elastix-ai/Qwen2.5-0.5B-maskllm-beam-2to4-calib512-weakscale-blade
043
Compressed: Qwen2.5-0.5B-maskllm-beam-2to4-calib512-weakscale-blade
This is a compressed version of `Qwen/Qwen2.5-0.5B`.
Compression Summary
Layerwise Compression Specs
<details><summary>Full spec JSON</summary>
[
{
"pattern": ".*embed_tokens$",
"quant_config": {
"bits": 16,
"type": "gfp",
"groupsize": 32,
"exp_bits": 5,
"exp_bias": 18,
"expfact_m_bits": 3,
"expfact_m_range_oct": 2.0,
"scale_search": {
"grid_search_steps": 5,
"grid_search_min_ratio": 0.3,
"ls_polish_steps": 2,
"clip_ratio": 1.0
},
"qtip": {
"L": 16,
"T": null,
"hash_bytes": 4,
"kappa": null,
"hash_seed": 0,
"boundary": "prologue",
"candidates": 4
},
"rotate_seed": 0
},
"sparsity": 0,
"quantize": false,
"quantize_before_pruning": false,
"quant_dim": -1
},
{
"pattern": ".*lm_head$",
"quant_config": {
"bits": 16,
"type": "gfp",
"groupsize": 32,
"exp_bits": 5,
"exp_bias": 18,
"expfact_m_bits": 3,
"expfact_m_range_oct": 2.0,
"scale_search": {
"grid_search_steps": 5,
"grid_search_min_ratio": 0.3,
"ls_polish_steps": 2,
"clip_ratio": 1.0
},
"qtip": {
"L": 16,
"T": null,
"hash_bytes": 4,
"kappa": null,
"hash_seed": 0,
"boundary": "prologue",
"candidates": 4
},
"rotate_seed": 0
},
"sparsity": 0,
"quantize": false,
"quantize_before_pruning": false,
"quant_dim": -1
},
{
"pattern": "(?:^|\\.)linear_attn\\.conv1d$",
"quant_config": {
"bits": 16,
"type": "gfp",
"groupsize": 32,
"exp_bits": 5,
"exp_bias": 18,
"expfact_m_bits": 3,
"expfact_m_range_oct": 2.0,
"scale_search": {
"grid_search_steps": 5,
"grid_search_min_ratio": 0.3,
"ls_polish_steps": 2,
"clip_ratio": 1.0
},
"qtip": {
"L": 16,
"T": null,
"hash_bytes": 4,
"kappa": null,
"hash_seed": 0,
"boundary": "prologue",
"candidates": 4
},
"rotate_seed": 0
},
"sparsity": 0,
"quantize": false,
"quantize_before_pruning": false,
"quant_dim": -1
},
{
"pattern": "(?:^|\\.)(?:self_attn|linear_attn)\\.",
"quant_config": {
"bits": 16,
"type": "gfp",
"groupsize": 32,
"exp_bits": 5,
"exp_bias": 18,
"expfact_m_bits": 3,
"expfact_m_range_oct": 2.0,
"scale_search": {
"grid_search_steps": 5,
"grid_search_min_ratio": 0.3,
"ls_polish_steps": 2,
"clip_ratio": 1.0
},
"qtip": {
"L": 16,
"T": null,
"hash_bytes": 4,
"kappa": null,
"hash_seed": 0,
"boundary": "prologue",
"candidates": 4
},
"rotate_seed": 0
},
"sparsity": "2:4",
"quantize": false,
"quantize_before_pruning": false,
"quant_dim": -1
},
{
"pattern": "(?:^|\\.)mlp\\.router$",
"quant_config": {
"bits": 16,
"type": "gfp",
"groupsize": 32,
"exp_bits": 5,
"exp_bias": 18,
"expfact_m_bits": 3,
"expfact_m_range_oct": 2.0,
"scale_search": {
"grid_search_steps": 5,
"grid_search_min_ratio": 0.3,
"ls_polish_steps": 2,
"clip_ratio": 1.0
},
"qtip": {
"L": 16,
"T": null,
"hash_bytes": 4,
"kappa": null,
"hash_seed": 0,
"boundary": "prologue",
"candidates": 4
},
"rotate_seed": 0
},
"sparsity": 0,
"quantize": false,
"quantize_before_pruning": false,
"quant_dim": -1
},
{
"pattern": ".*",
"quant_config": {
"bits": 16,
"type": "gfp",
"groupsize": 32,
"exp_bits": 5,
"exp_bias": 18,
"expfact_m_bits": 3,
"expfact_m_range_oct": 2.0,
"scale_search": {
"grid_search_steps": 5,
"grid_search_min_ratio": 0.3,
"ls_polish_steps": 2,
"clip_ratio": 1.0
},
"qtip": {
"L": 16,
"T": null,
"hash_bytes": 4,
"kappa": null,
"hash_seed": 0,
"boundary": "prologue",
"candidates": 4
},
"rotate_seed": 0
},
"sparsity": "2:4",
"quantize": false,
"quantize_before_pruning": false,
"quant_dim": -1
}
]</details>
BEAM Fine-tuning
<!-- COMPRESSIONEVALRESULTS:BEGIN -->
Evaluation Results
KL Divergence
<!-- COMPRESSIONEVALRESULTS:END -->
