CoolFace
Modelpublic

inference-optimization/Qwen3.8-Flash-Next-MEP50

sourceHugging Faceupdated 1mo agoView on Hugging Face
5likes118downloads
Model Card

Qwen3.8-Flash-Next - 50% Expert Pruned

50% of the MoE experts pruned by router-weight magnitude using compressed-tensors.

  • —Base model: Qwen/Qwen3.8-Flash-Next
  • —Sparsity: 50% of routed experts removed per layer (512 -> 256 experts)
  • —Layers pruned: all 48 language model layers
  • —MTP layer: retained exactly as-is
  • —Shared experts: untouched
  • —Vision tower: untouched (dense ViT MLP, no MoE experts)

Reproduction

python
from compressed_tensors.entrypoints.convert import convert_checkpoint, MagnitudeExpertPruner

convert_checkpoint(
    model_stub="Qwen/Qwen3.8-Flash-Next",
    save_directory="Qwen3.8-Flash-Next-MEP50",
    converter=MagnitudeExpertPruner.from_pretrained(
        "Qwen/Qwen3.8-Flash-Next",
        router_pattern=r"language_model\.layers\.\d+\.mlp\.gate\.weight$",
        expert_pattern=r"language_model\.layers\.\d+\.mlp\.experts\.(gate_up_proj|down_proj)$",
        sparsity=0.5,
    ),
    max_workers=8,
)