CoolFace
Modelpublic

AverageMetaheuristicsEnjoyer/deepseek-v2-lite-sparse-mobe-b4-bs16-minimal-lr02-h100

sourceHugging Faceapache-2.0updated 4mo agoView on Hugging Face
0likes21downloads
Model Card

sparsedeepseekv2liteb4bs16minimal_lr02

Sparse-MoBE stripped of LISTA priors (T=0, S=0, square encoder, random w-init) on DeepSeek-V2-Lite-Chat, at its own Block-J LR optimum (lr=0.02). Compared against MoBE mobedeepseekv2lite (lr=0.07). Layer 0 is dense (firstkdensereplace=1) so startlayer=1. See docs/sparsemobe_mechanism.md.

  • —Method: sparse_mobe
  • —Base model: deepseek-ai/DeepSeek-V2-Lite-Chat
  • —Compressed: gate_proj, up_proj over layers 1-27 (down_proj kept dense)
  • —Settings: sparsemobe, numB=4, activation=tanh

See config.toml and training.json for the full run configuration and per-layer reconstruction stats.

Evaluation

TaskMetricValue
arc_challengesample_len1172.0000
arc_challengeacc,none0.4787
arc_challengeacc_stderr,none0.0146
arc_challengeacc_norm,none0.4787
arc_challengeaccnormstderr,none0.0146
arc_easysample_len2376.0000
arc_easyacc,none0.7673
arc_easyacc_stderr,none0.0087
arc_easyacc_norm,none0.7437
arc_easyaccnormstderr,none0.0090
winograndesample_len1267.0000
winograndeacc,none0.6969
winograndeacc_stderr,none0.0129
piqasample_len1838.0000
piqaacc,none0.7916
piqaacc_stderr,none0.0095
piqaacc_norm,none0.8041
piqaaccnormstderr,none0.0093
hellaswagsample_len10042.0000
hellaswagacc,none0.5798
hellaswagacc_stderr,none0.0049
hellaswagacc_norm,none0.7565
hellaswagaccnormstderr,none0.0043
openbookqasample_len500.0000
openbookqaacc,none0.3460
openbookqaacc_stderr,none0.0213
openbookqaacc_norm,none0.4680
openbookqaaccnormstderr,none0.0223

Usage

python
from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained(
    "AverageMetaheuristicsEnjoyer/deepseek-v2-lite-sparse-mobe-b4-bs16-minimal-lr02-h100",
    trust_remote_code=True,
    torch_dtype="bfloat16",
    device_map="auto",
)
tok = AutoTokenizer.from_pretrained("AverageMetaheuristicsEnjoyer/deepseek-v2-lite-sparse-mobe-b4-bs16-minimal-lr02-h100", trust_remote_code=True)

The factored experts are reconstructed at runtime via the bundled DeepseekV2SparseMoBEForCausalLM.