CoolFace
Modelpublic

logic65/Qwen3.6-Whittle-25B-A3B

sourceHugging Faceapache-2.0updated 25d agoView on Hugging Face
1likes1.1kdownloads
12 commits on main
bec8dab25d ago

card: next/ experimental qwen4exp build

logic65
b87203125d ago

next/: EXPERIMENTAL qwen4exp-format build (sigmoid GDN gate, identity HC, inert indexer, no n-gram yet). Runs on stock llama.cpp. GSM8K 86.5% via llama.cpp / 82.0% via transformers; parent 88.5%

logic65
584a4b225d ago

Upload next/gate_act.json with huggingface_hub

logic65
f06a52425d ago

Upload next/gsm8k_q4exp_stock_llamacpp.json with huggingface_hub

logic65
934f95625d ago

Upload next/gsm8k_sigmoid_transformers.json with huggingface_hub

logic65
481b25825d ago

next/: settled sigmoid-gate trainable state (routers, shared, LoRA, GDN gates) - experimental

logic65
dfb57a225d ago

card: support + authors

logic65
b03598425d ago

Upload eval/prune_report.json with huggingface_hub

logic65
efe4ee825d ago

Upload eval/gsm8k_base_qwen3.6-35b-a3b.json with huggingface_hub

logic65
a62a25625d ago

Upload eval/gsm8k_pruned_healed.json with huggingface_hub

logic65
ef65f6a25d ago

Qwen3.6-Whittle-25B-A3B: 256->180 experts, self-distilled heal (step 900), GSM8K 92.5%

logic65
dce046425d ago

initial commit

logic65