RASMUS/commitmoe-qwen35-fp8-layers-v2
CommitMoE — Qwen3.5-35B-A3B-FP8 expert-routing traces, columnar by layer Per-token MoE routing decisions from Qwen/Qwen3.5-35B-A3B-FP8, laid out one directory per layer so a predictor for a single layer reads only what it needs instead of scanning interleaved shards. The model has 40 MoE layers, 256 experts each, top-8 routing, hidden size 2048. Every row is one (prompt, decode token, layer) triple. What this is for Predicting which experts a layer will route to a… See the full description on the dataset page: https://huggingface.co/datasets/RASMUS/commitmoe-qwen35-fp8-layers-v2.
0329
