CoolFace
Modelpublic

newtype-2038/Qwen3.5-122B-A10B-Newtype-Tuned-v21-grpo

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes14downloads
Model Card

Qwen3.5-122B-A10B-Newtype-Tuned-v21-grpo

Option D3 + v10 (Masked SFT) init + dense reward — GRPO with multi-stage preflight reward.

  • —init: v10 LoRA (Masked SFT, assistant-only loss)
  • —trainer: TRL GRPOTrainer
  • —rollout: HF model.generate (k=8 per task, T=1.0)
  • —reward: dense [0,1.0] = parse 0.05 + grep 0.05 + file 0.10 + func 0.10 + harness 0.30/0.70
  • —MoE safeguards: outputrouterlogits + aux loss + explicit router freeze (from v19)
  • —corpus: SWE-bench-Lite 270 train pool (no leakage with stratified-30 eval)
  • —hyperparams: β=0.1, ε=0.2, lr=1e-6, 80 steps, k=8
  • —train stats: REAL PASS 24/80 = 30%, trainloss 0.0855, trainruntime 18h 16m