CoolFace
Modelpublic

HumorR1/policy-qwen3vl-2b-grpo-newyorker

sourceHugging Faceapache-2.0updated 5mo agoView on Hugging Face
0likes4downloads
7 commits on main
bde9ad25mo ago

Add 8192-token eval JSON

Broyojo
5ec35325mo ago

Update model card with honest 8192-token eval (was clipped at 2048)

Broyojo
666a4495mo ago

Add eval JSON for the SFT+GRPO policy

Broyojo
d574cb15mo ago

Replace with SFT-think + GRPO policy (+2.30σ over base, restores thinking format)

Broyojo
059036b5mo ago

Add 50×5 held-out eval (RM scores per cartoon × sample)

Broyojo
60ee9cf5mo ago

GRPO policy (Qwen3-VL-2B-Thinking + LoRA, FB=0.1, 200 steps)

Broyojo
e60a9465mo ago

initial commit

Broyojo