CoolFace
Modelpublic

vgandhi13/Qwen2.5-VL-7B-RLVR-ReasoningOnly-ThinkLite

sourceHugging Faceotherupdated 24d agoView on Hugging Face
0likes33downloads
2 commits on main
039fb5c24d ago

RLVR reasoning-only baseline (GRPO, ThinkLite-VL-70k, 500 steps)

vgandhi13
4b8e0d124d ago

initial commit

vgandhi13