sandeep123/aops-grpo-vanilla-step100
025
Correct model card: per-dataset settings (previous card was hardcoded for ScienceQA)
aops_grpo_vanilla step 100 | pass@1 0.2259 pass@6 0.4336 | best pass@6
initial commit
Correct model card: per-dataset settings (previous card was hardcoded for ScienceQA)
aops_grpo_vanilla step 100 | pass@1 0.2259 pass@6 0.4336 | best pass@6
initial commit