sandeep123/aops-grpo-cliphigh-step100
024
Correct model card: per-dataset settings (previous card was hardcoded for ScienceQA)
aops_grpo_cliphigh step 100 | pass@1 0.2135 pass@6 0.4219 | best pass@6
initial commit
Correct model card: per-dataset settings (previous card was hardcoded for ScienceQA)
aops_grpo_cliphigh step 100 | pass@1 0.2135 pass@6 0.4219 | best pass@6
initial commit