sandeep123/aops-grpo-entropy-step800
027
Correct model card: per-dataset settings (previous card was hardcoded for ScienceQA)
aops_grpo_entropy step 800 | pass@1 0.2298 pass@6 0.4023 | best pass@1
initial commit
Correct model card: per-dataset settings (previous card was hardcoded for ScienceQA)
aops_grpo_entropy step 800 | pass@1 0.2298 pass@6 0.4023 | best pass@1
initial commit