mlfoundations-dev/Qwen2.5-7B-Instruct_qwq_mix_r1_science_eval_2870
mlfoundations-dev/Qwen2.5-7B-Instruct_qwq_mix_r1_science_eval_2870 Precomputed model outputs for evaluation. Evaluation Results AIME24 Average Accuracy: 60.67% ± 2.20% Number of Runs: 10 Run Accuracy Questions Solved Total Questions 1 70.00% 21 30 2 53.33% 16 30 3 53.33% 16 30 4 66.67% 20 30 5 63.33% 19 30 6 66.67% 20 30 7 60.00% 18 30 8 46.67% 14 30 9 63.33% 19 30 10 63.33% 19 30
Upload README.md with huggingface_hub
Upload README.md with huggingface_hub
Adding shard 2
Adding shard 3
Adding shard 1
Adding shard 3
Adding shard 0
Upload README.md with huggingface_hub
Adding shard 30
Adding shard 60
Adding shard 28
Adding shard 4
Adding shard 36
Adding shard 16
Adding shard 12
Adding shard 52
Adding shard 2
Adding shard 53
Adding shard 44
Adding shard 10
Adding shard 23
Adding shard 62
Adding shard 5
Adding shard 34
Adding shard 50
Adding shard 15
Adding shard 48
Adding shard 0
Adding shard 51
Adding shard 42
Adding shard 20
Adding shard 57
Adding shard 26
Adding shard 55
Adding shard 3
Adding shard 58
Adding shard 1
Adding shard 18
Adding shard 8
Adding shard 31
Adding shard 13
Adding shard 40
Adding shard 41
Adding shard 43
Adding shard 59
Adding shard 21
Adding shard 19
Adding shard 61
Adding shard 54
Adding shard 33
