datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
SlimPajama-Meta-rater-Reasoning-30B
Top 30B token SlimPajama Subset selected by the Reasoning rater
This repository contains the dataset described in the paper Meta-rater: A Multi-dimensional Data Selection Method for Pre-training Language Models.
Code: https://github.com/opendatalab/Meta-rater
Dataset Description
This dataset contains the top 30B tokens from the SlimPajama-627B corpus, selected using the Reasoning dimension of the PRRC (Professionalism, Readability, Reasoning, Cleanliness) framework. Each… See the full description on the dataset page: https://huggingface.co/datasets/opendatalab/SlimPajama-Meta-rater-Reasoning-30B.code-meta-reasoning-filteredmeta_chat_reasoning_25_75_system_eval_bba0
mlfoundations-dev/meta_chat_reasoning_25_75_system_eval_bba0
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
Accuracy
23.7
65.8
82.2
0.4
18.6
20.4
13.5
6.8
11.4
AIME24
Average Accuracy: 23.67% ± 1.73%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
23.33%
7
30
2
26.67%
8
30
3
33.33%
10
30… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_25_75_system_eval_bba0.t1-musr-prompt-enhancement-together_ai-meta-llama-meta-llama-3-1-8b
t1-musr-prompt-enhancement-together_ai-meta-llama-meta-llama-3-1-8b
MuSR Prompt Enhancement via Knowledge Synthesis + Compliance Tracking.
Performance
Eval Set
pass@1
Original (base)
0.7450
Original (enhanced prompt)
0.7300
Heldout (base prompt)
0.7050
Heldout (enhanced prompt)
0.7050
Strategies
Natural strategy: Means‑Motive‑Opportunity Heuristic
Enhanced strategy: Means-Motive-Opportunity Matrix
Synthesized Facts
Always list… See the full description on the dataset page: https://huggingface.co/datasets/reasoning-degeneration-dev/t1-musr-prompt-enhancement-together_ai-meta-llama-meta-llama-3-1-8b.REASONING_evalchemy_64shards_Meta-Llama-3-8B-Instructmeta_chat_reasoning_50_50_system_100k_eval_bba0
mlfoundations-dev/meta_chat_reasoning_50_50_system_100k_eval_bba0
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
Accuracy
32.3
71.5
82.8
0.5
42.4
36.9
9.2
10.4
11.7
AIME24
Average Accuracy: 32.33% ± 1.77%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
23.33%
7
30
2
30.00%
9
30
3
33.33%
10… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_50_50_system_100k_eval_bba0.meta_chat_reasoning_0_100_system_100k_eval_bba0
mlfoundations-dev/meta_chat_reasoning_0_100_system_100k_eval_bba0
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
Accuracy
37.0
78.5
83.6
0.4
48.1
44.4
19.6
15.3
19.3
AIME24
Average Accuracy: 37.00% ± 1.97%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
33.33%
10
30
2
43.33%
13
30
3
46.67%… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_0_100_system_100k_eval_bba0.meta_chat_reasoning_75_25_system_eval_bba0
mlfoundations-dev/meta_chat_reasoning_75_25_system_eval_bba0
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
Accuracy
22.7
60.3
78.8
0.4
40.9
27.6
12.8
7.8
11.0
AIME24
Average Accuracy: 22.67% ± 1.23%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
23.33%
7
30
2
23.33%
7
30
3
30.00%
9
30… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_75_25_system_eval_bba0.meta_chat_reasoning_50_50_system_eval_bba0
mlfoundations-dev/meta_chat_reasoning_50_50_system_eval_bba0
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
Accuracy
20.3
60.5
77.6
0.5
22.6
20.9
11.1
4.8
7.9
AIME24
Average Accuracy: 20.33% ± 0.74%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
16.67%
5
30
2
16.67%
5
30
3
23.33%
7
30
4… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_50_50_system_eval_bba0.meta_chat_reasoning_25_75_eval_636d
mlfoundations-dev/meta_chat_reasoning_25_75_eval_636d
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
Accuracy
23.0
66.5
81.0
0.4
24.0
4.4
9.1
6.2
10.9
AIME24
Average Accuracy: 23.00% ± 0.99%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
16.67%
5
30
2
23.33%
7
30
3
26.67%
8
30
4
20.00%… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_25_75_eval_636d.meta_chat_reasoning_25_75_eval_2e29
mlfoundations-dev/meta_chat_reasoning_25_75_eval_2e29
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
AIME25
HLE
LiveCodeBenchv5
Accuracy
23.0
66.5
79.8
44.3
23.1
4.4
18.9
7.3
11.2
23.7
15.2
13.5
AIME24
Average Accuracy: 23.00% ± 1.37%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
23.33%… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_25_75_eval_2e29.REASONING_evalchemy_8shards_Meta-Llama-3-8B-Instructmeta_chat_reasoning_0_100_system_eval_636d
mlfoundations-dev/meta_chat_reasoning_0_100_system_eval_636d
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
Accuracy
26.3
67.5
82.2
29.2
44.4
39.1
27.6
9.4
15.2
AIME24
Average Accuracy: 26.33% ± 1.29%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
30.00%
9
30
2
26.67%
8
30
3
30.00%
9
30… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_0_100_system_eval_636d.meta_chat_reasoning_100_0_eval_636d
mlfoundations-dev/meta_chat_reasoning_100_0_eval_636d
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
Accuracy
3.7
34.8
51.6
18.4
19.1
22.9
3.5
0.5
1.7
AIME24
Average Accuracy: 3.67% ± 0.74%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
0.00%
0
30
2
3.33%
1
30
3
6.67%
2
30
4
3.33%
1
30… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_100_0_eval_636d.meta_chat_reasoning_50_50_eval_636d
mlfoundations-dev/meta_chat_reasoning_50_50_eval_636d
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
Accuracy
17.7
48.8
60.2
19.0
30.2
17.7
11.4
3.4
6.3
AIME24
Average Accuracy: 17.67% ± 0.95%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
20.00%
6
30
2
13.33%
4
30
3
16.67%
5
30
4… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_50_50_eval_636d.meta_chat_reasoning_0_100_system_eval_bba0
mlfoundations-dev/meta_chat_reasoning_0_100_system_eval_bba0
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
Accuracy
29.7
69.5
83.8
28.2
47.3
40.7
31.7
12.9
19.2
AIME24
Average Accuracy: 29.67% ± 1.60%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
20.00%
6
30
2
36.67%
11
30
3
33.33%
10… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_0_100_system_eval_bba0.meta_chat_reasoning_75_25_100k_eval_636d
mlfoundations-dev/meta_chat_reasoning_75_25_100k_eval_636d
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
Accuracy
25.7
62.5
77.6
25.2
34.7
36.0
13.8
7.5
8.2
AIME24
Average Accuracy: 25.67% ± 1.89%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
20.00%
6
30
2
26.67%
8
30
3
23.33%
7
30
4… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_75_25_100k_eval_636d.meta_chat_reasoning_50_50_100k_eval_636d
mlfoundations-dev/meta_chat_reasoning_50_50_100k_eval_636d
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
Accuracy
33.7
71.5
83.6
27.6
37.6
33.8
21.3
10.6
10.7
AIME24
Average Accuracy: 33.67% ± 1.79%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
33.33%
10
30
2
46.67%
14
30
3
33.33%
10
30… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_50_50_100k_eval_636d.meta_chat_reasoning_0_100_100k_eval_636d
mlfoundations-dev/meta_chat_reasoning_0_100_100k_eval_636d
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
Accuracy
37.0
75.0
84.6
29.0
47.5
45.1
38.4
15.2
19.2
AIME24
Average Accuracy: 37.00% ± 3.21%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
36.67%
11
30
2
36.67%
11
30
3
40.00%
12
30… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_0_100_100k_eval_636d.meta_chat_reasoning_25_75_system_100k_eval_bba0
mlfoundations-dev/meta_chat_reasoning_25_75_system_100k_eval_bba0
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
Accuracy
32.7
73.0
85.0
50.8
45.3
37.5
30.7
9.1
11.4
AIME24
Average Accuracy: 32.67% ± 1.75%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
36.67%
11
30
2
40.00%
12
30
3
36.67%… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_25_75_system_100k_eval_bba0.meta_chat_reasoning_75_25_system_100k_eval_bba0
mlfoundations-dev/meta_chat_reasoning_75_25_system_100k_eval_bba0
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
Accuracy
25.3
63.7
76.8
0.4
39.2
39.7
8.2
6.4
6.3
AIME24
Average Accuracy: 25.33% ± 1.58%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
26.67%
8
30
2
20.00%
6
30
3
23.33%
7
30… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_75_25_system_100k_eval_bba0.meta_chat_reasoning_0_100_100k_eval_2e29
mlfoundations-dev/meta_chat_reasoning_0_100_100k_eval_2e29
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
AIME25
HLE
LiveCodeBenchv5
Accuracy
35.0
74.5
84.4
30.2
46.4
47.0
36.9
15.4
18.0
23.3
1.4
28.2
AIME24
Average Accuracy: 35.00% ± 1.58%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_0_100_100k_eval_2e29.meta_chat_reasoning_50_50_100k_eval_2e29
mlfoundations-dev/meta_chat_reasoning_50_50_100k_eval_2e29
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
AIME25
HLE
LiveCodeBenchv5
Accuracy
30.3
74.2
82.8
24.6
38.8
32.7
22.8
10.9
11.4
25.7
1.2
16.8
AIME24
Average Accuracy: 30.33% ± 2.13%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_50_50_100k_eval_2e29.meta_chat_reasoning_75_25_100k_eval_2e29
mlfoundations-dev/meta_chat_reasoning_75_25_100k_eval_2e29
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
AIME25
HLE
LiveCodeBenchv5
Accuracy
24.3
68.5
76.8
25.8
35.9
33.2
13.6
7.5
8.5
20.7
0.5
10.3
AIME24
Average Accuracy: 24.33% ± 1.42%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_75_25_100k_eval_2e29.meta_chat_reasoning_25_75_100k_eval_2e29
mlfoundations-dev/meta_chat_reasoning_25_75_100k_eval_2e29
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
AIME25
HLE
LiveCodeBenchv5
Accuracy
32.3
75.0
82.2
29.2
42.7
36.4
32.7
12.0
15.2
24.7
2.3
23.7
AIME24
Average Accuracy: 32.33% ± 1.64%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_25_75_100k_eval_2e29.REASONING_evalchemy_256shards_Meta-Llama-3-8B-InstructREASONING_evalchemy_2048shards_Meta-Llama-3-8B-Instructmeta_chat_reasoning_0_100_eval_636d
mlfoundations-dev/meta_chat_reasoning_0_100_eval_636d
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
Accuracy
26.7
67.0
82.8
28.6
45.2
34.5
30.2
10.0
16.3
AIME24
Average Accuracy: 26.67% ± 2.75%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
43.33%
13
30
2
16.67%
5
30
3
26.67%
8
30
4… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_0_100_eval_636d.meta_chat_reasoning_75_25_eval_636d
mlfoundations-dev/meta_chat_reasoning_75_25_eval_636d
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
Accuracy
19.7
60.8
74.8
21.8
36.5
23.1
8.3
3.3
7.4
AIME24
Average Accuracy: 19.67% ± 1.37%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
20.00%
6
30
2
20.00%
6
30
3
16.67%
5
30
4
20.00%… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_75_25_eval_636d.meta_chat_reasoning_100_0_system_eval_bba0
mlfoundations-dev/meta_chat_reasoning_100_0_system_eval_bba0
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
Accuracy
4.0
32.5
51.0
36.2
19.0
18.5
2.8
0.9
2.5
AIME24
Average Accuracy: 4.00% ± 1.03%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
6.67%
2
30
2
6.67%
2
30
3
3.33%
1
30
4… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/meta_chat_reasoning_100_0_system_eval_bba0.
