datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
Bespoke-Stratos-7B_eval_3a76
chengfu0118/Bespoke-Stratos-7B_eval_3a76
Precomputed model outputs for evaluation.
Evaluation Results
MATH500
Accuracy: 48.80%
Accuracy
Questions Solved
Total Questions
48.80%
244
500
Bespoke-Stratos-7B_1755006372_eval_466d
chengfu0118/Bespoke-Stratos-7B_1755006372_eval_466d
Precomputed model outputs for evaluation.
Evaluation Results
MATH500
Accuracy: 79.60%
Accuracy
Questions Solved
Total Questions
79.60%
398
500
Custom-Bespoke-Stratos-7B_1753961306_eval_466d_math500_skip_attn_1
chengfu0118/Custom-Bespoke-Stratos-7B_1753961306_eval_466d_math500_skip_attn_1
Precomputed model outputs for evaluation.
Evaluation Results
MATH500
Accuracy: 1.80%
Accuracy
Questions Solved
Total Questions
1.80%
9
500
Bespoke-Stratos-7B_1755005674_eval_07bc
chengfu0118/Bespoke-Stratos-7B_1755005674_eval_07bc
Precomputed model outputs for evaluation.
Evaluation Results
LiveCodeBench
Average Accuracy: 33.30% ± 0.70%
Number of Runs: 6
Run
Accuracy
Questions Solved
Total Questions
1
35.62%
182
511
2
32.29%
165
511
3
30.72%
157
511
4
34.25%
175
511
5
34.05%
174
511
6
32.88%
168
511
Custom-Bespoke-Stratos-7B_1753940626_eval_104b_aime24_skip_attn_5
chengfu0118/Custom-Bespoke-Stratos-7B_1753940626_eval_104b_aime24_skip_attn_5
Precomputed model outputs for evaluation.
Evaluation Results
AIME24
Average Accuracy: 0.00% ± 0.00%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
0.00%
0
30
2
0.00%
0
30
3
0.00%
0
30
4
0.00%
0
30
5
0.00%
0
30
6
0.00%
0
30
7
0.00%
0
30
8
0.00%
0
30
9
0.00%
0
30
10
0.00%
0
30
bespoke_stratos_eval_2e29
mlfoundations-dev/fig1_all_bespoke_stratos_eval_2e29
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
LiveCodeBenchv5
AIME25
HLE
Accuracy
23.7
67.8
78.6
29.4
44.8
42.4
39.9
13.5
15.2
30.3
21.0
1.7
AIME24
Average Accuracy: 23.67% ± 1.79%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
26.67%… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/bespoke_stratos_eval_2e29.Bespoke-Stratos-7B_1753887741_eval_e0d7
chengfu0118/Bespoke-Stratos-7B_1753887741_eval_e0d7
Precomputed model outputs for evaluation.
Evaluation Results
GPQADiamond
Average Accuracy: 44.78% ± 0.60%
Number of Runs: 3
Run
Accuracy
Questions Solved
Total Questions
1
44.95%
89
198
2
45.96%
91
198
3
43.43%
86
198
Custom-Bespoke-Stratos-7B_1753940653_eval_104b_aime24_skip_attn_4
chengfu0118/Custom-Bespoke-Stratos-7B_1753940653_eval_104b_aime24_skip_attn_4
Precomputed model outputs for evaluation.
Evaluation Results
AIME24
Average Accuracy: 0.00% ± 0.00%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
0.00%
0
30
2
0.00%
0
30
3
0.00%
0
30
4
0.00%
0
30
5
0.00%
0
30
6
0.00%
0
30
7
0.00%
0
30
8
0.00%
0
30
9
0.00%
0
30
10
0.00%
0
30
Bespoke-Stratos-7B_1743983930_eval_68a0
mlfoundations-dev/Bespoke-Stratos-7B_1743983930_eval_68a0
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AIME25
AMC23
MATH500
Accuracy
12.7
13.3
53.0
76.0
AIME24
Average Accuracy: 12.67% ± 1.74%
Number of Runs: 5
Run
Accuracy
Questions Solved
Total Questions
1
10.00%
3
30
2
16.67%
5
30
3
6.67%
2
30
4
16.67%
5
30
5
13.33%
4
30
AIME25
Average Accuracy: 13.33%… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/Bespoke-Stratos-7B_1743983930_eval_68a0.Bespoke-Stratos-32B_1744004628_eval_0981
mlfoundations-dev/Bespoke-Stratos-32B_1744004628_eval_0981
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AIME25
AMC23
MATH500
GPQADiamond
LiveCodeBench
Accuracy
34.7
24.7
84.0
86.4
55.9
56.4
AIME24
Average Accuracy: 34.67% ± 1.52%
Number of Runs: 5
Run
Accuracy
Questions Solved
Total Questions
1
33.33%
10
30
2
40.00%
12
30
3
30.00%
9
30
4
33.33%
10
30
5
36.67%
11
30… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/Bespoke-Stratos-32B_1744004628_eval_0981.bespoke_stratos_10k_eval_636d
mlfoundations-dev/fig1_scaling_bespoke_stratos_10k_eval_636d
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
Accuracy
18.7
61.0
77.6
28.2
40.2
38.2
33.9
8.3
12.5
AIME24
Average Accuracy: 18.67% ± 1.35%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
13.33%
4
30
2
20.00%
6
30
3
13.33%
4
30… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/bespoke_stratos_10k_eval_636d.bespoke_stratos_3k_eval_636d
mlfoundations-dev/fig1_scaling_bespoke_stratos_3k_eval_636d
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
Accuracy
17.7
60.5
77.6
28.2
41.1
43.3
30.7
5.5
7.7
AIME24
Average Accuracy: 17.67% ± 1.64%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
16.67%
5
30
2
16.67%
5
30
3
10.00%
3
30
4… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/bespoke_stratos_3k_eval_636d.bespoke_stratos_1k_eval_636d
mlfoundations-dev/fig1_scaling_bespoke_stratos_1k_eval_636d
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
Accuracy
14.3
53.5
72.0
27.2
37.1
37.4
25.0
4.3
5.8
AIME24
Average Accuracy: 14.33% ± 0.95%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
20.00%
6
30
2
13.33%
4
30
3
16.67%
5
30
4… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/bespoke_stratos_1k_eval_636d.Custom-Bespoke-Stratos-7B_1753940497_eval_104b_aime24_skip_attn_2
chengfu0118/Custom-Bespoke-Stratos-7B_1753940497_eval_104b_aime24_skip_attn_2
Precomputed model outputs for evaluation.
Evaluation Results
AIME24
Average Accuracy: 0.00% ± 0.00%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
0.00%
0
30
2
0.00%
0
30
3
0.00%
0
30
4
0.00%
0
30
5
0.00%
0
30
6
0.00%
0
30
7
0.00%
0
30
8
0.00%
0
30
9
0.00%
0
30
10
0.00%
0
30
Custom-Bespoke-Stratos-7B_1753940455_eval_104b_aime24_skip_attn_1
chengfu0118/Custom-Bespoke-Stratos-7B_1753940455_eval_104b_aime24_skip_attn_1
Precomputed model outputs for evaluation.
Evaluation Results
AIME24
Average Accuracy: 0.00% ± 0.00%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
0.00%
0
30
2
0.00%
0
30
3
0.00%
0
30
4
0.00%
0
30
5
0.00%
0
30
6
0.00%
0
30
7
0.00%
0
30
8
0.00%
0
30
9
0.00%
0
30
10
0.00%
0
30
Custom-Bespoke-Stratos-7B_1753940541_eval_104b_aime24_skip_attn_3
chengfu0118/Custom-Bespoke-Stratos-7B_1753940541_eval_104b_aime24_skip_attn_3
Precomputed model outputs for evaluation.
Evaluation Results
AIME24
Average Accuracy: 0.00% ± 0.00%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
0.00%
0
30
2
0.00%
0
30
3
0.00%
0
30
4
0.00%
0
30
5
0.00%
0
30
6
0.00%
0
30
7
0.00%
0
30
8
0.00%
0
30
9
0.00%
0
30
10
0.00%
0
30
Custom-Bespoke-Stratos-7B_1753940786_eval_104b_aime24_skip_attn_7
chengfu0118/Custom-Bespoke-Stratos-7B_1753940786_eval_104b_aime24_skip_attn_7
Precomputed model outputs for evaluation.
Evaluation Results
AIME24
Average Accuracy: 0.00% ± 0.00%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
0.00%
0
30
2
0.00%
0
30
3
0.00%
0
30
4
0.00%
0
30
5
0.00%
0
30
6
0.00%
0
30
7
0.00%
0
30
8
0.00%
0
30
9
0.00%
0
30
10
0.00%
0
30
Custom-Bespoke-Stratos-7B_1753961263_eval_466d_math500_skip_attn_0
chengfu0118/Custom-Bespoke-Stratos-7B_1753961263_eval_466d_math500_skip_attn_0
Precomputed model outputs for evaluation.
Evaluation Results
MATH500
Accuracy: 79.40%
Accuracy
Questions Solved
Total Questions
79.40%
397
500
Bespoke-Stratos-7B_1743982559_eval_0981Bespoke-Stratos-7B_1743996665_eval_0981
mlfoundations-dev/Bespoke-Stratos-7B_1743996665_eval_0981
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AIME25
AMC23
MATH500
GPQADiamond
LiveCodeBench
Accuracy
16.0
14.7
57.5
77.0
31.3
27.3
AIME24
Average Accuracy: 16.00% ± 1.74%
Number of Runs: 5
Run
Accuracy
Questions Solved
Total Questions
1
13.33%
4
30
2
10.00%
3
30
3
16.67%
5
30
4
20.00%
6
30
5
20.00%
6
30… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/Bespoke-Stratos-7B_1743996665_eval_0981.Bespoke-Stratos-7B_eval_2e29
mlfoundations-dev/Bespoke-Stratos-7B_eval_2e29
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
AIME25
HLE
LiveCodeBenchv5
Accuracy
14.3
54.2
77.6
34.2
40.2
31.8
27.4
3.2
4.8
12.7
10.0
16.7
AIME24
Average Accuracy: 14.33% ± 1.57%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
16.67%
5
30… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/Bespoke-Stratos-7B_eval_2e29.bespoke_stratos_0.3k_eval_2e29
mlfoundations-dev/bespoke_stratos_0.3k_eval_2e29
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
AIME25
HLE
LiveCodeBenchv5
Accuracy
17.0
50.0
71.4
27.8
37.1
39.2
24.6
4.6
5.7
10.3
0.4
14.5
AIME24
Average Accuracy: 17.00% ± 1.10%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
20.00%
6
30… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/bespoke_stratos_0.3k_eval_2e29.Bespoke-Stratos-32B_eval_2e29
mlfoundations-dev/Bespoke-Stratos-32B_eval_2e29
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME24
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
CodeForces
AIME25
HLE
LiveCodeBenchv5
Accuracy
35.7
76.2
85.8
34.2
56.8
57.1
56.2
14.7
21.9
22.3
7.6
38.0
AIME24
Average Accuracy: 35.67% ± 1.89%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
40.00%
12
30… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/Bespoke-Stratos-32B_eval_2e29.Bespoke-Stratos-7B_1753887651_eval_466d
chengfu0118/Bespoke-Stratos-7B_1753887651_eval_466d
Precomputed model outputs for evaluation.
Evaluation Results
MATH500
Accuracy: 79.20%
Accuracy
Questions Solved
Total Questions
79.20%
396
500
Custom-Bespoke-Stratos-7B_1753940744_eval_104b_aime24_skip_attn_6
chengfu0118/Custom-Bespoke-Stratos-7B_1753940744_eval_104b_aime24_skip_attn_6
Precomputed model outputs for evaluation.
Evaluation Results
AIME24
Average Accuracy: 0.00% ± 0.00%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
0.00%
0
30
2
0.00%
0
30
3
0.00%
0
30
4
0.00%
0
30
5
0.00%
0
30
6
0.00%
0
30
7
0.00%
0
30
8
0.00%
0
30
9
0.00%
0
30
10
0.00%
0
30
Custom-Bespoke-Stratos-7B_1753947429_eval_104b_aime24_skip_attn_1
chengfu0118/Custom-Bespoke-Stratos-7B_1753947429_eval_104b_aime24_skip_attn_1
Precomputed model outputs for evaluation.
Evaluation Results
AIME24
Average Accuracy: 0.00% ± 0.00%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
0.00%
0
30
2
0.00%
0
30
3
0.00%
0
30
4
0.00%
0
30
5
0.00%
0
30
6
0.00%
0
30
7
0.00%
0
30
8
0.00%
0
30
9
0.00%
0
30
10
0.00%
0
30
Custom-Bespoke-Stratos-7B_1753961348_eval_466d_math500_skip_attn_2
chengfu0118/Custom-Bespoke-Stratos-7B_1753961348_eval_466d_math500_skip_attn_2
Precomputed model outputs for evaluation.
Evaluation Results
MATH500
Accuracy: 1.00%
Accuracy
Questions Solved
Total Questions
1.00%
5
500
bespoke_stratos_eval_636dBespoke-Stratos-7B_1753867522_eval_7a7d
chengfu0118/Bespoke-Stratos-7B_1753867522_eval_7a7d
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
MATH500
GPQADiamond
Accuracy
53.8
44.8
MATH500
Accuracy: 53.80%
Accuracy
Questions Solved
Total Questions
53.80%
269
500
GPQADiamond
Average Accuracy: 44.78% ± 0.14%
Number of Runs: 3
Run
Accuracy
Questions Solved
Total Questions
1
44.95%
89
198
2
44.95%
89
198
3… See the full description on the dataset page: https://huggingface.co/datasets/chengfu0118/Bespoke-Stratos-7B_1753867522_eval_7a7d.Bespoke-Stratos-7B_1753887628_eval_104b
chengfu0118/Bespoke-Stratos-7B_1753887628_eval_104b
Precomputed model outputs for evaluation.
Evaluation Results
AIME24
Average Accuracy: 19.67% ± 1.45%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
16.67%
5
30
2
20.00%
6
30
3
23.33%
7
30
4
26.67%
8
30
5
23.33%
7
30
6
16.67%
5
30
7
23.33%
7
30
8
20.00%
6
30
9
16.67%
5
30
10
10.00%
3
30
