CoolFace
30 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01chengfu0118 /Bespoke-Stratos-7B_eval_3a76 chengfu0118/Bespoke-Stratos-7B_eval_3a76 Precomputed model outputs for evaluation. Evaluation Results MATH500 Accuracy: 48.80% Accuracy Questions Solved Total Questions 48.80% 244 500 tabularn<1K0 likes54 downloads1y agoHugging Face02chengfu0118 /Bespoke-Stratos-7B_1755006372_eval_466d chengfu0118/Bespoke-Stratos-7B_1755006372_eval_466d Precomputed model outputs for evaluation. Evaluation Results MATH500 Accuracy: 79.60% Accuracy Questions Solved Total Questions 79.60% 398 500 tabularn<1K0 likes32 downloads1y agoHugging Face03chengfu0118 /Custom-Bespoke-Stratos-7B_1753961306_eval_466d_math500_skip_attn_1 chengfu0118/Custom-Bespoke-Stratos-7B_1753961306_eval_466d_math500_skip_attn_1 Precomputed model outputs for evaluation. Evaluation Results MATH500 Accuracy: 1.80% Accuracy Questions Solved Total Questions 1.80% 9 500 tabularn<1K0 likes31 downloads1y agoHugging Face04chengfu0118 /Bespoke-Stratos-7B_1755005674_eval_07bc chengfu0118/Bespoke-Stratos-7B_1755005674_eval_07bc Precomputed model outputs for evaluation. Evaluation Results LiveCodeBench Average Accuracy: 33.30% ± 0.70% Number of Runs: 6 Run Accuracy Questions Solved Total Questions 1 35.62% 182 511 2 32.29% 165 511 3 30.72% 157 511 4 34.25% 175 511 5 34.05% 174 511 6 32.88% 168 511 tabular1K<n<10K0 likes21 downloads1y agoHugging Face05chengfu0118 /Custom-Bespoke-Stratos-7B_1753940626_eval_104b_aime24_skip_attn_5 chengfu0118/Custom-Bespoke-Stratos-7B_1753940626_eval_104b_aime24_skip_attn_5 Precomputed model outputs for evaluation. Evaluation Results AIME24 Average Accuracy: 0.00% ± 0.00% Number of Runs: 10 Run Accuracy Questions Solved Total Questions 1 0.00% 0 30 2 0.00% 0 30 3 0.00% 0 30 4 0.00% 0 30 5 0.00% 0 30 6 0.00% 0 30 7 0.00% 0 30 8 0.00% 0 30 9 0.00% 0 30 10 0.00% 0 30 tabularn<1K0 likes13 downloads1y agoHugging Face06mlfoundations-dev /bespoke_stratos_eval_2e29 mlfoundations-dev/fig1_all_bespoke_stratos_eval_2e29 Precomputed model outputs for evaluation. Evaluation Results Summary Metric AIME24 AMC23 MATH500 MMLUPro JEEBench GPQADiamond LiveCodeBench CodeElo CodeForces LiveCodeBenchv5 AIME25 HLE Accuracy 23.7 67.8 78.6 29.4 44.8 42.4 39.9 13.5 15.2 30.3 21.0 1.7 AIME24 Average Accuracy: 23.67% ± 1.79% Number of Runs: 10 Run Accuracy Questions Solved Total Questions 1 26.67%… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/bespoke_stratos_eval_2e29.tabular10K<n<100K0 likes10 downloads1y agoHugging Face07chengfu0118 /Bespoke-Stratos-7B_1753887741_eval_e0d7 chengfu0118/Bespoke-Stratos-7B_1753887741_eval_e0d7 Precomputed model outputs for evaluation. Evaluation Results GPQADiamond Average Accuracy: 44.78% ± 0.60% Number of Runs: 3 Run Accuracy Questions Solved Total Questions 1 44.95% 89 198 2 45.96% 91 198 3 43.43% 86 198 tabularn<1K0 likes9 downloads1y agoHugging Face08chengfu0118 /Custom-Bespoke-Stratos-7B_1753940653_eval_104b_aime24_skip_attn_4 chengfu0118/Custom-Bespoke-Stratos-7B_1753940653_eval_104b_aime24_skip_attn_4 Precomputed model outputs for evaluation. Evaluation Results AIME24 Average Accuracy: 0.00% ± 0.00% Number of Runs: 10 Run Accuracy Questions Solved Total Questions 1 0.00% 0 30 2 0.00% 0 30 3 0.00% 0 30 4 0.00% 0 30 5 0.00% 0 30 6 0.00% 0 30 7 0.00% 0 30 8 0.00% 0 30 9 0.00% 0 30 10 0.00% 0 30 tabularn<1K0 likes8 downloads1y agoHugging Face09mlfoundations-dev /Bespoke-Stratos-7B_1743983930_eval_68a0 mlfoundations-dev/Bespoke-Stratos-7B_1743983930_eval_68a0 Precomputed model outputs for evaluation. Evaluation Results Summary Metric AIME24 AIME25 AMC23 MATH500 Accuracy 12.7 13.3 53.0 76.0 AIME24 Average Accuracy: 12.67% ± 1.74% Number of Runs: 5 Run Accuracy Questions Solved Total Questions 1 10.00% 3 30 2 16.67% 5 30 3 6.67% 2 30 4 16.67% 5 30 5 13.33% 4 30 AIME25 Average Accuracy: 13.33%… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/Bespoke-Stratos-7B_1743983930_eval_68a0.tabular1K<n<10K0 likes7 downloads1y agoHugging Face10mlfoundations-dev /Bespoke-Stratos-32B_1744004628_eval_0981 mlfoundations-dev/Bespoke-Stratos-32B_1744004628_eval_0981 Precomputed model outputs for evaluation. Evaluation Results Summary Metric AIME24 AIME25 AMC23 MATH500 GPQADiamond LiveCodeBench Accuracy 34.7 24.7 84.0 86.4 55.9 56.4 AIME24 Average Accuracy: 34.67% ± 1.52% Number of Runs: 5 Run Accuracy Questions Solved Total Questions 1 33.33% 10 30 2 40.00% 12 30 3 30.00% 9 30 4 33.33% 10 30 5 36.67% 11 30… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/Bespoke-Stratos-32B_1744004628_eval_0981.tabular1K<n<10K0 likes7 downloads1y agoHugging Face11mlfoundations-dev /bespoke_stratos_10k_eval_636d mlfoundations-dev/fig1_scaling_bespoke_stratos_10k_eval_636d Precomputed model outputs for evaluation. Evaluation Results Summary Metric AIME24 AMC23 MATH500 MMLUPro JEEBench GPQADiamond LiveCodeBench CodeElo CodeForces Accuracy 18.7 61.0 77.6 28.2 40.2 38.2 33.9 8.3 12.5 AIME24 Average Accuracy: 18.67% ± 1.35% Number of Runs: 10 Run Accuracy Questions Solved Total Questions 1 13.33% 4 30 2 20.00% 6 30 3 13.33% 4 30… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/bespoke_stratos_10k_eval_636d.tabular1K<n<10K0 likes7 downloads1y agoHugging Face12mlfoundations-dev /bespoke_stratos_3k_eval_636d mlfoundations-dev/fig1_scaling_bespoke_stratos_3k_eval_636d Precomputed model outputs for evaluation. Evaluation Results Summary Metric AIME24 AMC23 MATH500 MMLUPro JEEBench GPQADiamond LiveCodeBench CodeElo CodeForces Accuracy 17.7 60.5 77.6 28.2 41.1 43.3 30.7 5.5 7.7 AIME24 Average Accuracy: 17.67% ± 1.64% Number of Runs: 10 Run Accuracy Questions Solved Total Questions 1 16.67% 5 30 2 16.67% 5 30 3 10.00% 3 30 4… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/bespoke_stratos_3k_eval_636d.tabular1K<n<10K0 likes7 downloads1y agoHugging Face13mlfoundations-dev /bespoke_stratos_1k_eval_636d mlfoundations-dev/fig1_scaling_bespoke_stratos_1k_eval_636d Precomputed model outputs for evaluation. Evaluation Results Summary Metric AIME24 AMC23 MATH500 MMLUPro JEEBench GPQADiamond LiveCodeBench CodeElo CodeForces Accuracy 14.3 53.5 72.0 27.2 37.1 37.4 25.0 4.3 5.8 AIME24 Average Accuracy: 14.33% ± 0.95% Number of Runs: 10 Run Accuracy Questions Solved Total Questions 1 20.00% 6 30 2 13.33% 4 30 3 16.67% 5 30 4… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/bespoke_stratos_1k_eval_636d.tabular1K<n<10K0 likes7 downloads1y agoHugging Face14chengfu0118 /Custom-Bespoke-Stratos-7B_1753940497_eval_104b_aime24_skip_attn_2 chengfu0118/Custom-Bespoke-Stratos-7B_1753940497_eval_104b_aime24_skip_attn_2 Precomputed model outputs for evaluation. Evaluation Results AIME24 Average Accuracy: 0.00% ± 0.00% Number of Runs: 10 Run Accuracy Questions Solved Total Questions 1 0.00% 0 30 2 0.00% 0 30 3 0.00% 0 30 4 0.00% 0 30 5 0.00% 0 30 6 0.00% 0 30 7 0.00% 0 30 8 0.00% 0 30 9 0.00% 0 30 10 0.00% 0 30 tabularn<1K0 likes7 downloads1y agoHugging Face15chengfu0118 /Custom-Bespoke-Stratos-7B_1753940455_eval_104b_aime24_skip_attn_1 chengfu0118/Custom-Bespoke-Stratos-7B_1753940455_eval_104b_aime24_skip_attn_1 Precomputed model outputs for evaluation. Evaluation Results AIME24 Average Accuracy: 0.00% ± 0.00% Number of Runs: 10 Run Accuracy Questions Solved Total Questions 1 0.00% 0 30 2 0.00% 0 30 3 0.00% 0 30 4 0.00% 0 30 5 0.00% 0 30 6 0.00% 0 30 7 0.00% 0 30 8 0.00% 0 30 9 0.00% 0 30 10 0.00% 0 30 tabularn<1K0 likes7 downloads1y agoHugging Face16chengfu0118 /Custom-Bespoke-Stratos-7B_1753940541_eval_104b_aime24_skip_attn_3 chengfu0118/Custom-Bespoke-Stratos-7B_1753940541_eval_104b_aime24_skip_attn_3 Precomputed model outputs for evaluation. Evaluation Results AIME24 Average Accuracy: 0.00% ± 0.00% Number of Runs: 10 Run Accuracy Questions Solved Total Questions 1 0.00% 0 30 2 0.00% 0 30 3 0.00% 0 30 4 0.00% 0 30 5 0.00% 0 30 6 0.00% 0 30 7 0.00% 0 30 8 0.00% 0 30 9 0.00% 0 30 10 0.00% 0 30 tabularn<1K0 likes7 downloads1y agoHugging Face17chengfu0118 /Custom-Bespoke-Stratos-7B_1753940786_eval_104b_aime24_skip_attn_7 chengfu0118/Custom-Bespoke-Stratos-7B_1753940786_eval_104b_aime24_skip_attn_7 Precomputed model outputs for evaluation. Evaluation Results AIME24 Average Accuracy: 0.00% ± 0.00% Number of Runs: 10 Run Accuracy Questions Solved Total Questions 1 0.00% 0 30 2 0.00% 0 30 3 0.00% 0 30 4 0.00% 0 30 5 0.00% 0 30 6 0.00% 0 30 7 0.00% 0 30 8 0.00% 0 30 9 0.00% 0 30 10 0.00% 0 30 tabularn<1K0 likes7 downloads1y agoHugging Face18chengfu0118 /Custom-Bespoke-Stratos-7B_1753961263_eval_466d_math500_skip_attn_0 chengfu0118/Custom-Bespoke-Stratos-7B_1753961263_eval_466d_math500_skip_attn_0 Precomputed model outputs for evaluation. Evaluation Results MATH500 Accuracy: 79.40% Accuracy Questions Solved Total Questions 79.40% 397 500 tabularn<1K0 likes7 downloads1y agoHugging Face19mlfoundations-dev /Bespoke-Stratos-7B_1743982559_eval_0981tabular1K<n<10K0 likes6 downloads1y agoHugging Face20mlfoundations-dev /Bespoke-Stratos-7B_1743996665_eval_0981 mlfoundations-dev/Bespoke-Stratos-7B_1743996665_eval_0981 Precomputed model outputs for evaluation. Evaluation Results Summary Metric AIME24 AIME25 AMC23 MATH500 GPQADiamond LiveCodeBench Accuracy 16.0 14.7 57.5 77.0 31.3 27.3 AIME24 Average Accuracy: 16.00% ± 1.74% Number of Runs: 5 Run Accuracy Questions Solved Total Questions 1 13.33% 4 30 2 10.00% 3 30 3 16.67% 5 30 4 20.00% 6 30 5 20.00% 6 30… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/Bespoke-Stratos-7B_1743996665_eval_0981.tabular1K<n<10K0 likes6 downloads1y agoHugging Face21mlfoundations-dev /Bespoke-Stratos-7B_eval_2e29 mlfoundations-dev/Bespoke-Stratos-7B_eval_2e29 Precomputed model outputs for evaluation. Evaluation Results Summary Metric AIME24 AMC23 MATH500 MMLUPro JEEBench GPQADiamond LiveCodeBench CodeElo CodeForces AIME25 HLE LiveCodeBenchv5 Accuracy 14.3 54.2 77.6 34.2 40.2 31.8 27.4 3.2 4.8 12.7 10.0 16.7 AIME24 Average Accuracy: 14.33% ± 1.57% Number of Runs: 10 Run Accuracy Questions Solved Total Questions 1 16.67% 5 30… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/Bespoke-Stratos-7B_eval_2e29.tabular10K<n<100K0 likes6 downloads1y agoHugging Face22mlfoundations-dev /bespoke_stratos_0.3k_eval_2e29 mlfoundations-dev/bespoke_stratos_0.3k_eval_2e29 Precomputed model outputs for evaluation. Evaluation Results Summary Metric AIME24 AMC23 MATH500 MMLUPro JEEBench GPQADiamond LiveCodeBench CodeElo CodeForces AIME25 HLE LiveCodeBenchv5 Accuracy 17.0 50.0 71.4 27.8 37.1 39.2 24.6 4.6 5.7 10.3 0.4 14.5 AIME24 Average Accuracy: 17.00% ± 1.10% Number of Runs: 10 Run Accuracy Questions Solved Total Questions 1 20.00% 6 30… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/bespoke_stratos_0.3k_eval_2e29.tabular10K<n<100K0 likes6 downloads1y agoHugging Face23mlfoundations-dev /Bespoke-Stratos-32B_eval_2e29 mlfoundations-dev/Bespoke-Stratos-32B_eval_2e29 Precomputed model outputs for evaluation. Evaluation Results Summary Metric AIME24 AMC23 MATH500 MMLUPro JEEBench GPQADiamond LiveCodeBench CodeElo CodeForces AIME25 HLE LiveCodeBenchv5 Accuracy 35.7 76.2 85.8 34.2 56.8 57.1 56.2 14.7 21.9 22.3 7.6 38.0 AIME24 Average Accuracy: 35.67% ± 1.89% Number of Runs: 10 Run Accuracy Questions Solved Total Questions 1 40.00% 12 30… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/Bespoke-Stratos-32B_eval_2e29.tabular10K<n<100K0 likes6 downloads1y agoHugging Face24chengfu0118 /Bespoke-Stratos-7B_1753887651_eval_466d chengfu0118/Bespoke-Stratos-7B_1753887651_eval_466d Precomputed model outputs for evaluation. Evaluation Results MATH500 Accuracy: 79.20% Accuracy Questions Solved Total Questions 79.20% 396 500 tabularn<1K0 likes6 downloads1y agoHugging Face25chengfu0118 /Custom-Bespoke-Stratos-7B_1753940744_eval_104b_aime24_skip_attn_6 chengfu0118/Custom-Bespoke-Stratos-7B_1753940744_eval_104b_aime24_skip_attn_6 Precomputed model outputs for evaluation. Evaluation Results AIME24 Average Accuracy: 0.00% ± 0.00% Number of Runs: 10 Run Accuracy Questions Solved Total Questions 1 0.00% 0 30 2 0.00% 0 30 3 0.00% 0 30 4 0.00% 0 30 5 0.00% 0 30 6 0.00% 0 30 7 0.00% 0 30 8 0.00% 0 30 9 0.00% 0 30 10 0.00% 0 30 tabularn<1K0 likes6 downloads1y agoHugging Face26chengfu0118 /Custom-Bespoke-Stratos-7B_1753947429_eval_104b_aime24_skip_attn_1 chengfu0118/Custom-Bespoke-Stratos-7B_1753947429_eval_104b_aime24_skip_attn_1 Precomputed model outputs for evaluation. Evaluation Results AIME24 Average Accuracy: 0.00% ± 0.00% Number of Runs: 10 Run Accuracy Questions Solved Total Questions 1 0.00% 0 30 2 0.00% 0 30 3 0.00% 0 30 4 0.00% 0 30 5 0.00% 0 30 6 0.00% 0 30 7 0.00% 0 30 8 0.00% 0 30 9 0.00% 0 30 10 0.00% 0 30 tabularn<1K0 likes6 downloads1y agoHugging Face27chengfu0118 /Custom-Bespoke-Stratos-7B_1753961348_eval_466d_math500_skip_attn_2 chengfu0118/Custom-Bespoke-Stratos-7B_1753961348_eval_466d_math500_skip_attn_2 Precomputed model outputs for evaluation. Evaluation Results MATH500 Accuracy: 1.00% Accuracy Questions Solved Total Questions 1.00% 5 500 tabularn<1K0 likes6 downloads1y agoHugging Face28mlfoundations-dev /bespoke_stratos_eval_636dtabular1K<n<10K0 likes5 downloads1y agoHugging Face29chengfu0118 /Bespoke-Stratos-7B_1753867522_eval_7a7d chengfu0118/Bespoke-Stratos-7B_1753867522_eval_7a7d Precomputed model outputs for evaluation. Evaluation Results Summary Metric MATH500 GPQADiamond Accuracy 53.8 44.8 MATH500 Accuracy: 53.80% Accuracy Questions Solved Total Questions 53.80% 269 500 GPQADiamond Average Accuracy: 44.78% ± 0.14% Number of Runs: 3 Run Accuracy Questions Solved Total Questions 1 44.95% 89 198 2 44.95% 89 198 3… See the full description on the dataset page: https://huggingface.co/datasets/chengfu0118/Bespoke-Stratos-7B_1753867522_eval_7a7d.tabular1K<n<10K0 likes5 downloads1y agoHugging Face30chengfu0118 /Bespoke-Stratos-7B_1753887628_eval_104b chengfu0118/Bespoke-Stratos-7B_1753887628_eval_104b Precomputed model outputs for evaluation. Evaluation Results AIME24 Average Accuracy: 19.67% ± 1.45% Number of Runs: 10 Run Accuracy Questions Solved Total Questions 1 16.67% 5 30 2 20.00% 6 30 3 23.33% 7 30 4 26.67% 8 30 5 23.33% 7 30 6 16.67% 5 30 7 23.33% 7 30 8 20.00% 6 30 9 16.67% 5 30 10 10.00% 3 30 tabularn<1K0 likes5 downloads1y agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.