datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
gemini-flash-2.0-speech-MOSS-Annotatedme-dj-0520-gemini-2.0-flash-001gemini-2.0-flash-responsesgemini__gemini-2.0-flash_eval_5ed6
gemini/gemini-2.0-flash Evaluation Results
Precomputed model outputs for evaluation.
Evaluation Results
Summary
Metric
AIME25
LiveCodeBenchv5
AMC23
MATH500
MMLUPro
JEEBench
GPQADiamond
LiveCodeBench
CodeElo
HLE
SWEbench
AIME24
Accuracy
27.0
27.5
80.5
88.6
36.6
35.2
64.0
41.9
34.4
8.0
0.0
36.7
AIME25
Average Accuracy: 27.0% ± 0.7%
Number of Runs: 10
Run
Accuracy
Questions Solved
Total Questions
1
26.7%
8
30
2
26.7%
8… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations-dev/gemini__gemini-2.0-flash_eval_5ed6.gemini-2.0-flash-lite-pneumonia-datasetgemini-flash-2.0-speech-Kanade-Annotatedgemini-flash-2.0-speech-Kanade-Fixed
