datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
off-the-shelf-model-evals
Babel Tower benchmark archive
Filesystem toolkit 1.3.0 provides versioned storage and validation for the
proposed multilingual difficulty-calibrated benchmark. It connects a question
bank, evaluation protocols, model-family panels, item-level responses, external
calibration results, and frozen benchmark releases.
Current data status: no real evaluation runs, complete foundation item bank,
or fitted calibration parameters have been published here. The toolkit includes
separate… See the full description on the dataset page: https://huggingface.co/datasets/base-model-evals/off-the-shelf-model-evals.BaseModelPretrainglobal-mmlu-rephrased
global_mmlu (rephrased for base-model evaluation)
Global MMLU knowledge-MCQA items rewritten from question format into completion/cloze format for base (non-instruction-tuned) language model evaluation.
Base (non-instruction-tuned) language models often can't follow question-style
prompts like "What is the capital of Turkey?" -- that phrasing is suited to
instruction-tuned models. Each item here has been rewritten into a natural
completion prefix (e.g. "The capital of Turkey is… See the full description on the dataset page: https://huggingface.co/datasets/base-model-evals/global-mmlu-rephrased.belebele-rephrased
belebele (rephrased for base-model evaluation)
Belebele reading-comprehension items rewritten from question format into completion/cloze format for base (non-instruction-tuned) language model evaluation.
Base (non-instruction-tuned) language models often can't follow question-style
prompts like "What is the capital of Turkey?" -- that phrasing is suited to
instruction-tuned models. Each item here has been rewritten into a natural
completion prefix (e.g. "The capital of Turkey is… See the full description on the dataset page: https://huggingface.co/datasets/base-model-evals/belebele-rephrased.eval_data_imdb_with_basemodel_truepreferencesbase_model_sprint
Base Model Metadata Sprint
Description
Join us in improving the discoverability and understanding of models on the Hugging Face Hub by adding base_model metadata! This sprint aims to enhance the information available for models derived from, fine-tuned on, or quantized versions of existing base models.
🤗 Strong contributions will win prizes!! 🤗
Why It Matters
Adding base_model metadata helps users:
Easily find models derived from specific architectures… See the full description on the dataset page: https://huggingface.co/datasets/librarian-bots/base_model_sprint.base-model-personas-database_models_to_processbase_model_bad_caseD-EVAL__standard_eval_v3__FinEval_16k_fulleval_3args_basemodel-commonsenseQA-eval_0base_model_client_dataset_20231012_093051
Dataset Card for "base_model_client_dataset_20231012_093051"
More Information needed
D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-commonsenseQA__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-commonsenseQA
Experiment Description: Evaluation experiment for task commonsenseQA from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-27T00:08:01.014212
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-commonsenseQA__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-commonsenseQA__v1.base_model_inference_surveyD-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_4arg__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-countdown_4arg
Experiment Description: Evaluation experiment for task countdown_4arg from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-26T23:04:19.703111
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_4arg__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_4arg__v1.D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_5arg__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-countdown_5arg
Experiment Description: Evaluation experiment for task countdown_5arg from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-26T23:24:41.569284
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_5arg__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_5arg__v1.D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_6arg__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-countdown_6arg
Experiment Description: Evaluation experiment for task countdown_6arg from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-26T23:45:50.852122
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_6arg__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_6arg__v1.D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_2dig__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-longmult_2dig
Experiment Description: Evaluation experiment for task longmult_2dig from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-27T00:50:28.324661
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_2dig__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_2dig__v1.D-EVAL__standard_eval_v3__FinEval_16k_fulleval__3args_basemodel-eval_0D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-gsm8k__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-gsm8k
Experiment Description: Evaluation experiment for task gsm8k from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-27T00:28:26.546911
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-gsm8k__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following configurations with immediate… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-gsm8k__v1.D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_3dig__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-longmult_3dig
Experiment Description: Evaluation experiment for task longmult_3dig from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-27T01:07:20.942754
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_3dig__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_3dig__v1.D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_4dig__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-longmult_4dig
Experiment Description: Evaluation experiment for task longmult_4dig from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-27T01:24:13.992023
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_4dig__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_4dig__v1.D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_5dig__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-longmult_5dig
Experiment Description: Evaluation experiment for task longmult_5dig from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-27T01:43:02.308956
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_5dig__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-longmult_5dig__v1.D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-acronym_5o__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-acronym_5o
Experiment Description: Evaluation experiment for task acronym_5o from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-27T02:02:12.652182
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-acronym_5o__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following configurations with… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-acronym_5o__v1.D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-letter_countdown_5o__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-letter_countdown_5o
Experiment Description: Evaluation experiment for task letter_countdown_5o from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-27T02:12:20.603697
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-letter_countdown_5o__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-letter_countdown_5o__v1.D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-letter_countdown_4o__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-letter_countdown_4o
Experiment Description: Evaluation experiment for task letter_countdown_4o from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-27T02:22:26.243577
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-letter_countdown_4o__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-letter_countdown_4o__v1.basemodelCNNOV_Eng_BaseModelD-EVAL__standard_eval_v3__GRPO_basemodel_rl_grpo-rl_eval-eval_rlD-EVAL__standard_eval_v3__GRPO_basemodel_rl_grpo-ckpt-25-rl-eval_rlD-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_3arg__v1
Experiment Tracker: FinEval_16k_fulleval_3args_basemodel-countdown_3arg
Experiment Description: Evaluation experiment for task countdown_3arg from FinEval_16k_fulleval_3args_basemodel
Start Time: 2025-10-26T22:45:00.332516
Tracker Dataset: TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_3arg__v1
Stages Completed
Total stages: 1
Models Created
Dataset Configurations
This tracker dataset contains the following… See the full description on the dataset page: https://huggingface.co/datasets/TAUR-dev/D-ExpTracker__FinEval_16k_fulleval_3args_basemodel-countdown_3arg__v1.
