CoolFace
Datasetpublic

saidutta69/odia-eval-benchmark

Odia Eval Benchmark 125,243 evaluation samples across 33 datasets. Zero gating. Zero waiting. Just download and eval. Why This Is The #1 Odia Evaluation Benchmark Before this dataset, evaluating Odia language models meant hunting down individual repos, figuring out each one's format, dealing with broken loaders, and keeping track of what you've already tested. This is the first and only unified Odia eval benchmark. Factor Every Other Option This… See the full description on the dataset page: https://huggingface.co/datasets/saidutta69/odia-eval-benchmark.

sourceHugging Facemitupdated 12d agoView on Hugging Face
0likes36downloads
Dataset Card

Odia Eval Benchmark

<div align="center"> <img src="https://photu.kashyalabanavli.site/racer-is-op.png" alt="RACER IS OP" width="100%"> </div>

<br>

125,243 evaluation samples across 33 datasets. Zero gating. Zero waiting. Just download and eval.


Why This Is The #1 Odia Evaluation Benchmark

Before this dataset, evaluating Odia language models meant hunting down individual repos, figuring out each one's format, dealing with broken loaders, and keeping track of what you've already tested. This is the first and only unified Odia eval benchmark.

FactorEvery Other OptionThis Dataset
Total samplesScattered across ~30 standalone repos124,249 in one place
Task diversityEach dataset covers 1 task9 task types (MCQ, QA, math, translation, classification, generation, NER, paraphrasing, summarization)
Load timepip install per repo + format-specific parsingOne `load_dataset()` call
Schema30 different column names and structuresUnified schema with 15 fields
Eval harnessNone -- write per-dataset scriptsBundled (scripts/eval_harness.py)
Quality mixNo comparison possible3 tiers: professional translation (43K), native Odia (43K), NLLB (15K)
Install30+ pip install datasets[...]pip install datasets
AccessSome gated, some broken loadersAll public, all working
NER coverage153 samples (IndicGLUE only)1,147 samples (IndicGLUE + Naamapadam)

No other Odia eval benchmark has all three of: unified schema, bundled eval harness, and multi-tiers of quality with professional translations.


What's In This Beast

MetricValue
Total Samples125,243
Unique Datasets33
Evaluation Tasks9
LanguagesOdia (ory) + English prompts where available
LicenseMIT (commercially usable, no restrictions)
Access RequiredNone
File FormatParquet (single split, 80MB)

By Task

TaskSamplesWhat It Measures
Multiple Choice63,266Knowledge & reasoning across 100+ subjects (MILU, MMLU, ARC, TriviaQA, HellaSwag, Winogrande, TruthfulQA-MC, BHRAM-IL, IndicCOPA, IndicGLUE-WSTP)
Question Answering29,392Reading comprehension, factual recall, BoolQ, IndicQA, IndicSQuAD, IndicQuest
Generation23,738Summarization, headline gen, question gen
Math2,638Arithmetic chain-of-thought reasoning
Classification4,050News categorization, paraphrase detection
Translation1,012Odia-English translation quality
NER1,147Token-level named entity recognition

By Quality Tier

TierSamplesProvider
Professional Translation47,951Sarvam AI (MMLU, GSM8K, ARC, TriviaQA, BoolQ, IndiVibe)
Native Odia60,403AI4Bharat, L3Cube, Sambhashana, MTEB, OpenLanguageData
NLLB Translated15,895TripathySagar (ARC, GSM8K, HellaSwag, Winogrande, TruthfulQA)

Full Dataset List

DatasetSamplesTaskQuality
bhram_il10,265multiple_choiceNative Odia
flores_plus1,012translationNative Odia
indic_copa500multiple_choiceNative Odia
indic_glue_csqa1,975qaNative Odia
indic_glue_ner153nerNative Odia
indic_glue_wstp502multiple_choiceNative Odia
indic_headline_gen7,137generationNative Odia
indic_qa1,680qaNative Odia
indic_quest_odia200qaNative Odia
indic_question_generation10,553generationNative Odia
indic_sentence_summarization6,048generationNative Odia
indic_squad_odia11,803qaNative Odia
indic_xparaphrase2,002classificationNative Odia
milu4,525multiple_choiceNative Odia
naamapadam_odia_ner994nerNative Odia
odia_arc1,172multiple_choiceNLLB Translated
odia_gsm8k1,319mathNLLB Translated
odia_hellaswag10,003multiple_choiceNLLB Translated
odia_news_classification2,048classificationNative Odia
odia_truthfulqa817qaNLLB Translated
odia_truthfulqa_mc817multiple_choiceNLLB Translated
odia_winogrande1,767multiple_choiceNLLB Translated
sarvam_arc_challenge1,150multiple_choiceProfessional Translation
sarvam_arc_challenge_val294multiple_choiceProfessional Translation
sarvam_boolq9,427qaProfessional Translation
sarvam_boolq_val3,270qaProfessional Translation
sarvam_gsm8k_indic1,319mathProfessional Translation
sarvam_indivibe_chat100qaProfessional Translation
sarvam_indivibe_code40qaProfessional Translation
sarvam_indivibe_math40qaProfessional Translation
sarvam_indivibe_stem40qaProfessional Translation
sarvam_mmlu_indic14,042multiple_choiceProfessional Translation
sarvam_mmlu_indic_val285multiple_choiceProfessional Translation
sarvam_triviaqa17,944multiple_choiceProfessional Translation

Quick Start

Load the data

python
from datasets import load_dataset

ds = load_dataset('saidutta69/odia-eval-benchmark', split='odia')
print(f'{len(ds):,} samples loaded')

# Filter to a specific dataset
mmlu = ds.filter(lambda x: x['dataset_name'] == 'sarvam_mmlu_indic')

# Filter by task type
mcq = ds.filter(lambda x: x['task'] == 'multiple_choice')
print(f'MCQ: {{len(mcq):,}} samples')

Evaluate a model

Use the bundled eval harness:

bash
# Random baseline on all MCQ tasks
python scripts/eval_harness.py --model random --task-type multiple_choice

# Evaluate a HuggingFace model on MMLU Odia
python scripts/eval_harness.py --model your-org/model --tasks sarvam_mmlu_indic --device mps

# Test all tasks
python scripts/eval_harness.py --model random --task-type all --verbose

Programmatic eval

python
from scripts.eval_harness import load_data, default_prompt, score_mc, MockModel

ds = load_data(dataset_names=['sarvam_mmlu_indic'])
model = MockModel('your-org/model', device='mps')

for sample in ds:
    prompt = default_prompt(sample)
    pred = model.predict(prompt)
    score = score_mc(sample, pred)

Dataset Fields

FieldTypeDescription
idstringUnique sample identifier
taskstringTask type: multiple_choice, qa, math, translation, classification, generation, ner
languagestringLanguage code (ory)
promptstringOriginal English prompt (when available)
prompt_odiastringOdia prompt/question/context
referencestringEnglish reference/answer (when available)
reference_odiastringOdia reference/answer
choiceslist[string]English answer choices (MCQ tasks)
choices_odialist[string]Odia answer choices (MCQ tasks)
answerstringCorrect answer
domainstringDomain or category label
sourcestringOriginal dataset name
subsetstringSubject or subcategory
splitstringDataset split
dataset_namestringInternal name for filtering

Attribution

SourceDatasets
Sarvam AIMMLU-Indic, GSM8K-Indic, ARC-Challenge-Indic, TriviaQA-Indic-MCQ, BoolQ-Indic, IndiVibe
AI4BharatMILU, IndicQA, IndicCOPA, IndicHeadlineGeneration, IndicSentenceSummarization, IndicQuestionGeneration, IndicXParaphrase, IndicGLUE (CSQA, WSTP, WikiNER), Naamapadam
L3CubeIndicSQuAD Odia, IndicQuest Odia
TripathySagarOdia-translated ARC, GSM8K, HellaSwag, Winogrande, TruthfulQA
SambhashanaBHRAM-IL
OpenLanguageDataFLORES+
MTEBOdiaNewsClassification

Built because waiting for access requests is not a strategy.