datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
esb-datasets-earnings22-validation-tiny-filteredA filtered (<=30s duration) slice (512 samples) of the Earnings22 dataset.
def add_duration(sample):
y, sr = sample['audio']["array"], sample['audio']["sampling_rate"]
sample['duration_ms']=librosa.get_duration(y=y, sr=sr) * 1000
return sample
tedlium = load_dataset("esb/datasets", "earnings22", split='validation', trust_remote_code=True)
# compute duration to filter
tedlium = tedlium.map(add_duration)
tedlium = tedlium.select(range(512))
# Whisper max supported duration
tedlium… See the full description on the dataset page: https://huggingface.co/datasets/D4nt3/esb-datasets-earnings22-validation-tiny-filtered.ttm-validation-datasetccpc-dataset-v2-validation-testdrkernel-validation-data
DR.Kernel Validation Dataset (KernelBench Level 2)
Paper | GitHub
This directory documents the format of hkust-nlp/drkernel-validation-data.
This validation set is built from KernelBench Level 2 tasks and is used for DR.Kernel evaluation/grading.
Overview
Purpose: validation/evaluation set for kernel generation models.
Task source: KernelBench Level 2.
Current local Parquet (validation_data_thinking.parquet) contains 100 tasks.
Dataset Structure
Parquet… See the full description on the dataset page: https://huggingface.co/datasets/hkust-nlp/drkernel-validation-data.MMMU-Reasoning-Distill-ValidationD-SFTv1_C-cd3arg-Qwen2.5-1.5B-MockSearchV2-7_24_25-sft_test_with_validation_tracking-sft-databangla-ocr-validation_data_printed
Bangla OCR Validation Dataset (Printed + Scanned)
📌 Description
This dataset is a Bangla OCR validation dataset containing a mix of printed document images and their corresponding text annotations. It is designed to evaluate OCR and vision-language models on both clean digital text and scanned document images.
📊 Dataset Composition
1507 line-level images with text annotations
50 full-page document images with text
Data includes:
Printed/typed Bangla text… See the full description on the dataset page: https://huggingface.co/datasets/arobin79/bangla-ocr-validation_data_printed.roco2-question-dataset-validationmusic-validation-datasetMNLP_M3_validation_datasetonly-code-validation-datavalidation-datastandard_dataset_nonsynthetic_sorted_validation_set
Dataset Card for "standard_dataset_nonsynthetic_sorted"
More Information needed
nepali-validation_datavalidation-datasetd1_d2_d4_validation_dataset_3_episodesvalidation_countdown_sft_deepseek_qwen_distilled_32b_dataset_v2ttm_validation_dataset_45secvalidation_countdown_sft_deepseek_qwen_distilled_32b_datasettext-and-code-validation-dataophthalmology_validation_datasetBattles_Validation_Datasquad_adversarial_validation_dataset
Dataset Card for "squad_adversarial_validation_dataset"
More Information needed
public_validation_datacsv-upload-synthetic_datasets_archive_2synthetic_medical_validationD-SFTv1_C-cd3arg-Qwen2.5-1.5B-MockSearchV2-7_24_25_sft_test_with_validation_tracking_sft_datasquad_contrasting_validation_dataset
Dataset Card for "squad_contrasting_validation_dataset"
More Information needed
mini-validation-datasetttm_validation_dataset_10seccsv-upload-synthetic_datasets_archive_google-gemma-3-27b-it-synthetic-main_validation
