aman-hf/indic_asr
Indic ASR Unified Dataset Unified collection of Indian language ASR datasets for pretraining. Stats Total hours: 10,278 Total samples: 4,732,705 Languages: 1 Audio: 16kHz mono (mixed flac/mp3/wav) Languages Language Hours Samples hi2 10,278 4,732,705 Usage from datasets import load_dataset # Load all languages (streaming) ds = load_dataset("aman-hf/indic_asr", streaming=True, split="train") # Load specific language… See the full description on the dataset page: https://huggingface.co/datasets/aman-hf/indic_asr.
02.1k
Indic ASR Unified Dataset
Unified collection of Indian language ASR datasets for pretraining.
Stats
- Total hours: 10,278
- Total samples: 4,732,705
- Languages: 1
- Audio: 16kHz mono (mixed flac/mp3/wav)
Languages
Usage
from datasets import load_dataset
# Load all languages (streaming)
ds = load_dataset("aman-hf/indic_asr", streaming=True, split="train")
# Load specific language
ds_hi = load_dataset("aman-hf/indic_asr", "hi", streaming=True, split="train")Schema
audio: Audio bytes (16kHz mono)text: Transcription textduration: Duration in secondslanguage: ISO language codesource: Original dataset name
