CoolFace
Datasetpublic

aman-hf/indic_asr

Indic ASR Unified Dataset Unified collection of Indian language ASR datasets for pretraining. Stats Total hours: 10,278 Total samples: 4,732,705 Languages: 1 Audio: 16kHz mono (mixed flac/mp3/wav) Languages Language Hours Samples hi2 10,278 4,732,705 Usage from datasets import load_dataset # Load all languages (streaming) ds = load_dataset("aman-hf/indic_asr", streaming=True, split="train") # Load specific language… See the full description on the dataset page: https://huggingface.co/datasets/aman-hf/indic_asr.

sourceHugging Facecc-by-4.0updated 7mo agoView on Hugging Face
0likes2.1kdownloads
Dataset Card

Indic ASR Unified Dataset

Unified collection of Indian language ASR datasets for pretraining.

Stats

  • Total hours: 10,278
  • Total samples: 4,732,705
  • Languages: 1
  • Audio: 16kHz mono (mixed flac/mp3/wav)

Languages

LanguageHoursSamples
hi210,2784,732,705

Usage

python
from datasets import load_dataset

# Load all languages (streaming)
ds = load_dataset("aman-hf/indic_asr", streaming=True, split="train")

# Load specific language
ds_hi = load_dataset("aman-hf/indic_asr", "hi", streaming=True, split="train")

Schema

  • audio: Audio bytes (16kHz mono)
  • text: Transcription text
  • duration: Duration in seconds
  • language: ISO language code
  • source: Original dataset name