anuj-inavlabs/kupe-spark-asr-270m-data
kupe-spark-asr-270m — data Multilingual ASR corpus for kupe-spark-asr-270m (Gemma-3-270m + Mimi codec). Languages: en (English), hi (Hindi), gu (Gujarati), bn (Bengali), ur (Urdu), mr (Marathi) Configs audio — raw speech resampled to 24 kHz mono (audio/data/shard_*.parquet). mimi — Mimi codebook-0 tokens (12.5 tok/s) + transcripts (mimi/*.parquet). Used for training. Shards are uploaded one-by-one as they are fetched. Resume state lives in… See the full description on the dataset page: https://huggingface.co/datasets/anuj-inavlabs/kupe-spark-asr-270m-data.
kupe-spark-asr-270m — data
Multilingual ASR corpus for kupe-spark-asr-270m (Gemma-3-270m + Mimi codec).
Languages: en (English), hi (Hindi), gu (Gujarati), bn (Bengali), ur (Urdu), mr (Marathi)
Configs
- audio — raw speech resampled to 24 kHz mono (
audio/data/shard_*.parquet). - mimi — Mimi codebook-0 tokens (12.5 tok/s) + transcripts (
mimi/*.parquet). Used for training.
Shards are uploaded one-by-one as they are fetched. Resume state lives in audio/fetch_state.json.
from datasets import load_dataset
audio = load_dataset("anuj-inavlabs/kupe-spark-asr-270m-data", "audio", split="train")
mimi = load_dataset("anuj-inavlabs/kupe-spark-asr-270m-data", "mimi", split="train")Sources: ai4bharat/IndicVoices, ARTPARK-IISc/Vaani-transcription-part, mozilla-foundation/commonvoice170, MLCommons/peoplesspeech. See each source for its license.
