CoolFace
Datasetpublic

anuj-inavlabs/kupe-spark-asr-270m-data

kupe-spark-asr-270m — data Multilingual ASR corpus for kupe-spark-asr-270m (Gemma-3-270m + Mimi codec). Languages: en (English), hi (Hindi), gu (Gujarati), bn (Bengali), ur (Urdu), mr (Marathi) Configs audio — raw speech resampled to 24 kHz mono (audio/data/shard_*.parquet). mimi — Mimi codebook-0 tokens (12.5 tok/s) + transcripts (mimi/*.parquet). Used for training. Shards are uploaded one-by-one as they are fetched. Resume state lives in… See the full description on the dataset page: https://huggingface.co/datasets/anuj-inavlabs/kupe-spark-asr-270m-data.

sourceHugging Faceupdated 22d agoView on Hugging Face
0likes758downloads
Dataset Card

kupe-spark-asr-270m — data

Multilingual ASR corpus for kupe-spark-asr-270m (Gemma-3-270m + Mimi codec).

Languages: en (English), hi (Hindi), gu (Gujarati), bn (Bengali), ur (Urdu), mr (Marathi)

Configs

  • —audio — raw speech resampled to 24 kHz mono (audio/data/shard_*.parquet).
  • —mimi — Mimi codebook-0 tokens (12.5 tok/s) + transcripts (mimi/*.parquet). Used for training.

Shards are uploaded one-by-one as they are fetched. Resume state lives in audio/fetch_state.json.

python
from datasets import load_dataset
audio = load_dataset("anuj-inavlabs/kupe-spark-asr-270m-data", "audio", split="train")
mimi  = load_dataset("anuj-inavlabs/kupe-spark-asr-270m-data", "mimi",  split="train")

Sources: ai4bharat/IndicVoices, ARTPARK-IISc/Vaani-transcription-part, mozilla-foundation/commonvoice170, MLCommons/peoplesspeech. See each source for its license.