kupe
Datasets
All datasets matching “kupe”kupe-asr-en-data
kupe-asr-en-mini-150m — data
Two loadable configs, packed into ~20-25 bunch_*.parquet files each (Hub-quota friendly):
raw — 24 kHz mono English audio (flac bytes) + text. The encode stage reads this.
mimi — Mimi c0..c7 codes (12.5 Hz) + text. Training reads this.
Ledgers under ledger/ (data.json, mimi.json) track collected/encoded hours and resume state.
from datasets import load_dataset
ds = load_dataset("anuj-inavlabs/kupe-asr-en-data", "mimi", split="train")
kupe-spark-asr-270m-data
kupe-spark-asr-270m — data
Multilingual ASR corpus for kupe-spark-asr-270m (Gemma-3-270m + Mimi codec).
Languages: en (English), hi (Hindi), gu (Gujarati), bn (Bengali), ur (Urdu), mr (Marathi)
Configs
audio — raw speech resampled to 24 kHz mono (audio/data/shard_*.parquet).
mimi — Mimi codebook-0 tokens (12.5 tok/s) + transcripts (mimi/*.parquet). Used for training.
Shards are uploaded one-by-one as they are fetched. Resume state lives in… See the full description on the dataset page: https://huggingface.co/datasets/anuj-inavlabs/kupe-spark-asr-270m-data.mixtral-chunksmodel-storage-v2kupe-tts
kupe-tts
Self-contained Hindi / Hinglish TTS parquet clusters
(embedded audio bytes + text + full STT char timestamps).
Default split (train)
data/clusters/cluster-XXXXX-of-00010.parquet —
10 clusters, 30 rows.
column
type
description
audio
Audio
embedded wav bytes (playable in Viewer)
text
string
utterance transcript
index
int64
corpus index
meta_json
string
full Soniox generation + timestamps JSON
characters_json
string
char-level STT… See the full description on the dataset page: https://huggingface.co/datasets/anuj-inavlabs/kupe-tts.kupe-thinkspark-270m-phase1-data
ThinkSpark-v2-350M — Phase-1 free-audio training data
Pre-encoded Mimi cb0 (12.5Hz semantic) tokens +
per-frame energy/f0 prosody, packaged for Phase 1 of ThinkSpark-v2-350M — teaching a
270M-parameter Gemma-3-based full-duplex floor-controller that a stream of Mimi audio
tokens carries language + prosody, before Phase 2 teaches it to referee turn-taking.
Sourced from free/open corpora (LibriSpeech, AI4Bharat Kathbath/Shrutilipi, IndicTTS,
Google FLEURS) via… See the full description on the dataset page: https://huggingface.co/datasets/anuj-inavlabs/kupe-thinkspark-270m-phase1-data.
