anuj-inavlabs/kupe-thinkspark-270m-phase1-data
ThinkSpark-v2-350M — Phase-1 free-audio training data Pre-encoded Mimi cb0 (12.5Hz semantic) tokens + per-frame energy/f0 prosody, packaged for Phase 1 of ThinkSpark-v2-350M — teaching a 270M-parameter Gemma-3-based full-duplex floor-controller that a stream of Mimi audio tokens carries language + prosody, before Phase 2 teaches it to referee turn-taking. Sourced from free/open corpora (LibriSpeech, AI4Bharat Kathbath/Shrutilipi, IndicTTS, Google FLEURS) via… See the full description on the dataset page: https://huggingface.co/datasets/anuj-inavlabs/kupe-thinkspark-270m-phase1-data.
phase1: gu — 33 parquet shard(s), full re-upload
phase1: hi — 41 parquet shard(s), full re-upload
phase1: update dataset card
phase1: en — 13 parquet shard(s), full re-upload
initial commit
