CoolFace
20 results

kupe

anuj-inavlabs /kupe-asr-en-data kupe-asr-en-mini-150m — data Two loadable configs, packed into ~20-25 bunch_*.parquet files each (Hub-quota friendly): raw — 24 kHz mono English audio (flac bytes) + text. The encode stage reads this. mimi — Mimi c0..c7 codes (12.5 Hz) + text. Training reads this. Ledgers under ledger/ (data.json, mimi.json) track collected/encoded hours and resume state. from datasets import load_dataset ds = load_dataset("anuj-inavlabs/kupe-asr-en-data", "mimi", split="train") tabularautomatic-speech-recognition1M<n<10M0 likes1k downloads13d agoHugging Faceanuj-inavlabs /kupe-spark-asr-270m-data kupe-spark-asr-270m — data Multilingual ASR corpus for kupe-spark-asr-270m (Gemma-3-270m + Mimi codec). Languages: en (English), hi (Hindi), gu (Gujarati), bn (Bengali), ur (Urdu), mr (Marathi) Configs audio — raw speech resampled to 24 kHz mono (audio/data/shard_*.parquet). mimi — Mimi codebook-0 tokens (12.5 tok/s) + transcripts (mimi/*.parquet). Used for training. Shards are uploaded one-by-one as they are fetched. Resume state lives in… See the full description on the dataset page: https://huggingface.co/datasets/anuj-inavlabs/kupe-spark-asr-270m-data.audio0 likes663 downloads18d agoHugging FaceKuperberg /mixtral-chunkstextn<1K0 likes588 downloads9mo agoHugging FaceKuperberg /model-storage-v2textn<1K0 likes522 downloads9mo agoHugging Faceanuj-inavlabs /kupe-tts kupe-tts Self-contained Hindi / Hinglish TTS parquet clusters (embedded audio bytes + text + full STT char timestamps). Default split (train) data/clusters/cluster-XXXXX-of-00010.parquet — 10 clusters, 30 rows. column type description audio Audio embedded wav bytes (playable in Viewer) text string utterance transcript index int64 corpus index meta_json string full Soniox generation + timestamps JSON characters_json string char-level STT… See the full description on the dataset page: https://huggingface.co/datasets/anuj-inavlabs/kupe-tts.audiotext-to-speechn<1K0 likes495 downloads1mo agoHugging Faceanuj-inavlabs /kupe-thinkspark-270m-phase1-data ThinkSpark-v2-350M — Phase-1 free-audio training data Pre-encoded Mimi cb0 (12.5Hz semantic) tokens + per-frame energy/f0 prosody, packaged for Phase 1 of ThinkSpark-v2-350M — teaching a 270M-parameter Gemma-3-based full-duplex floor-controller that a stream of Mimi audio tokens carries language + prosody, before Phase 2 teaches it to referee turn-taking. Sourced from free/open corpora (LibriSpeech, AI4Bharat Kathbath/Shrutilipi, IndicTTS, Google FLEURS) via… See the full description on the dataset page: https://huggingface.co/datasets/anuj-inavlabs/kupe-thinkspark-270m-phase1-data.tabular100K<n<1M0 likes276 downloads24d agoHugging Face