CoolFace
Datasetpublic

anuj-inavlabs/kupe-thinkspark

ThinkSpark training corpus Synthetic multilingual training data for ThinkSpark — a tiny model that predicts the human thinking sound / backchannel a voice assistant should emit between STT and the main LLM reply. Generated with Sarvam sarvam-105b (reasoning_effort=low) via the kupe-thinkspark pipeline. Files path rows description corpus/thinkspark_corpus_clean.jsonl 38,338 validated + deduped full corpus corpus/thinkspark_corpus.jsonl 40,090 raw… See the full description on the dataset page: https://huggingface.co/datasets/anuj-inavlabs/kupe-thinkspark.

sourceHugging Faceapache-2.0updated 1mo agoView on Hugging Face
0likes32downloads
3 commits on main
6da33d41mo ago

Upload ThinkSpark corpus (38,338 clean, 30,652/3,843/3,843 splits)

anuj-inavlabs
f8915e51mo ago

Upload ThinkSpark corpus (38,338 clean, 30,652/3,843/3,843 splits)

anuj-inavlabs
3ce02941mo ago

initial commit

anuj-inavlabs