CoolFace
Datasetpublic

zsophia/slm-speech-coach

SLM Speech Coach — audio speech-coaching pairs License & attribution This dataset is released under CC-BY-4.0. It is a derivative work that combines: Real speech from The People's Speech (MLCommons), licensed CC-BY-4.0 — please retain this attribution when redistributing. Synthetic child speech generated via TTS (OpenAI gpt-4o-mini-tts / Gemini), plus one controlled delivery flaw injected per clip. Coaching text written by a Gemini 3.1 teacher model… See the full description on the dataset page: https://huggingface.co/datasets/zsophia/slm-speech-coach.

sourceHugging Facecc-by-4.0updated 3mo agoView on Hugging Face
0likes27downloads
50 commits on main
870acfd3mo ago

License: cc-by-4.0 + People's Speech attribution; add regenerated_v4 config

zsophia
92c03f63mo ago

Add lib/categorize.py for demo notebook judge

zsophia
8ed80e83mo ago

Add lib/llm_client.py for demo notebook judge

zsophia
bb315e73mo ago

Add judge_correctness.py (clean-clip abstention rubric) for demo notebook

zsophia
20624c83mo ago

Fix NEW4 dev: readings-gated no-fix (was flaw-denial on 589 flawed clips)

zsophia
5ab81153mo ago

Fix NEW4 val: readings-gated no-fix (was flaw-denial on 589 flawed clips)

zsophia
af23c8a3mo ago

Fix NEW4 train: readings-gated no-fix (was flaw-denial on 589 flawed clips)

zsophia
ec0759b3mo ago

Fix NEW4 dev: flat relative audio paths (audio-data/*.wav) to match NEW3/tarball

zsophia
5f0dcb93mo ago

Fix NEW4 val: flat relative audio paths (audio-data/*.wav) to match NEW3/tarball

zsophia
72e2cd23mo ago

Fix NEW4 train: flat relative audio paths (audio-data/*.wav) to match NEW3/tarball

zsophia
57e90563mo ago

Add NEW4 dev split (clean-clip targets rebalanced to no-fix)

zsophia
be6becd3mo ago

Add NEW4 val split (clean-clip targets rebalanced to no-fix)

zsophia
9b767443mo ago

Add NEW4 train split (clean-clip targets rebalanced to no-fix)

zsophia
a2dd01c3mo ago

Add full-coverage v3 metrics (all 5984 clips, base clip_id keyed)

zsophia
7c530913mo ago

Document v3 speaker-leak fix + v3 verifier in dataset card

zsophia
0b6a8c23mo ago

Update verify.py: kid-recalibrated thresholds + focus-aware grounding (v3)

zsophia
1a594483mo ago

v3 splits: fix speaker leak (group by human kid, not per-recording person_id): dev

zsophia
031a5cc3mo ago

v3 splits: fix speaker leak (group by human kid, not per-recording person_id): val

zsophia
c5589023mo ago

v3 splits: fix speaker leak (group by human kid, not per-recording person_id): train

zsophia
14daa8b3mo ago

Add regenerated_v3 config (per-flaw fan-out, filler-quotes-only)

zsophia
f1c2b813mo ago

Add v3 per-flaw fan-out split: dev

zsophia
b2f52023mo ago

Add v3 per-flaw fan-out split: val

zsophia
478743b3mo ago

Add v3 per-flaw fan-out split: train

zsophia
1329d103mo ago

Upload README.md with huggingface_hub

zsophia
95485dc3mo ago

Upload data/gemma_full_NEW2_dev.jsonl with huggingface_hub

zsophia
7a0ebdd3mo ago

Upload data/gemma_full_NEW2_val.jsonl with huggingface_hub

zsophia
ebbd9c83mo ago

Upload data/gemma_full_NEW2_train.jsonl with huggingface_hub

zsophia
1f3943d3mo ago

Upload data/gemma_full_NEW_dev.jsonl with huggingface_hub

zsophia
6421c5e3mo ago

Upload data/gemma_full_NEW_val.jsonl with huggingface_hub

zsophia
0eadf3d3mo ago

Upload data/gemma_full_NEW_train.jsonl with huggingface_hub

zsophia
7f2782d3mo ago

Upload data/gemma_full_NEW_dev.jsonl with huggingface_hub

zsophia
a5d2be83mo ago

Upload data/gemma_full_NEW_val.jsonl with huggingface_hub

zsophia
4b2d1fc3mo ago

Upload data/gemma_full_NEW_train.jsonl with huggingface_hub

zsophia
10274623mo ago

Upload data/gemma_full_NEW_dev.jsonl with huggingface_hub

zsophia
8fbd9103mo ago

Upload data/gemma_full_NEW_val.jsonl with huggingface_hub

zsophia
97e05683mo ago

Upload data/gemma_full_NEW_train.jsonl with huggingface_hub

zsophia
9dd05bf3mo ago

Upload scripts/verify.py with huggingface_hub

zsophia
2ded1e03mo ago

Upload README.md with huggingface_hub

zsophia
45682c33mo ago

Upload data/gemma_full_NEW_dev.jsonl with huggingface_hub

zsophia
6ef93063mo ago

Upload data/gemma_full_NEW_val.jsonl with huggingface_hub

zsophia
86441603mo ago

Upload data/gemma_full_NEW_train.jsonl with huggingface_hub

zsophia
ded8d9f3mo ago

Fill 900 empty transcripts via Gemini gateway (277 base speeches, fanned to variants)

zsophia
8f5548a3mo ago

eval.py: strict hallucination check + transcript loader

zsophia
a5ca48a3mo ago

Eval: strict hallucination check (claim-cue + skip suggestions/contractions/empty transcripts)

zsophia
f9912e33mo ago

Eval: caught-any-measured-flaw + quote-hallucination check (vs transcript)

zsophia
72648c63mo ago

Add multi-checkpoint sweep cell + metric-reading note

zsophia
5bd96203mo ago

Cell 6: add audio player + real flaw metrics table

zsophia
dca01493mo ago

Add interactive eval notebook

zsophia
c75340a3mo ago

Add measured-flaw + filler scoring to eval

zsophia
6e414cc3mo ago

Add verify module for eval

zsophia