CoolFace
Datasetpublic

cvxhull/stt-calibration

STT Calibration Dataset Tiny calibration dataset for PersonalAssistant STT service. Used on first run to auto-tune speculative pre-transcription parameters. Contents File Duration Size Purpose short.wav 3.5s 110KB RTF measurement + VAD onset latency long.wav 23.3s 729KB Split quality calibration (whole vs split comparison) very_long.wav 56.8s 1.8MB Multi-split calibration (find minimum safe split interval) manifest.json - 2KB Sample metadata +… See the full description on the dataset page: https://huggingface.co/datasets/cvxhull/stt-calibration.

sourceHugging Facecc-by-4.0updated 7mo agoView on Hugging Face
0likes22downloads
Dataset Card

STT Calibration Dataset

Tiny calibration dataset for PersonalAssistant STT service. Used on first run to auto-tune speculative pre-transcription parameters.

Contents

FileDurationSizePurpose
short.wav3.5s110KBRTF measurement + VAD onset latency
long.wav23.3s729KBSplit quality calibration (whole vs split comparison)
very_long.wav56.8s1.8MBMulti-split calibration (find minimum safe split interval)
manifest.json-2KBSample metadata + reference transcriptions

Total: ~2.6MB

Source

All audio from LibriSpeech test-clean (CC BY 4.0). very_long.wav is 4 samples concatenated with 0.5s silence gaps.

Usage

Downloaded automatically on first STT run via huggingface_hub.snapshot_download:

python
from huggingface_hub import snapshot_download
path = snapshot_download("cvxhull/stt-calibration")

Cached in ~/.cache/huggingface/hub/. No re-download on subsequent runs.

Calibration Parameters

ParameterHow it's calibrated
ASR RTFTranscribe short.wav, measure wall time / audio duration
Split intervalDerived from RTF: clamp(target_latency / rtf, min_safe_split, buffer_timeout)
Min safe splitTranscribe long.wav whole vs split at [5s, 8s, 12s], find minimum with similarity >= 0.95
VAD onset latencyFeed short.wav through VAD, measure chunks until first detection