cvxhull/stt-calibration
STT Calibration Dataset Tiny calibration dataset for PersonalAssistant STT service. Used on first run to auto-tune speculative pre-transcription parameters. Contents File Duration Size Purpose short.wav 3.5s 110KB RTF measurement + VAD onset latency long.wav 23.3s 729KB Split quality calibration (whole vs split comparison) very_long.wav 56.8s 1.8MB Multi-split calibration (find minimum safe split interval) manifest.json - 2KB Sample metadata +… See the full description on the dataset page: https://huggingface.co/datasets/cvxhull/stt-calibration.
STT Calibration Dataset
Tiny calibration dataset for PersonalAssistant STT service. Used on first run to auto-tune speculative pre-transcription parameters.
Contents
Total: ~2.6MB
Source
All audio from LibriSpeech test-clean (CC BY 4.0). very_long.wav is 4 samples concatenated with 0.5s silence gaps.
Usage
Downloaded automatically on first STT run via huggingface_hub.snapshot_download:
from huggingface_hub import snapshot_download
path = snapshot_download("cvxhull/stt-calibration")Cached in ~/.cache/huggingface/hub/. No re-download on subsequent runs.
