CoolFace
Datasetpublic

NRK-KIHUB/no-asr-eval-data-broadcast-sample

NRK Norwegian Speech Dataset (Sample) Dataset Description Note: This is a sample dataset containing a subset of chunks for demonstration and preview purposes. The full dataset is available privately. This dataset contains Norwegian speech data from NRK TV broadcasts (norge-rundt, supernytt), processed for automatic speech recognition (ASR) evaluation and research. Reference text caveat: Reference text is NRK's on-air teletext subtitling, not a verbatim… See the full description on the dataset page: https://huggingface.co/datasets/NRK-KIHUB/no-asr-eval-data-broadcast-sample.

sourceHugging Faceupdated 5d agoView on Hugging Face
0likes85downloads
8 commits on main
28a6c8e5d ago

fix: add missing provenance columns (transcription_source, transcript_fidelity, verification, verification_note)

ina-nrk
b86c9005d ago

fix: normalise file_name to relative paths (was absolute cache paths)

ina-nrk
55a096e5d ago

altwer: refresh text_variants (gemini-3.5-flash, prompt v2)

ina-nrk
93ed77e9d ago

Update sample dataset (108 chunks, 36 episodes)

ina-nrk
7e1cd459d ago

Update sample dataset (108 chunks, 36 episodes)

ina-nrk
7f023279d ago

Update sample dataset (108 chunks, 36 episodes)

ina-nrk
67101489d ago

Update sample dataset (108 chunks, 36 episodes)

ina-nrk
4af8dfb9d ago

initial commit

ina-nrk