NRK-KIHUB/no-asr-eval-data-broadcast-sample
NRK Norwegian Speech Dataset (Sample) Dataset Description Note: This is a sample dataset containing a subset of chunks for demonstration and preview purposes. The full dataset is available privately. This dataset contains Norwegian speech data from NRK TV broadcasts (norge-rundt, supernytt), processed for automatic speech recognition (ASR) evaluation and research. Reference text caveat: Reference text is NRK's on-air teletext subtitling, not a verbatim… See the full description on the dataset page: https://huggingface.co/datasets/NRK-KIHUB/no-asr-eval-data-broadcast-sample.
fix: add missing provenance columns (transcription_source, transcript_fidelity, verification, verification_note)
fix: normalise file_name to relative paths (was absolute cache paths)
altwer: refresh text_variants (gemini-3.5-flash, prompt v2)
Update sample dataset (108 chunks, 36 episodes)
Update sample dataset (108 chunks, 36 episodes)
Update sample dataset (108 chunks, 36 episodes)
Update sample dataset (108 chunks, 36 episodes)
initial commit
