uam-wmi-asr-eval-labs/2026-dwesui-g04-admedvoice
DWESUI 2026 - Grupa 4 - ADMEDVOICE (medyczna) Robocza/archiwalna kopia zbioru ewaluacyjnego ASR zbudowanego przez studentow kursu Warsztaty z ewaluacji systemow rozpoznawania mowy (UAM WMI), edycja 2026, tryb dzienny. Zespol (atrybucja): Grupa 4 (DWESUI 2026) Zrodlo oryginalne: https://huggingface.co/datasets/TCA/zwesui-grupa-4-medyczn Domena: medyczna Licencja zrodla: nagrania YouTube CC-BY + Kaggle ADMEDVOICE + TTS Status: kopia publiczna w organizacji kursowej (zespół… See the full description on the dataset page: https://huggingface.co/datasets/uam-wmi-asr-eval-labs/2026-dwesui-g04-admedvoice.
DWESUI 2026 - Grupa 4 - ADMEDVOICE (medyczna)
Robocza/archiwalna kopia zbioru ewaluacyjnego ASR zbudowanego przez studentow kursu Warsztaty z ewaluacji systemow rozpoznawania mowy (UAM WMI), edycja 2026, tryb dzienny.
- Zespol (atrybucja): Grupa 4 (DWESUI 2026)
- Zrodlo oryginalne: https://huggingface.co/datasets/TCA/zwesui-grupa-4-medyczn
- Domena: medyczna
- Licencja zrodla: nagrania YouTube CC-BY + Kaggle ADMEDVOICE + TTS
- Status: kopia publiczna w organizacji kursowej (zespół opublikował zbiór na CC BY 4.0); planowane włączenie do BIGOS V3 i Polish ASR Leaderboard V2 (do końca 2026).
Kopia utworzona 2026-06-28 (konsolidacja artefaktow kursu). Konwencja nazwy: {rok}-{tryb}-g{NN}-{domena}.
Oryginalny opis zespolu
Polski korpus ASR — grupa 4 (mowa medyczna, trzustka i obrazowanie)
Korpus referencyjny do ewaluacji systemów ASR w języku polskim, przygotowany w ramach warsztatów Ewaluacja Systemów Rozpoznawania Mowy (UAM WMI, edycja 2026, grupa 4).
Domena: mowa medyczna — opisy obrazowania diagnostycznego, objawów i badań laboratoryjnych związanych z chorobami trzustki. Zbiór łączy segmenty z materiału edukacyjnego (YouTube, CC-BY) oraz uzupełniające nagrania syntetyczne TTS, transkrybowane według wspólnego protokołu normalizacji (normalize.py + opis w normalization-protocol_updated.md).
Repozytorium (Hugging Face): https://huggingface.co/datasets/TCA/zwesui-grupa-4-medyczn Identyfikator datasetu: TCA/zwesui-grupa-4-medyczn
Cel i pytania badawcze
Celem korpusu jest dostarczenie referencyjnego zestawu testowego do oceny jakości rozpoznawania mowy (ASR) dla języka polskiego w warunkach domeny medycznej, ze szczególnym uwzględnieniem terminologii dotyczącej trzustki, opisów badań obrazowych (np. USG/TK/MR) oraz wyników laboratoryjnych (np. enzymy trzustkowe, parametry zapalne).
Zbiór ma umożliwiać:
- porównywanie modeli ASR w ustandaryzowanym protokole (wspólna normalizacja i schemat TSV),
- identyfikację typowych źródeł błędów (terminologia specjalistyczna, liczby i jednostki, skróty, nazwy badań),
- ocenę wpływu typu źródła audio (YouTube vs TTS) na wyniki WER/CER.
Przykładowe pytania badawcze:
- Jak silnie domena medyczna (terminy specjalistyczne) pogarsza WER/CER w porównaniu do ogólnych korpusów PL?
- Jakie kategorie tokenów są najtrudniejsze: liczby, jednostki, skróty badań, nazwy anatomiczne, leki?
- Czy wyniki ASR różnią się istotnie pomiędzy nagraniami z YouTube (naturalne warunki) a TTS (czysta artykulacja)?
- Które modele (np. Whisper/Conformer/wav2vec2) są najbardziej odporne na słownictwo medyczne po polsku?
- Jak protokół normalizacji wpływa na raportowane WER/CER (np. zapis liczb, interpunkcja, skróty)?
Opis zbioru
Zbiór składa się z krótkich segmentów mowy w języku polskim związanych z medycyną (trzustka, diagnostyka obrazowa, objawy oraz wyniki badań).
Źródła audio:
youtube— segmenty wycięte z materiału edukacyjnego opublikowanego na YouTube (licencja CC-BY, link per segment wsource_url),edge_tts— nagrania syntetyczne przygotowane jako uzupełnienie domenowe.
Anotacja i weryfikacja:
- Transkrypcje są przygotowane i znormalizowane zgodnie z wspólnym protokołem (
normalize.py,normalization-protocol_updated.md). - Pola
annotatororazverified_byzawierają pseudonimy w formacieanon_<8hex>(pseudonimizacja; brak danych osobowych). - Segmenty mają przypisane metadane źródła i licencji (
source_url,source_license), co umożliwia audyt pochodzenia.
Kryteria segmentacji (założenia praktyczne):
- segmenty powinny obejmować spójne frazy/zdania w mowie czytanej (
speech_type=read), - unika się ucięć wewnątrz słowa i fragmentów z dominującym nakładaniem mowy,
- preferowane są fragmenty o wystarczającej zrozumiałości do wiarygodnej transkrypcji.
Struktura plików
audio_n_grupa_4.wav # audio
corpus.csv # 10 kolumn (schema jak amu-cai/pl-asr-bigos-v2)Ograniczenia
- Domenowość: Zbiór koncentruje się na wąskim obszarze medycznym (trzustka i diagnostyka), więc wyniki nie muszą uogólniać się na inne specjalizacje.
- Źródła audio: Materiał z YouTube może zawierać szum, kompresję, zmienną dykcję i warunki nagrania, co wpływa na porównywalność z nagraniami studyjnymi.
- TTS: Dane syntetyczne mogą mieć inną charakterystykę akustyczną i prozodyczną niż mowa ludzka; modele mogą uzyskiwać na nich nienaturalnie dobre wyniki.
- Bias tematyczny i leksykalny: Nadreprezentacja określonych terminów i konstrukcji zdań może faworyzować modele dostrojone do podobnych danych.
- Normalizacja: Zasady normalizacji wpływają na wynik WER/CER (np. zapis liczb, jednostki, interpunkcja); porównania powinny używać identycznego protokołu.
Dane osobowe i RODO
Kolumny annotator i verified_by są pseudonimizowane (SHA-256 + sól edycji, format anon_<8hex>). Dobrowolna publikacja nicku Gitea: whitelist w corpus_to_hf.py (KEEP_NICK_WHITELIST).
Audio z YouTube: materiał na licencji CC-BY (link w source_url). Nagrania TTS: brak głosu ludzkiego; teksty scenariuszy opracowane przez zespół.
Licencja
Zbiór: `cc-by-4.0` (audio + transkrypcje), o ile nie wskazano inaczej w source_license per wiersz.
Cytowanie
@misc{zwesui-grupa-4-medyczna,
title = {Polski korpus ASR — grupa 4 (mowa medyczna, trzustka i obrazowanie)},
author = {Zespół grupa 4, Warsztaty ASR UAM WMI 2026},
year = {2026},
url = {https://huggingface.co/datasets/TCA/zwesui-grupa-4-medyczn},
note = {Hugging Face dataset TCA/zwesui-grupa-4-medyczn}
}Kontakt i kod
Repozytorium eksperymentów: https://git.wmi.amu.edu.pl/s512760/projekt-grupa4-Warsztaty-z-ewaluacji-asr
