CoolFace
Datasetpublic

TCA/zwesui-grupa-4-medyczn

Polski korpus ASR — grupa 4 (mowa medyczna, trzustka i obrazowanie) Korpus referencyjny do ewaluacji systemów ASR w języku polskim, przygotowany w ramach warsztatów Ewaluacja Systemów Rozpoznawania Mowy (UAM WMI, edycja 2026, grupa 4). Domena: mowa medyczna — opisy obrazowania diagnostycznego, objawów i badań laboratoryjnych związanych z chorobami trzustki. Zbiór łączy segmenty z materiału edukacyjnego (YouTube, CC-BY) oraz uzupełniające nagrania syntetyczne TTS, transkrybowane… See the full description on the dataset page: https://huggingface.co/datasets/TCA/zwesui-grupa-4-medyczn.

sourceHugging Facecc-by-4.0updated 3mo agoView on Hugging Face
0likes19downloads
Dataset Card

Polski korpus ASR — grupa 4 (mowa medyczna, trzustka i obrazowanie)

Korpus referencyjny do ewaluacji systemów ASR w języku polskim, przygotowany w ramach warsztatów Ewaluacja Systemów Rozpoznawania Mowy (UAM WMI, edycja 2026, grupa 4).

Domena: mowa medyczna — opisy obrazowania diagnostycznego, objawów i badań laboratoryjnych związanych z chorobami trzustki. Zbiór łączy segmenty z materiału edukacyjnego (YouTube, CC-BY) oraz uzupełniające nagrania syntetyczne TTS, transkrybowane według wspólnego protokołu normalizacji (normalize.py + opis w normalization-protocol_updated.md).

Repozytorium (Hugging Face): https://huggingface.co/datasets/TCA/zwesui-grupa-4-medyczn Identyfikator datasetu: TCA/zwesui-grupa-4-medyczn

Cel i pytania badawcze

Celem korpusu jest dostarczenie referencyjnego zestawu testowego do oceny jakości rozpoznawania mowy (ASR) dla języka polskiego w warunkach domeny medycznej, ze szczególnym uwzględnieniem terminologii dotyczącej trzustki, opisów badań obrazowych (np. USG/TK/MR) oraz wyników laboratoryjnych (np. enzymy trzustkowe, parametry zapalne).

Zbiór ma umożliwiać:

  • —porównywanie modeli ASR w ustandaryzowanym protokole (wspólna normalizacja i schemat TSV),
  • —identyfikację typowych źródeł błędów (terminologia specjalistyczna, liczby i jednostki, skróty, nazwy badań),
  • —ocenę wpływu typu źródła audio (YouTube vs TTS) na wyniki WER/CER.

Przykładowe pytania badawcze:

  1. 1.Jak silnie domena medyczna (terminy specjalistyczne) pogarsza WER/CER w porównaniu do ogólnych korpusów PL?
  2. 2.Jakie kategorie tokenów są najtrudniejsze: liczby, jednostki, skróty badań, nazwy anatomiczne, leki?
  3. 3.Czy wyniki ASR różnią się istotnie pomiędzy nagraniami z YouTube (naturalne warunki) a TTS (czysta artykulacja)?
  4. 4.Które modele (np. Whisper/Conformer/wav2vec2) są najbardziej odporne na słownictwo medyczne po polsku?
  5. 5.Jak protokół normalizacji wpływa na raportowane WER/CER (np. zapis liczb, interpunkcja, skróty)?

Opis zbioru

Zbiór składa się z krótkich segmentów mowy w języku polskim związanych z medycyną (trzustka, diagnostyka obrazowa, objawy oraz wyniki badań).

Źródła audio:

  • —youtube — segmenty wycięte z materiału edukacyjnego opublikowanego na YouTube (licencja CC-BY, link per segment w source_url),
  • —edge_tts — nagrania syntetyczne przygotowane jako uzupełnienie domenowe.

Anotacja i weryfikacja:

  • —Transkrypcje są przygotowane i znormalizowane zgodnie z wspólnym protokołem (normalize.py, normalization-protocol_updated.md).
  • —Pola annotator oraz verified_by zawierają pseudonimy w formacie anon_<8hex> (pseudonimizacja; brak danych osobowych).
  • —Segmenty mają przypisane metadane źródła i licencji (source_url, source_license), co umożliwia audyt pochodzenia.

Kryteria segmentacji (założenia praktyczne):

  • —segmenty powinny obejmować spójne frazy/zdania w mowie czytanej (speech_type=read),
  • —unika się ucięć wewnątrz słowa i fragmentów z dominującym nakładaniem mowy,
  • —preferowane są fragmenty o wystarczającej zrozumiałości do wiarygodnej transkrypcji.

Struktura plików

audio_n_grupa_4.wav # audio
corpus.csv        # 10 kolumn (schema jak amu-cai/pl-asr-bigos-v2)
KolumnaOpis
pathŚcieżka względna do WAV 16 kHz mono PCM
sentenceTranskrypcja znormalizowana (referencja ASR)
domainmedyczna
sourceyoutube lub edge_tts
speech_typeread
annotator, verified_byPseudonimy anon_<hash> (RODO)
source_url, source_licensePochodzenie i licencja segmentu

Ograniczenia

  • —Domenowość: Zbiór koncentruje się na wąskim obszarze medycznym (trzustka i diagnostyka), więc wyniki nie muszą uogólniać się na inne specjalizacje.
  • —Źródła audio: Materiał z YouTube może zawierać szum, kompresję, zmienną dykcję i warunki nagrania, co wpływa na porównywalność z nagraniami studyjnymi.
  • —TTS: Dane syntetyczne mogą mieć inną charakterystykę akustyczną i prozodyczną niż mowa ludzka; modele mogą uzyskiwać na nich nienaturalnie dobre wyniki.
  • —Bias tematyczny i leksykalny: Nadreprezentacja określonych terminów i konstrukcji zdań może faworyzować modele dostrojone do podobnych danych.
  • —Normalizacja: Zasady normalizacji wpływają na wynik WER/CER (np. zapis liczb, jednostki, interpunkcja); porównania powinny używać identycznego protokołu.

Dane osobowe i RODO

Kolumny annotator i verified_by są pseudonimizowane (SHA-256 + sól edycji, format anon_<8hex>). Dobrowolna publikacja nicku Gitea: whitelist w corpus_to_hf.py (KEEP_NICK_WHITELIST).

Audio z YouTube: materiał na licencji CC-BY (link w source_url). Nagrania TTS: brak głosu ludzkiego; teksty scenariuszy opracowane przez zespół.

Licencja

Zbiór: `cc-by-4.0` (audio + transkrypcje), o ile nie wskazano inaczej w source_license per wiersz.

Cytowanie

bibtex
@misc{zwesui-grupa-4-medyczna,
  title   = {Polski korpus ASR — grupa 4 (mowa medyczna, trzustka i obrazowanie)},
  author  = {Zespół grupa 4, Warsztaty ASR UAM WMI 2026},
  year    = {2026},
  url     = {https://huggingface.co/datasets/TCA/zwesui-grupa-4-medyczn},
  note    = {Hugging Face dataset TCA/zwesui-grupa-4-medyczn}
}

Kontakt i kod

Repozytorium eksperymentów: https://git.wmi.amu.edu.pl/s512760/projekt-grupa4-Warsztaty-z-ewaluacji-asr