s479246/dwesui-grupa-2-kulinarna
G2-Polish-Culinary-ASR-Evaluation-Corpus Korpus do ewaluacji systemow ASR jezyka polskiego (domena kulinarna) stworzony w ramach warsztatow Ewaluacja Systemow Rozpoznawania Mowy (UAM WMI, edycja 2026, zespol 2). Publikowany podzbior to mowa naturalna z wideo kulinarnych YouTube (licencja CC-BY) - sluzy do badania odpornosci ASR na szum kuchenny oraz dopasowania domenowego do specjalistycznego slownictwa (zapozyczenia, miary, liczby). Pelny eksperyment ewaluacyjny zespolu… See the full description on the dataset page: https://huggingface.co/datasets/s479246/dwesui-grupa-2-kulinarna.
G2-Polish-Culinary-ASR-Evaluation-Corpus
Korpus do ewaluacji systemow ASR jezyka polskiego (domena kulinarna) stworzony w ramach warsztatow Ewaluacja Systemow Rozpoznawania Mowy (UAM WMI, edycja 2026, zespol 2). Publikowany podzbior to mowa naturalna z wideo kulinarnych YouTube (licencja CC-BY) - sluzy do badania odpornosci ASR na szum kuchenny oraz dopasowania domenowego do specjalistycznego slownictwa (zapozyczenia, miary, liczby).
Pelny eksperyment ewaluacyjny zespolu obejmowal dodatkowo podzbior syntetyczny (Edge TTS, 200 segmentow) jako czysty punkt odniesienia. Zgodnie z licencja Azure/Edge TTS audio syntetyczne nie jest redystrybuowane - uzyte bylo wylacznie do wewnetrznej ewaluacji.
Cel i pytania badawcze
Cel główny: Porównanie skuteczności 5 systemów ASR (trzy rozmiary architektury Seq2Seq, model CTC oraz model komercyjny) dla spontanicznej mowy polskiej w trudnym, zaszumionym środowisku domeny kulinarnej.
Pytania badawcze:
- PB1: Jak wypada architektura Seq2Seq w porównaniu do CTC na specjalistycznym słownictwie oraz jaki jest bezpośredni wpływ rozmiaru modelu na jakość?
- PB2: W jakim stopniu silny szum w tle (dźwięki kuchenne np. smażenie, okap) degraduje jakość transkrypcji w porównaniu do mowy nagrywanej w sterylnych warunkach?
- PB3: Jak tradycyjne metryki błędów słownych (WER) korelują z nowoczesnymi metrykami semantycznymi (MER, BERTScore) - czy system z dużym WER może dostarczyć użyteczny biznesowo sens?
Opis zbioru
Statystyki
Statystyki zbioru:
Rozkład po wymiarach: Zbiór jest idealnie zbalansowany:
- 200 nagrań naturalnych z szumem (spontaniczne).
- 200 nagrań wygenerowanych syntetycznie (czytane).
- Podział w pełni równomierny na członków grupy (po 100 rekordów).
Metodologia transkrypcji referencyjnej:
- Transkrypcję wykonał zespół ręcznie, po 100 nagrań na osobę.
- Stosowaliśmy weryfikację krzyżową (minimum 15% wierszy zweryfikowanych przez innego członka zespołu - cross-check).
- Normalizacja: usunięto interpunkcję, zamieniono litery na małe.
Struktura plikow
audio/pl/nat-<anon>-<N>.wav # segmenty naturalne (YouTube), 16 kHz mono PCM
audio/pl/syn-<anon>-<scenariusz>-<prompt>.wav # segmenty syntetyczne (TTS)
transcript/pl/test.tsv # 16 kolumn: path, sentence, age, gender, accent,
# locale, utterance_weight, tts_gen_speed, tts_engine,
# speech_type, source, domain, annotator,
# verified_by, source_url, source_licensePodzbior naturalny vs syntetyczny rozroznia kolumna source (youtube vs tts) oraz speech_type (spontaneous vs read). Scenariusz syntezy jest zakodowany w nazwie pliku (syn-...-<scenariusz>-...). Schema jest zgodna ze wzorcem warsztatow, co pozwala laczyc zbiory roznych grup w jeden benchmark.
Wyniki bazowe (baseline)
Wyniki główne (na pełnym zbiorze 400 nagrań):
- Whisper Large-v3: - WER: 15.6% - CER: 10.9% - RTF: 0.27 - Najlepszy w szumie.
- Whisper Medium: - WER: 21.7% - CER: 16.1% - RTF: 0.19 - Dobry kompromis na CPU.
- AssemblyAI: - WER: 24.7% - CER: 20.5% - RTF: 0.75 - Komercyjny (słaby w szumie).
- Whisper Base: - WER: 36.8% - CER: 18.3% - RTF: 0.07 - Lekki model.
- Wav2Vec2 (CTC): - WER: 44.3% - CER: 19.2% - RTF: 0.008 - Bardzo szybki, ale mało dokładny.
Wyniki semantyczne (MER): Large-v3 gubił zaledwie 12.4% encji biznesowych (MER), podczas gdy Wav2Vec2 ponad 43.8%.
Faza 3: RESULTS & REFLECTION
Podsumowanie ewaluacji
Podsumowanie: Wyniki pokazują ogromną dysproporcję jakościową między architekturami. Zwycięzcą został model Whisper Large-v3. Test Wilcoxona dowiódł, że przewaga architektury Seq2Seq nad klasycznym systemem CTC (Wav2Vec2) jest wysoce istotna statystycznie (p = 9.8e-11). Niespodzianką była niska wydajność komercyjnego AssemblyAI w zderzeniu z rzeczywistym szumem z Youtube (WER wyniósł tam dla API aż 44%).
Wnioski i ograniczenia
Odpowiedzi na pytania badawcze:
- PB1: Zdecydowanym wygranym jest architektura Seq2Seq wspierana gigantyczną siecią, podczas gdy lżejsze systemy CTC kompletnie poległy w trudnej akustyce polskiej domeny gastronomicznej. Rozmiar modelu to największa dźwignia sukcesu.
- PB2: Szum to najważniejszy wymiar analizy – luka szumu (19 punktów procentowych) pokazuje, że ocena modelu wyłącznie na sterylnych danych TTS kompletnie zakrzywia rzeczywisty obraz biznesowy.
- PB3: WER i MER nie idą 1:1. Często duży model robił błahą literówkę rzutującą na cały współczynnik WER, jednak z biznesowego punktu widzenia poprawnie identyfikował Encję Biznesową (MER rzędu 12%), co sprawia, że jest gotowy do wdrożenia, mimo pozornego WER=15%.
Ograniczenia badania: Nie badaliśmy wpływu różnicy samych mikrofonów zbierających (kierunkowy vs lavalier), które wpłynęłyby drastycznie na polepszenie jakości surowego audio naturalnego.
Dane osobowe i RODO
Identyfikatory anotatorow (annotator, verified_by) sa pseudonimizowane funkcja SHA-256 z sola per edycja (format anon_<8hex>). Czlonkowie zespolu, ktorzy dobrowolnie zgodzili sie na publikacje nicku, sa na whitelist w corpus_to_hf.py.
Audio naturalne pochodzi z publicznych wideo na licencji CC-BY (mowa publiczna, instruktazowa). Audio syntetyczne (TTS) nie zawiera danych osobowych.
Licencja
cc-by-4.0 - dotyczy audio i transkryptow. Tekst wejsciowy do TTS jest wlasnoscia zespolu i publikowany pod ta sama licencja.
Cytowanie
@misc{dwesui_grupa_2_kulinarna,
title = {G2-Polish-Culinary-ASR-Evaluation-Corpus},
author = {Zespol 2, Warsztaty ASR UAM WMI 2026},
year = {2026},
url = {https://huggingface.co/datasets/s479246/dwesui-grupa-2-kulinarna},
}Szkielet dataset card wygenerowany z raportu koncowego przez `publishtohf.py`.
