CoolFace
Datasetpublic

uam-wmi-asr-eval-labs/2026-zwesui-g05-ai-talk-probka

ZWESUI 2026 - Grupa 5 - rozmowy o IT/AI - probka Publiczna próbka ilustrująca domenę zbioru testowego ASR zbudowanego przez Grupę 5 (ZWESUI 2026) w ramach przedmiotu Warsztaty z ewaluacji systemów rozpoznawania mowy (UAM WMI). Pełny zbiór jest utrzymywany jako held-out w organizacji uam-wmi-asr-eval-labs — dostęp na prośbę (HF @michaljunczyk, micjun@amu.edu.pl). Pełny zbiór (held-out, prywatny): uam-wmi-asr-eval-labs/2026-zwesui-g05-ai-talk Oryginał zespołu:… See the full description on the dataset page: https://huggingface.co/datasets/uam-wmi-asr-eval-labs/2026-zwesui-g05-ai-talk-probka.

sourceHugging Faceotherupdated 1mo agoView on Hugging Face
0likes16downloads
Dataset Card

ZWESUI 2026 - Grupa 5 - rozmowy o IT/AI - probka

Publiczna próbka ilustrująca domenę zbioru testowego ASR zbudowanego przez Grupę 5 (ZWESUI 2026) w ramach przedmiotu Warsztaty z ewaluacji systemów rozpoznawania mowy (UAM WMI). Pełny zbiór jest utrzymywany jako held-out w organizacji `uam-wmi-asr-eval-labs` — dostęp na prośbę (HF @michaljunczyk, micjun@amu.edu.pl).

  • —Pełny zbiór (held-out, prywatny): uam-wmi-asr-eval-labs/2026-zwesui-g05-ai-talk
  • —Oryginał zespołu: `slapekm/zwesui-grupa-5-it-ai` (gated, dostęp po prośbie; CC BY-NC 4.0)
  • —Domena: ai talk
  • —Próbka: 10 segmentów (4 z audio, 6 tylko tekst + odnośnik do źródła)
  • —Cel próbki: pokazać charakter danych (słownictwo, styl mowy, warunki akustyczne), aby publikowane metryki dało się interpretować bez dostępu do pełnego zbioru. Próbka nie służy do ewaluacji.

Dobór segmentów

Sześć segmentów naturalnych z różnych nagrań (tylko tekst + źródło) oraz cztery segmenty syntetyczne z audio (głosy męskie i żeńskie).

Wybór deterministyczny (ziarno 20260815), równomierny po źródłach/subdomenach, długość segmentu 2,5–15 s. Kolumny annotator/verified_by pominięto; nazwy plików zanonimizowane. Kolumna audio_included mówi, czy wiersz zawiera audio; note wyjaśnia brak audio i wskazuje fragment w źródle.

Licencje

Nagrania naturalne (rozmowy i wykłady o AI z kanału branżowego YouTube) mają standardową licencję YouTube — audio nie jest redystrybuowane; w próbce podano transkrypcję (krótki cytat) i odnośnik do źródła. Segmenty syntetyczne w próbce: TTSMaker (deklaracja zespołu: użycie wolne). Segmenty Edge-TTS/gTTS/„internal" nie są udostępniane.

Wyniki zespołu na pełnym zbiorze

Wartości zgłoszone przez zespół w raporcie końcowym (czerwiec 2026), liczone na pełnym zbiorze własnym protokołem normalizacji zespołu. Nie były niezależnie odtwarzane — niezależna ewaluacja zbiorów held-out planowana jest w ramach BIGOS V3 / Polish ASR Leaderboard V2 (do końca 2026).

SystemWERCERRTFWER — mowa naturalnaWER — synteza (TTS)
Whisper large-v3-turbo9,88%6,17%0,21613,74%2,99%
MMS-1B-all16,54%6,06%0,11623,67%14,08%
wav2vec2-XLSR-53-Polish34,76%11,42%0,05849,79%22,47%

BERTScore F1 (xlm-roberta-base) dla Whisper large-v3-turbo: 0,9878; bootstrap 95% CI WER segmentowego Whisper: [7,09%; 9,68%] (wg raportu).

Schemat

KolumnaOpis
ididentyfikator segmentu w próbce
audioaudio segmentu (WAV, mono) lub null
texttranskrypcja referencyjna zespołu (bez normalizacji)
duration_sdługość segmentu w sekundach
speech_typespontaneous / read
source_typenatural / tts
speaker_genderpłeć mówcy, jeśli oznaczona przez zespół
subdomainpoddziedzina, jeśli oznaczona
tts_enginesilnik syntezy dla source_type=tts
source_urlźródło nagrania
source_licenselicencja źródła (deklaracja zespołu + weryfikacja prowadzącego, gdzie możliwa)
audio_includedczy wiersz zawiera audio
noteuwagi (np. powód braku audio, znacznik czasu w źródle)

Kopia przygotowana przez prowadzącego 2026-08-15. Konwencja nazwy: {rok}-{tryb}-g{NN}-{domena}-probka.