CoolFace
Datasetpublic

uam-wmi-asr-eval-labs/2026-zwesui-g04-botanika-probka

ZWESUI 2026 - Grupa 4 - botanika - probka Publiczna próbka ilustrująca domenę zbioru testowego ASR zbudowanego przez Grupę 4 (ZWESUI 2026) w ramach przedmiotu Warsztaty z ewaluacji systemów rozpoznawania mowy (UAM WMI). Pełny zbiór jest utrzymywany jako held-out w organizacji uam-wmi-asr-eval-labs — dostęp na prośbę (HF @michaljunczyk, micjun@amu.edu.pl). Pełny zbiór (held-out, prywatny): uam-wmi-asr-eval-labs/2026-zwesui-g04-botanika Oryginał zespołu: mszulcc/grupa-4-ZWESUI0… See the full description on the dataset page: https://huggingface.co/datasets/uam-wmi-asr-eval-labs/2026-zwesui-g04-botanika-probka.

sourceHugging Faceotherupdated 1mo agoView on Hugging Face
0likes14downloads
Dataset Card

ZWESUI 2026 - Grupa 4 - botanika - probka

Publiczna próbka ilustrująca domenę zbioru testowego ASR zbudowanego przez Grupę 4 (ZWESUI 2026) w ramach przedmiotu Warsztaty z ewaluacji systemów rozpoznawania mowy (UAM WMI). Pełny zbiór jest utrzymywany jako held-out w organizacji `uam-wmi-asr-eval-labs` — dostęp na prośbę (HF @michaljunczyk, micjun@amu.edu.pl).

  • —Pełny zbiór (held-out, prywatny): uam-wmi-asr-eval-labs/2026-zwesui-g04-botanika
  • —Oryginał zespołu: `mszulcc/grupa-4-ZWESUI0` (gated, po zalogowaniu)
  • —Domena: botanika
  • —Próbka: 10 segmentów (10 z audio, 0 tylko tekst + odnośnik do źródła)
  • —Cel próbki: pokazać charakter danych (słownictwo, styl mowy, warunki akustyczne), aby publikowane metryki dało się interpretować bez dostępu do pełnego zbioru. Próbka nie służy do ewaluacji.

Dobór segmentów

Sześć segmentów naturalnych z różnych filmów oraz cztery segmenty syntetyczne (KugelAudio).

Wybór deterministyczny (ziarno 20260815), równomierny po źródłach/subdomenach, długość segmentu 2,5–15 s. Kolumny annotator/verified_by pominięto; nazwy plików zanonimizowane. Kolumna audio_included mówi, czy wiersz zawiera audio; note wyjaśnia brak audio i wskazuje fragment w źródle.

Licencje

Nagrania naturalne w próbce pochodzą wyłącznie z filmów YouTube (uprawa roślin, ogrodnictwo), które są oznaczone licencją Creative Commons — Uznanie autorstwa, potwierdzoną przez prowadzącego na stronach filmów 2026-08-15. Segmenty syntetyczne w próbce: KugelAudio-0-Open (MIT). Segmenty Coqui XTTS v2 (licencja niekomercyjna) i filmy bez potwierdzonej licencji nie są udostępniane.

Wyniki zespołu na pełnym zbiorze

Wartości zgłoszone przez zespół w raporcie końcowym (czerwiec 2026), liczone na pełnym zbiorze własnym protokołem normalizacji zespołu. Nie były niezależnie odtwarzane — niezależna ewaluacja zbiorów held-out planowana jest w ramach BIGOS V3 / Polish ASR Leaderboard V2 (do końca 2026).

SystemWERCERRTFWER — mowa spontaniczna (YouTube)WER — synteza (TTS)
Whisper large-v36,5%2,2%0,327,1%3,8%
Cohere Transcribe 2B9,2%3,6%0,1610,2%5,5%
Qwen3-ASR 1.7B12,4%5,1%0,1113,9%7,2%

Schemat

KolumnaOpis
ididentyfikator segmentu w próbce
audioaudio segmentu (WAV, mono) lub null
texttranskrypcja referencyjna zespołu (bez normalizacji)
duration_sdługość segmentu w sekundach
speech_typespontaneous / read
source_typenatural / tts
speaker_genderpłeć mówcy, jeśli oznaczona przez zespół
subdomainpoddziedzina, jeśli oznaczona
tts_enginesilnik syntezy dla source_type=tts
source_urlźródło nagrania
source_licenselicencja źródła (deklaracja zespołu + weryfikacja prowadzącego, gdzie możliwa)
audio_includedczy wiersz zawiera audio
noteuwagi (np. powód braku audio, znacznik czasu w źródle)

Kopia przygotowana przez prowadzącego 2026-08-15. Konwencja nazwy: {rok}-{tryb}-g{NN}-{domena}-probka.