datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
dwesui-grupa-1-neurologia
NeuroSpeechPL
Publiczny eksport HuggingFace zawiera wyłącznie redystrybuowalne audio source=natural. Wiersze TTS są celowo wyłączone z publicznego zbioru danych, ponieważ ich source_license zabrania redystrybucji audio. Pełna lokalna ewaluacja opisana w raporcie korzystała zarówno z nagrań naturalnych, jak i TTS.
Repozytorium zbioru danych HF: https://huggingface.co/datasets/JankesTNJ/dwesui-grupa-1-neurologia
Repozytorium kodu:… See the full description on the dataset page: https://huggingface.co/datasets/JankesTNJ/dwesui-grupa-1-neurologia.grug-think-clonedwesui-grupa-2-kulinarna
G2-Polish-Culinary-ASR-Evaluation-Corpus
Korpus do ewaluacji systemow ASR jezyka polskiego (domena kulinarna) stworzony
w ramach warsztatow Ewaluacja Systemow Rozpoznawania Mowy (UAM WMI, edycja 2026,
zespol 2). Publikowany podzbior to mowa naturalna z wideo kulinarnych YouTube
(licencja CC-BY) - sluzy do badania odpornosci ASR na szum kuchenny oraz dopasowania
domenowego do specjalistycznego slownictwa (zapozyczenia, miary, liczby).
Pelny eksperyment ewaluacyjny zespolu… See the full description on the dataset page: https://huggingface.co/datasets/s479246/dwesui-grupa-2-kulinarna.instagram-scraperdemozwesui-grupa-5-it-ai
Wykorzystanie ASR do transkrypcji polskich nagrań o tematyce AI
Korpus do ewaluacji systemów ASR języka polskiego stworzony w ramach warsztatów
Ewaluacja Systemów Rozpoznawania Mowy (UAM WMI, edycja 2026, zespół 5).
Zbiór powstał jako część kursu - publikujemy go publicznie, żeby inni badacze
polskiego ASR mogli z niego korzystać i porównywać wyniki na wspólnym benchmarku.
Cel i pytania badawcze
Cel główny:
Porównanie jakości 3 systemów ASR dla spontanicznej… See the full description on the dataset page: https://huggingface.co/datasets/slapekm/zwesui-grupa-5-it-ai.grupo_public_databsi_grundschutzivan-bunin-grugan-uladzimir-ragautsou
Груган
Metadata
Author: Іван Бунін
Title: Груган
Narrator: Уладзімір Рагаўцоў
Source Group: Аўдыёкнігі
Source: БЛР#аўдыякніга
Notes
The original audio files are preserved as-is:
no conversion;
no re-encoding;
no filename changes inside each split folder, except removing one common top-level archive folder when present.
To avoid Hugging Face Dataset Viewer scan-size errors, the dataset is split into smaller folders.
Target maximum split size:… See the full description on the dataset page: https://huggingface.co/datasets/archivartaunik/ivan-bunin-grugan-uladzimir-ragautsou.grupinggrundschutz-dataset
IT-Grundschutz Dataset
Training data for IT-Grundschutz fine-tuning.
gruppo-citrigno-faq-diagnostica
Gruppo Citrigno - FAQ Diagnostica
Questo dataset contiene un insieme di domande frequenti e relative risposte brevi riguardanti i servizi diagnostici offerti dai Centri del Gruppo Citrigno.
Contenuto
Il file CSV include:
Domande frequenti
Risposte sintetiche e strutturate
Formattazione ottimizzata per modelli LLM (domanda/risposta atomica)
Obiettivo
Fornire un dataset leggibile e utilizzabile da modelli linguistici per:
Apprendimento supervisionato… See the full description on the dataset page: https://huggingface.co/datasets/Citrigno/gruppo-citrigno-faq-diagnostica.
