datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
Indic-subtitler-audio_evals
Indic_audio_evals
As part of this project. We are evaluating our performance of various ASR models as well
in a benchmarking dataset, we have created in various languages. This benchmarking dataset
is more alligned to real-world use-cases rather than having any academic datasets.
About Dataset
Dataset Link in HuggingFace: kurianbenoy/Indic-subtitler-audio_evals
This dataset contains audio file in .wav format and video file in .mp4. The respective groundtruth will be… See the full description on the dataset page: https://huggingface.co/datasets/kurianbenoy/Indic-subtitler-audio_evals.eval-stt-officiels
EvalSTT — Corpus officiels (FR)
Corpus public d'évaluation de modèles de transcription (speech-to-text) sur du
langage de l'administration française : discours officiels, allocutions
publiques et questions au gouvernement. Constitué par le département IA dans
l'État (DINUM) dans le cadre de l'évaluation des modèles de speech-to-text.
Ce dataset est publié pour la transparence : il documente les jeux de
données utilisés pour nos évaluations et permet de reproduire les mesures… See the full description on the dataset page: https://huggingface.co/datasets/AgentPublic/eval-stt-officiels.
