CoolFace
Datasetpublic

madoss/french_tv_media_dataset_2026

Dataset Card : A Multi-Domain Pseudo-Labeled ASR Corpus Résumé (Abstract) Ce corpus présente un jeu de données de reconnaissance automatique de la parole (ASR) en langue française, totalisant 97 heures d'audio annoté. Il est dérivé de flux de diffusion (broadcast) issus de France Télévisions, couvrant une diversité de domaines acoustiques et linguistiques (Information, Société, Divertissement, Documentaire, Sport). L'annotation a été réalisée via une méthodologie… See the full description on the dataset page: https://huggingface.co/datasets/madoss/french_tv_media_dataset_2026.

sourceHugging Facecc-by-4.0updated 2mo agoView on Hugging Face
1likes281downloads
1 commits on main
1a5ce692mo ago

Duplicate from Archime/french_tv_media_dataset_2026

madoss, Archime