datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
Emilia-dataset-french-with-gender
Dataset Card for Dataset Name
This dataset card aims to be a base template for new datasets. It has been generated using this raw template.
Dataset Details
Dataset Description
Curated by: [More Information Needed]
Funded by [optional]: [More Information Needed]
Shared by [optional]: [More Information Needed]
Language(s) (NLP): [More Information Needed]
License: [More Information Needed]
Dataset Sources [optional]
Repository: [More… See the full description on the dataset page: https://huggingface.co/datasets/AdrienB134/Emilia-dataset-french-with-gender.french_tv_media_dataset_2026
Dataset Card : A Multi-Domain Pseudo-Labeled ASR Corpus
Résumé (Abstract)
Ce corpus présente un jeu de données de reconnaissance automatique de la parole (ASR) en langue française, totalisant 97 heures d'audio annoté. Il est dérivé de flux de diffusion (broadcast) issus de France Télévisions, couvrant une diversité de domaines acoustiques et linguistiques (Information, Société, Divertissement, Documentaire, Sport). L'annotation a été réalisée via une méthodologie… See the full description on the dataset page: https://huggingface.co/datasets/Archime/french_tv_media_dataset_2026.french_tv_media_dataset_2026
Dataset Card : A Multi-Domain Pseudo-Labeled ASR Corpus
Résumé (Abstract)
Ce corpus présente un jeu de données de reconnaissance automatique de la parole (ASR) en langue française, totalisant 97 heures d'audio annoté. Il est dérivé de flux de diffusion (broadcast) issus de France Télévisions, couvrant une diversité de domaines acoustiques et linguistiques (Information, Société, Divertissement, Documentaire, Sport). L'annotation a été réalisée via une méthodologie… See the full description on the dataset page: https://huggingface.co/datasets/madoss/french_tv_media_dataset_2026.French_Call_Center_Audio_Dataset_Dual_ChannelDataset Description:
This dataset is a large-scale collection of 31,106 hours of processed French (FR) dual-channel call center audio recordings, containing 3,569,083 hours of processed call center audio recordings across 54 languages, designed to support the development and training of advanced speech AI and conversational AI systems.
It consists of real-world customer and agent speech recordings collected from call center environments. The dataset is organized in a dual-channel format, where… See the full description on the dataset page: https://huggingface.co/datasets/InfoBayAI/French_Call_Center_Audio_Dataset_Dual_Channel.French-Speech-Dataset
🎧 French Speech Dataset
The French Speech Dataset is a comprehensive speech audio dataset designed to deliver high-quality and diverse audio data for advanced AI and machine learning applications. It includes 198 hours of audio data across 912 files, provided in MP3 and WAV formats, with a total size of 445 MB. This well-structured audio dataset ensures balanced and representative voice data, with 51% female and 49% male speakers, and a wide age distribution from 18 to 50+ years.… See the full description on the dataset page: https://huggingface.co/datasets/Speech-data/French-Speech-Dataset.French-Call-Center-Audio-Dataset-Single-ChannelDataset Description:
This dataset is a large-scale collection of 31,106 hours of processed French (FR) single-channel call center audio recordings, containing 3,569,083 hours of processed call center audio recordings across 54 languages, designed to support the development and training of advanced speech AI and conversational AI systems.
The dataset captures authentic speech characteristics such as tone variation, pauses, silence patterns, and natural speaking behaviour commonly observed in… See the full description on the dataset page: https://huggingface.co/datasets/InfoBayAI/French-Call-Center-Audio-Dataset-Single-Channel.french-speech-recognition-dataset
French Speech Dataset for recognition task
Dataset comprises 547 hours of telephone dialogues in French, collected from 964 native speakers across various topics and domains, with an impressive 98% Word Accuracy Rate. It is designed for research in speech recognition, focusing on various recognition models, primarily aimed at meeting the requirements for automatic speech recognition (ASR) systems.
By utilizing this dataset, researchers and developers can advance their… See the full description on the dataset page: https://huggingface.co/datasets/UniDataPro/french-speech-recognition-dataset.french-speech-recognition-dataset
French Telephone Dialogues Dataset - 547 Hours
his speech recognition dataset comprises 547 hours of telephone dialogues in French from 964 native speakers, providing audio recordings with detailed annotations (text, speaker ID, gender, age) to support speech recognition systems, natural language processing, and deep learning models for training and evaluating automatic speech recognition technology. - Get the data
Dataset characteristics:
Characteristic
Data… See the full description on the dataset page: https://huggingface.co/datasets/ud-nlp/french-speech-recognition-dataset.espnet_yodas2Ce répertoire est vide, il a été créé pour améliorer le référencement du jeu de données espnet/yodas2.
espnet_yodasCe répertoire est vide, il a été créé pour améliorer le référencement du jeu de données espnet/yodas.
espnet_ml_superb_hfCe répertoire est vide, il a été créé pour améliorer le référencement du jeu de données espnet/ml_superb_hf.
sdialog_voices-kokoroCe répertoire est vide, il a été créé pour améliorer le référencement du jeu de données sdialog/voices-kokoro.
FILALIHicham_CommonVoice-whisper-processed-newCe répertoire est vide, il a été créé pour améliorer le référencement du jeu de données FILALIHicham/CommonVoice-whisper-processed-new.
beryamosta_french_audio_dataset_1Ce répertoire est vide, il a été créé pour améliorer le référencement du jeu de données beryamosta/french_audio_dataset_1.
BrunoHays_multilingual_librispeech_frenchCe répertoire est vide, il a été créé pour améliorer le référencement du jeu de données BrunoHays/multilingual_librispeech_french.
StormblessedKal_Emma-FrenchCe répertoire est vide, il a été créé pour améliorer le référencement du jeu de données StormblessedKal/Emma-French.
AdoCleanCode_french-multi-mfa_train_v1_previewCe répertoire est vide, il a été créé pour améliorer le référencement du jeu de données AdoCleanCode/french-multi-mfa_train_v1_preview .
Unique007_french_phone_1421_samples_16khzCe répertoire est vide, il a été créé pour améliorer le référencement du jeu de données Unique007/french_phone_1421_samples_16khz.
mih12345_may_30_frenchCe répertoire est vide, il a été créé pour améliorer le référencement du jeu de données mih12345/may_30_french.
FILALIHicham_LibriSpeech-whisper-processed-newCe répertoire est vide, il a été créé pour améliorer le référencement du jeu de données FILALIHicham/LibriSpeech-whisper-processed-new.
ayush-shunyalabs_french-speech-datasetCe répertoire est vide, il a été créé pour améliorer le référencement du jeu de données ayush-shunyalabs/french-speech-dataset.
ud-nlp_french-speech-recognition-datasetCe répertoire est vide, il a été créé pour améliorer le référencement du jeu de données ud-nlp/french-speech-recognition-dataset.
AdoCleanCode_french-multi-mfa_TRAIN_V0Ce répertoire est vide, il a été créé pour améliorer le référencement du jeu de données AdoCleanCode/french-multi-mfa_TRAIN_V0.
Unique007_french_phone_16khzCe répertoire est vide, il a été créé pour améliorer le référencement du jeu de données Unique007/french_phone_16khz.
FILALIHicham_Ofrom-whisper-processed-newCe répertoire est vide, il a été créé pour améliorer le référencement du jeu de données FILALIHicham/Ofrom-whisper-processed-new.
rishabbahal_quebecois_canadian_french_datasetCe répertoire est vide, il a été créé pour améliorer le référencement du jeu de données rishabbahal/quebecois_canadian_french_dataset.
AdoCleanCode_french-multi-mfaCe répertoire est vide, il a été créé pour améliorer le référencement du jeu de données AdoCleanCode/french-multi-mfa.
AdoCleanCode_french-multi-mfa_train_v1Ce répertoire est vide, il a été créé pour améliorer le référencement du jeu de données AdoCleanCode/french-multi-mfa_train_v1.
FILALIHicham_PraxyMedicalSynthetic-whisper-processed-newCe répertoire est vide, il a été créé pour améliorer le référencement du jeu de données FILALIHicham/PraxyMedicalSynthetic-whisper-processed-new.
FILALIHicham_TedX-whisper-processed-newCe répertoire est vide, il a été créé pour améliorer le référencement du jeu de données FILALIHicham/TedX-whisper-processed-new.
