ggfox00000/stt-cefc-fr-test
CEFC-Orfeo FR — long-form oral test mirror Mirror non-officiel du Corpus d'Études du Français Contemporain (CEFC) agrégé par le projet Orfeo (ANR), tel que distribué sur le portail projet-orfeo.fr (release 13). Long-form : 1 row = 1 fichier audio entier (30-60 min en moyenne). 12 sous-corpus oraux du français contemporain, 303 heures au total, 901 fichiers. Idéal pour bench Whisper / Canary en conditions réelles (chunked decoding, dérive temporelle, multi-locuteurs).… See the full description on the dataset page: https://huggingface.co/datasets/ggfox00000/stt-cefc-fr-test.
CEFC-Orfeo FR — long-form oral test mirror
Mirror non-officiel du Corpus d'Études du Français Contemporain (CEFC) agrégé par le projet Orfeo (ANR), tel que distribué sur le portail projet-orfeo.fr (release 13).
Long-form : 1 row = 1 fichier audio entier (30-60 min en moyenne). 12 sous-corpus oraux du français contemporain, 303 heures au total, 901 fichiers. Idéal pour bench Whisper / Canary en conditions réelles (chunked decoding, dérive temporelle, multi-locuteurs).
Sous-corpus inclus (colonne subcorpus)
→ Permet analyses de robustesse par variété (régionale, native vs L2, formelle vs spontanée, dyadique vs multi-locuteurs).
Schéma
Pré-traitement
- Audio source : WAV mono 22050 Hz PCM_16 (upstream Orfeo).
- Resampling 22050 → 16 000 Hz via
soxr.resample(quality="HQ"). Filtre anti-aliasing polyphase de qualité studio. La bande 8-11 kHz coupée est inaudible et hors de la bande utile pour ASR (Whisper/wav2vec2 tournent nativement à 16 kHz, downsampleraient en interne quand même). - Encodage FLAC PCM_16 mono via
soundfile. - Pas de découpage — fichiers longs préservés entiers.
- Annotations : parsées depuis
.orfeo(format CoNLL-U étendu Orfeo, voir guide segmentation projet-orfeo.fr) : - chaque phrase
# sent_id+# text→ 1 segment start = min(BTIMESTAMP),end = max(ETIMESTAMP)des tokens de la phrasespeaker_id= locuteur majoritaire (col 13 du .orfeo)
Exemple de chargement
from datasets import load_dataset
ds = load_dataset("ggfox00000/stt-cefc-fr-test", split="test")
print(len(ds), "files")
# Filtrer par sous-corpus
cfpp = ds.filter(lambda r: r["subcorpus"] == "cfpp")
print(len(cfpp), "files dans CFPP (Paris parlé)")
sample = ds[0]
print(sample["audio_id"], sample["subcorpus"],
sample["duration_sec"]/60, "min,",
sample["n_segments"], "segments,",
sample["n_speakers"], "speakers")
print("First segment:", sample["segments"][0])Source
- Projet : Orfeo (ANR-12-CORP-0005)
- Distribution :
cefc-orfeorelease 13 - Documentation :
documentation/guide_segmentation_orfeo.pdf,guide_pos_orfeo.pdf,guide_dependance_orfeo.pdf - Liste des corpus source : http://www.projet-orfeo.fr/corpus-source/
Licence
License héritée des sous-corpus source (variable, généralement académique non-commerciale) — voir le projet Orfeo et chaque sous-corpus pour les détails. Usage non-commercial recommandé. Redistribution technique (resampling 22k→16k + FLAC) sans modification des transcriptions.
Citation
@misc{cefc-orfeo,
title = {Corpus d'\\'Etudes du Fran\\c{c}ais Contemporain},
author = {Projet Orfeo (ANR)},
url = {http://www.projet-orfeo.fr},
}