CoolFace
Datasetpublic

ggfox00000/stt-cefc-fr-test

CEFC-Orfeo FR — long-form oral test mirror Mirror non-officiel du Corpus d'Études du Français Contemporain (CEFC) agrégé par le projet Orfeo (ANR), tel que distribué sur le portail projet-orfeo.fr (release 13). Long-form : 1 row = 1 fichier audio entier (30-60 min en moyenne). 12 sous-corpus oraux du français contemporain, 303 heures au total, 901 fichiers. Idéal pour bench Whisper / Canary en conditions réelles (chunked decoding, dérive temporelle, multi-locuteurs).… See the full description on the dataset page: https://huggingface.co/datasets/ggfox00000/stt-cefc-fr-test.

sourceHugging Faceotherupdated 5mo agoView on Hugging Face
0likes97downloads
Dataset Card

CEFC-Orfeo FR — long-form oral test mirror

Mirror non-officiel du Corpus d'Études du Français Contemporain (CEFC) agrégé par le projet Orfeo (ANR), tel que distribué sur le portail projet-orfeo.fr (release 13).

Long-form : 1 row = 1 fichier audio entier (30-60 min en moyenne). 12 sous-corpus oraux du français contemporain, 303 heures au total, 901 fichiers. Idéal pour bench Whisper / Canary en conditions réelles (chunked decoding, dérive temporelle, multi-locuteurs).

Sous-corpus inclus (colonne subcorpus)

Sous-corpusGenreOrigine
cfpbParlement BruxellesCFPB
cfppParis parléCFPP2000
clapiInteractions LyonCLAPI
coralromRoman européen FRC-ORAL-ROM
crfpRéférence FR parléCRFP
fleuronÉtudiants en mobilitéFLEURON
frenchoralnarrativeRécits orauxFrenchOralNarrative
ofromOral fribourgeois (Suisse)OFROM
reunions-de-travailRéunions pro—
tcofFamilial / enfantsTCOF
tufsApprenants étrangers FRTUFS
valibelFR BelgiqueVALIBEL

→ Permet analyses de robustesse par variété (régionale, native vs L2, formelle vs spontanée, dyadique vs multi-locuteurs).

Schéma

ChampTypeDescription
audio_idstring<subcorpus>/<basename> (ex: cfpb/CFPB-1000-5)
subcorpusstringUne des 12 valeurs ci-dessus
audioAudioFLAC 16 kHz mono PCM_16 (resamplé depuis 22050 Hz)
duration_secfloat64Durée en secondes
transcriptstringConcat de toutes les phrases (# text Orfeo, ordre temporel)
n_segmentsint32Nombre de phrases (# sent_id)
n_speakersint32Nombre de locuteurs distincts (col 13 .orfeo)
segmentslist{start, end, text, speaker_id} par phrase

Pré-traitement

  • —Audio source : WAV mono 22050 Hz PCM_16 (upstream Orfeo).
  • —Resampling 22050 → 16 000 Hz via soxr.resample(quality="HQ"). Filtre anti-aliasing polyphase de qualité studio. La bande 8-11 kHz coupée est inaudible et hors de la bande utile pour ASR (Whisper/wav2vec2 tournent nativement à 16 kHz, downsampleraient en interne quand même).
  • —Encodage FLAC PCM_16 mono via soundfile.
  • —Pas de découpage — fichiers longs préservés entiers.
  • —Annotations : parsées depuis .orfeo (format CoNLL-U étendu Orfeo, voir guide segmentation projet-orfeo.fr) :
  • —chaque phrase # sent_id + # text → 1 segment
  • —start = min(BTIMESTAMP), end = max(ETIMESTAMP) des tokens de la phrase
  • —speaker_id = locuteur majoritaire (col 13 du .orfeo)

Exemple de chargement

python
from datasets import load_dataset
ds = load_dataset("ggfox00000/stt-cefc-fr-test", split="test")
print(len(ds), "files")

# Filtrer par sous-corpus
cfpp = ds.filter(lambda r: r["subcorpus"] == "cfpp")
print(len(cfpp), "files dans CFPP (Paris parlé)")

sample = ds[0]
print(sample["audio_id"], sample["subcorpus"],
      sample["duration_sec"]/60, "min,",
      sample["n_segments"], "segments,",
      sample["n_speakers"], "speakers")
print("First segment:", sample["segments"][0])

Source

  • —Projet : Orfeo (ANR-12-CORP-0005)
  • —Distribution : cefc-orfeo release 13
  • —Documentation : documentation/guide_segmentation_orfeo.pdf, guide_pos_orfeo.pdf, guide_dependance_orfeo.pdf
  • —Liste des corpus source : http://www.projet-orfeo.fr/corpus-source/

Licence

License héritée des sous-corpus source (variable, généralement académique non-commerciale) — voir le projet Orfeo et chaque sous-corpus pour les détails. Usage non-commercial recommandé. Redistribution technique (resampling 22k→16k + FLAC) sans modification des transcriptions.

Citation

bibtex
@misc{cefc-orfeo,
  title  = {Corpus d'\\'Etudes du Fran\\c{c}ais Contemporain},
  author = {Projet Orfeo (ANR)},
  url    = {http://www.projet-orfeo.fr},
}