cefc
Datasets
All datasets matching “cefc”stt-cefc-fr-test
CEFC-Orfeo FR — long-form oral test mirror
Mirror non-officiel du Corpus d'Études du Français Contemporain (CEFC)
agrégé par le projet Orfeo (ANR), tel que distribué sur le portail
projet-orfeo.fr (release 13).
Long-form : 1 row = 1 fichier audio entier (30-60 min en moyenne).
12 sous-corpus oraux du français contemporain, 303 heures au total,
901 fichiers. Idéal pour bench Whisper / Canary en conditions réelles
(chunked decoding, dérive temporelle, multi-locuteurs).… See the full description on the dataset page: https://huggingface.co/datasets/ggfox00000/stt-cefc-fr-test.CEFC-ORFEO
[!NOTE]
Dataset origin: https://www.ortolang.fr/market/corpora/cefc-orfeo/
Description
Le Corpus d'Etude pour le Français Contemporain (C.E.F.C.) est le résultat du projet Orféo (Outils et Recherches sur le Français Écrit et Oral).
Il comporte 10 millions de mots :
Un corpus Oral de 4 millions de mots constitué à partir de 14 corpus sources contenant les transcriptions alignées texte/parole. Le corpus rassemble sur un seul site et sous un seul format des données enregistrées… See the full description on the dataset page: https://huggingface.co/datasets/datasets-CNRS/CEFC-ORFEO.orfeo-cefc-frautoeval-staging-eval-project-a0b7f8d6-f4e4-45b3-a9ae-cefcb10962b0-128122
Dataset Card for AutoTrain Evaluator
This repository contains model predictions generated by AutoTrain for the following task and dataset:
Task: Summarization
Model: autoevaluate/summarization-not-evaluated
Dataset: autoevaluate/xsum-sample
Config: autoevaluate--xsum-sample
Split: test
To run new evaluation jobs, visit Hugging Face's automatic model evaluator.
Contributions
Thanks to @lewtun for evaluating this model.
CEFC-GOLD
[!NOTE]
Dataset origin: https://www.ortolang.fr/market/corpora/cefc-gold
[!WARNING]
Vous devez vous rendre sur le site d'Ortholang et vous connecter afin de télécharger les données.
Description
Une nouvelle version est en préparation. Dans l'attente de cette version les données ne sont pas accessibles.
Le CEFC-Gold est un corpus d'entraînement de 172 000 mots constitué à partir d'extraits représentants l'essentiel des genres présents dans le CEFC.
Il a fait l'objet d'un… See the full description on the dataset page: https://huggingface.co/datasets/datasets-CNRS/CEFC-GOLD.
