ggfox00000/stt-vibravox-fr-test
VibraVox FR — test split (mirror of Cnam-LMSSC/vibravox) Mirror public des splits test de VibraVox (CNAM-LMSSC, Paris) pour benchmark ASR français multi-capteur sur audio standard ET non-standard (bone-conduction, in-ear, throat, accéléromètre). Ce repo contient uniquement les configs speech_clean + speech_noisy (les seules avec transcription). Les configs speechless_* upstream sont exclues car sans texte → pas de WER possible. Configs Config Test rows… See the full description on the dataset page: https://huggingface.co/datasets/ggfox00000/stt-vibravox-fr-test.
VibraVox FR — test split (mirror of Cnam-LMSSC/vibravox)
Mirror public des splits `test` de VibraVox (CNAM-LMSSC, Paris) pour benchmark ASR français multi-capteur sur audio standard ET non-standard (bone-conduction, in-ear, throat, accéléromètre).
Ce repo contient uniquement les configs `speech_clean` + `speech_noisy` (les seules avec transcription). Les configs speechless_* upstream sont exclues car sans texte → pas de WER possible.Configs
Total mirror : ~15.22 GB, 3 239 utterances.
Schéma (identique pour les 2 configs)
Chaque row contient 6 captures audio synchronisées du MÊME locuteur prononçant la MÊME phrase, sur 6 capteurs simultanés :
Utilisation
Chargement
from datasets import load_dataset
# clean
ds_clean = load_dataset("ggfox00000/stt-vibravox-fr-test", "speech_clean", split="test")
# noisy
ds_noisy = load_dataset("ggfox00000/stt-vibravox-fr-test", "speech_noisy", split="test")
sample = ds_clean[0]
print(sample["normalized_text"])
# canal référence pour ASR :
print(sample["audio.headset_microphone"]["sampling_rate"],
sample["audio.headset_microphone"]["array"].shape)
# canal alternatif (bone conduction) :
print(sample["audio.throat_microphone"]["array"].shape)Bench ASR multi-capteur
Le canal audio.headset_microphone est la baseline standard (équivalent d'un micro casque studio). Les 5 autres canaux sont des captures alternatives (bone conduction / vibration / in-ear) — utiles pour mesurer la robustesse de Whisper / Canary à de l'audio "non standard".
Pour un bench WER classique, comparer la sortie ASR sur headset_microphone au champ normalized_text.
Pré-traitement
Aucun. Les 32 parquets test (30 speechclean + 2 speechnoisy) sont transférés bit-à-bit depuis Cnam-LMSSC/vibravox. Aucun resampling, aucun ré-encodage. Audio upstream : 48 kHz mono PCM par canal.
Source
- Dataset upstream : https://huggingface.co/datasets/Cnam-LMSSC/vibravox
- Lab : CNAM-LMSSC (Conservatoire National des Arts et Métiers — Laboratoire de Mécanique des Structures et des Systèmes Couplés), Paris
- Project page : https://vibravox.cnam.fr
Licence
CC-BY-4.0 (héritée de VibraVox upstream). Toute redistribution doit créditer le CNAM-LMSSC.
Citation
@misc{vibravox2024,
title = {{Vibravox: A Dataset of French Speech Captured with Body-conduction
Audio Sensors}},
author = {{Hauret, Julien and others}},
year = {2024},
publisher = {Hugging Face},
url = {https://huggingface.co/datasets/Cnam-LMSSC/vibravox},
}