CoolFace
Datasetpublic

ggfox00000/stt-vibravox-fr-test

VibraVox FR — test split (mirror of Cnam-LMSSC/vibravox) Mirror public des splits test de VibraVox (CNAM-LMSSC, Paris) pour benchmark ASR français multi-capteur sur audio standard ET non-standard (bone-conduction, in-ear, throat, accéléromètre). Ce repo contient uniquement les configs speech_clean + speech_noisy (les seules avec transcription). Les configs speechless_* upstream sont exclues car sans texte → pas de WER possible. Configs Config Test rows… See the full description on the dataset page: https://huggingface.co/datasets/ggfox00000/stt-vibravox-fr-test.

sourceHugging Facecc-by-4.0updated 5mo agoView on Hugging Face
0likes361downloads
Dataset Card

VibraVox FR — test split (mirror of Cnam-LMSSC/vibravox)

Mirror public des splits `test` de VibraVox (CNAM-LMSSC, Paris) pour benchmark ASR français multi-capteur sur audio standard ET non-standard (bone-conduction, in-ear, throat, accéléromètre).

Ce repo contient uniquement les configs `speech_clean` + `speech_noisy` (les seules avec transcription). Les configs speechless_* upstream sont exclues car sans texte → pas de WER possible.

Configs

ConfigTest rowsTest sizeDomaine
speech_clean3 064 utt~14.36 GBPhrases lues en environnement studio calme
speech_noisy175 utt~0.86 GBPhrases lues en environnement bruité

Total mirror : ~15.22 GB, 3 239 utterances.

Schéma (identique pour les 2 configs)

Chaque row contient 6 captures audio synchronisées du MÊME locuteur prononçant la MÊME phrase, sur 6 capteurs simultanés :

ColonneTypeDescription
audio.headset_microphoneAudioCasque studio = canal référence ASR
audio.forehead_accelerometerAudioAccéléromètre front (bone conduction)
audio.soft_in_ear_microphoneAudioMicro intra-auriculaire souple
audio.rigid_in_ear_microphoneAudioMicro intra-auriculaire rigide
audio.temple_vibration_pickupAudioCapteur vibration tempe
audio.throat_microphoneAudioMicro de gorge
genderstringM / F
speaker_idstringidentifiant locuteur
sentence_idint64id phrase (mêmes phrases répétées entre locuteurs)
durationfloat64durée en secondes
raw_textstringtexte brut
normalized_textstringtexte normalisé (référence WER)
phonemized_textstringtranscription phonétique

Utilisation

Chargement

python
from datasets import load_dataset

# clean
ds_clean = load_dataset("ggfox00000/stt-vibravox-fr-test", "speech_clean", split="test")
# noisy
ds_noisy = load_dataset("ggfox00000/stt-vibravox-fr-test", "speech_noisy", split="test")

sample = ds_clean[0]
print(sample["normalized_text"])
# canal référence pour ASR :
print(sample["audio.headset_microphone"]["sampling_rate"],
      sample["audio.headset_microphone"]["array"].shape)
# canal alternatif (bone conduction) :
print(sample["audio.throat_microphone"]["array"].shape)

Bench ASR multi-capteur

Le canal audio.headset_microphone est la baseline standard (équivalent d'un micro casque studio). Les 5 autres canaux sont des captures alternatives (bone conduction / vibration / in-ear) — utiles pour mesurer la robustesse de Whisper / Canary à de l'audio "non standard".

Pour un bench WER classique, comparer la sortie ASR sur headset_microphone au champ normalized_text.

Pré-traitement

Aucun. Les 32 parquets test (30 speechclean + 2 speechnoisy) sont transférés bit-à-bit depuis Cnam-LMSSC/vibravox. Aucun resampling, aucun ré-encodage. Audio upstream : 48 kHz mono PCM par canal.

Source

  • —Dataset upstream : https://huggingface.co/datasets/Cnam-LMSSC/vibravox
  • —Lab : CNAM-LMSSC (Conservatoire National des Arts et Métiers — Laboratoire de Mécanique des Structures et des Systèmes Couplés), Paris
  • —Project page : https://vibravox.cnam.fr

Licence

CC-BY-4.0 (héritée de VibraVox upstream). Toute redistribution doit créditer le CNAM-LMSSC.

Citation

bibtex
@misc{vibravox2024,
  title  = {{Vibravox: A Dataset of French Speech Captured with Body-conduction
            Audio Sensors}},
  author = {{Hauret, Julien and others}},
  year   = {2024},
  publisher = {Hugging Face},
  url    = {https://huggingface.co/datasets/Cnam-LMSSC/vibravox},
}