PraxySante/FR_Drugs_tiret_dictation_augmented
FR_Drugs_tiret_dictation_augmented Dictee de listes de medicaments au format "tiret" (patterns du dataset FR_Drugs_dictation_with_dashes_pattern, molecules completees depuis les sources autocorrect/medical), synthetisee en TTS Coqui XTTS v2 (600 voix clonees) puis augmentee acoustiquement. element valeur extraits 141960 moteur Coqui XTTS v2, 600 voix clonees (16 kHz mono) base audio/coqui/<shard>/ parasite seul (65%) audio_babble_only/ echo seul (25%)… See the full description on the dataset page: https://huggingface.co/datasets/PraxySante/FR_Drugs_tiret_dictation_augmented.
FRDrugstiretdictationaugmented
Dictee de listes de medicaments au format "tiret" (patterns du dataset FR_Drugs_dictation_with_dashes_pattern, molecules completees depuis les sources autocorrect/medical), synthetisee en TTS Coqui XTTS v2 (600 voix clonees) puis augmentee acoustiquement.
metadata.jsonl : audio_filepath, text (transcription de reference), engine, augmentation, pattern, molecule, missing, index.
Echantillons d'ecoute
samples/ : 15 extraits avec leur transcription de reference et les parametres d'augmentation (SIR, DRR, RT60, famille d'echo, parasites utilises) dans samples/samples.json.
