ggfox00000/dia-simsamu-test-fr
Simsamu — French diarization (mirror) Mirror byte-exact du dataset diarizers-community/simsamu (HF Inria / Eole), réutilisé tel quel comme dataset de bench DIA français pour STTSTAGE. Contenu 61 enregistrements audio 3h 15 min au total (~3 min 11 s par enregistrement) 16 kHz mono 2 locuteurs par enregistrement (médecin régulateur + appelant simulé) Langue : français (fr), domaine : régulation médicale / téléphonique simulée Licence : MIT (héritée upstream)… See the full description on the dataset page: https://huggingface.co/datasets/ggfox00000/dia-simsamu-test-fr.
017
Simsamu — French diarization (mirror)
Mirror byte-exact du dataset `diarizers-community/simsamu` (HF Inria / Eole), réutilisé tel quel comme dataset de bench DIA français pour STTSTAGE.
Contenu
- 61 enregistrements audio
- 3h 15 min au total (~3 min 11 s par enregistrement)
- 16 kHz mono
- 2 locuteurs par enregistrement (médecin régulateur + appelant simulé)
- Langue : français (fr), domaine : régulation médicale / téléphonique simulée
- Licence : MIT (héritée upstream)
Schéma (format diarizers natif)
Usage côté STTSTAGE
- Bench DIA : conversion
(timestamps + speakers) → RTTMà la volée dansensure_data.load_dataset(), puis run via la pipelinepyannote/speaker-diarization-3.1. - Fine-tune : compatible directement avec
huggingface/diarizers(scripttrain_segmentation.py) pour fine-tunerpyannote/segmentation-3.0en FR.
Source upstream
- Repo : https://huggingface.co/datasets/diarizers-community/simsamu
- License : MIT
- Contexte : entraînement de jeunes urgentistes (simulation appel SAMU)
