CoolFace
Datasetpublic

ggfox00000/dia-simsamu-test-fr

Simsamu — French diarization (mirror) Mirror byte-exact du dataset diarizers-community/simsamu (HF Inria / Eole), réutilisé tel quel comme dataset de bench DIA français pour STTSTAGE. Contenu 61 enregistrements audio 3h 15 min au total (~3 min 11 s par enregistrement) 16 kHz mono 2 locuteurs par enregistrement (médecin régulateur + appelant simulé) Langue : français (fr), domaine : régulation médicale / téléphonique simulée Licence : MIT (héritée upstream)… See the full description on the dataset page: https://huggingface.co/datasets/ggfox00000/dia-simsamu-test-fr.

sourceHugging Facemitupdated 5mo agoView on Hugging Face
0likes17downloads
Dataset Card

Simsamu — French diarization (mirror)

Mirror byte-exact du dataset `diarizers-community/simsamu` (HF Inria / Eole), réutilisé tel quel comme dataset de bench DIA français pour STTSTAGE.

Contenu

  • —61 enregistrements audio
  • —3h 15 min au total (~3 min 11 s par enregistrement)
  • —16 kHz mono
  • —2 locuteurs par enregistrement (médecin régulateur + appelant simulé)
  • —Langue : français (fr), domaine : régulation médicale / téléphonique simulée
  • —Licence : MIT (héritée upstream)

Schéma (format diarizers natif)

ColonneTypeContenu
audioAudio(16 kHz)dict {path, array, sampling_rate}
timestamps_startSequence[float64]starts segments en secondes
timestamps_endSequence[float64]ends segments en secondes
speakersSequence[string]label speaker par segment

Usage côté STTSTAGE

  • —Bench DIA : conversion (timestamps + speakers) → RTTM à la volée dans ensure_data.load_dataset(), puis run via la pipeline pyannote/speaker-diarization-3.1.
  • —Fine-tune : compatible directement avec huggingface/diarizers (script train_segmentation.py) pour fine-tuner pyannote/segmentation-3.0 en FR.

Source upstream

  • —Repo : https://huggingface.co/datasets/diarizers-community/simsamu
  • —License : MIT
  • —Contexte : entraînement de jeunes urgentistes (simulation appel SAMU)