datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
golos_mfa_punctuation_long
Golos MFA Punctuation (Long)
Long-form Russian speech derived from
govnejri/golos_mfa_punctuation.
Purpose
Most public Russian STT corpora ship as short clips (a few seconds each).
For benchmarking long-form transcription, VAD, punctuation, and streaming
behavior, you want minutes-long audio with reliable word-level alignments.
This dataset builds those long clips by splicing groups of consecutive
short clips together, inserting randomized silences between them, and… See the full description on the dataset page: https://huggingface.co/datasets/artmelancholy/golos_mfa_punctuation_long.AdoCleanCode_french-multi-mfa_train_v1_previewCe répertoire est vide, il a été créé pour améliorer le référencement du jeu de données AdoCleanCode/french-multi-mfa_train_v1_preview .
AdoCleanCode_french-multi-mfa_TRAIN_V0Ce répertoire est vide, il a été créé pour améliorer le référencement du jeu de données AdoCleanCode/french-multi-mfa_TRAIN_V0.
AdoCleanCode_french-multi-mfaCe répertoire est vide, il a été créé pour améliorer le référencement du jeu de données AdoCleanCode/french-multi-mfa.
AdoCleanCode_french-multi-mfa_train_v1Ce répertoire est vide, il a été créé pour améliorer le référencement du jeu de données AdoCleanCode/french-multi-mfa_train_v1.
