multi-word
distilbert-base-multilingual-cased-sindhi-wordpiecellasa_stage3_trained_multilingual_v11_words_th_pt_tu_rubert-base-multilingual-cased-sindhi-wordpieceomnivoice-word-controlbert_tokenizer_updated_multilingual_wordsbartpho-word-base-ed-multi-v2bartpho-word-base-ed-multi-v3llasa_stage3_trained_multilingual_v11_words_pl2
SPEEED_s3_words_multi_0-200000
Multilingual Audio Alignments - Processed (Mixed Text/Phonemes)
This dataset contains processed audio alignments from AAdonis/multilingual_audio_alignments (english).
Curriculum Learning
This dataset uses mixed text/phoneme conditioning with a curriculum learning schedule:
p_start: 0.0 (starting probability of using phonemes)
p_end: 0.0 (ending probability of using phonemes)
curriculum_rows: 400000 (rows over which probability increases)
Early in the dataset, more words… See the full description on the dataset page: https://huggingface.co/datasets/AdoCleanCode/SPEEED_s3_words_multi_0-200000.SPEEED_s3_words_fr_ger_jpn_spa_multi
