CoolFace
Modelpublic

anak10thn/jalak-vits-multispeaker-slr44

sourceHugging Facecc-by-sa-4.0updated 3mo agoView on Hugging Face
0likes40downloads
12 commits on main
080d8cb3mo ago

FIX: use g2p-id (Wikidepia, the ORIGINAL dataset phonemizer) instead of espeak-id. Output has ʔ + per-word stress matching training data. 25.3s sample.

anak10thn
bb85b803mo ago

Add diagnostic samples: pretrained vs finetuned, IPA-asli vs espeak-id

anak10thn
e310dcf3mo ago

Add diagnostic samples: pretrained vs finetuned, IPA-asli vs espeak-id

anak10thn
2114c633mo ago

Add diagnostic samples: pretrained vs finetuned, IPA-asli vs espeak-id

anak10thn
7c7e7e23mo ago

Add diagnostic samples: pretrained vs finetuned, IPA-asli vs espeak-id

anak10thn
d36266b3mo ago

Add diagnostic samples: pretrained vs finetuned, IPA-asli vs espeak-id

anak10thn
bb801393mo ago

Add diagnostic samples: pretrained vs finetuned, IPA-asli vs espeak-id

anak10thn
b30eb1b3mo ago

Add diagnostic: generate from dataset-native IPA vs espeak-id (phonemizer mismatch test)

anak10thn
9658b1d3mo ago

Add diagnostic: generate from dataset-native IPA vs espeak-id (phonemizer mismatch test)

anak10thn
87cce793mo ago

Add long audio sample (42.5s, speaker wibowo)

anak10thn
cc4d6123mo ago

Add jalak VITS finetuned model (124 spk, +SLR44 Sundanese, eval_mel=21.19)

anak10thn
4850b893mo ago

initial commit

anak10thn