anak10thn/jalak-vits-multispeaker-slr44
FIX: use g2p-id (Wikidepia, the ORIGINAL dataset phonemizer) instead of espeak-id. Output has ʔ + per-word stress matching training data. 25.3s sample.
Add diagnostic samples: pretrained vs finetuned, IPA-asli vs espeak-id
Add diagnostic samples: pretrained vs finetuned, IPA-asli vs espeak-id
Add diagnostic samples: pretrained vs finetuned, IPA-asli vs espeak-id
Add diagnostic samples: pretrained vs finetuned, IPA-asli vs espeak-id
Add diagnostic samples: pretrained vs finetuned, IPA-asli vs espeak-id
Add diagnostic samples: pretrained vs finetuned, IPA-asli vs espeak-id
Add diagnostic: generate from dataset-native IPA vs espeak-id (phonemizer mismatch test)
Add diagnostic: generate from dataset-native IPA vs espeak-id (phonemizer mismatch test)
Add long audio sample (42.5s, speaker wibowo)
Add jalak VITS finetuned model (124 spk, +SLR44 Sundanese, eval_mel=21.19)
initial commit
