CoolFace
Modelpublic

vaghawan/xtts-v2-stage-c-balanced-dual-voice-3epoch-1h-bible_tts_speaker-hausa-speaker-female-waxalnlp-3

sourceHugging Faceotherupdated 26d agoView on Hugging Face
0likes16downloads
Model Card

XTTS-v2 Hausa — Stage C — balanced BibleTTS + waxalnlp dual-voice (3 epochs, from Stage A)

Fine-tuned Coqui XTTS-v2 for Hausa (ha), trained on Balanced OpenSLR BibleTTS + vaghawan/hausa-tts-24khz-waxalnlp-3-clean (~441 clips each), init from Stage A checkpoint.

Files

FilePurpose
best_model.pthFine-tuned GPT checkpoint (epoch 3)
config.jsonModel config (includes Hausa language)
vocab.jsonExtended Hausa BPE vocabulary
references/bible_tts_speaker.wavSpeaker reference for bible_tts_speaker
references/hausa-speaker-female-waxalnlp-3.wavSpeaker reference for hausa-speaker-female-waxalnlp-3
infer.pyInference script
xtts_hausa_patch.pyRequired Hausa runtime patches
env_config.pyConfig loader
config.env.exampleExample settings (copy to config.env)
samples.txtDefault eval sentences
requirements.txtPython dependencies

Quick start

bash
pip install -r requirements.txt
cp config.env.example config.env

python infer.py --model-dir . --speaker-wav references/bible_tts_speaker.wav

# Single line:
python infer.py --model-dir . --text "Ina kwana." --speaker-wav references/bible_tts_speaker.wav --out outputs/out.wav

All speakers (one WAV per reference):

python infer.py --model-dir . --all-speakers --out-dir outputs/samples

Training details

  • —Base model: Coqui XTTS-v2
  • —Epochs: 3
  • —Language: Hausa (ha)
  • —Speakers: bible_tts_speaker, hausa-speaker-female-waxalnlp-3

License

XTTS-v2 uses the Coqui Public Model License. Check each dataset license before redistribution.