CoolFace
Modelpublic

vaghawan/xtts-v2-en-pidgin-lr-5e-5-epoch20-35mins

sourceHugging Faceotherupdated 2mo agoView on Hugging Face
0likes13downloads
Model Card

XTTS-v2 — English + Nigerian Pidgin (lr=5e-5, 20 epochs, ~35 min data)

Fine-tuned Coqui XTTS-v2 for English and Nigerian Pidgin (both synthesized with language id en), trained on vaghawan/en-pidgin-high-similarity-11-35mins (speaker en_pidgin_voice).

Pidgin has no native XTTS language code — train and infer Pidgin text as en.

Files

FilePurpose
best_model.pthFine-tuned GPT checkpoint (epoch 20, lr=5e-5)
config.jsonModel config
vocab.jsonStock XTTS English BPE vocabulary (no extend)
references/en_pidgin_voice.wavSpeaker reference
infer_english_and_pidgin.pyEnglish + Pidgin sample inference
infer.pyShared inference helpers
xtts_hausa_patch.pyRuntime language helpers (also used for en)
env_config.pyConfig loader
config.env.exampleExample settings (copy to config.env)
requirements.txtPython dependencies

Quick start

bash
pip install -r requirements.txt
cp config.env.example config.env

python infer_english_and_pidgin.py \
  --model-dir . \
  --speaker-wav references/en_pidgin_voice.wav \
  --out-dir outputs/samples_en_pidgin

# Single line (via infer.py):
python infer.py --model-dir . --language en \
  --text "How far? I dey fine." \
  --speaker-wav references/en_pidgin_voice.wav \
  --out outputs/out.wav

Training details

  • —Base model: Coqui XTTS-v2 (stock English vocab — no extend_vocab.py)
  • —Epochs: 20
  • —Learning rate: 5e-5
  • —Language id: en (English and Pidgin)
  • —Speakers: en_pidgin_voice
  • —Data: ~35 minutes high-similarity English/Pidgin

License

XTTS-v2 uses the Coqui Public Model License. Check each dataset license before redistribution.