CoolFace
Modelpublic

yonroy/voicemos2026-track2-emotion

sourceHugging Facecc-by-nc-sa-4.0updated 4mo agoView on Hugging Face
0likes
Model Card

VoiceMOS Challenge 2026 — Track 2 (Emotional TTS) checkpoints

Bộ checkpoint cho VoiceMOS Challenge 2026 Track 2 — dự đoán điểm MOS cho giọng nói cảm xúc (EMOS / EmoCat / VAD) và chất lượng (QMOS). Đây là các model train trong dự án; dùng kèm code ở demo Space.

Checkpoint trong repo

FileExperimentMô tảĐiểm DEV (UTT-SRCC)
ft_emotion_full_20epoch.ptexp08TỐT NHẤT cảm xúc. WavLM-large fine-tune (warm-start SAILER) + audeering frozen → trunk → 3 head (EMOS/CAT/VAD)EMOS 0.811 · CAT-err 0.133 · VAD 0.659/0.793/0.751
ft_qmos_utmos.ptexp13Fine-tune UTMOS cho QMOS (chất lượng giọng)QMOS (exp07 mốc 0.548)
ft_joint_full.ptexp11Fine-tune đồng thời WavLM + audeering, fusion 1 modelval nội bộ ~0.83 (nghi overfit)
Hệ 6 cột mạnh nhất = trộn cột: 5 cảm xúc ← ft_emotion_full_20epoch.pt + QMOS ← exp07 → QMOS 0.548 · EMOS 0.811 · CAT 0.133 · VAD 0.659/0.793/0.751.

Kiến trúc & hằng số (PHẢI khớp khi nạp ft_emotion_full_20epoch.pt)

Checkpoint không lưu các hằng kiến trúc → khi nạp phải đặt đúng:

TRUNK_HIDDEN = 512 · HEAD_HIDDEN = 128 · EMO_MAX_SEC = 8 · SR = 16000
EMOTIONS5 = ["angry", "happy", "neutral", "sad", "surprised"]

Key trong ckpt: wavlm (statedict backbone), `heads` (trunk + 3 head), `emosmu/emossd`, `vadmu/vadsd` (chuẩn hóa nhãn), `AUDDIM (>0 = có audeering). Nạp bằng torch.load(..., weights_only=False)`.

Code nạp đầy đủ: xem app.py của Space hoặc kaggle_baseline/track2/exp08_finetune_emotion_pipeline.py.

License — ⚠️ phi thương mại

Checkpoint kế thừa từ nhiều nguồn → tuân theo ràng buộc nghiêm ngặt nhất:

Thành phầnLicense
WavLM (microsoft/wavlm-large)MIT
SAILER (tiantiaf/wavlm-large-categorical-emotion)Open RAIL
audeering wav2vec2 MSP-dimCC BY-NC-SA 4.0 (non-commercial)

→ Repo này để CC BY-NC-SA 4.0 (chỉ dùng phi thương mại, ghi nguồn, chia sẻ tương tự). Data train (BTC VoiceMOS 2026 + ESD + DailyTalk) có license riêng — không đóng gói trong repo này.

Trích dẫn

Dùng cho VoiceMOS Challenge 2026 (Track 2 — Emotional TTS). Paper ICASSP 2027 (in progress).