laion/voicenet-1.7B-wip
0
MOSS VoiceGenerator — GRPO LoRA (Rank 8)
Overview
- Base model: OpenMOSS-Team/MOSS-VoiceGenerator (Qwen3-1.7B backbone)
- Method: GRPO (Group Relative Policy Optimization)
- LoRA rank: 8, alpha: 16
- Training: 500 steps, batch=8, G=4, lr=5e-5
- Rewards: Speaker similarity (ECAPA-TDNN, w=0.6) + CLAP emotion (w=0.4) + WER penalty
Results (500 steps)
Eval (1 sample per condition)
Usage
from transformers import AutoModel
from peft import PeftModel
model = AutoModel.from_pretrained("OpenMOSS-Team/MOSS-VoiceGenerator", trust_remote_code=True)
model.language_model = PeftModel.from_pretrained(model.language_model, "laion/voicenet-1.7B-wip", subfolder="grpo-r8-500steps")