leeaandrob/neurogrid-tts-synth-ptbr
NeuroGrid TTS Synthetic pt-BR Corpora Corpora sinteticos para treino/QAT de TTS pt-BR (F5-TTS). synth_clean_v1.tar — 12.001 clipes / 28.5h. Teacher: firstpixel F5 pt-BR (CC-BY-NC — uso de pesquisa). Filtro ASR faster-whisper (WER<=0.15). synth_v2_apache.tar — 18.024 clipes / 38.7h. Teachers: Kokoro-82M + VoxCPM2 (ambos Apache-2.0). Templates com numeros/moeda/datas/horas (num2words) + textos de livros (CML/MLS). Filtro ASR com canonicalizacao de digitos. Campo src no meta.jsonl… See the full description on the dataset page: https://huggingface.co/datasets/leeaandrob/neurogrid-tts-synth-ptbr.
NeuroGrid TTS Synthetic pt-BR Corpora
Corpora sinteticos para treino/QAT de TTS pt-BR (F5-TTS).
synth_clean_v1.tar— 12.001 clipes / 28.5h. Teacher: firstpixel F5 pt-BR (CC-BY-NC — uso de pesquisa). Filtro ASR faster-whisper (WER<=0.15).synth_v2_apache.tar— 18.024 clipes / 38.7h. Teachers: Kokoro-82M + VoxCPM2 (ambos Apache-2.0). Templates com numeros/moeda/datas/horas (num2words) + textos de livros (CML/MLS). Filtro ASR com canonicalizacao de digitos. Camposrcno meta.jsonl identifica o teacher.
Formato: wavs/*.wav + meta.jsonl ({audio_path, text, duration[, src]}).
Receita validada (chain 7): finetune F5 base no corpus -> QAT ternario (44 FFN, g128 absmean, lr 5e-5, 12k steps) nos MESMOS dados -> ternario WER 0.047 vs base FP16 0.043 (empate).
