CoolFace
Datasetpublic

leeaandrob/neurogrid-tts-synth-ptbr

NeuroGrid TTS Synthetic pt-BR Corpora Corpora sinteticos para treino/QAT de TTS pt-BR (F5-TTS). synth_clean_v1.tar — 12.001 clipes / 28.5h. Teacher: firstpixel F5 pt-BR (CC-BY-NC — uso de pesquisa). Filtro ASR faster-whisper (WER<=0.15). synth_v2_apache.tar — 18.024 clipes / 38.7h. Teachers: Kokoro-82M + VoxCPM2 (ambos Apache-2.0). Templates com numeros/moeda/datas/horas (num2words) + textos de livros (CML/MLS). Filtro ASR com canonicalizacao de digitos. Campo src no meta.jsonl… See the full description on the dataset page: https://huggingface.co/datasets/leeaandrob/neurogrid-tts-synth-ptbr.

sourceHugging Faceupdated 2mo agoView on Hugging Face
0likes10downloads
Dataset Card

NeuroGrid TTS Synthetic pt-BR Corpora

Corpora sinteticos para treino/QAT de TTS pt-BR (F5-TTS).

  • —synth_clean_v1.tar — 12.001 clipes / 28.5h. Teacher: firstpixel F5 pt-BR (CC-BY-NC — uso de pesquisa). Filtro ASR faster-whisper (WER<=0.15).
  • —synth_v2_apache.tar — 18.024 clipes / 38.7h. Teachers: Kokoro-82M + VoxCPM2 (ambos Apache-2.0). Templates com numeros/moeda/datas/horas (num2words) + textos de livros (CML/MLS). Filtro ASR com canonicalizacao de digitos. Campo src no meta.jsonl identifica o teacher.

Formato: wavs/*.wav + meta.jsonl ({audio_path, text, duration[, src]}).

Receita validada (chain 7): finetune F5 base no corpus -> QAT ternario (44 FFN, g128 absmean, lr 5e-5, 12k steps) nos MESMOS dados -> ternario WER 0.047 vs base FP16 0.043 (empate).