datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
ASR-datasets-ptbr
📚 Datasets de Áudio em Português (PT-BR)
Este repositório reúne diversos corpora públicos de fala em português do Brasil, combinados em um único dataset para facilitar treinamentos e pesquisas em ASR (Automatic Speech Recognition).
O objetivo é fornecer um recurso amplo, padronizado e de fácil acesso para a comunidade.
📂 Datasets Integrados
A tabela abaixo lista todos os datasets incluídos, com suas informações:
Dataset
Config Name
TOTAL
train
test
validation… See the full description on the dataset page: https://huggingface.co/datasets/opedromartins/ASR-datasets-ptbr.mTEDx-ptbr
Multilingual TEDx (Portuguese speech and transcripts)
NOTE: This dataset contains only the Portuguese portion of the mTEDx dataset, already processed and segmented into parts.
Multilingual TEDx (mTEDx) is a multilingual speech recognition and translation corpus to facilitate the training of ASR and SLT models in additional languages.
The corpus comprises audio recordings and transcripts from TEDx Talks in 8 languages (Spanish, French, Portuguese, Italian, Russian, Greek, Arabic… See the full description on the dataset page: https://huggingface.co/datasets/dominguesm/mTEDx-ptbr.common_voice_ptasr-leaderboard-datasets-ptbrAudio-Transcription-Models-Comparison-PT-BR
Audio Transcription Models Comparison
A dataset dedicated to comparing the performance of modern Speech-to-Text (STT) models, focusing exclusively on Brazilian Portuguese.
About the Dataset
This dataset was created to store and compare transcription results from different Artificial Intelligence models in challenging scenarios. Unlike generic benchmarks, this project focuses on the reality of usage in Brazil, covering:
Regionalism: Local vocabulary, accents, and… See the full description on the dataset page: https://huggingface.co/datasets/tech4humans/Audio-Transcription-Models-Comparison-PT-BR.multispeaker-tts-ptbrDataset importado do https://gitlab.com/fb-audio-corpora
pt-br-tts-synth
pt-br-tts-synth
98813 frases PT-BR sintetizadas com Kokoro-82M (vozes pf_dora/pm_alex/pm_santa, speeds 0.9-1.1x), 16kHz mono WAV em 32 tar shards (WebDataset). Texto gerado por LLM (3 tiers de complexidade x 40 topicos); transcricao, tier, topico, voz e speed em metadata.jsonl.
from datasets import load_dataset
ds = load_dataset("webdataset", data_files="hf://datasets/marcosremar2/pt-br-tts-synth/shard_*.tar", split="train")
named-entities-tts-pt-br-audio-qwen3tts
Qwen3-TTS (checkpoint base) — áudio sintetizado de entidades nomeadas
Dataset de áudio gerado sinteticamente a partir do glossário de entidades nomeadas do
projeto de IC "Aprimoramento de modelos de reconhecimento automático de fala em relação
ao reconhecimento de nomes próprios", usando o modelo Qwen3-TTS (Qwen/Qwen3-TTS-12Hz-1.7B-Base) em seu
checkpoint base, sem fine-tuning — etapa de baseline do projeto.
Splits
Split
Nº de exemplos
train
17309… See the full description on the dataset page: https://huggingface.co/datasets/RodrigoLimaRFL/named-entities-tts-pt-br-audio-qwen3tts.mTEDx-ptbr
Multilingual TEDx (Portuguese speech and transcripts)
NOTE: This dataset contains only the Portuguese portion of the mTEDx dataset, already processed and segmented into parts.
Multilingual TEDx (mTEDx) is a multilingual speech recognition and translation corpus to facilitate the training of ASR and SLT models in additional languages.
The corpus comprises audio recordings and transcripts from TEDx Talks in 8 languages (Spanish, French, Portuguese, Italian, Russian, Greek, Arabic… See the full description on the dataset page: https://huggingface.co/datasets/FERNAN89/mTEDx-ptbr.qwen3-omni-ptbr-qwen3tts-synthetic
Qwen3 Omni PT-BR Synthetic TTS Teacher Dataset
This dataset contains synthetic Portuguese (Brazil) speech/text examples for an experimental omni speech pipeline:
Whisper/ASR -> Tucano hidden states -> Qwen3 audio-code talker -> Qwen3-TTS tokenizer decoder
Contents
fast_pass_answer_texts.jsonl: 50,000 synthetic Q&A/text rows.
teacher_wavs_det_v1/: 12,204 generated WAV files.
audio_metadata.jsonl: lightweight audio manifest with relative WAV paths and text.… See the full description on the dataset page: https://huggingface.co/datasets/marcosremar2/qwen3-omni-ptbr-qwen3tts-synthetic.named-entities-tts-pt-br-audio
YourTTS (checkpoint base) — áudio sintetizado de entidades nomeadas
Dataset de áudio gerado sinteticamente a partir do glossário de entidades nomeadas do
projeto de IC "Aprimoramento de modelos de reconhecimento automático de fala em relação
ao reconhecimento de nomes próprios", usando o modelo YourTTS (tts_models/multilingual/multi-dataset/your_tts) em seu
checkpoint base, sem fine-tuning — etapa de baseline do projeto.
Splits
Split
Nº de exemplos… See the full description on the dataset page: https://huggingface.co/datasets/RodrigoLimaRFL/named-entities-tts-pt-br-audio.minimind-ptbr-kokoro-tts-68k
MiniMind PT-BR Kokoro TTS 68k
Synthetic Brazilian Portuguese speech dataset generated for the MiniMind/Tucano2 -> Mimi Talker fine-tuning experiments.
Contents
audio/: 68,486 WAV files generated with Kokoro TTS.
manifests/kokoro_groq25k_audio_manifest.jsonl: source text manifest.
manifests/kokoro_groq25k_audio_manifest_with_wavs.jsonl: manifest with WAV paths.
manifests/kokoro_groq25k_audio_manifest_with_mimi.jsonl: manifest with Mimi token references.… See the full description on the dataset page: https://huggingface.co/datasets/marcosremar2/minimind-ptbr-kokoro-tts-68k.pt-br_char
Brazilian Portuguese Merged Speech Dataset (Derived from Common Voice)
This dataset is a preprocessed and merged version of the Mozilla Common Voice dataset for Brazilian Portuguese (pt-BR). It was created by filtering, merging, and normalizing audio clips to improve usability for speech recognition and TTS (Text-to-Speech) training.
📌 Dataset Details
Source: Derived from Common Voice Corpus 20.0
Language: 🇧🇷 Brazilian Portuguese (pt-BR)
Format: MP3 (24 kHz, mono… See the full description on the dataset page: https://huggingface.co/datasets/firstpixel/pt-br_char.tts-dataset-pt-brmultispeaker-tts-ptbrDataset importado do https://gitlab.com/fb-audio-corpora
vyse-voice-pt-brDataset usado para treinar a voz da Vyse (Valorant)
Geração do metadata.csv:
Rodar: whisper.sh em seguida transcrib.sh, isso produzira um txt com todas falas pronto para ser utilizado no treinamento com piper
localingua_pt-brtranscriptions unverified! known to contain mistakes/noise
palavras_pt_BR_ate_4_letraspalavras_pt_BR_4x2a5_letraspalavras_pt_BR_ate_5_letraspalavras_pt_BR_2x2a5_letrascv_25_pt_br_ECAPA_TDNN_embeddingsPTBRSpeechRecognition_CommonVoice17-TestOs-Cavaleiros-do-Zodiaco-Vozes-pt-brOs áudios desse dataset são baseados apenas na Saga de Hades.
Todos os WAVs foram editados no Audacity e limpos com o UVR5.
Rhulk_pt-brsage-voice-pt-brDataset usado para treinar a voz da Sage (Valorant)
Geração do metadata.csv:
Rodar: whisper.sh em seguida transcrib.sh, isso produzira um txt com todas falas pronto para ser utilizado no treinamento com piper
license: mit
synthetic_utterances_pt-BR_1400_sentences_x_6_speakersSidney_ptbrpalavras_pt_BR_ate_3_letrassynthetic_utterances_pt-BR_1200_sentences_x_6_speakers
