datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
sampleflip-kitsAgent-TTS-cleanedmuertinRon-datasetronei1986Agent-TTS-HindiAgent-TTS-Combinedronemarorpheus-zac-evalronaldovoice-dataset
Ronaldo Voice Dataset
Dataset de voz para treinamento de modelos TTS (Text-to-Speech) em português brasileiro.
Estrutura do Dataset
O dataset contém:
353 arquivos de áudio em formato WAV
Transcrições em português brasileiro
Uso
from datasets import load_dataset
dataset = load_dataset("romulofachetti/ronaldovoice-dataset", split="train")
# Acessar um exemplo
print(dataset[0]["transcription"])
# Tocar audio
dataset[0]["audio"]
Licença
CC-BY-4.0
Elise-Hindironan_tts_midronan_tts_medium_cleanAgent-Hindi-TTSronan_audiodatasetosha_testqwen3-tts-eval-testronaldinhoRonnieMcNuttcajuecastanharonaldosuzanRonuAIronaldinronaldokh-en-dataset
KYNMAW — Khasi Bhashini Multi-Task Dataset
The largest open multi-task speech + text dataset for Khasi, an Austroasiatic
language spoken by roughly 1.5 million people in Meghalaya, Northeast India — built
to help bring Khasi into modern speech recognition, text-to-speech, and machine
translation systems as part of
If you're working on low-resource ASR, endangered-language NLP, Indic
speech translation, or Northeast Indian languages, this dataset is for you.… See the full description on the dataset page: https://huggingface.co/datasets/RonitMehta260704/kh-en-dataset.ronan_tts_medium_cleanroneironinovoRONY2
