datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
ultravox-multivoice-dataset-atoms-final2ultravox-multivoice-dataset-atoms-final3ultravox-singlevoice-dataset-atomsultravox-multivoice-datasetultravox-singlevoice-dataset-atoms2ultravox-data-aug-obfuscated-template-cleanedsingaporean_accent_district_names_dataset_ultravoxContinuation-egy-for-ultravox-v1
Speech Dataset with Continuations
This dataset contains speech audio files with their transcriptions and AI-generated continuations.
Dataset Splits
Train: 85,248 samples (70.0%)
Validation: 18,267 samples (15.0%)
Test: 18,268 samples (15.0%)
Dataset Structure
Each sample contains:
audio: Audio file (WAV format, 16kHz)
text: Original transcription text
continuation: AI-generated continuation of the text
duration: Audio duration in seconds
sampling_rate_hz:… See the full description on the dataset page: https://huggingface.co/datasets/MAdel121/Continuation-egy-for-ultravox-v1.ultravox-jsonultravox-test4ultravox-train-jsonultravox-test69ultravox-test3ultravox-testultravox-multivoice-dataset-atomsultravox-multivoice-dataset-atoms-finalgujarati_dataset_ultravox_4ultravox-test2ultravox-multivoice-testinggujarati_dataset_ultravox_5ultravox-continuationultravox-json2ultravox-dataultravox-indic-speech
Equal Indic Speech Dataset 1
A large-scale multilingual speech dataset for English and Hindi, containing 4.2 million audio-transcript pairs
Dataset Overview
Total Samples: 4,226,934 audio-transcript pairs
Languages: English and Hindi
Total Duration: ~X,XXX hours of audio
Sample Rate: Various (preserved from source)
Dataset (Train + Validation)
English Train: 1,290,610 samples
English Validation: 368,745 samples
Hindi Train: 1,997,008 samples
Hindi Validation: 570,571… See the full description on the dataset page: https://huggingface.co/datasets/equal-ai/ultravox-indic-speech.ultravox-atoms
