MAdel121/Continuation-egy-for-ultravox-v1
Speech Dataset with Continuations This dataset contains speech audio files with their transcriptions and AI-generated continuations. Dataset Splits Train: 85,248 samples (70.0%) Validation: 18,267 samples (15.0%) Test: 18,268 samples (15.0%) Dataset Structure Each sample contains: audio: Audio file (WAV format, 16kHz) text: Original transcription text continuation: AI-generated continuation of the text duration: Audio duration in seconds… See the full description on the dataset page: https://huggingface.co/datasets/MAdel121/Continuation-egy-for-ultravox-v1.
Add dataset card with split information
Upload speech dataset with train/validation/test splits
Add dataset card
Upload speech dataset with audio files and transcriptions
initial commit
