MAdel121/Continuation-egy-for-ultravox-v1
Speech Dataset with Continuations This dataset contains speech audio files with their transcriptions and AI-generated continuations. Dataset Splits Train: 85,248 samples (70.0%) Validation: 18,267 samples (15.0%) Test: 18,268 samples (15.0%) Dataset Structure Each sample contains: audio: Audio file (WAV format, 16kHz) text: Original transcription text continuation: AI-generated continuation of the text duration: Audio duration in seconds… See the full description on the dataset page: https://huggingface.co/datasets/MAdel121/Continuation-egy-for-ultravox-v1.
Speech Dataset with Continuations
This dataset contains speech audio files with their transcriptions and AI-generated continuations.
Dataset Description
- Total samples: 121,783 samples
- Audio format: WAV files at 16kHz sampling rate
- Language: Arabic
- Task: Speech-to-text with continuation generation
Dataset Splits
- Train: 85,248 samples (70.0%)
- Validation: 18,267 samples (15.0%)
- Test: 18,268 samples (15.0%)
Dataset Structure
Each sample contains:
audio: Audio file (WAV format, 16kHz)text: Original transcription textcontinuation: AI-generated continuation of the textduration: Audio duration in secondssampling_rate_hz: Audio sampling rateaudio_filename: Original audio filename
Usage
from datasets import load_dataset
# Load the dataset
dataset = load_dataset("MAdel121/Continuation-egy-for-ultravox-v1")
# Access different splits
train_dataset = dataset['train']
val_dataset = dataset['validation']
test_dataset = dataset['test']
# Access audio and text from a sample
sample = train_dataset[0]
audio_array = sample['audio']['array']
transcription = sample['text']
continuation = sample['continuation']Citation
Please cite this dataset if you use it in your research.
