CoolFace
Datasetpublic

MAdel121/Continuation-egy-for-ultravox-v1

Speech Dataset with Continuations This dataset contains speech audio files with their transcriptions and AI-generated continuations. Dataset Splits Train: 85,248 samples (70.0%) Validation: 18,267 samples (15.0%) Test: 18,268 samples (15.0%) Dataset Structure Each sample contains: audio: Audio file (WAV format, 16kHz) text: Original transcription text continuation: AI-generated continuation of the text duration: Audio duration in seconds… See the full description on the dataset page: https://huggingface.co/datasets/MAdel121/Continuation-egy-for-ultravox-v1.

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes13downloads
Dataset Card

Speech Dataset with Continuations

This dataset contains speech audio files with their transcriptions and AI-generated continuations.

Dataset Description

  • Total samples: 121,783 samples
  • Audio format: WAV files at 16kHz sampling rate
  • Language: Arabic
  • Task: Speech-to-text with continuation generation

Dataset Splits

  • Train: 85,248 samples (70.0%)
  • Validation: 18,267 samples (15.0%)
  • Test: 18,268 samples (15.0%)

Dataset Structure

Each sample contains:

  • audio: Audio file (WAV format, 16kHz)
  • text: Original transcription text
  • continuation: AI-generated continuation of the text
  • duration: Audio duration in seconds
  • sampling_rate_hz: Audio sampling rate
  • audio_filename: Original audio filename

Usage

python
from datasets import load_dataset

# Load the dataset
dataset = load_dataset("MAdel121/Continuation-egy-for-ultravox-v1")

# Access different splits
train_dataset = dataset['train']
val_dataset = dataset['validation']
test_dataset = dataset['test']

# Access audio and text from a sample
sample = train_dataset[0]
audio_array = sample['audio']['array']
transcription = sample['text']
continuation = sample['continuation']

Citation

Please cite this dataset if you use it in your research.