ivkond/synthetic-speech-diarization-ru
synthetic-speech-diarization-ru Synthetic speech diarization dataset in Parquet format. Dataset Details Number of tracks: 2000 Sampling rate: 16000 Hz Audio format: Embedded in Parquet files (Audio feature compatible) Storage: Parquet format for efficient loading Dataset Structure The dataset contains audio tracks with speaker diarization annotations, stored directly in Parquet format. Features audio: Audio waveform (Audio feature… See the full description on the dataset page: https://huggingface.co/datasets/ivkond/synthetic-speech-diarization-ru.
synthetic-speech-diarization-ru
Synthetic speech diarization dataset in Parquet format.
Dataset Details
- Number of tracks: 2000
- Sampling rate: 16000 Hz
- Audio format: Embedded in Parquet files (Audio feature compatible)
- Storage: Parquet format for efficient loading
Dataset Structure
The dataset contains audio tracks with speaker diarization annotations, stored directly in Parquet format.
Features
audio: Audio waveform (Audio feature with array and sampling_rate)duration: Track duration in secondsnum_speakers: Number of speakers in the trackspeakers: List of speaker segments with timestamps and textspeaker_volumes: Speaker volume levelsconversation_type: Type of conversation (dialogue, monologue, etc.)difficulty: Difficulty level (easy, medium, hard)has_overlaps: Whether track contains overlapping speechhas_simultaneous: Whether track contains simultaneous speechhas_noise: Whether track contains background noise
Usage
from datasets import load_dataset
# Load dataset from HuggingFace Hub directly
dataset = load_dataset("ivkond/synthetic-speech-diarization-ru")
# Access a sample
sample = dataset[0]
print(f"Duration: {sample['duration']}s")
print(f"Speakers: {sample['num_speakers']}")Notes
- Audio data is embedded directly in Parquet files for efficient streaming
- No custom loading script required
- Compatible with standard Hugging Face dataset operations
