CoolFace
Datasetpublic

ODYSSEYAILABS/odyssey-v0.5.1-16h-eval-preview-public

πŸ‡ΏπŸ‡¦ Odyssey V0.5.1 β€” 16H Evaluation Preview (Code-Switched ASR) Odyssey AI Labs presents a 16-hour Enterprise Evaluation Preview of the V0.5 corpus. This release is designed to surface the hardest South African ASR realities directly: native urban code-switching, multi-speaker turn-taking, and overlapping conversational speech. A structured public preview of the Odyssey SA Voice Corpus, designed for researchers, data buyers, and speech teams evaluating multilingual South… See the full description on the dataset page: https://huggingface.co/datasets/ODYSSEYAILABS/odyssey-v0.5.1-16h-eval-preview-public.

sourceHugging Faceotherupdated 5mo agoView on Hugging Face
0likes58downloads
Dataset Card

πŸ‡ΏπŸ‡¦ Odyssey V0.5.1 β€” 16H Evaluation Preview (Code-Switched ASR)

Odyssey AI Labs presents a 16-hour Enterprise Evaluation Preview of the V0.5 corpus. This release is designed to surface the hardest South African ASR realities directly: native urban code-switching, multi-speaker turn-taking, and overlapping conversational speech.

A structured public preview of the Odyssey SA Voice Corpus, designed for researchers, data buyers, and speech teams evaluating multilingual South African conversational data.

This repository is a transcript-and-metadata release. It is intended to demonstrate data quality, schema design, diarization structure, and real-world linguistic complexity before commercial engagement.

Raw audio is not distributed in this repository.


What This Preview Contains

  • β€”171 conversational clips
  • β€”16.15 hours of source material
  • β€”Train / Validation / Test split files
  • β€”Public transcript text
  • β€”Speaker-count and code-switch indicators
  • β€”QA summary fields
  • β€”Sidecar metadata, transcript, and QA JSON files
  • β€”Preserved source lineage IDs

Why It Matters

Many speech datasets perform well in controlled settings but fail in real environments.

This preview focuses on real South African conditions such as:

  • β€”natural code-switching
  • β€”multi-speaker conversations
  • β€”turn-taking dynamics
  • β€”overlapping speech
  • β€”multilingual utterances
  • β€”informal spoken language

These are the conditions production systems must handle.


Data Structure

Main split files:

  • β€”data/train.jsonl
  • β€”data/validation.jsonl
  • β€”data/test.jsonl

Each row includes fields such as:

  • β€”id
  • β€”batch_id
  • β€”clip_number
  • β€”duration_seconds
  • β€”primary_language
  • β€”secondary_language
  • β€”speaker_count
  • β€”code_switch
  • β€”text

Additional sidecars:

  • β€”sidecars/metadata/
  • β€”sidecars/transcripts/
  • β€”sidecars/qa_flags/

Intended Use

Allowed:

  • β€”dataset inspection
  • β€”schema review
  • β€”ingestion testing
  • β€”buyer diligence
  • β€”research evaluation

Not allowed:

  • β€”commercial deployment
  • β€”model training
  • β€”fine-tuning
  • β€”redistribution
  • β€”derivative dataset release

Commercial use requires a separate agreement with Odyssey AI Labs.


Companion Gated Audio Repository

The companion audio repository contains gated evaluation audio for approved users:

ODYSSEYAILABS/odyssey-v0.5.1-16h-eval-audio-gated

Access requests are reviewed manually.


About Odyssey AI Labs

Odyssey AI Labs builds high-quality African data infrastructure for modern AI systems, beginning with multilingual South African voice data.