ODYSSEYAILABS/odyssey-v0.5.1-16h-eval-preview-public
πΏπ¦ Odyssey V0.5.1 β 16H Evaluation Preview (Code-Switched ASR) Odyssey AI Labs presents a 16-hour Enterprise Evaluation Preview of the V0.5 corpus. This release is designed to surface the hardest South African ASR realities directly: native urban code-switching, multi-speaker turn-taking, and overlapping conversational speech. A structured public preview of the Odyssey SA Voice Corpus, designed for researchers, data buyers, and speech teams evaluating multilingual Southβ¦ See the full description on the dataset page: https://huggingface.co/datasets/ODYSSEYAILABS/odyssey-v0.5.1-16h-eval-preview-public.
πΏπ¦ Odyssey V0.5.1 β 16H Evaluation Preview (Code-Switched ASR)
Odyssey AI Labs presents a 16-hour Enterprise Evaluation Preview of the V0.5 corpus. This release is designed to surface the hardest South African ASR realities directly: native urban code-switching, multi-speaker turn-taking, and overlapping conversational speech.
A structured public preview of the Odyssey SA Voice Corpus, designed for researchers, data buyers, and speech teams evaluating multilingual South African conversational data.
This repository is a transcript-and-metadata release. It is intended to demonstrate data quality, schema design, diarization structure, and real-world linguistic complexity before commercial engagement.
Raw audio is not distributed in this repository.
What This Preview Contains
- 171 conversational clips
- 16.15 hours of source material
- Train / Validation / Test split files
- Public transcript text
- Speaker-count and code-switch indicators
- QA summary fields
- Sidecar metadata, transcript, and QA JSON files
- Preserved source lineage IDs
Why It Matters
Many speech datasets perform well in controlled settings but fail in real environments.
This preview focuses on real South African conditions such as:
- natural code-switching
- multi-speaker conversations
- turn-taking dynamics
- overlapping speech
- multilingual utterances
- informal spoken language
These are the conditions production systems must handle.
Data Structure
Main split files:
data/train.jsonldata/validation.jsonldata/test.jsonl
Each row includes fields such as:
idbatch_idclip_numberduration_secondsprimary_languagesecondary_languagespeaker_countcode_switchtext
Additional sidecars:
sidecars/metadata/sidecars/transcripts/sidecars/qa_flags/
Intended Use
Allowed:
- dataset inspection
- schema review
- ingestion testing
- buyer diligence
- research evaluation
Not allowed:
- commercial deployment
- model training
- fine-tuning
- redistribution
- derivative dataset release
Commercial use requires a separate agreement with Odyssey AI Labs.
Companion Gated Audio Repository
The companion audio repository contains gated evaluation audio for approved users:
ODYSSEYAILABS/odyssey-v0.5.1-16h-eval-audio-gated
Access requests are reviewed manually.
About Odyssey AI Labs
Odyssey AI Labs builds high-quality African data infrastructure for modern AI systems, beginning with multilingual South African voice data.
