CoolFace
Datasetpublic

jml2026/multilingual-accent-speech

πŸŽ™οΈ Silencio Network: Voice AI Sample Dataset πŸ“Š This is a sample. The full Silencio corpus contains 100,000+ hours across 170+ countries and 100+ languages. πŸ“§ Contact: sofia@silencioai.com for custom datasets, bulk licensing, or specific language requests. 🌍 Why Silencio Data? Silencio data is collected in the wild from a massive, opt-in community (2M+ contributors across 180+ countries), giving you: βœ… Real-world accents, dialects, devices, and… See the full description on the dataset page: https://huggingface.co/datasets/jml2026/multilingual-accent-speech.

sourceHugging Facecc-by-nc-4.0updated 6mo agoView on Hugging Face
1likes566downloads
Dataset Card

πŸŽ™οΈ Silencio Network: Voice AI Sample Dataset

<p align="left"> <img src="https://cdn-uploads.huggingface.co/production/uploads/69162b50b89e7abe20de4b5a/LWhs4p2lPFcyiVsP0tluu.png" width="40%"> </p>

![Website](https://www.silencioai.com) ![Contact](mailto:sofia@silencioai.com) ![Data Available](mailto:sofia@silencioai.com)


πŸ“Š This is a sample. The full Silencio corpus contains 100,000+ hours across 170+ countries and 100+ languages. πŸ“§ Contact: sofia@silencioai.com for custom datasets, bulk licensing, or specific language requests.

🌍 Why Silencio Data?

Silencio data is collected in the wild from a massive, opt-in community (2M+ contributors across 180+ countries), giving you:

  • β€”βœ… Real-world accents, dialects, devices, and environments that lab or scraped datasets don't capture
  • β€”βœ… Explicit, traceable consent β€” every recording tied to verified opt-in (GDPR/CCPA compliant)
  • β€”βœ… Privacy-first pipelines β€” anonymized, PII hashed, reduced legal risk for enterprise
  • β€”βœ… Rapid scaling into hard-to-source languages and niches

πŸ“Š Full Data Availability

CategoryAvailableTop Languages
African Languages25,000+ hrsSwahili (9.7k), Nigerian English (8.1k), Hausa, Yoruba, Zulu
Asian Languages15,000+ hrsHindi, Mandarin, Japanese, Korean, Vietnamese
European Languages20,000+ hrsGerman, Spanish, French, Portuguese, Polish
Emotional Speech5,000+ hrsJoy, anger, sadness, fear, surprise, neutral
Multi-Speaker10,000+ hrsOverlapping speech, turn-taking, interruptions
Conversational30,000+ hrsNatural dialogue, disfluencies, backchannels

Custom requests? We can source virtually any language, accent, or demographic at scale.


🎯 This Sample Dataset

This sample covers 43 language–region configs across 20+ languages demonstrating our data quality:

Accented English

ConfigAccent/RegionSplitsSamples
english_algeriaAlgerianfree_speech21
english_australiaAustralianfree_speech25
english_belarusBelarusianfree_speech21
english_chinaMandarin-influencedfree_speech, keywords, monologues75
english_egyptEgyptianfree_speech25
english_french_speakingFrench-speaking countriesfree_speech21
english_haitiHaitianfree_speech21
english_irelandIrishfree_speech21
english_jamaicaJamaicanfree_speech25
english_kenyaKenyanfree_speech25
english_mandarinMandarin-influenced (Global)free_speech25
english_nigeriaNigerianfree_speech, keywords, monologues75
english_pakistanPakistanifree_speech25
english_polandPolishfree_speech25
english_russiaRussianfree_speech25
english_south_africaSouth Africanfree_speech17
english_ugandaUgandanfree_speech25
english_united_kingdomBritishfree_speech25
english_united_statesAmericanfree_speech, keywords, monologues75
english_ukraineUkrainianfree_speech25

African Languages

ConfigLanguageRegionSplitsSamples
amharic_ethiopiaAmharicEthiopiafree_speech51
hausa_nigeriaHausaNigeriafree_speech42
igbo_nigeriaIgboNigeriafree_speech36
yoruba_nigeriaYorubaNigeriafree_speech39

Other Languages

ConfigLanguageRegionSplitsSamples
french_canadaFrenchCanadafree_speech25
french_globalFrenchGlobalfree_speech25
german_germanyGermanGermanyfree_speech, keywords, monologues75
gujarati_indiaGujaratiIndiafree_speech18
italian_italyItalianItalyfree_speech25
japanese_japanJapaneseJapanfree_speech25
kannada_indiaKannadaIndiafree_speech25
malayalam_indiaMalayalamIndiafree_speech25
mandarin_chinese_chinaMandarinChinafree_speech25
marathi_indiaMarathiIndiafree_speech25
odia_indiaOdiaIndiafree_speech21
portuguese_brazilPortugueseBrazilfree_speech25
russian_russiaRussianRussiafree_speech25
spanish_mexicoSpanishMexicofree_speech, keywords, monologues56
telugu_indiaTeluguIndiafree_speech25
turkish_turkeyTurkishTurkeyfree_speech, monologues32
vietnamese_vietnamVietnameseVietnammonologues15

Medical Domain

ConfigLanguageSplitsSamples
english_medicalEnglishmedical8
global_medicalMultilingual (EN/ES/DE)medical25

Conversational

ConfigLanguageSplitsMeetingsParticipantsAudio Columns
conversational_englishEnglishconversations48speakeraudio, singlechannel, multi_channel
Each row contains 3 audio files (individual speaker, full meeting single-channel, full meeting multi-channel) plus word-level meeting transcripts with speaker turns and timestamps.

πŸš€ Quick Start

python
from datasets import load_dataset

# Load Nigerian English samples
ds = load_dataset("SilencioNetwork/complete-voiceai-speech-dataset", "english_nigeria")

# Access different speech types
free_speech = ds['free_speech']
keywords = ds['keywords']
monologues = ds['monologues']

# Process a sample
for sample in free_speech:
    audio = sample['audio']
    transcript = sample['transcript']
    speaker_id = sample['speaker_id']
    emotion = sample['emotions']
    print(f"Speaker {speaker_id}: {transcript[:50]}...")

🎀 Speech Types

TypeDescriptionUse Cases
free_speechUnscripted speech on provided topicsConversational AI, dialogue systems
keywordsShort isolated phrases/termsWake word detection, command recognition
monologuesLonger scripted passagesTTS training, ASR benchmarking

πŸ“‹ Rich Metadata

Every recording includes:

  • β€”Speaker demographics: gender, ethnicity, occupation, birth year, birth place
  • β€”Linguistic info: mother tongue, dialect, language proficiency data
  • β€”Recording context: device, OS, browser, location, background noise
  • β€”Content: script, Whisper-generated transcript, emotion labels
  • β€”Technical: duration, 48kHz WAV format

🎯 Ideal For

  • β€”πŸ—£οΈ ASR training β€” accent-robust speech recognition
  • β€”πŸ”Š TTS development β€” diverse voice synthesis
  • β€”πŸ˜Š Emotion recognition β€” labeled emotional speech
  • β€”πŸŒ Multilingual models β€” 100+ languages available
  • β€”πŸŽ™οΈ Speaker verification β€” unique speaker embeddings
  • β€”πŸ“Š Benchmarking β€” real-world robustness testing

βš–οΈ License

CC BY-NC 4.0 β€” Free for research and non-commercial use.

For commercial licensing, contact sofia@silencioai.com.

πŸ“§ Get More Data

Need the full corpus? This sample represents <0.01% of our available data.

What You NeedWe Can Provide
Specific language/accentβœ… 100+ languages available
Emotional speechβœ… 5,000+ hours labeled
Multi-speaker/overlappingβœ… 10,000+ hours
Custom demographicsβœ… Age, gender, occupation targeting
Bulk volumeβœ… 100,000+ hours total

πŸ“§ Email: sofia@silencioai.com

🌐 Website: silencioai.com


Citation

bibtex
@dataset{silencio_network_speech_2025,
    title        = {Silencio Network Voice AI Speech Corpus},
    author       = {Silencio Network},
    year         = {2025},
    publisher    = {Hugging Face},
    license      = {CC BY-NC 4.0}
}