nigerian-pidgin
nigerian-pidgin-1.0
Language:
- Nigerian Pidgin English (West African Pidgin variant)
Dataset Description
Dataset Summary
The Nigerian Pidgin ASR dataset (v1.0) is the first publicly released speech-to-text corpus for Nigerian Pidgin English, a widely spoken lingua franca across Nigeria and West Africa. This dataset comprises over 3,000 audio recordings paired with sentence-level transcriptions, recorded by native speakers across different genders and age groups. It is tailored for… See the full description on the dataset page: https://huggingface.co/datasets/asr-nigerian-pidgin/nigerian-pidgin-1.0.nigerian-pidgin-voice-text
Wazobia Labs — Nigerian Pidgin Emotion & Sentiment Dataset
Version: v0.8 — May 2026
Entries: 550 annotated entries
Builder: Wazobia Labs
License: CC-BY-4.0 — commercial use permitted with attribution
Contact: wazobialabs@gmail.com
Language: Nigerian Pidgin (Naija) — ISO 639-3: pcm
What This Is
The first commercially licensed Nigerian Pidgin emotion and sentiment dataset — built from lived native speaker knowledge, not translated from English, not scraped from news… See the full description on the dataset page: https://huggingface.co/datasets/WAZOBIALABS/nigerian-pidgin-voice-text.english-nigerian-pidgin_sentence-pairs_mt560
English-Nigerian Pidgin Parallel Dataset
This dataset contains parallel sentences in English and Nigerian Pidgin (Nigeria).
Dataset Information
Language Pair: English ↔ Nigerian Pidgin
Language Code: pcm
Country: Nigeria
Original Source: OPUS MT560 Dataset
Dataset Structure
The dataset contains parallel sentences that can be used for:
Machine translation training
Cross-lingual NLP tasks
Language model fine-tuning
Citation
If you use this dataset… See the full description on the dataset page: https://huggingface.co/datasets/michsethowusu/english-nigerian-pidgin_sentence-pairs_mt560.Medical-Reasoning-Dataset-Nigerian-Pidgin
Medical Reasoning Dataset Nigerian Pidgin | Africa (Electric Sheep Africa metadata inventory)
Size category: 10K<n<100K - Formats: json - Sector: health - Engineered by Electric Sheep Africa
TL;DR
This dataset is part of the Electric Sheep Africa catalog on Hugging Face. It is indexed for African data discovery with standardized metadata, loading guidance, provenance notes, and analyst-oriented context.
What This Dataset Covers
Health datasets… See the full description on the dataset page: https://huggingface.co/datasets/electricsheepafrica/Medical-Reasoning-Dataset-Nigerian-Pidgin.English-NigerianPidgin-Result-Validationnigerian-pidgin-speech
Nigerian Pidgin Audio + Text Dataset for Whisper Fine-tuning
Nigerian Pidgin speech dataset for Whisper fine-tuning
Dataset Summary
This dataset contains audio recordings and transcriptions in Nigerian Pidgin English, designed for fine-tuning speech recognition models, particularly OpenAI's Whisper.
Dataset Structure
Train Split: 65 samples
Test Split: 8 samples
Total Duration: 0.0 hours (estimated)
Average Duration: 2.4 seconds per sample
Sample Rate: 16kHz… See the full description on the dataset page: https://huggingface.co/datasets/Rexe/nigerian-pidgin-speech.
