datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
nigerian-pidgin-1.0
Language:
- Nigerian Pidgin English (West African Pidgin variant)
Dataset Description
Dataset Summary
The Nigerian Pidgin ASR dataset (v1.0) is the first publicly released speech-to-text corpus for Nigerian Pidgin English, a widely spoken lingua franca across Nigeria and West Africa. This dataset comprises over 3,000 audio recordings paired with sentence-level transcriptions, recorded by native speakers across different genders and age groups. It is tailored for… See the full description on the dataset page: https://huggingface.co/datasets/asr-nigerian-pidgin/nigerian-pidgin-1.0.english-nigerian-pidgin_sentence-pairs_mt560
English-Nigerian Pidgin Parallel Dataset
This dataset contains parallel sentences in English and Nigerian Pidgin (Nigeria).
Dataset Information
Language Pair: English ↔ Nigerian Pidgin
Language Code: pcm
Country: Nigeria
Original Source: OPUS MT560 Dataset
Dataset Structure
The dataset contains parallel sentences that can be used for:
Machine translation training
Cross-lingual NLP tasks
Language model fine-tuning
Citation
If you use this dataset… See the full description on the dataset page: https://huggingface.co/datasets/michsethowusu/english-nigerian-pidgin_sentence-pairs_mt560.Medical-Reasoning-Dataset-Nigerian-Pidgin
Medical Reasoning Dataset Nigerian Pidgin | Africa (Electric Sheep Africa metadata inventory)
Size category: 10K<n<100K - Formats: json - Sector: health - Engineered by Electric Sheep Africa
TL;DR
This dataset is part of the Electric Sheep Africa catalog on Hugging Face. It is indexed for African data discovery with standardized metadata, loading guidance, provenance notes, and analyst-oriented context.
What This Dataset Covers
Health datasets… See the full description on the dataset page: https://huggingface.co/datasets/electricsheepafrica/Medical-Reasoning-Dataset-Nigerian-Pidgin.nigerian-pidgin-speech
Nigerian Pidgin Audio + Text Dataset for Whisper Fine-tuning
Nigerian Pidgin speech dataset for Whisper fine-tuning
Dataset Summary
This dataset contains audio recordings and transcriptions in Nigerian Pidgin English, designed for fine-tuning speech recognition models, particularly OpenAI's Whisper.
Dataset Structure
Train Split: 65 samples
Test Split: 8 samples
Total Duration: 0.0 hours (estimated)
Average Duration: 2.4 seconds per sample
Sample Rate: 16kHz… See the full description on the dataset page: https://huggingface.co/datasets/Rexe/nigerian-pidgin-speech.nigerian-pidgin-eval
Wazobia Labs — Nigerian Pidgin Gold-Standard Evaluation Set
Version: v0.3 — May 2026
Entries: 253 dual-verified gold-standard entries
Builder: Wazobia Labs
License: CC-BY-4.0 — commercial use permitted with attribution
Contact: wazobialabs@gmail.com
What This Is
Every AI lab building for Nigerian Pidgin has the same unsolved problem: they cannot evaluate whether their model actually works.
No gold-standard benchmark exists. No culturally verified test set. No sarcasm… See the full description on the dataset page: https://huggingface.co/datasets/WAZOBIALABS/nigerian-pidgin-eval.mt5_nigerian_pidginDeveloped by rufatronics (Aga) Ahmad Garba Adamu
mt5_nigerian_pidgin
nigerian_pidgin_asr_v2
