datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
final_pidgin9jalingo-reviewed-pidginnigerian-pidgin-1.0
Language:
- Nigerian Pidgin English (West African Pidgin variant)
Dataset Description
Dataset Summary
The Nigerian Pidgin ASR dataset (v1.0) is the first publicly released speech-to-text corpus for Nigerian Pidgin English, a widely spoken lingua franca across Nigeria and West Africa. This dataset comprises over 3,000 audio recordings paired with sentence-level transcriptions, recorded by native speakers across different genders and age groups. It is tailored for… See the full description on the dataset page: https://huggingface.co/datasets/asr-nigerian-pidgin/nigerian-pidgin-1.0.Pidgin_ASR_Dataset_Combined
Naija-ASR-Corpus v1.0 (NAC-v1.0)
A Foundational Automatic Speech Recognition Corpus for Nigerian Pidgin (Naija, PCM)
📌 Dataset Summary
Naija-ASR-Corpus (NAC-v1.0) is a speech dataset derived from the Universal Dependencies Naija Spoken Corpus (UD_Naija-NSC).
The NAC Team processed the original long-form recordings by:
Segmenting the audio into sentence-level clips.
Transcribing/Aligning the text to create paired audio-text data suitable for ASR training.
This dataset… See the full description on the dataset page: https://huggingface.co/datasets/timniel/Pidgin_ASR_Dataset_Combined.Pidgin_ASR_Dataset_Combined
Naija-ASR-Corpus v1.0 (NAC-v1.0)
A Foundational Automatic Speech Recognition Corpus for Nigerian Pidgin (Naija, PCM)
📌 Dataset Summary
Naija-ASR-Corpus (NAC-v1.0) is a speech dataset derived from the Universal Dependencies Naija Spoken Corpus (UD_Naija-NSC).
The NAC Team processed the original long-form recordings by:
Segmenting the audio into sentence-level clips.
Transcribing/Aligning the text to create paired audio-text data suitable for ASR training.
This dataset… See the full description on the dataset page: https://huggingface.co/datasets/AnonXx/Pidgin_ASR_Dataset_Combined.pidgin-asr-combined
Pidgin ASR Combined
A unified Nigerian Pidgin English speech-to-text dataset that combines
publicly available Pidgin ASR sources into a single train / validation /
test setup with a consistent schema. Built for fine-tuning Whisper-family
models on Nigerian Pidgin (Naija, pcm).
~8.6 hours, 4,278 clips, 10 source speakers, 16 kHz mono WAV.
Used to train michaelodafe/whisper-pidgin-v1
(21.37% WER on the test split, beating the published Wav2Vec2-XLSR-53
baseline by 8.2 pp).… See the full description on the dataset page: https://huggingface.co/datasets/michaelodafe/pidgin-asr-combined.english-nigerian-pidgin_sentence-pairs_mt560
English-Nigerian Pidgin Parallel Dataset
This dataset contains parallel sentences in English and Nigerian Pidgin (Nigeria).
Dataset Information
Language Pair: English ↔ Nigerian Pidgin
Language Code: pcm
Country: Nigeria
Original Source: OPUS MT560 Dataset
Dataset Structure
The dataset contains parallel sentences that can be used for:
Machine translation training
Cross-lingual NLP tasks
Language model fine-tuning
Citation
If you use this dataset… See the full description on the dataset page: https://huggingface.co/datasets/michsethowusu/english-nigerian-pidgin_sentence-pairs_mt560.pidginData
Naija-ASR-Corpus v2.0 (NAC-v2.0)
A Foundational Automatic Speech Recognition Corpus for Nigerian Pidgin (Naija, PCM)
📌 Dataset Summary
Naija-ASR-Corpus (NAC-v2.0) is a speech dataset derived from the Universal
Dependencies Naija Spoken Corpus (UD_Naija-NSC).
The NAC Team processed the original long-form recordings by:
Segmenting the audio into sentence-level clips.
Aligning each clip to its transcript (text_ortho) from the CoNLL-U source.
Tagging each sample… See the full description on the dataset page: https://huggingface.co/datasets/voicedata/pidginData.nigerian-pidgin-speech
Nigerian Pidgin Audio + Text Dataset for Whisper Fine-tuning
Nigerian Pidgin speech dataset for Whisper fine-tuning
Dataset Summary
This dataset contains audio recordings and transcriptions in Nigerian Pidgin English, designed for fine-tuning speech recognition models, particularly OpenAI's Whisper.
Dataset Structure
Train Split: 65 samples
Test Split: 8 samples
Total Duration: 0.0 hours (estimated)
Average Duration: 2.4 seconds per sample
Sample Rate: 16kHz… See the full description on the dataset page: https://huggingface.co/datasets/Rexe/nigerian-pidgin-speech.celeb_pidginen-pidgin-all-audio-57minseng-pidgin-tts-july
eng-pidgin-tts-july
Local TTS dataset uploaded from this repository.
Source
Data dir: /home/ml/workspaces/kashish/data-creation/data-prep-eleven-labs/output/combined_july7
CSV: /home/ml/workspaces/kashish/data-creation/data-prep-eleven-labs/output/combined_july7/data.csv
Transcript column: transcript
Speaker column: speaker
Audio sample rate: 24000
Columns
Column
Description
audio
Local WAV file uploaded as Hugging Face audio feature… See the full description on the dataset page: https://huggingface.co/datasets/vaghawan/eng-pidgin-tts-july.english-cameroon-pidgin_sentence-pairs_mt560
English-Cameroon Pidgin Parallel Dataset
This dataset contains parallel sentences in English and Cameroon Pidgin (Cameroon).
Dataset Information
Language Pair: English ↔ Cameroon Pidgin
Language Code: wes
Country: Cameroon
Original Source: OPUS MT560 Dataset
Dataset Structure
The dataset contains parallel sentences that can be used for:
Machine translation training
Cross-lingual NLP tasks
Language model fine-tuning
Citation
If you use this… See the full description on the dataset page: https://huggingface.co/datasets/michsethowusu/english-cameroon-pidgin_sentence-pairs_mt560.PidginMed-ASR
PidginMed-ASR
PidginMed-ASR is a Nigerian Pidgin English medical speech benchmark for automatic speech recognition.
Dataset Structure
The dataset contains audio recordings paired with Nigerian Pidgin transcriptions and English source translations.
Column
Description
audio
Path to audio file
transcription
Nigerian Pidgin transcript
english_translation
Original English text
speaker_id
Anonymized speaker ID
duration
Audio duration
split
Train, validation… See the full description on the dataset page: https://huggingface.co/datasets/AnnonSubmit/PidginMed-ASR.pidgin-to-englishen-pidgin-high-similarity-11-35minsnigerian_pidgin_asr_v2unfiltered-pidgin-english-lexicon
Dataset Summary
The unfiltered-pidgin-english-lexicon is a specialized dictionary dataset mapping West African Pidgin English terms to their English meanings. It contains 1,874 unique pidgin terms alongside localized definitions, serving as a foundational resource for Natural Language Processing (NLP) tasks involving low-resource West African creoles and pidgins (specifically Nigerian Pidgin/Naija, pcm).
The primary data source is compiled from Naijalingo.
Dataset… See the full description on the dataset page: https://huggingface.co/datasets/prince4332/unfiltered-pidgin-english-lexicon.eng-pidgin-mispronounced-data
eng-pidgin-mispronounced-data
Local TTS dataset uploaded from this repository.
Source
Data dir: /home/ml/workspaces/kashish/data-creation/data-prep-eleven-labs/output/mtn_mispronounced_words_2_from_combined_july7
CSV: output/mtn_mispronounced_words_2_from_combined_july7/data.csv
Transcript column: transcript
Speaker column: speaker
Audio sample rate: 24000
Columns
Column
Description
audio
Local WAV file uploaded as Hugging Face audio… See the full description on the dataset page: https://huggingface.co/datasets/vaghawan/eng-pidgin-mispronounced-data.farma-agri-yoruba-pidginunfiltered-pidgin-english-lexicon
Dataset Summary
The unfiltered-pidgin-english-lexicon is a specialized dictionary dataset mapping West African Pidgin English terms to their English meanings. It contains 1,874 unique pidgin terms alongside localized definitions, serving as a foundational resource for Natural Language Processing (NLP) tasks involving low-resource West African creoles and pidgins (specifically Nigerian Pidgin/Naija, pcm).
The primary data source is compiled from Naijalingo.
Dataset… See the full description on the dataset page: https://huggingface.co/datasets/ananselabs/unfiltered-pidgin-english-lexicon.Pidgin_English_AmazonMTurk
