CoolFace
22 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01voicedata /final_pidgingatedaudio100K<n<1M0 likes191 downloads18d agoHugging Face02voicedata /9jalingo-reviewed-pidginaudion<1K0 likes137 downloads10d agoHugging Face03asr-nigerian-pidgin /nigerian-pidgin-1.0 Language: - Nigerian Pidgin English (West African Pidgin variant) Dataset Description Dataset Summary The Nigerian Pidgin ASR dataset (v1.0) is the first publicly released speech-to-text corpus for Nigerian Pidgin English, a widely spoken lingua franca across Nigeria and West Africa. This dataset comprises over 3,000 audio recordings paired with sentence-level transcriptions, recorded by native speakers across different genders and age groups. It is tailored for… See the full description on the dataset page: https://huggingface.co/datasets/asr-nigerian-pidgin/nigerian-pidgin-1.0.audioautomatic-speech-recognition1K<n<10K2 likes132 downloads1y agoHugging Face04timniel /Pidgin_ASR_Dataset_Combined Naija-ASR-Corpus v1.0 (NAC-v1.0) A Foundational Automatic Speech Recognition Corpus for Nigerian Pidgin (Naija, PCM) 📌 Dataset Summary Naija-ASR-Corpus (NAC-v1.0) is a speech dataset derived from the Universal Dependencies Naija Spoken Corpus (UD_Naija-NSC). The NAC Team processed the original long-form recordings by: Segmenting the audio into sentence-level clips. Transcribing/Aligning the text to create paired audio-text data suitable for ASR training. This dataset… See the full description on the dataset page: https://huggingface.co/datasets/timniel/Pidgin_ASR_Dataset_Combined.audioautomatic-speech-recognition1K<n<10K0 likes124 downloads10mo agoHugging Face05AnonXx /Pidgin_ASR_Dataset_Combined Naija-ASR-Corpus v1.0 (NAC-v1.0) A Foundational Automatic Speech Recognition Corpus for Nigerian Pidgin (Naija, PCM) 📌 Dataset Summary Naija-ASR-Corpus (NAC-v1.0) is a speech dataset derived from the Universal Dependencies Naija Spoken Corpus (UD_Naija-NSC). The NAC Team processed the original long-form recordings by: Segmenting the audio into sentence-level clips. Transcribing/Aligning the text to create paired audio-text data suitable for ASR training. This dataset… See the full description on the dataset page: https://huggingface.co/datasets/AnonXx/Pidgin_ASR_Dataset_Combined.audioautomatic-speech-recognition1K<n<10K1 likes114 downloads6mo agoHugging Face06michaelodafe /pidgin-asr-combined Pidgin ASR Combined A unified Nigerian Pidgin English speech-to-text dataset that combines publicly available Pidgin ASR sources into a single train / validation / test setup with a consistent schema. Built for fine-tuning Whisper-family models on Nigerian Pidgin (Naija, pcm). ~8.6 hours, 4,278 clips, 10 source speakers, 16 kHz mono WAV. Used to train michaelodafe/whisper-pidgin-v1 (21.37% WER on the test split, beating the published Wav2Vec2-XLSR-53 baseline by 8.2 pp).… See the full description on the dataset page: https://huggingface.co/datasets/michaelodafe/pidgin-asr-combined.audioautomatic-speech-recognition1K<n<10K1 likes104 downloads5mo agoHugging Face07michsethowusu /english-nigerian-pidgin_sentence-pairs_mt560 English-Nigerian Pidgin Parallel Dataset This dataset contains parallel sentences in English and Nigerian Pidgin (Nigeria). Dataset Information Language Pair: English ↔ Nigerian Pidgin Language Code: pcm Country: Nigeria Original Source: OPUS MT560 Dataset Dataset Structure The dataset contains parallel sentences that can be used for: Machine translation training Cross-lingual NLP tasks Language model fine-tuning Citation If you use this dataset… See the full description on the dataset page: https://huggingface.co/datasets/michsethowusu/english-nigerian-pidgin_sentence-pairs_mt560.text10K<n<100K1 likes82 downloads1y agoHugging Face08voicedata /pidginData Naija-ASR-Corpus v2.0 (NAC-v2.0) A Foundational Automatic Speech Recognition Corpus for Nigerian Pidgin (Naija, PCM) 📌 Dataset Summary Naija-ASR-Corpus (NAC-v2.0) is a speech dataset derived from the Universal Dependencies Naija Spoken Corpus (UD_Naija-NSC). The NAC Team processed the original long-form recordings by: Segmenting the audio into sentence-level clips. Aligning each clip to its transcript (text_ortho) from the CoNLL-U source. Tagging each sample… See the full description on the dataset page: https://huggingface.co/datasets/voicedata/pidginData.audioautomatic-speech-recognition1K<n<10K0 likes72 downloads26d agoHugging Face09Rexe /nigerian-pidgin-speech Nigerian Pidgin Audio + Text Dataset for Whisper Fine-tuning Nigerian Pidgin speech dataset for Whisper fine-tuning Dataset Summary This dataset contains audio recordings and transcriptions in Nigerian Pidgin English, designed for fine-tuning speech recognition models, particularly OpenAI's Whisper. Dataset Structure Train Split: 65 samples Test Split: 8 samples Total Duration: 0.0 hours (estimated) Average Duration: 2.4 seconds per sample Sample Rate: 16kHz… See the full description on the dataset page: https://huggingface.co/datasets/Rexe/nigerian-pidgin-speech.audioautomatic-speech-recognitionn<1K1 likes40 downloads1y agoHugging Face10okezieowen /celeb_pidginaudio1K<n<10K0 likes37 downloads1y agoHugging Face11vaghawan /en-pidgin-all-audio-57minsaudion<1K0 likes37 downloads2mo agoHugging Face12vaghawan /eng-pidgin-tts-july eng-pidgin-tts-july Local TTS dataset uploaded from this repository. Source Data dir: /home/ml/workspaces/kashish/data-creation/data-prep-eleven-labs/output/combined_july7 CSV: /home/ml/workspaces/kashish/data-creation/data-prep-eleven-labs/output/combined_july7/data.csv Transcript column: transcript Speaker column: speaker Audio sample rate: 24000 Columns Column Description audio Local WAV file uploaded as Hugging Face audio feature… See the full description on the dataset page: https://huggingface.co/datasets/vaghawan/eng-pidgin-tts-july.audio1K<n<10K0 likes30 downloads3mo agoHugging Face13michsethowusu /english-cameroon-pidgin_sentence-pairs_mt560 English-Cameroon Pidgin Parallel Dataset This dataset contains parallel sentences in English and Cameroon Pidgin (Cameroon). Dataset Information Language Pair: English ↔ Cameroon Pidgin Language Code: wes Country: Cameroon Original Source: OPUS MT560 Dataset Dataset Structure The dataset contains parallel sentences that can be used for: Machine translation training Cross-lingual NLP tasks Language model fine-tuning Citation If you use this… See the full description on the dataset page: https://huggingface.co/datasets/michsethowusu/english-cameroon-pidgin_sentence-pairs_mt560.text10K<n<100K1 likes29 downloads1y agoHugging Face14AnnonSubmit /PidginMed-ASR PidginMed-ASR PidginMed-ASR is a Nigerian Pidgin English medical speech benchmark for automatic speech recognition. Dataset Structure The dataset contains audio recordings paired with Nigerian Pidgin transcriptions and English source translations. Column Description audio Path to audio file transcription Nigerian Pidgin transcript english_translation Original English text speaker_id Anonymized speaker ID duration Audio duration split Train, validation… See the full description on the dataset page: https://huggingface.co/datasets/AnnonSubmit/PidginMed-ASR.audioautomatic-speech-recognition1K<n<10K0 likes29 downloads5mo agoHugging Face15Tommy0201 /pidgin-to-englishtext100K<n<1M8 likes27 downloads3y agoHugging Face16vaghawan /en-pidgin-high-similarity-11-35minsaudion<1K0 likes26 downloads2mo agoHugging Face17grazef6 /nigerian_pidgin_asr_v2audio1K<n<10K0 likes13 downloads10mo agoHugging Face18prince4332 /unfiltered-pidgin-english-lexicon Dataset Summary The unfiltered-pidgin-english-lexicon is a specialized dictionary dataset mapping West African Pidgin English terms to their English meanings. It contains 1,874 unique pidgin terms alongside localized definitions, serving as a foundational resource for Natural Language Processing (NLP) tasks involving low-resource West African creoles and pidgins (specifically Nigerian Pidgin/Naija, pcm). The primary data source is compiled from Naijalingo. Dataset… See the full description on the dataset page: https://huggingface.co/datasets/prince4332/unfiltered-pidgin-english-lexicon.texttranslation1K<n<10K0 likes13 downloads4mo agoHugging Face19vaghawan /eng-pidgin-mispronounced-data eng-pidgin-mispronounced-data Local TTS dataset uploaded from this repository. Source Data dir: /home/ml/workspaces/kashish/data-creation/data-prep-eleven-labs/output/mtn_mispronounced_words_2_from_combined_july7 CSV: output/mtn_mispronounced_words_2_from_combined_july7/data.csv Transcript column: transcript Speaker column: speaker Audio sample rate: 24000 Columns Column Description audio Local WAV file uploaded as Hugging Face audio… See the full description on the dataset page: https://huggingface.co/datasets/vaghawan/eng-pidgin-mispronounced-data.audion<1K0 likes13 downloads3mo agoHugging Face20Jesujuwon /farma-agri-yoruba-pidgintextn<1K0 likes11 downloads6mo agoHugging Face21ananselabs /unfiltered-pidgin-english-lexicon Dataset Summary The unfiltered-pidgin-english-lexicon is a specialized dictionary dataset mapping West African Pidgin English terms to their English meanings. It contains 1,874 unique pidgin terms alongside localized definitions, serving as a foundational resource for Natural Language Processing (NLP) tasks involving low-resource West African creoles and pidgins (specifically Nigerian Pidgin/Naija, pcm). The primary data source is compiled from Naijalingo. Dataset… See the full description on the dataset page: https://huggingface.co/datasets/ananselabs/unfiltered-pidgin-english-lexicon.texttranslation1K<n<10K0 likes11 downloads3mo agoHugging Face22Tommy0201 /Pidgin_English_AmazonMTurktext10K<n<100K1 likes9 downloads2y agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.