CoolFace
7 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01asr-nigerian-pidgin /nigerian-pidgin-1.0 Language: - Nigerian Pidgin English (West African Pidgin variant) Dataset Description Dataset Summary The Nigerian Pidgin ASR dataset (v1.0) is the first publicly released speech-to-text corpus for Nigerian Pidgin English, a widely spoken lingua franca across Nigeria and West Africa. This dataset comprises over 3,000 audio recordings paired with sentence-level transcriptions, recorded by native speakers across different genders and age groups. It is tailored for… See the full description on the dataset page: https://huggingface.co/datasets/asr-nigerian-pidgin/nigerian-pidgin-1.0.audioautomatic-speech-recognition1K<n<10K2 likes121 downloads1y agoHugging Face02timniel /Pidgin_ASR_Dataset_Combined Naija-ASR-Corpus v1.0 (NAC-v1.0) A Foundational Automatic Speech Recognition Corpus for Nigerian Pidgin (Naija, PCM) 📌 Dataset Summary Naija-ASR-Corpus (NAC-v1.0) is a speech dataset derived from the Universal Dependencies Naija Spoken Corpus (UD_Naija-NSC). The NAC Team processed the original long-form recordings by: Segmenting the audio into sentence-level clips. Transcribing/Aligning the text to create paired audio-text data suitable for ASR training. This dataset… See the full description on the dataset page: https://huggingface.co/datasets/timniel/Pidgin_ASR_Dataset_Combined.audioautomatic-speech-recognition1K<n<10K0 likes120 downloads10mo agoHugging Face03AnonXx /Pidgin_ASR_Dataset_Combined Naija-ASR-Corpus v1.0 (NAC-v1.0) A Foundational Automatic Speech Recognition Corpus for Nigerian Pidgin (Naija, PCM) 📌 Dataset Summary Naija-ASR-Corpus (NAC-v1.0) is a speech dataset derived from the Universal Dependencies Naija Spoken Corpus (UD_Naija-NSC). The NAC Team processed the original long-form recordings by: Segmenting the audio into sentence-level clips. Transcribing/Aligning the text to create paired audio-text data suitable for ASR training. This dataset… See the full description on the dataset page: https://huggingface.co/datasets/AnonXx/Pidgin_ASR_Dataset_Combined.audioautomatic-speech-recognition1K<n<10K1 likes108 downloads6mo agoHugging Face04michaelodafe /pidgin-asr-combined Pidgin ASR Combined A unified Nigerian Pidgin English speech-to-text dataset that combines publicly available Pidgin ASR sources into a single train / validation / test setup with a consistent schema. Built for fine-tuning Whisper-family models on Nigerian Pidgin (Naija, pcm). ~8.6 hours, 4,278 clips, 10 source speakers, 16 kHz mono WAV. Used to train michaelodafe/whisper-pidgin-v1 (21.37% WER on the test split, beating the published Wav2Vec2-XLSR-53 baseline by 8.2 pp).… See the full description on the dataset page: https://huggingface.co/datasets/michaelodafe/pidgin-asr-combined.audioautomatic-speech-recognition1K<n<10K1 likes95 downloads4mo agoHugging Face05voicedata /pidginData Naija-ASR-Corpus v2.0 (NAC-v2.0) A Foundational Automatic Speech Recognition Corpus for Nigerian Pidgin (Naija, PCM) 📌 Dataset Summary Naija-ASR-Corpus (NAC-v2.0) is a speech dataset derived from the Universal Dependencies Naija Spoken Corpus (UD_Naija-NSC). The NAC Team processed the original long-form recordings by: Segmenting the audio into sentence-level clips. Aligning each clip to its transcript (text_ortho) from the CoNLL-U source. Tagging each sample… See the full description on the dataset page: https://huggingface.co/datasets/voicedata/pidginData.audioautomatic-speech-recognition1K<n<10K0 likes72 downloads24d agoHugging Face06Rexe /nigerian-pidgin-speech Nigerian Pidgin Audio + Text Dataset for Whisper Fine-tuning Nigerian Pidgin speech dataset for Whisper fine-tuning Dataset Summary This dataset contains audio recordings and transcriptions in Nigerian Pidgin English, designed for fine-tuning speech recognition models, particularly OpenAI's Whisper. Dataset Structure Train Split: 65 samples Test Split: 8 samples Total Duration: 0.0 hours (estimated) Average Duration: 2.4 seconds per sample Sample Rate: 16kHz… See the full description on the dataset page: https://huggingface.co/datasets/Rexe/nigerian-pidgin-speech.audioautomatic-speech-recognitionn<1K1 likes39 downloads1y agoHugging Face07AnnonSubmit /PidginMed-ASR PidginMed-ASR PidginMed-ASR is a Nigerian Pidgin English medical speech benchmark for automatic speech recognition. Dataset Structure The dataset contains audio recordings paired with Nigerian Pidgin transcriptions and English source translations. Column Description audio Path to audio file transcription Nigerian Pidgin transcript english_translation Original English text speaker_id Anonymized speaker ID duration Audio duration split Train, validation… See the full description on the dataset page: https://huggingface.co/datasets/AnnonSubmit/PidginMed-ASR.audioautomatic-speech-recognition1K<n<10K0 likes25 downloads5mo agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.