CoolFace
Datasetpublic

taqbaylit/common-voice-scripted-speech-kab-26-huge

Common Voice Scripted Speech 26.0 - Kabyle (Huge, Cleaned) Full cleaned dataset of Mozilla Common Voice 26.0 for Kabyle (Taqbaylit) ASR. No speaker cap, no splits — all validated, cleaned, GlotLID-filtered clips. Source Original: Mozilla Common Voice 26.0 (cv-corpus-26.0-2026-06-12) Dataset ID: cmqim4fux00tynq07ljtyhzfh (Mozilla Data Collective) License: CC0-1.0 Generated: 2026-07-12 Cleaning Pipeline Quality filter: ≥2 upvotes, 0 downvotes… See the full description on the dataset page: https://huggingface.co/datasets/taqbaylit/common-voice-scripted-speech-kab-26-huge.

sourceHugging Facecc0-1.0updated 3mo agoView on Hugging Face
0likes336downloads
Dataset Card

Common Voice Scripted Speech 26.0 - Kabyle (Huge, Cleaned)

Full cleaned dataset of Mozilla Common Voice 26.0 for Kabyle (Taqbaylit) ASR. No speaker cap, no splits — all validated, cleaned, GlotLID-filtered clips.

Source

  • —Original: Mozilla Common Voice 26.0 (cv-corpus-26.0-2026-06-12)
  • —Dataset ID: cmqim4fux00tynq07ljtyhzfh (Mozilla Data Collective)
  • —License: CC0-1.0
  • —Generated: 2026-07-12

Cleaning Pipeline

  1. 1.Quality filter: ≥2 upvotes, 0 downvotes
  2. 2.Character cleaning: Fixed 29 false friend types (Greek/Cyrillic epsilon → ɛ/Ɛ, gamma → ɣ/Ɣ, etc.)
  3. 3.Language filtering: GlotLID v3 (kab_Latn ≥ 0.95)

Statistics

MetricValue
Total clips567,727
Hours~520.4
Speakers1,330
Avg clip duration~3.3s

Usage

python
from datasets import load_dataset
ds = load_dataset("boffire/common-voice-scripted-speech-kab-26-huge", split="train")

Audio Format

  • —Sampling rate: 16,000 Hz
  • —Format: MP3 (original), decoded to float32 arrays

Citation

Mozilla Common Voice: https://commonvoice.mozilla.org/