CoolFace
Datasetpublic

Klayt/baoule-common-voice

Common Voice — Baoulé (bci) Dataset audio en langue baoulé (code ISO 639-3 : bci), extrait de Mozilla Common Voice. Le baoulé est une langue kwa parlée en Côte d'Ivoire. Splits Split Exemples train ~319 test ~290 validation ~267 Colonnes Colonne Type Description audio Audio Signal 16 kHz mono sentence string Transcription en baoulé client_id string Identifiant anonymisé du locuteur path string Nom du fichier… See the full description on the dataset page: https://huggingface.co/datasets/Klayt/baoule-common-voice.

sourceHugging Facecc0-1.0updated 6mo agoView on Hugging Face
0likes77downloads
Dataset Card

Common Voice — Baoulé (bci)

Dataset audio en langue baoulé (code ISO 639-3 : bci), extrait de Mozilla Common Voice. Le baoulé est une langue kwa parlée en Côte d'Ivoire.

Splits

SplitExemples
train~319
test~290
validation~267

Colonnes

ColonneTypeDescription
audioAudioSignal 16 kHz mono
sentencestringTranscription en baoulé
client_idstringIdentifiant anonymisé du locuteur
pathstringNom du fichier original
localestringbci

Utilisation

python
from datasets import load_dataset

ds = load_dataset("votre-pseudo/baule-common-voice")

# Écouter le premier exemple
sample = ds["train"][0]
print(sample["sentence"])
# → array audio lisible avec IPython.display.Audio ou tout player

# Accéder au signal
array = sample["audio"]["array"]   # np.ndarray float32
sr    = sample["audio"]["sampling_rate"]  # 16000

Caractères spéciaux du baoulé

Ce dataset contient les caractères Unicode spécifiques au baoulé : ɛ, ɔ, ŋ, ʼ ainsi que des voyelles avec tons diacritiques.