Bambara
Datasets
All datasets matching “Bambara”Bambara-Speech-Translation-Data
AfVoices-Translated (Bambara-English)
This is a Bambara speech translation dataset, which is built on the African Next Voices (AfVoices) Bambara ASR corpus. It provides English translations for the human-corrected subset of the original collection, creating a parallel corpus for Bambara-English machine translation and speech-to-text tasks.
Methodology
We machine-translated the human-validated transcriptions from AfVoices using the Oolel-translator repository.
Inference… See the full description on the dataset page: https://huggingface.co/datasets/soynade-research/Bambara-Speech-Translation-Data.bambara-whisper-featuresmerged-bambara-dioula-datasetmerged-bambara-dioula-datasetBambara_AudioSynthetique_42K_V3
Description
Ce corpus comprend 42 000 entrées audio synthétiques en langue Bambara (bm), totalisant environ 44,4 heures d'enregistrement. Cette version 3 a été convertie au format Parquet pour optimiser les performances de lecture et garantir une compatibilité totale avec le Dataset Viewer de Hugging Face.
Origine et Traitement des Données Textuelles
Le corpus de texte a été constitué par l'agrégation de plusieurs sources linguistiques afin de garantir un volume suffisant… See the full description on the dataset page: https://huggingface.co/datasets/OumarDicko/Bambara_AudioSynthetique_42K_V3.Bambara_Translation_Corpus_FR-BM
🌍 Bambara Translation Corpus: Direct & Instruction-Tuned (FR-BM)
🚀 Overview & Vision
The Bambara Translation Corpus is a comprehensive bilingual dataset designed to bridge French and Bamanankan across two distinct paradigms: Direct Neural Machine Translation (NMT) and Prompt-Based Instruction Tuning.
This dual-mode architecture caters to both traditional seq2seq translation models and modern instruction-tuned Large Language Models (LLMs).
📊 Dataset… See the full description on the dataset page: https://huggingface.co/datasets/Makan09/Bambara_Translation_Corpus_FR-BM.
