Favourez/tupuri_english
French-English to Tupuri Translation Dataset Dataset Summary This dataset provides sentence-level translations from French and English into Tupuri, a low-resource language spoken in northern Cameroon and southwestern Chad. It aims to support research in African language translation and NLP for underrepresented languages. Supported Tasks and Leaderboards Machine Translation: French/English → Tupuri. Multilingual modeling: Useful for zero-shot or… See the full description on the dataset page: https://huggingface.co/datasets/Favourez/tupuri_english.
French-English to Tupuri Translation Dataset
Dataset Summary
This dataset provides sentence-level translations from French and English into Tupuri, a low-resource language spoken in northern Cameroon and southwestern Chad. It aims to support research in African language translation and NLP for underrepresented languages.
Supported Tasks and Leaderboards
- Machine Translation: French/English → Tupuri.
- Multilingual modeling: Useful for zero-shot or low-resource model training.
Languages
fr: Frenchen: Englishtpi: Tupuri (ISO 639-3: tur)
Dataset Structure
The dataset is in Excel format with the following columns:
Data Splits
All data is currently in one file. Manual splits into train/val/test are recommended.
Usage
from datasets import load_dataset
dataset = load_dataset("your-username/fr-en-tupuri-translation")
print(dataset["train"][0])
@dataset{fr_en_tupuri_translation_2025,
title = {French-English to Tupuri Translation Dataset},
author = {Nopole Flairan, Ngana Noa},
year = {2025},
publisher = {Hugging Face},
note = {Low-resource language dataset for Tupuri translation.}
}
