CoolFace
Datasetpublic

Favourez/tupuri_english

French-English to Tupuri Translation Dataset Dataset Summary This dataset provides sentence-level translations from French and English into Tupuri, a low-resource language spoken in northern Cameroon and southwestern Chad. It aims to support research in African language translation and NLP for underrepresented languages. Supported Tasks and Leaderboards Machine Translation: French/English → Tupuri. Multilingual modeling: Useful for zero-shot or… See the full description on the dataset page: https://huggingface.co/datasets/Favourez/tupuri_english.

sourceHugging Facemitupdated 1y agoView on Hugging Face
0likes17downloads
Dataset Card

French-English to Tupuri Translation Dataset

Dataset Summary

This dataset provides sentence-level translations from French and English into Tupuri, a low-resource language spoken in northern Cameroon and southwestern Chad. It aims to support research in African language translation and NLP for underrepresented languages.

Supported Tasks and Leaderboards

  • —Machine Translation: French/English → Tupuri.
  • —Multilingual modeling: Useful for zero-shot or low-resource model training.

Languages

  • —fr: French
  • —en: English
  • —tpi: Tupuri (ISO 639-3: tur)

Dataset Structure

The dataset is in Excel format with the following columns:

french_sentenceenglish_sentencetupuri_sentence
MerciThank youMiindo

Data Splits

All data is currently in one file. Manual splits into train/val/test are recommended.

Usage

python
from datasets import load_dataset

dataset = load_dataset("your-username/fr-en-tupuri-translation")
print(dataset["train"][0])


@dataset{fr_en_tupuri_translation_2025,
  title     = {French-English to Tupuri Translation Dataset},
  author    = {Nopole Flairan, Ngana Noa},
  year      = {2025},
  publisher = {Hugging Face},
  note      = {Low-resource language dataset for Tupuri translation.}
}