CoolFace
Datasetpublic

tufaax/somali-multilingual-infopankki

Somali Multilingual Infopankki somali-multilingual-infopankki is a parallel corpus containing multilingual translation pairs that involve the Somali (so) language. This dataset has been filtered and extracted from the original Helsinki-NLP/opus_infopankki corpus. It is designed to support machine translation (NMT), multilingual sentence alignment, and Somali natural language processing (NLP) research. Dataset Details Source Dataset: Helsinki-NLP/opus_infopankki… See the full description on the dataset page: https://huggingface.co/datasets/tufaax/somali-multilingual-infopankki.

sourceHugging Facecc-by-4.0updated 2mo agoView on Hugging Face
0likes114downloads
Dataset Card

Somali Multilingual Infopankki

somali-multilingual-infopankki is a parallel corpus containing multilingual translation pairs that involve the Somali (so) language. This dataset has been filtered and extracted from the original Helsinki-NLP/opus_infopankki corpus.

It is designed to support machine translation (NMT), multilingual sentence alignment, and Somali natural language processing (NLP) research.

Dataset Details

  • —Source Dataset: Helsinki-NLP/opus_infopankki
  • —Total Rows: 226,212 translation units
  • —Subsets: 11 configurations containing Somali language pairs (such as ar-so, fi-so, en-so, sv-so, etc.)
  • —Size: 25.3 MB

How to Use

You can load any subset of this dataset using the Hugging Face datasets library:

python
from datasets import load_dataset

dataset = load_dataset("tufaax/somali-multilingual-infopankki", "ar-so")
print(dataset["train"][0])