tufaax/somali-multilingual-infopankki
Somali Multilingual Infopankki somali-multilingual-infopankki is a parallel corpus containing multilingual translation pairs that involve the Somali (so) language. This dataset has been filtered and extracted from the original Helsinki-NLP/opus_infopankki corpus. It is designed to support machine translation (NMT), multilingual sentence alignment, and Somali natural language processing (NLP) research. Dataset Details Source Dataset: Helsinki-NLP/opus_infopankki… See the full description on the dataset page: https://huggingface.co/datasets/tufaax/somali-multilingual-infopankki.
Somali Multilingual Infopankki
somali-multilingual-infopankki is a parallel corpus containing multilingual translation pairs that involve the Somali (so) language. This dataset has been filtered and extracted from the original Helsinki-NLP/opus_infopankki corpus.
It is designed to support machine translation (NMT), multilingual sentence alignment, and Somali natural language processing (NLP) research.
Dataset Details
- Source Dataset:
Helsinki-NLP/opus_infopankki - Total Rows: 226,212 translation units
- Subsets: 11 configurations containing Somali language pairs (such as
ar-so,fi-so,en-so,sv-so, etc.) - Size: 25.3 MB
How to Use
You can load any subset of this dataset using the Hugging Face datasets library:
from datasets import load_dataset
dataset = load_dataset("tufaax/somali-multilingual-infopankki", "ar-so")
print(dataset["train"][0])