datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
kulyk-bidirectionalkulyk-bidirectional-gemmakurdish-bidirectional-translation-v2pristine-twi-english-bidirectional-multilen
This dataset is shared under CC BY-NC 4.0, which means you are free to use, share, and adapt it for non-commercial research and educational purposes with attribution. You can read the full license at https://creativecommons.org/licenses/by-nc/4.0/.
Twi ↔ English Bidirectional MT Dataset
Derived from ghananlpcommunity/pristine-twi-english.
Schema
Field
Type
Description
source
string
Source text (no prefix token)
target
string
Clean target translation… See the full description on the dataset page: https://huggingface.co/datasets/ghananlpcommunity/pristine-twi-english-bidirectional-multilen.glossa-bidirectional-t5-bart-splitmtet-vi-en-bidirectional
MTET Vietnamese–English Bidirectional Dataset (Cleaned)
This is the cleaned, bidirectional version of the MTET (Machine Translation Evaluation for Translation) Vietnamese–English parallel corpus used to train the vi-en-transformer-25m model.
Files
File
Description
mtet_bidirectional_cleaned.csv
Main training data (bidirectional, cleaned)
Usage
import pandas as pd
df = pd.read_csv("mtet_bidirectional_cleaned.csv")
print(df.head())
# source… See the full description on the dataset page: https://huggingface.co/datasets/Cong123779/mtet-vi-en-bidirectional.nepali-english-bidirectionalitsbib-nepali-english-bidirectional-1path_selection_bidirectionality_4english_bangla_nmt_datasets_bidirectional_v2path_selection_bidirectionality_5glossa-bidirectional-t5-bartglossa-bidirectional-llamapath_selection_bidirectionality_3glossa-bidirectional-llama-splitpath_selection_bidirectionality_1path_selection_bidirectionality_and_connection_understanding_8vlsp-en-vi-bidirectional-sftkurdish-bidirectional-translation-finall
Kurdish Bidirectional Translation Dataset
Overview
This dataset contains bidirectional translation pairs for Kurdish (Central Kurdish - Sorani script) with English, Arabic, and Persian.
Each sample includes:
translation: Forward translation (Source → Kurdish)
back_translation: Reverse translation (Kurdish → Source)
Dataset Details
Total Samples: 627,103
Languages: Kurdish (ckb), English (en), Arabic (ar), Persian (fa)
Format: JSON conversations with… See the full description on the dataset page: https://huggingface.co/datasets/shiima/kurdish-bidirectional-translation-finall.path_selection_bidirectionality_7path_selection_bidirectionality_and_connection_understanding_mastervlsp-en-vi-bidirectional-grpowar_eng_bidirectional
