TajikNLPWorld/TajPersParallelCorpus
Dataset Card for Tajik–Persian Parallel Corpus Dataset Details Dataset Description The Tajik–Persian Parallel Corpus is a large-scale parallel corpus containing 328,253 aligned Tajik–Persian sentence pairs collected from multiple sources, including news, poetry, prose, lexical resources, and named-entity lists. It is intended for machine translation, cross-lingual retrieval, linguistic analysis, tokenizer evaluation, and other NLP tasks. Curated… See the full description on the dataset page: https://huggingface.co/datasets/TajikNLPWorld/TajPersParallelCorpus.
027
No card is published for this repository, or it could not be fetched from Hugging Face right now.
