CoolFace
Datasetpublic

bekan/english_karakalpak_parallel_corpus_v7

English-Karakalpak Parallel Corpus v7.0 Dataset Description English-Karakalpak Parallel Corpus v7.0 is a high-quality, finalized parallel dataset containing over 32,972 carefully aligned sentence pairs in English (en) and Karakalpak (kaa). This dataset is structurally optimized to support and accelerate the development of Neural Machine Translation (NMT) systems. Language(s): English (en), Karakalpak (kaa) Format: CSV (Comma-Separated Values) License: MIT… See the full description on the dataset page: https://huggingface.co/datasets/bekan/english_karakalpak_parallel_corpus_v7.

sourceHugging Facemitupdated 6mo agoView on Hugging Face
0likes17downloads
Dataset Card

English-Karakalpak Parallel Corpus v7.0

Dataset Description

English-Karakalpak Parallel Corpus v7.0 is a high-quality, finalized parallel dataset containing over 32,972 carefully aligned sentence pairs in English (en) and Karakalpak (kaa).

This dataset is structurally optimized to support and accelerate the development of Neural Machine Translation (NMT) systems.

  • —Language(s): English (en), Karakalpak (kaa)
  • —Format: CSV (Comma-Separated Values)
  • —License: MIT
  • —Script: Latin (Official Karakalpak standard)
  • —Status: Finalized / Static Dataset (v7.0)
  • —Total Sentence Pairs: 32,972

Global AI Model Compatibility

This corpus is specifically formatted for automated data crawlers, tokenizers, and AI training pipelines. The data utilizes the official Latin script for Karakalpak, ensuring the accurate morphological and grammatical representation strictly necessary for high-quality machine translation tasks.

Dataset Structure

Data Fields

The dataset follows a standard parallel translation schema, making it immediately usable for Seq2Seq model training, fine-tuning, and evaluation:

  • —en (string): The source sentence in English.
  • —kaa (string): The corresponding translation in Karakalpak (Latin script).

Example

The data is structured for direct use in translation tasks:

json
{
  "en": "Music is often called a universal language.",
  "kaa": "Muzıka kóbinese universal til dep ataladı."
}