CoolFace
Datasetpublic

Pangeanic/Cantonese-Japanese-Machine-Translation-Corpus-text

PangeanicYueJa - Cantonese Japanese Parallel Corpus PangeanicYueJa is a Cantonese-Japanese parallel corpus designed for machine translation, multilingual large language model (LLM) training, cross-lingual NLP research, retrieval-augmented generation (RAG), bilingual embeddings, instruction tuning, and multilingual AI systems. This release contains 55,000 Cantonese-Japanese sentence pairs sampled from a larger corpus of approximately 3.08 million parallel sentence pairs. For the… See the full description on the dataset page: https://huggingface.co/datasets/Pangeanic/Cantonese-Japanese-Machine-Translation-Corpus-text.

sourceHugging Facecc-by-4.0updated 3mo agoView on Hugging Face
5likes100downloads
Dataset Card

PangeanicYueJa - Cantonese Japanese Parallel Corpus

PangeanicYueJa is a Cantonese-Japanese parallel corpus designed for machine translation, multilingual large language model (LLM) training, cross-lingual NLP research, retrieval-augmented generation (RAG), bilingual embeddings, instruction tuning, and multilingual AI systems.

This release contains 55,000 Cantonese-Japanese sentence pairs sampled from a larger corpus of approximately 3.08 million parallel sentence pairs. For the complete dataset, please contact Pangeanic

The dataset focuses specifically on written Cantonese (Yue Chinese) paired with Japanese translations, providing valuable training data for multilingual AI systems working with two important East Asian languages.


Why Cantonese and Japanese Matter for AI

Both Cantonese and Japanese are widely used languages with significant cultural, economic, and technological importance.

While Japanese is relatively well represented in NLP resources, direct Cantonese-Japanese parallel data remains scarce. Most multilingual systems rely heavily on English as an intermediary language.

This dataset provides direct sentence-level alignment between Cantonese and Japanese, enabling:

  • —Cantonese ↔ Japanese machine translation
  • —multilingual LLM training
  • —cross-lingual retrieval
  • —bilingual embeddings
  • —conversational AI
  • —multilingual search systems

Dataset Overview

AttributeDescription
Language PairCantonese (Yue) ↔ Japanese
Dataset TypeParallel Corpus
ModalityText
TaskMachine Translation
FormatParquet
Dataset Size55,000 Sentence Pairs
ScriptTraditional Chinese / Japanese
DomainMixed Web Content
ProviderIndependent Dataset Release

Dataset Structure

The dataset contains two columns:

ColumnDescription
sourceCantonese sentence (Traditional Chinese)
targetJapanese translation

Example Usage

python
from datasets import load_dataset

dataset = load_dataset("Pangeanic/Cantonese-Japanese-Machine-Translation-Corpus-text")

print(dataset["train"][0])

AI and LLM Use Cases

This dataset is suitable for:

  • —Cantonese-Japanese machine translation
  • —Japanese-Cantonese translation models
  • —multilingual LLM training
  • —continued pretraining
  • —supervised fine-tuning (SFT)
  • —retrieval-augmented generation (RAG)
  • —bilingual embedding models
  • —cross-lingual retrieval
  • —multilingual search systems
  • —conversational AI
  • —language model evaluation
  • —synthetic data generation
  • —multilingual instruction tuning

Why This Dataset Is Useful

Direct Cantonese-Japanese Alignment

Most publicly available translation resources focus on English-centered language pairs.

This dataset provides direct Cantonese-Japanese sentence alignments without requiring English as an intermediary language.

Machine Translation Training

Aligned sentence pairs make the dataset suitable for:

  • —neural machine translation
  • —sequence-to-sequence models
  • —encoder-decoder architectures
  • —multilingual transformer training

LLM Adaptation

The dataset can be used for:

  • —multilingual LLM adaptation
  • —Cantonese language enhancement
  • —Japanese language enhancement
  • —bilingual alignment
  • —continued pretraining
  • —instruction tuning

Cross-Lingual Applications

Developers can use PangeanicYueJa for:

  • —multilingual search
  • —semantic retrieval
  • —bilingual embeddings
  • —knowledge transfer
  • —multilingual RAG systems

Recommended Applications

Machine Translation

Train Cantonese ↔ Japanese translation systems.

Multilingual Large Language Models

Improve Cantonese and Japanese understanding and generation capabilities.

Conversational AI

Build assistants and chatbots capable of operating across Cantonese and Japanese.

Retrieval-Augmented Generation (RAG)

Enhance retrieval performance across Cantonese and Japanese content.

Cross-Lingual Retrieval

Develop semantic search systems that operate across both languages.


Dataset Characteristics

  • —Cantonese (Yue Chinese)
  • —Traditional Chinese script
  • —Japanese translations
  • —Sentence-level alignment
  • —Bilingual parallel data
  • —AI-ready format
  • —Suitable for modern NLP pipelines

Intended Research Areas

This dataset supports research in:

  • —machine translation
  • —multilingual NLP
  • —bilingual embeddings
  • —cross-lingual transfer learning
  • —language model adaptation
  • —multilingual retrieval
  • —multilingual RAG
  • —conversational AI
  • —Cantonese language technologies
  • —Japanese language technologies

Limitations

  • —This release is a sample of a larger corpus.
  • —The dataset does not include document-level metadata.
  • —The dataset is provided at sentence level.
  • —Domain distribution may vary across the corpus.

Citation

bibtex
@dataset{pangeanic_cantonese_japanese_mt_2026,
  author = {{Pangeanic}},
  title = {Cantonese-Japanese Machine Translation Corpus},
  year = {2026},
  publisher = {Pangeanic}
  url = {https://huggingface.co/datasets/Pangeanic/Cantonese-Japanese-Machine-Translation-Corpus-text}
}

Keywords

Cantonese dataset, Yue dataset, Japanese dataset, Cantonese Japanese corpus, Cantonese Japanese translation, bilingual dataset, parallel corpus, multilingual NLP, multilingual LLM, Cantonese AI, Japanese AI, machine translation corpus, bilingual AI training data, retrieval augmented generation, multilingual embeddings, cross-lingual NLP, Cantonese NLP, Japanese NLP, Yue Chinese dataset.