Pangeanic/Cantonese-Japanese-Machine-Translation-Corpus-text
PangeanicYueJa - Cantonese Japanese Parallel Corpus PangeanicYueJa is a Cantonese-Japanese parallel corpus designed for machine translation, multilingual large language model (LLM) training, cross-lingual NLP research, retrieval-augmented generation (RAG), bilingual embeddings, instruction tuning, and multilingual AI systems. This release contains 55,000 Cantonese-Japanese sentence pairs sampled from a larger corpus of approximately 3.08 million parallel sentence pairs. For the… See the full description on the dataset page: https://huggingface.co/datasets/Pangeanic/Cantonese-Japanese-Machine-Translation-Corpus-text.
PangeanicYueJa - Cantonese Japanese Parallel Corpus
PangeanicYueJa is a Cantonese-Japanese parallel corpus designed for machine translation, multilingual large language model (LLM) training, cross-lingual NLP research, retrieval-augmented generation (RAG), bilingual embeddings, instruction tuning, and multilingual AI systems.
This release contains 55,000 Cantonese-Japanese sentence pairs sampled from a larger corpus of approximately 3.08 million parallel sentence pairs. For the complete dataset, please contact Pangeanic
The dataset focuses specifically on written Cantonese (Yue Chinese) paired with Japanese translations, providing valuable training data for multilingual AI systems working with two important East Asian languages.
Why Cantonese and Japanese Matter for AI
Both Cantonese and Japanese are widely used languages with significant cultural, economic, and technological importance.
While Japanese is relatively well represented in NLP resources, direct Cantonese-Japanese parallel data remains scarce. Most multilingual systems rely heavily on English as an intermediary language.
This dataset provides direct sentence-level alignment between Cantonese and Japanese, enabling:
- Cantonese ↔ Japanese machine translation
- multilingual LLM training
- cross-lingual retrieval
- bilingual embeddings
- conversational AI
- multilingual search systems
Dataset Overview
Dataset Structure
The dataset contains two columns:
Example Usage
from datasets import load_dataset
dataset = load_dataset("Pangeanic/Cantonese-Japanese-Machine-Translation-Corpus-text")
print(dataset["train"][0])AI and LLM Use Cases
This dataset is suitable for:
- Cantonese-Japanese machine translation
- Japanese-Cantonese translation models
- multilingual LLM training
- continued pretraining
- supervised fine-tuning (SFT)
- retrieval-augmented generation (RAG)
- bilingual embedding models
- cross-lingual retrieval
- multilingual search systems
- conversational AI
- language model evaluation
- synthetic data generation
- multilingual instruction tuning
Why This Dataset Is Useful
Direct Cantonese-Japanese Alignment
Most publicly available translation resources focus on English-centered language pairs.
This dataset provides direct Cantonese-Japanese sentence alignments without requiring English as an intermediary language.
Machine Translation Training
Aligned sentence pairs make the dataset suitable for:
- neural machine translation
- sequence-to-sequence models
- encoder-decoder architectures
- multilingual transformer training
LLM Adaptation
The dataset can be used for:
- multilingual LLM adaptation
- Cantonese language enhancement
- Japanese language enhancement
- bilingual alignment
- continued pretraining
- instruction tuning
Cross-Lingual Applications
Developers can use PangeanicYueJa for:
- multilingual search
- semantic retrieval
- bilingual embeddings
- knowledge transfer
- multilingual RAG systems
Recommended Applications
Machine Translation
Train Cantonese ↔ Japanese translation systems.
Multilingual Large Language Models
Improve Cantonese and Japanese understanding and generation capabilities.
Conversational AI
Build assistants and chatbots capable of operating across Cantonese and Japanese.
Retrieval-Augmented Generation (RAG)
Enhance retrieval performance across Cantonese and Japanese content.
Cross-Lingual Retrieval
Develop semantic search systems that operate across both languages.
Dataset Characteristics
- Cantonese (Yue Chinese)
- Traditional Chinese script
- Japanese translations
- Sentence-level alignment
- Bilingual parallel data
- AI-ready format
- Suitable for modern NLP pipelines
Intended Research Areas
This dataset supports research in:
- machine translation
- multilingual NLP
- bilingual embeddings
- cross-lingual transfer learning
- language model adaptation
- multilingual retrieval
- multilingual RAG
- conversational AI
- Cantonese language technologies
- Japanese language technologies
Limitations
- This release is a sample of a larger corpus.
- The dataset does not include document-level metadata.
- The dataset is provided at sentence level.
- Domain distribution may vary across the corpus.
Citation
@dataset{pangeanic_cantonese_japanese_mt_2026,
author = {{Pangeanic}},
title = {Cantonese-Japanese Machine Translation Corpus},
year = {2026},
publisher = {Pangeanic}
url = {https://huggingface.co/datasets/Pangeanic/Cantonese-Japanese-Machine-Translation-Corpus-text}
}Keywords
Cantonese dataset, Yue dataset, Japanese dataset, Cantonese Japanese corpus, Cantonese Japanese translation, bilingual dataset, parallel corpus, multilingual NLP, multilingual LLM, Cantonese AI, Japanese AI, machine translation corpus, bilingual AI training data, retrieval augmented generation, multilingual embeddings, cross-lingual NLP, Cantonese NLP, Japanese NLP, Yue Chinese dataset.
