raptorkwok/cantonese-chinese-parallel-corpus
Cantonese-Written Chinese Parallel Corpus (CCPC) About the Dataset Data Splits Training Data (train): 160,000 Sentence Pairs Validation Data (validation): 20,000 Sentence Pairs Test Data (test): 5,461 Sentence Pairs Languages Cantonese (yue) Traditional Chinese (zh-TW) Original Data Structure JSON lines consisting of yue, zh and ref fields. Data Source Apart from the data from our first generation… See the full description on the dataset page: https://huggingface.co/datasets/raptorkwok/cantonese-chinese-parallel-corpus.
Update README.md
Update README.md
Update README.md
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Update README.md
Update citation
Upload dataset
Upload dataset
Upload dataset
Upload dataset
Update README.md
Upload dataset
Update README.md
Update README.md
Upload dataset
initial commit
