CoolFace
Datasetpublic

guiti999/cantonese-traditional-chinese-parallel-corpus-gen3

Cantonese-Written Chinese Parallel Dataset (3rd Generation) About the Dataset Data Splits Training Data (train): 160,000 Sentence Pairs Validation Data (validation): 20,000 Sentence Pairs Test Data (test): 5,461 Sentence Pairs Languages Cantonese (yue) Traditional Chinese (zh-TW) Original Data Structure JSON lines consisting of yue, zh and ref fields. Data Source LIHKG HKCancor Cantonse-Mandarin… See the full description on the dataset page: https://huggingface.co/datasets/guiti999/cantonese-traditional-chinese-parallel-corpus-gen3.

sourceHugging Facecc-by-nc-sa-4.0updated 9mo agoView on Hugging Face
0likes33downloads
1 commits on main
abbc1f99mo ago

Duplicate from raptorkwok/cantonese-traditional-chinese-parallel-corpus-gen3

guiti999, raptorkwok