HPLT/DocHPLT
DocHPLT: A Massively Multilingual Document-Level Translation Dataset Existing document-level machine translation resources are only available for a handful of languages, mostly high-resourced ones. To facilitate the training and evaluation of document-level translation and, more broadly, long-context modeling for global communities, we create DocHPLT, the largest publicly available document-level translation dataset to date. It contains 124 million aligned document pairs across… See the full description on the dataset page: https://huggingface.co/datasets/HPLT/DocHPLT.
Update README.md
Update README.md
Update README.md
Delete en-cy
Delete en-ca
Delete en-bs
Delete en-bn
Delete en-bg
Delete en-az
Delete en-ar
Delete en-af
Upload dataset
Upload dataset (part 00004-of-00005)
Upload dataset (part 00003-of-00005)
Upload dataset (part 00002-of-00005)
Upload dataset (part 00001-of-00005)
Upload dataset (part 00000-of-00005)
Upload dataset
Upload dataset (part 00002-of-00003)
Upload dataset (part 00001-of-00003)
Upload dataset (part 00000-of-00003)
Upload dataset
Upload dataset
Upload dataset (part 00002-of-00003)
Upload dataset (part 00001-of-00003)
Upload dataset (part 00000-of-00003)
Update README.md
Delete en-be
Upload dataset
Upload dataset
note on accessibility
Update README.md
Update README.md
Update README.md
Update README.md
Update README.md
Upload dataset
Upload dataset (part 00002-of-00003)
Upload dataset (part 00001-of-00003)
Upload dataset (part 00000-of-00003)
Upload dataset
Upload dataset
Upload dataset (part 00004-of-00005)
Upload dataset (part 00003-of-00005)
Upload dataset (part 00002-of-00005)
Upload dataset (part 00001-of-00005)
Upload dataset (part 00000-of-00005)
Update README.md
Upload dataset
Upload dataset
