CoolFace
Datasetpublic

foss22/common_corpus_pre1939_Russsian

Демонстрация низкого качества OCR/HTR, поражающего обучающие датасеты на русском 19 века и ранее. Использовать для тестирования спеллчекеров и корректоров. TODO: common_corpus_pre1939_Russian -как результат коррекции, вместо нынешнего некачественного common_corpus_pre1939_Russsian Лицензия кау у исходного PleIAs/common_corpus Мотивация: https://huggingface.co/datasets/PleIAs/common_corpus/discussions/2#67adb8aba035b45ce76b33dd Feb 13, 2025 A language column was added in Common Corpus 2.0, so… See the full description on the dataset page: https://huggingface.co/datasets/foss22/common_corpus_pre1939_Russsian.

sourceHugging Faceupdated 6mo agoView on Hugging Face
0likes351downloads
Dataset Card

Демонстрация низкого качества OCR/HTR, поражающего обучающие датасеты на русском 19 века и ранее.

Использовать для тестирования спеллчекеров и корректоров.

TODO: commoncorpuspre1939Russian -как результат коррекции, вместо нынешнего некачественного commoncorpuspre1939Russsian

Лицензия кау у исходного PleIAs/common_corpus

Мотивация: https://huggingface.co/datasets/PleIAs/common_corpus/discussions/2#67adb8aba035b45ce76b33dd Feb 13, 2025 A language column was added in Common Corpus 2.0, so filtering on language is now possible. Thanks! It does however require processing the entire 10+ TB dataset. Having separate subsets or releases per language would be quite convenient.