CoolFace
Datasetpublic

ramSeraph/indic_wikisource

Dataset contains page image urls and the corresponding annotations from wikisource. Also has information whether the page has been validated/proofread. I expect this dataset to be useful for creating OCR models for printed text in Indic languages. Languages Covered: as - Assamese bn - Bengali gu - Gujarati hi - Hindi kn - Kannada ml - Malayalam mr - Marathi or - Odiya pa - Punjabi sa - Sanskrit ta - Tamil te - Telugu

sourceHugging Facecc-by-sa-4.0updated 2y agoView on Hugging Face
1likes126downloads
fileas.parquet41.9 MBdownload
filebn.parquet97.1 MBdownload
filegu.parquet45.7 MBdownload
filehi.parquet107.4 MBdownload
filekn.parquet16.0 MBdownload
fileml.parquet50.6 MBdownload
filemr.parquet66.0 MBdownload
fileor.parquet6.7 MBdownload
filepa.parquet35.9 MBdownload
filesa.parquet64.2 MBdownload
fileta.parquet190.4 MBdownload
filete.parquet127.6 MBdownload

ramSeraph/indic_wikisource · main · files are served by the source, never re-hosted here