datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
MMMU-Reasoning-Distill-Validationbangla-ocr-validation_data_printed
Bangla OCR Validation Dataset (Printed + Scanned)
📌 Description
This dataset is a Bangla OCR validation dataset containing a mix of printed document images and their corresponding text annotations. It is designed to evaluate OCR and vision-language models on both clean digital text and scanned document images.
📊 Dataset Composition
1507 line-level images with text annotations
50 full-page document images with text
Data includes:
Printed/typed Bangla text… See the full description on the dataset page: https://huggingface.co/datasets/arobin79/bangla-ocr-validation_data_printed.roco2-question-dataset-validationvalidation-datasetpublic_validation_dataCOCO-validation_dataset_balanceadoVIZWIZ_VALIDATION_data_with_imagesvqav2-ar-validation-datavalidation_data_dec_13Image-To-Text-Validation-DatasetDataset_clean_X_DIAG_validationjk_ocf_dataset_preprocessed_validationpixel-dataset-prerender-java-wikipedia-validation
