multi-modal-qa
multimodalqamultimodalqa_doc
MultimodalQA_Doc Documentation
This repository contains Wikipedia data crawled for the MultimodalQA dataset, a dataset designed for multimodal question answering. The dataset combines text, tables, and images from Wikipedia articles to enable research on answering questions that require understanding and reasoning across multiple modalities.
Included in this repository is a data loading script. It reads text, table, and image data stored in Parquet format and reconstructs them into… See the full description on the dataset page: https://huggingface.co/datasets/JoohyungYun/multimodalqa_doc.multimodal_qa_dataset_v1multimodal_qa_dataset_v4_trainmultimodal_qa_dataset_v3_trainmultimodal_qa_dataset_v2_image_focus
