laughatwill/TIGER-Lab_MMEB-train
MMEB Training Dataset (Lance Format) This is a Lance-format version of the TIGER-Lab/MMEB-train dataset, optimized for efficient storage and fast random access. The original dataset is used for training VLM2Vec models in the paper VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks (ICLR 2025). Directory Structure TIGER-Lab_MMEB-train/ └── data/ ├── A-OKVQA/ │ ├── train.lance │ ├── original.lance │ └──… See the full description on the dataset page: https://huggingface.co/datasets/laughatwill/TIGER-Lab_MMEB-train.
MMEB Training Dataset (Lance Format)
This is a Lance-format version of the TIGER-Lab/MMEB-train dataset, optimized for efficient storage and fast random access.
The original dataset is used for training VLM2Vec models in the paper VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks (ICLR 2025).
Directory Structure
TIGER-Lab_MMEB-train/
└── data/
├── A-OKVQA/
│ ├── train.lance
│ ├── original.lance
│ └── diverse.lance
├── MSCOCO/
│ └── ...
└── images/
├── A-OKVQA.lance
├── MSCOCO.lance
└── ...Schema
Metadata ({dataset}/{variant}.lance)
Images (images/{dataset}.lance)
Dataset Statistics
Each dataset has 3 variants: train, original, and diverse_instruction (same sample count, different instruction templates).
Original Dataset
This dataset is derived from TIGER-Lab/MMEB-train. For evaluation, please refer to TIGER-Lab/MMEB-eval.
Citation
@article{jiang2024vlm2vec,
title={VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks},
author={Jiang, Ziyan and Meng, Rui and Yang, Xinyi and Yavuz, Semih and Zhou, Yingbo and Chen, Wenhu},
journal={arXiv preprint arXiv:2410.05160},
year={2024}
}License
Apache-2.0 (same as the original dataset)
