CoolFace
Datasetpublic

laughatwill/TIGER-Lab_MMEB-train

MMEB Training Dataset (Lance Format) This is a Lance-format version of the TIGER-Lab/MMEB-train dataset, optimized for efficient storage and fast random access. The original dataset is used for training VLM2Vec models in the paper VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks (ICLR 2025). Directory Structure TIGER-Lab_MMEB-train/ └── data/ ├── A-OKVQA/ │ ├── train.lance │ ├── original.lance │ └──… See the full description on the dataset page: https://huggingface.co/datasets/laughatwill/TIGER-Lab_MMEB-train.

sourceHugging Faceapache-2.0updated 8mo agoView on Hugging Face
0likes214downloads
Dataset Card

MMEB Training Dataset (Lance Format)

This is a Lance-format version of the TIGER-Lab/MMEB-train dataset, optimized for efficient storage and fast random access.

The original dataset is used for training VLM2Vec models in the paper VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks (ICLR 2025).

Directory Structure

TIGER-Lab_MMEB-train/
└── data/
    ├── A-OKVQA/
    │   ├── train.lance
    │   ├── original.lance
    │   └── diverse.lance
    ├── MSCOCO/
    │   └── ...
    └── images/
        ├── A-OKVQA.lance
        ├── MSCOCO.lance
        └── ...

Schema

Metadata ({dataset}/{variant}.lance)

FieldTypeDescription
qrystringQuery text (may contain `<\image_1\>` placeholder)
qry_image_idstringQuery image path (empty if text-only)
pos_textstringPositive sample text
pos_image_idstringPositive sample image path
neg_textstringNegative sample text (optional)
neg_image_idstringNegative sample image path (optional)

Images (images/{dataset}.lance)

FieldTypeDescription
image_idstringImage path identifier
databinaryImage binary data (JPEG)

Dataset Statistics

DatasetSamplesImages
A-OKVQA17,05617,056
ChartQA28,29928,299
CIRR26,11616,640
DocVQA39,46339,463
HatefulMemes8,5008,500
ImageNet_1K100,000100,000
InfographicsVQA23,9464,406
MSCOCO100,00059,969
MSCOCO_i2t113,287113,287
MSCOCO_t2i100,00070,414
N24News48,98848,988
NIGHTS15,94131,882
OK-VQA9,0099,009
SUN39719,85019,850
VisDial123,287123,287
Visual7W69,81714,366
VisualNews_i2t100,000100,000
VisualNews_t2i99,90399,903
VOC20077,8447,844
WebQA17,16612,873

Each dataset has 3 variants: train, original, and diverse_instruction (same sample count, different instruction templates).

Original Dataset

This dataset is derived from TIGER-Lab/MMEB-train. For evaluation, please refer to TIGER-Lab/MMEB-eval.

Citation

bibtex
@article{jiang2024vlm2vec,
  title={VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks},
  author={Jiang, Ziyan and Meng, Rui and Yang, Xinyi and Yavuz, Semih and Zhou, Yingbo and Chen, Wenhu},
  journal={arXiv preprint arXiv:2410.05160},
  year={2024}
}

License

Apache-2.0 (same as the original dataset)