CoolFace
Datasetpublic

muyuho/Vero-35k-VisionSelector

Vero-35k-VisionSelector (Multi-Domain Balanced Visual Token Pruning Dataset) This dataset is a balanced ~35.4K multi-domain dataset derived from zlab-princeton/Vero-600k, specifically designed for Vision Token Pruning Pre-training (e.g. VisionSelector LIS) and Decoupled Downstream Task Fine-tuning. ๐Ÿ“Š Dataset Overview Total Samples: 35,400 multi-modal samples Domain Coverage: 6 core domains across 59 distinct tasks (600 samples per task) Image Preservation: 100%โ€ฆ See the full description on the dataset page: https://huggingface.co/datasets/muyuho/Vero-35k-VisionSelector.

sourceHugging Faceapache-2.0updated 28d agoView on Hugging Face
0likes89downloads
Dataset Card

Vero-35k-VisionSelector (Multi-Domain Balanced Visual Token Pruning Dataset)

This dataset is a balanced ~35.4K multi-domain dataset derived from zlab-princeton/Vero-600k, specifically designed for Vision Token Pruning Pre-training (e.g. VisionSelector LIS) and Decoupled Downstream Task Fine-tuning.

๐Ÿ“Š Dataset Overview

  • โ€”Total Samples: 35,400 multi-modal samples
  • โ€”Domain Coverage: 6 core domains across 59 distinct tasks (600 samples per task)
  • โ€”Image Preservation: 100% Bit-Exact raw original image bytes (zero re-compression)
  • โ€”Archive Volumes: Split into 7 parts (< 5 GB per part)

Domain Distribution (35,400 Samples)

  • โ€”STEM (Science, Math & Geometry): 7,800 samples (13 configs)
  • โ€”Knowledge & Recognition: 7,200 samples (12 configs)
  • โ€”Counting, Grounding & Search: 6,600 samples (11 configs)
  • โ€”Chart & OCR: 5,400 samples (9 configs)
  • โ€”Spatial & Action (UI Navigation): 4,800 samples (8 configs)
  • โ€”Captioning & Instruction Following: 3,600 samples (6 configs)

๐Ÿ“ File Structure

  • โ€”vero_visionselector_all_35k.jsonl: Standard VisionSelector SFT format (conversations: [{from: "human", value: "..."}, {from: "gpt", value: "..."}])
  • โ€”vero_train_all_35k.verl.jsonl: veRL multi-modal RL training format (prompt, reward_model, extra_info)
  • โ€”downstream_tasks/: 6 decoupled domain-specific SFT training splits for task adaptation:
  • โ€”downstream_stem_math.jsonl (7,800 samples)
  • โ€”downstream_knowledge.jsonl (7,200 samples)
  • โ€”downstream_grounding.jsonl (6,600 samples)
  • โ€”downstream_ocr_chart.jsonl (5,400 samples)
  • โ€”downstream_ui_agent.jsonl (4,800 samples)
  • โ€”downstream_captioning.jsonl (3,600 samples)
  • โ€”images.tar.gz.part_*: Multi-part compressed image archive (< 5 GB each)
  • โ€”summary.json: Detailed dataset metrics and config breakdowns

๐Ÿ› ๏ธ How to Extract Images

bash
cat images.tar.gz.part_* | tar -xzf -