muyuho/Vero-35k-VisionSelector
Vero-35k-VisionSelector (Multi-Domain Balanced Visual Token Pruning Dataset) This dataset is a balanced ~35.4K multi-domain dataset derived from zlab-princeton/Vero-600k, specifically designed for Vision Token Pruning Pre-training (e.g. VisionSelector LIS) and Decoupled Downstream Task Fine-tuning. ๐ Dataset Overview Total Samples: 35,400 multi-modal samples Domain Coverage: 6 core domains across 59 distinct tasks (600 samples per task) Image Preservation: 100%โฆ See the full description on the dataset page: https://huggingface.co/datasets/muyuho/Vero-35k-VisionSelector.
Vero-35k-VisionSelector (Multi-Domain Balanced Visual Token Pruning Dataset)
This dataset is a balanced ~35.4K multi-domain dataset derived from zlab-princeton/Vero-600k, specifically designed for Vision Token Pruning Pre-training (e.g. VisionSelector LIS) and Decoupled Downstream Task Fine-tuning.
๐ Dataset Overview
- Total Samples: 35,400 multi-modal samples
- Domain Coverage: 6 core domains across 59 distinct tasks (600 samples per task)
- Image Preservation: 100% Bit-Exact raw original image bytes (zero re-compression)
- Archive Volumes: Split into 7 parts (< 5 GB per part)
Domain Distribution (35,400 Samples)
- STEM (Science, Math & Geometry): 7,800 samples (13 configs)
- Knowledge & Recognition: 7,200 samples (12 configs)
- Counting, Grounding & Search: 6,600 samples (11 configs)
- Chart & OCR: 5,400 samples (9 configs)
- Spatial & Action (UI Navigation): 4,800 samples (8 configs)
- Captioning & Instruction Following: 3,600 samples (6 configs)
๐ File Structure
vero_visionselector_all_35k.jsonl: Standard VisionSelector SFT format (conversations: [{from: "human", value: "..."}, {from: "gpt", value: "..."}])vero_train_all_35k.verl.jsonl: veRL multi-modal RL training format (prompt,reward_model,extra_info)downstream_tasks/: 6 decoupled domain-specific SFT training splits for task adaptation:downstream_stem_math.jsonl(7,800 samples)downstream_knowledge.jsonl(7,200 samples)downstream_grounding.jsonl(6,600 samples)downstream_ocr_chart.jsonl(5,400 samples)downstream_ui_agent.jsonl(4,800 samples)downstream_captioning.jsonl(3,600 samples)images.tar.gz.part_*: Multi-part compressed image archive (< 5 GB each)summary.json: Detailed dataset metrics and config breakdowns
๐ ๏ธ How to Extract Images
cat images.tar.gz.part_* | tar -xzf -