jingyaogong/minimind-v_dataset
Ⅰ 数据集 本轮训练用到的图文数据全部来自 ALLaVA-4V 系列。 相比以往从几份 LLaVA 衍生集拼接得到的数据,ALLaVA-4V 的质量更整齐、中英双语原生对照,细粒度描述也更充分。 它由两个子源构成:一份是 LAION 里挑出来的高质量图片(自然图像为主),一份是 VFLAN 指令流里挑出来的图片(文档、图表、合成场景居多)。 Pretrain(pretrain_i2t.parquet,约 127 万条 / ~64 万张唯一图像) ALLaVA-Caption-LAION-4V 英/中:~47万 + ~44万 ALLaVA-Caption-VFLAN-4V 英/中:~19万 + ~17万 任务形式为"请描述这张图片"类的单轮长描述,用于让模型建立视觉 token 到语言 token 的基础对齐。 SFT(sft_i2t.parquet,约 290 万条 / ~65 万张唯一图像) ALLaVA-Instruct-LAION-4V 英/中:~47万 + ~47万… See the full description on the dataset page: https://huggingface.co/datasets/jingyaogong/minimind-v_dataset.
Update README_en.md
Update README.md
Upload 2 files
Upload VLM-structure-moe.jpg
Upload 2 files
Update README.md
Update README.md
Delete sft_data.parquet
Delete pretrain_data.parquet
Upload 2 files
Delete sft_vlm_data_multi.jsonl
Delete sft_multi_images_trans_image.zip
Delete sft_images.zip
Delete sft_data.jsonl
Delete pretrain_images.zip
Delete pretrain_data.jsonl
Upload 2 files
Upload 2 files
Delete images/new.png
Upload 8 files
Create images/new.png
Delete dataset/eval_images/new.png
Upload 8 files
Create dataset/eval_images/new.png
Upload sft_vlm_data_multi.jsonl
Upload 2 files
Rename sft_images2.zip to sft_images.zip
Delete sft_images.zip
Delete out
Delete eval_images
Delete LLaVA-Pretrain
Delete LLaVA-Instruct
Upload 2 files
Upload 2 files
Upload 512_llm.pth
Upload 6 files
Upload 14 files
initial commit
