CoolFace
15 results

minimind-v

jingyaogong /minimind-v_dataset Ⅰ 数据集 本轮训练用到的图文数据全部来自 ALLaVA-4V 系列。 相比以往从几份 LLaVA 衍生集拼接得到的数据,ALLaVA-4V 的质量更整齐、中英双语原生对照,细粒度描述也更充分。 它由两个子源构成:一份是 LAION 里挑出来的高质量图片(自然图像为主),一份是 VFLAN 指令流里挑出来的图片(文档、图表、合成场景居多)。 Pretrain(pretrain_i2t.parquet,约 127 万条 / ~64 万张唯一图像) ALLaVA-Caption-LAION-4V 英/中:~47万 + ~44万ALLaVA-Caption-VFLAN-4V 英/中:~19万 + ~17万 任务形式为"请描述这张图片"类的单轮长描述,用于让模型建立视觉 token 到语言 token 的基础对齐。 SFT(sft_i2t.parquet,约 290 万条 / ~65 万张唯一图像) ALLaVA-Instruct-LAION-4V 英/中:~47万 + ~47万… See the full description on the dataset page: https://huggingface.co/datasets/jingyaogong/minimind-v_dataset.imagevisual-question-answeringn<1K37 likes934 downloads5mo agoHugging Facewzdsnyngmhhay /minimind-v_dataset "大道至简" 中文 | English 此项目旨在从0开始,仅用1.3块钱成本 + 1小时!即可训练出26M参数的超小多模态视觉语言模型MiniMind-V。 MiniMind-V最小版本体积仅为 GPT3 的约 $\frac{1}{7000}$,力求做到个人GPU也可快速推理甚至训练。 MiniMind-V是MiniMind纯语言模型的视觉能力额外拓展。 项目同时包含了VLM大模型的极简结构、数据集清洗、预训练(Pretrain)、监督微调(SFT)等全过程代码。 这不仅是一个开源VLM模型的最小实现,也是入门视觉语言模型的简明教程。希望此项目能为所有人提供一个抛砖引玉的示例,一起感受创造的乐趣!推动更广泛AI社区的进步! 为防止误解,“1小时” 基于NVIDIA 3090硬件设备(单卡)测试1 epoch,“1.3块钱” 指GPU服务器租用成本。 🔗🤖在线体验 | 🔗🎞️视频介绍 📌 Introduction “用乐高拼出一架飞机,远比坐在头等舱里飞行更让人兴奋!”… See the full description on the dataset page: https://huggingface.co/datasets/wzdsnyngmhhay/minimind-v_dataset.imagen<1K0 likes194 downloads8mo agoHugging Facewwwwwy1 /minimind-v_dataset "大道至简" 中文 | English 此项目旨在从0开始,仅用1.3块钱成本 + 1小时!即可训练出26M参数的超小多模态视觉语言模型MiniMind-V。 MiniMind-V最小版本体积仅为 GPT3 的约 $\frac{1}{7000}$,力求做到个人GPU也可快速推理甚至训练。 MiniMind-V是MiniMind纯语言模型的视觉能力额外拓展。 项目同时包含了VLM大模型的极简结构、数据集清洗、预训练(Pretrain)、监督微调(SFT)等全过程代码。 这不仅是一个开源VLM模型的最小实现,也是入门视觉语言模型的简明教程。 希望此项目能为所有人提供一个抛砖引玉的示例,一起感受创造的乐趣!推动更广泛AI社区的进步! 为防止误解,“1小时” 基于NVIDIA 3090硬件设备(单卡)测试1 epoch,“1.3块钱” 指GPU服务器租用成本。 🔗🤖在线体验 | 🔗🎞️视频介绍 📌 Introduction “用乐高拼出一架飞机,远比坐在头等舱里飞行更让人兴奋!”… See the full description on the dataset page: https://huggingface.co/datasets/wwwwwy1/minimind-v_dataset.imagen<1K0 likes127 downloads8mo agoHugging Facecaspar /minimind-v_datasettext1K<n<10K0 likes49 downloads2mo agoHugging Facexinyanghuang /minimind-v_multi_imageimage1 likes45 downloads2y agoHugging Faceqqceqqq /minimind-v_dataset Ⅰ 数据集 原始来源: Chinese-LLaVA-Vision:包含约57万张预训练图像,来自CC-3M和COCO 2014 llava-en-zh-300k:包含300k条指令微调数据和15万张图像 LLaVA-SFT-665K:包含665k条指令微调数据 其中部分为中文数据,部分为英文数据。问答内容经过翻译,对中文支持更友好,进一步经过整理并resize(pretrain分辨率128×128,sft分辨率160×160)。 (pretrain_i2t.parquet) 预训练数据集格式: 列名: conversations (json string), image_bytes (binary), image_names (string) conversations 示例: [ {"role": "user", "content": "提供给定图像的简要描述。\n<image>"}, {"role": "assistant", "content": "橄榄油是自由使用的健康成分。"} ]… See the full description on the dataset page: https://huggingface.co/datasets/qqceqqq/minimind-v_dataset.imagevisual-question-answeringn<1K0 likes23 downloads5mo agoHugging Face