CoolFace
20 results

minimind

jingyaogong /minimind_dataset 📌 数据介绍 Ⅰ Tokenizer 分词器可以粗略理解成 LLM 使用的一本“词典”,负责把自然语言映射成 token id,再把 token id 解码回文本;项目中也提供了train_tokenizer.py作为词表训练示例。不建议重新训练 tokenizer,因为词表和切分规则一旦变化,模型权重、数据格式、推理接口与社区生态的兼容性都会下降,也会削弱模型的传播性。同时,tokenizer 还会影响 PPL 这类按 token 统计的指标,因此跨 tokenizer 比较时,BPB(Bits Per Byte)往往更有参考价值,可参考这篇。 对 MiniMind 这类小模型来说,词表大小还会直接影响 embedding 层和输出层的参数占比,因此保持词表精简通常是更合适的取舍。 Tokenizer介绍 第三方强大的开源模型例如 Yi、Qwen2、ChatGLM、Mistral、Llama 3 的 tokenizer 词表长度如下:… See the full description on the dataset page: https://huggingface.co/datasets/jingyaogong/minimind_dataset.text-generation113 likes5.7k downloads6mo agoHugging Facejingyaogong /minimind-v_dataset Ⅰ 数据集 本轮训练用到的图文数据全部来自 ALLaVA-4V 系列。 相比以往从几份 LLaVA 衍生集拼接得到的数据,ALLaVA-4V 的质量更整齐、中英双语原生对照,细粒度描述也更充分。 它由两个子源构成:一份是 LAION 里挑出来的高质量图片(自然图像为主),一份是 VFLAN 指令流里挑出来的图片(文档、图表、合成场景居多)。 Pretrain(pretrain_i2t.parquet,约 127 万条 / ~64 万张唯一图像) ALLaVA-Caption-LAION-4V 英/中:~47万 + ~44万ALLaVA-Caption-VFLAN-4V 英/中:~19万 + ~17万 任务形式为"请描述这张图片"类的单轮长描述,用于让模型建立视觉 token 到语言 token 的基础对齐。 SFT(sft_i2t.parquet,约 290 万条 / ~65 万张唯一图像) ALLaVA-Instruct-LAION-4V 英/中:~47万 + ~47万… See the full description on the dataset page: https://huggingface.co/datasets/jingyaogong/minimind-v_dataset.imagevisual-question-answeringn<1K36 likes934 downloads5mo agoHugging Facejingyaogong /minimind-o_dataset For full documentation, please refer to the GitHub repository: https://github.com/jingyaogong/minimind-o Technical Report: https://arxiv.org/abs/2605.03937 text1M<n<10M13 likes551 downloads5mo agoHugging Facewzdsnyngmhhay /minimind-v_dataset "大道至简" 中文 | English 此项目旨在从0开始,仅用1.3块钱成本 + 1小时!即可训练出26M参数的超小多模态视觉语言模型MiniMind-V。 MiniMind-V最小版本体积仅为 GPT3 的约 $\frac{1}{7000}$,力求做到个人GPU也可快速推理甚至训练。 MiniMind-V是MiniMind纯语言模型的视觉能力额外拓展。 项目同时包含了VLM大模型的极简结构、数据集清洗、预训练(Pretrain)、监督微调(SFT)等全过程代码。 这不仅是一个开源VLM模型的最小实现,也是入门视觉语言模型的简明教程。希望此项目能为所有人提供一个抛砖引玉的示例,一起感受创造的乐趣!推动更广泛AI社区的进步! 为防止误解,“1小时” 基于NVIDIA 3090硬件设备(单卡)测试1 epoch,“1.3块钱” 指GPU服务器租用成本。 🔗🤖在线体验 | 🔗🎞️视频介绍 📌 Introduction “用乐高拼出一架飞机,远比坐在头等舱里飞行更让人兴奋!”… See the full description on the dataset page: https://huggingface.co/datasets/wzdsnyngmhhay/minimind-v_dataset.imagen<1K0 likes188 downloads8mo agoHugging Faceharithoppil /minimind_dataset 📌 Data Overview Ⅰ Tokenizer A tokenizer maps words from natural language to numbers like 0, 1, 36 through a “vocabulary”. You can think of each number as the page index of a word in a “dictionary”. You may choose to build your own vocabulary and train a tokenizer. The code can be found in ./scripts/train_tokenizer.py (for learning reference only; unless necessary, there is no need to retrain one yourself, as MiniMind already comes with a tokenizer).… See the full description on the dataset page: https://huggingface.co/datasets/harithoppil/minimind_dataset.text10M<n<100M0 likes184 downloads8mo agoHugging Facemarcosremar2 /minimind-ptbr-kokoro-tts-68k MiniMind PT-BR Kokoro TTS 68k Synthetic Brazilian Portuguese speech dataset generated for the MiniMind/Tucano2 -> Mimi Talker fine-tuning experiments. Contents audio/: 68,486 WAV files generated with Kokoro TTS. manifests/kokoro_groq25k_audio_manifest.jsonl: source text manifest. manifests/kokoro_groq25k_audio_manifest_with_wavs.jsonl: manifest with WAV paths. manifests/kokoro_groq25k_audio_manifest_with_mimi.jsonl: manifest with Mimi token references.… See the full description on the dataset page: https://huggingface.co/datasets/marcosremar2/minimind-ptbr-kokoro-tts-68k.audiotext-to-speech1K<n<10K0 likes169 downloads4mo agoHugging Face