VincentZhu007/minimind-3
014
MiniMind-3 (64M)
[!NOTE] 感谢 MiniMind 原作者 jingyaogong 的贡献。 本仓库的权重是在原作者工作基础上转换而来,并非最原始的 MiniMind 模型权重。 如需访问原始权重,请前往原作者仓库:jingyaogong/minimind-3(HF)/ gongjy/minimind-3(ModelScope)。
MiniMind 是一个仅 64M 参数的超小尺寸中文 LLM,从零手写训练,旨在以极低成本揭示 LLM 的基本原理。 本仓库是官方 PyTorch 权重转换而来的 Transformers / Qwen3 兼容格式,可直接用于推理部署。
- 原始项目:jingyaogong/minimind
- 架构:Qwen3ForCausalLM(dense,8 层,hidden 768,GQA 8/4,tie embeddings)
- 词表:6400(自训练 tokenizer,面向中文)
快速开始
from transformers import AutoModelForCausalLM, AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained("minimind-3")
model = AutoModelForCausalLM.from_pretrained("minimind-3")
messages = [{"role": "user", "content": "你好,请介绍一下你自己"}]
prompt = tokenizer.apply_chat_template(messages, add_generation_prompt=True, tokenize=False)
inputs = tokenizer(prompt, return_tensors="pt")
# BERT 风格 tokenizer 会返回 token_type_ids,但模型 forward 不接收,generate 会报 ValueError,需移除
inputs.pop("token_type_ids", None)
out = model.generate(**inputs, max_new_tokens=256)
print(tokenizer.decode(out[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))模型配置
备注
64M 级别的模型能力有限,主要用于学习 LLM 训练/推理全流程,不适合生产场景的复杂任务。 训练代码、数据集与更多尺寸的权重请见原始仓库。
