CoolFace
Modelpublic

Godners/dao-zang-sft-qwen2.5-0.5b

sourceHugging Facemitupdated 18d agoView on Hugging Face
0likes439downloads
Model Card

dao-zang-sft-qwen2.5-0.5b

道藏问答领域模型(中文古典文献 · 对话式问答)

基于 Qwen/Qwen2.5-0.5B-Instruct,用 10 万条《道藏/正统道藏》合成问答对(QA)做 LoRA 指令微调(SFT)后,将 LoRA 与基座合并得到的可独立推理完整模型。

⚠️ 这是由本项目微调产生的衍生模型,不是 Qwen 官方发布的模型。请勿误标为 Qwen/Qwen2.5-0.5B-Instruct。

1. 模型简介

项目值
模型大小0.5B(约 6.3 亿参数,含未共享的 lm_head)
基座模型Qwen/Qwen2.5-0.5B-Instruct
微调方式LoRA SFT(指令微调,仅对助手回答算损失)
LoRA 秩r=64, alpha=128
训练数据10 万条「道藏问答」对话对(20 批 × 5,000)
数据来源Godners/DaoZang(285,117 个经文 chunk 切分而来)
训练精度fp16
架构Qwen2-0.5B (decoder-only, causal LM)
能力边界道藏问答专家,非通用模型

2. 仓库内容

文件说明
model.safetensors + config.json + tokenizer 系列transformers 可直接加载的完整模型
dao-zang-sft-qwen2.5-0.5b.ggufGGUF(f16),供 Ollama / llama.cpp 部署

3. 快速开始

HuggingFace transformers:

python
from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "Godners/dao-zang-sft-qwen2.5-0.5b"
model = AutoModelForCausalLM.from_pretrained(model_name, trust_remote_code=True, dtype="float16")
tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)

messages = [{"role": "user", "content": "什么是「存思」?请依据经文说明。"}]
prompt = tokenizer.apply_chat_template(messages, tokenize=True, return_tensors="pt")
out = model.generate(prompt, max_new_tokens=200)
print(tokenizer.decode(out[0], skip_special_tokens=True))

Ollama(用 GGUF):

bash
ollama create dao-zang-sft-qwen2.5-0.5b -f - <<'EOF'
FROM ./dao-zang-sft-qwen2.5-0.5b.gguf
PARAMETER temperature 0.7
PARAMETER top_p 0.8
EOF
ollama run dao-zang-sft-qwen2.5-0.5b "什么是「存思」?"

llama.cpp:

bash
llama-cli -m dao-zang-sft-qwen2.5-0.5b.gguf -p "<|im_start|>user\n什么是「存思」?<|im_end|>\n<|im_start|>assistant\n" -n 120

4. 能力与用途

适用于《道藏》经文名词/术语/名物的概念问答、篇目背景问答、引文理解,及面向 RAG 的下游对话微调起点。训练数据为规则模板 + LLM 合成,答案均引用原文、不编造。

5. 转换与校验说明

模型源自 PaddlePaddle 训练产物(model_state.pdparams),已转换为 HuggingFace safetensors(fp16) 与 GGUF(f16) 两个可直接推理格式。正确性已校验:

  • —与官方基座 Qwen/Qwen2.5-0.5B-Instruct 核对:embed_tokens 与各 LayerNorm 一致, 投影层与基座相关系数 >0.98(LoRA 微调扰动);
  • —HF 版可正常加载并产出通顺道藏风格引文;GGUF 经 llama.cpp 实测可推理(CPU 约 21 tok/s)。

6. 已知局限

  • —数据是合成的,个别条目可能有语句瑕疵或释义不精确。
  • —容量 0.5B:复杂推理、长文综合能力有限;对未见过的经文组合可能幻觉,关键论断请回原文核对。
  • —训练语料繁简体/标点混杂,可能沿袭到回答中。
  • —非通用模型:仅针对道藏问答优化,脱离领域的一般对话质量弱于基座。

7. 伦理与合规

仅供学术研究与传统文化研究使用。涉及养生、丹道、符箓、医药等内容时,模型输出不应视为 医学或修炼建议。请遵守所用基座与数据集(Qwen、Godners/DaoZang)的许可条款。