Godners/dao-zang-sft-qwen2.5-7b
0557
dao-zang-sft-qwen2.5-7b · GGUF(Q4KM + f16)
《道藏》证据问答 / 分步推理模型 —— 本仓库提供该模型的两种 GGUF 量化档, 面向 llama.cpp / Ollama 本地推理;模型权重完全一致,差别只在精度与体积。
GGUF 是自包含格式:词表、chat template、超参元数据都在.gguf内,不需要额外config.json/tokenizer.json。 Paddle/FastDeploy 完整模型另见飞桨 AI Studio 仓库(同名)。
1. 模型简介
2. 用法
2.1 llama.cpp
# 推荐档
llama-cli -m dao-zang-sft-qwen2.5-7b-Q4_K_M.gguf --temp 0.7 --top-p 0.8 --repeat-penalty 1.1 -n 512
# 服务模式
llama-server -m dao-zang-sft-qwen2.5-7b-Q4_K_M.gguf -c 8192 --host 0.0.0.0 --port 80802.2 Ollama
# Modelfile
FROM ./dao-zang-sft-qwen2.5-7b-Q4_K_M.gguf
PARAMETER temperature 0.7
PARAMETER top_p 0.8
PARAMETER repeat_penalty 1.1
PARAMETER stop "<|im_end|>"ollama create dao-zang-sft-qwen2.5-7b -f Modelfile
ollama run dao-zang-sft-qwen2.5-7b
# 也可直接拉远端文件:
# FROM https://huggingface.co/Godners/dao-zang-sft-qwen2.5-7b/resolve/main/dao-zang-sft-qwen2.5-7b-Q4_K_M.gguf2.3 ⚠️ 必须按训练时的 I/O 规范提问
模型是证据问答专家,不是通用助手;脱离该范式质量会明显下降。
system: 你是《道藏》文献推理助手。下面是检索到的经文片段([n]为编号,可能含无关项)。
请基于证据逐点推理后回答;证据不足以作答时请明说,不要编造,也不要引用不存在的内容。
user: 问题:<问题>
证据:
[1] 《<篇名1>》:<正文…>
[2] 《<篇名2>》:<正文…>
[3] 《<篇名3>》:<正文…> ← 干扰项(可选)
assistant:
推理:
1) 据[1]……;2) 结合[2]……;3) [3]为目录/无关,排除。
结论:<答案>(据[1][2])。硬约束:结论须证据可支撑并带 [n];证据不足要明说、不编造;三段结构固定。
3. 转换与验证证据(可复现)
链路:Paddle 完整模型(safetensors 分片, 339 张量) → HF safetensors → GGUF f16 → Q4_K_M
- Paddle
nn.Linear权重存[in, out],转 HF 必须转置为[out, in];`lm_head.weight` 需按配置判定: 7Btie_word_embeddings=false(独立 Linear)→ 需转置(0.5B 共享权重则不转,不可套用)。 - 转换后
transformers严格加载校验:LOAD_OK params=7.616B✅(形状不符会直接报错)→ 证方向正确。 - GGUF 回读:339 张量、
chat_template存在、无坏张量;f16 = 14.19 GiB → Q4KM = 4.36 GiB(30.7%)。 - 冒烟:
llama-cli(CPU, i9-10900K, -t 10)跑真实 holdout 记录,输出连贯、带合法[n]引用。
4. 评测与已知局限(如实披露)
v40 里程碑评测(30 条 holdout = single/multi/refusal 各 10,recompute_refusal 同口径):
- 「该拒不拒」未解决(三版同口径均 0/10);宽松口径复核 v40 仅 1/10 属纯拒答 → 多数为真实行为,但拒答表现不稳定(部分记录可给出干净拒答,如 GGUF 抽样冒烟)。
- v40 相对 v30 重复退化反弹(8→14/30),疑似过训练。发布版仍采用 v40。
- 判据提醒:
predict_refusal视「含[n]」为已作答,引用被否证证据的正确拒答会被误判。 - 数据为 DeepSeek-V4-Flash 合成、非人工精校;长证据(multi 常 1300–1500+ token)可能截断。
- 非通用模型:请回原文核对引文(可配合
Godners/DaoZang检索溯源)。
5. 伦理与合规
仅供学术研究与传统文化研究。涉及养生、丹道、符箓、医药等内容,输出不应视为医学或修炼建议。 证据引用为模型生成,引用前建议人工核对原文。
6. 引用
基座 Qwen/Qwen2.5-7B-Instruct;数据 Godners/DaoZang(37,121 条,DeepSeek-V4-Flash 合成); 微调 Paddle LoRA SFT(40 批增量续训,r64/α128,fp16);GGUF(llama.cpp,Q4KM 与 f16)。
