CoolFace
Modelpublic

Godners/dao-zang-sft-qwen2.5-7b

sourceHugging Facemitupdated 17d agoView on Hugging Face
0likes557downloads
Model Card

dao-zang-sft-qwen2.5-7b · GGUF(Q4KM + f16)

《道藏》证据问答 / 分步推理模型 —— 本仓库提供该模型的两种 GGUF 量化档, 面向 llama.cpp / Ollama 本地推理;模型权重完全一致,差别只在精度与体积。

文件大小建议场景
dao-zang-sft-qwen2.5-7b-Q4_K_M.gguf4.36 GiB推荐:CPU 推理快、体积小(本机 i9-10900K 实测约 10.8 tok/s)
dao-zang-sft-qwen2.5-7b-f16.gguf14.19 GiB全精度参考/再量化底座(CPU 约 1.5–3 tok/s)
GGUF 是自包含格式:词表、chat template、超参元数据都在 .gguf 内,不需要额外 config.json / tokenizer.json。 Paddle/FastDeploy 完整模型另见飞桨 AI Studio 仓库(同名)。

1. 模型简介

项目值
基座Qwen/Qwen2.5-7B-Instruct(tie_word_embeddings=false,Qwen2ForCausalLM)
参数量7.616 B(fp16 原始权重 14.19 GB / 339 张量)
微调LoRA SFT(PaddleNLP),r=64, alpha=128,40 批增量续训 v1→v40
训练数据37,121 条「证据落地 + 分步推理(CoT)」合成问答(源自 Godners/DaoZang)
训练硬件/精度Iluvatar BI-V150S 32G,fp16 O2
合并方式LoRA 与基座数值合并为完整模型(非量化 fp16 分支)
量化llama.cpp:Q4_K_M(类型 Q4K:169 / F32:141 / Q6K:29)与 f16

2. 用法

2.1 llama.cpp

bash
# 推荐档
llama-cli -m dao-zang-sft-qwen2.5-7b-Q4_K_M.gguf --temp 0.7 --top-p 0.8 --repeat-penalty 1.1 -n 512
# 服务模式
llama-server -m dao-zang-sft-qwen2.5-7b-Q4_K_M.gguf -c 8192 --host 0.0.0.0 --port 8080

2.2 Ollama

dockerfile
# Modelfile
FROM ./dao-zang-sft-qwen2.5-7b-Q4_K_M.gguf
PARAMETER temperature 0.7
PARAMETER top_p 0.8
PARAMETER repeat_penalty 1.1
PARAMETER stop "<|im_end|>"
bash
ollama create dao-zang-sft-qwen2.5-7b -f Modelfile
ollama run dao-zang-sft-qwen2.5-7b
# 也可直接拉远端文件:
# FROM https://huggingface.co/Godners/dao-zang-sft-qwen2.5-7b/resolve/main/dao-zang-sft-qwen2.5-7b-Q4_K_M.gguf

2.3 ⚠️ 必须按训练时的 I/O 规范提问

模型是证据问答专家,不是通用助手;脱离该范式质量会明显下降。

system: 你是《道藏》文献推理助手。下面是检索到的经文片段([n]为编号,可能含无关项)。
        请基于证据逐点推理后回答;证据不足以作答时请明说,不要编造,也不要引用不存在的内容。
user:   问题:<问题>
        证据:
        [1] 《<篇名1>》:<正文…>
        [2] 《<篇名2>》:<正文…>
        [3] 《<篇名3>》:<正文…>     ← 干扰项(可选)
assistant:
        推理:
        1) 据[1]……;2) 结合[2]……;3) [3]为目录/无关,排除。
        结论:<答案>(据[1][2])。

硬约束:结论须证据可支撑并带 [n];证据不足要明说、不编造;三段结构固定。

3. 转换与验证证据(可复现)

链路:Paddle 完整模型(safetensors 分片, 339 张量) → HF safetensors → GGUF f16 → Q4_K_M

  • —Paddle nn.Linear 权重存 [in, out],转 HF 必须转置为 [out, in];`lm_head.weight` 需按配置判定: 7B tie_word_embeddings=false(独立 Linear)→ 需转置(0.5B 共享权重则不转,不可套用)。
  • —转换后 transformers 严格加载校验:LOAD_OK params=7.616B ✅(形状不符会直接报错)→ 证方向正确。
  • —GGUF 回读:339 张量、chat_template 存在、无坏张量;f16 = 14.19 GiB → Q4KM = 4.36 GiB(30.7%)。
  • —冒烟:llama-cli(CPU, i9-10900K, -t 10)跑真实 holdout 记录,输出连贯、带合法 [n] 引用。

4. 评测与已知局限(如实披露)

v40 里程碑评测(30 条 holdout = single/multi/refusal 各 10,recompute_refusal 同口径):

指标v30v40
single/multi 不误拒1.001.00
refusal(应拒 10 条)0/100/10
严重重复(>300B 片段)8/3014/30
  • —「该拒不拒」未解决(三版同口径均 0/10);宽松口径复核 v40 仅 1/10 属纯拒答 → 多数为真实行为,但拒答表现不稳定(部分记录可给出干净拒答,如 GGUF 抽样冒烟)。
  • —v40 相对 v30 重复退化反弹(8→14/30),疑似过训练。发布版仍采用 v40。
  • —判据提醒:predict_refusal 视「含 [n]」为已作答,引用被否证证据的正确拒答会被误判。
  • —数据为 DeepSeek-V4-Flash 合成、非人工精校;长证据(multi 常 1300–1500+ token)可能截断。
  • —非通用模型:请回原文核对引文(可配合 Godners/DaoZang 检索溯源)。

5. 伦理与合规

仅供学术研究与传统文化研究。涉及养生、丹道、符箓、医药等内容,输出不应视为医学或修炼建议。 证据引用为模型生成,引用前建议人工核对原文。

6. 引用

基座 Qwen/Qwen2.5-7B-Instruct;数据 Godners/DaoZang(37,121 条,DeepSeek-V4-Flash 合成); 微调 Paddle LoRA SFT(40 批增量续训,r64/α128,fp16);GGUF(llama.cpp,Q4KM 与 f16)。