wulezhi/qwen3.8-27b-buddhist
013
Qwen3.8-27B-Buddhist(佛学辞典 SFT 微调版)
基于 Qwen3.8-27B(qwen3_5 架构,稠密 27B,48 线性注意力 + 16 全注意力,带视觉模块)的佛学辞典微调模型, 使用 佛光大辞典 与 中华佛教大百科全书 的语料做 35,841 条中文佛教 SFT 微调, 目的是让模型解释和理解佛学术语、名相、义理——服务于佛学学习与查阅场景。
架构更正说明:本模型为稠密模型(Qwen3_5ForConditionalGeneration,非 MoE)。 早期文档误标为 "MoE / 激活 3B",与事实不符,已订正。模型卡
已上传量化版本(加载框架)
本仓库提供的量化权重按推理框架分为两类:
1. GGUF —— llama.cpp / Ollama 加载
GGUF 由 save_pretrained_gguf(..., save_method="forced_merged_4bit") 导出, 即 "4-bit NF4 基座 + LoRA 权重" 合并后的量化结果,并非 16-bit 全量微调。2. safetensors 量化 —— vLLM 加载
三个量化目录的 quantization_config 不同(quant_method 各异),加载命令需对应:
# 示例:起 vLLM 在线服务(以 int8 为例,路径换成实际下载位置)
vllm serve ./qwen38-int8-w8a8 --quantization compressed-tensors --served-model-name qwen3.8-27b-buddhist这些 safetensors 量化版面向 vLLM 在线服务场景(视觉模块 visual 已排除在量化之外,保留 fp); llama.cpp 侧请用上面的 GGUF,两者不要混用。
LoRA 适配器(复现 / 继续训练)
训练参数
- 基座:Qwen3.8-27B(qwen3_5 稠密架构)
- 方法:Unsloth QLoRA,r=8, alpha=8,基座 4-bit NF4
- 数据:佛光大辞典 + 中华佛教大百科全书,35,841 条(佛教 SFT,Plan A 清洗:0 空 think 块 / 0 重复 / 0 system 污染)
- 训练:3 epoch,13,443 步,final loss 1.591(2.245 → 1.591,健康收敛)
- 硬件:RTX 3090 24GB
- 导出:GGUF(
forced_merged_4bit)→ Q4KM / Q6_K;int8 / AWQ / AutoAWQ 走各自量化流水线
推理示例(llama.cpp)
# Q4_K_M(推荐,需 ~19GB 显存)
llama-server -m qwen3.8-27b-Buddhist-16bit.Q4_K_M.gguf -c 32768 -ngl 99
# 带视觉模块
llama-server -m qwen3.8-27b-Buddhist-16bit.Q4_K_M.gguf \
--mmproj qwen3.8-27b-Buddhist-16bit.BF16-mmproj.gguf -c 32768 -ngl 99显存需求参考:
许可
基于 Qwen3.8-27B(Apache-2.0)微调,权重与数据均以 Apache-2.0 发布。
