CoolFace
Modelpublic

wulezhi/qwen3.8-27b-buddhist

sourceHugging Faceapache-2.0updated 2h agoView on Hugging Face
0likes13downloads
Model Card

Qwen3.8-27B-Buddhist(佛学辞典 SFT 微调版)

基于 Qwen3.8-27B(qwen3_5 架构,稠密 27B,48 线性注意力 + 16 全注意力,带视觉模块)的佛学辞典微调模型, 使用 佛光大辞典 与 中华佛教大百科全书 的语料做 35,841 条中文佛教 SFT 微调, 目的是让模型解释和理解佛学术语、名相、义理——服务于佛学学习与查阅场景。

架构更正说明:本模型为稠密模型(Qwen3_5ForConditionalGeneration,非 MoE)。 早期文档误标为 "MoE / 激活 3B",与事实不符,已订正。

模型卡

项值
架构qwen3_5 稠密 27B(hidden 5120,64 层:48 linearattention + 16 fullattention,GQA 24/4 头,vocab 248320,bf16)
视觉内置 vision encoder(Qwen3_5ForConditionalGeneration,multimodal),可选搭配 mmproj
基座Qwen3.8-27B(Unsloth 4-bit NF4 版)
微调方法Unsloth QLoRA,r=8, alpha=8
语料佛光大辞典 + 中华佛教大百科全书,35,841 条(佛教 SFT:科判注解、义理问答、经文释义)
用途佛学术语/名相/义理的解释与理解

已上传量化版本(加载框架)

本仓库提供的量化权重按推理框架分为两类:

1. GGUF —— llama.cpp / Ollama 加载

文件大小说明
qwen3.8-27b-Buddhist-16bit.Q4_K_M.gguf~16 GB主力推荐,llama.cpp / Ollama 直接加载
qwen3.8-27b-Buddhist-16bit.Q6_K.gguf~21 GB高精度档,显存充足时选
qwen3.8-27b-Buddhist-16bit.BF16-mmproj.gguf~0.9 GB视觉模块,图像理解时搭配 --mmproj 使用
GGUF 由 save_pretrained_gguf(..., save_method="forced_merged_4bit") 导出, 即 "4-bit NF4 基座 + LoRA 权重" 合并后的量化结果,并非 16-bit 全量微调。

2. safetensors 量化 —— vLLM 加载

三个量化目录的 quantization_config 不同(quant_method 各异),加载命令需对应:

目录量化`quant_method`vLLM 加载
qwen38-autoawq-w4a16/W4A16 AutoAWQ(gemm, group 128)awqvllm serve . --quantization awq
qwen38-awq-w4a16/W4A16 Compressed-Tensors(pack-quantized)compressed-tensorsvllm serve . --quantization compressed-tensors
qwen38-int8-w8a8/W8A8 Compressed-Tensors(权重 channel-8bit + 激活 token-8bit dynamic)compressed-tensorsvllm serve . --quantization compressed-tensors
bash
# 示例:起 vLLM 在线服务(以 int8 为例,路径换成实际下载位置)
vllm serve ./qwen38-int8-w8a8 --quantization compressed-tensors --served-model-name qwen3.8-27b-buddhist
这些 safetensors 量化版面向 vLLM 在线服务场景(视觉模块 visual 已排除在量化之外,保留 fp); llama.cpp 侧请用上面的 GGUF,两者不要混用。

LoRA 适配器(复现 / 继续训练)

文件说明
adapter_model.safetensors + adapter_config.jsonLoRA r=8, alpha=8。若在 transformers 侧加载,请搭配 4-bit 基座 unsloth/Qwen3.8-27B-unsloth-bnb-4bit,不要配 16-bit 基座。日常推理直接用上面的量化版即可。

训练参数

  • —基座:Qwen3.8-27B(qwen3_5 稠密架构)
  • —方法:Unsloth QLoRA,r=8, alpha=8,基座 4-bit NF4
  • —数据:佛光大辞典 + 中华佛教大百科全书,35,841 条(佛教 SFT,Plan A 清洗:0 空 think 块 / 0 重复 / 0 system 污染)
  • —训练:3 epoch,13,443 步,final loss 1.591(2.245 → 1.591,健康收敛)
  • —硬件:RTX 3090 24GB
  • —导出:GGUF(forced_merged_4bit)→ Q4KM / Q6_K;int8 / AWQ / AutoAWQ 走各自量化流水线

推理示例(llama.cpp)

bash
# Q4_K_M(推荐,需 ~19GB 显存)
llama-server -m qwen3.8-27b-Buddhist-16bit.Q4_K_M.gguf -c 32768 -ngl 99

# 带视觉模块
llama-server -m qwen3.8-27b-Buddhist-16bit.Q4_K_M.gguf \
  --mmproj qwen3.8-27b-Buddhist-16bit.BF16-mmproj.gguf -c 32768 -ngl 99

显存需求参考:

硬件Q4_K_MQ6_K
RTX 3060 12GB⚠️ 需 CPU offload(实测 ~19-23 t/s)❌
RTX 3090 24GB✅ 全 GPU✅ 全 GPU
双 2080Ti 44GB✅ 全 GPU✅ 全 GPU

许可

基于 Qwen3.8-27B(Apache-2.0)微调,权重与数据均以 Apache-2.0 发布。