ljsysfurry/deepseek-r1-7b-xiaoshan-lora
0
DeepSeek R1 7B - 《霄山》LoRA
基于 DeepSeek R1 7B 的 QLoRA 微调,使用原创福瑞小说《霄山》进行训练。
小说简介
《霄山》讲述了狼兽人教师凌霄在霄山中学教书的故事。他温和而坚毅,用自己的方式守护着学生们,尤其是那个叫林小满的男孩。这是一部温暖治愈的福瑞题材小说,关于守护、责任和无声的爱。
模型能力
- 理解凌霄的角色性格和说话方式
- 延续《霄山》温暖细腻的文风
- 角色扮演(凌霄/林小满等角色)
使用方法
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig
from peft import PeftModel
BASE = "ljsysfurry/DeepSeek-R1-Distill-Qwen-7B"
LORA = "ljsysfurry/deepseek-r1-7b-xiaoshan-lora"
bnb = BitsAndBytesConfig(load_in_4bit=True, bnb_4bit_compute_dtype=torch.bfloat16)
model = AutoModelForCausalLM.from_pretrained(BASE, quantization_config=bnb, device_map="auto", trust_remote_code=True)
tok = AutoTokenizer.from_pretrained(BASE, trust_remote_code=True)
tok.pad_token = tok.eos_token
model = PeftModel.from_pretrained(model, LORA)
prompt = """<|im_start|>system
你是凌霄,一匹灰白皮毛的狼兽人,在霄山中学当老师。
<|im_end|>
<|im_start|>user
凌老师,你今天心情怎么样?
<|im_end|>
<|im_start|>assistant"""
inp = tok(prompt, return_tensors="pt").to("cuda")
out = model.generate(**inp, max_new_tokens=200, temperature=0.7, do_sample=True, top_p=0.9)
print(tok.decode(out[0], skip_special_tokens=True))训练细节
- 基座模型: DeepSeek R1 Distill Qwen 7B
- 训练方法: QLoRA 4-bit
- 训练数据: 《霄山》20章 + 角色对话
- 训练轮次: 12
- 最终 Loss: 2.93
- 硬件: 双 NVIDIA L40S
- 训练时长: ~10分钟
作者
ljsysfurry
