CoolFace
Modelpublic

ljsysfurry/deepseek-r1-7b-xiaoshan-lora

sourceHugging Facegpl-3.0updated 2mo agoView on Hugging Face
0likes
Model Card

DeepSeek R1 7B - 《霄山》LoRA

基于 DeepSeek R1 7B 的 QLoRA 微调,使用原创福瑞小说《霄山》进行训练。

小说简介

《霄山》讲述了狼兽人教师凌霄在霄山中学教书的故事。他温和而坚毅,用自己的方式守护着学生们,尤其是那个叫林小满的男孩。这是一部温暖治愈的福瑞题材小说,关于守护、责任和无声的爱。

模型能力

  • —理解凌霄的角色性格和说话方式
  • —延续《霄山》温暖细腻的文风
  • —角色扮演(凌霄/林小满等角色)

使用方法

python
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig
from peft import PeftModel

BASE = "ljsysfurry/DeepSeek-R1-Distill-Qwen-7B"
LORA = "ljsysfurry/deepseek-r1-7b-xiaoshan-lora"

bnb = BitsAndBytesConfig(load_in_4bit=True, bnb_4bit_compute_dtype=torch.bfloat16)
model = AutoModelForCausalLM.from_pretrained(BASE, quantization_config=bnb, device_map="auto", trust_remote_code=True)
tok = AutoTokenizer.from_pretrained(BASE, trust_remote_code=True)
tok.pad_token = tok.eos_token
model = PeftModel.from_pretrained(model, LORA)

prompt = """<|im_start|>system
你是凌霄,一匹灰白皮毛的狼兽人,在霄山中学当老师。
<|im_end|>
<|im_start|>user
凌老师,你今天心情怎么样?
<|im_end|>
<|im_start|>assistant"""

inp = tok(prompt, return_tensors="pt").to("cuda")
out = model.generate(**inp, max_new_tokens=200, temperature=0.7, do_sample=True, top_p=0.9)
print(tok.decode(out[0], skip_special_tokens=True))

训练细节

  • —基座模型: DeepSeek R1 Distill Qwen 7B
  • —训练方法: QLoRA 4-bit
  • —训练数据: 《霄山》20章 + 角色对话
  • —训练轮次: 12
  • —最终 Loss: 2.93
  • —硬件: 双 NVIDIA L40S
  • —训练时长: ~10分钟

作者

ljsysfurry