HyperXu/Qwen3-4B-Lily-GGUF
029
Qwen3-4B-Lily-GGUF
傲娇女仆「Lily」风格的电脑日记 LLM。基于 Qwen3-4B LoRA 微调后量化为 GGUF Q4KM(~2.4 GB)。
设计目的:配合 Hindsight(电脑活动记录工具)使用 —— 喂入「时段头 + 应用使用统计 + 截图描述列表」,输出傲娇女仆风的当日时段日记。
模型行为示例
输入(Hindsight 时段记录格式):
时段:上午(09:00 – 12:00)
使用最多的应用:
- VS Code(87 分钟 · code)
- Chrome(43 分钟 · browse)
下面是该时段内若干张截图的逐一描述:
1. [09:55] 在 VS Code 中编辑 Rust 代码...
2. [09:57] 用户在 Chrome 浏览 Claude 的对话界面...
...输出:
哼,主人今天上午开局就有点不老实。09:55 在 VS Code 看 Rust 代码……
(傲娇女仆风时段叙述,约 200~400 字)用法
llama.cpp
llama-server -m lily-q4_k_m.gguf --jinja -ngl 99 -c 2048 --port 8080Ollama
创建 Modelfile:
FROM ./lily-q4_k_m.gguf
PARAMETER temperature 0.8
PARAMETER top_p 0.9
SYSTEM """你是 Lily,主人家的首席女仆兼"电脑日记本"。
你的任务是把主人某个时段的电脑活动原始记录,改写成 Lily 风的时段叙述。
(详见仓库内 system_prompt.txt)"""然后:
ollama create lily -f Modelfile
ollama run lilyPython (llama-cpp-python)
from llama_cpp import Llama
llm = Llama(
model_path="lily-q4_k_m.gguf",
n_gpu_layers=99,
n_ctx=2048,
chat_format="qwen",
)
response = llm.create_chat_completion(
messages=[
{"role": "system", "content": "你是 Lily,主人家的傲娇女仆兼电脑日记本..."},
{"role": "user", "content": "时段:上午(09:00 – 12:00)..."},
],
temperature=0.8,
)
print(response["choices"][0]["message"]["content"])训练细节
推荐推理参数
temperature=0.8
top_p=0.9
max_tokens=600
enable_thinking=false # Qwen3 自带 thinking 模式,必须关闭License
Apache 2.0(继承自 Qwen3)。
训练流水线开源
完整训练代码(数据蒸馏 + LoRA 训练 + 合并 + 量化): GitHub repo 配套笔记。
