CoolFace
Modelpublic

HyperXu/Qwen3-4B-Lily-GGUF

sourceHugging Faceapache-2.0updated 5mo agoView on Hugging Face
0likes29downloads
Model Card

Qwen3-4B-Lily-GGUF

傲娇女仆「Lily」风格的电脑日记 LLM。基于 Qwen3-4B LoRA 微调后量化为 GGUF Q4KM(~2.4 GB)。

设计目的:配合 Hindsight(电脑活动记录工具)使用 —— 喂入「时段头 + 应用使用统计 + 截图描述列表」,输出傲娇女仆风的当日时段日记。

模型行为示例

输入(Hindsight 时段记录格式):

时段:上午(09:00 – 12:00)
使用最多的应用:
- VS Code(87 分钟 · code)
- Chrome(43 分钟 · browse)

下面是该时段内若干张截图的逐一描述:
1. [09:55] 在 VS Code 中编辑 Rust 代码...
2. [09:57] 用户在 Chrome 浏览 Claude 的对话界面...
...

输出:

哼,主人今天上午开局就有点不老实。09:55 在 VS Code 看 Rust 代码……
(傲娇女仆风时段叙述,约 200~400 字)

用法

llama.cpp

bash
llama-server -m lily-q4_k_m.gguf --jinja -ngl 99 -c 2048 --port 8080

Ollama

创建 Modelfile:

FROM ./lily-q4_k_m.gguf

PARAMETER temperature 0.8
PARAMETER top_p 0.9

SYSTEM """你是 Lily,主人家的首席女仆兼"电脑日记本"。
你的任务是把主人某个时段的电脑活动原始记录,改写成 Lily 风的时段叙述。
(详见仓库内 system_prompt.txt)"""

然后:

bash
ollama create lily -f Modelfile
ollama run lily

Python (llama-cpp-python)

python
from llama_cpp import Llama

llm = Llama(
    model_path="lily-q4_k_m.gguf",
    n_gpu_layers=99,
    n_ctx=2048,
    chat_format="qwen",
)

response = llm.create_chat_completion(
    messages=[
        {"role": "system", "content": "你是 Lily,主人家的傲娇女仆兼电脑日记本..."},
        {"role": "user", "content": "时段:上午(09:00 – 12:00)..."},
    ],
    temperature=0.8,
)
print(response["choices"][0]["message"]["content"])

训练细节

项配置
BaseQwen/Qwen3-4B
方法LoRA
LoRA rankr=16, α=32
Target modulesq/k/v/o + gate/up/down (full attention + MLP)
Epochs5
Effective batch16
Learning rate2e-4 (cosine, warmup 5%)
数据~847 (Hindsight 时段记录, Lily 风改写) 对
数据来源DeepSeek-V4 Pro API 蒸馏 + regex 救援解析
量化Q4KM (4.95 BPW, ~2.4 GB)

推荐推理参数

temperature=0.8
top_p=0.9
max_tokens=600
enable_thinking=false   # Qwen3 自带 thinking 模式,必须关闭

License

Apache 2.0(继承自 Qwen3)。

训练流水线开源

完整训练代码(数据蒸馏 + LoRA 训练 + 合并 + 量化): GitHub repo 配套笔记。