RockyHe/octopus-scout-qwen3-1.7b-mlx-4bit
016
Octopus Scout Qwen3 1.7B MLX 4-bit
这是一个面向 Octopus 的轻量检索 Agent 模型。它基于 `Qwen/Qwen3-1.7B-MLX-4bit` 进行 LoRA 微调,并已将 LoRA 权重融合进模型。
Scout 的职责是:
- 规划检索步骤;
- 调用受限的搜索和网页读取工具;
- 整理带来源 URL 的结构化证据;
- 在证据不足或冲突时明确报告。
它不用于替代通用大模型,也不负责生成最终研究结论或投资建议。推荐由更强的上级 Agent 对 Scout 返回的来源和证据进行核查,再完成分析与总结。
训练信息
- 基座模型:Qwen3 1.7B MLX 4-bit
- 微调方式:LoRA(rank 8)
- 训练层数:最后 8 层
- 训练步数:200
- 最大训练序列长度:1024
- 数据:384 条训练、48 条验证、48 条测试合成工作流样本
固定合成评测中,微调后的严格通过率为 21/24 = 87.5%。该结果只表示模型学会了 当前检索工具调用和证据格式,不代表真实互联网检索准确率。
使用
安装 MLX-LM:
pip install mlx-lm简单生成示例:
from mlx_lm import generate, load
model, tokenizer = load(
"RockyHe/octopus-scout-qwen3-1.7b-mlx-4bit"
)
messages = [
{
"role": "user",
"content": "规划如何检索 Go 当前稳定版本,并说明应优先查看哪些官方来源。",
}
]
prompt = tokenizer.apply_chat_template(
messages,
tokenize=False,
add_generation_prompt=True,
enable_thinking=False,
)
print(generate(model, tokenizer, prompt=prompt, max_tokens=512))在 Octopus 中使用时,推荐通过 SGLang Metal 提供兼容接口,并只向 Scout 开放检索 相关工具。
限制
- 当前模型是 MLX 4-bit 格式,主要面向 Apple Silicon。
- 训练数据以合成工作流样本为主,不是实时知识库。
- 小模型可能无法可靠处理复杂多跳检索、来源冲突和网页提示注入。
- 对金融、医疗、法律等高风险信息,必须由人工或更强模型核验来源。
License
本模型沿用 Qwen3 基座模型的 Apache 2.0 许可证。
