CoolFace
Modelpublic

RockyHe/octopus-scout-qwen3-1.7b-mlx-4bit

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes16downloads
Model Card

Octopus Scout Qwen3 1.7B MLX 4-bit

这是一个面向 Octopus 的轻量检索 Agent 模型。它基于 `Qwen/Qwen3-1.7B-MLX-4bit` 进行 LoRA 微调,并已将 LoRA 权重融合进模型。

Scout 的职责是:

  • —规划检索步骤;
  • —调用受限的搜索和网页读取工具;
  • —整理带来源 URL 的结构化证据;
  • —在证据不足或冲突时明确报告。

它不用于替代通用大模型,也不负责生成最终研究结论或投资建议。推荐由更强的上级 Agent 对 Scout 返回的来源和证据进行核查,再完成分析与总结。

训练信息

  • —基座模型:Qwen3 1.7B MLX 4-bit
  • —微调方式:LoRA(rank 8)
  • —训练层数:最后 8 层
  • —训练步数:200
  • —最大训练序列长度:1024
  • —数据:384 条训练、48 条验证、48 条测试合成工作流样本

固定合成评测中,微调后的严格通过率为 21/24 = 87.5%。该结果只表示模型学会了 当前检索工具调用和证据格式,不代表真实互联网检索准确率。

使用

安装 MLX-LM:

bash
pip install mlx-lm

简单生成示例:

python
from mlx_lm import generate, load

model, tokenizer = load(
    "RockyHe/octopus-scout-qwen3-1.7b-mlx-4bit"
)

messages = [
    {
        "role": "user",
        "content": "规划如何检索 Go 当前稳定版本,并说明应优先查看哪些官方来源。",
    }
]
prompt = tokenizer.apply_chat_template(
    messages,
    tokenize=False,
    add_generation_prompt=True,
    enable_thinking=False,
)

print(generate(model, tokenizer, prompt=prompt, max_tokens=512))

在 Octopus 中使用时,推荐通过 SGLang Metal 提供兼容接口,并只向 Scout 开放检索 相关工具。

限制

  • —当前模型是 MLX 4-bit 格式,主要面向 Apple Silicon。
  • —训练数据以合成工作流样本为主,不是实时知识库。
  • —小模型可能无法可靠处理复杂多跳检索、来源冲突和网页提示注入。
  • —对金融、医疗、法律等高风险信息,必须由人工或更强模型核验来源。

License

本模型沿用 Qwen3 基座模型的 Apache 2.0 许可证。