CoolFace
Modelpublic

zhongweixie/claw-rl-v13-grpo-dr-rubric

sourceHugging Faceapache-2.0updated 19d agoView on Hugging Face
0likes26downloads
Model Card

qwen3vl-8b-claw-rl-grpo-dr-rubric-stage3-iter560

在内部 agent 任务集上做 RL 微调得到的 Qwen3-VL-8B 模型。

这不是 Qwen3-VL-8B-Instruct 本身,上游那份模型卡里的任何跑分都不适用于本模型。

训练配置

项值
实验名exp_rl_v5_v13_grpo_dr_rubric_stage3
算法GRPO
变体启用 rubric overlay (rubric_overlay_v13_dr_rubric.json)。
起点stage3 SFT checkpoint,其上游为 Qwen3-VL-8B-Instruct
最终 checkpointiter_0000560
训练量561 个 rollout step,约 3 个 epoch,187 条 prompt
samples / prompt8
rollout batch1
global batch8
硬件8xH800,TP=8,colocate
奖励 judgeqwen/qwen-2.5-72b-instruct (OpenRouter)

学习率、KL 系数等由 slime 的 formal profile 提供,未在启动脚本中显式设置, 故此处不列出,以免给出未经核实的数值。

评测状态

目前没有可信的 held-out 评测数字。 不要把本模型当作已验证优于其起点。

原因:

  • —冷启动对照实验因环境问题未能跑起来,缺少可比基线。
  • —held-out 驱动脚本会主动拒绝一部分任务(沙箱快照类、多模态输入类), 覆盖率不足全集,其总分不能当作全集分数引用。

起点 SFT checkpoint 记录的 eval=0.506 是起点的分数,不是本模型的分数。

用法

python
from transformers import Qwen3VLForConditionalGeneration, AutoProcessor

model = Qwen3VLForConditionalGeneration.from_pretrained(
    "zhongweixie/qwen3vl-8b-claw-rl-grpo-dr-rubric-stage3-iter560",
    dtype="auto",
    device_map="auto",
)
processor = AutoProcessor.from_pretrained(
    "zhongweixie/qwen3vl-8b-claw-rl-grpo-dr-rubric-stage3-iter560"
)

来源

由 slime/tools/convert_torch_dist_to_hf.py 从该实验 iter_0000560 的 Megatron 分布式 checkpoint 转换而来,缺失权重与 tokenizer/config 取自该次 RL 训练实际 使用的 stage3 SFT 基座。