CoolFace
Modelpublic

PengxinWang/RobustLLMAgent

sourceHugging Faceupdated 7h agoView on Hugging Face
2likes
Model Card

RobustLLMAgent

面向 ALFWorld 与 WebShop 的 Qwen2.5 强化学习模型。所有模型与算法统一以 step200 为比较基准,training seed=0,thinking off。训练采用 GiGPO。

已完成训练的模型

模型环境算法下载目录
Qwen2.5-1.5B-InstructALFWorldVanillaglobal_step_300
Qwen2.5-1.5B-InstructALFWorldPlain Gaussianglobal_step_300
Qwen2.5-1.5B-InstructWebShopVanillaglobal_step_300
Qwen2.5-1.5B-InstructWebShopPlain Gaussianglobal_step_300
Qwen2.5-1.5B-InstructWebShopStable Gaussianglobal_step_200
Qwen2.5-7B-InstructALFWorldVanillaglobal_step_200
Qwen2.5-7B-InstructALFWorldPlain Gaussianglobal_step_200
Qwen2.5-7B-InstructWebShopVanillaglobal_step_200
Qwen2.5-7B-InstructWebShopPlain Gaussianglobal_step_200

表中链接标明可下载的 checkpoint;WebShop 1.5B Stable Gaussian 主结果采用 step200。

下载内容为 LoRA adapter,需搭配对应的 Qwen2.5-Instruct 基座使用。训练与评测入口见 GitHub 项目。