CoolFace
Modelpublic

PolarisDane/agentgym-rl-sciworld-qwen2.5-7b-plan-k3-nognorm

sourceHugging Faceapache-2.0updated 7d agoView on Hugging Face
0likes19downloads
Model Card

agentgym-rl-sciworld-qwen2.5-7b-plan-k3-nognorm

ScienceWorld, Qwen2.5-7B-Instruct, plan forecast K=3(不做 group_norm)

用 AgentGym-RL 框架训练的 agentic RL 检查点。

评测

step成功率Average Score
25072.50%53.40

成功率口径为 done 且 score = 100(严格:任务真正完成),200 题官方 eval split,max_rounds=30, temperature=1。

检查点

每个训练 step 是一个独立分支,main 指向 step 250。

  • —step-250 ← main
python
from transformers import AutoModelForCausalLM, AutoTokenizer
m = AutoModelForCausalLM.from_pretrained("PolarisDane/agentgym-rl-sciworld-qwen2.5-7b-plan-k3-nognorm", revision="step-250")
t = AutoTokenizer.from_pretrained("PolarisDane/agentgym-rl-sciworld-qwen2.5-7b-plan-k3-nognorm", revision="step-250")