PolarisDane/agentgym-rl-sciworld-qwen2.5-7b-plan-k3-nognorm
019
agentgym-rl-sciworld-qwen2.5-7b-plan-k3-nognorm
ScienceWorld, Qwen2.5-7B-Instruct, plan forecast K=3(不做 group_norm)
用 AgentGym-RL 框架训练的 agentic RL 检查点。
评测
成功率口径为 done 且 score = 100(严格:任务真正完成),200 题官方 eval split,max_rounds=30, temperature=1。
检查点
每个训练 step 是一个独立分支,main 指向 step 250。
step-250← main
from transformers import AutoModelForCausalLM, AutoTokenizer
m = AutoModelForCausalLM.from_pretrained("PolarisDane/agentgym-rl-sciworld-qwen2.5-7b-plan-k3-nognorm", revision="step-250")
t = AutoTokenizer.from_pretrained("PolarisDane/agentgym-rl-sciworld-qwen2.5-7b-plan-k3-nognorm", revision="step-250")