CoolFace
Modelpublic

arvindcr4/tinker-rl-scale_gsm8k_qwen3-8b-qwen3-8b

sourceHugging Faceapache-2.0updated 5mo agoView on Hugging Face
0likes
Model Card

tinker-rl-scalegsm8kqwen3-8b-qwen3-8b

LoRA adapters trained with GRPO on top of Qwen/Qwen3-8B using the Tinker cloud training service. Part of the TinkerRL-Bench release for our NeurIPS submission "A Unified Benchmark for RL Post-Training of Language Models" (repo).

Training configuration

Base modelQwen/Qwen3-8B
Experiment tagscale_gsm8k_qwen3-8b
CampaignNone
Taskgsm8k
Seed42
LoRA rank32
Learning rate3e-05
Group size8
Training steps30
PlatformTinker (tinker)
Training run ID3154dee5-4fd7-59b6-ba3b-721eef675bfc

Metrics

MetricValue
First-5 reward avg0.3125
Last-10 reward avg0.34375
Peak reward0.625
Peak accuracy0.625
Last-10 accuracy0.34375

Checkpoints in this repo

StepOriginal Tinker URILocal path
sampler_weights/finaltinker://3154dee5-4fd7-59b6-ba3b-721eef675bfc:train:0/sampler_weights/finalfinal

How to load

python
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer

base = "Qwen/Qwen3-8B"
adapter = "arvindcr4/tinker-rl-scale_gsm8k_qwen3-8b-qwen3-8b"

tok = AutoTokenizer.from_pretrained(base)
model = AutoModelForCausalLM.from_pretrained(base, torch_dtype="auto", device_map="auto")
model = PeftModel.from_pretrained(model, adapter, subfolder="final")  # or "<step>"

Companion releases

Citation

bibtex
@misc{tinkerrlbench2026,
  title   = {A Unified Benchmark for RL Post-Training of Language Models},
  author  = {Arvind, C. R. and Jeyaraj, Sandhya},
  year    = {2026},
  note    = {NeurIPS submission, https://github.com/pes-llm-research/tinker-rl-lab}
}

License

Apache 2.0. The underlying base model retains its original license — please check Qwen/Qwen3-8B for any usage restrictions.