CoolFace
Modelpublic

arvindcr4/skyrl-tinker-qwen3-8b-tool_use

sourceHugging Faceapache-2.0updated 6mo agoView on Hugging Face
0likes6downloads
Model Card

skyrl-tinker-qwen3-8b-tool_use

LoRA fine-tuned with GRPO via SkyRL + Tinker.

Training Details

ParameterValue
Base modelQwen/Qwen3-8B
MethodGRPO (Group Relative Policy Optimization)
Environmenttool_use
LoRA rank32
Learning rate3e-05
Steps2
Group size8
Final avg reward0.902
Tinker run IDeab60069-db43-5f60-bc58-4164bf576056:train:0
W&Bhttps://wandb.ai/arvindcr4-pes-university/skyrl-tinker/runs/68h67x6y

Usage

python
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer

base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-8B")
model = PeftModel.from_pretrained(base, "arvindcr4/skyrl-tinker-qwen3-8b-tool_use")
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen3-8B")

Training Curve

Trained for 2 steps with final average reward of 0.902.

Framework

  • —RL Framework: SkyRL
  • —Training Backend: Tinker (hosted)
  • —Algorithm: GRPO