SeongryongJung/Qwen3-8B-Material-GRPO-TR
07
Qwen3-8B-Material-GRPO-TR
This repository contains the Qwen3-8B material GRPO batch-size-32 run. The repository name uses the project GRPO-TR naming convention, but the actual training method for this checkpoint is GRPO.
The repository root contains the best validation checkpoint, selected by validation mean@16. checkpoints/last/ contains the final checkpoint.
Performance
Validation Mean@16
Detailed Training Hyperparameters
Raw result and artifact files:
results/validation_mean16.csvresults/training_scores.csvresults/hyperparameters.csvresults/training_score.pngresults/training_score.svgartifacts/output.logartifacts/queue.log
Usage
from transformers import AutoModelForCausalLM, AutoTokenizer
repo_id = "SeongryongJung/Qwen3-8B-Material-GRPO-TR"
tokenizer = AutoTokenizer.from_pretrained(repo_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
repo_id,
torch_dtype="auto",
device_map="auto",
trust_remote_code=True,
)Source
- Checkpoint:
checkpoints/datasets/sciknoweval/material/qwen3gen-material-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8 - Root actor checkpoint:
checkpoints/datasets/sciknoweval/material/qwen3gen-material-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor - Last actor checkpoint:
checkpoints/datasets/sciknoweval/material/qwen3gen-material-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor - W&B run:
run-20260703_105138-1ud3umaz - Queue log:
artifacts/queue.log
