CoolFace
Modelpublic

SeongryongJung/Qwen3-8B-Material-GRPO-TR

sourceHugging Faceapache-2.0updated 3mo agoView on Hugging Face
0likes7downloads
Model Card

Qwen3-8B-Material-GRPO-TR

This repository contains the Qwen3-8B material GRPO batch-size-32 run. The repository name uses the project GRPO-TR naming convention, but the actual training method for this checkpoint is GRPO.

The repository root contains the best validation checkpoint, selected by validation mean@16. checkpoints/last/ contains the final checkpoint.

Performance

DatasetMethodBase modelTrain batch sizeBest val mean@16Best checkpointFinal val mean@16Final checkpoint
Material / SciKnowEval materialGRPOQwen3-8B3277.99%10077.99%100

[image]

Validation Mean@16

stepval_mean16percent
100.67952127659667.95%
200.70678191489470.68%
300.70279255319170.28%
400.72406914893672.41%
500.74069148936274.07%
600.75332446808575.33%
700.75930851063875.93%
800.75066489361775.07%
900.75930851063875.93%
1000.77992021276677.99%

Detailed Training Hyperparameters

SectionParameterValueSource
Run identityBase modelQwen/Qwen3-8Bqueue/script override
Run identityDatasetMaterial / SciKnowEval materialrunqwen3generalization.sh
Run identityMethodGRPOrunqwen3generalization.sh
Run identityConfigbaseline_grporunqwen3generalization.sh
Run identityExperimentqwen3gen-material-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8runqwen3generalization.sh
Run identityW&B runrun-20260703_105138-1ud3umazwandb
DataTrain filedatasets/sciknoweval/material/train.parquetscript override
DataValidation filedatasets/sciknoweval/material/test.parquetscript override
DataTrain batch size32queue/script override
DataTrain max samples3200queue/script override
ScheduleTotal training steps100queue/script override
ScheduleValidation before trainFalsequeue/script override
ScheduleSave frequency10queue/script override
ScheduleValidation frequency10queue/script override
SequenceMax prompt length2048queue/script override
SequenceMax response length8192queue/script override
SequenceMax model length10240queue/script override
RolloutTrain rollout n8queue/script override
RolloutValidation rollout n16queue/script override
RolloutvLLM GPU memory utilization0.8queue/script override
OptimizationLearning rate1e-6GRPO method override
OptimizationWeight decay0.01script override
PPO/GRPOPPO mini batch size8queue/script override
PPO/GRPONormalize GRPO advantages by stdFalsebaseline_grpo.yaml / script override
Rollout correctionImportance sampling modetokenscript override
Rollout correctionIS threshold2.0script override
Checkpoint/LoggingCheckpoint rootcheckpoints/datasets/sciknoweval/material/qwen3gen-material-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8script override
Checkpoint/LoggingLatest checkpointed iteration100latestcheckpointediteration.txt
Checkpoint/LoggingExternal actor archivecheckpoints/datasets/sciknoweval/material/qwen3gen-material-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8/_actor_archivepreserveactorcheckpoints.py
Checkpoint/LoggingLoggerconsole, wandbppo_trainer.yaml
PPO/GRPOPolicy loss modevanillamethod override
PPO/GRPOActor KL loss coef0.0method override

Raw result and artifact files:

  • —results/validation_mean16.csv
  • —results/training_scores.csv
  • —results/hyperparameters.csv
  • —results/training_score.png
  • —results/training_score.svg
  • —artifacts/output.log
  • —artifacts/queue.log

Usage

python
from transformers import AutoModelForCausalLM, AutoTokenizer

repo_id = "SeongryongJung/Qwen3-8B-Material-GRPO-TR"
tokenizer = AutoTokenizer.from_pretrained(repo_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    repo_id,
    torch_dtype="auto",
    device_map="auto",
    trust_remote_code=True,
)

Source

  • —Checkpoint: checkpoints/datasets/sciknoweval/material/qwen3gen-material-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8
  • —Root actor checkpoint: checkpoints/datasets/sciknoweval/material/qwen3gen-material-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor
  • —Last actor checkpoint: checkpoints/datasets/sciknoweval/material/qwen3gen-material-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor
  • —W&B run: run-20260703_105138-1ud3umaz
  • —Queue log: artifacts/queue.log