CoolFace
Modelpublic

SeongryongJung/Qwen3-4B-Material-GRPO-TR

sourceHugging Faceapache-2.0updated 3mo agoView on Hugging Face
0likes11downloads
Model Card

Qwen3-4B-Material-GRPO-TR

This repository contains the Qwen3-4B material GRPO batch-size-32 run. The repository name uses the project GRPO-TR naming convention, but the actual training method for this checkpoint is GRPO.

The repository root contains the best validation checkpoint, selected by validation mean@16. checkpoints/last/ contains the final checkpoint.

Performance

DatasetMethodBase modelTrain batch sizeBest val mean@16Best checkpointFinal val mean@16Final checkpoint
Material / SciKnowEval materialGRPOQwen3-4B3276.60%6076.26%100

[image]

Validation Mean@16

stepval_mean16percent
100.66888297872366.89%
200.69547872340469.55%
300.71675531914971.68%
400.73936170212873.94%
500.75465425531975.47%
600.76595744680976.60%
700.75000000000075.00%
800.75066489361775.07%
900.75664893617075.66%
1000.76263297872376.26%

Detailed Training Hyperparameters

SectionParameterValueSource
Run identityBase modelQwen/Qwen3-4Bqueue/script override
Run identityDatasetMaterial / SciKnowEval materialrunqwen3generalization.sh
Run identityMethodGRPOrunqwen3generalization.sh
Run identityConfigbaseline_grporunqwen3generalization.sh
Run identityExperimentqwen3gen-material-GRPO-Qwen-Qwen3-4B-mbs8-train32-rollout8-lr1e-6-vllm0.8runqwen3generalization.sh
Run identityW&B runrun-20260702_125526-lnzvk3fvwandb
DataTrain filedatasets/sciknoweval/material/train.parquetscript override
DataValidation filedatasets/sciknoweval/material/test.parquetscript override
DataTrain batch size32queue/script override
DataTrain max samples3200queue/script override
ScheduleTotal training steps100queue/script override
ScheduleValidation before trainFalsequeue/script override
ScheduleSave frequency10queue/script override
ScheduleValidation frequency10queue/script override
SequenceMax prompt length2048queue/script override
SequenceMax response length8192queue/script override
SequenceMax model length10240queue/script override
RolloutTrain rollout n8queue/script override
RolloutValidation rollout n16queue/script override
RolloutvLLM GPU memory utilization0.8queue/script override
OptimizationLearning rate1e-6GRPO method override
OptimizationWeight decay0.01script override
PPO/GRPOPPO mini batch size8queue/script override
PPO/GRPONormalize GRPO advantages by stdFalsebaseline_grpo.yaml / script override
Rollout correctionImportance sampling modetokenscript override
Rollout correctionIS threshold2.0script override
Checkpoint/LoggingCheckpoint rootcheckpoints/datasets/sciknoweval/material/qwen3gen-material-GRPO-Qwen-Qwen3-4B-mbs8-train32-rollout8-lr1e-6-vllm0.8script override
Checkpoint/LoggingLatest checkpointed iteration100latestcheckpointediteration.txt
Checkpoint/LoggingExternal actor archivecheckpoints/datasets/sciknoweval/material/qwen3gen-material-GRPO-Qwen-Qwen3-4B-mbs8-train32-rollout8-lr1e-6-vllm0.8/_actor_archivepreserveactorcheckpoints.py
Checkpoint/LoggingLoggerconsole, wandbppo_trainer.yaml
PPO/GRPOPolicy loss modevanillamethod override
PPO/GRPOActor KL loss coef0.0method override

Raw result and artifact files:

  • —results/validation_mean16.csv
  • —results/training_scores.csv
  • —results/hyperparameters.csv
  • —results/training_score.png
  • —results/training_score.svg
  • —artifacts/config.yaml
  • —artifacts/wandb-summary.json
  • —artifacts/wandb-metadata.json
  • —artifacts/output.log
  • —artifacts/queue.log

Usage

python
from transformers import AutoModelForCausalLM, AutoTokenizer

repo_id = "SeongryongJung/Qwen3-4B-Material-GRPO-TR"
tokenizer = AutoTokenizer.from_pretrained(repo_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    repo_id,
    torch_dtype="auto",
    device_map="auto",
    trust_remote_code=True,
)

Source

  • —Checkpoint: checkpoints/datasets/sciknoweval/material/qwen3gen-material-GRPO-Qwen-Qwen3-4B-mbs8-train32-rollout8-lr1e-6-vllm0.8
  • —Root actor checkpoint: checkpoints/datasets/sciknoweval/material/qwen3gen-material-GRPO-Qwen-Qwen3-4B-mbs8-train32-rollout8-lr1e-6-vllm0.8/_actor_archive/global_step_60/actor
  • —Last actor checkpoint: checkpoints/datasets/sciknoweval/material/qwen3gen-material-GRPO-Qwen-Qwen3-4B-mbs8-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor
  • —W&B run: run-20260702_125526-lnzvk3fv
  • —Queue log: artifacts/queue.log