CoolFace
Modelpublic

SeongryongJung/Qwen3-8B-Biology-GRPO-TR

sourceHugging Faceapache-2.0updated 3mo agoView on Hugging Face
0likes16downloads
Model Card

Qwen3-8B-Biology-GRPO-TR

This repository contains the Qwen3-8B biology GRPO batch-size-32 run. The repository name uses the project GRPO-TR naming convention, but the actual training method for this checkpoint is GRPO.

The repository root contains the best validation checkpoint, selected by validation mean@16. checkpoints/last/ contains the final checkpoint.

Performance

DatasetMethodBase modelTrain batch sizeBest val mean@16Best checkpointFinal val mean@16Final checkpoint
Biology / SciKnowEval biologyGRPOQwen3-8B3250.38%9049.88%100

[image]

Validation Mean@16

stepval_mean16percent
100.30500000000030.50%
200.29875000000029.88%
300.41125000000041.12%
400.39125000000039.12%
500.37625000000037.62%
600.47500000000047.50%
700.46000000000046.00%
800.48750000000048.75%
900.50375000000050.38%
1000.49875000000049.88%

Detailed Training Hyperparameters

SectionParameterValueSource
Run identityBase modelQwen/Qwen3-8Bqueue/script override
Run identityDatasetBiology / SciKnowEval biologyrunqwen3generalization.sh
Run identityMethodGRPOrunqwen3generalization.sh
Run identityConfigbaseline_grporunqwen3generalization.sh
Run identityExperimentqwen3gen-biology-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8runqwen3generalization.sh
Run identityW&B runrun-20260703_072949-j4sb7trrwandb
DataTrain filedatasets/sciknoweval/biology/train.parquetscript override
DataValidation filedatasets/sciknoweval/biology/test.parquetscript override
DataTrain batch size32queue/script override
DataTrain max samples3200queue/script override
ScheduleTotal training steps100queue/script override
ScheduleValidation before trainFalsequeue/script override
ScheduleSave frequency10queue/script override
ScheduleValidation frequency10queue/script override
SequenceMax prompt length2048queue/script override
SequenceMax response length8192queue/script override
SequenceMax model length10240queue/script override
RolloutTrain rollout n8queue/script override
RolloutValidation rollout n16queue/script override
RolloutvLLM GPU memory utilization0.8queue/script override
OptimizationLearning rate1e-6GRPO method override
OptimizationWeight decay0.01script override
PPO/GRPOPPO mini batch size8queue/script override
PPO/GRPONormalize GRPO advantages by stdFalsebaseline_grpo.yaml / script override
Rollout correctionImportance sampling modetokenscript override
Rollout correctionIS threshold2.0script override
Checkpoint/LoggingCheckpoint rootcheckpoints/datasets/sciknoweval/biology/qwen3gen-biology-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8script override
Checkpoint/LoggingLatest checkpointed iteration100latestcheckpointediteration.txt
Checkpoint/LoggingExternal actor archivecheckpoints/datasets/sciknoweval/biology/qwen3gen-biology-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8/_actor_archivepreserveactorcheckpoints.py
Checkpoint/LoggingLoggerconsole, wandbppo_trainer.yaml
PPO/GRPOPolicy loss modevanillamethod override
PPO/GRPOActor KL loss coef0.0method override

Raw result and artifact files:

  • —results/validation_mean16.csv
  • —results/training_scores.csv
  • —results/hyperparameters.csv
  • —results/training_score.png
  • —results/training_score.svg
  • —artifacts/output.log
  • —artifacts/queue.log

Usage

python
from transformers import AutoModelForCausalLM, AutoTokenizer

repo_id = "SeongryongJung/Qwen3-8B-Biology-GRPO-TR"
tokenizer = AutoTokenizer.from_pretrained(repo_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    repo_id,
    torch_dtype="auto",
    device_map="auto",
    trust_remote_code=True,
)

Source

  • —Checkpoint: checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8
  • —Root actor checkpoint: checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8/global_step_90/actor
  • —Last actor checkpoint: checkpoints/datasets/sciknoweval/biology/qwen3gen-biology-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor
  • —W&B run: run-20260703_072949-j4sb7trr
  • —Queue log: artifacts/queue.log