CoolFace
Modelpublic

SeongryongJung/Qwen3-4B-Chemical-RLSD-TR

sourceHugging Faceapache-2.0updated 3mo agoView on Hugging Face
0likes7downloads
Model Card

Qwen3-4B-Chemical-RLSD-TR

This repository contains the Qwen3-4B Chemical RLSD_TR batch-size-32 run.

The repository root contains the best validation checkpoint, selected by validation mean@16. checkpoints/last/ contains the final checkpoint. For this run, best and final are both global_step_100.

Performance

DatasetMethodBase modelTrain batch sizeBest val mean@16Best checkpointFinal val mean@16Final checkpoint
ChemicalRLSD_TRQwen3-4B3268.96%10068.96%100

[image]

Validation Mean@16

stepval_mean16percent
100.43988095238143.99%
200.51011904761951.01%
300.59434523809559.43%
400.63571428571463.57%
500.65863095238165.86%
600.67351190476267.35%
700.68511904761968.51%
800.67886904761967.89%
900.68214285714368.21%
1000.68958333333368.96%

Detailed Training Hyperparameters

SectionParameterValueSource
Run identityBase modelQwen/Qwen3-4Bqueue/script override
Run identityDatasetChemical / SciKnowEval chemistryrunqwen3generalization.sh
Run identityMethodRLSD_TRrunqwen3generalization.sh
Run identityConfigrlsdrunqwen3generalization.sh
Run identityExperimentqwen3gen-chemistry-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8runqwen3generalization.sh
Run identityW&B runrun-20260702_062054-bz6p2yxywandb
DataTrain filedatasets/sciknoweval/chemistry/train.parquetscript override
DataValidation filedatasets/sciknoweval/chemistry/test.parquetscript override
DataTrain batch size32queue/script override
DataTrain max samples3200queue/script override
DataPrompt keypromptlegacy_data.yaml default
DataReward keydata_sourcelegacy_data.yaml default
DataShuffle train dataTrueuser.yaml / legacy_data.yaml
DataValidation shuffleFalselegacy_data.yaml default
DataFilter overlong promptsTrueuser.yaml
DataPrompt truncationerrorlegacy_data.yaml default
Dataenable_thinkingfalsescript override
ScheduleTotal training steps100queue/script override
ScheduleTotal epochs30ppo_trainer/user.yaml default
ScheduleValidation before trainFalsequeue/script override
ScheduleSave frequency10queue/script override
ScheduleValidation frequency10queue/script override
SequenceMax prompt length2048queue/script override
SequenceMax response length8192queue/script override
SequenceMax model length10240queue/script override
SequenceActor max token length per GPU10240queue/script override
RolloutRollout enginevllmuser.yaml
RolloutRollout dtypebfloat16rollout.yaml default
RolloutTrain rollout n8queue/script override
RolloutTrain rollout temperature1.0script override
RolloutTrain rollout top_p1.0script override
RolloutTrain rollout do_sampleTruerollout.yaml default
RolloutCalculate rollout log probsTruerlsd.yaml / script override
RolloutMax num batched tokens10240queue/script override
RolloutvLLM GPU memory utilization0.8queue/script override
RolloutTensor model parallel size2rollout.yaml default
RolloutFree cache engineTruerollout.yaml default
ValidationValidation rollout n16queue/script override
ValidationValidation temperature0.6queue/script override
ValidationValidation top_p0.95queue/script override
ValidationValidation do_sampleTruequeue/script override
OptimizationOptimizerAdamWfsdp optimizer config
OptimizationLearning rate1e-6RLSD_TR method override
OptimizationLR schedulerconstantW&B config
OptimizationLR warmup steps10script override
OptimizationWeight decay0.01script override
OptimizationBetas(0.9, 0.999)W&B config
OptimizationGradient clip1.0script override
PPO/GRPOAdvantage estimatorgrporlsd.yaml
PPO/GRPONormalize GRPO advantages by stdFalsescript override
PPO/GRPOPPO epochs1W&B config
PPO/GRPOPPO mini batch size8queue/script override
PPO/GRPOPPO micro batch size per GPU1user.yaml
PPO/GRPOClip ratio low0.2script override
PPO/GRPOClip ratio high0.28script override
PPO/GRPOGamma1.0ppo_trainer.yaml default
PPO/GRPOLambda1.0ppo_trainer.yaml default
PPO/GRPOUse KL in rewardFalseppo_trainer/user.yaml
PPO/GRPOActor KL loss observed0.0output.log
Rollout correctionImportance sampling modetokenscript override
Rollout correctionIS threshold2.0script override
RLSD_TRPolicy loss moderlsdmethod override
RLSD_TRTeacher regularizationtrust-regionmethod override
RLSD_TRTrust-region mix / teacher update rate0.1queue/script override
RLSD_TRToken reweight lambda0.5queue/script override
RLSD_TRToken reweight eps_w0.2queue/script override
RLSD_TRToken reweight decay steps0queue/script override
RLSD_TRMax reprompt length10240method override
RLSD_TRFused kernelsFalsemethod override
FSDP/SystemActor strategyfsdpdp_actor.yaml
FSDP/SystemFSDP dtypebfloat16W&B config
FSDP/SystemFSDP model dtypefp32W&B config
FSDP/SystemUse torch compileTrueW&B config
FSDP/SystemGPUs per node8queue/script override
FSDP/SystemNodes1user.yaml
FSDP/SystemGPU typeNVIDIA H200wandb-metadata
Checkpoint/LoggingCheckpoint rootcheckpoints/datasets/sciknoweval/chemistryscript override
Checkpoint/LoggingLatest checkpointed iteration100latestcheckpointediteration.txt
Checkpoint/LoggingMax actor checkpoints to keep1user.yaml
Checkpoint/LoggingLoggerconsole, wandbppo_trainer.yaml
Checkpoint/LoggingW&B entityseongryongjung-chung-ang-universityenvironment
Checkpoint/LoggingW&B projectSDPO-rootuser.yaml project_name
Checkpoint/LoggingW&B groupQWEN3-RLSD-TR-GRPO-matched-generalizationmethod override

Raw result and artifact files:

  • —results/validation_mean16.csv
  • —results/training_scores.csv
  • —results/hyperparameters.csv
  • —results/training_score.png
  • —results/training_score.svg
  • —artifacts/config.yaml
  • —artifacts/wandb-summary.json
  • —artifacts/wandb-metadata.json
  • —artifacts/output.log
  • —artifacts/queue.log

Usage

python
from transformers import AutoModelForCausalLM, AutoTokenizer

repo_id = "SeongryongJung/Qwen3-4B-Chemical-RLSD-TR"
tokenizer = AutoTokenizer.from_pretrained(repo_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    repo_id,
    torch_dtype="auto",
    device_map="auto",
    trust_remote_code=True,
)

Source

  • —Checkpoint: checkpoints/datasets/sciknoweval/chemistry/qwen3gen-chemistry-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8
  • —W&B run: run-20260702_062054-bz6p2yxy
  • —Queue log: artifacts/queue.log