| Run identity | Base model | Qwen/Qwen3-4B | queue/script override |
| Run identity | Dataset | Physics / SciKnowEval physics | runqwen3generalization.sh |
| Run identity | Method | RLSD_TR | runqwen3generalization.sh |
| Run identity | Config | rlsd | runqwen3generalization.sh |
| Run identity | Experiment | qwen3gen-physics-RLSD_TR-Qwen-Qwen3-4B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8 | runqwen3generalization.sh |
| Run identity | W&B run | run-20260702_085822-eajdt9hv | wandb |
| Data | Train file | datasets/sciknoweval/physics/train.parquet | script override |
| Data | Validation file | datasets/sciknoweval/physics/test.parquet | script override |
| Data | Train batch size | 32 | queue/script override |
| Data | Train max samples | 3200 | queue/script override |
| Data | Prompt key | prompt | legacy_data.yaml default |
| Data | Reward key | data_source | legacy_data.yaml default |
| Data | Shuffle train data | True | user.yaml / legacy_data.yaml |
| Data | Validation shuffle | False | legacy_data.yaml default |
| Data | Filter overlong prompts | True | user.yaml |
| Data | Prompt truncation | error | legacy_data.yaml default |
| Data | enable_thinking | false | script override |
| Schedule | Total training steps | 100 | queue/script override |
| Schedule | Total epochs | 30 | ppo_trainer/user.yaml default |
| Schedule | Validation before train | False | queue/script override |
| Schedule | Save frequency | 10 | queue/script override |
| Schedule | Validation frequency | 10 | queue/script override |
| Sequence | Max prompt length | 2048 | queue/script override |
| Sequence | Max response length | 8192 | queue/script override |
| Sequence | Max model length | 10240 | queue/script override |
| Sequence | Actor max token length per GPU | 10240 | queue/script override |
| Rollout | Rollout engine | vllm | user.yaml |
| Rollout | Rollout dtype | bfloat16 | rollout.yaml default |
| Rollout | Train rollout n | 8 | queue/script override |
| Rollout | Train rollout temperature | 1.0 | script override |
| Rollout | Train rollout top_p | 1.0 | script override |
| Rollout | Train rollout do_sample | True | rollout.yaml default |
| Rollout | Calculate rollout log probs | True | rlsd.yaml / script override |
| Rollout | Max num batched tokens | 10240 | queue/script override |
| Rollout | vLLM GPU memory utilization | 0.8 | queue/script override |
| Rollout | Tensor model parallel size | 2 | rollout.yaml default |
| Rollout | Free cache engine | True | rollout.yaml default |
| Validation | Validation rollout n | 16 | queue/script override |
| Validation | Validation temperature | 0.6 | queue/script override |
| Validation | Validation top_p | 0.95 | queue/script override |
| Validation | Validation do_sample | True | queue/script override |
| Optimization | Optimizer | AdamW | fsdp optimizer config |
| Optimization | Learning rate | 1e-6 | RLSD_TR method override |
| Optimization | LR scheduler | constant | W&B config |
| Optimization | LR warmup steps | 10 | script override |
| Optimization | Weight decay | 0.01 | script override |
| Optimization | Betas | (0.9, 0.999) | W&B config |
| Optimization | Gradient clip | 1.0 | script override |
| PPO/GRPO | Advantage estimator | grpo | rlsd.yaml |
| PPO/GRPO | Normalize GRPO advantages by std | False | script override |
| PPO/GRPO | PPO epochs | 1 | W&B config |
| PPO/GRPO | PPO mini batch size | 8 | queue/script override |
| PPO/GRPO | PPO micro batch size per GPU | 1 | user.yaml |
| PPO/GRPO | Clip ratio low | 0.2 | script override |
| PPO/GRPO | Clip ratio high | 0.28 | script override |
| PPO/GRPO | Gamma | 1.0 | ppo_trainer.yaml default |
| PPO/GRPO | Lambda | 1.0 | ppo_trainer.yaml default |
| PPO/GRPO | Use KL in reward | False | ppo_trainer/user.yaml |
| PPO/GRPO | Actor KL loss observed | 0.0 | output.log |
| Rollout correction | Importance sampling mode | token | script override |
| Rollout correction | IS threshold | 2.0 | script override |
| RLSD_TR | Policy loss mode | rlsd | method override |
| RLSD_TR | Teacher regularization | trust-region | method override |
| RLSD_TR | Trust-region mix / teacher update rate | 0.1 | queue/script override |
| RLSD_TR | Token reweight lambda | 0.5 | queue/script override |
| RLSD_TR | Token reweight eps_w | 0.2 | queue/script override |
| RLSD_TR | Token reweight decay steps | 0 | queue/script override |
| RLSD_TR | Max reprompt length | 10240 | method override |
| RLSD_TR | Fused kernels | False | method override |
| FSDP/System | Actor strategy | fsdp | dp_actor.yaml |
| FSDP/System | FSDP dtype | bfloat16 | W&B config |
| FSDP/System | FSDP model dtype | fp32 | W&B config |
| FSDP/System | Use torch compile | True | W&B config |
| FSDP/System | GPUs per node | 8 | queue/script override |
| FSDP/System | Nodes | 1 | user.yaml |
| FSDP/System | GPU type | NVIDIA H200 | wandb-metadata |
| Checkpoint/Logging | Checkpoint root | checkpoints/datasets/sciknoweval/physics | script override |
| Checkpoint/Logging | Latest checkpointed iteration | 100 | latestcheckpointediteration.txt |
| Checkpoint/Logging | Max actor checkpoints to keep | 1 | user.yaml |
| Checkpoint/Logging | Logger | console, wandb | ppo_trainer.yaml |
| Checkpoint/Logging | W&B entity | seongryongjung-chung-ang-university | environment |
| Checkpoint/Logging | W&B project | SDPO-root | user.yaml project_name |
| Checkpoint/Logging | W&B group | QWEN3-RLSD-TR-GRPO-matched-generalization | method override |