plclmezboss/opd-power-diff-student-qwen3-0.6b-teacher-qwen3-4b-alpha1-checkpoint-1500
010
plclmezboss/opd-power-diff-student-qwen3-0.6b-teacher-qwen3-4b-alpha1-checkpoint-1500
Final checkpoint from an OPD Reward Shaping run.
Run Metadata
- Student model:
Qwen3-0.6B-Base - Teacher model:
Qwen3-4B - Reward mode:
sampled_power_diff - Power reward alpha:
1 - Terminal stop target:
mask - Max completion length:
1024 - Checkpoint:
checkpoint-1500 - Run tag:
20260518_112528 - Source checkpoint path:
/workspace/anhao/OPD-Reward-Shaping/experiments/power_diff_reward_sampled_power_diff_studentQwen3-0.6B-Base_teacherQwen3-4B/non_thinking/maxlen1024/terminal_mask/alpha1_loss_window_token_mean_reward_none/20260518_112528/checkpoints/checkpoint-1500
Contents
This repository contains the inference-ready model files only: model weights, config, tokenizer files, and chat template. Training-state artifacts such as optimizer, scheduler, RNG, and trainer state are omitted.
