CoolFace
Modelpublic

plclmezboss/opd-power-diff-student-qwen3-0.6b-teacher-qwen3-4b-alpha1-checkpoint-1500

sourceHugging Faceupdated 4mo agoView on Hugging Face
0likes10downloads
Model Card

plclmezboss/opd-power-diff-student-qwen3-0.6b-teacher-qwen3-4b-alpha1-checkpoint-1500

Final checkpoint from an OPD Reward Shaping run.

Run Metadata

  • —Student model: Qwen3-0.6B-Base
  • —Teacher model: Qwen3-4B
  • —Reward mode: sampled_power_diff
  • —Power reward alpha: 1
  • —Terminal stop target: mask
  • —Max completion length: 1024
  • —Checkpoint: checkpoint-1500
  • —Run tag: 20260518_112528
  • —Source checkpoint path: /workspace/anhao/OPD-Reward-Shaping/experiments/power_diff_reward_sampled_power_diff_studentQwen3-0.6B-Base_teacherQwen3-4B/non_thinking/maxlen1024/terminal_mask/alpha1_loss_window_token_mean_reward_none/20260518_112528/checkpoints/checkpoint-1500

Contents

This repository contains the inference-ready model files only: model weights, config, tokenizer files, and chat template. Training-state artifacts such as optimizer, scheduler, RNG, and trainer state are omitted.