RockToken/qwen3_30b_a3b_to_4b_onpolicy_5k_src20k-25k_freeze_random
06
qwen330ba3bto4bonpolicy5ksrc20k-25kfreeze_random
A 4B math-distilled model. Student fine-tuned from RockToken/qwen3_30b_a3b_to_4b_offpolicy_20k via on-policy reverse-KL distillation against a Qwen3-30B-A3B teacher, using the token_freeze_kd algorithm to mask a 98-token "freeze list" out of the KD loss.
This is the control arm ("random" token set) of an A/B experiment on the effect of selectively freezing certain tokens during on-policy KD.
Training
A/B siblings
- 5k variants (this slice only):
- `RockToken/qwen3_30b_a3b_to_4b_onpolicy_5k_src20k-25k_freeze_random` — control
- `RockToken/qwen3_30b_a3b_to_4b_onpolicy_5k_src20k-25k_freeze_rock` — treatment
- 10k variants (5k + continued 5k on src25k-30k):
- `RockToken/qwen3_30b_a3b_to_4b_onpolicy_10k_src20k-30k_freeze_random` — control
- `RockToken/qwen3_30b_a3b_to_4b_onpolicy_10k_src20k-30k_freeze_rock` — treatment
Use
from transformers import AutoModelForCausalLM, AutoTokenizer
tok = AutoTokenizer.from_pretrained("RockToken/qwen3_30b_a3b_to_4b_onpolicy_5k_src20k-25k_freeze_random")
model = AutoModelForCausalLM.from_pretrained("RockToken/qwen3_30b_a3b_to_4b_onpolicy_5k_src20k-25k_freeze_random", torch_dtype="bfloat16")