CoolFace
Modelpublic

Zzyy2000/qwen3-4b-midtrain-reasoning-onpolicy-doc

sourceHugging Faceotherupdated 2mo agoView on Hugging Face
0likes9downloads
Model Card

Qwen3-4B Safety Midtrain ? Reasoning + On-policy Document

Continued-pretraining/midtraining checkpoint initialized from Qwen3-4B-Base. Training input: data/onpolicy_reasoning_onpolicy_doc.jsonl. It is not initialized from the non-Base Qwen3-4B instruct model.