CoolFace
Modelpublic

Zzyy2000/qwen3-4b-midtrain-reasoning-offpolicy-doc

sourceHugging Faceotherupdated 2mo agoView on Hugging Face
0likes4downloads
Model Card

Qwen3-4B Safety Midtrain ? Reasoning + Off-policy Document

Continued-pretraining/midtraining checkpoint initialized from Qwen3-4B-Base. Training input: data/onpolicy_reasoning_offpolicy_doc.jsonl. It is not initialized from the non-Base Qwen3-4B instruct model.