CoolFace
Modelpublic

meangrinch/Qwen3.5-4B-Claude-4.6-Opus-Reasoning-Distill

sourceHugging Faceapache-2.0updated 7mo agoView on Hugging Face
2likes14downloads
Model Card

Qwen3.5-4B-Claude-4.6-Opus-Reasoning-Distill

Fine-tuned reasoning model distilled from Claude 4.6 Opus chain-of-thought traces.

Training details

SettingValue
Datasetopus4.6reasoning1579xfiltered.jsonl
MethodSFTTrainer
LoRA Rankrank=16, alpha=16
Epochs3
Warmup steps30
Effective batch size16
Learning rate1e-4
Schedulercosine
Max sequence length4096

Source

Related