abugoot-primeintellect/bioreasoning-qwen3-30ba3b-sft-20260218-ckpt-final
08
bioreasoning-qwen3-30ba3b-sft-20260218-ckpt-final
LoRA adapter checkpoint from supervised fine-tuning on the bioreasoning dataset.
Training Details
- Base model: Qwen/Qwen3-30B-A3B
- Method: LoRA (rank 32)
- Training platform: Tinker (ThinkingMachines)
- Dataset: abugoot-primeintellect/bioreasoningv0211prime_sft (~193k train examples)
- Hyperparameters: batchsize=128, lr=2e-5 (linear decay), weightdecay=0.01, seq_len=8192
- Epochs: 3
- Checkpoint: step final (epoch 3, batch 1511)
- Loss masking: Last assistant message only
