agurung/lcb-med-hard-ft-qwen3-4b-dft-rft-iid-24-highlr-v1
018
agurung/lcb-med-hard-ft-qwen3-4b-dft-rft-iid-24-highlr-v1
PEFT LoRA adapter archive for the LCB med/hard Qwen3-4B FT experiment.
- Base model:
Qwen/Qwen3-4B-Instruct-2507 - Local run name:
dft_rft_iid_24-lora-r128-a32-lr5e-4-const-lr5e-4-qps8-gpuauto-ep4-highlr_v1 - Arm:
dft_rft_iid_24 - Variant:
highlr-v1 - Adapter checkpoints:
15 - Included bytes:
17095774071 - Excluded local optimizer/RNG bytes:
0
The archive intentionally keeps HF/PEFT model artifacts and training metadata, but excludes optimizer, scheduler, and RNG state files. These repos are meant for evaluation and RL seeding, not exact optimizer-state resume.
Checkpoint dirs:
checkpoint-10, checkpoint-15, checkpoint-20, checkpoint-25, checkpoint-30, checkpoint-35, checkpoint-40, checkpoint-45, checkpoint-5, checkpoint-50, checkpoint-55, checkpoint-60, checkpoint-65, checkpoint-70, checkpoint-72
