nathanwei05/cs2881r-dobby-qwen2.5-3b-rlvr-grpo100-step100
0189
nathanwei05/cs2881r-dobby-qwen2.5-3b-rlvr-grpo100-step100
Harvard CS 2881R (AI Safety, Fall 2026), Assignment 1, stage 3 (rlvr). LoRA GRPO (rank 16, LR 2e-5, beta 0.04, 100 updates, checkpoint 100 selected on a 150-prompt dev set) from `axel-sdq/cs2881r-dobby-qwen2.5-3b-rlaif-grpo100-step25` at revision ba9705301d86619447f480121c06133039a496d3, which is itself SFT + RLAIF from Qwen2.5-3B-Instruct. Reward: rule-based verifier correctness on GSM8K/MATH prompts only.
The merged model is at the repository root; the LoRA adapter is under adapter/. Training code, data, worklog and results: https://github.com/harvard-cs2881f26/hw1-soderquist-wei
