CoolFace
Modelpublic

nathanwei05/cs2881r-dobby-qwen2.5-3b-rlvr-grpo100-step100

sourceHugging Faceapache-2.0updated 5d agoView on Hugging Face
0likes189downloads
Model Card

nathanwei05/cs2881r-dobby-qwen2.5-3b-rlvr-grpo100-step100

Harvard CS 2881R (AI Safety, Fall 2026), Assignment 1, stage 3 (rlvr). LoRA GRPO (rank 16, LR 2e-5, beta 0.04, 100 updates, checkpoint 100 selected on a 150-prompt dev set) from `axel-sdq/cs2881r-dobby-qwen2.5-3b-rlaif-grpo100-step25` at revision ba9705301d86619447f480121c06133039a496d3, which is itself SFT + RLAIF from Qwen2.5-3B-Instruct. Reward: rule-based verifier correctness on GSM8K/MATH prompts only.

The merged model is at the repository root; the LoRA adapter is under adapter/. Training code, data, worklog and results: https://github.com/harvard-cs2881f26/hw1-soderquist-wei