CoolFace
Modelpublic

sttjr/paganini-qwen35-27b-grpo-lora

sourceHugging Faceapache-2.0updated 6mo agoView on Hugging Face
0likes8downloads
4 commits on main
1213e196mo ago

Update model card: add full GRPO training details, reward function, agent architecture

sttjr
f40791c6mo ago

Paganini AIOS GRPO RL — Qwen3.5-27B LoRA rank 32, dual-domain reward (code+finance), 13.7K samples

sttjr
45fa1806mo ago

Paganini AIOS GRPO RL — Qwen3.5-27B LoRA rank 32, dual-domain reward (code+finance), 13.7K samples

sttjr
2c3458e6mo ago

initial commit

sttjr