sttjr/paganini-qwen35-27b-grpo-lora
08
Update model card: add full GRPO training details, reward function, agent architecture
Paganini AIOS GRPO RL — Qwen3.5-27B LoRA rank 32, dual-domain reward (code+finance), 13.7K samples
Paganini AIOS GRPO RL — Qwen3.5-27B LoRA rank 32, dual-domain reward (code+finance), 13.7K samples
initial commit
