siddham0909/trace-rca-qwen3-1.7b
0
Trace RCA — Qwen/Qwen3-1.7B (GRPO + LoRA)
Trained on the Trace RCA Gym environment.
Training evidence
reward_plot.png— reward curves (regenerated every 5 episodes during training)metrics.jsonl— per-episode rich metrics (fault_type, tier, difficulty, reward components)fault_type_metrics.json— per-fault-type rolling successcompare.png,compare.md— before/after comparison on pinned scenariosadapter/— the LoRA adapter (load with PEFT)tb_episodes/— TensorBoard episode scalars
Usage
from peft import PeftModel
from transformers import AutoModelForCausalLM
base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-1.7B")
model = PeftModel.from_pretrained(base, "siddham0909/trace-rca-qwen3-1.7b", subfolder="adapter")