rohanjain2312/grpo-reward-hacking-fixed-kl-qwen05b
0529
Refresh model card: 100 steps, three arms, judge scores
LLM-judge coherence scores
final model + model card
latest -> step 100
checkpoint @ step 100
logs @ step 100
logs @ step 100
logs @ step 90
logs @ step 90
Publish step-80 checkpoint as the final model + model card
latest -> step 80
checkpoint @ step 80
logs @ step 80
logs @ step 80
logs @ step 70
logs @ step 70
logs @ step 60
logs @ step 60
logs @ step 50
logs @ step 50
latest -> step 40
checkpoint @ step 40
logs @ step 40
logs @ step 40
logs @ step 30
logs @ step 30
logs @ step 20
logs @ step 20
logs @ step 10
logs @ step 10
logs @ step 0
logs @ step 0
initial commit
