Zhongzhu/tunekv-terminalbench-27b
TB2 transfer eval (Harbor 0.1.28 terminus-2): RH vs DH, 2 rounds
tb6: full run trajectories (journal + agent logs) and training bundles (episodes/rows/logs/checkpoints) + SHA256SUMS
tb6: GRPO tuned+base verdicts (grpo/eval), comparisons, summary, README, final scripts (part 6)
tb6: GRPO tuned+base verdicts (grpo/eval), comparisons, summary, README, final scripts (part 5)
tb6: GRPO tuned+base verdicts (grpo/eval), comparisons, summary, README, final scripts (part 4)
tb6: GRPO tuned+base verdicts (grpo/eval), comparisons, summary, README, final scripts (part 3)
tb6: GRPO tuned+base verdicts (grpo/eval), comparisons, summary, README, final scripts (part 2)
tb6: GRPO tuned+base verdicts (grpo/eval), comparisons, summary, README, final scripts
tb6 COMPARISON_27B_CE.json
tb6 COMPARISON_27B_GRPO.json
tb6 27B lean verdicts q27-base80-b4
tb6 27B lean verdicts q27-grpo-tuned80-r2
tb6 27B lean verdicts q27-grpo-tuned80
tb6 27B GRPO: artifact (TP1 hybrid, n_inject 704) + rows report/manifest + config + train steps + canary
tb6 27B CE paired comparison
tb6 27B lean verdicts q27-tp-r4
tb6 27B lean verdicts q27-tp-r3
tb6 27B lean verdicts q27-tp-r2
tb6 27B lean verdicts q27-tp-r1
tb6 27B lean verdicts q27-ce-tuned80-r2
tb6 27B lean verdicts q27-ce-tuned80
tb6 27B lean verdicts q27-base80-b3
tb6 27B lean verdicts q27-base80-b2
tb6 27B lean verdicts q27-grpo-t3
tb6 27B lean verdicts q27-grpo-t2
tb6 27B lean verdicts q27-grpo-t1
tb6 27B lean verdicts q27-base80
27B shared prefix (704 ids)
tb6 pipeline scripts
tb6 27B CE+0.1KL: artifact (TP1 hybrid, n_inject 704) + 148 rows + config + train steps + canary
initial commit
