CoolFace
Apppublic

madhuria/patch2prod-arena

sourceHugging Faceupdated 5mo agoView on Hugging Face
0likes
36 commits on main
9fbd3445mo ago

fix: clean deployment, dev workflow, and docs for HF Space

Ria-R
414b1635mo ago

fix(space): align docker startup with Hugging Face app port

Ria-R
0ff55435mo ago

docs: add local and Kaggle SFT notebook references

Ria-R
2d550a65mo ago

artifacts: add GRPO clipped ratio plot via LFS

Ria-R
d36076f5mo ago

artifacts: add GRPO completion plot via LFS

Ria-R
7a1ed405mo ago

artifacts: add GRPO entropy plot via LFS

Ria-R
de6e9fb5mo ago

artifacts: add GRPO grad norm plot via LFS

Ria-R
9480a585mo ago

artifacts: add GRPO reward plot via LFS

Ria-R
0d6b4795mo ago

artifacts: add GRPO loss plot via LFS

Ria-R
f5965315mo ago

docs: fix markdown image rendering and expand experiment log

Ria-R
91c57c45mo ago

docs: add project blog writeup for hf submission

Ria-R
ceace925mo ago

update README and add GRPO training log

Ria-R
747da3d5mo ago

fix: gate kl_coef on GRPOConfig signature to avoid TypeError

Ria-R
730f5905mo ago

fix: eval/train format alignment + KL + live metrics + multi-panel plots

Ria-R
8baa8d25mo ago

fix: lightweight GRPO training - chat template + stop tokens + tuned hyperparams

Ria-R
8862e085mo ago

chore: trigger hf space rebuild for README sync

Ria-R
27d5b305mo ago

Readme updates

Ria-R
c3b8a6c5mo ago

fix hf short_description length

Ria-R
6f73f1c5mo ago

update hf space README metadata fields

Ria-R
215f2865mo ago

fix hf space config: use root index.html app_file

Ria-R
20a80a55mo ago

fix hf spaces metadata color

Ria-R
76cffc35mo ago

update demo ui and add ci webhook + hf space setup

Ria-R
95e32025mo ago

fix GRPO training: strict parse, termination reward, variance jitter, throughput

Ria-R
77ce89a5mo ago

grpo training

Ria-R
53dbdf75mo ago

grpo training

Ria-R
83687d55mo ago

Fix GRPO training: use env-grounded prompts, add reward debug logging, honest eval

Ria-R
a4ea3505mo ago

evaluate grpo

Ria-R
95718a75mo ago

grpo changes

Ria-R
d04ace45mo ago

grpo changes

Ria-R
d9b49ff5mo ago

setting up grpo

Ria-R
d1ae6465mo ago

Post SFT Training

Ria-R
3eaa9c65mo ago

Add working baseline and risk-aware evaluation traces

Ria-R
c0358625mo ago

training fixes

Ria-R
8fe77225mo ago

training stuff

Ria-R
84241585mo ago

Add baseline evaluation artifacts

Madhuria Rudra
51458415mo ago

Initial Patch2Prod Arena submission

Madhuria Rudra