Team Ai
Apppublic

madhuria/patch2prod-arena

sourceHugging Faceupdated 6mo agoView on Hugging Face
0likes
36 commits on main
9fbd3446mo ago

fix: clean deployment, dev workflow, and docs for HF Space

Ria-R
414b1636mo ago

fix(space): align docker startup with Hugging Face app port

Ria-R
0ff55436mo ago

docs: add local and Kaggle SFT notebook references

Ria-R
2d550a66mo ago

artifacts: add GRPO clipped ratio plot via LFS

Ria-R
d36076f6mo ago

artifacts: add GRPO completion plot via LFS

Ria-R
7a1ed406mo ago

artifacts: add GRPO entropy plot via LFS

Ria-R
de6e9fb6mo ago

artifacts: add GRPO grad norm plot via LFS

Ria-R
9480a586mo ago

artifacts: add GRPO reward plot via LFS

Ria-R
0d6b4796mo ago

artifacts: add GRPO loss plot via LFS

Ria-R
f5965316mo ago

docs: fix markdown image rendering and expand experiment log

Ria-R
91c57c46mo ago

docs: add project blog writeup for hf submission

Ria-R
ceace926mo ago

update README and add GRPO training log

Ria-R
747da3d6mo ago

fix: gate kl_coef on GRPOConfig signature to avoid TypeError

Ria-R
730f5906mo ago

fix: eval/train format alignment + KL + live metrics + multi-panel plots

Ria-R
8baa8d26mo ago

fix: lightweight GRPO training - chat template + stop tokens + tuned hyperparams

Ria-R
8862e086mo ago

chore: trigger hf space rebuild for README sync

Ria-R
27d5b306mo ago

Readme updates

Ria-R
c3b8a6c6mo ago

fix hf short_description length

Ria-R
6f73f1c6mo ago

update hf space README metadata fields

Ria-R
215f2866mo ago

fix hf space config: use root index.html app_file

Ria-R
20a80a56mo ago

fix hf spaces metadata color

Ria-R
76cffc36mo ago

update demo ui and add ci webhook + hf space setup

Ria-R
95e32026mo ago

fix GRPO training: strict parse, termination reward, variance jitter, throughput

Ria-R
77ce89a6mo ago

grpo training

Ria-R
53dbdf76mo ago

grpo training

Ria-R
83687d56mo ago

Fix GRPO training: use env-grounded prompts, add reward debug logging, honest eval

Ria-R
a4ea3506mo ago

evaluate grpo

Ria-R
95718a76mo ago

grpo changes

Ria-R
d04ace46mo ago

grpo changes

Ria-R
d9b49ff6mo ago

setting up grpo

Ria-R
d1ae6466mo ago

Post SFT Training

Ria-R
3eaa9c66mo ago

Add working baseline and risk-aware evaluation traces

Ria-R
c0358626mo ago

training fixes

Ria-R
8fe77226mo ago

training stuff

Ria-R
84241586mo ago

Add baseline evaluation artifacts

Madhuria Rudra
51458416mo ago

Initial Patch2Prod Arena submission

Madhuria Rudra