CoolFace
Modelpublic

Rob1234567/qwen3.5-4b-ariadna-grpo-v1

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes177downloads
22 commits on main
754038a2mo ago

Исправление: GRM — модель награды, а не механизм памяти (верифицировано субагентом)

Rob1234567
688a9bd2mo ago

Перевод README на русский язык

Rob1234567
60e14a52mo ago

Translate README to English

Rob1234567
7ed99a02mo ago

Update README: add GGUF v1 vs v10 comparison results, cross-ref to GGUF card

Rob1234567
c8ccf562mo ago

Add subagent domain-expert testing report

Rob1234567
082d29c2mo ago

Update model card with evals and technical report link

Rob1234567
e3cf91b2mo ago

Add technical report PDF with CPT→SFT→GRPO pipeline and SFT vs GRPO evals

Rob1234567
f11081d2mo ago

Update model card with v10 GRPO training details

Rob1234567
79815702mo ago

GRPO v10: KAT 3-level reward + GRM model-based judge, 800 steps

Rob1234567
75427972mo ago

GRPO v5 (CoRPO): A=r-0.5, 800 steps, 471 trained

Rob1234567
55ecc8d2mo ago

GRPO v5 (CoRPO): A=r-0.5 static baseline, ordinal reward

Rob1234567
7b2dd102mo ago

GRPO v3-fixed: K=4, 400steps, Sign-advantage, KL=0.01

Rob1234567
6e772472mo ago

GRPO v3-fixed: K=4, 400 steps, KL=0.01

Rob1234567
0267b072mo ago

fix: GGUF reconverted after config fix (mtp_num_hidden_layers=0)

Rob1234567
bace0192mo ago

Add model card for GRPO v2

Rob1234567
d7188252mo ago

fix: GGUF from KL-regularized GRPO v2 (beta=0.01, Q4_K_M)

Rob1234567
7a60d093mo ago

fix: manual GRPO re-run with KL beta=0.01

Rob1234567
0c673c63mo ago

fix: re-convert GGUF from safetensors (was corrupted header)

Rob1234567
e04cb1c3mo ago

Upload model-Q4_K_M.gguf with huggingface_hub

Rob1234567
fe275b83mo ago

Upload README.md with huggingface_hub

Rob1234567
41adf653mo ago

Upload folder using huggingface_hub

Rob1234567
19636883mo ago

initial commit

Rob1234567