Rob1234567/qwen3.5-4b-ariadna-grpo-v1
Исправление: GRM — модель награды, а не механизм памяти (верифицировано субагентом)
Перевод README на русский язык
Translate README to English
Update README: add GGUF v1 vs v10 comparison results, cross-ref to GGUF card
Add subagent domain-expert testing report
Update model card with evals and technical report link
Add technical report PDF with CPT→SFT→GRPO pipeline and SFT vs GRPO evals
Update model card with v10 GRPO training details
GRPO v10: KAT 3-level reward + GRM model-based judge, 800 steps
GRPO v5 (CoRPO): A=r-0.5, 800 steps, 471 trained
GRPO v5 (CoRPO): A=r-0.5 static baseline, ordinal reward
GRPO v3-fixed: K=4, 400steps, Sign-advantage, KL=0.01
GRPO v3-fixed: K=4, 400 steps, KL=0.01
fix: GGUF reconverted after config fix (mtp_num_hidden_layers=0)
Add model card for GRPO v2
fix: GGUF from KL-regularized GRPO v2 (beta=0.01, Q4_K_M)
fix: manual GRPO re-run with KL beta=0.01
fix: re-convert GGUF from safetensors (was corrupted header)
Upload model-Q4_K_M.gguf with huggingface_hub
Upload README.md with huggingface_hub
Upload folder using huggingface_hub
initial commit
