CoolFace
Modelpublic

cs-552-2026-busybees/safety_model

sourceHugging Faceupdated 4mo agoView on Hugging Face
0likes35downloads
50 commits on main
50d3c424mo ago

Deterministic decoding for safety eval (do_sample=false) — reproducible score

sophieur444
06e2d7e4mo ago

Restore dedicated safety weights (fb56cd1e, 0.82 local) — revert v6 safety candidate

sophieur444
ae6f0794mo ago

v6 multi-domain model deployed as safety candidate

sophieur444
fb56cd14mo ago

Swap in group-trained weights for safety benchmark

sophieur444
1b37ecd4mo ago

Upload train_safety_v10_frombase.py with huggingface_hub

sophieur444
a5f2afe4mo ago

transport: eval_safety_realistic.py (script only, no weights)

sophieur444
b1c3ca94mo ago

transport: train_safety_v9_realdistill.py (script only, no weights)

sophieur444
15f61ec4mo ago

transport: train_safety_v8_boxrepair.py (script only, no weights)

sophieur444
85c84984mo ago

holdout eval at 16k context

sophieur444
29bad904mo ago

add reliable held-out safety eval (acc + no_box)

sophieur444
7aaba864mo ago

eval: safety_v7

sophieur444
7a7db154mo ago

add v7 continued-SFT script

sophieur444
06c13764mo ago

eval: safety_v6

sophieur444
f4219b14mo ago

v6 iterative script (transport)

sophieur444
a4580904mo ago

eval: safety_v5

sophieur444
792d2b74mo ago

v5 format-only script (transport, weights unchanged)

sophieur444
74c07664mo ago

eval: safety_v4

sophieur444
aa7ba714mo ago

v4 teacher-distill script (transport only, weights unchanged)

sophieur444
390a8934mo ago

group proposal training script

sophieur444
e1c0d254mo ago

eval: hh_mix

sophieur444
e7a9c164mo ago

eval: low_lr_6ep

sophieur444
d3c97bb4mo ago

eval: combo_64_lowlr

sophieur444
ea9d3444mo ago

strategy strategy_dpo.py

sophieur444
134f2dc4mo ago

strategy strategy_hh_mix.py

sophieur444
27cc17c4mo ago

eval: dropout_high

sophieur444
7ab6ad94mo ago

low_lr: 82% local, lr=5e-5 r=32 epochs=4

sophieur444
d3df5084mo ago

experiment scripts

sophieur444
03c2ffd4mo ago

experiment scripts

sophieur444
e04fc9c4mo ago

eval: small_lora

sophieur444
b59abb64mo ago

eval: low_lr

sophieur444
e1256074mo ago

eval: bigger_lora

sophieur444
51c1c784mo ago

eval: more_epochs

sophieur444
cbe10764mo ago

standalone scripts

sophieur444
57baf8a4mo ago

standalone scripts

sophieur444
adcfa224mo ago

experiments: save after each + skip already done

sophieur444
34167734mo ago

Upload distilled_examples.jsonl with huggingface_hub

sophieur444
10362b34mo ago

local experiments script

sophieur444
51cc3824mo ago

self-distillation from base Qwen3-1.7B

sophieur444
6650e034mo ago

GRPO RLVR on top of v3 SFT

sophieur444
e70de044mo ago

self-distillation script

sophieur444
e9f9e854mo ago

eval orchestration script

sophieur444
e0cfe1d4mo ago

validation samples for eval

sophieur444
907315e4mo ago

local eval script

sophieur444
4d38de04mo ago

GRPO fix

sophieur444
f026f8e4mo ago

GRPO training script

sophieur444
c4cce6f4mo ago

restore thinking mode

sophieur444
87b43254mo ago

disable thinking mode for 4k CI

sophieur444
c27e41d4mo ago

v3 improved safety training

sophieur444
7772c234mo ago

v3.1: fixed loaders, SafetyBench dev, expanded MMLU, HH-RLHF

sophieur444
4428d2a4mo ago

fix: remove flash_attn

sophieur444