CoolFace
Modelpublic

agentic-moral-alignment/g0-goals-nothink-0816-1351

sourceHugging Faceupdated 1mo agoView on Hugging Face
0likes
Model Card

g0-goals-nothink-0816-1351

LoRA adapters from mt-moral-alignment run g0-goals-nothink-0816-1351, one subfolder per checkpoint, converted from verl FSDP shards. Per-episode logs: https://huggingface.co/datasets/agentic-moral-alignment/mtma/tree/main/runs/train/g0-goals-nothink-0816-1351

stepload
50subfolder="step_50"
python
base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3.5-4B-Base")
model = PeftModel.from_pretrained(base, "agentic-moral-alignment/g0-goals-nothink-0816-1351", subfolder="step_50")

WARNING: vLLM cannot serve these adapters on Qwen3.5 -- hybrid-GDN LoRA is a silent no-op (vllm#49354). Merge first: model.merge_and_unload().save_pretrained(...).

Frozen run config

yaml
# frozen for g0-goals-nothink-0816-1351 (2026-08-16T13:51:43Z, git 3fd8bfc)
STAGE: train
MODEL: Qwen/Qwen3.5-4B-Base
GPUS: 1
TP: 1
MAX_SEQS: 256
GPU_MEM_UTIL: 0.72
GAMES: neighbourhood-necromancer
SAMPLE_ROLLOUT_START_DEPTH: True
RESAMPLE_STARTS: True
TURN_CAP: 64
N: 8
BATCH: 8
DATA: data/train/g0-goals-nothink-0816-1351.parquet
STEPS: 50
LR: 1e-05
TOP_P: 0.95
ROLLOUT_SEED: 42
FRAMING: game-goals
LAM: 1
TASK_WEIGHT: 0
MORAL: deon_soft
RETURN_FN: reward_to_go
BASELINE_FN: group_mean_anchor
NORMALIZE_FN: none
GAMMA: 0.0
THINKING: False
MAX_TURN_TOKENS: 4096
ENV_TIMEOUT_S: 60
AGENT_WORKERS: 2
REWARD_WORKERS: 1
BYPASS: True
GRAD_CKPT: True
CALC_ENTROPY: True
SAVE_FREQ: 5
NOSET: 0
PUSH: 0
PROMPT_LEN: 4096
RESPONSE_LEN: 40960
MAX_MODEL_LEN: 45056
TOKEN_LEN_PER_GPU: 49152
LORA_RANK: 32
LORA_ALPHA: 64