mlnomad/gelu-d12-chinchilla-261M-pytorch
Fix: lazy non-persistent RoPE buffers — HF from_pretrained's meta-init was leaving persistent rope_cos/rope_sin uninitialised, producing NaN logits. Buffers are now computed on first forward.
Fix: lazy non-persistent RoPE buffers — HF from_pretrained's meta-init was leaving persistent rope_cos/rope_sin uninitialised, producing NaN logits. Buffers are now computed on first forward.
Fix: lazy non-persistent RoPE buffers — HF from_pretrained's meta-init was leaving persistent rope_cos/rope_sin uninitialised, producing NaN logits. Buffers are now computed on first forward.
Fix: lazy non-persistent RoPE buffers — HF from_pretrained's meta-init was leaving persistent rope_cos/rope_sin uninitialised, producing NaN logits. Buffers are now computed on first forward.
Fix: GQA → MHA (n_head = n_kv_head, no head sharing)
Add wikitext-103 eval: loss=3.840, PPL=46.52
Initial PyTorch port of GELU d12 Chinchilla (261M) — AutoModelForCausalLM compatible
initial commit
