CoolFace
Modelpublic

ddevMhrn/Llama-3.2-1B-Viveka-retrained

sourceHugging Faceapache-2.0updated 4mo agoView on Hugging Face
0likes4downloads
Model Card

Llama-3.2-1B-Viveka (retrained)

Fresh retrain of Llama-3.2-1B on the Viveka OpenEnv, produced to obtain per-action inference JSONs (components + trajectory) for capacity-failure-vs-reward-hacking analysis. 200 episodes, tier mix 1:0.4 / 2:0.4 / 4:0.2. Separate from the original repo so prior artifacts are preserved.

Base model: meta-llama/Llama-3.2-1B-Instruct (trained via Unsloth's open 4-bit mirror).

See github.com/DevMhrn/viveka-env.