CoolFace
Modelpublic

laion/a3-rl-laion_nemotron-gym-identity-following-v2-65-8B

sourceHugging Faceupdated 23d agoView on Hugging Face
0likes43downloads
Model Card

a3-rl-laion_nemotron-gym-identity-following-v2 (step 65, 8B)

RL (GRPO/rloo_n) finetune trained with SkyRL on Jupiter (a3 series #22).

Training Traces

Training-time Daytona/Harbor rollouts for this run are uploaded as a companion dataset: [open-athena/a3-rl-laion_nemotron-gym-identity-following-v2](https://huggingface.co/datasets/open-athena/a3-rl-laion_nemotron-gym-identity-following-v2)

The dataset contains the last episode of each trial (per make_and_upload_trace_dataset --episodes last) the same rollouts the policy was trained on after rollback / truncation.