GoodStartLabs/diplomacy-235b-lora
213
Trim model card
Add per-update training metrics (25 steps x 41 metrics)
Add model card
Diplomacy RL LoRA, final checkpoint (optimizer step 25) from wandb run 7zu4lxjj
initial commit
Trim model card
Add per-update training metrics (25 steps x 41 metrics)
Add model card
Diplomacy RL LoRA, final checkpoint (optimizer step 25) from wandb run 7zu4lxjj
initial commit