amr-fma/amr-fma-Llama-3.1-8B-Instruct-lora_sdpo-gsm8k-debug_sdpo_quick-s42
0
amr-fma/amr-fma-Llama-3.1-8B-Instruct-lorasdpo-gsm8k-debugsdpo_quick-s42
amr-fma training run.
- Method:
lora_sdpo - Base model:
meta-llama/Llama-3.1-8B-Instruct - Dataset:
openai/gsm8k(slug:gsm8k) - Seed:
42 - Git commit:
9e910a3030d37320b8ab3c7479359f38b11703dc - Exp name:
debug_sdpo_quick - WandB run:
uvozx2a5
Tags
- phase:P1
- domain:math
Checkpoints (branches)
- step 1 → revision
? - step 2 → revision
?
Pin a specific checkpoint with revision=... in AutoModelForCausalLM.from_pretrained / PeftModel.from_pretrained.
Hyperparameter sections
checkpointing, dataset, evaluation, lora, model, optimization, prompt_style, runtime, sdpo, sequence
