CoolFace
Modelpublic

amr-fma/amr-fma-Qwen2.5-7B-Instruct-lora_sdpo-gsm8k-debug_sdpo_quick-s42

sourceHugging Faceupdated 3mo agoView on Hugging Face
0likes
Model Card

amr-fma/amr-fma-Qwen2.5-7B-Instruct-lorasdpo-gsm8k-debugsdpo_quick-s42

amr-fma training run.

  • —Method: lora_sdpo
  • —Base model: Qwen/Qwen2.5-7B-Instruct
  • —Dataset: openai/gsm8k (slug: gsm8k)
  • —Seed: 42
  • —Git commit: 9e910a3030d37320b8ab3c7479359f38b11703dc
  • —Exp name: debug_sdpo_quick
  • —WandB run: 0t0x8zsg

Tags

  • —phase:P1
  • —domain:math

Checkpoints (branches)

  • —step 1 → revision ?
  • —step 2 → revision ?

Pin a specific checkpoint with revision=... in AutoModelForCausalLM.from_pretrained / PeftModel.from_pretrained.

Hyperparameter sections

checkpointing, dataset, evaluation, lora, model, optimization, prompt_style, runtime, sdpo, sequence