sachiniyer/posttraining-practice
0
1MODEL_IDS = [2 "sachiniyer/Qwen2.5-0.5B-GRPO-LLMJudge-Schwinn",3 "sachiniyer/Qwen2.5-0.5B-DPO-Schwinn",4 "sachiniyer/Qwen2.5-0.5B-PPO-Schwinn",5 "Qwen/Qwen2.5-0.5B",6 "sachiniyer/SmolLM2-DPO-Schwinn-SmolLM2-Base",7 "sachiniyer/SmolLM2-DPO-Schwinn-gpt-5-mini-base",8 "sachiniyer/SmolLM2-FT-SFT-Learning",9 "sachiniyer/DeepSeek-R1-LoRA-Finetuned",10 "sachiniyer/DeepSeek-R1-QLoRA-Finetuned",11]12 