just1nseo/llama31-tulu3-8b-dpo-if-rlvr-anchor-judge
0
just1nseo/llama31-tulu3-8b-dpo-if-rlvr-anchor-judge
GRPO / IF-RLVR checkpoints for meta-llama/Llama-3.1-8B-Instruct, trained with the bidirectional anchor reward (p(y|x) anchor coefficient 0.1 + gpt-oss-120b verifier fallback bonus 0.1 (threshold 5)).
Each checkpoint is a complete HF model directory in its own subfolder:
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("just1nseo/llama31-tulu3-8b-dpo-if-rlvr-anchor-judge", subfolder="global_step_91")
tok = AutoTokenizer.from_pretrained("just1nseo/llama31-tulu3-8b-dpo-if-rlvr-anchor-judge", subfolder="global_step_91")