RESEARCH-EMPRM/emprm-v2-stageB_rung5_qwen25_s1
09
EM-PRM v2 — stageB_rung5_qwen25_s1
LoRA adapter for Qwen/Qwen2.5-VL-7B-Instruct from the paper EM-PRM: Evidence-Mediated Process Rewards for Robust Multimodal Reasoning (EM-PRM v2 experiment ladder).
Rung 6 seed 1 (misses the held-out counterfactual floor; keeps the false-evidence line and the ranking gain).
Training
- LoRA rank 64, alpha 128, dropout 0.05, target modules kproj, layers.0.mlp.downproj, layers.0.mlp.gateproj, layers.0.mlp.upproj, layers.1.mlp.downproj, layers.1.mlp.gateproj, layers.1.mlp.upproj, layers.10.mlp.downproj, layers.10.mlp.gateproj, layers.10.mlp.upproj, layers.11.mlp.downproj, layers.11.mlp.gateproj, layers.11.mlp.upproj, layers.12.mlp.downproj, layers.12.mlp.gateproj, layers.12.mlp.upproj, layers.13.mlp.downproj, layers.13.mlp.gateproj, layers.13.mlp.upproj, layers.14.mlp.downproj, layers.14.mlp.gateproj, layers.14.mlp.upproj, layers.15.mlp.downproj, layers.15.mlp.gateproj, layers.15.mlp.upproj, layers.16.mlp.downproj, layers.16.mlp.gateproj, layers.16.mlp.upproj, layers.17.mlp.downproj, layers.17.mlp.gateproj, layers.17.mlp.upproj, layers.18.mlp.downproj, layers.18.mlp.gateproj, layers.18.mlp.upproj, layers.19.mlp.downproj, layers.19.mlp.gateproj, layers.19.mlp.upproj, layers.2.mlp.downproj, layers.2.mlp.gateproj, layers.2.mlp.upproj, layers.20.mlp.downproj, layers.20.mlp.gateproj, layers.20.mlp.upproj, layers.21.mlp.downproj, layers.21.mlp.gateproj, layers.21.mlp.upproj, layers.22.mlp.downproj, layers.22.mlp.gateproj, layers.22.mlp.upproj, layers.23.mlp.downproj, layers.23.mlp.gateproj, layers.23.mlp.upproj, layers.24.mlp.downproj, layers.24.mlp.gateproj, layers.24.mlp.upproj, layers.25.mlp.downproj, layers.25.mlp.gateproj, layers.25.mlp.upproj, layers.26.mlp.downproj, layers.26.mlp.gateproj, layers.26.mlp.upproj, layers.27.mlp.downproj, layers.27.mlp.gateproj, layers.27.mlp.upproj, layers.3.mlp.downproj, layers.3.mlp.gateproj, layers.3.mlp.upproj, layers.4.mlp.downproj, layers.4.mlp.gateproj, layers.4.mlp.upproj, layers.5.mlp.downproj, layers.5.mlp.gateproj, layers.5.mlp.upproj, layers.6.mlp.downproj, layers.6.mlp.gateproj, layers.6.mlp.upproj, layers.7.mlp.downproj, layers.7.mlp.gateproj, layers.7.mlp.upproj, layers.8.mlp.downproj, layers.8.mlp.gateproj, layers.8.mlp.upproj, layers.9.mlp.downproj, layers.9.mlp.gateproj, layers.9.mlp.upproj, oproj, qproj, vproj; vision tower frozen; bfloat16.
- Seed 1, learning rate 5e-05, effective batch 2×4, one epoch.
- Training data, pair sets and every gate artifact are in the mirror
RESEARCH-EMPRM/emprm-v2(dataset repo;results/runs_v2/train/stageB_rung5_qwen25_s1/) and the paper bundle underbackdata/.
Pre-registered gates (development half)
- Held-out relational FlipAcc (operation subset): 0.5188
- Forced-evidence acceptance at 0.5: false 0.025, true 0.92
- Chart-disjoint pair gain against the v1 head: +0.1009 (95% interval [0.0614, 0.1409])
Load
from transformers import AutoModelForImageTextToText, AutoProcessor
from peft import PeftModel
base = AutoModelForImageTextToText.from_pretrained("Qwen/Qwen2.5-VL-7B-Instruct", dtype="bfloat16", device_map="cuda")
model = PeftModel.from_pretrained(base, "RESEARCH-EMPRM/emprm-v2-stageB_rung5_qwen25_s1")
processor = AutoProcessor.from_pretrained("Qwen/Qwen2.5-VL-7B-Instruct")adapter_config.json records the local path the adapter was trained from; pass the base model explicitly as above. Scoring prompts (bank extraction, claim extraction, claim support, ranking) are the ones in work/scripts/eval_bon.py of the mirror.
Provenance
Trained in the EM-PRM v2 repository; every number quoted in the paper is traceable to planning/V2_PLAN.md and the generated tables in the mirror.
