CoolFace
Modelpublic

RESEARCH-EMPRM/emprm-v2-stageB_rung5_qwen25_s1

sourceHugging Faceapache-2.0updated 20d agoView on Hugging Face
0likes9downloads
Model Card

EM-PRM v2 — stageB_rung5_qwen25_s1

LoRA adapter for Qwen/Qwen2.5-VL-7B-Instruct from the paper EM-PRM: Evidence-Mediated Process Rewards for Robust Multimodal Reasoning (EM-PRM v2 experiment ladder).

Rung 6 seed 1 (misses the held-out counterfactual floor; keeps the false-evidence line and the ranking gain).

Training

  • —LoRA rank 64, alpha 128, dropout 0.05, target modules kproj, layers.0.mlp.downproj, layers.0.mlp.gateproj, layers.0.mlp.upproj, layers.1.mlp.downproj, layers.1.mlp.gateproj, layers.1.mlp.upproj, layers.10.mlp.downproj, layers.10.mlp.gateproj, layers.10.mlp.upproj, layers.11.mlp.downproj, layers.11.mlp.gateproj, layers.11.mlp.upproj, layers.12.mlp.downproj, layers.12.mlp.gateproj, layers.12.mlp.upproj, layers.13.mlp.downproj, layers.13.mlp.gateproj, layers.13.mlp.upproj, layers.14.mlp.downproj, layers.14.mlp.gateproj, layers.14.mlp.upproj, layers.15.mlp.downproj, layers.15.mlp.gateproj, layers.15.mlp.upproj, layers.16.mlp.downproj, layers.16.mlp.gateproj, layers.16.mlp.upproj, layers.17.mlp.downproj, layers.17.mlp.gateproj, layers.17.mlp.upproj, layers.18.mlp.downproj, layers.18.mlp.gateproj, layers.18.mlp.upproj, layers.19.mlp.downproj, layers.19.mlp.gateproj, layers.19.mlp.upproj, layers.2.mlp.downproj, layers.2.mlp.gateproj, layers.2.mlp.upproj, layers.20.mlp.downproj, layers.20.mlp.gateproj, layers.20.mlp.upproj, layers.21.mlp.downproj, layers.21.mlp.gateproj, layers.21.mlp.upproj, layers.22.mlp.downproj, layers.22.mlp.gateproj, layers.22.mlp.upproj, layers.23.mlp.downproj, layers.23.mlp.gateproj, layers.23.mlp.upproj, layers.24.mlp.downproj, layers.24.mlp.gateproj, layers.24.mlp.upproj, layers.25.mlp.downproj, layers.25.mlp.gateproj, layers.25.mlp.upproj, layers.26.mlp.downproj, layers.26.mlp.gateproj, layers.26.mlp.upproj, layers.27.mlp.downproj, layers.27.mlp.gateproj, layers.27.mlp.upproj, layers.3.mlp.downproj, layers.3.mlp.gateproj, layers.3.mlp.upproj, layers.4.mlp.downproj, layers.4.mlp.gateproj, layers.4.mlp.upproj, layers.5.mlp.downproj, layers.5.mlp.gateproj, layers.5.mlp.upproj, layers.6.mlp.downproj, layers.6.mlp.gateproj, layers.6.mlp.upproj, layers.7.mlp.downproj, layers.7.mlp.gateproj, layers.7.mlp.upproj, layers.8.mlp.downproj, layers.8.mlp.gateproj, layers.8.mlp.upproj, layers.9.mlp.downproj, layers.9.mlp.gateproj, layers.9.mlp.upproj, oproj, qproj, vproj; vision tower frozen; bfloat16.
  • —Seed 1, learning rate 5e-05, effective batch 2×4, one epoch.
  • —Training data, pair sets and every gate artifact are in the mirror RESEARCH-EMPRM/emprm-v2 (dataset repo; results/runs_v2/train/stageB_rung5_qwen25_s1/) and the paper bundle under backdata/.

Pre-registered gates (development half)

  • —Held-out relational FlipAcc (operation subset): 0.5188
  • —Forced-evidence acceptance at 0.5: false 0.025, true 0.92
  • —Chart-disjoint pair gain against the v1 head: +0.1009 (95% interval [0.0614, 0.1409])

Load

python
from transformers import AutoModelForImageTextToText, AutoProcessor
from peft import PeftModel
base = AutoModelForImageTextToText.from_pretrained("Qwen/Qwen2.5-VL-7B-Instruct", dtype="bfloat16", device_map="cuda")
model = PeftModel.from_pretrained(base, "RESEARCH-EMPRM/emprm-v2-stageB_rung5_qwen25_s1")
processor = AutoProcessor.from_pretrained("Qwen/Qwen2.5-VL-7B-Instruct")

adapter_config.json records the local path the adapter was trained from; pass the base model explicitly as above. Scoring prompts (bank extraction, claim extraction, claim support, ranking) are the ones in work/scripts/eval_bon.py of the mirror.

Provenance

Trained in the EM-PRM v2 repository; every number quoted in the paper is traceable to planning/V2_PLAN.md and the generated tables in the mirror.