ob11/Qwen-VL-PRM-7B
241
Model Summary
Qwen-VL-PRM-7B is a process reward model finetuned from Qwen2.5-7B-Instruct on approximately 300,000 examples. It demonstrates strong test-time scaling performance improvements on various advanced multimodal reasoning benchmarks when used with Qwen2.5-VL and Gemma-3 models despite being trained mainly on abstract reasoning datasets and elementary reasoning datasets.
- Logs: https://wandb.ai/aisg-arf/multimodal-reasoning/runs/pj4oc0qh
- Repository: https://github.com/theogbrand/vlprm
- Paper: https://arxiv.org/pdf/2509.23250
Use
The model usage is documented here.
Evaluation
Commercial Models
Qwen-2.5-VL Family
Gemma-3 Family
Framework versions
- TRL: 0.19.1
- Transformers: 4.55.3
- Pytorch: 2.7.1
- Datasets: 3.0.1
- Tokenizers: 0.21.4
Citations
@misc{ong2025vlprms,
title={Training Vision-Language Process Reward Models for Test-Time Scaling in Multimodal Reasoning: Key Insights and Lessons Learned},
author={Brandon Ong, Tej Deep Pala, Vernon Toh, William Chandra Tjhi, and Soujanya Poria},
year={2025},
eprint={2509.23250},
archivePrefix={arXiv},
primaryClass={cs.AI},
url={https://arxiv.org/pdf/2509.23250},
}