CoolFace
Modelpublic

Color2333/pbr-scorer-qwen25-vl-lora

sourceHugging Faceotherupdated 3mo agoView on Hugging Face
0likes5downloads
Model Card

PBR Scorer — Qwen2.5-VL QLoRA 打分器

把 Qwen2.5-VL-7B 微调成 PBR 逐通道质量打分器(Q-Align/DeQA 范式)。本仓库是 LoRA adapter,需配基座 Qwen/Qwen2.5-VL-7B-Instruct。

模型(当前版:fullcover 160k)

  • —QLoRA(4-bit NF4 冻结基座 + LoRA on LLM proj + 视觉塔 blocks,~47.6M 可训)。
  • —无自定义头:读 answer 位 6 个数字 token("0"…"5")softmax,期望值 = 分数。
  • —训练:160k items(全覆盖),DeQA 软标签(高斯 σ=0.75)CE。(旧版为 60k,已弃用。)
  • —输入:[通道图, 渲染图, base_color] + 每通道评分准则 prompt。
  • —权重:models/qwen25_fullcover/(软链 models/qwen25_adapter)。

结果(golden 200,精选/GT均衡/高清,2026-06 实测)

指标meanbasenormalroughmetallic
SRCC0.7400.8130.8330.7620.554
τb—0.6650.6960.6200.437
MAE—0.630.670.631.19

综合分级能力:模型综合分 vs 人工 finalScore 相关 0.875、vs tier 档位 0.836 → 能很好地把资产排出"电影级→勉强可用"。

fullcover(160k) 全面优于旧 60k 版(golden mean 0.740 vs 0.722,metallic 0.554 vs 0.540,tier 0.836 vs 0.800)。 读出可换温度(T≈0.25)以恢复两端、提升"守护精品"。

参照:旧 60k 版 old-test(4917) SRCC mean 0.792 / metallic 0.631(不同测试集,不可与 golden 直接比绝对值)。

用法

python
from transformers import AutoModelForImageTextToText
from peft import PeftModel
base = AutoModelForImageTextToText.from_pretrained("Qwen/Qwen2.5-VL-7B-Instruct", load_in_4bit=True)
model = PeftModel.from_pretrained(base, "<this-repo>")
# 推理:构造 [channel, render, base_color] + prompt,读 6 数字 token softmax 取期望
# 完整逻辑见代码仓库 vlm_scorer_eval.py

局限

同 DINOv2 卡:聚合 SRCC 受单人标注噪声封顶 ~0.79;metallic 最弱;训练数据私有不分发。

License

继承 Qwen2.5-VL 基座许可;本 adapter 为衍生物,研究用途。