medical-expert/v3_sftmerged_grounding_grpo_step900
03
v3sftmergedgroundinggrpostep900
GRPO LoRA adapter for chest X-ray phrase grounding, on top of the v3 SFT-merged Lingshu base (lingshu_v3_sft_merged, Qwen2.5-VL-7B). Global step 900.
- Base model: local merged base
lingshu_v3_sft_merged(seeadapter_config.json) - Method: GRPO (EasyR1/veRL), dual-expert (MDETR/TransVG) tool-calling rollout
- Reward: format + accuracy(IoU)
- Hyperparams: lr 5e-6, klcoef 1e-1, klpenalty lowvarkl, enforce_eager, LoRA rank 32 / alpha 64, all-linear, vision frozen
- rollout: n=2, temperature 1.0, tp=4, gpu_util 0.6
Notes
- Near step 900: format ~1.0, accuracy(IoU) ~0.34, anyexpertrate ~0.6, reward overall ~0.40.
- basemodel in adapterconfig.json points to the local merged base path; load against that base.
