CoolFace
Modelpublic

medical-expert/v3_sftmerged_grounding_grpo_step900

sourceHugging Faceupdated 3mo agoView on Hugging Face
0likes3downloads
Model Card

v3sftmergedgroundinggrpostep900

GRPO LoRA adapter for chest X-ray phrase grounding, on top of the v3 SFT-merged Lingshu base (lingshu_v3_sft_merged, Qwen2.5-VL-7B). Global step 900.

  • —Base model: local merged base lingshu_v3_sft_merged (see adapter_config.json)
  • —Method: GRPO (EasyR1/veRL), dual-expert (MDETR/TransVG) tool-calling rollout
  • —Reward: format + accuracy(IoU)
  • —Hyperparams: lr 5e-6, klcoef 1e-1, klpenalty lowvarkl, enforce_eager, LoRA rank 32 / alpha 64, all-linear, vision frozen
  • —rollout: n=2, temperature 1.0, tp=4, gpu_util 0.6

Notes

  • —Near step 900: format ~1.0, accuracy(IoU) ~0.34, anyexpertrate ~0.6, reward overall ~0.40.
  • —basemodel in adapterconfig.json points to the local merged base path; load against that base.