CoolFace
Modelpublic

logan7000/mllm-cogrpo-heter-qwen25vl-7b-x-internvl35-8b-mmr1-groupA-qwen25vl-7b-endpoint

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes17downloads
Model Card

q1716523669/mllm-cogrpo-heter-qwen25vl-7b-x-internvl35-8b-mmr1-groupA-qwen25vl-7b-endpoint

Cross-family co-learning (co-GRPO-DP): trained jointly with peer OpenGVLab/InternVL3_5-8B-HF via majority-vote cross-labeling — no ground-truth labels are used.

  • —Base: Qwen/Qwen2.5-VL-7B-Instruct · Peer: OpenGVLab/InternVL3_5-8B-HF
  • —Method: co-GRPO-DP (heterogeneous co-learning, rendezvous cross-pseudo-labels)
  • —Dataset: mmr1 (~8k), 1 epoch = 722 steps
  • —Checkpoint: endpoint (checkpoint-722)
  • —4-bench avg: 47.2 (MathVision / MathVerse / MathVista / We-Math; prompt=answer, greedy T=0, mathruler)
  • —WandB project: co-rl-mllm-mmr1