CoolFace
Modelpublic

anonymousauthor01/instruction_following_reranker

sourceHugging Faceupdated 28d agoView on Hugging Face
1likes28downloads
Model Card

EMNLP 2026 Findings: On-Policy Distillation Meets Off-policy GRPO : Training Compact Instruction Following Rerankers

Model Checkpoint

Citation

If you use this model, please cite:

bibtex
@inproceedings{prabhakar2026onpolicy,
  title     = {On-Policy Distillation Meets Off-Policy {GRPO}:
               Training Compact Instruction-Following Rerankers},
  author    = {Prabhakar, Vignesh and Pan, Jialing and
               Ankisettipalli, Anil Babu},
  booktitle = {Findings of the Association for Computational Linguistics:
               EMNLP 2026},
  year      = {2026},
  address   = {Budapest, Hungary},
  publisher = {Association for Computational Linguistics},
  note      = {To appear}
}