anonymousauthor01/instruction_following_reranker
128
EMNLP 2026 Findings: On-Policy Distillation Meets Off-policy GRPO : Training Compact Instruction Following Rerankers
Model Checkpoint
Citation
If you use this model, please cite:
@inproceedings{prabhakar2026onpolicy,
title = {On-Policy Distillation Meets Off-Policy {GRPO}:
Training Compact Instruction-Following Rerankers},
author = {Prabhakar, Vignesh and Pan, Jialing and
Ankisettipalli, Anil Babu},
booktitle = {Findings of the Association for Computational Linguistics:
EMNLP 2026},
year = {2026},
address = {Budapest, Hungary},
publisher = {Association for Computational Linguistics},
note = {To appear}
}