Mending the Holes: Mitigating Reward Hacking in Reinforcement Learning for Multilingual Translation

Yifeng Liu, Siqi Ouyang, Yatish Hosmane Revanasiddappa, Lei Li. Mending the Holes: Mitigating Reward Hacking in Reinforcement Learning for Multilingual Translation. In Maria Liakata, Viviane P. Moreira, Jiajun Zhang 0001, David Jurgens, editors, Findings of the Association for Computational Linguistics, ACL 2026, San Diego, California, United States, July 2-7, 2026. pages 33699-33723, Association for Computational Linguistics, 2026. [doi]

Abstract

Abstract is missing.