Less Noise, More Voice: Reinforcement Learning for Reasoning via Instruction Purification

Yiju Guo, Tianyi Hu, Zexu Sun, Yankai Lin 0001. Less Noise, More Voice: Reinforcement Learning for Reasoning via Instruction Purification. In Maria Liakata, Viviane P. Moreira, Jiajun Zhang 0001, David Jurgens, editors, Findings of the Association for Computational Linguistics, ACL 2026, San Diego, California, United States, July 2-7, 2026. pages 13469-13482, Association for Computational Linguistics, 2026. [doi]

Abstract

Abstract is missing.