Efficiently Learning To Reason or Not to Reason: Root-token Policy Optimization for Adaptive Thinking

Taehyeon Kim, Hyunsoo Lee, Youngsoo Jang, Moontae Lee. Efficiently Learning To Reason or Not to Reason: Root-token Policy Optimization for Adaptive Thinking. In Maria Liakata, Viviane P. Moreira, Jiajun Zhang 0001, David Jurgens, editors, Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), ACL 2026, San Diego, California, United States, July 2-7, 2026. pages 17934-17949, Association for Computational Linguistics, 2026. [doi]

Abstract

Abstract is missing.