EvoCoT: Overcoming the Exploration Bottleneck in Reinforcement Learning for LLMs

Huanyu Liu 0001, Jia Li 0012, Yihong Dong, Chang Yu, Taozhi Chen, Lecheng Wang, Yongding Tao, Bin Gu 0006, Ge Li 0001. EvoCoT: Overcoming the Exploration Bottleneck in Reinforcement Learning for LLMs. In Maria Liakata, Viviane P. Moreira, Jiajun Zhang 0001, David Jurgens, editors, Findings of the Association for Computational Linguistics, ACL 2026, San Diego, California, United States, July 2-7, 2026. pages 20589-20603, Association for Computational Linguistics, 2026. [doi]

Abstract

Abstract is missing.