Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via sequence-level likelihood

Xingyu Lin, Yilin Wen 0007, Du Su, En Wang, Wenbin Liu, Zhonghou Lv, Jinchang Hou, Chenfu Bao. Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via sequence-level likelihood. In Maria Liakata, Viviane P. Moreira, Jiajun Zhang 0001, David Jurgens, editors, Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), ACL 2026, San Diego, California, United States, July 2-7, 2026. pages 32256-32269, Association for Computational Linguistics, 2026. [doi]

Authors

Xingyu Lin

This author has not been identified. Look up 'Xingyu Lin' in Google

Yilin Wen 0007

This author has not been identified. Look up 'Yilin Wen 0007' in Google

Du Su

This author has not been identified. Look up 'Du Su' in Google

En Wang

This author has not been identified. Look up 'En Wang' in Google

Wenbin Liu

This author has not been identified. Look up 'Wenbin Liu' in Google

Zhonghou Lv

This author has not been identified. Look up 'Zhonghou Lv' in Google

Jinchang Hou

This author has not been identified. Look up 'Jinchang Hou' in Google

Chenfu Bao

This author has not been identified. Look up 'Chenfu Bao' in Google