Beyond Verifiable Rewards: Scaling Reinforcement Learning in Language Models to Unverifiable Data

Yunhao Tang, Sid Wang, Lovish Madaan, Rémi Munos. Beyond Verifiable Rewards: Scaling Reinforcement Learning in Language Models to Unverifiable Data. In Danielle Belgrave, Cheng Zhang 0005, Laura N. Montoya, Hsuan-Tien Lin, Razvan Pascanu, Piotr Koniusz, Marzyeh Ghassemi, Nancy Chen, Iván Vladimir Meza Ruíz, Arturo Loaiza-Bonilla, editors, Advances in Neural Information Processing Systems 38: Annual Conference on Neural Information Processing Systems 2025, NeurIPS 2025, San Diago, CA, USA, December 2-7, 2025 / Mexico City, Mexico, November 30 - December 5, 2025. 2025. [doi]

Authors

Yunhao Tang

This author has not been identified. Look up 'Yunhao Tang' in Google

Sid Wang

This author has not been identified. Look up 'Sid Wang' in Google

Lovish Madaan

This author has not been identified. Look up 'Lovish Madaan' in Google

Rémi Munos

This author has not been identified. Look up 'Rémi Munos' in Google