Diversity as a Reward: Fine-Tuning LLMs on a Mixture of Domain-Undetermined Data

Zhenqing Ling, Daoyuan Chen, Liuyi Yao, Qianli Shen, Yaliang Li, Ying Shen 0001. Diversity as a Reward: Fine-Tuning LLMs on a Mixture of Domain-Undetermined Data. In Danielle Belgrave, Cheng Zhang 0005, Laura N. Montoya, Hsuan-Tien Lin, Razvan Pascanu, Piotr Koniusz, Marzyeh Ghassemi, Nancy Chen, Iván Vladimir Meza Ruíz, Arturo Loaiza-Bonilla, editors, Advances in Neural Information Processing Systems 38: Annual Conference on Neural Information Processing Systems 2025, NeurIPS 2025, San Diago, CA, USA, December 2-7, 2025 / Mexico City, Mexico, November 30 - December 5, 2025. 2025. [doi]

Authors

Zhenqing Ling

This author has not been identified. Look up 'Zhenqing Ling' in Google

Daoyuan Chen

This author has not been identified. Look up 'Daoyuan Chen' in Google

Liuyi Yao

This author has not been identified. Look up 'Liuyi Yao' in Google

Qianli Shen

This author has not been identified. Look up 'Qianli Shen' in Google

Yaliang Li

This author has not been identified. Look up 'Yaliang Li' in Google

Ying Shen 0001

This author has not been identified. Look up 'Ying Shen 0001' in Google