Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs

Xiaozhe Li, XinYu Fang, Shengyuan Ding, Yang Li 0189, Linyang Li, Haodong Duan, Qingwen Liu 0001, Kai Chen 0026. Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs. In Maria Liakata, Viviane P. Moreira, Jiajun Zhang 0001, David Jurgens, editors, Findings of the Association for Computational Linguistics, ACL 2026, San Diego, California, United States, July 2-7, 2026. pages 28351-28368, Association for Computational Linguistics, 2026. [doi]

References

No references recorded for this publication.

Cited by

No citations of this publication recorded.