Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization

Jiantong Jiang, Peiyu Yang, Rui Zhang, Feng Liu. Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization. In Maria Liakata, Viviane P. Moreira, Jiajun Zhang 0001, David Jurgens, editors, Findings of the Association for Computational Linguistics, ACL 2026, San Diego, California, United States, July 2-7, 2026. pages 38450-38476, Association for Computational Linguistics, 2026. [doi]

Abstract

Abstract is missing.