Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization

Jiantong Jiang, Peiyu Yang, Rui Zhang, Feng Liu. Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization. In Maria Liakata, Viviane P. Moreira, Jiajun Zhang 0001, David Jurgens, editors, Findings of the Association for Computational Linguistics, ACL 2026, San Diego, California, United States, July 2-7, 2026. pages 38450-38476, Association for Computational Linguistics, 2026. [doi]

@inproceedings{JiangYZL26,
  title = {Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization},
  author = {Jiantong Jiang and Peiyu Yang and Rui Zhang and Feng Liu},
  year = {2026},
  url = {https://aclanthology.org/2026.findings-acl.1916/},
  researchr = {https://researchr.org/publication/JiangYZL26},
  cites = {0},
  citedby = {0},
  pages = {38450-38476},
  booktitle = {Findings of the Association for Computational Linguistics, ACL 2026, San Diego, California, United States, July 2-7, 2026},
  editor = {Maria Liakata and Viviane P. Moreira and Jiajun Zhang 0001 and David Jurgens},
  publisher = {Association for Computational Linguistics},
  isbn = {979-8-89176-395-1},
}