ARKV: Adaptive and Resource-Efficient KV Cache Management Under Limited Memory Budget for Long-Context Inference in LLMs

Jianlong Lei, Shashikant Ilager. ARKV: Adaptive and Resource-Efficient KV Cache Management Under Limited Memory Budget for Long-Context Inference in LLMs. In 26th IEEE International Symposium on Cluster, Cloud and Internet Computing, CCGrid 2026, Sydney, Australia, May 18-21, 2026. pages 54-63, IEEE, 2026. [doi]

Abstract

Abstract is missing.