The following publications are possibly variants of this publication:
- Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache ManagementQianli Liu, Zicong Hong, Peng Li, Fahao Chen, Song Guo 0001. infocom 2025: 1-10 [doi]
- CacheGen: KV Cache Compression and Streaming for Fast Large Language Model ServingYuhan Liu, Hanchen Li, Yihua Cheng, Siddhant Ray, Yuyang Huang, Qizheng Zhang, Kuntai Du, Jiayi Yao, Shan Lu 0001, Ganesh Ananthanarayanan, Michael Maire, Henry Hoffmann, Ari Holtzman, Junchen Jiang. sigcomm 2024: 38-56 [doi]
- Memory-Efficient KV Cache Optimization for Large Language Model Inference at the EdgeChi Zhang, Haisheng Tan, Haotian Pan, Yang Xu, Haohua Du, Li Zhang, Xiaoming Fu. infocom 2026: 1-10 [doi]
- RTT- or Bandwidth-Bound? Demystifying the KV Cache Transfer in Large Language Model ServingShengnan Yue, Mowei Wang, Yu Yan, WeiQiang Cheng, Zihan Jiang 0006, Zhenhui Zhang. naic 2025: 5-7 [doi]