| 0 | -- | 0 | Xiaoniu Song, Rong Chen 0001, Haitao Song 0001, Yiwen Zhang, Haibo Chen 0001. Unified and Near-optimal Multi-GPU Cache for Embedding-based Deep Learning |
| 0 | -- | 0 | Chao Jin, Zili Zhang, Xuanlin Jiang, Fangyue Liu, Shufan Liu, Xuanzhe Liu, Xin Jin 0008. RAGCache: Efficient Knowledge Caching for Retrieval-Augmented Generation |
| 0 | -- | 0 | Sam H. Noh, Robbert van Renesse. Editor-in-Chief's Message |
| 0 | -- | 0 | Mingcong Han, Rong Chen 0001, Weihang Shen, Hanze Zhang, Jinrong Yang, Haibo Chen 0001. Real-time, Work-conserving GPU Scheduling for Concurrent DNN Inference |
| 0 | -- | 0 | Chuandong Li 0004, Zhe Tang, Dong Liu, Zhihong Xue, Xiaolin Wang 0001, Zhenlin Wang 0003, Yingwei Luo, Diyu Zhou. A Comprehensive Study on Solving Memory Bloat Under Virtualization |
| 0 | -- | 0 | Jinwoo Jeong, Jeongseob Ahn. An Efficient DNN Model Serving System using Layer-wise Caching and Direct-Host-Access |
| 0 | -- | 0 | Hanze Zhang, Rong Chen 0001, Zihan Tang, Ke Cheng, Haibo Chen 0001. Accelerating Million-scale In-network Lock Management using Lock Fission |