The following publications are possibly variants of this publication:
- RetroInfer: A Vector Storage Engine for Scalable Long-Context LLM InferenceYaoqi Chen, Jinkai Zhang, Baotong Lu, Qianxi Zhang, Chengruidong Zhang, Jing Liu, Jingjia Luo, Di Liu, Huiqiang Jiang, Qi Chen 0009, Bailu Ding, Xiao Yan 0002, Jiawei Jiang 0001, Chen Chen 0067, Mingxing Zhang, Cheng Li 0001, Yuqing Yang 0001, Fan Yang 0024, Mao Yang 0004. pvldb, 19(5):1016-1031, January 2026. [doi]
- AlayaDB: The Data Foundation for Efficient and Effective Long-context LLM InferenceYangshen Deng, Zhengxin You, Long Xiang, Qilong Li, Peiqi Yuan, Zhaoyang Hong, Yitao Zheng, Wanting Li, Runzhong Li, Haotian Liu, Kyriakos Mouratidis, Man Lung Yiu, Huan Li, Qiaomu Shen, Rui Mao 0001, Bo Tang 0016. SIGMOD 2025: 364-377 [doi]
- 2EAL: Hybrid-Bonding Architecture with Hybrid Sparse Attention for Efficient Long-Context LLM InferenceZizhuo Fu, Xiaotian Guo, Wenxuan Zeng, Shuzhang Zhong, Yadong Zhang, Peiyu Chen, Runsheng Wang, Le Ye, Meng Li. iccad 2025: 1-9 [doi]
- SampleAttention: Near-Lossless Acceleration of Long Context LLM Inference with Adaptive Structured Sparse AttentionQianchao Zhu, Jiangfei Duan, Chang Chen 0001, Siran Liu, Xiuhong Li, Guanyu Feng, Xin Lv, Xiao Chuanfu, Dahua Lin, Chao Yang 0002. mlsys 2024: [doi]
- KVO-LLM: Boosting Long-Context Generation Throughput for Batched LLM InferenceZhenyu Li, Dongxu Lyu, Gang Wang 0063, Yuzhou Chen, Liyan Chen, Wenjie Li 0003, Jianfei Jiang 0001, Yanan Sun 0003, Guanghui He. dac 2025: 1-7 [doi]