Faster MoE LLM Inference for Extremely Large Models

Haoqi Yang 0001, Luohe Shi, Qiwei Li 0002, Zuchao Li, Ping Wang 0028, Hao Huang, Hai Zhao 0001. Faster MoE LLM Inference for Extremely Large Models. In Maria Liakata, Viviane P. Moreira, Jiajun Zhang 0001, David Jurgens, editors, Findings of the Association for Computational Linguistics, ACL 2026, San Diego, California, United States, July 2-7, 2026. pages 43133-43151, Association for Computational Linguistics, 2026. [doi]

Abstract

Abstract is missing.