CodeMNER: Vision-Language Models are Better Multimodal Named Entity Recognizers via Progressive Vision-Code Alignment

Jiakang Yu, Shizhou Huang, Xiaode Chen, Hongtao Deng, Wang Gao 0002, Xun Zhu. CodeMNER: Vision-Language Models are Better Multimodal Named Entity Recognizers via Progressive Vision-Code Alignment. In Stevan Rudinac, Zi Helen Huang, Marcel Worring, Lucia Vadicamo, Xirong Li 0001, Pascal Mettes, Lizi Liao, editors, Proceedings of the 2026 International Conference on Multimedia Retrieval, ICMR 2026, Amsterdam, The Netherlands, June 16-19, 2026. pages 497-505, ACM, 2026. [doi]

Abstract

Abstract is missing.