From Captioning to Multimodal Reasoning: The Evolution of Vision-Language Research in the Era of Multimodal LLMs

Marcella Cornia. From Captioning to Multimodal Reasoning: The Evolution of Vision-Language Research in the Era of Multimodal LLMs. In Stevan Rudinac, Zi Helen Huang, Marcel Worring, Lucia Vadicamo, Xirong Li 0001, Pascal Mettes, Lizi Liao, editors, Proceedings of the 2026 International Conference on Multimedia Retrieval, ICMR 2026, Amsterdam, The Netherlands, June 16-19, 2026. pages 1, ACM, 2026. [doi]

Abstract

Abstract is missing.