José Luis Huillca Mango, Leandro A. F. Fernandes. Multimodal Embedding for Scientific Image Caption Generation. In Antonino Furnari, Petia Radeva, editors, Proceedings of the 21st International Conference on Computer Vision Theory and Applications, VISAPP 2026, Marbella, Spain, March 9-11, 2026, Volume 1. pages 87-98, SCITEPRESS, 2026. [doi]