OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models

Wenwen Yu, Zhibo Yang 0003, Jianqiang Wan, Sibo Song, Jun Tang 0008, Wenqing Cheng, Yuliang Liu, Xiang Bai. OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models. IEEE Trans. Pattern Anal. Mach. Intell., 48(8):9210-9227, August 2026. [doi]

Abstract

Abstract is missing.