ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos

Peiran Wu, Yunze Liu, Miao Liu, Junxiao Shen. ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos. In IEEE/CVF Winter Conference on Applications of Computer Vision, WACV 2026, Tucson, AZ, USA, March 6-10, 2026. pages 5174-5183, IEEE, 2026. [doi]

Abstract

Abstract is missing.