| 0 | -- | 0 | Chengcheng Song, Hui Li 0037, Tianyang Xu 0001, Xiao-Jun Wu 0001, Josef Kittler. RefineFuse: an end-to-end network for multi-scale refinement fusion of multi-modality images |
| 0 | -- | 0 | Haonan Cheng, Hanyue Liu, JuanJuan Cai, Long Ye. CLFormer: a cross-lingual transformer framework for temporal forgery localization |
| 0 | -- | 0 | Qing Zhang, Ling Li 0012, Rizhao Cai, Qingli Li, Bandara Dissanayake, Yan Wang 0033, Alex C. Kot. PS-Net: high-frequency attention and Bayesian analysis based facial pore segmentation with no human annotation |
| 0 | -- | 0 | Yuxiang Fu, Jiakun Ding, Renzhi Wang, Qian Fu, Ivor W. Tsang, Ming-Ming Cheng, Qing Guo 0005. Benchmarking Drag⋆ for eye direction transformation and beyond |
| 0 | -- | 0 | Yizhang Jin, Jian Li 0062, Tianjun Gu, Yexin Liu, Bo Zhao 0015, Jinxiang Lai, Zhenye Gan, Yabiao Wang, Chengjie Wang 0001, Xin Tan 0002, Lizhuang Ma. Efficient multimodal large language models: a survey |
| 0 | -- | 0 | Yifei Deng, Zhengyu Chen, Chenglong Li 0002, Jin Tang 0001. Uncertainty-aware coarse-to-fine alignment for text-image person retrieval |
| 0 | -- | 0 | Yichen Shi, Yuhao Gao, Yingxin Lai, Hongyang Wang, Jun Feng, Lei He, Jun Wan 0001, Changsheng Chen, Zitong Yu, Xiaochun Cao. SHIELD: an evaluation benchmark for face spoofing and forgery detection with multimodal large language models |
| 0 | -- | 0 | Hang Zhang, Wenxiao Zhang, Haoxuan Qu, Jun Liu 0036. Enhancing human-centered dynamic scene understanding via multiple LLMs collaborated reasoning |
| 0 | -- | 0 | Yibin Ye, Xichao Teng, Hongrui Yang, Shuo Chen, Yuli Sun, Yijie Bian, Tao Tan 0002, Zhang Li, Qifeng Yu. 3MOS: a multi-source, multi-resolution, and multi-scene optical-SAR dataset with insights for multi-modal image matching |
| 0 | -- | 0 | Shuzhou Yang, Yu Wang, Haijie Li, Jiarui Meng, Yanmin Wu, Xiandong Meng, Jian Zhang. Hybrid Fourier score distillation for efficient one image to 3D object generation |
| 0 | -- | 0 | Yaokun Yang, Feng Lu. GazeLLM: a plug-and-play zero-shot LLM reasoning framework for boosting gaze target detection |
| 0 | -- | 0 | Jiaxin Mei, Tao Zhou 0002, Kaiwen Huang, Yizhe Zhang 0001, Yi Zhou 0007, Ye Wu 0001, Huazhu Fu. A survey on deep learning for polyp segmentation: techniques, challenges and future trends |
| 0 | -- | 0 | Junlin Xie, Zhihong Chen, Ruifei Zhang, Guanbin Li. Large multimodal agents: a survey |
| 0 | -- | 0 | Xiaohan Fang, Peilin Chen 0001, Meng Wang 0017, Shiqi Wang 0001. Immersive video interaction system: a survey |
| 0 | -- | 0 | Suyan Li, Fuxiang Huang, Lei Zhang 0038. A survey of multimodal composite editing and retrieval |
| 0 | -- | 0 | Fang Nan, Ni Zhang 0001, Nian Liu 0002, Haochen Han, Binglu Wang. Visual-guided human-object interaction detection |
| 0 | -- | 0 | Yingjia Xu, Mengxia Wu, Zixin Guo, Min Cao, Mang Ye, Jorma Laaksonen. Efficient text-to-video retrieval via multi-modal multi-tagger derived pre-screening |
| 0 | -- | 0 | Xiao Wang 0014, Yuehang Li, Wentao Wu, Jiandong Jin, Yao Rong, Bo Jiang 0002, Chuanfu Li, Jin Tang 0001. Pre-training on high-resolution X-ray images: an experimental study |
| 0 | -- | 0 | Xiaoxu Jin, Weinan Guan, Wei Wang, Jing Dong. Towards reliable deepfake detection from uncertainty calibration perspective |
| 0 | -- | 0 | Erfei Cui, Wenhai Wang, Zhiqi Li, Jiangwei Xie, Haoming Zou, Hanming Deng, Gen Luo, Lewei Lu, Xizhou Zhu, Jifeng Dai. DriveMLM: aligning multi-modal large language models with behavioral planning states for autonomous driving |
| 0 | -- | 0 | Ruikun Zhang, Zhiyuan Yang, Liyuan Pan. DehazeMamba: large multi-modal model guided single image dehazing via mamba |
| 0 | -- | 0 | Qianggang Ding, Zhichao Shen, WeiQiang Zhu, Bang Liu. DASFormer: self-supervised pretraining for earthquake monitoring |
| 0 | -- | 0 | Yifu Yuan, Hongyao Tang, Cong Wang, Yan Zheng 0002, Jianye Hao. ED2: environment dynamics decomposition world models for continuous control |
| 0 | -- | 0 | Yifeng Cheng, Alois Knoll, Hu Cao. URNet: uncertainty-aware refinement network for event-based stereo depth estimation |
| 0 | -- | 0 | Mingjin Zhang, Qian Xu, Yuchun Wang, Xi Li, Haojuan Yuan. MIRSAM: multimodal vision-language segment anything model for infrared small target detection |
| 0 | -- | 0 | Lebin Zhou, Cihan Ruan, Nam Ling, Zhenghao Chen, Wei Wang, Wei Jiang. TVC: tokenized video compression with ultra-low bit rate |
| 0 | -- | 0 | Duoduo Xue, Wenrui Dai, Ziyang Zheng, Junni Zou, Hongkai Xiong. A contemporary survey on image reconstruction with unsupervised deep learning: from denoising to generation |
| 0 | -- | 0 | Zhe Cao 0001, Lixin Xu, Jin Zhang, Biwen Yang, Kaizheng Chen, Ruiheng Zhang. DBDB: de-bimodal defocus blur in joint infrared-visible imaging |
| 0 | -- | 0 | Yuli Zhou, Guolei Sun, Yawei Li 0001, Guo-Sen Xie, Luca Benini, Ender Konukoglu. When SAM2 meets video camouflaged object segmentation: a comprehensive evaluation and adaptation |
| 0 | -- | 0 | Yasheng Sun, Bohan Li, Mingchen Zhuge, Deng-Ping Fan, Salman H. Khan 0001, Fahad Shahbaz Khan, Hideki Koike. Connecting dreams with visual brainstorming instruction |