Abstract is missing.
- From Captioning to Multimodal Reasoning: The Evolution of Vision-Language Research in the Era of Multimodal LLMsMarcella Cornia. 1 [doi]
- Retrieval in the Age of Agents: From Ranking Documents to Querying ExpertsEvangelos Kanoulas. 2 [doi]
- Graphs for Logic and Texts for Context: A Multi-Agent Orchestrated Hybrid RAG with Stepwise Question DecompositionFeng Ding, Huailiang Peng, Hao Sun, Chi Zhang, Qiong Dai. 3-11 [doi]
- Mitigating Semantic Bias in Multilingual Visual Document Retrieval via Language-Vision-Aware Late InteractionHaowei Li, Haojie Wu, Jie Bao, Zhen Chen 0025, Yong Liao 0003. 12-20 [doi]
- Describing-Verifying-Scoring: A Hierarchical Reasoning Framework for Zero-Shot Composed Image RetrievalGuquan Jing, Peng Gao, Yujian Lee, Hui Zhang 0062. 21-30 [doi]
- Spherical Projected Bézier Flow: A Geometry-Constrained Manifold Transport Framework for Cross-Age Face RetrievalHuaQing Song, Baichuan Lin, Shuofeng Sun, Lanchi Xie, Haibin Yan, Zhihui Li. 31-39 [doi]
- Frozen LVLMs for Micro-Video Recommendation: A Systematic Study of Feature Extraction and FusionHuatuan Sun, Yunshan Ma 0002, Changguang Wu, Yanxin Zhang, Pengfei Wang, Xiaoyu Du 0002. 40-49 [doi]
- PIRSA: Profile-Indexed Retrieval and Semantic Frame Alignment for Ambiguous Spoken Language UnderstandingXiaoqin Zhang, Xingpeng Wu, Yanjun Lu, Shuhan Nie, Tian Shi, Xianglong Liu, Xin Yang. 50-58 [doi]
- PAMS-GNN: Popularity-Aware Multimodal Semantic GraphNeural Networks for RecommendationQuanyou Li, Yunqi Cao, Le Yu, Wenxin Li, Jin Xu. 59-68 [doi]
- MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document RetrievalFengbin Zhu, Zijing Cai, Yuzhe Wang, Pengyang Shao, Wenjie Wang 0007, Fuli Feng, Richang Hong, Tat-Seng Chua. 69-78 [doi]
- DIR-RSCLIP: A Degradation-Invariant Cross-Modal Retrieval Network for Remote Sensing ImagesXiaotian Li, Chenyu Zhang, Changbai Chen, Zhongjie Zhu. 79-87 [doi]
- BiOVQL: Brain-inspired One-stage Egocentric Visual Query LocalizationYifei Cao, Guolong Wang 0001, Mingliang Hou, Jizhe Yu, Xianjie Zhang, Xiya Bu, Zhizhen Li, Yu Liu 0035. 88-98 [doi]
- Which LoRA Should Be Merged Next? Retrieving an Additional LoRA from a Target ImageDaichi Sugita, Huu-Long Pham, Makoto P. Kato, Hiroaki Ohshima, Sumio Fujita, Yoshiyuki Shoji. 99-107 [doi]
- NeuroAlign: Dynamic Dual-Stream Alignment of Perception and Cognition for Zero-Shot Brain-Image RetrievalYixing Ke, Dong Liang 0001, Kun Shang 0002. 108-117 [doi]
- M-STAR: Multi-view Semantic Topology Alignment with Reasoning from VLMs for Image-Text RetrievalXuewen He, Yuning Guo, Fumao Xu, Mingyong Li. 118-127 [doi]
- Scaling Multimodal Retrieval and Generation for Long Documents through Visual Tiling and Context CompressionYi Jin, Weichao Chen 0001, Shengjie Zhao 0001. 128-137 [doi]
- GjPest4CMR: LLMs-Assisted Morphology-Aware Fine-grained Goji Pest Image-Text RetrievalWenkai Ma, Wentao Ma 0003, Tan Wang, Yuwei Wang 0002, Lu Liu, Junfei Yang, Xianbao Xu, Yuan Rao 0003. 138-146 [doi]
- LSR²: Learning to Select Relational and Reasoning Feature for Multi-modal Re-identificationPeng Jin, Yuxuan Qiu, Zhaofa Wang, Xiaoyue Hu, Xiabing Zhou, Na Jiang. 147-156 [doi]
- Unsupervised Cross-Modal Semantic Invariance HashingQiyou Huang, Meng Wang. 157-166 [doi]
- RoATR: A Systematic Study of Audio-Text Retrieval Robustness Against Realistic PerturbationsHonglei Zhang, Pengfei Zhou, Ruohan Wang, Siyue Zhang, Yilei Shi. 167-176 [doi]
- RFHNet: Relational and Frequency-Aware Hashing Network for Large-Scale Fine-Grained Food Image RetrievalJunsong Wang, Weiqing Min, Guorui Sheng, Tao Yao, Lili Wang 0009, Shuqiang Jiang. 177-185 [doi]
- DeHub: Learning Hub-Resistant Representations for Text-Video RetrievalAnjun Jia, Xiaowei Zhang 0003. 186-195 [doi]
- AdRetr: Theme-Aware Advertisement Video Retrieval Beyond KeywordsNeha Choudhary, Abhiraj Painuly, Yaman Kumar 0001, Varun Khurana, Poonam Goyal. 196-205 [doi]
- Empowering Vision Language Models for Training-Free Visual Search via Context-Aware Scanpath SimulationHaoran Wang, Dan Wan. 206-214 [doi]
- DyCa-GRPO: Calibrated and Efficient Learning-to-Rank for Multimodal Retrieval with Human FeedbackNing Han, Xiubo Liang. 215-222 [doi]
- CCRA: A Cross-modal Complementary Representation Alignment Framework for Bridging the Modality GapXingchen Han, Ruihao Zhang, Ruiting Li, Yingxin Pei, Jiaqi Wang 0011, Zhe Ji, Feiliang Ren, Yongkang Liu 0002. 223-232 [doi]
- PRISM-GCN: Principled Representation Integrationon Graphs for Multi-Behavior RecommendationXinwei Li, Gaoquan Liu, Changqiang Xu, Ruohong Huan, Xiaomin Zhao. 233-241 [doi]
- B-HFA: Parameter-Efficient Vision-Language Retrieval via Block-shared Adapters and Hierarchical AggregationRui Xu, Lin Yao 0001, Zhiyang Wu, Xuyun Zhang, Guowei Wu 0001. 242-251 [doi]
- MCHRAG: Multi-Centroid Hierarchical Indexing for Efficient Incremental RAGYuan Ren, Mingxue Liao, Gang Zhou 0001, Jinxing Peng, Pin Lv. 252-260 [doi]
- Adaptive Knowledge-Language Alignment for Industrial Anomaly Detection and SegmentationShih Chih Lin. 261-268 [doi]
- RankVR: Low-Rank Structure Perception and Value Recalibration for Robust Composed Image RetrievalJiale Huang, Zixu Li 0001, Zhiheng Fu, Zhiwei Chen 0003, Qinlei Huang, Yupeng Hu 0003. 269-278 [doi]
- Target-Enhanced Gated Transformer: A Multi-Behavior Recommendation Framework for Noise Suppression and Target Signal PreservationXing Zhang, Xu Cheng 0003, Likang Wu, Yingyuan Xiao, Wenguang Zheng. 279-287 [doi]
- IMAGINE: Adaptive Schema-Imagery Enhanced Composition for Composed Video RetrievalJiale Huang, Zixu Li 0001, Zhiwei Chen 0003, Zhiheng Fu, Chunxiao Wang, Yupeng Hu 0003. 288-297 [doi]
- CREAM: Collaborative Representation with Self-supervised Alignment for Multimedia RecommendationJunhao Gao, Chao Yang, Bin Jiang 0006. 298-307 [doi]
- Contrastive Multimodal Fusion and Pseudo-Label method for Unsupervised Cross-Modal Hashing RetrievalQinze Zhu, Jiayi Yang, Yijie Zhu, Mingyong Li. 308-316 [doi]
- From Noisy Candidates to Reliable Grounding in Weakly-Supervised Referring Expression ComprehensionYunlong He, Ziqi Gu, Tong Zhang 0021, Zhen Cui 0001, Chunyan Xu. 317-326 [doi]
- Fine-grained Text-Video Retrieval with Patch-level Temporal Difference and AggregationJialong Hu, Zijie Song, Yang Wang 0023, Zhenzhen Hu 0004, Jia Li 0013, Yixiao Ma, Richang Hong. 327-336 [doi]
- MMRet3D: A Multi-Modal Matching Framework for 3D Object Retrieval from Multi-View ImagesZeYu Li, Lei Li 0009. 337-346 [doi]
- Global-Regional Dual Hashing for Unsupervised Visual-Textual Retrieval via Concept Similarity GuidanceYewen Li, Zongwei Tang, Xiaodong Wang. 347-355 [doi]
- Calibrate and Aggregate: Cross-Modal Retrieval with Distribution Alignment and Token ReductionZiyi Wu, Jiahao Li, Mingyuan Jiu, Hongru Zhao, Hichem Sahbi, Mingliang Xu 0001. 356-365 [doi]
- SCAN: Self-Calibrated Textual Anchoring for Dual-Granularity Video Screening in Text-Video RetrievalDixin Chen, Baoyao Yang, Haifeng Lin, Canrong Du, Wenbin Yao. 366-375 [doi]
- Deconstructing Centrality: Scale-Hierarchy for Hubness in Text-Video RetrievalHoulin Zhu, Libo Liu, Ruonan Zhang 0002, Zhen Deng. 376-385 [doi]
- Robust Graph Matching via Confidence-Guided Distillation and Random Node MaskingZhoubo Xu, Zizhao Pang, Yu Meng, Huijie Cong. 386-394 [doi]
- CARE: A Constraint-Aware Hypergraph Framework for Knowledge-Driven Event-Centric RetrievalMengxue Yang 0001, Xitong Li, Ziyi Yang, Jingqi Zhang, Xiaruo Zhang, Ying Li. 395-404 [doi]
- Cross-View Collaborative Recommendation with Multimodal and Multi-Scale User BehaviorsYifan Huo, Ming Liu, Junhong Zheng, Lili He 0006. 405-409 [doi]
- Relational Retrieval: Leveraging Known-Novel Interactions for Generalized Category DiscoveryYulin Xu, Chunqi Guo, Yuanzhen Shuai, Jianyuan Ni. 410-414 [doi]
- Instance-Adaptive Routing for Object Re-Identification with Heterogeneous ExpertsShuming Hu, Chuan Fu, Shuting He, Henghui Ding. 415-419 [doi]
- Reranking-based Analysis on Visual and Textual Query Contribution to Composed Image RetrievalHuaying Zhang, Ren Togo, Takahiro Ogawa 0001, Miki Haseyama. 420-424 [doi]
- Video Hashing with Robust Secondary Frames and Local Tangent Space Alignment for Copy DetectionZixuan Yu, Xiaoping Liang, Zhenjun Tang. 425-429 [doi]
- POSITIVE4Rec: Incorporating the Recency Effect with Positional Inductive Bias for Sequential RecommendationPo-Chih Lin, Yixuan Dong, Fang-Yi Su, Haijie Yang, Zelin Zang, Hongliang Zhang 0002, Wing-kuen Ling, Fuji Yang. 430-434 [doi]
- A Decomposed Retrieval-Edit-Rerank Framework for Chord GenerationQiqi He, Dichucheng Li, Xiaoheng Sun, Anqi Huang. 435-439 [doi]
- DTSR: High-Frequency Prior-Based Dynamic Texture Synthesis for Real-World Image Super-ResolutionFeiyi He, Zihan Cheng, Jielei Wang, Cencen Liu, Guoming Lu. 440-448 [doi]
- Semi-Automatic Correction of 3D Tubular Structure Skeletons via Component-Wise MST and Filtered Delaunay TriangulationRuoxuan Yang, Chuan Li 0007. 449-458 [doi]
- Neural Representations for Animated GIFsYifei Wang, Gaozhi Liu, Sheng Li 0006, Xinpeng Zhang 0001, Zhenxing Qian. 459-467 [doi]
- SatCLA: A Collaborative LLM-Driven Framework for Annotation of LEO Satellite ImageryGuogen Zeng, Juan Luo, Peng Sun 0003, Ying Qiao, Anping Liu. 468-477 [doi]
- Semi-3DETR: Semi-Supervised Detection Transformer for 3D Object DetectionNa Dong, Gim Hee Lee. 478-486 [doi]
- Evidential Uncertainty Modulated Adaptive Predictive Contrastive Learning for Multimodal FusionQiuyu Mei, Hong Yu 0007, Shijie Yu, Yan Yang. 487-496 [doi]
- CodeMNER: Vision-Language Models are Better Multimodal Named Entity Recognizers via Progressive Vision-Code AlignmentJiakang Yu, Shizhou Huang, Xiaode Chen, Hongtao Deng, Wang Gao 0002, Xun Zhu. 497-505 [doi]
- 2P-Net: Asymmetric Domain-Adaptive Prototype Network for Cross-Domain Multimodal Sensor RetrievalXin Qin, Wenjie Wang, Mengna Liu, Xu Cheng 0003, Fan Shi 0001, Shengyong Chen. 506-514 [doi]
- Keep the General, Inject the Specific: Structured Dialogue Fine-Tuning for Knowledge Injection without Catastrophic ForgettingYijie Hong, Xiaofei Yin, Xinzhong Wang, Ya Guo, Huijia Zhu, Sufeng Duan. 515-524 [doi]
- Hyperbolic and Evidence-Prioritized Experts for Large Vision-Language ModelsZijie Zhou 0001, Dandan Zhu, Hangxiangpan Wang, Heng Zhang, Huishen Jiao, Yi Zhao. 525-534 [doi]
- Improving Pseudo-Labeling and Representation Balance in Realistic Long-Tailed Semi-Supervised LearningZhengyu Ma, Qifeng Zhou. 535-543 [doi]
- SubGAva: 3D Gaussian Primitive Subdivision for Photo-realistic and Animatable Human Avatars from Monocular VideoPu Wang, Dehui Kong, Jinghua Li, Baocai Yin. 544-552 [doi]
- Entropy Regularized Simple Multiple Kernel K-Means with Adaptive Deviation CorrectionXiaohong Jia 0002, Zhiwei Xia, Baijing Wu, Yunchao Wei, Yao Zhao 0001. 553-557 [doi]
- OOWM: Structuring Embodied Reasoning and Planning via Object-Oriented Programmatic World ModelingHongyu Chen, Liang Lin, Guangrun Wang. 558-566 [doi]
- MAFNet: Multi-frequency Adaptive Fusion Network for Real-time Stereo MatchingAo Xu, Rujin Zhao, Xiong Xu, Boceng Huang, Yujia Jia, Hongfeng Long, Fuxuan Chen, Zilong Cao, Fangyuan Chen. 567-576 [doi]
- Adaptive Spatial-Channel Masked Reconstruction Knowledge Distillation for Dense PredictionZiniu Liu, Shuheng Zhou 0001, Jin Zeng, Mingqing Liu 0002, Yulong Zhang, Hao Deng 0002. 577-585 [doi]
- PURE: Probabilistic Utility for Robust Evidence in Multimodal RecommendationJinguo Hu, Yuelan Qi, Song Yu, Zhifang Liao, Wendong Zhang. 586-594 [doi]
- From Physics to Representation: Audio Learning with Synthetic Pre-training via Procedural GenerationFengrui Liu, Ruiyang Huang, Qijian Zheng, Yuanfang Wang, Feng Liu 0039. 595-604 [doi]
- Parameter-Efficient Adaptation with Proxy Anchors for Cross-Domain Few-Shot LearningSong Shi, Chengqiao Liu, Jinfang Jia. 605-614 [doi]
- Real-Time Retrieval-Free Camera Pose Estimation via Sparse Cross-Modal 2D-3D Matching with Projection-Guided RefinementFan Wu, Amine Kacete, Jérôme Royan, Guillaume Moreau. 615-624 [doi]
- AF-BEV: Object-Aware Adaptive Frustum-based BEV Aggregation for 3D Object DetectionBingyu Zhu, Dongbo Yu, Yunbiao Wang, Jun Xiao 0005, Haiyong Jiang. 625-634 [doi]
- KG-CPEN: Knowledge-Guided Compositional Prototype Evolution for Unbiased Scene Graph GenerationYujun Hu, Changbo Wang, Gaoqi He. 635-644 [doi]
- Anomaly Detection in Dynamic Networks with Hyperspherical Projection and DBN-based Anomaly SynthesisYifan Hong 0001, Jiao Luo, Wang Jiawei, Yangchen Zeng, Yusen Wu. 645-653 [doi]
- SSHF-CLIP: Semantic-Guided Scale Selection and Hybrid Fusion for Zero-Shot Anomaly DetectionKaiyuan Jin 0001, Wayit Abliz, Maihemuti Maimaiti, Zaokere Kadeer, Aishan Wumaier, Abdujelil Abdurahman, Panpan Zheng. 654-662 [doi]
- Detail-Aware Camouflaged Object Detection via Multi-Granularity Collaborative LearningYe Wang, Kai Huang, Kai Zhao, Sumin Shen. 663-671 [doi]
- TASEN: Topic-Aware Semantic Enhancement Network for Multimodal Named Entity RecognitionGuohui Ding, Chufei Wang, Hongfeng Wang, Zakovorotnyi Oleksandr. 672-680 [doi]
- Egocentric Action Recognition with Retrieval-Augmented LearningYishan Zou, Chris D. Nugent, Matthew Burns, Shengli Wu 0001, Mingzhu Xu, Meng Liu 0006. 681-689 [doi]
- GADRNet: Geometry-Prior-Guided Adaptive Distortion Rectification Network for Panoramic Depth EstimationGuoxu Li, Cheng Han 0002, Chao Zhang 0105, Tongzhou Zhang 0001, Shuang Yang. 690-699 [doi]
- MOC-3D: Manifold-Order Consistency for Text-to-3D GenerationChenyang Fan, Wen Yang 0003, Junshi Cheng, Zihong Li, Wenfeng Zhang, Wei Hu, Yi Zhang, Pan Zeng. 700-709 [doi]
- From Confrontion to Balance: A Kronecker-Constrained Spectral Entropy Joint Optimization Framework for Multimodal Sentiment AnalysisFeifei Xu, Puzhe Li, Dongyang Li, Bo Li, Luobing Huang, Wenjing Zhu, Zirui Xu, Yu Xie. 710-718 [doi]
- Graph-Based Rotation-Robust Semantic Modeling for Oriented Object Detection in Remote Sensing ImagesHongning Liu, Xianchao Zhang 0001, Hui Sun, Linlin Zong, Wenxin Liang, Xinyue Liu 0002. 719-727 [doi]
- Robust Multi-modal Knowledge Graph Completion via Modality-Specific ExpertsHaiyan Liu, Xin Song, Ye Wang 0015, Kai Chen 0020, Yuying Liu 0001, Bin Zhou 0004, Hongkui Tu, Liqun Gao, Yue Qian. 728-737 [doi]
- LaViSE: Language-aware Vision Scale Enhancement for Referring Remote Sensing Image SegmentationYan Li 0083, Junjie Zheng, Zhouchao Fu, Shengjie Yang, Junjie Liao, Jianwei Zheng 0001. 738-747 [doi]
- Symmetry-Aware Causal Inference for Robust Neural PDE SolversYuanming Xie, Yanzhuo Xiang, Haochen You, Nuoya Liu, Fangzhou Liu, Bo Zhao, Zhaolu Kang, Yue Li, Yuqi Li. 748-757 [doi]
- Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic ManipulationZijian Song, Qichang Li, Sihan Qin, Yuhao Chen, Tianshui Chen, Liang Lin, Guangrun Wang. 758-767 [doi]
- Ref2Inpaint: 3D Gaussian Inpainting via Visibility-Aware Mask Refinement and VLM-Guided Reference RetrievalYining Xu 0001, Yuanyang Zhang, Jingjiao You, Yingjie Huang 0001, Jianbo Mei, Yilong Liu, Li Yao 0003. 768-776 [doi]
- SaF-AD: Saliency-Adaptive and Feature-Consistent Diffusion for Industrial Anomaly DetectionYilong Liu, Yuanyang Zhang, Zirui Luo, Kaixi Xu, Yining Xu 0001, Li Yao 0003. 777-786 [doi]
- Beyond Inconsistent Reasoning: Intermediate Process Direct Preference Optimization on Small Multi-modal Large Language Models for Visual Question AnsweringYongzhu Miao, Puzhen Su, Haoran Yin, Shasha Li 0001, Jintao Tang, Ting Wang 0009. 787-796 [doi]
- Mitigating Multimodal Inconsistency via Cognitive Dual-Pathway Reasoning for Intent RecognitionYifan Wang, Peiwu Wang, Yunxian Chi, Zhinan Gou, Kai Gao 0006. 797-806 [doi]
- OpenSGG-VL: Open-Vocabulary 3DSGG with Orthogonal Residual Fusion and Iterative Relation RefinementBinbin Zhang, Fang Zhou, Liang Xiao, Zhiyong Su, Weiqing Li. 807-816 [doi]
- TEA-Mamba: Textual Event-Aware Mamba for Multimodal Time Series ForecastingHaowei Ran, Zheng Wang 0008, Meijun Sun. 817-825 [doi]
- Seedcap: Semantic Expansion and Entity-Driven Zero-Shot Image CaptioningBinbin Li 0003, Shupei Xiao, Dayan Wu, Gengqi Yang, Siyu Jia, Zisen Qi. 826-834 [doi]
- AutoAWG: Adverse Weather Generation with Adaptive Multi-Controls for Automotive VideosJiagao Hu, Daiguo Zhou, Danzhen Fu, Fuhao Li, Zepeng Wang, Fei Wang 0032, Wenhua Liao, Jiayi Xie, Haiyang Sun. 835-844 [doi]
- CausalGS: Learning Physical Causality of 3D Dynamic Scenes with Gaussian RepresentationsNengbo Lu, Minghua Pan. 845-854 [doi]
- ExpV2S: Zero-Shot Expressive Video-to-Speech Synthesis via Latent Diffusion ModelFang Zhang, Anqi Gou, Linli Xu. 855-864 [doi]
- PRISM: Preference-Guided Semantic Reasoning with Vision-Language Models for Object Goal NavigationZijian Liu, Cong Pan, Chengjie Fan, Wanjie Cai, Xichen Ding, Jie Qin 0004. 865-873 [doi]
- Rectifying Multimodal Variance: UAPA-HCF for Weakly Supervised Violence DetectionLongkun Shi, Hanlin Hu, Haoze Zheng, Yuanyuan Liao, Turdi Tohti. 874-883 [doi]
- Where & What Anomaly? A Framework for Pose-Agnostic Anomaly Detection and Zero-Shot Semantic ClassificationZhaokun Huang, Yonghong Song, Heyao Zhang. 884-892 [doi]
- Learning A Bank of Transferable Prompts for Vision-Language ModelsJiong Wang, Zhongwei Huang, Chong Wang 0001, Endai Huang, Ran Zhou 0002, Haitao Gan, Yingying Zhu 0001, Xiaoyu Shen 0001. 893-901 [doi]
- Decision-Invariant Sim-to-Real Vision-and-Language Navigation with Pseudo-Panoramic ObservationsYuanyu Zheng, Xumin Shen, Yunda Sun, Ying Shen 0005, Lin Zhang 0014. 902-910 [doi]
- TAVEN: Task-driven Adaptive Viewpoint Exploration for Training-Free 3D Spatial Reasoning and UnderstandingShuyi Jiang, Zhihao Yuan, Na Zhao 0004. 911-920 [doi]
- SGFR-Track: Uncertainty-Gated Spectral Feature Restoration for Online Multi-Object TrackingZheng Liang, Yisu Liu, Shuo Yang 0013. 921-929 [doi]
- Retrieval-Guided Contextual Inference for Training-Free Video Anomaly Detection in Low-Light ScenariosMengjingcheng Mo, Jiankang Zheng, Jiaxu Leng, Xinbo Gao 0001. 930-939 [doi]
- Agglomerative Model Meets Multi-Scale Adaptive Fusion for Cross-Modal Unsupervised Domain AdaptationZhixun Wang, Liqun Kuang, Song Wang, Shichao Jiao, Zhongyu Chen, Fengguang Xiong. 940-948 [doi]
- CHM: Context Hiding and Misguidance for Robust Adversarial Attacks on Active Speaker DetectionXiangyu Ye, Yatie Xiao, Qingxiao Guan, Zhenbang Liu. 949-957 [doi]
- HIRNet: Hypergraph-Induced Iterative Reasoning Network for Crowd CountingRuihan Wang, Mengqi Lei, Siqi Li 0001, Wei Bao. 958-966 [doi]
- Unveiling PEFT Robustness to Noisy Labels in VLMs: A Gradient-Loss Decoupling PerspectiveTengfei Ma, Weiran Pan, Wei Wei 0002. 967-976 [doi]
- Decoupling Multimodal Perception and Reasoning for Image Reasoning Segmentation with Large Language ModelsYiqing Shen 0003, Feng Chen. 977-985 [doi]
- Beyond Post-hoc Fusion: Rethinking Cross-Modal Interaction Timing in Few-Shot LearningLiang Yang, Hongyuan Xiao, Songtao He, Ye-Lin, Zhenchang Zhang. 986-995 [doi]
- GeoPro-Depth: Geometrically Consistent Prompting for Robust Metric Depth CompletionXun Fang, Zixuan Hua, Lihua Zhang 0002. 996-1005 [doi]
- A Unified Object-Centric Spatio-Temporal Graph Reasoning Framework for Audio-Visual Question AnsweringFeifei Xu, Wenjing Zhu, Dongyang Li, Puzhe Li, Luobin Huang, Yu Xie, Zirui Xu. 1006-1014 [doi]
- RainbowDreamer: Taming Semantic Controls for Attribute-Consistent Text-to-3D GenerationWeiyi Bu, Xiaodong Cun, Rui Yin 0001, Jiantao Yuan, Wei Qi. 1015-1024 [doi]
- Text4Radar-V2X: Text-guided 4D Radar for Cooperative 3D Object DetectionXiangyuan Peng, Kay Bierzynski, Lorenzo Servadei, Robert Wille. 1025-1034 [doi]
- Hierarchical Local-Global Context Modeling with Selective Modulation for Point Cloud Semantic SegmentationSongtao Li, Di Zheng, XiHua Zou. 1035-1044 [doi]
- SKG-VLA: Scene Knowledge Graph Priors for Structured Scene Semantics and Multimodal Reasoning for Decision MakingZeYu Li, Lei Li 0009. 1045-1054 [doi]
- C$^2$MOE: Consistency and Complementarity-guided Mixture of Experts for Incomplete Multimodal Emotion LearningYuntao Shou, Tao Meng, Wei Ai 0001, Keqin Li 0001. 1055-1063 [doi]
- PanoAdapter: Efficient Adaptation of Depth Foundation Models for Immersive Multimedia via Spherical RectificationWei Xue, Zhiyong Huo. 1064-1072 [doi]
- Teaching Audio-Language Models to Reason over TimeYufeng Xu, Yunjia Li, Hai Wang, Wei Li 0012. 1073-1082 [doi]
- Structure Aware Distillation for Multimodal Intent Understanding Under Missing ModalitiesLanlan Lu, Qimeng Yang, Yi Liu, Xinjun Pei, Jinmiao Song. 1083-1091 [doi]
- Context-Aware Interpretable Representations for Retrieval and Graph Convolutional Network ClassificationThiago César Castilho Almeida, Gustavo Rosseto Leticio, Vinicius Atsushi Sato Kawai, Daniel Carlos Guimarães Pedronette. 1092-1101 [doi]
- STeP-Net: A Spatio-Temporal Perception Network for Action DetectionKunfang Song, Guowei Yan, Jiaqing Wang, Shufen Ruan, Yanwen Wang. 1102-1110 [doi]
- Text-Guided Prototype Replay and Classifier Guidance for Incremental Few-Shot Semantic SegmentationLuofeng Zhang, Shengzhe You, Qian Shao, Yanjing Lei, Yu Liu, Fei Gao 0014. 1111-1119 [doi]
- Towards Robust Sparse-View 3D Gaussian Splatting via Hierarchical Depth and Multi-View ConsistencyJianhui Zheng, Zhiyong Huo, Jiahao Zheng. 1120-1127 [doi]
- CERA: Conflict-Explicit Reflective Agent for Multimodal Emotion ReasoningKejun Liu, Yuanyuan Liu, Ke Wang, Jiahao Zhang, Lei Xu, Chang Tang, Zhe Chen, Yibing Zhan. 1128-1137 [doi]
- PCMA: Prompt-guided Cross-domain Multi-prototype Alignment for Source-Free Domain AdaptationKaicheng Peng, Ya Li. 1138-1146 [doi]
- SAM3-LiteText: An Anatomical Study of the SAM3 Text Encoder for Efficient Vision-Language SegmentationChengxi Zeng, Yuxuan Jiang 0015, Ge Gao 0005, Shuai Wang 0054, Duolikun Danier, Bin Zhu 0006, Stevan Rudinac, David Bull 0001, Fan Zhang 0017. 1147-1156 [doi]
- HB-Mamba: Hierarchical Bi-directional State Space Modeling for LiDAR Semantic Segmentation in Autonomous DrivingWei Li 0315, Haiyun Guo, Manli Tao, Honghui Dong, Ming Tang 0001, Jinqiao Wang. 1157-1165 [doi]
- LTA-Gait: In-Network Temporal Activation of Large Vision Models for Gait RecognitionQichao Zhang, Genlang Chen, Chengcheng Jia, Jiajian Zhang. 1166-1173 [doi]
- Adaptive Knowledge Generation via Reinforcement-Guided Pattern Completion for Zero-Shot Visual Question AnsweringZhihui Sun, Diwei Su, Xiuxing Li, Qixin Wang 0004, Shihao Zhang 0001, Xia Wu 0001. 1174-1183 [doi]
- RMPL: Relation-aware Multi-task Progressive Learning with Stage-wise Training for Multimedia Event ExtractionYongkang Jin, Jianwen Luo, Jingjing Wang, Jianmin Yao 0001, Yu Hong 0001. 1184-1193 [doi]
- ESG-Rec: Enhancing Static-Graph Representations via Tri-view Contrastive Learning for Multimodal RecommendationWenfeng Li, Ru Wang 0001, Fuyong Xu, Guoshuai Yang, Peiyu Liu 0001. 1194-1202 [doi]
- GD-Head: Reconstructing High-quality 3D Avatar Head from a Single Image Using Geometry-guided Diffusion ModelsLeyuan Liu 0001, Xiaoqing Chen, Yufei Qian, Jingying Chen 0001. 1203-1212 [doi]
- HM-NVS: Hierarchical Multi-Modal Novel View Synthesis with Uncertainty-Aware Progressive RefinementJiahao Chang, Haohua Zhao 0001, Liqing Zhang 0001. 1213-1221 [doi]
- PSRNet: Progressive Semantic Refinement for Human Parsing via Text Conditioning and Embedding-Based CalibrationMing Meng, Hanwen Liu, Xingxing Xiang, Long Ye, Lei Zhang 0218, Zhaoxin Fan. 1222-1230 [doi]
- VAR-3D: View-aware Auto-Regressive Model for Text-to-3D Generation via a 3D TokenizerZongcheng Han, Yu Hong 0001, Haoran Sun, Dongyan Cao. 1231-1240 [doi]
- From Diffusion to Rectified Flow: Rethinking Text-Based SegmentationZishen Qu, Xuesong Li, Hongwei Kang, Haijian Gu, Quan Meng, Tianrui Niu, Xin Yang, Ruidong Pan. 1241-1250 [doi]
- Geometry-Guided Depth Correction for Metric Relative Pose EstimationShibin Xie, Hao Yin, Shuting Wang, Xiaokang Fang, Liang Jin, Haotian Liu, Yanting Zhang 0001, Shen Cai. 1251-1259 [doi]
- Learning Where to Embed: Noise-Aware Positional Embedding for Query Retrieval in Small-Object DetectionYangchen Zeng, Zhenyu Yu, Dongming Jiang, Wenbo Zhang, Yifan Hong 0001, Zhanhua Hu, Jiao Luo, Kangning Cui. 1260-1269 [doi]
- Time-Surface Self-Attention: Restoring Temporal Connectivity in Spiking TransformersTiantian Xiao, Xi Wu, Hongbin Lv, Daoyuan Wang. 1270-1278 [doi]
- RHVI-FDD: A Hierarchical Decoupling Framework for Low-Light Image EnhancementJunhao Yang, Chunguo Wu, Bo Yang 0002, Hongwei Ge, Yanchun Liang 0001, Heow Pueh Lee. 1279-1288 [doi]
- BSSNet: Block-Aware Serialized Spatial Learning for Robust Point Cloud RegistrationHang Li, Yulong Sun, Binhong Zhao, Feng Chen, Limei Hu. 1289-1297 [doi]
- Event-Centric Structural Modeling for Zero-Shot Video Moment RetrievalXin Li, Yongxiu Xu, Yuyao Kong, Hongbo Xu, Gaopeng Gou, Yubin Wang. 1298-1307 [doi]
- SliceCSRef: Dual-Level Semantic Alignment for Robust Speech Referring Expression ComprehensionLihong Huang, Sheng-hua Zhong, Qiao Yan, Zhijiao Xiao, Yan Liu 0004. 1308-1316 [doi]
- DenseSpeech: Dense Multi-Segment Temporal Grounding in Public Speaking VideosJiachen Tan, Tingting Zhang, Tao Zhou, Guangyao Su, Jianwei Fang, Bin Wu 0001, Chunping Zheng. 1317-1326 [doi]
- Evo-CuRL: Curriculum-Aware Reinforcement Learning over Code Lineage Graphs for Software Engineering ReasoningWei Tan, Yuanhao Li, Wenkai Liang. 1327-1335 [doi]
- MoiréNet: Leveraging Directional Priors for Compact Dual-Domain Image DemoiréingShuwei Guo, Simin Luan, John See, Zeyd Boukhers, Miho Ohsaki, Kimiaki Shirahama, Cong Yang. 1336-1345 [doi]
- QMTD: Query Vector Guided Multi-Scale Text DetectionZhiqiang You, Yutong Jiang, Shenguang Huang, Zhangjie Liu, Gaode Wu, Haoyu Wang. 1346-1354 [doi]
- ReNoRD: Learning from Relations under Noisy Pseudo Labels via Relational Distillation for Multimodal SentimentTiantai Zhai, Yan Zhuang 0002, Fuji Ren, Jiawen Deng, Liang Luo. 1355-1364 [doi]
- Dual-view Driver Gaze Estimation via Mutual EnhancementChengzheng Fu, Rong-Quan, Siyu Chen 0004, Yiming Ni, Jie Qin 0004. 1365-1374 [doi]
- KAN or MLP? Point Cloud Shows the Way ForwardYan Shi, Qingdong He, Yijun Liu 0012, Jingyong Su. 1375-1384 [doi]
- HD²FI-Net: Hierarchical Dual-Domain Fusion-Interaction Network for RGB-T Semantic SegmentationZhenrong Guo, Bowen Fei, Daqian Liu, Jiahao Zhang. 1385-1393 [doi]
- STAR-GS: Spatio-Temporal Geometry Alignment and Generative Refinement for Sparse-View 4D Gaussian SplattingYunqi Gao, Zhanfeng Liao, Dongbo Zhou, Leyuan Liu 0001. 1394-1403 [doi]
- STEP: Stable Gradient Projection for Continual LearningLonglong Zhai, Jiao Tian, Feng Yan, Lei Su, Yanjun Qin, Shaochen Jiang, Chong Peng 0001, Panpan Zheng. 1404-1412 [doi]
- Reflective Cross-Granularity Grounding with Preference Optimization for Long Video UnderstandingWei Feng, Xin Wang 0019, Hong Chen 0011, Yu-Wei Zhan, Zihan Song 0003, Bin Huang 0004, Kecheng Zheng, Wenwu Zhu 0001. 1413-1422 [doi]
- GlassSplat: Geometric Consistency and Pruning for Reflection-Free 3D Scene ReconstructionJingjiao You, Yuanyang Zhang, Yining Xu 0001, Yunjie Zhang, Li Yao 0003, Cunjian Chen, Tien-Tsin Wong. 1423-1431 [doi]
- VideoTG-R1: Boosting Video Temporal Grounding via Curriculum Reinforcement Learning on Reflected Boundary AnnotationsLu Dong 0005, Haiyu Zhang, Han Lin, Ziang Yan, Xiangyu Zeng 0004, Hongjie Zhang 0002, Yifei Huang 0006, Yi Wang 0033, Zhen-Hua Ling, Limin Wang 0002, Yali Wang 0001. 1432-1441 [doi]
- ICMF-Net: Interactive Cross-Modal Fusion with Attention and Selection Network for Remote Sensing Object DetectionKun Yao, Hao Zeng, Yida Wang, Ming Ma 0006. 1442-1449 [doi]
- DINOTrack: Leverage Differential Attention for Noise-Aware Visual Tracking with DINOv3Wei Xu, Gu Geng, Di Yuan 0002, Rui Chen, Qiao Liu 0001. 1450-1458 [doi]
- RaC-Stitch: Reliability-Aware Collaborative Smoothing for Unsupervised Video StitchingGuoliang Liu, Zhengwei Miao, Jianlin Zhang 0001, Haorui Zuo. 1459-1467 [doi]
- Beyond Over-Editing: Important Weight Constrained Knowledge Editing in Large Language ModelsZifeng Zhu, Yixian Dai, BingHui Guo, Hongwei Zheng, Yifan Sun, Zhaoxin Fan. 1468-1476 [doi]
- Toward General and Robust LLM-enhanced Text-attributed Graph LearningZihao Zhang, Xunkai Li, Rong-Hua Li 0001, Zhenjun Li, Bing Zhou, Guoren Wang. 1477-1485 [doi]
- BSR-CLIP: Background-Calibrated Structural Reasoning for Zero-Shot Visual-Language Anomaly DetectionShengchang Wang, Yue Han, Yongquan Xue, Jiao Li, Sizhe Tan, Yunfei Zhang, Liejun Wang, Panpan Zheng. 1486-1494 [doi]
- Query-Guided Conflict Inference and Incongruity-Aware Alignment for Implicit Hate Speech Detection in VideosShuo Liu, Jiakang Yu, Xun Zhu, Hongtao Deng, Yinxia Lou. 1495-1503 [doi]
- YDANet: Leveraging YCbCr Color Space and Dual-Path Attention Network for Depth CompletionJun Liu, Guoqiang Xiao 0001, Michael S. Lew, Song Wu 0003. 1504-1513 [doi]
- TCRS-QA: Training-Free Chain-of-Thought Reasoning for Shot-Aware Storyline Question Answering in Long-Form VideosZhenpeng Zeng, Xiaoyu Wu, Xuxu Wang, Qian Yu, Yudong Wang, Zihao Liu 0022. 1514-1522 [doi]
- SIGaze: Toward Pixel-Level Single-Instance Gaze Object PredictionDongxing Duan, Xu Liu, Jingyuan Xu, Ruijie Liu, Dan Guo 0001. 1523-1532 [doi]
- SparseStreet: Sparse Gaussian Splatting for Real-Time Street Scene SimulationQingpo Wuwu, Xiaobao Wei, Peng Chen 0046, Nan Huang, Zhongyu Zhao, Hao Wang 0073, Ming Lu 0002, Ningning Ma, Shanghang Zhang. 1533-1541 [doi]
- TD-CoT: Bridging the Holistic-Atomic Gap for Training-Free Temporal Reversal Detection in Video LVLMsPengfei Huang, Xuezhen Hou. 1542-1546 [doi]
- Efficient Music Denoising with Channel Attention and Multi-Scale Sequence EncodingSeungmin Ha, Wei Li 0012, Yulun Wu. 1547-1552 [doi]
- Robust Exemplar Prompt Learning via Bi-directional Visual-Semantic Alignment for Multi-Object TrackingLingyan Liang, Zhibin Zhang, Gang Dong, Dongchao Wen, Kaihua Zhang 0001. 1553-1557 [doi]
- LDCS-Net: Local Dual-Context Attention Network for 3D Semantic SegmentationShuang Guo, Ying Zhou, Meina Song, Huilin Ai, Jia-Long Li, Zi-Yang Chen. 1558-1562 [doi]
- CPD: Distilling Semantics in Feature Space via Class-Projection InteractionYingbin Wang, Jielei Wang, Qianxin Xia, Xuewan He, Guoming Lu. 1563-1567 [doi]
- Locate Core, Refine Path: A Training-Free Closed-Loop Paradigm for Referring Video Object SegmentationJizhe Yu, Hao Zhang, Xiya Bu, Yuhang Duan, Xiaoshuai Wu, Yu Liu 0035. 1568-1572 [doi]
- Joint-Guided Spatial and Semantic Sensitive Diffusion Policy for Robotic ManipulationHongda Zhang, Siao Liu, Yi Liu 0027, Chun Ouyang 0002, Zhongxue Gan. 1573-1577 [doi]
- LimbAug: Enhancing Virtual IMU Generalization in Human Activity Recognition via Learning Limb Movement DifferenceLingtao Huang, Chengshuo Xia. 1578-1582 [doi]
- UniDGF: A Unified Detection-to-Generation Framework for Hierarchical Object Visual RecognitionXinyu Nan, Lingtao Mao, Huangyu Dai, Zexin Zheng, Xinyu Sun, Zihan Liang 0001, Ben Chen 0004, Chenyi Lei. 1583-1587 [doi]
- BL-UDA: Towards Unsupervised Domain-Adaptive Surgical Instrument Segmentation with Source Box LabelsZiyuan Zhao, Yuhua Wang, Yifang Yin, Yichen Zhang 0002, XuLei Yang, Jun Cheng 0003, Roger Zimmermann, Cuntai Guan, S. Kevin Zhou. 1588-1592 [doi]
- PEGE: Monocular 6D Pose Estimation with Geometry-Aware Enhancements for Small ObjectsQianlei Wang, Kexun Chen, Yuhuang He, Xiaolin Qin. 1593-1597 [doi]
- Adaptive Multi-Agent Reasoning for Text-to-Video RetrievalJiaxin Wu 0001, Xiao-Yong Wei, Qing Li 0001. 1598-1607 [doi]
- MixCache: Mixture-of-Cache for Video Diffusion Transformer AccelerationYuanxin Wei, Lansong Diao, Bujiao Chen, Shenggan Cheng, Zhengping Qian, Wenyuan Yu, Nong Xiao 0001, Wei Lin 0016, Jiangsu Du. 1608-1617 [doi]
- Short-Length Hashing via Bit-Level Semantic Representation for Image-Text RetrievalQing Ma, Siyang Zhang, Yue Jiang, Cong Bai. 1618-1625 [doi]
- StepVAR: Structure-Texture Guided Pruning for Visual Autoregressive ModelsKeli Liu, Zhendong Wang, Wengang Zhou 0001, Houqiang Li. 1626-1634 [doi]
- HSS-Net: Hybrid State Space Modeling for Efficient Unified Adverse Weather RestorationYueqi Zhu, Baiwen Zhang, Guo Cheng, Yongkang Zhang, Feiran Liu, Er Cao, Meng Xu 0026. 1635-1643 [doi]
- Stillness is Redundant: Motion-Aware KV Cache Retrieval for Efficient Video UnderstandingJingru Li, Haowen Zheng. 1644-1652 [doi]
- Audit-and-Repair Indexing: Probabilistic Caption Indexes for Robust Multimodal RetrievalYangyang Liu. 1653-1661 [doi]
- Lookahead-R: Budget-Aware Tool Retrieval via Execution-Centric PlanningZongze Wu, Yani Guo, Runnan Li. 1662-1671 [doi]
- SA-Edit: Accelerating Editing Models via Test-time Spatial AccelerationYihao Song, Teng Hu, Ran Yi 0002, Xiaoning Lei, Bin Sheng 0001. 1672-1681 [doi]
- LP-VFedNN: A Lightweight and Lossless Privacy-Preserving Vertical Federated Learning Framework For Heterogeneous Neural Network Via Homomorphic Encryption and Intel SGXHan Sun, Liji Wu, Zixin Wang, Baisong Li, Huiping Zhuang, Weiping Wang, Yaoyi Deng, Mingxuan Li, Hailong Zhang 0001. 1682-1691 [doi]
- Uncertainty-Gated Generative Compression for Structure-Preserving Multimedia RetrievalYiming Ding, Ziang Chen, Jianguo Wei. 1692-1700 [doi]
- SHARP: Semantic Head-Aware Representation Pruning for Efficient MLLMsHaifeng Ma, Mingyue Guo 0001, Linhui Xiao, Qingfang Zheng, Qingming Huang. 1701-1705 [doi]
- Self-Supervised Video Hashing with Consistent Short-Term and Long-Range Temporal ModelingShuang Hu, Likai Yang, Xiaoping Liang, Zhenjun Tang. 1706-1710 [doi]
- GDT-VLM: Global Distribution Modeling for Visual Token Compression in Efficient Multimodal Large Language ModelsJiangtao Xie, Junjie Wu, ZhaoLin Zhang, Qilong Wang, Peihua Li. 1711-1715 [doi]
- An Energy-Efficient Multimodal Retrieval Framework for Inference on Heterogeneous Edge NodesJunfeng Fang, Yan Zhang, Mingyu Liu, Zhaoxi Feng, Manzhou Li, Yan Li. 1716-1720 [doi]
- Efficient Rationale-based Retrieval: On-policy Distillation from Generative Rerankers based on JEPATeng Chen, Sheng Xu, Feixiang Guo, Xiaoyu Wang, Qingqing Gu, Hongyan Li, Luo Ji. 1721-1729 [doi]
- What Drove Success at the 15th Video Browser Showdown? A Comprehensive Interaction-Logging AnalysisBastian Jäckl, Omar Shahbaz Khan, Benjamin Verner, Zuzana Vopálková, Udo Schlegel, Daniel A. Keim, Jakub Lokoc. 1730-1739 [doi]
- Ask-to-Retrieve: VQA-Guided Information-Gain Question Selection for Interactive Text-to-Image RetrievalShuaiwei Xie, Yating Yang, Bo Ma 0004, Xi Zhou 0007, Zhen Wang 0062, Ahtamjan Ahmat. 1740-1748 [doi]
- Agent-Based Query Reformulation: Simulating Feedback and Mitigating Negation Blindness in Interactive Image RetrievalHongyi Zhu 0004, Shuai Wang 0054, Jia-Hong Huang, Yixian Shen, Stevan Rudinac, Evangelos Kanoulas. 1749-1758 [doi]
- A Pruning-based Question-Answering for Interactive Video Search: A Simple BaselineYu Tong Cheng, Phuong Anh Nguyen 0002, Chong-Wah Ngo. 1759-1767 [doi]
- Evaluating Keyframe Layouts for Visual Known-Item Search in Homogeneous CollectionsBastian Jäckl, Jirí Kruchina, Lucas Joos, Daniel A. Keim, Ladislav Peska, Jakub Lokoc. 1768-1777 [doi]
- Optimization of Long-Running Media Aggregation QueriesSigurður Þórarinsson, Björn Þór Jónsson 0001, Omar Shahbaz Khan. 1778-1786 [doi]
- On the Effectiveness of Integration Methods for Multimodal Dialogue Response RetrievalSeongbo Jang, Seonghyeon Lee, Dongha Lee 0003, Hwanjo Yu. 1787-1792 [doi]
- Object Referring-Guided Scanpath Prediction with Perception-Enhanced Vision-Language ModelsRong-Quan, Yantao Lai, Dong Liang 0008, Jie Qin 0004. 1793-1797 [doi]
- FMD-AL: Cold-Start Active Learning based on Foundation ModelHuilin Ai, Ying Zhou, Zhonghua Peng, Ziyang Chen, Shuang Guo, Heng Xu, Zhiwei Yu, Jialong Li 0006. 1798-1802 [doi]
- VideoAgent: Personalized Synthesis of Scientific VideosXiao Liang, Bangxin Li, Zixuan Chen, Hanyue Zheng, Zhi Ma, Di Wang 0011, Cong Tian 0001, Quan Wang 0006. 1803-1811 [doi]
- FreSCo: Joint Frequency-Aware and Spatial Control for Image Zero-Shot Style TransferTingrun Chen, Xudong Ling, Shicai Wei, Guiduo Duan, Yue Zhang 0042. 1812-1821 [doi]
- Retrieval-Augmented Camera Control for Video DiffusionLining Wang, Hongxun Yao, Jinyu Zhang. 1822-1831 [doi]
- LayoutGD: Content-Aware Layout Generation via Graph-Enhanced Diffusion ModelXudong Zhou, Guozheng Li 0002, Chi Harold Liu. 1832-1841 [doi]
- NeRAG: Neuro-Explicit Retrieval-Augmented Generation for Real-Time Interaction in Digital HumansYueqian Guo, Tianzhao Li, Xin Lv, Jiehaolin Chen, Zhaohan Wang, Yurun Chen 0003, Sirui Xiao, Yezi He, Helin Li, Fan Zhang 0105. 1842-1850 [doi]
- Context Relation-Aware and Fine-Grained Token Interaction for Dialogue-Level Aspect-Based Sentiment Quadruple AnalysisJiahui Liu, Tao Sun, Zimeng Xu, Zhipeng Shen, Yifan Kong, Jiaao Zhou. 1851-1860 [doi]
- InterFold: Learning Interpretable Diffusion Manifolds Beyond Binary SamplesAlexander Vincent Lewi, Rainer Tan, Shengfeng He. 1861-1869 [doi]
- Toward Generation-Centric Coding: Compressing Latents representation for TI2V SynthesisJianran Liu, Wen Ji 0003, Xiaokai Meng, Wancai Zhang, Ying Wang. 1870-1878 [doi]
- Training for Identity, Inference for Controllability: A Unified Approach to Tuning-Free Face PersonalizationLianyu Pang, Ji Zhou, Qiping Wang 0004, Baoquan Zhao, Zhenguo Yang, Qing Li 0001, Xudong Mao. 1879-1888 [doi]
- Sticker-Enriched Empathetic Response Generation: A Role-Aware Pairing Benchmark and A Novel Multimodal FrameworkWei Zhang, Changhong Jiang, Lulu Wang, Mingting Yu, Siyuan Zhao, Ronghan Li. 1889-1898 [doi]
- Dual-Pathway Diffusion for Hand Correction in Synthetic Portraits: Global Context Aware and Local Structure RefinementYuShe Cao, Luoxi Jing, Yuanze Wang, Dianxi Shi, Chun Yu, Junliang Xing. 1899-1907 [doi]
- ExpPortrait: Novel Expression Generation for Fine-Grained Controllable Portrait AnimationHualiang Wei, Wenhui Li. 1908-1917 [doi]
- MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference OptimizationJianxuan Yang, Xiaoran Yang, Lipan Zhang, Xinyue Guo 0001, Zhao Wang, Gongping Huang. 1918-1926 [doi]
- Identity-Decoupled Anonymization for Visual Evidence in Multi-modal Retrieval-Augmented GenerationZehua Cheng, Wei Dai 0015, Jiahao Sun. 1927-1935 [doi]
- ComMark: Covert and Robust Black-Box Model Watermarking with Compressed SamplesYunfei Yang 0001, Xiaojun Chen 0004, Zhendong Zhao, Yu Zhou 0015, Xiaoyan Gu 0001, Juan Cao 0001. 1936-1945 [doi]
- Multimodal Deepfake Detection with Quantum State Inspired Analytic Incremental Adaptability LearningJianbin Ye, Man Xiao, Bo Liu 0014, Huaping Hu, Zijian Gao, Shaojing Fu, Kele Xu, Huaimin Wang 0001. 1946-1955 [doi]
- UAU-Net: Uncertainty-aware Representation Learning and Evidential Classification for Facial Action Unit DetectionYuze Li, Zhilei Liu. 1956-1964 [doi]
- Towards Generalized Image Manipulation Localization via Score-based ModelYunfei Wang 0001, Bo Du, Zhe Yang, Xin Liu, Zhiyu Lin, Tianxin Xu, Ji-Zhe Zhou 0001. 1965-1973 [doi]
- GMAE: Gated Multi-signal Adaptive Ensemble for Targeted Transfer Attacks on Commercial Large Vision-Language ModelsChengyin Hu, Yijun Chen, Tianle Liang, Yiwei Wei, Ang Li, Haitao Shi, Lingyan Bian, Xuelian Shi. 1974-1983 [doi]
- Preserving Texture in Chaos: Texture-Aware Deep Unfolding for Secure Compressed SensingHongying Zheng, Aijia Zhou, Di Xiao 0001. 1984-1993 [doi]
- Text Recovery Attacks and Defenses on Physical EnvelopesYongfei Tao, Yi Zhang, Runze Liao, Jingwei Qu, BingYao Huang. 1994-2002 [doi]
- Privacy Protection Against Personalized Text-to-Image Synthesis via Cross-image Consistency ConstraintsGuanyu Wang 0005, Kailong Wang 0001, Yihao Huang 0001, Mingyi Zhou, Geguang Pu, Li Li 0029. 2003-2011 [doi]
- AIFIND: Artifact-Aware Interpreting Fine-Grained Alignment for Incremental Face Forgery DetectionHao Wang 0035, Beichen Zhang, Yanpei Gong, Shaoyi Fang, Zhaobo Qi, Yuanrong Xu, Xinyan Liu 0008, Weigang Zhang. 2012-2021 [doi]
- Mitigating Hallucinations in Vision-Language Models via Contextual Entropy CalibrationXuanyu Yin, Daowan Peng, Wei Wei 0002. 2022-2031 [doi]
- Spatial-Frequency Domain Complementary Learning for Robust Cross-Modal HashingGang Zhou 0001, Shibiao Xu, Xiaolong Zheng. 2032-2040 [doi]
- Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language ModelsBin Zhu 0006, Yinxuan Gui, Huiyan Qi, Jingjing Chen 0001, Chong-Wah Ngo, Ee-Peng Lim. 2041-2049 [doi]
- Semantic-Guided Fast Adversarial Training via Class Relationship ExploitationYu Chen, Ke Wang, Fan Yang, Qiang Xu, Jinwei Chi, Honghao Wei. 2050-2058 [doi]
- MirageNet: A Secure, Efficient, and Scalable DNN Protection for Edge-Computing Multimedia RetrievalHuadi Zheng, Cheng Li, Xin Zhou, Wei Wang, Yuanhang Yu, Feng Wang 0050, Yan Ding. 2059-2067 [doi]
- Privacy-Constrained Low-Bit Representation Learning for Person Image RetrievalJunfeng Fang, Yan Zhang, Manzhou Li, Xinjin Ge, Yan Li, Weiyuan Cui. 2068-2076 [doi]
- TSAD: Trace-Semantic Adaptive Disentanglement for Detecting and Grounding Multi-Modal Media ManipulationWenzheng Liu, Cheng Fu, Hujin Peng, Junlong Wu, Xianhong Chen, Lan Huang, Jing Xu, Yixi Tian, Menghan Liang, Xiaofeng Wang 0002, Tan Deng, Wanwei Jiang, Xiang Li. 2077-2086 [doi]
- Structure-Induced Safety Gaps in Multimodal Reasoning SystemsMeng Yang 0019, Peirou Liang, Zhiqian Wu, Yong Liao 0003. 2087-2095 [doi]
- Content-Adaptive Implicit Neural Representations for Resolution-Agnostic Remote Sensing WatermarkingMinxi Li, Naen Xu, Hengyu An, Tianyu Du. 2096-2105 [doi]
- HiChrom-MAE: Frequency-Chromaticity Masked Autoencoding for Palmprint Presentation Attack DetectionQichao Xiong, Yiheng Huang, Junhong Chen, Zhanhong Liang, Lunke Fei. 2106-2114 [doi]
- Enhancing Deepfake Detection Reliability via Risk-Regulated Dual-Threshold Interval SelectionBoyao Wei, Ruixia Liu, Yinglong Wang 0001. 2115-2123 [doi]
- FairFBC: Scalable Fair Fuzzy Clustering via Group-Balanced Anchor GraphsTongzheng Zhao, Yan Chen, Peng Wu, Chao Wen, Peng Zhou, Liang Du. 2124-2132 [doi]
- Thinking in High-Frequency: Practical Defense for Deepfake Detectors Against Black-box Adversarial AttacksFuqiang Du, Min Yu 0001, Jianguo Jiang, Yixin Zhang, Yachao Liang, Meng Zhang, Weiqing Huang. 2133-2141 [doi]
- DocForensic: A VMamba-Wavelet Cross-Attention Network for Document Image Tampering LocalizationJiaxin Chen, Long Sun, Dengyong Zhang. 2142-2146 [doi]
- Revealing the Impact of Visual Text Style on Attribute-based Descriptions Produced by Large Visual Language ModelsXiaomeng Wang, Martha A. Larson, Zhengyu Zhao 0001. 2147-2151 [doi]
- ForgeryMoE: Mixture of Experts for Image Forgery Detection under JPEG CompressionDan Wu, Saihui Hou, Kang Yang, Jian Zhao 0006, Min Ren, Zhaofeng He 0001. 2152-2156 [doi]
- BiRNet: Bilateral-Attentive Refinement Network for Tampering Detection Across Manipulation ParadigmsZhiyao Xie, Tong Liu 0021, Jiahao Huang, Nuno Lourenço 0002, Xiaochen Yuan. 2157-2161 [doi]
- Risk-Aware Medical Question Answering as a Reliability-Critical Decision ProcessYueqin Luo, Yunfan Li 0003. 2162-2171 [doi]
- SNOC: Subtle Nested Objective Configuration for Joint Ultra-Low-Light Enhancement and Super-ResolutionJiaxin Gao 0001, Yaohua Liu, Danchen Cui, Zhihui Zhao. 2172-2181 [doi]
- Benchmarking MLLM-based Web Understanding: Reasoning, Robustness and SafetyJunliang Liu, Jingyu Xiao, Wenxin Tang, Zhixian Wang, Zipeng Xie, Wenxuan Wang 0001, Minrun Zhang, Shuangheng Yu. 2182-2190 [doi]
- Skeleton-Guided Spatio-Temporal Video Representation for Long-Term Action Quality AssessmentZhiwei Hong, Qing Lei, Hongbo Zhang 0002, Jixiang Du. 2191-2199 [doi]
- CompArt: Operationalizing Aesthetic Alignment in Text-to-Image Generation via Principles of ArtZhe Jin, Tat-Seng Chua. 2200-2209 [doi]
- VFGS-Net: Frequency-Guided State-Space Learning for Topology-Preserving Retinal Vessel SegmentationRuiqi Song, Lei Liu, Ya-Nan Zhang, Chao Wang, Xiaoning Li, Nan Mu. 2210-2218 [doi]
- Augmenting medical vision-language pretraining via domain-aware retrieval-augmented caption enrichmentXiaoyang Wei 0004, Camille Kurtz, Florence Cloppet. 2219-2227 [doi]
- SAND: Semantic-Aware Anomaly Detection with Region-Consistent Memory for Noisy TrainingKaixi Xu, Yuanyang Zhang, Yilong Liu, Zirui Luo, Yutong He, Li Yao 0003. 2228-2236 [doi]
- CoMemRet: Wood Surface Anomaly Detection Based on Multiview Contrastive Learning and Memory Bank RetrievalBangling Wang, Fengqi Hao, Jinqiang Bai, Huijuan Hao, Xiangjun Dong 0001, Dexin Ma, Hoiio Kong. 2237-2245 [doi]
- A-MAR: Agent-based Multimodal Art Retrieval for Fine-Grained Artwork UnderstandingShuai Wang 0054, Hongyi Zhu 0004, Jiahong Huang, Yixian Shen, Chengxi Zeng, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring. 2246-2255 [doi]
- GS³-ICL: Graph-Structured Sparse Selection with Invariance-Consistent Learning for multimodal SERYufan Zhou, Zhiyuan Ma, Lei Wang, Hongrui Ren, Zhuolun Zhong, Shangpeng Wang, Chenyuan Zhang, Haoran Yang 0007. 2256-2265 [doi]
- GAformer: Low-Light Image Enhancement Based on Gradient-Aware Kernel and Frequency-Modulated TransformerYifan Shuai, Ke Wang, Weiming Feng, Shuai Pang, Dehua Zhou, Yikui Zhai. 2266-2275 [doi]
- Chameleon: Benchmarking Detection and Backtracking on Commercial-Grade AI-Generated VideosXingming Liao, Meiyu Zeng, Canyu Chen, Nankai Lin, Zhuowei Wang 0001, Aimin Yang 0002. 2276-2285 [doi]
- EAD-Net: Emotion-Aware Talking Head Generation with Spatial Refinement and Temporal CoherenceYaHui Li, Yinfeng Yu, Liejun Wang, Shengjie Shen. 2286-2294 [doi]
- Coupling Frequency-domain Stepwise Enhancement and Statistical Moment Adjustment for Single Image DehazingXiaowen Chen, Guoqiang Xiao 0001, Michael S. Lew, Song Wu 0003. 2295-2304 [doi]
- OpenImplicit: Benchmarking Implicit Reasoning in MLLMs via Open-Ended EvaluationJidong Li, Xiaofei Yin, Ya Guo, Shuheng Zhou, Yi Tu, Haodong Zhao, Sufeng Duan, Gongshen Liu, Huijia Zhu. 2305-2313 [doi]
- Decoupling Vocal and Rhythmic Conditioning for Music-Driven Singing Avatar AnimationYiguo Jiang, Xiaodong Cun, Chen-Bin Feng, Jian Sun 0010, Chi-Man Pun. 2314-2322 [doi]
- TF-Count: A Training-Free Exemplar-Based Method for Class-Agnostic Cell Counting Using DINOv2Xiuze Dong, Maosheng He, Zhao Wang, Zhiqiang Liang, Yifan He. 2323-2332 [doi]
- Exploring Potential Knowledge Correlations of Disease Diagnosis with Partial LabelsNian Ai, Daizong Liu, Pan Zhou 0001. 2333-2342 [doi]
- PhysFlow: Frequency-Selective Flow Matching with Dual-Stream Expert Fusion for Remote PhotoplethysmographyYouchen Luo, Zhaodong Sun, Huiyu Yang, Wenye Geng, Yuwei Chen 0005, Xiaobai Li. 2343-2351 [doi]
- Sparse Implicit Connectivity Graphs with Scheduled Emotion History Sampling for Multimodal Emotion Recognition in ConversationFeng Li, Wen Luo, Bing Wang 0004, Yongwei Li. 2352-2360 [doi]
- MDHL-FND: Multi-Domain Hierarchical LoRA for Fake News DetectionLinfeng Ke. 2361-2370 [doi]
- DapQ-DiT: Distribution-Aware Post-Training Quantization for Efficient Generative Tasks in Diffusion TransformersLianwei Yang, Haokun Lin, Yichen Wu, Zhenan Sun, Qingyi Gu. 2371-2380 [doi]
- Multi-Scale Perception and Channel-Gated Fusion Network for Aerial Image DetectionJiaxin Chen, Zhixiang Zheng, Pei Yi, Dengyong Zhang, Yuxu Peng, Lei Wang. 2381-2389 [doi]
- Synergizing Agentic Data Generation and Efficient Representation Learning for Medical Cross-Modal UnderstandingLemin Cheng. 2390-2399 [doi]
- Anatomic-Decoupling Adaptation: A Unified Framework for Zero/Few-Shot Medical Anomaly DetectionZhihuan Lin, Fei Wang 0056, Weihong Cai, Hao Cai 0002. 2400-2408 [doi]
- MetaDB: Metadata-Guided Diffusion Bridge Model for High-Fidelity Medical Image SynthesisYanjun Chi, Keqiang Wang, Wei Huang, Wei Xu, Jiaen Liang, Jun Yu 0001. 2409-2417 [doi]
- Event-Based Token Sequences for Audio-Conditioned Music-Game Level ModelingKe Zhang, Chu-Hsuan Hsueh, Kokolo Ikeda. 2418-2427 [doi]
- Anime-2026: A Large-scale Anime Character Dataset for Anime-related AI TasksShijie Xuyang, Bingzhe Yu, Minyi Zhao, Guangze Li, Jihong Guan, Shuigeng Zhou. 2428-2437 [doi]
- Ivy-Fake: A Unified Explainable Framework and Benchmark for Image and Video AIGC DetectionChangjiang Jiang, Wenhui Dong, Zhonghao Zhang, Fengchang Yu, Wei Peng 0009, Xinbin Yuan, Yifei Bi, Ming Zhao, Zian Zhou, Chenyang Si, Caifeng Shan. 2438-2447 [doi]
- Data-Centric Multimodal Pavement Distress Detection Using Intensity-Range ImageryWenhan Tao, Yongsheng Bai, Feng Wang, Jelena Tesic. 2448-2456 [doi]
- RoDE: Linear Rectified Mixture of Diverse Experts for Food Large Multi-Modal ModelsPengkun Jiao, Xinlan Wu, Bin Zhu 0006, Jingjing Chen, Chong-Wah Ngo, Yu-Gang Jiang. 2457-2466 [doi]
- ImageNetion: Retrieval-as-Policy for Creative Gollin Figure Completion via Generative FeedbackDongjin Huang, Yichuan Liu, Jiantao Qu, Qinghang Wu. 2467-2476 [doi]
- MMG-RAG: Multimodal Graph RAG for Medical Report GenerationGang Liu 0021, Xiaotian Tang, Jiacheng Gan, Tianyu Ren, Tingyao Liu, Shenjun Zhong. 2477-2485 [doi]
- CLIP-SegFusion: An Attention-Guided Feature Fusion Framework for Multi-Level Detection on AI-Generated ArtworksYuqian Zheng, Hyeongjin Ahn, Juyeob Lee, Eunil Park. 2486-2495 [doi]
- Depth-Guided Perception and Policy-Driven Adaptation for Wind Turbine Anomaly DetectionJing Guo, Baoqi Huang, Qing Miao, Bing Jia, Runze Yang. 2496-2504 [doi]
- Fine-Grained Cross-Modal Retrieval in Art via Region-Level Grounding of Symbolic NarrativesMihai-Bogdan Bîndila, Shenghui Wang 0001, Gwenn Englebienne. 2505-2514 [doi]
- DynBrush: Structure-Aware and Style-Adaptive Transfer for Traditional Chinese Landscape RenderingHangshen Nong, Mingyuan Ge, Mingyong Li. 2515-2523 [doi]
- ICSGDiff: A Multimodal Structure-Aware Diffusion Network for Restoring Ancient Bamboo SlipsYouxin Liao, Jiahao Zhang, Guang Long, Yueran Wang, Ying Qi, Chenyang Wang, Qiang Zhang 0049, Shanxiong Chen. 2524-2532 [doi]
- TR-GLP: A Two-Stage Framework with Temporal Reprogramming and Residual Graph Label Propagation for Short Video Fake News DetectionJunjiang Chen, Wenzhong Yang, Yabo Yin, Hongzhen Lv, Fuyuan Wei, Jingfeng He, Zongxu Luo, Junhang Wu. 2533-2542 [doi]
- CB-CV: A Cluster-Based Cross-Validation Benchmark for Multimodal Video Out-of-Distribution DetectionJi Zhang, Xiao Luo, Hang Zhou 0008. 2543-2551 [doi]
- LLM-Guided Secure Federated Visual Prompts with Deep Unfolding for MRI ReconstructionDi Xiao, Yuhan Gou, Yu Ren, Shijia Xu, Yue Zhang. 2552-2560 [doi]
- ATRIE: Adaptive Tuning for Robust Inference and Emotion in Persona-Driven Speech SynthesisAoduo Li, Haoran Lv, Hongjian Xu, Shengmin Li, Sihao Qin, Zimeng Li, Chi-Man Pun, Xuhang Chen 0002. 2561-2570 [doi]
- Progressive High-Confidence Pseudo-Labeling for Unsupervised Cross-View Image Geo-LocalizationLong Yu 0003, Chunfang Yang, Ma Zhu, Xu Wang 0046, Yang Pei. 2571-2579 [doi]
- Explainable Multimodal Modeling with KANs for Urban EV Charging Demand ForecastingYi Zhao, Qianqian Ren, Boyuan Wang, Hui Xu. 2580-2587 [doi]
- VietFashion: Benchmarking Sketch-Text Composed Image Retrieval for Cultural OutfitsHoang-Nguyen Cao, Le-Hoang Bui, Dinh-Khoi Vo, Minh-Triet Tran, Trung-Nghia Le. 2588-2596 [doi]
- Multi-Modal 3D Object Detection in Autonomous Driving: A New SurveyPeng Zhang, Xin Lin. 2597-2606 [doi]
- Asymmetric Pipeline for Dataset Construction and Situation-aware Generative Outfit Retrieval Leveraging Differences in Task DifficultyYuma Oe, Katsumi Tanaka, Yoshiyuki Shoji. 2607-2615 [doi]
- TrackNetV6: A Unified Framework for Lightweight and Robust Fast-Moving Tiny Ball TrackingJizhe Yu, Xiya Bu, Yu Liu 0035, Kaiping Xu, Yifei Cao, Zhizhen Li. 2616-2625 [doi]
- NIGCL: Neuro-Image Geometric Contrastive Learning for Robust EEG-Based Visual RetrievalXueru Zhao, Yanrong Hao, Xin Wen 0008, Mengni Zhou, Jing Bian, Rui Cao. 2626-2635 [doi]
- ClearNight: Synergistic Dual-Prior Aggregation for Nighttime Image DehazingYiqiang Zhou, Xindan Gao, Jifeng Guo, Yanfeng Qiao, Yan Chen, Guang Li, Lu Wang. 2636-2645 [doi]
- HCG-MPB: Hierarchical Complementary Gating Mechanism with Multimodal Pattern Bank for Hateful Video DetectionHongxia Sun, Wenzhong Yang, Yabo Yin, Fuyuan Wei, Junhang Wu, Junjiang Chen. 2646-2655 [doi]
- Focal-RegionFace: Generating Fine-Grained Multi-attribute Descriptions for Arbitrarily Selected Face Focal RegionsKaiwen Zheng 0002, Junchen Fu, Songpei Xu, Yaoqin He, Joemon M. Jose, Hu Han 0001, Xuri Ge. 2656-2665 [doi]
- TG-MUNet: A Lightweight Text-Guided Mamba Unet for Semi-Supervised Medical Image SegmentationFeng Li, Chen Sun, Bing Wang 0004, Zongyu Xie. 2666-2675 [doi]
- Flickr-ABS: A Benchmark for Abstract Intent in Image-Text RetrievalTianyuan Li, Lei Wang, Yating Yang, Rui Dong, Ahtamjan Ahmat, Bangju Han, Zhijie Li. 2676-2684 [doi]
- DDL-Net: A Task-Balanced Panoptic Perception Network with Channel-Reorganized Attention in Autonomous DrivingBowei Fang, Yunyi Tang, Wentao Mu, Wenbo Liu 0006, Fei Yan 0006, Tao Deng 0002. 2685-2693 [doi]
- Blazer: Encrypted Video Traffic Identification for Mixed Segment Transmission Pattern based on LLMWeitao Tang, Meijie Du, Die Hu 0004, Shu Li, Zhao Li 0010, Rong Yang 0008, Qingyun Liu 0001. 2694-2703 [doi]
- Beyond Semantic Understanding: Physics-Informed Adaptation of Video Foundation Models for Precision Industrial MetrologyJiahao Chang, Haohua Zhao 0001, Liqing Zhang 0001. 2704-2713 [doi]
- Assessing Color Vision Test in Large Vision-language ModelsHongfei Ye, Bin Chen 0006, Wenxi Liu, Yu Zhang 0296, Zhao Li 0007, Dandan Ni, Hongyang Chen 0001. 2714-2722 [doi]
- SPGR: Semantic Purification and Geometric Routing for Fake Short-Video DetectionShaojie Hu, Yong Liu, Xiaoguang Zhang. 2723-2731 [doi]
- SlimNet: High-Quality and Efficient Object Removal by Eliciting Latent Capabilities of Diffusion ModelsXiao Ma, Jin Yuan, Yao Zhang 0010, Cheng Zhong, Zhongchao Shi, Jianping Fan 0007, Guihua Zeng. 2732-2740 [doi]
- Entropy-aware Mutual Student Co-training for Source-free Domain Adaptation in Medical Image SegmentationGuangrun Chen, Xiaoli Yang, Litan Sun, Ming Jin, Xiaofeng Qu, Sijie Niu. 2741-2750 [doi]
- SCORE: Soccer Curriculum for Ordinal Affect Recognition with EvidenceXiaofeng Shen, Ze Rong, Haoyang Qin, Binhao Zhao, Yue Xu, Lei Ma. 2751-2759 [doi]
- EC-RAG: Evidence-Centric Retrieval-Augmented Generation for Medical Visual Question AnsweringSongming Li, Jun Long. 2760-2767 [doi]
- VAV-R1: Difficulty-Aware Multimodal Reasoning for Video Anomaly ValidationJiang Liu, Yuhang Liu, Juan Yang, Qianhao Ren, Yutong Wang 0001, Zhongjiang He, Jingmin Xin, Hao Sun. 2768-2772 [doi]
- HSAMoE: Hemiparetic-Side-Aware Mixture of Experts for EEG-Based Motor Imagery Classification in Stroke PatientsMin Feng, Sheng-hua Zhong, Tianhao Gao, Rongrong Lu. 2773-2777 [doi]
- Efficient Video Anomaly Detection for Edge Devices via Background Feature CachingZhibo Zhang, Lin Zhao 0003, Wenyan Xing, Di Wang 0011, Chen Gong 0002, Le Zhang. 2778-2782 [doi]
- Centripetal-Scale Coupling and Sparsity-Guided Label Assignment for Tiny Object Detection in Steppe Rathole MonitoringLei Xu, Ru Li, Chunyu Zhao, Jiaqiang Zhang. 2783-2787 [doi]
- FSGD-Det: Frequency-Spectrum-Guided Dehazing for Aerial Object Detection in Hazy ImagesMin Dang, Gang Liu 0006, Zhaolu Zheng, Luyi Qiu, Zihao Li, Jing Liu 0007. 2788-2792 [doi]
- Zero-Effort Image-to-Music Generation: An Interpretable RAG-based VLM ApproachZijian Zhao, Dian Jin, Zijing Zhou. 2793-2797 [doi]
- Uncovering Frequency Cues for Robust Event-Based UAV DetectionXinyu Li, Wenjun Zhu, Xiaoyu Ji 0001, Wenyuan Xu 0001. 2798-2802 [doi]
- TrinitySeg: A Benchmark and Baseline for Monochrome NIR Smoke SegmentationHaowen Hua, Zeyi Shao, Shuwei Guo, John See, Zeyd Boukhers, Miho Ohsaki, Kimiaki Shirahama, Cong Yang. 2803-2807 [doi]
- Stat-SAM: Learning Global Echo-Intensity Priors as Prompts for SAM in Ultrasound Image SegmentationJuan Chen, Yang Wu, Lei Guo, Wenping Ge, Jie Ma. 2808-2812 [doi]
- Topology-Guided Feature Integration for Structured Object DetectionJiayi Ding, Libo Liu, Ruonan Zhang 0002. 2813-2817 [doi]
- Retrieval of LoRA Models based on Layer-Wise Weight Embedding without MetadataYuro Kanada, Yuma Oe, Huu-Long Pham, Makoto P. Kato, Hiroaki Ohshima, Sumio Fujita, Yoshiyuki Shoji. 2818-2825 [doi]
- Beyond Optical Flow: Latent Micro-Motion as Visual Evidence in UAV VideoBo-Wen Zhang 0011, Zhou Wang, Songlu Chen, Chun Yang, Xiaobin Zhu 0001, Xu-Cheng Yin. 2826-2832 [doi]
- Towards Self-Evolving Knowledge Systems: Enhancing Multimodal Agentic RAG with Hyperbolic FlowsTendai Mukande, Noel E. O'Connor. 2833-2841 [doi]
- Real-Time Monitoring and Analysis of Rehabilitation Exercises from a Smartphone Camera Video StreamMiriama Jánosová, Andrej Cernek, Radovan Dvorský, Vasil Poposki, Petra Budíková, Jan Sedmidubský. 2842-2846 [doi]
- Keep Your Memories, Lose the Evidence: Privacy-Aware LifeloggingAllie Tran. 2847-2851 [doi]
- VideoCreator: An Agentic System for Multi-turn Video ProductionZhengyang Liang, Yan Shu, Cathal Gurrin, Nicu Sebe, Lizi Liao. 2852-2856 [doi]
- TrackAnon: Towards Consistent Full-Body AnonymizationEmil Leidland, Duc-Tien Dang-Nguyen. 2857-2861 [doi]
- Discovery of Visually Novel Content in Developing News StoriesStefan J. Arzberger, Helmut Neuschmied, Werner Bailer. 2862-2866 [doi]
- Realistic Virtual Flood Experience System Using 360° Videos and 3D City Models Constructed from Building FootprintsTatsuro Banno, Koki Kawada, Mizuki Takenawa, Masatoshi Denda, Kiyoharu Aizawa. 2867-2871 [doi]
- Context-Aware Visual Redaction Pipeline: Leveraging Vision-Language Models for High-Fidelity Content InpaintingArun George Zachariah, Barnaby Simkin, Nikki Pope, Jibin Varghese, Michael Boone. 2872-2876 [doi]
- The 2026 Grand Challenge on Multimedia Verification: Overview and Key DirectionsDuc-Tien Dang-Nguyen, Kha-Luan Pham, Minh-Anh Pham, Silje Førsund, Henrik Brattli Vold, Minh-Triet Tran, Anh Duy Tran. 2877-2881 [doi]
- DeepVerify: The End-to-end Software for Evidence-Based Multi-Modal Online Information Verification with Explainable ReasoningHoang-Quoc Nguyen-Son, Tung-Duong Le-Duc, Quynh-Huong Dinh-Nguyen, Hai-Chau Nguyen-Le, Anh Duy Tran, Minh-Son Dao. 2882-2886 [doi]
- Contestable Multi-Agent Debate with Arena-based Argumentative Computation for Multimedia VerificationHung Truong Thanh Nguyen, Vo Thanh Khang Nguyen, Hoang-Loc Cao, Phuc Ho, Van Pham, Hung Cao. 2887-2891 [doi]
- MOSAIV: Multi-Agent LLM Swarms for Automated Multimedia News Verification: Fake News DetectionMuhammad Shahid Muneer, Khoa Van Tran, Van Tuan Nguyen, Simon S. Woo. 2892-2896 [doi]
- Detecting Distribution Shifts In the Wild: Techniques and Future PerspectivesBo Peng. 2897-2898 [doi]
- Fairness in Information Retrieval: An Economic PerspectiveChen Xu 0010, Clara Rus, Yuanna Liu, Marleen de Jonge, Jun Xu 0001, Maarten de Rijke. 2899-2900 [doi]
- Understanding Art & CulturePiera Riccio, Selina Khan, Ludovica Schaerf, Shuai Wang 0054, Tiancheng Liu, Athanasios Efthymiou, Noa Garcia, Nanne van Noord. 2901-2903 [doi]
- Introduction to the 9th Annual Lifelog Search Challenge, LSC'26Allie Tran, Werner Bailer, Duc-Tien Dang-Nguyen, Graham Healy, Steve Hodges 0001, Björn Þór Jónsson 0001, Wolfgang Hürst, Luca Rossetto, Klaus Schoeffmann, Minh-Triet Tran, Liting Zhou, Cathal Gurrin. 2904-2905 [doi]
- Toward Trustworthy Vision-language Models in the Wild: Theory, Algorithm and ApplicationBo Peng, Xuefeng Du, Zhen Fang 0001. 2906-2907 [doi]
- The 7th International Workshop on Intelligent Cross-Data Analysis and RetrievalMinh-Son Dao, Duc-Tien Dang-Nguyen, Son N. Tran. 2908-2909 [doi]
- The 5th ACM International Workshop on Multimedia AI against Disinformation (MAD'26)Dan-Cristian Stanciu, Symeon Papadopoulos, Giorgos Kordopatis-Zilos, Bogdan Ionescu, Adrian Popescu 0001, Roberto Caldelli, Milica Gerhardt, Vera Schmitt. 2910-2913 [doi]
- User Influence Characterization and Market Event Attribution via GNN-LLM Collaboration in Financial NetworksYunming Hui. 2914-2917 [doi]
- Semantic-Anchored Multi-State Retrieval for Robust 3D PerceptionDi Dai, Bo Liu, Liwei Wang 0001. 2918-2926 [doi]
- Object pose estimation for upper-limb prostheses graspingAnder Etxezarreta. 2927-2930 [doi]
- Towards Scalable and Adaptive Multi-Teacher Distillation for Text-to-Video RetrievalToya Oyama. 2931-2934 [doi]