Abstract is missing.
- Beyond Low-Rank Tuning: Model Prior-Guided Rank Allocation for Effective Transfer in Low-Data and Large-Gap RegimesChuyan Zhang, Kefan Wang, Yun Gu. 1-10 [doi]
- Nautilus: Locality-Aware Autoencoder for Scalable Mesh GenerationYuxuan Wang, Xuanyu Yi, Haohan Weng, Qingshan Xu 0001, Xiaokang Wei, Xianghui Yang, Chunchao Guo, Long Chen 0016, Hanwang Zhang. 1-10 [doi]
- MUNBa: Machine Unlearning Via Nash BargainingJing Wu 0021, Mehrtash Harandi. 1-12 [doi]
- ETA: Energy-Based Test-Time Adaptation for Depth CompletionYounjoon Chung, Hyoungseob Park, Patrick Rim, Xiaoran Zhang, Jihe He, Ziyao Zeng, Safa Cicek, Byung-Woo Hong, James S. Duncan, Alex Wong 0001. 1-12 [doi]
- From Prompt to Progression: Taming Video Diffusion Models for Seamless Attribute TransitionLing Lo, Kelvin C. K. Chan, Wen-Huang Cheng, Ming-Hsuan Yang 0001. 1-10 [doi]
- MMCR: Benchmarking Cross-Source Reasoning in Scientific PapersYang Tian, Zheng Lu, Mingqi Gao 0004, Zheng Liu, Bo Zhao. 1-10 [doi]
- The Best of Both Worlds: Integrating Language Models and Diffusion Models for Video GenerationAoxiong Yin, Xu Tan 0003, Kai Shen, Yichong Leng, Xinyu Zhou, Juncheng Li 0006, Siliang Tang. 1-12 [doi]
- Weakly-Supervised Learning of Dense Functional CorrespondencesStefan Stojanov, Linan Zhao, Yunzhi Zhang, Daniel L. K. Yamins, Jiajun Wu 0001. 1-13 [doi]
- Counting Stacked ObjectsCorentin Dumery, Noa Etté, Aoxiang Fan, Ren Li, Jingyi Xu, Hieu Le 0001, Pascal Fua. 1-10 [doi]
- Princeton365: A Diverse Dataset with Accurate Camera PoseKarhan Kayan, Stamatis Alexandropoulos, Rishabh Jain, Yiming Zuo 0001, Erich Liang, Jia Deng 0001. 1-10 [doi]
- FedMVP: Federated Multimodal Visual Prompt Tuning for Vision-Language ModelsMainak Singha, Subhankar Roy, Sarthak Mehrotra, Ankit Jha, Moloud Abdar, Biplab Banerjee, Elisa Ricci 0001. 1-10 [doi]
- TAR3D: Creating High-Quality 3D Assets Via Next-Part PredictionXuying Zhang, Yutong Liu, Yangguang Li 0001, Renrui Zhang, Yufei Liu, Kai Wang 0001, Wanli Ouyang, Zhiwei Xiong, Peng Gao 0007, Qibin Hou, Ming-Ming Cheng. 1-12 [doi]
- Vivid4D: Improving 4D Reconstruction from Monocular Video by Video InpaintingJiaxin Huang 0012, Sheng Miao, Bangbang Yang, Yuewen Ma, Yiyi Liao. 1-13 [doi]
- Class-Wise Federated Averaging for Efficient PersonalizationGyuejeong Lee, Daeyoung Choi. 1-10 [doi]
- Diversity-Enhanced Distribution Alignment for Dataset DistillationHongcheng Li, Yucan Zhou, Xiaoyan Gu 0001, Bo Li 0063, Weiping Wang 0005. 1-10 [doi]
- Balanced Image Stylization with Style Matching ScoreYuxin Jiang, Liming Jiang 0001, Shuai Yang 0001, Jia-Wei Liu, Ivor W. Tsang, Mike Zheng Shou. 1-10 [doi]
- EA-Vit: Efficient Adaptation for Elastic Vision TransformerChen Zhu, Wangbo Zhao, Huiwen Zhang, Yuhao Zhou 0004, Weidong Tang, Shuo Wang 0001, Zhihang Yuan, Yuzhang Shang, Xiaojiang Peng, Kai Wang 0036, Dawei Yang. 1-10 [doi]
- Describe, Don't Dictate: Semantic Image Editing with Natural Language IntentEn Ci, Shanyan Guan, Yanhao Ge, Yilin Zhang, Wei Li, Zhenyu Zhang 0005, Jian Yang 0003, Ying Tai. 1-10 [doi]
- A Hyperdimensional One Place Signature to Represent Them All: Stackable Descriptors for Visual Place RecognitionConnor Malone, Somayeh Hussaini, Tobias Fischer 0001, Michael Milford. 1-12 [doi]
- Moment Quantization for Video Temporal GroundingXiaolong Sun, Le Wang 0003, Sanping Zhou, Liushuai Shi, Kun Xia, Mengnan Liu 0001, Yabing Wang, Gang Hua 0001. 1-10 [doi]
- Iris: Breaking GUI Complexity with Adaptive Focus and Self-RefiningZhiqi Ge, Juncheng Li 0006, Xinglei Pang, Minghe Gao, Kaihang Pan, Wang Lin, Hao Fei 0001, Wenqiao Zhang, Siliang Tang, Yueting Zhuang. 1-10 [doi]
- Hierarchical-Aware Orthogonal Disentanglement Framework for Fine-Grained Skeleton-Based Action RecognitionHaochen Chang, Pengfei Ren 0001, Haoyang Zhang, Liang Xie 0012, Hongbo Chen, Erwei Yin. 1-10 [doi]
- GT-Loc: Unifying When and Where in Images Through a Joint Embedding SpaceDavid G. Shatwell, Ishan Rajendrakumar Dave, Sirnam Swetha, Mubarak Shah. 1-11 [doi]
- MGSfM: Multi-Camera Geometry Driven Global Structure-from-MotionPeilin Tao, Hainan Cui, Diantao Tu, Shuhan Shen. 1-10 [doi]
- COVTrack: Continuous Open-Vocabulary Tracking via Adaptive Multi-Cue FusionZekun Qian, Ruize Han, Zhixiang Wang, Junhui Hou, Wei Feng 0005. 1-10 [doi]
- LLM-Enhanced Action-Aware Multi-Modal Prompt Tuning for Image-Text MatchingMengxiao Tian, Xinxiao Wu, Shuo Yang 0002. 1-10 [doi]
- Debiased Curriculum Adaptation for Safe Transfer Learning in Chest X-Ray ClassificationMingyang Liu, Xinyang Chen 0001, Yang Shu 0001, Xiucheng Li, Weili Guan, Liqiang Nie. 1-10 [doi]
- FDPT: Federated Discrete Prompt Tuning for Black-Box Visual-Language ModelsJiaQi Wu, Simin Chen, Jing Tang, Yuzhe Yang, Yiming Chen, Lixu Wang, Song Lin, Zehua Wang, Wei Chen, Zijian Tian. 1-10 [doi]
- LeGrad: An Explainability Method for Vision Transformers via Feature Formation SensitivityWalid Bousselham, Angie W. Boggust, Sofian Chaybouti, Hendrik Strobelt, Hilde Kuehne. 1-10 [doi]
- OphCLIP: Hierarchical Retrieval-Augmented Learning for Ophthalmic Surgical Video-Language PretrainingMing Hu, Kun Yuan 0004, Yaling Shen, Feilong Tang, Xiaohao Xu, Lin Zhou, Wei Li 0320, Ying Chen, Zhongxing Xu, Zelin Peng, Siyuan Yan, Vinkle Srivastav, Diping Song, Tianbin Li, Danli Shi, Jin Ye 0002, Nicolas Padoy, Nassir Navab, Junjun He, ZongYuan Ge. 1-12 [doi]
- RoboPearls: Editable Video Simulation for Robot ManipulationTang Tao, Likui Zhang, Youpeng Wen, Kaidong Zhang, Jia-Wang Bian, Xia Zhou, Tianyi Yan, Kun Zhan, Peng Jia 0007, Hefeng Wu, Liang Lin, Xiaodan Liang. 1-12 [doi]
- Geminio: Language-Guided Gradient Inversion Attacks in Federated LearningJunjie Shan, Ziqi Zhao, Jialin Lu, Rui Zhang, Siu-Ming Yiu, Ka Ho Chow. 1-10 [doi]
- Correspondence as Video: Test-Time Adaption on SAM2 for Reference Segmentation in the WildHaoran Wang, Zekun Li 0010, Jian Zhang 0090, Lei Qi 0001, Yinghuan Shi. 1-10 [doi]
- Variance-Based Pruning for Accelerating and Compressing Trained NetworksUranik Berisha, Jens Mehnert, Alexandru Paul Condurache. 1-10 [doi]
- TITAN-Guide: Taming Inference-Time Alignment for Guided Text-to-Video Diffusion ModelsChristian Simon, Masato Ishii, Akio Hayakawa, Zhi Zhong, Shusuke Takahashi, Takashi Shibuya 0001, Yuki Mitsufuji. 1-10 [doi]
- PINO: Person-Interaction Noise Optimization for Long-Duration and Customizable Motion Generation of Arbitrary-Sized GroupsSakuya Ota, Qing Yu, Kent Fujiwara, Satoshi Ikehata, Ikuro Sato. 1-10 [doi]
- Target Bias Is All You Need: Zero-Shot Debiasing of Vision-Language Models With Bias CorpusTaeuk Jang, Hoin Jung, Xiaoqian Wang 0001. 1-12 [doi]
- What Makes for Text to 360-Degree Panorama Generation with Stable Diffusion?Jinhong Ni, Chang-Bin Zhang, Qiang Zhang, Jing Zhang. 1-10 [doi]
- Exploring View Consistency for Scene-Adaptive Low-Light Light Field Image EnhancementShuo Zhang, Chen Gao, Youfang Lin. 1-10 [doi]
- ODP-Bench: Benchmarking Out-Of-Distribution Performance PredictionHan Yu 0009, Kehan Li, Dongbai Li, Yue He 0001, Xingxuan Zhang, Peng Cui 0001. 1-13 [doi]
- DC-AE 1.5: Accelerating Diffusion Model Convergence with Structured Latent SpaceJunyu Chen 0003, Dongyun Zou, Wenkun He, Junsong Chen, Enze Xie, Song Han 0003, Han Cai. 1-10 [doi]
- A Linear N-Point Solver for Structure and Motion from Asynchronous TracksHang Su, Yunlong Feng, Daniel Gehrig, Panfeng Jiang, Ling Gao 0001, Xavier Lagorce, Laurent Kneip. 1-10 [doi]
- Geometrycrafter: Consistent Geometry Estimation for Open-World Videos With Diffusion PriorsTian-Xing Xu, Xiangjun Gao, Wenbo Hu 0002, Xiaoyu Li 0002, Song-Hai Zhang, Ying Shan. 1-13 [doi]
- WorldScore: A Unified Evaluation Benchmark for World GenerationHaoyi Duan, Hong-Xing Yu, Sirui Chen, Li Fei-Fei 0001, Jiajun Wu 0001. 1-12 [doi]
- ExploreGS: Explorable 3D Scene Reconstruction with Virtual Camera Samplings and Diffusion PriorsMinsu Kim, Subin Jeon, In Cho, Mijin Yoo, Seon Joo Kim. 1-10 [doi]
- Scaling Language-Free Visual Representation LearningDavid Fan 0001, Shengbang Tong, Jiachen Zhu 0002, Koustuv Sinha, Zhuang Liu 0003, Xinlei Chen, Michael Rabbat, Nicolas Ballas, Yann LeCun, Amir Bar, Saining Xie. 1-13 [doi]
- High-Resolution Spatiotemporal Modeling with Global-Local State Space Models for Video-Based Human Pose EstimationRunyang Feng, Hyung Jin Chang, Tze Ho Elden Tse, Boeun Kim, Yi Chang 0001, Yixing Gao. 1-10 [doi]
- RESCUE: Crowd Evacuation Simulation via Controlling SDM-United CharactersXiaolin Liu, Tianyi Zhou, Hongbo Kang, Jian Ma, Ziwen Wang, Jing Huang, Wenguo Weng, Yu-Kun Lai, Kun Li 0001. 1-10 [doi]
- Vector Contrastive Learning for Pixel-Wise Pretraining in Medical VisionYuting He, Shuo Li. 1-11 [doi]
- Trade-Offs in Image Generation: How Do Different Dimensions Interact?Sicheng Zhang, Binzhu Xie, Zhonghao Yan, Yuli Zhang, Donghao Zhou, Xiaofei Chen, Shi Qiu, Jiaqi Liu, Guoyang Xie, Zhichao Lu. 1-12 [doi]
- FIND: Few-Shot Anomaly Inspection with Normal-Only Multi-Modal DataYiting Li, Fayao Liu, Jingyi Liao, Sichao Tian, Chuan-Sheng Foo, XuLei Yang. 1-10 [doi]
- Spatial-Temporal Aware Visuomotor Diffusion Policy LearningZhenyang Liu, Yikai Wang 0002, Kuanning Wang, Longfei Liang, Xiangyang Xue 0001, Yanwei Fu 0001. 1-10 [doi]
- Decoding Correlation-Induced Misalignment in the Stable Diffusion Workflow for Text-to-Image GenerationYunze Tong, Fengda Zhang, Didi Zhu, Jun Xiao 0001, Kun Kuang 0001. 1-10 [doi]
- Denoising Token Prediction in Masked Autoregressive ModelsTing Yao 0003, Yehao Li, Yingwei Pan, Zhaofan Qiu, Tao Mei 0001. 1-10 [doi]
- SAGI: Semantically Aligned and Uncertainty Guided AI Image InpaintingPaschalis Giakoumoglou, Dimitrios Karageorgiou, Symeon Papadopoulos, Panagiotis C. Petrantonakis. 1-12 [doi]
- Understanding Personal Concept in Open-Vocabulary Semantic SegmentationSunghyun Park 0005, Jungsoo Lee, Shubhankar Borse, Munawar Hayat, Sungha Choi, Kyuwoong Hwang, Fatih Porikli. 1-10 [doi]
- CoTracker3: Simpler and Better Point Tracking by Pseudo-Labeling Real VideosNikita Karaev, Yuri Makarov, Jianyuan Wang, Natalia Neverova, Andrea Vedaldi, Christian Rupprecht 0001. 1-10 [doi]
- SurfaceSplat: Connecting Surface Reconstruction and Gaussian SplattingZihui Gao, Jia-Wang Bian, Guosheng Lin, Hao Chen 0034, Chunhua Shen. 1-10 [doi]
- ProSAM: Enhancing the Robustness of Sam-Based Visual Reference Segmentation with Probabilistic PromptsXiaoqi Wang, Clint Sebastian, Wenbin He, Liu Ren. 1-10 [doi]
- AdsQA: Towards Advertisement Video UnderstandingXinwei Long, Kai Tian, Peng Xu 0005, Guoli Jia, Jingxuan Li, Sa Yang, Yihua Shao, Kaiyan Zhang, Che Jiang, Hao Xu, Yang Liu, Jiaheng Ma, Bowen Zhou 0002. 1-12 [doi]
- VideoRFSplat: Direct Scene-Level Text-to-3D Gaussian Splatting Generation with Flexible Pose and Multi-View Joint ModelingHyojun Go, Byeongjun Park, Hyelin Nam, Byung-Hoon Kim, Hyungjin Chung, Changick Kim. 1-12 [doi]
- Seam360GS: Seamless 360° Gaussian Splatting from Real-World Omnidirectional ImagesChangha Shin, Woong Oh Cho, Seon Joo Kim. 1-10 [doi]
- Detect Anything 3D in the WildHanxue Zhang, Haoran Jiang, Qingsong Yao, Yanan Sun 0005, Renrui Zhang, Hao Zhao 0002, Hongyang Li 0001, Hongzi Zhu, Zetong Yang. 1-12 [doi]
- Hi3dgen: High-Fidelity 3D Geometry Generation From Images Via Normal BridgingChongjie Ye, Yushuang Wu, Ziteng Lu, Jiahao Chang, Xiaoyang Guo, Jiaqing Zhou, Hao Zhao 0002, Xiaoguang Han 0001. 1-12 [doi]
- Boosting Multimodal Learning via Disentangled Gradient LearningShicai Wei, Chunbo Luo, Yang Luo 0001. 1-10 [doi]
- Generalizable Non-Line-of-Sight Imaging with Learnable Physical PriorsShida Sun, Yue Li, Yueyi Zhang, Zhiwei Xiong. 1-10 [doi]
- AutoPrompt: Automated Red-Teaming of Text-to-Image Models via LLM-Driven Adversarial PromptsYufan Liu 0002, Wanqian Zhang, Huashan Chen, Lin Wang 0108, Xiaojun Jia, Zheng Lin 0001, Weiping Wang 0005. 1-10 [doi]
- GIViC: Generative Implicit Video CompressionGe Gao 0005, Siyue Teng, Tianhao Peng 0004, Fan Zhang 0017, David Bull 0001. 1-12 [doi]
- Cabld: Contrast-Agnostic Brain Landmark Detection With Consistency-Based RegularizationSoorena Salari, Arash Harirpoush, Hassan Rivaz, Yiming Xiao. 1-12 [doi]
- M-Net: MRI Brain Tumor Sequential Segmentation Network via Mesh-CastJiacheng Lu, Hui Ding, Shiyu Zhang, Guoping Huo. 1-10 [doi]
- Video Individual Counting for Moving DronesYaowu Fan, Jia Wan 0001, Tao Han 0002, Antoni B. Chan, Andy J. Ma. 1-10 [doi]
- Find any Part in 3DZiqi Ma, Yisong Yue, Georgia Gkioxari. 1-10 [doi]
- Cross-Granularity Online Optimization with Masked Compensated Information for Learned Image CompressionHaowei Kuang, Wenhan Yang, Zongming Guo, Jiaying Liu 0001. 1-10 [doi]
- Pose-Star: Anatomy-Aware Editing for Open-World Fashion ImagesYuran Dong, Mang Ye. 1-10 [doi]
- Probabilistic Inertial Poser (ProbIP): Uncertainty-Aware Human Motion Modeling from Sparse Inertial SensorsMin Kim, Younho Jeon, Sungho Jo. 1-10 [doi]
- DreamFuse: Adaptive Image Fusion with Diffusion TransformerJunjia Huang, Pengxiang Yan, Jiyang Liu, Jie Wu 0030, Zhao Wang, Yitong Wang, Liang Lin, Guanbin Li. 1-10 [doi]
- Enhancing Mamba Decoder with Bidirectional Interaction in Multi-Task Dense PredictionMang Cao, Sanping Zhou, Yizhe Li, Ye Deng 0005, Wenli Huang 0004, Le Wang 0003. 1-10 [doi]
- ConstStyle: Robust Domain Generalization with Unified Style TransformationNam Duong Tran, Nam Nguyen Phuong, Hieu H. Pham 0001, Phi-Le Nguyen, My T. Thai. 1-10 [doi]
- Interaction-Merged Motion Planning: Effectively Leveraging Diverse Motion Datasets for Robust PlanningGiwon Lee, Wooseong Jeong, Daehee Park 0001, Jaewoo Jeong, Kuk-Jin Yoon. 1-12 [doi]
- PanoLlama: Generating Endless and Coherent Panoramas with Next-Token-Prediction LLMsTeng Zhou, Xiaoyu Zhang, Yongchuan Tang. 1-10 [doi]
- Gaze-Language Alignment for Zero-Shot Prediction of Visual Search Targets from Human Gaze ScanpathsSounak Mondal, Naveen Sendhilnathan, Ting Zhang 0013, Yue Liu, Michael Proulx, Michael Louis Iuzzolino, Chuan Qin, Tanya R. Jonker. 1-12 [doi]
- LUSD: Localized Update Score Distillation for Text-Guided Image EditingWorameth Chinchuthakun, Tossaporn Saengja, Nontawat Tritrong, Pitchaporn Rewatbowornwong, Pramook Khungurn, Supasorn Suwajanakorn. 1-10 [doi]
- Scalable Ranked Preference Optimization for Text-To-Image GenerationShyamgopal Karthik, Huseyin Coskun, Zeynep Akata, Sergey Tulyakov, Jian Ren 0005, Anil Kag. 1-12 [doi]
- Seeing the Unseen: A Semantic Alignment and Context-Aware Prompt Framework for Open-Vocabulary Camouflaged Object SegmentationPeng Ren, Tian Bai, Jing Sun 0012, Fuming Sun. 1-10 [doi]
- DC-ControlNet: Decoupling Inter- and Intra-Element Conditions in Image Generation with Diffusion ModelsHongji Yang, Wencheng Han, Yucheng Zhou 0001, Jianbing Shen. 1-10 [doi]
- TLB-VFI: Temporal-Aware Latent Brownian Bridge Diffusion for Video Frame InterpolationZonglin Lyu, Chen Chen. 1-10 [doi]
- ImageGem: In-the-wild Generative Image Interaction Dataset for Generative Model PersonalizationYuanhe Guo, Linxi Xie, Zhuoran Chen, Kangrui Yu, Ryan Po, Guandao Yang, Gordon Wetztein, Hongyi Wen. 1-10 [doi]
- Partial Forward Blocking: A Novel Data Pruning Paradigm for Lossless Training AccelerationDongyue Wu, Zilin Guo, Jialong Zuo, Nong Sang, Changxin Gao. 1-10 [doi]
- Geo4D: Leveraging Video Generators for Geometric 4D Scene ReconstructionZeren Jiang, Chuanxia Zheng, Iro Laina, Diane Larlus, Andrea Vedaldi. 1-14 [doi]
- One Last Attention for Your Vision-Language ModelLiang Chen 0030, Ghazi Shazan Ahmad, Tianjun Yao, Lingqiao Liu, Zhiqiang Shen. 1-10 [doi]
- MEMFOF: High-Resolution Training for Memory-Efficient Multi-Frame Optical Flow EstimationVladislav Bargatin, Egor Chistov, Alexander Yakovenko, Dmitriy S. Vatolin. 1-10 [doi]
- I Am Big, You Are Little; I Am Right, You Are WrongDavid A. Kelly, Akchunya Chanchal, Nathan Blake. 1-10 [doi]
- Dataset Distillation as Data Compression: A Rate-Utility PerspectiveYouneng Bao, Yiping Liu, Zhuo Chen, Yongsheng Liang 0001, Mu Li 0005, Kede Ma. 1-11 [doi]
- EgoPPG: Heart Rate Estimation From Eye-Tracking Cameras in Egocentric Systems to Benefit Downstream Vision TasksBjörn Braun, Rayan Armani, Manuel Meier, Max Möbus, Christian Holz 0001. 1-12 [doi]
- TRCE: Towards Reliable Malicious Concept Erasure in Text-to-Image Diffusion ModelsRuidong Chen, Honglin Guo, Lanjun Wang, Chenyu Zhang 0003, Weizhi Nie, An-An Liu. 1-10 [doi]
- Identity-Aware Language Gaussian Splatting for Open-Vocabulary 3D Semantic SegmentationSungmin Jang, Wonjun Kim. 1-10 [doi]
- FlowTok: Flowing Seamlessly Across Text and Image TokensJu He, Qihang Yu, Qihao Liu, Liang-Chieh Chen. 1-12 [doi]
- Auxiliary Prompt Tuning of Vision-Language Models for Few-Shot Out-of-Distribution DetectionWenjun Miao, Guansong Pang, Zihan Wang, Jin Zheng, Xiao Bai 0001. 1-10 [doi]
- 2 ST-Adapter: Disentangled-and-Deformable Spatio-Temporal Adapter for Few-Shot Action RecognitionWenjie Pei, Qizhong Tan, Guangming Lu 0002, Jiandong Tian, Jun Yu 0002. 1-10 [doi]
- Aligning Information Capacity Between Vision and Language via Dense-to-Sparse Feature Distillation for Image-Text MatchingYang Liu, Wentao Feng, Zhuoyao Liu, Shudong Huang, Jiancheng Lv 0001. 1-10 [doi]
- ViewSRD: 3D Visual Grounding Via Structured Multi-View DecompositionRonggang Huang, Haoxin Yang, Yan Cai 0021, Xuemiao Xu, Huaidong Zhang, Shengfeng He. 11 [doi]
- Scaling Laws for Native Multimodal ModelsMustafa Shukor, Enrico Fini, Victor Guilherme Turrisi da Costa, Matthieu Cord, Joshua M. Susskind, Alaaeldin El-Nouby. 12-23 [doi]
- FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme CasesShuai Tan 0002, Bill Gong, Bin Ji 0004, Ye Pan. 24-36 [doi]
- Differentiable Room Acoustic Rendering with Multi-View Vision PriorsDerong Jin, Ruohan Gao. 37-47 [doi]
- Token Activation Map to Visually Explain Multimodal LLMsYi Li 0050, Hualiang Wang, Xinpeng Ding, Haonan Wang, Xiaomeng Li 0001. 48-58 [doi]
- Multi-View 3D Point TrackingFrano Rajic, Haofei Xu, Marko Mihajlovic, Siyuan Li 0008, Irem Demir, Emircan Gündogdu, Lei Ke, Sergey Prokudin, Marc Pollefeys, Siyu Tang 0001. 59-68 [doi]
- Uncalibrated Structure from Motion on a SphereJonathan Ventura, Viktor Larsson, Fredrik Kahl. 69-78 [doi]
- Removing Cost Volumes from Optical Flow EstimatorsSimon Kiefhaber 0002, Stefan Roth 0001, Simone Schaub-Meyer. 79-89 [doi]
- Image as an Imu: Estimating Camera Motion From a Single Motion-Blurred ImageJerred Chen, Ronald Clark. 90-99 [doi]
- TrajectoryCrafter: Redirecting Camera Trajectory for Monocular Videos via Diffusion ModelsMark Yu, Wenbo Hu 0002, Jinbo Xing, Ying Shan. 100-111 [doi]
- Secure On-Device Video OOD Detection without BackpropagationShawn Li, Peilin Cai, Yuxiao Zhou 0006, Zhiyu Ni, Renjie Liang, You Qin, Yi Nian, Zhengzhong Tu, Xiyang Hu, Yue Zhao 0016. 112-121 [doi]
- Learning Counterfactually Decoupled Attention for Open-World Model AttributionYu Zheng 0015, Boyang Gong, Fanye Kong, Yueqi Duan, Bingyao Yu, Wenzhao Zheng, Lei Chen 0069, Jiwen Lu, Jie Zhou 0001. 122-132 [doi]
- Latte: Collaborative Test-Time Adaptation of Vision-Language Models in Federated LearningWenxuan Bao, Ruxi Deng, Ruizhong Qiu, Tianxin Wei, Hanghang Tong, Jingrui He. 133-143 [doi]
- Is Less More? Exploring Token Condensation as Training-Free Test-Time AdaptationZixin Wang, Dong Gong, Sen Wang 0001, Zi Huang, Yadan Luo. 144-154 [doi]
- Mastering Collaborative Multi-Modal Data Selection: A Focus on Informativeness, Uniqueness, and RepresentativenessQifan Yu, Zhebei Shen, Zhongqi Yue, Yang Wu, Bosheng Qin, Wenqiao Zhang, Yunfei Li, Juncheng Li 0006, Siliang Tang, Yueting Zhuang. 155-165 [doi]
- IRGPT: Understanding Real-World Infrared Image with Bi-Cross-Modal Curriculum on Large-Scale BenchmarkZhe Cao 0001, Jin Zhang 0021, Ruiheng Zhang 0001. 166-176 [doi]
- SMoLoRa: Exploring and Defying Dual Catastrophic Forgetting in Continual Visual Instruction TuningZiqi Wang, Chang Che, Qi Wang, Yangyang Li, Zenglin Shi, Meng Wang. 177-186 [doi]
- One Object, Multiple Lies: A Benchmark for Cross-Task Adversarial Attack on Unified Vision-Language ModelsJiale Zhao, Xinyang Jiang, Junyao Gao 0002, Yuhao Xue, Cairong Zhao. 187-196 [doi]
- Generalized Tensor-Based Parameter-Efficient Fine-Tuning via Lie Group TransformationsChongjie Si, Zhiyi Shi, Xuehui Wang, Yichen Xiao, Xiaokang Yang 0001, Wei Shen 0002. 197-207 [doi]
- Bootstrapping Grounded Chain-of-Thought in Multimodal Llms for Data-Efficient Model AdaptationJiaer Xia, Bingkui Tong, Yuhang Zang, Rui Shao, Kaiyang Zhou. 208-217 [doi]
- Deciphering Cross-Modal Alignment in Large Vision-Language Models Via Modality Integration RateQidong Huang, Xiaoyi Dong, Pan Zhang 0001, Yuhang Zang, Yuhang Cao, Jiaqi Wang 0003, Weiming Zhang 0001, Nenghai Yu. 218-227 [doi]
- X-Fusion: Introducing New Modality to Frozen Large Language ModelsSicheng Mo, Thao Nguyen, Xun Huang, Siddharth Srinivasan Iyer, Yijun Li 0001, Yuchen Liu 0002, Abhishek Tandon, Eli Shechtman, Krishna Kumar Singh, Yong Jae Lee, Bolei Zhou, Yuheng Li. 228-238 [doi]
- LLaVA-KD: A Framework of Distilling Multimodal Large Language ModelsYuxuan Cai, Jiangning Zhang, Haoyang He, Xinwei He 0001, Ao Tong, Zhenye Gan, Chengjie Wang 0001, Zhucun Xue, Yong Liu 0007, Xiang Bai. 239-249 [doi]
- TITAN: Query-Token Based Domain Adaptive Adversarial LearningTajamul Ashraf, Janibul Bashir. 250-262 [doi]
- StolenLoRA: Exploring LoRA Extraction Attacks via Synthetic DataYixu Wang, Yan Teng 0002, Yingchun Wang 0004, Xingjun Ma. 263-272 [doi]
- MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGIHuanjin Yao, Jiaxing Huang 0001, Yawen Qiu, Michael K. Chen 0002, Wenzheng Liu, Wei Zhang 0196, Wenjie Zeng, Xikun Zhang 0007, Jingyi Zhang 0005, Yuxin Song, Wenhao Wu, Dacheng Tao. 273-283 [doi]
- Doodle Your Keypoints: Sketch-Based Few-Shot Keypoint DetectionSubhajit Maity, Ayan Kumar Bhunia, Subhadeep Koley, Pinaki Nath Chowdhury, Aneeshan Sain, Yi-Zhe Song. 284-296 [doi]
- Dissecting Generalized Category Discovery: Multiplex Consensus under Self-DeconstructionLuyao Tang, Kunze Huang, Chaoqi Chen, Yuxuan Yuan, Chenxin Li, Xiaotong Tu, Xinghao Ding, Yue Huang 0001. 297-307 [doi]
- LMM-Det: Make Large Multimodal Models Excel in Object DetectionJincheng Li 0002, Chunyu Xie, Ji Ao, Dawei Leng, Yuhui Yin. 308-318 [doi]
- ShortV: Efficient Multimodal Large Language Models by Freezing Visual Tokens in Ineffective LayersQianhao Yuan, Qingyu Zhang, Yanjiang Liu, Jiawei Chen 0011, Yaojie Lu 0001, Hongyu Lin, Jia Zheng 0009, Xianpei Han, Le Sun 0001. 329-339 [doi]
- Achieving More with Less: Additive Prompt Tuning for Rehearsal-Free Class-Incremental LearningHaoran Chen 0003, Ping Wang, Zihan Zhou, Xu Zhang, Zuxuan Wu, Yu-Gang Jiang 0001. 340-349 [doi]
- Ciard: Cyclic Iterative Adversarial Robustness DistillationLiming Lu, Shuchao Pang, Xu Zheng, Xiang Gu, AnAn Du, Yunhuai Liu, Yongbin Zhou. 350-359 [doi]
- Moderating the Generalization of Score-Based Generative ModelWan Jiang, He Wang 0002, Xin Zhang 0098, Dan Guo 0001, Zhaoxin Fan, Yunfeng Diao, Richang Hong. 360-369 [doi]
- LLM-Assisted Entropy-Based Adaptive Distillation for Unsupervised Fine-Grained Visual Representation LearningJianfeng Dong, Danfeng Luo, Daizong Liu, Jie Sun 0034, Xiaoye Qu, Xun Yang 0001, Dongsheng Liu 0003, Xun Wang 0007. 383-392 [doi]
- InfoBridge: Balanced Multimodal Integration through Conditional Dependency ModelingChenxin Li, Yifan Liu, Panwang Pan, Hengyu Liu, Xinyu Liu 0001, Wuyang Li, Cheng Wang, Weihao Yu 0004, Yiyang Lin, Yixuan Yuan. 393-404 [doi]
- A Hidden Stumbling Block in Generalized Category Discovery: Distracted AttentionQiyu Xu, Zhanxuan Hu, Yu Duan 0001, Ercheng Pei, Yonghang Tai. 405-414 [doi]
- Meta-Learning Dynamic Center Distance: Hard Sample Mining for Learning with Noisy LabelsChenyu Mu, Yijun Qu, Jiexi Yan, Erkun Yang, Cheng Deng 0002. 415-425 [doi]
- ChartPoint: Guiding MLLMs with Grounding Reflection for Chart ReasoningZhengzhuo Xu, Sinan Du, Yiyan Qi, Siwen Lu, Chengjin Xu, Chun Yuan 0003, Jian Guo. 426-436 [doi]
- Multimodal Large Language Model-Guided ISP Hyperparameter Optimization with Dynamic Preference LearningXinyu Sun, Zhikun Zhao, Congyan Lang, Bing Li 0001, Juan Wang 0012. 437-446 [doi]
- Creation-Mmbench: Assessing Context-Aware Creative Intelligence in MllmsXinYu Fang, Zhijian Chen, Kai Lan, Lixin Ma, Shengyuan Ding, Yingji Liang, Xiangyu Zhao, Farong Wen, Zicheng Zhang, Guofeng Zhang 0001, Haodong Duan, Kai Chen 0026, Dahua Lin. 447-456 [doi]
- Gradient Short-Circuit: Efficient Out-of-Distribution Detection via Feature InterventionJiawei Gu, Ziyue Qiao, Zechao Li. 457-466 [doi]
- Boundary Probing for Input Privacy Protection when Using LMM ServicesXiaofei Hui, Haoxuan Qu, Ping Hu 0001, Hossein Rahmani 0001, Jun Liu 0036. 467-477 [doi]
- Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language ModelShiming Chen 0002, Bowen Duan 0001, Salman Khan 0001, Fahad Shahbaz Khan. 478-487 [doi]
- ConsNoTrainLoRA: Data-driven Weight Initialization of Low-Rank Adapters Using ConstraintsDebasmit Das, Hyoungwoo Park, Munawar Hayat, Seokeon Choi, Sungrack Yun, Fatih Porikli. 498-507 [doi]
- UPRE: Zero-Shot Domain Adaptation for Object Detection via Unified Prompt and Representation EnhancementXiao Zhang, Fei Wei, Yong Wang, Wenda Zhao, Feiyi Li, Xiangxiang Chu. 508-518 [doi]
- Boosting Generative Adversarial Transferability with Self-Supervised Vision Transformer FeaturesShangbo Wu, Yu-an Tan 0001, Ruinan Ma, Wencong Ma, Dehua Zhu, Yuanzhang Li 0001. 530-540 [doi]
- Open-Set Cross Modal Generalization via Multimodal Unified RepresentationHai Huang 0013, Yan Xia 0006, Shulei Wang, Hanting Wang, Minghui Fang 0002, Shengpeng Ji, Sashuai Zhou, Tao Jin 0004, Zhou Zhao 0001. 541-551 [doi]
- Adversarial Data Augmentation for Single Domain Generalization via Lyapunov Exponent-Guided OptimizationZuyu Zhang, Ning Chen, Yongshan Liu, Qinghua Zhang, Xu Zhang. 552-561 [doi]
- Adversarial Robust Memory-Based Continual LearnerXiaoyue Mi, Fan Tang, Zonghan Yang, Danding Wang, Juan Cao 0001, Peng Li 0030, Yang Liu 0005. 562-572 [doi]
- NegRefine: Refining Negative Label-Based Zero-Shot OOD DetectionAmirhossein Ansari, Ke Wang 0001, Pulei Xiong. 573-582 [doi]
- Divide-And-Conquer for Enhancing Unlabeled Learning, Stability, and Plasticity in Semi-Supervised Continual LearningYue Duan, Taicai Chen, Lei Qi 0001, Yinghuan Shi. 583-593 [doi]
- A Unified Framework to BRIDGE Complete and Incomplete Deep Multi-View Clustering Under Non-IID Missing PatternsXiaorui Jiang, Buyun He, Peng Yuan Zhou, Xinyue Chen, Jingcai Guo, Jie Xu, Yong Liao 0003. 594-603 [doi]
- HumorDB: Can AI Understand Graphical Humor?Veedant Jain, Gabriel Kreiman, Felipe dos Santos Alves Feitosa. 604-613 [doi]
- GCAV: A Global Concept Activation Vector Framework for Cross-Layer Consistency in InterpretabilityZhenghao He, Sanchit Sinha, Guangzhi Xiong, Aidong Zhang 0001. 614-623 [doi]
- Confound from all Sides, Distill with Resilience: Multi-Objective Adversarial Paths to Zero-Shot RobustnessJunhao Dong 0001, Jiao Liu 0006, Xinghua Qu, Yew-Soon Ong. 624-634 [doi]
- Mitigating Object Hallucinations via Sentence-Level Early InterventionShangpin Peng, Songiao Yang, Li Jiang 0009, Zhuotao Tian. 635-646 [doi]
- Active Membership Inference Test (aMINT): Enhancing Model Auditability with Multi-Task LearningDaniel DeAlcala, Aythami Morales, Julian Fierrez, Gonzalo Mancera, Ruben Tolosana, Javier Ortega-Garcia. 647-656 [doi]
- Unknown Text Learning for Clip-Based Few-Shot Open-Set RecognitionRui Ma, Qilong Wang 0001, Bing Cao 0002, Qinghua Hu, Yahong Han. 657-667 [doi]
- One-Shot Knowledge Transfer for Scalable Person Re-IdentificationLonghua Li, Lei Qi 0001, Xin Geng 0001. 668-677 [doi]
- ShortFT: Diffusion Model Alignment via Shortcut-Based Fine-TuningXiefan Guo, Miaomiao Cui, Liefeng Bo, Di Huang 0001. 678-687 [doi]
- PRISM: Reducing Spurious Implicit Biases in Vision-Language Models with LLM-Guided Embedding ProjectionMahdiyar Molahasani, Azadeh Motamedi, Michael A. Greenspan, Il-Min Kim 0001, Ali Etemad. 688-697 [doi]
- Open-Unfairness Adversarial Mitigation for Generalized Deepfake DetectionZhaoyang Li 0014, Zhu Teng, Baopeng Zhang, Jianping Fan 0001. 698-707 [doi]
- MultiVerse: A Multi-Turn Conversation Benchmark for Evaluating Large Vision and Language ModelsYoung-Jun Lee, Byung kwan Lee, Jianshu Zhang, Yechan Hwang, ByungSoo Ko, Han-Gyu Kim, Dongyu Yao, Xuankun Rong, Eojin Joo, Seung-Ho Han 0001, Bowon Ko, Ho-Jin Choi. 708-719 [doi]
- Spatial Preference Rewarding for MLLMs Spatial UnderstandingHan Qiu 0008, Peng Gao 0007, Lewei Lu, Xiaoqin Zhang 0002, Ling Shao 0001, Shijian Lu. 720-730 [doi]
- EA-KD: Entropy-Based Adaptive Knowledge DistillationChi-Ping Su, Ching-Hsun Tseng, Bin Pu, Lei Zhao 0013, Jiewen Yang, Zhuangzhuang Chen, Shin-Jye Lee. 731-740 [doi]
- Structured Policy Optimization: Enhance Large Vision-Language Model via Self-Referenced DialogueGuohao Sun, Can Qin, Yihao Feng, Zeyuan Chen 0001, Ran Xu 0001, Sohail A. Dianat, Majid Rabbani, Raghuveer Rao, Zhiqiang Tao. 741-751 [doi]
- Seal Your Backdoor with Variational DefenseIvan Sabolic, Matej Grcic, Sinisa Segvic. 752-764 [doi]
- Semi-ViM: Bidirectional State Space Model for Mitigating Label Imbalance in Semi-Supervised LearningHongyang He, Hongyang Xie, Haochen You, Victor Sanchez. 765-774 [doi]
- CODE-CL: Conceptor-Based Gradient Projection for Deep Continual LearningMarco Paul E. Apolinario, Sakshi Choudhary, Kaushik Roy 0001. 775-784 [doi]
- SAMO: A Lightweight Sharpness-Aware Approach for Multi-Task Optimization with Joint Global-Local PerturbationHao Ban, Gokul Ram Subramani, Kaiyi Ji. 785-795 [doi]
- Beyond the Limits: Overcoming Negative Correlation of Activation-Based Training-Free NASHaidong Kang, Lianbo Ma, Pengjun Chen, Guo Yu 0001, Xingwei Wang 0001, Min Huang 0001. 796-805 [doi]
- Integrating Task-Specific and Universal Adapters for Pre-Trained Model-Based Class-Incremental LearningYan Wang, Da-Wei Zhou 0001, Han-Jia Ye. 806-816 [doi]
- Semi-Supervised Deep Transfer for Regression Without Domain AlignmentMainak Biswas, Ambedkar Dukkipati, Devarajan Sridharan. 827-836 [doi]
- DocThinker: Explainable Multimodal Large Language Models with Rule-Based Reinforcement Learning for Document UnderstandingWenwen Yu, Zhibo Yang 0003, Yuliang Liu, Xiang Bai. 837-847 [doi]
- CVPT: Cross Visual Prompt TuningLingyun Huang, Jianxu Mao, Junfei Yi, Ziming Tao, Yaonan Wang 0001. 848-858 [doi]
- From Easy to Hard: The MIR Benchmark for Progressive Interleaved Multi-Image ReasoningHang Du, Jiayang Zhang, Guoshun Nan, Wendi Deng, Zhenyan Chen, Chenyang Zhang, Xiao Wang 0002, Shan Huang, Yuqi Pan, Tao Qi, Sicong Leng. 859-869 [doi]
- Learning Separable Fine-Grained Representation via Dendrogram Construction from Coarse Labels for Fine-grained Visual RecognitionGuanghui Shi, Xuefeng Liang, Wenjie Li, Xiaoyu Lin. 870-879 [doi]
- Diffusion Guided Adaptive Augmentation for Generalization in Visual Reinforcement LearningJeong Woon Lee, Hyoseok Hwang. 880-889 [doi]
- Causal Disentanglement and Cross-Modal Alignment for Enhanced Few-Shot LearningTianjiao Jiang, Zhen Zhang 0008, Yuhang Liu 0002, Javen Qinfeng Shi. 890-900 [doi]
- CA2C: A Prior-Knowledge-Free Approach for Robust Label Noise Learning via Asymmetric Co-Learning and Co-TrainingMengmeng Sheng, Zeren Sun, Tianfei Zhou, Xiangbo Shu, Jinshan Pan, Yazhou Yao. 901-911 [doi]
- Fast Globally Optimal and Geometrically Consistent 3D Shape MatchingPaul Roetzer, Florian Bernard 0001. 912-922 [doi]
- A Framework for Double-Blind Federated Adaptation of Foundation ModelsNurbek Tastan, Karthik Nandakumar. 923-933 [doi]
- Customizing Domain Adapters for Domain GeneralizationYuyang Ji, Zeyi Huang, Haohan Wang, Yong Jae Lee. 934-944 [doi]
- Towards Scalable Spatial Intelligence Via 2D-To-3D Data LiftingXingyu Miao, Haoran Duan 0001, Quanhao Qian, Jiuniu Wang, Yang Long 0001, Ling Shao 0001, Deli Zhao, Ran Xu, Gongjie Zhang. 945-959 [doi]
- SRefiner: Soft-Braid Attention for Multi-Agent Trajectory RefinementLiwen Xiao, Zhiyu Pan, Zhicheng Wang, Zhiguo Cao, Wei Li. 960-969 [doi]
- Underwater Visual SLAM with Depth Uncertainty and Medium ModelingRui Liu, Sheng Fan, Wenguan Wang, Yi Yang 0001. 970-980 [doi]
- Aligning Vision to Language: Annotation-Free Multimodal Knowledge Graph Construction for Enhanced LLMs ReasoningJunming Liu, Siyuan Meng, Yanting Gao, Song Mao, Pinlong Cai, Guohang Yan, Yirong Chen, Zilin Bian, Ding Wang, Botian Shi. 981-992 [doi]
- AIM: Amending Inherent Interpretability via Self-Supervised MaskingEyad Alshami, Shashank Agnihotri, Bernt Schiele, Margret Keuper. 993-1003 [doi]
- Reinforcement Learning-Guided Data Selection Via Redundancy AssessmentSuorong Yang, Peijia Li, Furao Shen, Jian Zhao 0013. 1004-1015 [doi]
- Deep Incomplete Multi-View Clustering with Distribution Dual-Consistency Recovery GuidanceJiaqi Jin, Siwei Wang 0001, Zhibin Dong, Xihong Yang, Xinwang Liu 0002, En Zhu, Kunlun He. 1016-1026 [doi]
- VGGSounder: Audio-Visual Evaluations for Foundation ModelsDaniil Zverev, Thaddäus Wiedemer, Ameya Prabhu, Matthias Bethge, Wieland Brendel, A. Sophia Koepke. 1027-1037 [doi]
- Web Artifact Attacks Disrupt Vision Language ModelsMaan Qraitem, Piotr Teterwak, Kate Saenko, Bryan A. Plummer. 1048-1057 [doi]
- Tensor-Aggregated LoRA in Federated Fine-TuningZhixuan Li, Binqian Xu, Xiangbo Shu, Jiachao Zhang, Yazhou Yao, Guo-Sen Xie, Jinhui Tang 0001. 1058-1067 [doi]
- Feature Coding in the Era of Large Models: Dataset, Test Conditions, and BenchmarkChangsheng Gao, Yifan Ma, Qiaoxi Chen, Yenan Xu, Dong Liu 0002, Weisi Lin. 1068-1077 [doi]
- Generate, Refine, and Encode: Leveraging Synthesized Novel Samples for On-the-Fly Fine-Grained Category DiscoveryXiao Liu, Nan Pu, Haiyang Zheng, Wenjing Li 0005, Nicu Sebe, Zhun Zhong. 1078-1087 [doi]
- MMOne: Representing Multiple Modalities in One SceneZhifeng Gu, Bing Wang. 1088-1098 [doi]
- MM-IFEngine: Towards Multimodal Instruction FollowingShengyuan Ding, Shenxi Wu, Xiangyu Zhao, Yuhang Zang, Haodong Duan, Xiaoyi Dong, Pan Zhang 0001, Yuhang Cao, Dahua Lin, Jiaqi Wang 0003. 1099-1109 [doi]
- Knowledge Distillation with Refined LogitsWujie Sun, Defang Chen 0001, Siwei Lyu, Genlang Chen, Chun Chen 0001, Can Wang 0001. 1110-1119 [doi]
- CoST: Efficient Collaborative Perception from Unified Spatiotemporal PerspectiveZongheng Tang, Yi Liu 0070, Yifan Sun 0003, YuLu Gao, Jinyu Chen, Runsheng Xu, Si Liu 0001. 1120-1129 [doi]
- RainbowPrompt: Diversity-Enhanced Prompt-Evolving for Continual LearningKiseong Hong, Gyeong-Hyeon Kim, Eunwoo Kim. 1130-1140 [doi]
- Causality-Guided Prompt Learning for Vision-Language Models via Visual GranulationMengyu Gao, Qiulei Dong. 1141-1151 [doi]
- FA: Forced Prompt Learning of Vision-Language Models for Out-of-Distribution DetectionXinhua Lu, Runhe Lai, Yanqi Wu, Kanghao Chen, Wei-Shi Zheng 0001, Ruixuan Wang. 1152-1161 [doi]
- VisionMath: Vision-Form Mathematical Problem-SolvingZongyang Ma, Yuxin Chen, Ziqi Zhang, Zhongang Oi, Chunfeng Yuan, Shaojie Zhu, Chengxiang Zhuo, Bing Li 0001, Ye Liu 0002, Zang Li, Ying Shan, Weiming Hu 0004. 1162-1172 [doi]
- Scaling Inference-Time Search with Vision Value Model for Improved Visual ComprehensionXiyao Wang, Zhengyuan Yang, Linjie Li, Hongjin Lu, Yuancheng Xu, Chung-Ching Lin, Kevin Lin, Furong Huang, Lijuan Wang. 1173-1184 [doi]
- Contrastive Flow MatchingGeorge Stoica, Vivek Ramanujan, Xiang Fan, Ali Farhadi, Ranjay Krishna, Judy Hoffman. 1185-1194 [doi]
- SemiVisBooster: Boosting Semi-Supervised Learning for Fine-Grained Classification through Pseudo-Label Semantic GuidanceWenjin Zhang, Xinyu Li, Chenyang Gao, Ivan Marsic. 1195-1204 [doi]
- Dataset Distillation via the Wasserstein MetricHaoyang Liu 0001, Yijiang Li, Tiancheng Xing, Peiran Wang, Vibhu Dalal, Luwei Li, Jingrui He, Haohan Wang. 1205-1215 [doi]
- Membership Inference Attacks With False Discovery Rate ControlChenxu Zhao, Wei Qian, Aobo Chen, Mengdi Huai. 1216-1227 [doi]
- Acknowledging Focus Ambiguity in Visual QuestionsChongyan Chen, Yu-Yun Tseng, Zhuoheng Li, Anush Venkatesh, Danna Gurari. 1228-1238 [doi]
- A Good Teacher Adapts Their Knowledge for DistillationChengyao Qian, Trung Le 0001, Mehrtash Harandi. 1239-1248 [doi]
- Evading Data Provenance in Deep Neural NetworksHongyu Zhu 0004, Sichu Liang, Wenwen Wang, Zhuomeng Zhang, Fangqi Li 0001, Shi-Lin Wang. 1249-1260 [doi]
- Boosting Adversarial Transferability via Residual Perturbation AttackJinjia Peng, Zeze Tao, Huibing Wang, Meng Wang, Yang Wang. 1261-1270 [doi]
- MAVias: Mitigate any Visual BiasIoannis Sarridis, Christos Koutlis, Symeon Papadopoulos, Christos Diou. 1271-1281 [doi]
- MPBR: Multimodal Progressive Bidirectional Reasoning for Open-Set Fine-Grained RecognitionJunfu Tan, Peiguang Jing, Yu Zhu, Yu Liu 0004. 1282-1291 [doi]
- Towards Higher Effective Rank in Parameter-Efficient Fine-Tuning Using Khatri-Rao ProductPaul Albert, Frederic Z. Zhang, Hemanth Saratchandran, Anton van den Hengel, Ehsan Abbasnejad. 1292-1302 [doi]
- Revisiting Pool-Based Prompt Learning for Few-Shot Class-Incremental LearningYongwei Jiang, Yixiong Zou, Yuhua Li 0003, Ruixuan Li 0001. 1303-1313 [doi]
- Federated Representation Angle LearningLiping Yi, Han Yu 0001, Gang Wang 0001, Xiaoguang Liu 0001, Xiaoxiao Li. 1314-1324 [doi]
- Federated Continual Instruction TuningHaiyang Guo, Fanhu Zeng, Fei Zhu 0004, Wenzhuo Liu, Da-Han Wang, Jian Xu 0015, Xu-Yao Zhang, Cheng-Lin Liu 0001. 1325-1335 [doi]
- Scaling Omni-Modal Pretraining with Multimodal Context: Advancing Universal Representation Learning Across ModalitiesYiyuan Zhang, Handong Li, Jing Liu, Xiangyu Yue. 1336-1348 [doi]
- More Reliable Pseudo-Labels, Better Performance: A Generalized Approach to Single Positive Multi-Label LearningLuong Tran, Thieu Vo, Anh Nguyen, Sang Dinh, Van Nguyen. 1349-1358 [doi]
- TWIST & SCOUT: Grounding Multimodal LLM-Experts by Forget-Free TuningAritra Bhowmik, Mohammad Mahdi Derakhshani, Dennis C. Koelma, Yuki M. Asano, Martin R. Oswald, Cees G. M. Snoek. 1359-1368 [doi]
- Generate, Transduct, Adapt: Iterative Transduction with VLMsOindrila Saha, Logan Lawrence, Grant Van Horn, Subhransu Maji. 1369-1379 [doi]
- BokehDiff: Neural Lens Blur with One-Step DiffusionChengxuan Zhu, Qingnan Fan, Qi Zhang 0066, Jinwei Chen, Huaqi Zhang, Chao Xu, Boxin Shi. 1369-1379 [doi]
- BabyVLM: Data-Efficient Pretraining of VLMs Inspired by Infant LearningShengao Wang Boston University, Arjun Chandra, Aoming Liu, Venkatesh Saligrama, Boqing Gong. 1380-1390 [doi]
- Controlling Multimodal Llms Via Reward-Guided DecodingOscar Mañas, Pierluca D'Oro, Koustuv Sinha, Adriana Romero-Soriano, Michal Drozdzal, Aishwarya Agrawal. 1391-1401 [doi]
- Improving Large Vision and Language Models by Learning from a Panel of PeersJefferson Hernandez, Jing Shi 0005, Simon Jenni, Vicente Ordonez, Kushal Kafle. 1402-1412 [doi]
- CE-FAM: Concept-Based Explanation via Fusion of Activation MapsMichihiro Kuroki, Toshihiko Yamasaki. 1413-1422 [doi]
- Leveraging Spatial Invariance to Boost Adversarial TransferabilityZihan Zhou, Li Li 0103, Yanli Ren, Chuan Qin, Guorui Feng. 1423-1432 [doi]
- Client2Vec: Improving Federated Learning by Distribution Shifts Aware Client IndexingYongxin Guo 0001, Lin Wang, Xiaoying Tang 0002, Tao Lin 0004. 1433-1443 [doi]
- A Tiny Change, a Giant Leap: Long-Tailed Class-Incremental Learning via Geometric Prototype AlignmentXinyi Lai, Luojun Lin, Weijie Chen 0006, Yuanlong Yu 0001. 1444-1453 [doi]
- PEFTDiff: Diffusion-Guided Transferability Estimation for Parameter-Efficient Fine-TuningPrafful Kumar Khoba, Zijian Wang 0009, Chetan Arora 0001, Mahsa Baktashmotlagh. 1454-1463 [doi]
- Forgetting Through Transforming: Enabling Federated Unlearning via Class-Aware Representation TransformationQi Guo, Zhen Tian, Minghao Yao, Saiyu Qi, Yong Qi, Bingyi Liu. 1474-1483 [doi]
- MMAT-1M: A Large Reasoning Dataset for Multimodal Agent TuningTianhong Gao, Yannian Fu, Weiqun Wu, Haixiao Yue, Shanshan Liu, Gang Zhang. 1484-1494 [doi]
- Geometry DistributionsBiao Zhang 0005, Jing Ren 0004, Peter Wonka. 1495-1505 [doi]
- CRAM: Large-Scale Video Continual Learning with Bootstrapped CompressionShivani Mall, João F. Henriques. 1504-15055 [doi]
- FastJSMA: Accelerating Jacobian-Based Saliency Map Attacks Through Gradient DecouplingZhenghao Gao, Shengjie Xu, Zijing Li, Meixi Chen, Chaojian Yu, Yuanjie Shao, Changxin Gao. 1506-1515 [doi]
- Boosting Class Representation via Semantically Related Instances for Robust Long-Tailed Learning with Noisy LabelsYuhang Li, Zhuying Li, Yuheng Jia. 1516-1525 [doi]
- Pi-GPS: Enhancing Geometry Problem Solving by Unleashing the Power of Diagrammatic InformationJunbo Zhao, Ting Zhang, Jiayu Sun, Mi Tian 0008, Hua Huang 0001. 1526-1536 [doi]
- VAGUE: Visual Contexts Clarify Ambiguous ExpressionsHeejeong Nam, Jinwoo Ahn, Keummin Ka, Jiwan Chung, Youngjae Yu. 1537-1547 [doi]
- Diffusion-Based Source-Biased Model for Single Domain Generalized Object DetectionHan Jiang, Wenfei Yang, Tianzhu Zhang 0001, Yongdong Zhang 0001. 1548-1557 [doi]
- PRO-VPT: Distribution-Adaptive Visual Prompt Tuning via Prompt RelocationChikai Shang, Mengke Li 0001, Yiqun Zhang 0006, Zhen Chen 0018, Jinlin Wu, Fangqing Gu, Yang Lu 0009, Yiu-ming Cheung. 1558-1568 [doi]
- BATCLIP: Bimodal Online Test-Time Adaptation for CLIPSarthak Kumar Maharana, Baoming Zhang, Leonid Karlinsky, Rogério Feris, Yunhui Guo. 1569-1579 [doi]
- Mind the Cost of Scaffold! Benign Clients May Even Become Accomplices of Backdoor AttackXingshuo Han, Xuanye Zhang, Xiang Lan, Haozhao Wang, Shengmin Xu, Shen Ren, Jason Zeng, Ming Wu, Michael Heinrich, Tianwei Zhang 0004. 1580-1589 [doi]
- AVTrustBench: Assessing and Enhancing Reliability and Robustness in Audio-Visual LLMsSanjoy Chowdhury, Sayan Nag, Subhrajyoti Dasgupta, Yaoting Wang, Mohamed Elhoseiny, Ruohan Gao, Dinesh Manocha. 1590-1601 [doi]
- Verbalized Representation Learning for Interpretable Few-Shot GeneralizationCheng-Fu Yang, Da Yin, Wenbo Hu 0006, Heng Ji 0001, Nanyun Peng 0001, Bolei Zhou, Kai-Wei Chang 0001. 1602-1612 [doi]
- UIPro: Unleashing Superior Interaction Capability for GUI AgentsHongxin Li, Jingran Su, Jingfan Chen, Zheng Ju, YunTao Chen, Qing Li 0001, Zhaoxiang Zhang 0001. 1613-1623 [doi]
- Loss Functions for Predictor-Based Neural Architecture SearchHan Ji 0003, Yuqi Feng, Jiahao Fan, Yanan Sun 0001. 1624-1633 [doi]
- DiMPLE - Disentangled Multi-Modal Prompt Learning: Enhancing Out-of-Distribution Alignment with Invariant and Spurious Feature SeparationUmaima Rahman, Mohammad Yaqub, Dwarikanath Mahapatra. 1634-1643 [doi]
- GRAB: A Challenging Graph Analysis Benchmark for Large Multimodal ModelsJonathan Roberts 0004, Kai Han 0001, Samuel Albanie. 1644-1654 [doi]
- MosaicDiff: Training-free Structural Pruning for Diffusion Model Acceleration Reflecting Pretraining DynamicsBowei Guo, Shengkun Tang, Cong Zeng, Zhiqiang Shen. 1655-1664 [doi]
- GLEAM: Enhanced Transferable Adversarial Attacks for Vision-Language Pre-Training Models via Global-Local TransformationsYunqi Liu, Xue Ouyang, Xiaohui Cui. 1665-1674 [doi]
- Adversarial Training for Probabilistic RobustnessYi Zhang 0141, Yuhang Chen, Zhen Chen, Wenjie Ruan, Xiaowei Huang 0001, Siddartha Khastgir, Xingyu Zhao 0001. 1675-1685 [doi]
- RMultiplex200K: Toward Reliable Multimodal Process Supervision for Visual Language Models on TelecommunicationsSijia Chen, Bin Song 0001. 1686-1696 [doi]
- Diffusion Curriculum: Synthetic-to-Real Data Curriculum via Image-Guided DiffusionYijun Liang, Shweta Bhardwaj, Tianyi Zhou 0001. 1697-1707 [doi]
- Backdoor Defense via Enhanced Splitting and Trap IsolationHongrui Yu, Lu Qi, Wanyu Lin, Jian Chen 0046, Hailong Sun 0001, Chengbin Sun. 1708-1717 [doi]
- Benchmarking Multimodal CoT Reward Model Stepwise by Visual ProgramMinghe Gao, Xuqi Liu, Zhongqi Yue, Yang Wu, Shuang Chen, Juncheng Li 0006, Siliang Tang, Fei Wu 0001, Tat-Seng Chua, Yueting Zhuang. 1718-1728 [doi]
- AIRA: Activation-Informed Low-Rank Adaptation for Large ModelsLujun Li 0001, Dezhi Li, Cheng Lin 0001, Wei Li 0286, Wei Xue 0002, Sirui Han, Yike Guo. 1729-1739 [doi]
- Social Debiasing for Fair Multi-Modal LLMsHarry Cheng 0002, Yangyang Guo, Qing Guo 0005, Ming-Hsuan Yang 0001, Tian Gan 0002, Weili Guan, Liqiang Nie. 1740-1750 [doi]
- Equipping Vision Foundation Model with Mixture of Experts for Out-of-Distribution DetectionShizhen Zhao, Jiahui Liu 0012, Xin Wen 0004, Haoru Tan, Xiaojuan Qi 0001. 1751-1761 [doi]
- LIRA: Reasoning Reconstruction via Multimodal Large Language ModelsZhen Zhou 0005, Tong Wang, Yunkai Ma, Xiao Tan, Fengshui Jing. 1762-1772 [doi]
- Towards Cross-Modal Backward-Compatible Representation Learning for Vision-Language ModelsYoung-Kyun Jang, Ser-Nam Lim. 1783-1792 [doi]
- Region-based Cluster Discrimination for Visual Representation LearningYin Xie, Kaicheng Yang 0002, Xiang An, Kun Wu, Yongle Zhao, Weimo Deng, Zimin Ran, Yumeng Wang, Ziyong Feng, Roy Miles, Ismail Elezi, Jiankang deng. 1793-1803 [doi]
- Towards Privacy-preserved Pre-training of Remote Sensing Foundation Models with Federated Mutual-Guidance LearningJieyi Tan, Chengwei Zhang, Bo Dang 0002, Yansheng Li 0001. 1804-1814 [doi]
- EFTViT: Efficient Federated Training of Vision Transformers with Masked Images on Resource-Constrained ClientsMeihan Wu, Tao Chang, Cui Miao, Jie Zhou 0001, Chun Li, Xiangyu Xu 0002, Ming Li 0073, Xiaodong Wang 0002. 1815-1824 [doi]
- HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature AdaptationQinqian Lei, Bo Wang 0019, Robby T. Tan. 1825-1835 [doi]
- Diagnosing Pretrained Models for Out-of-Distribution DetectionHaipeng Xiong, Kai Xu, Angela Yao. 1836-1845 [doi]
- R1-VL: Learning to Reason with Multimodal Large Language Models via Step-Wise Group Relative Policy OptimizationJingyi Zhang 0005, Jiaxing Huang 0001, Huanjin Yao, Shunyu Liu 0001, Xikun Zhang 0007, Shijian Lu, Dacheng Tao. 1859-1869 [doi]
- Supervised Exploratory Learning for Long-Tailed Visual RecognitionZhongQuan Jian, Yanhao Chen 0002, Yancheng Wang, Junfeng Yao, Meihong Wang, Qingqiang Wu 0001. 1870-1880 [doi]
- Synergistic Prompting for Robust Visual Recognition with Missing ModalitiesZhihui Zhang, Luanyuan Dai, Qika Lin, Yunfeng Diao, Guangyin Jin, Yufei Guo, Jing Zhang 0037, Xiaoshuai Hao. 1881-1890 [doi]
- Hierarchical Cross-Modal Prompt Learning for Vision-Language ModelsHao Zheng, Shunzhi Yang, Zhuoxin He, Jinfeng Yang, Zhenhua Huang. 1891-1901 [doi]
- Rethinking Few Shot CLIP Benchmarks: A Critical Analysis in the Inductive SettingAlexey Kravets, Da Chen, Vinay P. Namboodiri. 1902-1911 [doi]
- Boosting Domain Generalized and Adaptive Detection with Diffusion Models: Fitness, Generalization, and TransferabilityBoyong He, Yuxiang Ji, Zhuoyue Tan, Liaoni Wu. 1912-1923 [doi]
- Entropy-Adaptive Diffusion Policy Optimization with Dynamic Step AlignmentRenye Yan, Jikang Cheng, Yaozhong Gan, Shikun Sun, You Wu, Yunfan Yang, Ling Liang, Jinlong Lin, Yeshuang Zhu, Jie Zhou 0001, Jinchao Zhang, Junliang Xing, YiMao Cai, Ru Huang 0001. 1924-1934 [doi]
- Joint Asymmetric Loss for Learning with Noisy LabelsJialiang Wang 0003, Xianming Liu 0005, Xiong Zhou, Gangfeng Hu, Deming Zhai, Junjun Jiang, Xiangyang Ji. 1947-1956 [doi]
- FG-OrIU: Towards Better Forgetting via Feature-Gradient Orthogonality for Incremental UnlearningQian Feng, Jiahang Tu, Mintong Kang, Hanbin Zhao, Chao Zhang 0001, Hui Qian 0001. 1957-1967 [doi]
- Language-Driven Multi-Label Zero-Shot Learning with Semantic GranularityShouwen Wang, Qian Wan, Junbin Gao, Zhigang Zeng. 1968-1978 [doi]
- Svit-Split: Unleashing the Power of Vision Foundation Models Via Efficient Splitting HeadsYifan Li, Xin Li, Tianqin Li, Wenbin He, Yu Kong, Liu Ren. 1979-1989 [doi]
- D3: Training-Free AI-Generated Video Detection Using Second-Order FeaturesChende Zheng, Ruiqi Suo, Chenhao Lin, Zhengyu Zhao 0001, Le Yang 0007, Shuai Liu 0016, Minghui Yang, Cong Wang 0001, Chao Shen 0001. 1979-1989 [doi]
- Generalized Deep Multi-View Clustering Via Causal Learning With Partially Aligned Cross-View CorrespondenceXihong Yang, Siwei Wang 0001, Jiaqi Jin, Fangdi Wang, Tianrui Liu 0001, Yueming Jin, Xinwang Liu 0002, En Zhu, Kunlun He. 1990-1999 [doi]
- ViT-EnsembleAttack: Augmenting Ensemble Models for Stronger Adversarial Transferability in Vision TransformersHanwen Cao, Haobo Lu, Xiaosen Wang, Kun He 0001. 2000-2009 [doi]
- Instruction-Oriented Preference Alignment for Enhancing Multi-Modal Comprehension Capability of MLLMsZitian Wang, Yue Liao, Kang Rong, Fengyun Rao, Yibo Yang, Si Liu 0001. 2010-2021 [doi]
- Progressive Homeostatic and Plastic Prompt Tuning for Audio-Visual Multi-Task Incremental LearningJiong Yin, Liang Li 0003, Jiehua Zhang, YuHan Gao, Chenggang Yan 0001, Xichun Sheng. 2022-2033 [doi]
- Visual-RFT: Visual Reinforcement Fine-TuningZiyu Liu, Zeyi Sun 0002, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Haodong Duan, Dahua Lin, Jiaqi Wang 0003. 2034-2044 [doi]
- Jailbreaking Multimodal Large Language Models via Shuffle InconsistencyShiji Zhao, Ranjie Duan, Fengxiang Wang, Chi Chen, Caixin Kang, Shouwei Ruan, Jialing Tao, Yuefeng Chen, Hui Xue 0001, Xingxing Wei 0001. 2045-2054 [doi]
- Large Learning Rates Simultaneously Achieve Robustness to Spurious Correlations and CompressibilityMelih Barsbey, Lucas Prieto, Stefanos Zafeiriou, Tolga Birdal. 2055-2066 [doi]
- Dual-Rate Dynamic Teacher for Source-Free Domain Adaptive Object DetectionQi He 0007, Xiao Wu 0001, Jun-Yan He, Shuai Li 0014. 2067-2076 [doi]
- Dynamic Multi-Layer Null Space Projection for Vision-Language Continual LearningBorui Kang, Lei Wang 0001, Zhiping Wu, Tao Feng, Yawen Li, Yang Gao 0001, Wenbin Li 0006. 2077-2086 [doi]
- LlaVA-CoT: Let Vision Language Models Reason Step-By-StepGuowei Xu 0001, Peng Jin 0001, Ziang Wu, Hao Li, Yibing Song, Lichao Sun 0001, Li Yuan 0007. 2087-2098 [doi]
- DALIP: Distribution Alignment-Based Language-Image Pre-Training for Domain-Specific DataJunjie Wu, Jiangtao Xie, ZhaoLin Zhang, Qilong Wang 0001, Qinghua Hu, Peihua Li, Sen Xu. 2099-2109 [doi]
- Semi-Supervised Concept Bottleneck ModelsLijie Hu, Tianhao Huang, Huanyi Xie, Xilin Gong, Chenyang Ren, Zhengyu Hu, Lu Yu, Ping Ma, Di Wang 0015. 2110-2119 [doi]
- FRET: Feature Redundancy Elimination for Test Time AdaptationLinjing You, Jiabao Lu, Xiayuan Huang, Xiangli Nie. 2120-2130 [doi]
- Meta-Unlearning on Diffusion Models: Preventing Relearning Unlearned ConceptsHongcheng Gao, Tianyu Pang, Chao Du, Taihang Hu, Zhijie Deng, Min Lin. 2131-2141 [doi]
- A Unified Interpretation of Training-Time Out-Of-Distribution DetectionXu Cheng, Xin Jiang 0010, Zechao Li. 2142-2151 [doi]
- Coupling the Generator with Teacher for Effective Data-Free Knowledge DistillationXu Chen, Yang Li, Yahong Han, Guangquan Xu, Jialie Shen. 2152-2160 [doi]
- FedMeNF: Privacy-Preserving Federated Meta-Learning for Neural FieldsJunhyeog Yun, Minui Hong, Gunhee Kim. 2161-2171 [doi]
- Visual Modality Prompt for Adapting Vision-Language Object DetectorsHeitor Rapela Medeiros, Atif Belal, Srikanth Muralidharan, Eric Granger, Marco Pedersoli. 2172-2182 [doi]
- What's in a Latent? Leveraging Diffusion Latent Space for Domain GeneralizationXavier Thomas, Deepti Ghadiyaram. 2183-2194 [doi]
- Prototype Guided Backdoor Defense via Activation Space ManipulationVenkat Adithya Amula, Sunayana Samavedam, Saurabh Saini, Avani Gupta, P. J. Narayanan. 2195-2205 [doi]
- Analyzing Fine-Tuning Representation Shift for Multimodal LLMs SteeringPegah Khayatan, Mustafa Shukor, Jayneel Parekh, Arnaud Dapogny, Matthieu Cord. 2206-2216 [doi]
- Efficient Unsupervised Shortcut Learning Detection and Mitigation in TransformersLukas Kuhn, Sari Sadiya, Jörg Schlötterer, Florian Buettner 0001, Christin Seifert, Gemma Roig. 2217-2226 [doi]
- Understanding Museum Exhibits using Vision-Language ReasoningAda-Astrid Balauca, Sanjana Garai, Stefan Balauca, Rasesh Udayakumar Shetty, Naitik Agrawal, Dhwanil Subhashbhai Shah, Yuqian Fu, Xi Wang 0021, Kristina Toutanova, Danda Pani Paudel, Luc Van Gool. 2227-2238 [doi]
- Looking in the Mirror: A Faithful Counterfactual Explanation Method for Interpreting Deep Image Classification ModelsTownim Faisal Chowdhury, Vu Minh Hieu Phan, Kewen Liao, Nanyu Dong, Minh-Son To, Anton van den Hengel, Johan W. Verjans, Zhibin Liao. 2239-2249 [doi]
- Improving Multimodal Learning via Imbalanced LearningShicai Wei, Chunbo Luo, Yang Luo 0001. 2250-2259 [doi]
- NAPPure: Adversarial Purification for Robust Image Classification Under Non-Additive PerturbationsJunjie Nan, Jianing Li, Wei Chen, Mingkun Zhang, Xueqi Cheng. 2260-2269 [doi]
- VSP: Diagnosing the Dual Challenges of Perception and Reasoning in Spatial Planning Tasks for MLLMSQiucheng Wu, Handong Zhao, Michael Saxon, Trung Bui, William Yang Wang, Yang Zhang 0001, Shiyu Chang. 2270-2280 [doi]
- Multi-Cache Enhanced Prototype Learning for Test-Time Generalization of Vision-Language ModelsXinyu Chen, Haotian Zhai, Can Zhang, Xiupeng Shi, Ruirui Li. 2281-2291 [doi]
- AVAM: A Universal Training-Free Adaptive Visual Anchoring Embedded into Multimodal Large Language Model for Multi-Image Question AnsweringKang Zeng, Guojin Zhong, Jintao Cheng, Jin Yuan 0002, Zhiyong Li 0001. 2292-2302 [doi]
- Unsupervised Visual Chain-of-Thought Reasoning via Preference OptimizationKesen Zhao, Beier Zhu, Qianru Sun, Hanwang Zhang. 2303-2312 [doi]
- Adversarial Robustness of Discriminative Self-Supervised Learning in VisionÖmer Veysel Çagatan, Ömer Faruk Tal, M. Emre Gürsoy. 2313-2324 [doi]
- Hierarchical Variational Test-Time Prompt Generation for Zero-Shot GeneralizationZhaoyang Wu, Fang Liu 0001, Licheng Jiao, Shuo Li 0010, Lingling Li 0002, LiXu Liu, Puhua Chen, Wenping Ma 0001. 2325-2335 [doi]
- TRNAS: A Training-Free Robust Neural Architecture SearchYeming Yang, Qingling Zhu, Jianping Luo, Ka Chun Wong, Qiuzhen Lin, Jianqiang Li 0001. 2336-2345 [doi]
- Staining and Locking Computer Vision Models Without RetrainingOliver J. Sutton, Qinghua Zhou, George Leete, Alexander N. Gorban, Ivan Yu. Tyukin. 2346-2355 [doi]
- Granular Concept Circuits: Toward a Fine-Grained Circuit Discovery for Concept RepresentationsDahee Kwon, Sehyun Lee, Jaesik Choi. 2356-2365 [doi]
- Federated Domain Generalization with Domain-Specific Soft Prompts GenerationJianhan Wu 0001, Xiaoyang Qu, Zhangcheng Huang 0002, Jianzong Wang. 2366-2375 [doi]
- R1-Onevision: Advancing Generalized Multimodal Reasoning Through Cross-Modal FormalizationYi Yang, Xiaoxuan He, Hongkun Pan, Xiyan Jiang, Yan Deng, Xingtao Yang, Haoyu Lu, Dacheng Yin, Fengyun Rao, Minfeng Zhu, Bo Zhang, Wei Chen. 2376-2385 [doi]
- Boosting Adversarial Transferability via Negative Hessian Trace RegularizationYunfei Long, Zilin Tian, Liguo Zhang, Huosheng Xu. 2386-2395 [doi]
- The Inter-Intra Modal Measure: A Predictive Lens on Fine-Tuning Outcomes in Vision-Language ModelsLaura Niss, Kevin Vogt-Lowell, Theodoros Tsiligkaridis. 2396-2406 [doi]
- What to Distill? Fast Knowledge Distillation with Adaptive SamplingByungchul Chae, Seonyeong Heo. 2407-2416 [doi]
- Invisible Watermarks, Visible Gains: Steering Machine Unlearning with Bi-Level Watermarking DesignYuhao Sun, Yihua Zhang, Gaowen Liu, Hongtao Xie, Sijia Liu 0001. 2417-2428 [doi]
- Federated Continuous Category Discovery and LearningLixu Wang, Chenxi Liu, Junfeng Guo, Qingqing Ye 0001, Heng Huang 0001, Haibo Hu 0001, Wei Dong. 2429-2439 [doi]
- Beyond Losses Reweighting: Empowering Multi-Task Learning via the Generalization PerspectiveHoang Phan, Lam Tran, Quyen Tran, Ngoc N. Tran, Tuan Truong, Qi Lei, Nhat Ho, Dinh Q. Phung, Trung Le 0001. 2440-2450 [doi]
- Flexi-FSCIL: Adaptive Knowledge Retention for Breaking the Stability-Plasticity Dilemma in Few-Shot Class-Incremental LearningWufei Xie, Yalin Wang, Chenliang Liu, Zhaohui Jiang, Xue Yang. 2451-2460 [doi]
- PROL: Rehearsal Free Continual Learning in Streaming Data via Prompt Online LearningM. Anwar Ma'sum, Mahardhika Pratama, Savitha Ramasamy, Lin Liu 0003, Habibullah Habibullah, Ryszard Kowalczyk. 2471-2481 [doi]
- Can Knowledge be Transferred from Unimodal to Multimodal? Investigating the Transitivity of Multimodal Knowledge EditingLingyong Fang, Xinzhong Wang, Depeng Wang, Zongru Wu, Ya Guo, Huijia Zhu, Zhuosheng Zhang 0001, Gongshen Liu. 2482-2490 [doi]
- Visual-Oriented Fine-Grained Knowledge Editing for MultiModal Large Language ModelsZhen Zeng, Leijiang Gu, Xun Yang 0001, Zhangling Duan, Zenglin Shi, Meng Wang 0001. 2491-2500 [doi]
- Dynamic Multimodal Prototype Learning in Vision-Language ModelsXingyu Zhu, Shuo Wang 0008, Beier Zhu, Miaoge Li, Yunfan Li, Junfeng Fang, Zhicai Wang, Dongsheng Wang 0003, Hanwang Zhang. 2501-2511 [doi]
- Visual Intention Grounding for Egocentric AssistantsPengzhan Sun 0001, Junbin Xiao, Tze Ho Elden Tse, Yicong Li 0004, Arjun R. Akula, Angela Yao. 2512-2522 [doi]
- Street Gaussians Without 3D Object TrackerRuida Zhang, Chengxi Li 0001, Chenyangguang Zhang, Xingyu Liu, Haili Yuan, Yanyan Li, Xiangyang Ji, Gim Hee Lee. 2522-2534 [doi]
- Unleashing Vecset Diffusion Model for Fast Shape GenerationZeqiang Lai, Yunfei Zhao, Zibo Zhao 0001, Haolin Liu, Fuyun Wang, Huiwen Shi, Xianghui Yang, Qingxiang Lin, Jingwei Huang, Yuhong Liu, Jie Jiang 0015, Chunchao Guo, Xiangyu Yue 0001. 2523-2533 [doi]
- Inter: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance SamplingXin Dong, Shichao Dong, Jin Wang, Jing Huang, Li Zhou, Zenghui Sun, Lihua Jing, Jinsong Lan, Xiaoyong Zhu, Bo Zheng. 2534-2544 [doi]
- VisRL: Intention-Driven Visual Perception via Reinforced ReasoningZhangquan Chen, Xufang Luo, Dongsheng Li. 2545-2555 [doi]
- Auto-Regressively Generating Multi-View Consistent ImagesJiakui Hu, Yuxiao Yang, Jialun Liu, Jinbo Wu, Chen Zhao, Yanye Lu. 2556-2566 [doi]
- Towards Performance Consistency in Multi-Level Model CollaborationQi Li, Runpeng Yu, Xinchao Wang. 2567-2576 [doi]
- Debiased Teacher for Day-to-Night Domain Adaptive Object DetectionYiming Cui, Liang Li 0003, Haibing Yin, YuHan Gao, Yaoqi Sun, Chenggang Yan 0001. 2577-2587 [doi]
- From Easy to Hard: Progressive Active Learning Framework for Infrared Small Target Detection with Single Point SupervisionChuang Yu 0003, Jinmiao Zhao, Yunpeng Liu 0001, Sicheng Zhao, Yimian Dai, Xiangyu Yue 0001. 2588-2598 [doi]
- Disentangled World Models: Learning to Transfer Semantic Knowledge from Distracting Videos for Reinforcement LearningQi Wang 0080, Zhipeng Zhang, Baao Xie, Xin Jin 0014, Yunbo Wang, Shiyu Wang, Liaomo Zheng, Xiaokang Yang 0001, Wenjun Zeng 0001. 2599-2608 [doi]
- Stable-Sim2Real: Exploring Simulation of Real-Captured 3D Data with Two-Stage Depth DiffusionMutian Xu, Chongjie Ye, Haolin Liu 0004, Yushuang Wu, Jiahao Chang, Xiaoguang Han 0001. 2609-2619 [doi]
- ULTHO: Ultra-Lightweight Yet Efficient Hyperparameter Optimization in Deep Reinforcement LearningMingqi Yuan, Bo Li 0037, Xin Jin 0014, Wenjun Zeng 0001. 2620-2630 [doi]
- Task-Aware Prompt Gradient Projection for Parameter-Efficient Tuning Federated Class-Incremental LearningHualong Ke, Jiangming Shi, Yachao Zhang 0001, Fangyong Wang, Yuan Xie, Yanyun Qu. 2631-2641 [doi]
- Is Visual in-Context Learning for Compositional Medical Tasks Within Reach?Simon Reiß, Zdravko Marinov, Alexander Jaus, Constantin Seibold, M. Saquib Sarfraz, Erik Rodner, Rainer Stiefelhagen. 2642-2652 [doi]
- Effective Training Data Synthesis for Improving MLLM Chart UnderstandingYuwei Yang, Zeyu Zhang, Yunzhong Hou, Zhuowan Li, Gaowen Liu, Ali Payani, Yuan-Sen Ting, Liang Zheng 0001. 2653-2663 [doi]
- Learnable Logit Adjustment for Imbalanced Semi-Supervised Learning Under Class Distribution MismatchHyuck Lee, Taemin Park, Heeyoung Kim. 2664-2674 [doi]
- Where, What, Why: Towards Explainable Driver Attention PredictionYuchen Zhou 0002, Jiayu Tang, Xiaoyan Xiao, Yueyao Lin, Linkai Liu 0002, Zipeng Guo, Hao Fei 0001, Xiaobo Xia, Chao Gou. 2675-2685 [doi]
- Heuristic-Induced Multimodal Risk Distribution Jailbreak Attack for Multimodal Large Language ModelsTeng Ma, Xiaojun Jia, Ranjie Duan, Xinfeng Li, Yihao Huang 0001, Xiaoshuang Jia, Zhixuan Chu, Wenqi Ren. 2686-2696 [doi]
- Hypergraph Clustering Network with Partial Attribute ImputationQianqian Wang 0001, Bowen Zhao, Zhengming Ding, Wei Feng 0010, Quanxue Gao. 2697-2706 [doi]
- VRM: Knowledge Distillation via Virtual Relation MatchingWeijia Zhang, Fei Xie, Tom Weidong Cai, Chao Ma 0004. 2707-2717 [doi]
- From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-TuningPengkun Jiao, Bin Zhu 0006, Jingjing Chen 0001, Chong-Wah Ngo, Yu-Gang Jiang 0001. 2728-2737 [doi]
- You are Your Own Best Teacher: Achieving Centralized-level Performance in Federated Learning under Heterogeneous and Long-Tailed DataShanshan Yan, Zexi Li 0001, Chao Wu 0001, Meng Pang, Yang Lu 0009, Yan Yan 0001, Hanzi Wang. 2750-2759 [doi]
- Enhancing Few-Shot Vision-Language Classification With Large Multimodal Model FeaturesChancharik Mitra, Brandon Huang, Tianning Chai, Zhiqiu Lin, Assaf Arbelle, Rogério Feris, Leonid Karlinsky, Trevor Darrell, Deva Ramanan, Roei Herzig. 2760-2772 [doi]
- Safeguarding Vision-Language Models: Mitigating Vulnerabilities to Gaussian Noise in Perturbation-Based AttacksJiawei Wang, Yushen Zuo, Yuanjun Chai, Zhendong Liu, Yicheng Fu, Yichun Feng, Kin-Man Lam 0001. 2773-2782 [doi]
- Towards Adversarial Robustness via Debiased High-Confidence Logit AlignmentKejia Zhang 0003, Juanjuan Weng, Shaozi Li, Zhiming Luo. 2783-2792 [doi]
- Learning Visual Proxy for Compositional Zero-Shot LearningShiyu Zhang, Cheng Yan, Yang Liu, Chenchen Jing, Lei Zhou, Wenjun Wang. 2793-2802 [doi]
- Taming Flow Matching With Unbalanced Optimal Transport Into Fast PansharpeningZihan Cao, Yu Zhong, Liang-Jian Deng. 2803-2813 [doi]
- Evidential Knowledge DistillationLiangyu Xiang, Junyu Gao 0002, Changsheng Xu. 2814-2824 [doi]
- Know "No" Better: A Data-Driven Approach for Enhancing Negation Awareness in CLIPJunsung Park 0001, Jungbeom Lee, Jongyoon Song, Sangwon Yu, Dahuin Jung, Sungroh Yoon. 2825-2835 [doi]
- Intervening in Black Box: Concept Bottleneck Model for Enhancing Human Neural Network Mutual UnderstandingNuoye Xiong, Anqi Dong, Ning Wang 0047, Cong Hua, Guangming Zhu 0001, Lin Mei 0001, Peiyi Shen, Liang Zhang 0010. 2836-2845 [doi]
- VALLR: Visual ASR Language Model for Lip ReadingMarshall Thomas, Edward Fish, Richard Bowden. 2846-2856 [doi]
- Robust Dataset Condensation using Supervised Contrastive LearningNicole Hee-Yeon Kim, Hwanjun Song. 2857-2866 [doi]
- CaliMatch: Adaptive Calibration for Improving Safe Semi-Supervised LearningJinsoo Bae, Seoung Bum Kim, Hyungrok Do. 2867-2876 [doi]
- Hybrid-Tta: Continual Test-Time Adaptation Via Dynamic Domain Shift DetectionHyewon Park, Hyejin Park, Jueun Ko, Dongbo Min. 2877-2886 [doi]
- Resolving Token-Space Gradient Conflicts: Token Space Manipulation for Transformer-Based Multi-Task LearningWooseong Jeong, Kuk-Jin Yoon. 2887-2897 [doi]
- DisCoPatch: Taming Adversarially-Driven Batch Statistics for Improved Out-of-Distribution DetectionFrancisco Caetano, Christiaan G. A. Viviers, Luis Albert Zavala-Mondragón, Peter H. N. de With, Fons van der Sommen. 2898-2908 [doi]
- PLAN: Proactive Low-Rank Allocation for Continual LearningXiequn Wang, Zhan Zhuang, Yu Zhang. 2909-2918 [doi]
- Think Twice: Test-Time Reasoning for Robust CLIP Zero-Shot ClassificationShenyu Lu, Zhaoying Pan, Xiaoqian Wang. 2919-2929 [doi]
- Differential-Informed Sample Selection Accelerates Multimodal Contrastive LearningZihua Zhao, Feng Hong 0004, Mengxi Chen, Pengyi Chen, Benyuan Liu, Jiangchao Yao, Ya Zhang 0002, Yanfeng Wang 0001. 2930-2940 [doi]
- Dataset Distillation Via Vision-Language Category PrototypeYawen Zou, Guang Li, Duo Su, Zi Wang, Jun Yu, Chao Zhang. 2941-2950 [doi]
- Scaling and Taming Adversarial Training with Synthetic DataJuntao Wu, Xianting Huang, Yu Chen, Shuai Pang, Ke Wang. 2951-2960 [doi]
- A Constrained Optimization Approach for Gaussian Splatting from Coarsely-Posed Images and Noisy Lidar Point CloudsJizong Peng, Tze Ho Elden Tse, Kai Xu, Wenchao Gao, Angela Yao. 2961-2970 [doi]
- Soft Separation and Distillation: Toward Global Uniformity in Federated Unsupervised LearningHung-Chieh Fang, Hsuan-Tien Lin, Irwin King, Yifei Zhang. 2971-2980 [doi]
- Competitive Distillation: A Simple Learning Strategy for Improving Visual ClassificationDaqian Shi, Xiaolei Diao, Xu Chen, Cédric M. John. 2981-2990 [doi]
- Mitigating Catastrophic Overfitting in Fast Adversarial Training via Label Information EliminationChao Pan 0005, Ke Tang 0001, Qing Li 0001, Xin Yao 0001. 2991-3000 [doi]
- Fewer Denoising Steps or Cheaper Per-Step Inference: Towards Compute-Optimal Diffusion Model DeploymentZhenbang Du, Yonggan Fu, Lifu Wang, Jiayi Qian, Xiao Luo, Yingyan (Celine) Lin. 3001-3010 [doi]
- Chimera: Improving Generalist Model with Domain-Specific ExpertsTianshuo Peng, MingSheng Li, Jiakang Yuan, Hongbin Zhou, Renqiu Xia, Renrui Zhang, Lei Bai 0001, Song Mao, Bin Wang 0065, Aojun Zhou, Botian Shi, Tao Chen 0003, Bo Zhang 0069, Xiangyu Yue 0001. 3011-3022 [doi]
- SAUCE: Selective Concept Unlearning in Vision-Language Models with Sparse AutoencodersJiahui Geng, Qing Li. 3023-3033 [doi]
- Corvid: Improving Multimodal Large Language Models Towards Chain-of-Thought ReasoningJingjing Jiang, Chao Ma, Xurui Song, Hanwang Zhang, Jun Luo 0001. 3034-3046 [doi]
- Any-SSR: How Recursive Least Squares Works in Continual Learning of Large Language ModelsKai Tong, Kang Pan, Xiao Zhang 0053, Erli Meng, Run He, Yawen Cui, Nuoyan Guo, Huiping Zhuang. 3047-3057 [doi]
- Reminiscence Attack on Residuals: Exploiting Approximate Machine Unlearning for PrivacyYaxin Xiao, Qingqing Ye 0001, Li Hu, Huadi Zheng, Haibo Hu 0001, Zi Liang, Haoyang Li 0018, Yijie Jiao. 3058-3068 [doi]
- STEP-DETR: Advancing DETR-based Semi-Supervised Object Detection with Super Teacher and Pseudo-Label Guided Text QueriesTahira Shehzadi, Khurram Azeem Hashmi, Shalini Sarode, Didier Stricker, Muhammad Zeshan Afzal. 3069-3079 [doi]
- Adversarial Reconstruction Feedback for Robust Fine-Grained GeneralizationShijie Wang, Jian Shi, Haojie Li. 3080-3090 [doi]
- Not Only Vision: Evolve Visual Speech Recognition via Peripheral InformationZhaoxin Yuan, Shuang Yang, Shiguang Shan, Xilin Chen 0001. 3091-3100 [doi]
- KOEnsAttack: Towards Efficient Data-Free Black-Box Adversarial Attacks via Knowledge-Orthogonalized Substitute EnsemblesChaoyong Yang, Jia-Li Yin, Bin Chen, Zhaozhe Hu, Xiaolei Liu, Wei Lin. 3101-3110 [doi]
- FedPall: Prototype-Based Adversarial and Collaborative Learning for Federated Learning with Feature DriftYong Zhang, Feng Liang 0004, Guanghu Yuan, Min Yang 0007, Chengming Li 0004, Xiping Hu. 3111-3120 [doi]
- DuET: Dual Incremental Object Detection via Exemplar-Free Task ArithmeticMunish Monga, Vishal M. Chudasama, Pankaj Wasnik, Biplab Banerjee. 3121-3131 [doi]
- Dataset Ownership Verification for Pre-Trained Masked ModelsYuechen Xie, Jie Song, Yicheng Shan, Xiaoyan Zhang, Yuanyu Wan, Shengxuming Zhang, Jiarui Duan, Mingli Song. 3132-3142 [doi]
- Sparsity Outperforms Low-Rank Projections in Few-Shot AdaptationNairouz Mrabah, Nicolas Richet, Ismail Ben Ayed, Eric Granger. 3143-3152 [doi]
- Feature Decomposition-Recomposition in Large Vision-Language Model for Few-Shot Class-Incremental LearningZongyao Xue, Meina Kan, Shiguang Shan, Xilin Chen 0001. 3153-3162 [doi]
- VLRMBench: A Comprehensive and Challenging Benchmark for Vision-Language Reward ModelsJiacheng Ruan, Wenzhen Yuan 0002, Xiqi Gao 0001, Ye Guo, Daoxin Zhang, Zhe Xu, Yao Hu 0002, Ting Liu 0016, Yuzhuo Fu. 3163-3173 [doi]
- Adversarial Attention Perturbations for Large Object Detection TransformersZachary Yahn, Selim Furkan Tekin, Fatih Ilhan, Sihao Hu, Tiansheng Huang, Yichang Xu, Margaret Loper, Ling Liu 0001. 3184-3193 [doi]
- DISTIL: Data-Free Inversion of Suspicious Trojan Inputs via Latent DiffusionHossein Mirzaei, Zeinab Taghavi 0001, Sepehr Rezaee, Masoud Hadi, Moein Madadi, Mackenzie W. Mathis. 3194-3205 [doi]
- Guiding Diffusion-Based Articulated Object Generation by Partial Point Cloud Alignment and Physical Plausibility ConstraintsJens U. Kreber, Joerg Stueckler. 3206-3214 [doi]
- MISSRAG: Addressing the Missing Modality Challenge in Multimodal Large Language ModelsVittorio Pipoli, Alessia Saporita, Federico Bolelli, Marcella Cornia, Lorenzo Baraldi 0001, Costantino Grana, Rita Cucchiara, Elisa Ficarra. 3215-3224 [doi]
- ONLY: One-Layer Intervention Sufficiently Mitigates Hallucinations in Large Vision-Language ModelsZifu Wan, Ce Zhang 0009, Silong Yong, Martin Q. Ma, Simon Stepputtis, Louis-Philippe Morency, Deva Ramanan, Katia Sycara, Yaqi Xie 0001. 3225-3234 [doi]
- Adaptive Prompt Learning via Gaussian Outlier Synthesis for Out-Of-Distribution DetectionYongkang Zhang, Dongyu She, Zhong Zhou. 3235-3244 [doi]
- $\mathcal{F}_{M}$ FinMMR: Make Financial Numerical Reasoning More Multimodal, Comprehensive, and ChallengingZichen Tang, Haihong E, Jiacheng Liu, Zhongjun Yang, Rongjin Li, Zihua Rong, Haoyang He, Zhuodi Hao, Xinyang Hu, Kun Ji, Ziyan Ma, Mengyuan Ji, Jun Zhang, Chenghao Ma, Qianhe Zheng, Yang Liu, Yiling Huang, Xinyi Hu, Qing Huang, Zijian Xie, Shiyao Peng. 3245-3257 [doi]
- Trust but Verify: Programmatic VLM Evaluation in the WildViraj Prabhu, Senthil Purushwalkam, an Yan, Caiming Xiong, Ran Xu 0001. 3258-3267 [doi]
- FreeDNA: Endowing Domain Adaptation of Diffusion-Based Dense Prediction with Training-Free Domain Noise AlignmentHang Xu, Jie Huang 0017, Linjiang Huang, Dong Liu 0002, Yidi Liu, Feng Zhao 0004. 3268-3279 [doi]
- Progressive Distribution Bridging: Unsupervised Adaptation for Large-Scale Pre-Trained Models via Adaptive Auxiliary DataWeinan He, Yixin Zhang, Zilei Wang. 3280-3292 [doi]
- ALLGCD: Leveraging All Unlabeled Data for Generalized Category DiscoveryXinzi Cao, Ke Chen 0004, Feidiao Yang, Xiawu Zheng, Yonghong Tian 0001, Yutong Lu. 3293-3303 [doi]
- RALoc: Enhancing Outdoor LiDAR Localization via Rotation AwarenessYuyang Yang, We Li, Sheng Ao, Qingshan Xu, Shangshu Yu, Yu Guo, Yin Zhou, Siqi Shen, Cheng Wang. 3304-3313 [doi]
- External Knowledge Injection for CLIP-Based Class-Incremental LearningDa-Wei Zhou 0001, Kai-Wen Li, Jingyi Ning, Han-Jia Ye, Lijun Zhang, De-Chuan Zhan. 3314-3325 [doi]
- Cooperative Pseudo Labeling for Unsupervised Federated ClassificationKuangpu Guo, Lijun Sheng, Yongcan Yu, Jian Liang 0001, Zilei Wang, Ran He 0001. 3326-3336 [doi]
- SVIP: Semantically Contextualized Visual Patches for Zero-Shot LearningZhi Chen 0010, Zecheng Zhao, Jingcai Guo, Jingjing Li 0001, Zi Huang. 3346-3356 [doi]
- DreamLayer: Simultaneous Multi-Layer Generation via Diffusion ModelJunjia Huang, Pengxiang Yan, Jinhang Cai, Jiyang Liu, Zhao Wang, Yitong Wang, Xinglong Wu, Guanbin Li. 3357-3366 [doi]
- AutoOcc: Automatic Open-Ended Semantic Occupancy Annotation via Vision-Language Guided Gaussian SplattingXiaoyu Zhou, Jingqi Wang, Yongtao Wang, Yufei Wei, Nan Dong, Ming-Hsuan Yang 0001. 3367-3377 [doi]
- DWIM: Towards Tool-Aware Visual Reasoning via Discrepancy-Aware Workflow Generation & Instruct-Masking TuningFucai Ke, Vijay Kumar B. G, Xingjian Leng, Zhixi Cai, Zaid Khan 0001, Weiqing Wang 0001, Pari Delir Haghighi, Hamid Rezatofighi, Manmohan Chandraker. 3378-3389 [doi]
- FW-Merging: Scaling Model Merging with Frank-Wolfe OptimizationHao Mark Chen, Shell Xu Hu, Wayne Luk, Timothy M. Hospedales, Hongxiang Fan. 3390-3400 [doi]
- Augmenting Moment Retrieval: Zero-Dependency Two-Stage LearningZhengxuan Wei, Jiajin Tang, Sibei Yang. 3401-3412 [doi]
- Rep-MTL: Unleashing the Power of Representation-Level Task Saliency for Multi-Task LearningZedong Wang, Siyuan Li, Dan Xu. 3413-3423 [doi]
- Enhancing Numerical Prediction of MLLMS With Soft LabelingPei Wang, Zhaowei Cai, Hao Yang 0043, Davide Modolo, Ashwin Swaminathan. 3424-3434 [doi]
- Transparent Vision: A Theory of Hierarchical Invariant RepresentationsShuren Qi, Yushu Zhang 0001, Chao Wang 0028, Zhihua Xia, Xiaochun Cao, Fenglei Fan. 3435-3444 [doi]
- Fuse Before Transfer: Knowledge Fusion for Heterogeneous DistillationGuopeng Li 0004, Qiang Wang, Ke Yan, Shouhong Ding, Yuan Gao 0015, Gui-Song Xia. 3445-3454 [doi]
- What You Have is What You Track: Adaptive and Robust Multimodal TrackingYuedong Tan, Jiawei Shao, Eduard Zamfir, Ruanjun Li, Zhaochong An, Chao Ma 0004, Danda Pani Paudel, Luc Van Gool, Radu Timofte, Zongwei Wu. 3455-3465 [doi]
- Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language ModelsHyundong Jin, Hyung Jin Chang, Eunwoo Kim. 3466-3476 [doi]
- OrderChain: Towards General Instruct-Tuning for Stimulating the Ordinal Understanding Ability of MLLMJinhong Wang, Shuo Tong, Jian Liu, Dongqi Tang, Weiqiang Wang 0002, Wentong Li, Hongxia Xu, Danny Z. Chen, Jintai Chen, Jian Wu 0001. 3477-3487 [doi]
- DAP-MAE: Domain-Adaptive Point Cloud Masked Autoencoder for Effective Cross-Domain LearningZiqi Gao, Qiufu Li, LinLin Shen. 3488-3498 [doi]
- SFUOD: Source-Free Unknown Object DetectionKeon Hee Park, Seun-An Choe, Gyeong-Moon Park. 3499-3508 [doi]
- Activation Subspaces for Out-of-Distribution DetectionBaris Zöngür, Robin Hesse, Stefan Roth 0001. 3509-3519 [doi]
- A Recipe for Generating 3D Worlds from a Single ImageKatja Schwarz, Denis Rozumny, Samuel Rota Bulò, Lorenzo Porzi, Peter Kontschieder. 3520-3530 [doi]
- On the Complexity-Faithfulness Trade-Off of Gradient-Based ExplanationsAmir Mehrpanah, Matteo Gamba, Kevin Smith 0001, Hossein Azizpour. 3531-3541 [doi]
- Oasis: One Image is All You Need for Multimodal Instruction Data SynthesisLetian Zhang, Quan Cui, Bingchen Zhao, Cheng Yang. 3542-3551 [doi]
- Learning to Inference Adaptively for Multimodal Large Language ModelsZhuoyan Xu, Khoi Duc Nguyen, Preeti Mukherjee, Saurabh Bagchi, Somali Chaterji, Yingyu Liang, Yin Li 0003. 3552-3563 [doi]
- Self-Reinforcing Prototype Evolution with Dual-Knowledge Cooperation for Semi-Supervised Lifelong Person Re-IdentificationKunlun Xu, Fan Zhuo, Jiangmeng Li, Xu Zou 0002, Jiahuan Zhou. 3564-3574 [doi]
- Hierarchical Divide-And-Conquer Grouping for Classification Adaptation of Pre-Trained ModelsZiqian Lu, Yunlong Yu, Qinyue Tong, Jun Liu. 3575-3584 [doi]
- Knowledge Transfer from Interaction LearningYilin Gao, Kangyi Chen, Zhongxing Peng, Hengjie Lu, Shugong Xu. 3585-3595 [doi]
- DOGR: Towards Versatile Visual Document Grounding and ReferringYinan Zhou, Yuxin Chen, Haokun Lin, Yichen Wu, Shuyu Yang, Zhongang Qi, Chen Ma 0001, Li Zhu 0003. 3596-3606 [doi]
- Lark: Low-Rank Updates After Knowledge Localization for Few-Shot Class-Incremental LearningJinxin Shi, Jiabao Zhao, Yifan Yang 0001, Xingjiao Wu, Jiawen Li, Liang He 0001. 3607-3617 [doi]
- Advancing Textual Prompt Learning with Anchored AttributesZheng Li 0028, Yibing Song, Ming-Ming Cheng, Xiang Li 0041, Jian Yang 0003. 3618-3627 [doi]
- Decoupled Multi-Predictor Optimization for Inference-Efficient Model TuningLiwei Luo, Shuaitengyuan Li, Dongwei Ren, Qilong Wang 0001, Pengfei Zhu 0001, Qinghua Hu. 3628-3638 [doi]
- SHIFT: Smoothing Hallucinations by Information Flow Tuning for Multimodal Large Language ModelsSudong Wang, Yunjian Zhang, Yao Zhu 0003, Enci Liu, Jianing Li 0001, Yanwei Liu 0001, Xiangyang Ji. 3639-3649 [doi]
- Large Multi-modal Models Can Interpret Features in Large Multi-modal ModelsKaichen Zhang, Yifei Shen 0004, Bo Li, Ziwei Liu 0002. 3650-3661 [doi]
- SCAN: Bootstrapping Contrastive Pre-training for Data EfficiencyYangyang Guo, Mohan Kankanhalli. 3662-3672 [doi]
- A Conditional Probability Framework for Compositional Zero-Shot LearningPeng Wu 0014, Qiuxia Lai, Hao Fang 0010, Guo-Sen Xie, Yilong Yin, Xiankai Lu, Wenguan Wang. 3673-3683 [doi]
- Backdooring Self-Supervised Contrastive Learning by Noisy AlignmentTuo Chen, Jie Gui, Minjing Dong, Ju Jia, Lanting Fang, Jian Liu. 3684-3693 [doi]
- LYRA: An Efficient and Speech-Centric Framework for Omni-CognitionZhisheng Zhong, Chengyao Wang, Yuqi Liu 0003, Senqiao Yang, Longxiang Tang, Yuechen Zhang, Jingyao Li 0001, Tianyuan Qu, Yanwei Li, Yukang Chen, Shaozuo Yu, Sitong Wu, Eric Lo 0001, Shu Liu 0005, Jiaya Jia. 3694-3704 [doi]
- p-MoD: Building Mixture-of-Depths MLLMs via Progressive Ratio DecayJun Zhang 0106, Desen Meng, Zhengming Zhang, Zhenpeng Huang, Tao Wu 0020, Limin Wang 0002. 3705-3715 [doi]
- Enhancing Transferability of Targeted Adversarial Examples Via Inverse Target Gradient Competition and Spatial Distance StretchingZhankai Li, Weiping Wang, Jie Li, Shigeng Zhang, Yunan Hu, Song Guo 0001. 3716-3725 [doi]
- FedDifRC: Unlocking the Potential of Text-to-Image Diffusion Models in Heterogeneous Federated LearningHuan Wang, Haoran Li 0024, Huaming Chen, Jun Yan 0005, Jiahua Shi, Jun Shen 0001. 3726-3736 [doi]
- LoRA-FAIR: Federated LoRA Fine-Tuning with Aggregation and Initialization RefinementJieming Bian, Lei Wang 0199, Letian Zhang, Jie Xu 0001. 3737-3746 [doi]
- Category-Specific Selective Feature Enhancement for Long-Tailed Multi-Label Image ClassificationRuiqi Du, Xu Tang 0004, Xiangrong Zhang, Jingjing Ma 0001. 3757-3766 [doi]
- Registration beyond Points: General Affine Subspace Alignment via Geodesic Distance on Grassmann ManifoldJaeho Shin, Hyeonjae Gil, Junwoo Jang, Maani Ghaffari, Ayoung Kim. 3767-3776 [doi]
- Mind the Gap: Preserving and Compensating for the Modality Gap in CLIP-Based Continual LearningLinlan Huang, Xusheng Cao, Haori Lu, Yifan Meng, Fei Yang 0004, Xialei Liu. 3777-3786 [doi]
- Sibai: A Few-Shot Meta-Classifier for Poisoning Detection in Federated LearningMelanie Melanie Gotz, Torsten Kraub, Alexandra Dmitrienko. 3787-3797 [doi]
- Generalization-Preserved Learning: Closing the Backdoor to Catastrophic Forgetting in Continual Deepfake DetectionXueyi Zhang 0001, Peiyin Zhu, Chengwei Zhang, Zhiyuan Yan 0002, Jikang Cheng, Mingrui Lao, Siqi Cai 0002, Yanming Guo. 3798-3808 [doi]
- Dual Domain Control via Active Learning for Remote Sensing Domain Incremental Object DetectionJiachen Sun, De Cheng, Xi Yang, Nannan Wang. 3809-3818 [doi]
- Gradient Extrapolation for Debiased Representation LearningIhab Asaad, Maha Shadaydeh, Joachim Denzler. 3819-3829 [doi]
- VisNumBench: Evaluating Number Sense of Multimodal Large Language ModelsTengjin Weng, Jingyi Wang, Wenhao Jiang, Zhong Ming 0001. 3830-3840 [doi]
- FedAGC: Federated Continual Learning with Asymmetric Gradient CorrectionChengchao Zhang, Fanhua Shang, Hongyin Liu, Liang Wan, Wei Feng 0005. 3841-3850 [doi]
- Buffer-X: Towards Zero-Shot Point Cloud Registration in Diverse ScenesMinkyun Seo, Hyungtae Lim, Kanghee Lee, Luca Carlone, Jaesik Park. 3851-3862 [doi]
- Free-Merging: Fourier Transform for Efficient Model MergingShenghe Zheng, Hongzhi Wang. 3863-3873 [doi]
- RankCLIP: Ranking-Consistent Language-Image PretrainingYiming Zhang, Zhuokai Zhao, Zhaorun Chen, Zhili Feng, Zenghui Ding, Yining Sun. 3874-3884 [doi]
- Enhancing Adversarial Transferability by Balancing Exploration and Exploitation with Gradient-Guided SamplingZenghao Niu, Weicheng Xie 0001, Siyang Song, Zitong Yu, Feng Liu 0013, LinLin Shen. 3885-3894 [doi]
- An Efficient Post-Hoc Framework for Reducing Task Discrepancy of Text Encoders for Composed Image RetrievalJaeseok Byun, Seokhyeon Jeong, Wonjae Kim, Sanghyuk Chun, Taesup Moon. 3895-3904 [doi]
- Robin3D Improving 3D Large Language Model via Robust Instruction TuningWeitai Kang, Haifeng Huang 0001, Yuzhang Shang, Mubarak Shah, Yan Yan 0002. 3905-3915 [doi]
- FLSeg: Enhancing Privacy and Robustness in Federated Learning under Heterogeneous Data via Model SegmentationZichun Su, Zhi Lu, Yutong Wu, Renfei Shen, Songfeng Lu. 3916-3925 [doi]
- ZIUM: Zero-Shot Intent-Aware Adversarial Attack on Unlearned ModelsHyun Jun Yook, Ga San Jhun, Jae-Hyun Cho, Min Jeon, Donghyun Kim, Tae Hyung Kim 0001, Youn Kyu Lee. 3926-3935 [doi]
- Federated Prompt-Tuning with Heterogeneous and Incomplete Multimodal Client DataThu Hang Phung, Duong M. Nguyen, Thanh Trung Huynh, Quoc Viet Hung Nguyen, Trong Nghia Hoang, Phi-Le Nguyen. 3936-3946 [doi]
- Learning Interpretable Queries for Explainable Image Classification with Information PursuitStefan Kolek, Aditya Chattopadhyay, Kwan Ho Ryan Chan, Héctor Andrade-Loarca, Gitta Kutyniok, René Vidal. 3947-3956 [doi]
- ACAM-KD: Adaptive and Cooperative Attention Masking for Knowledge DistillationQizhen Lan, Qing Tian 0003. 3957-3966 [doi]
- Find a Scapegoat: Poisoning Membership Inference Attack and Defense to Federated LearningWenjin Mo, Zhiyuan Li, Minghong Fang, Mingwei Fang. 3967-3976 [doi]
- OpenVision: A Fully-Open, Cost-Effective Family of Advanced Vision Encoders for Multimodal LearningXianhang Li, Yanqing Liu, Haoqin Tu, Cihang Xie. 3977-3987 [doi]
- Integrating Visual Interpretation and Linguistic Reasoning for Geometric Problem SolvingZixian Guo, Ming Liu 0018, Qilong Wang 0001, Zhilong Ji, Jinfeng Bai, Lei Zhang 0006, Wangmeng Zuo. 3988-3998 [doi]
- SAFER: Sharpness Aware Layer-Selective Finetuning for Enhanced Robustness in Vision TransformersBhavna Gopal, Huanrui Yang, Mark Horton, Yiran Chen 0001. 3999-4008 [doi]
- Adding Additional Control to One-Step Diffusion with Joint Distribution MatchingYihong Luo, Tianyang Hu 0001, Yifan Song 0006, Jiacheng Sun, Zhenguo Li, Jing Tang 0004. 4009-4018 [doi]
- Semantic Equitable Clustering: A Simple and Effective Strategy for Clustering Vision TokensQihang Fan, Huaibo Huang, Mingrui Chen 0001, Ran He 0001. 4019-4028 [doi]
- SPD: Shallow Backdoor Protecting Deep Backdoor Against Backdoor DetectionShunjie Yuan, Xinghua Li 0001, Xuelin Cao, Haiyan Zhang, Mengyao Zhu, Robert H. Deng. 4029-4038 [doi]
- To Label or Not to Label: PALM - a Predictive Model for Evaluating Sample Efficiency in Active Learning ModelsJulia Machnio, Mads Nielsen, Mostafa Mehdipour-Ghazi. 4039-4048 [doi]
- Inference-Time Diffusion Model DistillationGeon Yeong Park, Sang Wan Lee, Jong Chul Ye. 4049-4058 [doi]
- 2D: Boosting Multimodal Learning with Gradient-Guided DistillationMohammed Rakib, Arunkumar Bagavathi. 4059-4068 [doi]
- Personalized Federated Learning Under Local SupervisionQiqi Liu, Jiaqiang Li, Yuchen Liu, Yaochu Jin, Lingjuan Lyu, Xiaohu Wu, Han Yu 0001. 4069-4079 [doi]
- Noise-Modeled Diffusion Models for Low-Light Spike Image RestorationRuonan Liu, Lin Zhu 0012, Xijie Xiang, Lizhi Wang 0001, Hua Huang 0001. 4080-4089 [doi]
- One Perturbation is Enough: On Generating Universal Adversarial Perturbations Against Vision-Language Pre-Training ModelsHao Fang 0011, Jiawei Kong 0001, Wenbo Yu, Bin Chen 0011, Jiawei Li 0006, Hao Wu, Shu-Tao Xia, Ke Xu 0002. 4090-4100 [doi]
- Why LVLMs are More Prone to Hallucinations in Longer Responses: The Role of ContextGe Zheng, Jiaye Qian, Jiajin Tang, Sibei Yang. 4101-4113 [doi]
- Intra-view and Inter-view Correlation Guided Multi-view Novel Class DiscoveryXinhang Wan, Jiyuan Liu 0003, Qian Qu, Suyuan Liu, Chuyu Zhang, Fangdi Wang, Xinwang Liu 0002, En Zhu, Kunlun He. 4114-4124 [doi]
- Prototype-Based Contrastive Learning with Stage-Wise Progressive Augmentation for Self-Supervised Fine-Grained LearningBaofeng Tan, Xiu-Shen Wei, Lin Zhao 0003. 4125-4134 [doi]
- Radiant Foam: Real-Time Differentiable Ray TracingShrisudhan Govindarajan, Daniel Rebain, Kwang Moo Yi, Andrea Tagliasacchi. 4135-4145 [doi]
- COSTARR: Consolidated Open Set Technique with Attenuation for Robust RecognitionRyan Rabinowitz, Steve Cruz, Walter J. Scheirer, Terrance E. Boult. 4146-4155 [doi]
- ALOcc: Adaptive Lifting-Based 3D Semantic Occupancy and Cost Volume-Based Flow PredictionsDubing Chen, Jin Fang, Wencheng Han, Xinjing Cheng, Junbo Yin, Chenzhong Xu, Fahad Shahbaz Khan, Jianbing Shen. 4156-4166 [doi]
- Information Density Principle for MLLM BenchmarksChunyi Li, Xiaozhe Li, Zicheng Zhang, Yuan Tian 0017, Ziheng Jia, Xiaohong Liu 0001, Xiongkuo Min, Jia Wang 0004, Haodong Duan, Kai Chen 0026, Guangtao Zhai. 4167-4177 [doi]
- Perspective-Aware Teaching: Adapting Knowledge for Heterogeneous DistillationJhe-Hao Lin, Yi Yao, Chan-Feng Hsu, Hong-Xia Xie, Hong-Han Shuai, Wen-Huang Cheng. 4178-4187 [doi]
- Is Meta-Learning Out? Rethinking Unsupervised Few-Shot Classification with Limited EntropyYunchuan Guan, Yu Liu 0040, Ke Zhou 0001, Zhiqi Shen 0001, Jenq-Neng Hwang, Serge J. Belongie, Lei Li 0050. 4188-4197 [doi]
- GenieBlue: Integrating Both Linguistic and Multimodal Capabilities for Large Language Models on Mobile DevicesXudong Lu, Yinghao Chen, Renshou Wu, Haohao Gao, Xi Chen 0072, Xue Yang 0005, Xiangyu Zhao, Aojun Zhou, Fangyuan Li, Yafei Wen, Xiaoxin Chen 0001, Shuai Ren 0002, Hongsheng Li 0001. 4198-4210 [doi]
- Learning to Unlearn While Retaining: Combating Gradient Conflicts in Machine UnlearningGaurav Patel, Qiang Qiu 0001. 4211-4221 [doi]
- Neural Architecture Search Driven by Locally Guided Diffusion for Personalized Federated LearningPeng Liao, Xilu Wang 0001, Yaochu Jin, Wenli Du, Han Hu. 4222-4231 [doi]
- Robust Multi-View Learning via Representation Fusion of Sample-Level Attention and Alignment of Simulated PerturbationJie Xu 0044, Na Zhao 0004, Gang Niu 0001, Masashi Sugiyama, Xiaofeng Zhu 0001. 4232-4241 [doi]
- PAN-Crafter: Learning Modality-Consistent Alignment for Pan-SharpeningJeonghyeok Do, Sungpyo Kim, Geunhyuk Youk, Jaehyup Lee, Munchurl Kim. 4242-4252 [doi]
- Attention to the Burstiness in Visual Prompt Tuning!Yuzhu Wang, Manni Duan, Shu Kong. 4253-4263 [doi]
- DIP: Unsupervised Dense In-Context Post-Training of Visual RepresentationsSophia Sirko-Galouchenko, Spyros Gidaris, Antonín Vobecký, Andrei Bursuc, Nicolas Thome. 4264-4274 [doi]
- Zero-Shot Vision Encoder Grafting via LLM SurrogatesKaiyu Yue, Vasu Singla, Menglin Jia, John Kirchenbauer, Rifaa Qadri, Zikui Cai, Abhinav Bhatele, Furong Huang, Tom Goldstein. 4275-4284 [doi]
- Long-Tailed Classification with Multi-Granularity SemanticsYuting Liu, Liu Yang, Yu Wang. 4285-4294 [doi]
- LLaVA-3D: A Simple Yet Effective Pathway to Empowering LMMs with 3D CapabilitiesChenming Zhu, Tai Wang, Wenwei Zhang, Jiangmiao Pang, Xihui Liu. 4295-4305 [doi]
- ReTracker: Exploring Image Matching for Robust Online Any Point TrackingDongli Tan, Xingyi He, Sida Peng, Yiqing Gong, Xing Zhu, Jiaming Sun 0002, Ruizhen Hu, Yujun Shen, Hujun Bao, Xiaowei Zhou 0001. 4306-4316 [doi]
- HIS-GPT: Towards 3D Human-In-Scene Multimodal UnderstandingJiahe Zhao, Ruibing Hou, Zejie Tian, Hong Chang 0001, Shiguang Shan. 4317-4327 [doi]
- Backdoor Attacks on Neural Networks Via One-Bit FlipXiang Li, Lannan Luo, Qiang Zeng 0001. 4328-4338 [doi]
- Long-LRM: Long-Sequence Large Reconstruction Model for Wide-Coverage Gaussian SplatsZiwen Chen, Hao Tan 0002, Kai Zhang 0045, Sai Bi, Fujun Luan, Yicong Hong, Fuxin Li, Zexiang Xu. 4349-4359 [doi]
- TR-PTS: Task-Relevant Parameter and Token Selection for Efficient TuningSiqi Luo, Haoran Yang, Yi Xin 0003, Mingyang Yi, Guangyang Wu, Guangtao Zhai, Xiaohong Liu 0001. 4360-4369 [doi]
- Exploring the Visual Feature Space for Multimodal Neural DecodingWeihao Xia 0001, A. Cengiz Öztireli. 4370-4379 [doi]
- Joint Diffusion Models in Continual LearningPawel Skiers, Kamil Deja. 4380-4390 [doi]
- TurboTrain: Towards Efficient and Balanced Multi-Task Learning for Multi-Agent Perception and PredictionZewei Zhou, Seth Z. Zhao, Tianhui Cai, Zhiyu Huang, Bolei Zhou, Jiaqi Ma 0003. 4391-4402 [doi]
- VITAL: More Understandable Feature Visualization through Distribution Alignment and Relevant Information FlowAda Gorgun, Bernt Schiele, Jonas Fischer. 4403-4412 [doi]
- Overcoming Dual Drift for Continual Long-Tailed Visual Question AnsweringFeifei Zhang 0001, ZhiHao Wang, Xi Zhang, Changsheng Xu. 4413-4423 [doi]
- ToolVQA: A Dataset for Multi-Step Reasoning VQA with External ToolsShaofeng Yin, Ting Lei, Yang Liu. 4424-4433 [doi]
- Continual Adaptation: Environment-Conditional Parameter Generation for Object Detection in Dynamic ScenariosDeng Li, Aming Wu, Yang Li, Yaowei Wang, Yahong Han. 4434-4443 [doi]
- SMP-Attack: Boosting the Transferability of Feature Importance-Based Adversarial Attack with Semantics-Aware Multi-Granularity PatchoutWen Yang, Guodong Liu, Di Ming. 4444-4454 [doi]
- Towards Comprehensive Lecture Slides Understanding: Large-Scale Dataset and Effective MethodEnming Zhang, Yuzhe Li, Yuliang Liu, Yingying Zhu 0005, Xiang Bai. 4455-4464 [doi]
- Backdoor Mitigation by Distance-Driven DetoxificationShaokui Wei, Jiayin Liu, Hongyuan Zha. 4465-4474 [doi]
- Zeroth-Order Fine-Tuning of LLMs in Random SubspacesZiming Yu, Pan Zhou 0002, Sike Wang, Jia Li 0002, Mi Tian 0008, Hua Huang 0001. 4475-4485 [doi]
- Gradient Decomposition and Alignment for Incremental Object DetectionWenLong Luo, Shizhou Zhang, De Cheng, Yinghui Xing, Guoqiang Liang 0001, Peng Wang 0015, Yanning Zhang 0001. 4486-4495 [doi]
- Synthesizing Near-Boundary OOD Samples for Out-of-Distribution DetectionJinglun Li, Kaixun Jiang, Zhaoyu Chen 0001, Bo Li 0115, Yao Tang, Weifeng Ge, Wenqiang Zhang. 4496-4506 [doi]
- CAVIS: Context-Aware Video Instance SegmentationSeunghun Lee 0002, Jiwan Seo, Kiljoon Han, Minwoo Choi, Sunghoon Im 0001. 4507-4517 [doi]
- Unlearning the Noisy Correspondence Makes CLIP More RobustHaochen Han, Alex Jinpeng Wang, Peijun Ye 0002, Fangming Liu. 4518-4528 [doi]
- FEVER-OOD: Free Energy Vulnerability Elimination for Robust Out-of-Distribution DetectionBrian K. S. Isaac-Medina, Mauricio Che, Yona Faline A. Gaus, Samet Akcay, Toby P. Breckon. 4529-4538 [doi]
- Local Dense Logit Relations for Enhanced Knowledge DistillationLiuchi Xu, Kang Liu, Jinshuai Liu, Lu Wang 0001, Lisheng Xu, Jun Cheng 0003. 4539-4549 [doi]
- Controllable Feature Whitening for Hyperparameter-Free Bias MitigationYooshin Cho, Hanbyel Cho, Janghyeon Lee 0001, Hyeong Gwon Hong, Jaesung Ahn, Junmo Kim 0002. 4550-4560 [doi]
- Differentially Private Fine-Tuning of Diffusion ModelsYu-Lin Tsai, Yizhe Li, Chia-Mu Yu, Xuebin Ren, Po-Yu Chen, Zekai Chen, Francois Buet-Golfouse. 4561-4571 [doi]
- FedXDS: Leveraging Model Attribution Methods to Counteract Data Heterogeneity in Federated LearningMaximilian Andreas Hoefler, Karsten Müller 0001, Wojciech Samek. 4572-4581 [doi]
- Towards Effective Foundation Model Adaptation for Extreme Cross-Domain Few-Shot LearningFei Zhou 0008, Peng Wang, Lei Zhang 0038, Wei Wei 0008, Chen Ding 0002, Guosheng Lin, Yanning Zhang 0001. 4582-4593 [doi]
- Consensus-Driven Active Model SelectionJustin Kay, Grant Van Horn, Subhransu Maji, Daniel Sheldon, Sara Beery. 4594-4604 [doi]
- Adversarial Purification via Super-Resolution and DiffusionMincheol Park, Cheonjun Park, Seungseop Lim, Mijin Koo, Hyunwuk Lee, Won Woo Ro, Suhyun Kim 0001. 4605-4615 [doi]
- FedWSQ: Efficient Federated Learning with Weight Standardization and Distribution-Aware Non-Uniform QuantizationSeung Wook Kim, Seongyeol Kim, Jiah Kim, Seowon Ji, Se-Ho Lee. 4616-4625 [doi]
- CMAD: Correlation-Aware and Modalities-Aware Distillation for Multimodal Sentiment Analysis with Missing ModalitiesYan Zhuang 0002, Minhao Liu, Wei Bai, Yanru Zhang, Xiaoyue Zhang, Jiawen Deng, Fuji Ren. 4626-4636 [doi]
- SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language ModelsXianfu Cheng, Wei Zhang 0384, Shiwei Zhang, Jian Yang 0030, Xiangyuan Guan, Xianjie Wu, Xiang Li 0117, Ge Zhang 0009, Jiaheng Liu, Yuying Mai, Yutao Zeng, Zhoufutu Wen, Ke Jin, Baorui Wang, Weixiao Zhou, Yunhong Lu, Hangyuan Ji, Tongliang Li, Wenhao Huang 0001, Zhoujun Li 0001. 4637-4646 [doi]
- 2.5 Years in Class: A Multimodal Textbook for Vision-Language PretrainingWenqi Zhang 0001, Hang Zhang, Xin Li 0056, Jiashuo Sun, Yongliang Shen 0001, Weiming Lu 0001, Deli Zhao, Yueting Zhuang, Lidong Bing. 4647-4658 [doi]
- Revelio: Interpreting and Leveraging Semantic Information in Diffusion ModelsDahye Kim 0004, Xavier Thomas, Deepti Ghadiyaram. 4659-4669 [doi]
- CLIP-GS: Unifying Vision-Language Representation with 3D Gaussian SplattingSiyu Jiao, Haoye Dong, Yuyang Yin, Zequn Jie, Yinlong Qian, Yao Zhao 0001, Humphrey Shi, Yunchao Wei. 4670-4680 [doi]
- ProJudge: A Multi-Modal Multi-Discipline Benchmark and Instruction-Tuning Dataset for Mllm-Based Process JudgesJiaxin Ai, Pengfei Zhou, Zhaopan Xu, Ming Li, Fanrui Zhang, Zizhen Li, Jianwen Sun, Yukang Feng, Baojin Huang, Zhongyuan Wang 0001, Kaipeng Zhang. 4681-4690 [doi]
- Failure Cases Are Better Learned but Boundary Says Sorry: Facilitating Smooth Perception Change for Accuracy-Robustness Trade-Off in Adversarial TrainingYanyun Wang, Li Liu. 4691-4700 [doi]
- Vehiclemae: View-Asymmetry Mutual Learning for Vehicle Re-Identification Pre-Training Via Masked AutoencodersQi Wang 0061, Zeyu Zhang, Dong Wang 0080, Di Gai, Xin Xiong 0016, Jiyang Xu, Ruihua Zhou. 4701-4711 [doi]
- Splattalk: 3D VQA with Gaussian SplattingAnh Thai, Songyou Peng, Kyle Genova, Leonidas J. Guibas, Thomas A. Funkhouser. 4712-4721 [doi]
- CaO2: Rectifying Inconsistencies in Diffusion-Based Dataset DistillationHaoxuan Wang 0002, Zhenghao Zhao, Junyi Wu 0002, Yuzhang Shang, Gaowen Liu, Yan Yan 0002. 4722-4731 [doi]
- Taming the Untamed: Graph-Based Knowledge Retrieval and Reasoning for MLLMs to Conquer the UnknownBowen Wang 0002, Zhouqiang Jiang, Yasuaki Susumu, Shotaro Miwa, Tianwei Chen 0001, Yuta Nakashima. 4732-4742 [doi]
- MambaMl: Exploring State Space Models for Multi-Label Image ClassificationXuelin Zhu, Jian Liu, Jiuxin Cao, Bing Wang. 4743-4753 [doi]
- SMStracker: Tri-Path Score Mask Sigma Fusion for Multi-Modal TrackingSixian Chan 0001, Zedong Li, Wenhao Li, Shijian Lu, Chunhua Shen, Xiaoqin Zhang 0002. 4766-4775 [doi]
- Enhancing Transformers Through Conditioned Embedded TokensHemanth Saratchandran, Simon Lucey. 4786-4795 [doi]
- Improved Noise Schedule for Diffusion TrainingTiankai Hang, Shuyang Gu, Jianmin Bao, Fangyun Wei, Dong Chen 0003, Xin Geng 0001, Baining Guo. 4796-4806 [doi]
- How Do Multimodal Large Language Models Handle Complex Multimodal Reasoning? Placing Them in an Extensible Escape GameZiyue Wang, Yurui Dong, Fuwen Luo, Minyuan Ruan, Zhili Cheng, Chi Chen, Peng Li, Yang Liu. 4807-4817 [doi]
- One Encoder to Rule Them All: Representation Learning for Model-Free Visual Reinforcement Learning Using Fourier Neural OperatorsParag Dutta, Mohd Ayyoob, Shalabh Bhatnagar, Ambedkar Dukkipati. 4818-4827 [doi]
- LIFT: Latent Implicit Functions for Task- and Data-Agnostic EncodingAmirhossein Kazerouni, Soroush Mehraban, Michael Brudno, Babak Taati. 4828-4837 [doi]
- Improving Noise Efficiency in Privacy-Preserving Dataset DistillationRunkai Zheng, Vishnu Asutosh Dasu, Yinong Oliver Wang, Haohan Wang, Fernando De la Torre. 4838-4847 [doi]
- Boosting MLLM Reasoning with Text-Debiased Hint-GRPOQihan Huang, Weilong Dai, Jinlong Liu, Wanggui He, Hao Jiang 0062, Mingli Song, Jingyuan Chen, Chang Yao 0001, Jie Song 0011. 4848-4857 [doi]
- Towards Real Unsupervised Anomaly Detection Via Confident Meta-LearningMuhammad Aqeel, Shakiba Sharifi, Marco Cristani, Francesco Setti. 4858-4867 [doi]
- RIPE: Reinforcement Learning on Unlabeled Image Pairs for Robust Keypoint ExtractionJohannes Künzel, Anna Hilsmann, Peter Eisert. 4868-4877 [doi]
- Efficient Adaptation of Pre-Trained Vision Transformer Underpinned by Approximately Orthogonal Fine-Tuning StrategyYiting Yang, Hao Luo, Yuan Sun, Qingsen Yan, Haokui Zhang, Wei Dong 0010, Guoqing Wang 0001, Peng Wang 0023, Yang Yang 0002, Hengtao Shen. 4878-4887 [doi]
- DiffRefine: Diffusion-Based Proposal Specific Point Cloud Densification for Cross-Domain Object DetectionSangyun Shin, Yuhang He, Xinyu Hou, Samuel Hodgson, Andrew Markham, Niki Trigoni. 4888-4897 [doi]
- On the Robustness Tradeoff in Fine-TuningKunyang Li 0001, Jean-Charles Noirot Ferrand, Ryan Sheatsley, Blaine Hoak, Yohan Beugin, Eric Pauley, Patrick D. McDaniel. 4898-4907 [doi]
- Understanding Flatness in Generative Models: Its Role and BenefitsTaehwan Lee, Kyeongkook Seo, Jaejun Yoo, Sung Whan Yoon. 4908-4917 [doi]
- Rayzer: a Self-Supervised Large View Synthesis ModelHanwen Jiang, Hao Tan 0002, Peng Wang 0099, Hai Jin 0001, Yue Zhao, Sai Bi, Kai Zhang 0045, Fujun Luan, Kalyan Sunkavalli, Qixing Huang, Georgios Pavlakos. 4918-4929 [doi]
- EVER: Exact Volumetric Ellipsoid Rendering for Real-Time View SynthesisAlexander Mai, Peter Hedman, George Kopanas, Dor Verbin, David Futschik, Qiangeng Xu, Falko Kuester, Jonathan T. Barron, Yinda Zhang 0001. 4930-4939 [doi]
- Self-Ensembling Gaussian Splatting for Few-Shot Novel View SynthesisChen Zhao 0025, Xuan Wang 0009, Tong Zhang 0023, Saqib Javed, Mathieu Salzmann. 4940-4950 [doi]
- Back on Track: Bundle Adjustment for Dynamic Scene ReconstructionWeirong Chen, Ganlin Zhang 0001, Felix Wimbauer, Rui Wang 0037, Nikita Araslanov, Andrea Vedaldi, Daniel Cremers. 4951-4960 [doi]
- SceneSplat: Gaussian Splatting-Based Scene Understanding with Vision-Language PretrainingYue Li 0036, Qi Ma, Runyi Yang, Huapeng Li, Mengjiao Ma, Bin Ren 0005, Nikola Popovic 0001, Nicu Sebe, Ender Konukoglu, Theo Gevers, Luc Van Gool, Martin R. Oswald, Danda Pani Paudel. 4961-4972 [doi]
- Importance-Based Token Merging for Efficient Image and Video GenerationHaoyu Wu, Jingyi Xu, Hieu Le 0001, Dimitris Samaras. 4983-4995 [doi]
- Knowledge Distillation for Learned Image CompressionYunuo Chen 0002, Zezheng Lyu, Bing He, Ning Cao, Gang Chen, Guo Lu, Wenjun Zhang 0001. 4996-5006 [doi]
- Distilling Diffusion Models to Efficient 3D LiDAR Scene CompletionShengyuan Zhang, An Zhao, Ling Yang 0006, Zejian Li, Chenye Meng, Haoran Xu, Tianrun Chen, Anyang Wei, Perry Pengyun Gu, Lingyun Sun. 5007-5016 [doi]
- Heavy Labels Out! Dataset Distillation with Label Space LighteningRuonan Yu, Songhua Liu, Zigeng Chen, Jingwen Ye, Xinchao Wang. 5017-5026 [doi]
- HAMSt3R: Human-Aware Multi-View Stereo 3D ReconstructionSara Rojas 0001, Matthieu Armando, Bernard Ghanem, Philippe Weinzaepfel, Vincent Leroy 0003, Grégory Rogez. 5027-5037 [doi]
- Time-Aware Auto White Balance in Mobile PhotographyMahmoud Afifi, Luxi Zhao 0002, Abhijith Punnappurath, Mohammed A. Abdelsalam, Ran Zhang, Michael S. Brown. 5038-5047 [doi]
- VolumetricSMPL: A Neural Volumetric Body Model for Efficient Interactions, Contacts, and CollisionsMarko Mihajlovic, Siwei Zhang, Gen Li 0010, Kaifeng Zhao 0004, Lea Müller, Siyu Tang 0001. 5060-5070 [doi]
- Contact-Aware Refinement of Human Pose Pseudo-Ground Truth via Bioimpedance SensingMaria-Paola Forte, Nikos Athanasiou, Giulia Ballardini, Jan Ulrich Bartels, Katherine J. Kuchenbecker, Michael J. Black. 5071-5080 [doi]
- Hyper-Depth: Hypergraph-Based Multi-Scale Representation Fusion for Monocular Depth EstimationLin Bie, Siqi Li 0001, Yifan Feng 0001, Yue Gao 0002. 5081-5090 [doi]
- Quanta Neural Networks: From Photons to PerceptionVarun Sundar, Tianyi Zhang, Sacha Jungerman, Mohit Gupta 0001. 5091-5101 [doi]
- EDFFDNet: Towards Accurate and Efficient Unsupervised Multi-Grid Image RegistrationHaokai Zhu, Bo Qu, Si-Yuan Cao, Runmin Zhang, Shujie Chen 0001, Bailin Yang, Hui-Liang Shen. 5102-5111 [doi]
- Adadrive: Self-Adaptive Slow-Fast System for Language-Grounded Autonomous DrivingRuifei Zhang, Junlin Xie, Wei Zhang, Weikai Chen 0001, Xiao Tan 0001, Xiang Wan, Guanbin Li. 5112-5121 [doi]
- SIGMAN: Scaling 3D Human Gaussian Generation with Millions of AssetsYuhang Yang 0002, Fengqi Liu, Yixing Lu, Qin Zhao, Pingyu Wu, Wei Zhai, Ran Yi 0002, Yang Cao 0010, Lizhuang Ma, Zheng-Jun Zha, Junting Dong. 5122-5133 [doi]
- Depth Any Event Stream: Enhancing Event-based Monocular Depth Estimation via Dense-to-Sparse DistillationJinjing Zhu, Tianbo Pan, Zidong Cao, Yexin Liu, James T. Kwok, Hui Xiong 0001. 5146-5155 [doi]
- PRVQL: Progressive Knowledge-Guided Refinement for Robust Egocentric Visual Query LocalizationBing Fan, Yunhe Feng, Yapeng Tian, James Chenhao Liang, Yuewei Lin, Yan Huang 0002, Heng Fan 0001. 5156-5165 [doi]
- WildSeg3D: Segment Any 3D Objects in the Wild from 2D ImagesYansong Guo, Jie Hu 0018, Yansong Qu, Liujuan Cao. 5166-5176 [doi]
- AerialVG: A Challenging Benchmark for Aerial Visual Grounding by Exploring Positional RelationsJunli Liu, Qizhi Chen, Zhigang Wang 0002, Yiwen Tang, Yiting Zhang, Chi Yan, Dong Wang 0028, Xuelong Li 0001, Bin Zhao 0001. 5177-5187 [doi]
- Consistent Time-of-Flight Depth Denoising via Graph-Informed Geometric AttentionWeida Wang, Changyong He, Jin Zeng 0004, Di Qiu. 5188-5197 [doi]
- Extending Foundational Monocular Depth Estimators to Fisheye Cameras with Calibration TokensSuchisrit Gangopadhyay, Jung Hee Kim 0001, Xien Chen, Patrick Rim, Hyoungseob Park, Alex Wong 0001. 5198-5209 [doi]
- Selective Contrastive Learning for Weakly Supervised Affordance GroundingWonJun Moon, Hyun Seok Seong, Jae-Pil Heo. 5210-5220 [doi]
- OpenSubstance: A High-Quality Measured Dataset of Multi-View and -Lighting Images and ShapesFan Pei, Jinchen Bai, Xiang Feng 0004, Zoubin Bi, Kun Zhou 0001, Hongzhi Wu. 5221-5231 [doi]
- PhysSplat: Efficient Physics Simulation for 3D Scenes via MLLM-Guided Gaussian SplattingHaoyu Zhao, Hao Wang 0218, Xingyue Zhao, Hao Fei 0001, Hongqiu Wang, Chengjiang Long, Hua Zou 0002. 5242-5252 [doi]
- AllTracker: Efficient Dense Point Tracking at High ResolutionAdam W. Harley, Yang You 0004, Xinglong Sun, Yang Zheng, Nikhil Raghuraman, Yunqi Gu, Sheldon Liang, Wen-Hsuan Chu, Achal Dave, Suya You, Rares Ambrus, Katerina Fragkiadaki, Leonidas J. Guibas. 5253-5262 [doi]
- PseudoMapTrainer: Learning Online Mapping without HD MapsChristian Löwens, Thorben Funke, Jingchao Xie, Alexandru Paul Condurache. 5263-5272 [doi]
- LONG3R: Long Sequence Streaming 3D ReconstructionZhuoguang Chen, Minghui Qin, Tianyuan Yuan, Zhe Liu, Hang Zhao. 5273-5284 [doi]
- DAMap: Distance-Aware MapNet for High Quality HD Map ConstructionJinpeng Dong, Chen Li, Yutong Lin, Jingwen Fu, Sanping Zhou, Nanning Zheng 0001. 5285-5294 [doi]
- VGMamba: Attribute-to-Location Clue Reasoning for Quantity-Agnostic 3D Visual GroundingYihang Zhu, Jinhao Zhang, Yuxuan Wang, Aming Wu, Cheng Deng 0002. 5295-5304 [doi]
- OV3D-CG: Open-Vocabulary 3D Instance Segmentation with Contextual GuidanceMingquan Zhou, Chen He, Ruiping Wang 0001, Xilin Chen 0001. 5305-5314 [doi]
- AnnofreeOD: Detecting All Classes at Low Frame Rates Without Human AnnotationsBoyi Sun, Yuhang Liu, Houxin He, Yonglin Tian, Fei-Yue Wang 0001. 5315-5325 [doi]
- PriOr-Flow: Enhancing Primitive Panoramic Optical Flow with Orthogonal ViewLongliang Liu, Miaojie Feng, Junda Cheng, Jijun Xiang, Xuan Zhu 0009, Xin Yang 0008. 5326-5336 [doi]
- Learning 4D Embodied World ModelsHaoyu Zhen, Qiao Sun 0003, Hongxin Zhang, Junyan Li, Siyuan Zhou, Yilun Du, Chuang Gan 0001. 5337-5347 [doi]
- DAViD: Data-Efficient and Accurate Vision Models from Synthetic Data DAViD also references Michelangelo's David - an iconic symbol of anatomical precision-and the David vs. Goliath story, reflecting our small yet powerful dataset and modelsFatemeh Saleh, Sadegh Aliakbarian, Charlie Hewitt, Lohit Petikam, Xian Xiao, Antonio Criminisi, Thomas J. Cashman 0001, Tadas Baltrusaitis. 5348-5358 [doi]
- Marigold-DC: Zero-Shot Monocular Depth Completion with Guided DiffusionMassimiliano Viola, Kevin Qu, Nando Metzger, Bingxin Ke, Alexander Becker 0002, Konrad Schindler, Anton Obukhov. 5359-5370 [doi]
- Multi-View Gaze Target EstimationQiaomu Miao, Vivek Raju Golani, Jingyi Xu, Progga Paromita Dutta, Minh Hoai, Dimitris Samaras. 5371-5381 [doi]
- Bayesian-Inspired Space-Time SuperpixelsKent Gauen, Stanley H. Chan. 5382-5391 [doi]
- Multimodal LLM Guided Exploration and Active Mapping Using Fisher InformationWen Jiang 0008, Boshu Lei, Katrina Ashton, Kostas Daniilidis. 5392-5404 [doi]
- Multispectral Demosaicing via Dual CamerasSaiKiran Kumar Tedla, Junyong Lee 0001, Beixuan Yang, Mahmoud Afifi, Michael S. Brown. 5405-5414 [doi]
- DepthSync: Diffusion Guidance-Based Depth Synchronization for Scale- and Geometry-Consistent Video Depth EstimationYuejiang Dong, Wang Zhao 0001, Jiale Xu, Ying Shan, Song-Hai Zhang. 5415-5425 [doi]
- Generative Modeling of Shape-Dependent Self-Contact Human PosesTakehiko Ohkawa, Jihyun Lee, Shunsuke Saito, Jason M. Saragih, Fabian Prada, Yichen Xu, Shoou-I Yu, Ryosuke Furuta, Yoichi Sato 0001, Takaaki Shiratori. 5426-5436 [doi]
- Enhanced Event-Based Dense Stereo via Cross-Sensor Knowledge DistillationHaihao Zhang, Yunjian Zhang, Jianing Li, Lin Zhu, Meng Lv, Yao Zhu, Yanwei Liu, Xiangyang Ji. 5437-5447 [doi]
- PBFG: A New Physically-Based Dataset and Removal of Lens Flares and GlaresJie Zhu, Sungkil Lee. 5448-5457 [doi]
- 2Net: A Decoupled Two-Stage Spatio-Temporal Forecasting Model for Complex Meteorological SystemsShaohan Li, Hao Yang, Min Chen, Xiaolin Qin. 5458-5468 [doi]
- GSOT3D: Towards Generic 3D Single Object Tracking in the WildYifan Jiao, Yunhao Li, Junhua Ding 0001, Qing Yang 0003, Song Fu, Heng Fan 0001, Libo Zhang 0001. 5469-5478 [doi]
- MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video UnderstandingTongtong Cheng, Rongzhen Li, Yixin Xiong, Tao Zhang, Jing Wang, Kai Liu. 5479-5489 [doi]
- Knowledge-Guided Part SegmentationXuejian Gou, Fang Liu 0001, Licheng Jiao, Shuo Li 0010, Lingling Li 0002, Hao Wang 0211, Xu Liu 0006, Puhua Chen, Wenping Ma 0001. 5490-5500 [doi]
- Robust 3D-Masked Part-Level Editing in 3D Gaussian Splatting with Regularized Score Distillation SamplingHayeon Kim, Ji Ha Jang, Se Young Chun. 5501-5510 [doi]
- COSMO: Combination of Selective Memorization for Low-Cost Vision-and-Language NavigationSiqi Zhang, Yanyuan Qiao, Qunbo Wang, Zike Yan, Qi Wu 0001, Zhihua Wei 0001, Jing Liu 0001. 5511-5522 [doi]
- TriDi: Trilateral Diffusion of 3D Humans, Objects, and InteractionsIlia A. Petrov 0001, Riccardo Marin, Julian Chibane, Gerard Pons-Moll. 5523-5535 [doi]
- NavMorph: A Self-Evolving World Model for Vision-and-Language Navigation in Continuous EnvironmentsXuan Yao 0001, Junyu Gao 0002, Changsheng Xu. 5536-5546 [doi]
- Beyond RGB: Adaptive Parallel Processing for RAW Object DetectionShani Gamrian, Hila Barel, Feiran Li, Masakazu Yoshimura, Daisuke Iso. 5547-5557 [doi]
- Gleam: Learning Generalizable Exploration Policy for Active Mapping in Complex 3D Indoor ScenesXiao Chen, Tai Wang, Quanyi Li, Tao Huang, Jiangmiao Pang, Tianfan Xue. 5558-5568 [doi]
- SMARTIES: Spectrum-Aware Multi-Sensor Auto-Encoder for Remote Sensing ImagesGencer Sumbul, Chang Xu 0027, Emanuele Dalsasso, Devis Tuia. 5569-5578 [doi]
- PHATNet: A Physics-Guided Haze Transfer Network for Domain-Adaptive Real-World Image DehazingFu-Jen Tsai, Yan-Tsung Peng, Yen-Yu Lin, Chia-Wen Lin. 5591-5600 [doi]
- Efficient Visual Place Recognition Through Multimodal Semantic Knowledge IntegrationSitao Zhang, Hongda Mao, Qingshuang Chen, Yelin Kim. 5601-5610 [doi]
- PoseSyn: Synthesizing Diverse 3D Pose Data from In-the-Wild 2D DataChangHee Yang, Hyeonseop Song, Seokhun Choi, Seungwoo Lee, Jaechul Kim, Hoseok Do. 5611-5621 [doi]
- STI-Bench: Are MLLMs Ready for Precise Spatial-Temporal World Understanding?Yun Li, Yiming Zhang, Tao Lin, Xiangrui Liu, Wenxiao Cai, Zheng Liu, Bo Zhao. 5622-5632 [doi]
- Articulate3D: Holistic Understanding of 3D Scenes as Universal Scene DescriptionAnna-Maria Halacheva, Yang Miao, Jan-Nico Zaech, Xi Wang 0021, Luc Van Gool, Danda Pani Paudel. 5633-5644 [doi]
- TorchAdapt: Towards Light-Agnostic Real-Time Visual PerceptionKhurram Azeem Hashmi, Karthik Palyakere Suresh, Didier Stricker, Muhammad Zeshan Afzal. 5645-5656 [doi]
- Human-in-the-Loop Local Corrections of 3D Scene Layouts via InfillingChristopher Xie, Armen Avetisyan, Henry Howard-Jenkins, Yawar Siddiqui, Julian Straub, Richard A. Newcombe, Vasileios Balntas, Jakob J. Engel. 5657-5666 [doi]
- FlowSeek: Optical Flow Made Easier with Depth Foundation Models and Motion BasesMatteo Poggi, Fabio Tosi. 5667-5679 [doi]
- POMATO: Marrying Pointmap Matching with Temporal Motions for Dynamic 3D ReconstructionSongyan Zhang, Yongtao Ge, Jinyuan Tian, Guangkai Xu, Hao Chen 0041, Chen Lv, Chunhua Shen. 5680-5689 [doi]
- CAT: A Unified Click-and-Track Framework for Realistic TrackingYongsheng Yuan, Jie Zhao 0014, Dong Wang 0004, Huchuan Lu. 5690-5700 [doi]
- Diffusion-Based Extreme High-Speed Scenes Reconstruction with the Complementary Vision SensorYapeng Meng, Yihan Lin, Taoyi Wang, Yuguo Chen, Lijian Wang, Rong Zhao. 5701-5710 [doi]
- GARF: Learning Generalizable 3D Reassembly for Real-World FracturesSihang Li 0001, Zeyu Jiang, Grace Chen, Chenyang Xu, Siqi Tan, Xue Wang, Irving Fang, Kristof Zyskowski, Shannon P. McPherron, Radu Iovita, Chen Feng 0002, Jing Zhang. 5711-5721 [doi]
- DepR: Depth Guided Single-View Scene Reconstruction with Instance-Level DiffusionQingcheng Zhao, Xiang Zhang 0015, Haiyang Xu 0002, Zeyuan Chen, Jianwen Xie, Yuan Gao, Zhuowen Tu. 5722-5733 [doi]
- XTrack: Multimodal Training Boosts RGB-X Video Object TrackersYuedong Tan, Zongwei Wu, Yuqian Fu, Zhuyun Zhou, Guolei Sun, Eduard Zamfir, Chao Ma 0004, Danda Pani Paudel, Luc Van Gool, Radu Timofte. 5734-5744 [doi]
- DiffuMatch: Category-Agnostic Spectral Diffusion Priors for Robust Non-Rigid Shape MatchingEmery Pierson, Lei Li 0038, Angela Dai, Maks Ovsjanikov. 5745-5756 [doi]
- Joint Learning of Pose Regression and Denoising Diffusion with Score Scaling Sampling for Category-Level 6D Pose EstimationSeunghyun Lee, Tae-Kyun Kim. 5757-5768 [doi]
- UnrealZoo: Enriching Photo-Realistic Virtual Worlds for Embodied AIFangwei Zhong, Kui Wu 0007, Churan Wang, Hao Chen 0062, Hai Ci, Zhoujun Li 0001, Yizhou Wang 0001. 5769-5779 [doi]
- SAC-GNC: Sample Consensus for Adaptive Graduated Non-ConvexityValter Piedade, Chitturi Sidhartha, Joseé Gaspar, Venu Madhav Govindu, Pedro Miraldo. 5780-5790 [doi]
- Performing Defocus Deblurring by Modeling its Formation ProcessZhengbo Zhang, Lin Geng Foo, Hossein Rahmani 0001, Jun Liu 0036, De Wen Soh. 5791-5801 [doi]
- Ultra-Precision 6DoF Pose Estimation Using 2-D Interpolated Discrete Fourier TransformGuowei Shi, Zian Mao, Peisen Huang. 5802-5810 [doi]
- AstroLoc: Robust Space to Ground Image LocalizerGabriele Moreno Berton, Alex Stoken, Carlo Masone. 5811-5820 [doi]
- Real3D: Towards Scaling Large Reconstruction Models with Real ImagesHanwen Jiang, Qixing Huang, Georgios Pavlakos. 5821-5833 [doi]
- Do It Yourself: Learning Semantic Correspondence from Pseudo-LabelsOlaf Dükel, Thomas Wimmer 0001, Christian Theobalt, Christian Rupprecht 0001, Adam Kortylewski. 5834-5844 [doi]
- EMatch: A Unified Framework for Event-Based Optical Flow and Stereo MatchingPengjie Zhang, Lin Zhu 0012, Xiao Wang 0014, Lizhi Wang 0001, Hua Huang 0001. 5845-5855 [doi]
- PanSt3R: Multi-View Consistent Panoptic SegmentationLojze Zust, Yohann Cabon, Juliette Marrie, Leonid Antsfeld, Boris Chidlovskii, Jérôme Revaud, Gabriela Csurka. 5856-5886 [doi]
- Stochastic Interpolants for Revealing Stylistic Flows Across the History of ArtPingchuan Ma 0006, Ming Gui, Johannes Schusterbauer, Xiaopei Yang, Olga Grebenkova, Vincent Tao Hu, Björn Ommer. 5867-5878 [doi]
- Is Tracking Really More Challenging in First Person Egocentric Vision?Matteo Dunnhofer, Zaira Manigrasso, Christian Micheloni. 5879-5889 [doi]
- Where am I? Cross-View Geo-localization with Natural Language DescriptionsJunyan Ye, Honglin Lin, Leyan Ou, Dairong Chen, Zihao Wang, Qi Zhu, Conghui He, Weijia Li. 5890-5900 [doi]
- Less is More: Empowering GUI Agent with Context-Aware SimplificationGongwei Chen, Xurui Zhou, Rui Shao 0001, Yibo Lyu, Kaiwen Zhou 0001, Shuai Wang 0020, Wentao Li, Yinchuan Li, Zhongang Qi, Liqiang Nie. 5901-5911 [doi]
- CityNav: A Large-Scale Dataset for Real-World Aerial NavigationJungdae Lee, Taiki Miyanishi, Shuhei Kurita, Koya Sakamoto, Daichi Azuma, Yutaka Matsuo, Nakamasa Inoue. 5912-5922 [doi]
- VLDrive: Vision-Augmented Lightweight MLLMs for Efficient Language-Grounded Autonomous DrivingRuifei Zhang, Wei Zhang, Xiao Tan 0001, Sibei Yang, Xiang Wan, Xiaonan Luo, Guanbin Li. 5923-5933 [doi]
- Rethinking Cross-Modal Interaction in Multimodal Diffusion TransformersZhengyao Lv, Tianlin Pan, Chenyang Si, Zhaoxi Chen 0009, Wangmeng Zuo, Ziwei Liu 0002, Kwan-Yee K. Wong. 5934-5943 [doi]
- Toward Material-Agnostic System Identification From VideosYizhou Zhao, Haoyu Chen, Chunjiang Liu, Zhenyang Li, Charles Herrmann, Junhwa Hur, Yinxiao Li, Ming-Hsuan Yang 0001, Bhiksha Raj, Min Xu 0009. 5944-5956 [doi]
- MagicHOI: Leveraging 3D Priors for Accurate Hand-Object Reconstruction from Short Monocular Video ClipsShibo Wang, Haonan He, Maria Parelli, Christoph Gebhardt, Zicong Fan, Jie Song 0006. 5957-5968 [doi]
- Exploiting Frequency Dynamics for Enhanced Multimodal Event-Based Action RecognitionMeiqi Cao, Xiangbo Shu, Xin Jiang 0010, Rui Yan 0010, Yazhou Yao, Jinhui Tang 0001. 5969-5979 [doi]
- Boosting Multi-View Indoor 3D Object Detection Via Adaptive 3D Volume ConstructionRunmin Zhang, Zhu Yu 0001, Si-Yuan Cao, Lingyu Zhu 0006, Guangyi Zhang, Xiaokai Bai, Hui-Liang Shen. 5980-5989 [doi]
- CleanPose: Category-Level Object Pose Estimation via Causal Learning and Knowledge DistillationXiao Lin, Yun Peng, Liuyi Wang, Xianyou Zhong, Minghao Zhu, Yi Feng, Jingwei Yang 0002, Chengju Liu, Qijun Chen. 5990-6000 [doi]
- FiffDepth: Feed-Forward Transformation of Diffusion-Based Generators for Detailed Depth EstimationYunpeng Bai, Qixing Huang. 6023-6033 [doi]
- Scenemi: Motion In-Betweening for Modeling Human-Scene InteractionsInwoo Hwang, Bing Zhou 0001, Young Min Kim 0001, Jian Wang 0100, Chuan Guo 0002. 6034-6045 [doi]
- HORT: Monocular Hand-held Objects Reconstruction with TransformersZerui Chen, Rolandos-Alexandros Potamias, Shizhe Chen, Cordelia Schmid. 6046-6057 [doi]
- Active Learning Meets Foundation Models: Fast Remote Sensing Data Annotation for Object DetectionMarvin Burges, Philipe Ambrozio Dias, Carson Woody, Sarah Walters, Dalton D. Lunga. 6058-6068 [doi]
- Humans as Checkerboards: Calibrating Camera Motion Scale for World-Coordinate Human Mesh RecoveryFengyuan Yang 0002, Kerui Gu, Ha Linh Nguyen, Tze Ho Elden Tse, Angela Yao. 6069-6079 [doi]
- Learnable Fractional Reaction-Diffusion Dynamics for Under-Display ToF Imaging and BeyondXin Qiao, Matteo Poggi, Xing Wei, Pengchao Deng, Yanhui Zhou, Stefano Mattoccia. 6080-6090 [doi]
- ArgoTweak: Towards Self-Updating HD Maps Through Structured PriorsLena Wild, Rafael Valencia, Patric Jensfelt. 6091-6100 [doi]
- DEPTHOR: Depth Enhancement from a Practical Light-Weight dToF Sensor and RGB ImageJijun Xiang, Xuan Zhu, Xianqi Wang, Yu Wang, Hong Zhang, Fei Guo, Xin Yang. 6101-6111 [doi]
- Gt-Mean Loss: a Simple Yet Effective Solution for Brightness Mismatch in Low-Light Image EnhancementJingxi Liao, Shijie Hao, Richang Hong, Meng Wang 0001. 6112-6121 [doi]
- GeoExplorer: Active Geo-Localization with Curiosity-Driven ExplorationLi Mi, Manon Béchaz, Zeming Chen 0001, Antoine Bosselut, Devis Tuia. 6122-6131 [doi]
- ROADWork: A Dataset and Benchmark for Learning to Recognize, Observe, Analyze and Drive Through Work ZonesAnurag Ghosh, Shen Zheng, Robert Tamburo, Khiem Vuong, Juan R. Alvarez-Padilla, Hailiang Zhu, Michael Cardei, Nicholas Dunn, Christoph Mertz, Srinivasa G. Narasimhan. 6132-6142 [doi]
- WildSAT: Learning Satellite Image Representations from Wildlife ObservationsRangel Daroya, Elijah Cole, Oisin Mac Aodha, Grant Van Horn, Subhransu Maji. 6143-6154 [doi]
- RoMo: Robust Motion Segmentation Improves Structure from MotionLily Goli, Sara Sabour, Mark J. Matthews, Marcus A. Brubaker, Dmitry Lagun, Alec Jacobson, David J. Fleet, Saurabh Saxena, Andrea Tagliasacchi. 6155-6164 [doi]
- Hints of Prompt: Enhancing Visual Representation for Multimodal LLMs in Autonomous DrivingHao Zhou, Zhanning Gao, Zhili Chen, Maosheng Ye, Qifeng Chen 0001, Tongyi Cao, Honggang Qi. 6165-6175 [doi]
- Learning Large Motion Estimation from Intermediate Representations with a High-Resolution Optical Flow Dataset Featuring Long-Range Dynamic MotionHoonhee Cho, Yuhwan Jeong, Kuk-Jin Yoon. 6176-6187 [doi]
- Robust Low-Light Scene Restoration via Illumination TransitionZe Li, Feng Zhang 0052, Xiatian Zhu, Meng Zhang, Yanghong Zhou, P. Y. Mok 0001. 6188-6197 [doi]
- CCMNet: Leveraging Calibrated Color Correction Matrices for Cross-Camera Color ConstancyDongyoung Kim, Mahmoud Afifi, Dongyun Kim, Michael S. Brown, Seon Joo Kim. 6198-6208 [doi]
- UrbanLLaVA: A Multi-Modal Large Language Model for Urban IntelligenceJie Feng 0002, Shengyuan Wang, Tianhui Liu, Yanxin Xi, Yong Li 0008. 6209-6219 [doi]
- $\text{CO}_{2}$-Net: A Physics-Informed Spatio-Temporal Model for Global Surface $\text{CO}_{{2}}$ ReconstructionHao Zheng, Yuting Zheng, Hanbo Huang, Chaofan Sun, Enhui Liao, Lin Liu, Yi Han, Hao Zhou, Shiyu Liang. 6220-6230 [doi]
- Zero-Shot Inexact CAD Model Alignment from a Single ImagePattaramanee Arsomngern, Sasikarn Khwanmuang, Matthias Nießner, Supasorn Suwajanakorn. 6231-6241 [doi]
- Balanced Sharpness-Aware Minimization for Imbalanced RegressionYahao Liu, Qin Wang 0013, Lixin Duan, Wen Li 0001. 6242-6251 [doi]
- Dual Reciprocal Learning of Language-based Human Motion Understanding and GenerationChen Liang, Zhicheng Shi, Wenguan Wang, Yi Yang 0001. 6252-6262 [doi]
- HazeFlow: Revisit Haze Physical Model as ODE and Non-Homogeneous Haze Generation for Real-World DehazingJunseong Shin, Seungwoo Chung, Yunjeong Yang, Tae-Hyun Kim. 6263-6272 [doi]
- Mamba-3VL: Taming State Space Model for 3D Vision Language LearningYuan Wang, Yuxin Chen, Zhongang Qi, Lijun Liu, Jile Jiao, Xuetao Feng, Yujia Liang, Ying Shan, Zhipeng Zhang. 6273-6283 [doi]
- Motal: Unsupervised 3D Object Detection by Modality and Task-Specific Knowledge TransferHai Wu, Hongwei Lin, Xusheng Guo, Xin Li 0003, Mingming Wang, Cheng Wang 0003, Chenglu Wen. 6284-6293 [doi]
- Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric PerspectivesShaoyuan Xie, Lingdong Kong, Yuhao Dong, Chonghao Sima, Wenwei Zhang, Qi Alfred Chen, Ziwei Liu 0002, Liang Pan. 6285-6297 [doi]
- DeGauss: Dynamic-Static Decomposition with Gaussian Splatting for Distractor-Free 3D ReconstructionRui Wang, Quentin Lohmeyer, Mirko Meboldt, Siyu Tang. 6294-6303 [doi]
- Manual-PA: Learning 3D Part Assembly from Instruction DiagramsJiahao Zhang, Anoop Cherian, Cristian Rodriguez, Weijian Deng, Stephen Gould. 6304-6314 [doi]
- MoMa-Kitchen: A 100K+ Benchmark for Affordance-Grounded Last-Mile Navigation in Mobile ManipulationPingrui Zhang, Xianqiang Gao 0001, Yuhan Wu, Kehui Liu, Dong Wang 0028, Zhigang Wang 0002, Bin Zhao 0001, Yan Ding 0002, Xuelong Li 0001. 6315-6326 [doi]
- NavQ: Learning a Q-Model for Foresighted Vision-and-Language NavigationPeiran Xu 0001, Xicheng Gong, Yadong Mu. 6327-6341 [doi]
- Embodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene UnderstandingYue Fan, Xiaojian Ma 0001, Rongpeng Su, Jun Guo 0009, Rujie Wu, Xi Chen, Qing Li 0003. 6342-6352 [doi]
- Lightsout: Diffusion-Based Outpainting for Enhanced Lens Flare RemovalShr-Ruei Tsai, Wei-Cheng Chang, Jie-Ying Lee, Chih-Hai Su, Yu-Lun Liu. 6353-6363 [doi]
- Rethinking Multi-Modal Object Detection From the Perspective of Mono-Modality Feature LearningTianyi Zhao, Boyang Liu, Yanglei Gao, Yiming Sun, Maoxun Yuan, Xingxing Wei. 6364-6373 [doi]
- GeoDiffusion: A Training-Free Framework for Accurate 3D Geometric Conditioning in Image GenerationPhillip Mueller, Talip Uenlue, Sebastian Schmidt 0006, Marcel Kollovieh, Jiajie Fan, Stephan Günnemann, Lars Mikelsons. 6374-6384 [doi]
- OVA-Fields: Weakly Supervised Open-Vocabulary Affordance Fields for Robot Operational Part DetectionHeng Su, Mengying Xie, Nieqing Cao, Yan Ding 0002, Beichen Shao, Xianlei Long, Fuqiang Gu, Chao Chen 0004. 6385-6395 [doi]
- Arti-PG: A Toolbox for Procedurally Synthesizing Large-Scale and Diverse Articulated Objects with Rich AnnotationsJianhua Sun 0003, Yuxuan Li, Jiude Wei, Longfei Xu, Nange Wang, Yining Zhang, Cewu Lu. 6396-6405 [doi]
- Scaling 3D Compositional Models for Robust Classification and Pose EstimationXiaoding Yuan, Guofeng Zhang 0020, Prakhar Kaushik, Artur Jesslen, Adam Kortylewski, Alan L. Yuille. 6406-6415 [doi]
- RoboTron-Nav: A Unified Framework for Embodied Navigation Integrating Perception, Planning, and PredictionYufeng Zhong 0001, Chengjian Feng, Feng Yan, Fanfan Liu, Liming Zheng, Lin Ma 0002. 6416-6425 [doi]
- Optical Model-Driven Sharpness Mapping for Autofocus in Small Depth-of-Field and Severe Defocus ScenariosChen-Liang Fan, Mingpei Cao, Chih-Chien Hung, Yuesheng Zhu. 6426-6435 [doi]
- X-Capture: An Open-Source Portable Device for Multi-Sensory LearningSamuel Clarke, Suzannah Wistreich, Yanjie Ze, Jiajun Wu 0001. 6436-6446 [doi]
- DRaM-LHM: A Quaternion Framework for Iterative Camera Pose EstimationChen Lin, Weizhi Du, Zhixiang Min, Baochen She, Enrique Dunn, Sonya M. Hanson. 6447-6455 [doi]
- Votesplat: Hough Voting Gaussian Splatting for 3D Scene UnderstandingMinchao Jiang, Shunyu Jia, Jiaming Gu, Xiaoyuan Lu, Guangming Zhu 0001, Anqi Dong, Liang Zhang 0010. 6456-6465 [doi]
- UMDATrack: Unified Multi-Domain Adaptive Tracking under Adverse Weather ConditionsSiyuan Yao, Rui Zhu, Ziqi Wang, Wenqi Ren, Yanyang Yan, Xiaochun Cao. 6466-6475 [doi]
- Prior-Aware Dynamic Temporal Modeling Framework for Sequential 3D Hand Pose EstimationPengfei Ren 0001, Jingyu Wang 0001, Haifeng Sun 0001, Qi Qi 0001, Xingyu Liu, Menghao Zhang 0004, Lei Zhang 0094, Jing Wang 0039, Jianxin Liao. 6476-6487 [doi]
- Epipolar Consistent Attention Aggregation Network for Unsupervised Light Field Disparity EstimationChen Gao, Shuo Zhang, Youfang Lin. 6488-6497 [doi]
- Fish2Mesh Transformer: 3D Human Mesh Recovery from Egocentric VisionTianma Shen, Aditya Puranik, James Vong, Vrushabh Abhijit Deogirikar, Ryan Fell, Julianna Dietrich, Maria Kyrarini, Christopher Kitts, David C. Jeong. 6498-6507 [doi]
- ATLAS: Decoupling Skeletal and Shape Parameters for Expressive Parametric Human ModelingJinhyung Park, Javier Romero 0002, Shunsuke Saito, Fabian Prada, Takaaki Shiratori, Yichen Xu, Federica Bogo, Shoou-I Yu, Kris Kitani, Rawal Khirodkar. 6508-6518 [doi]
- GloPER: Unsupervised Animal Pattern Extraction from Local ReconstructionBowen Chen 0003, Yun Sing Koh, Gillian Dobbie. 6519-6529 [doi]
- ObjectRelator: Enabling Cross-View Object Relation Understanding Across Ego-Centric and Exo-Centric PerspectivesYuqian Fu, Runze Wang, Bin Ren 0005, Guolei Sun, Biao Gong, Yanwei Fu 0001, Danda Pani Paudel, Xuanjing Huang 0001, Luc Van Gool. 6530-6540 [doi]
- Mosic: Optimal-Transport Motion Trajectory for Dense Self-Supervised LearningMohammadreza Salehi, Shashanka Venkataramanan, Ioana Simion, Efstratios Gavves, Cees G. M. Snoek, Yuki M. Asano. 6541-6551 [doi]
- On the Generalization of Representation Uncertainty in Earth ObservationSpyros Kondylatos, Nikolaos-Ioannis Bountos, Dimitrios Michail 0001, Xiao Xiang Zhu 0001, Gustau Camps-Valls, Ioannis Papoutsis. 6552-6562 [doi]
- MeshMamba: State Space Models for Articulated 3D Mesh Generation and ReconstructionYusuke Yoshiyasu, Leyuan Sun, Ryusuke Sagawa. 6563-6574 [doi]
- Predict-Optimize-Distill: A Self-Improving Cycle for 4D Object UnderstandingMingxuan Wu, Huang Huang, Justin Kerr, Chung Min Kim, Anthony Zhang, Brent Yi, Angjoo Kanazawa. 6575-6584 [doi]
- Humans as a Calibration Pattern: Dynamic 3D Scene Reconstruction from Unsynchronized and Uncalibrated VideosChangwoon Choi, Jeongjun Kim, Geonho Cha, Minkwan Kim, Dongyoon Wee, Young-Min Kim. 6598-6608 [doi]
- PhysRig: Differentiable Physics-Based Skinning and Rigging Framework for Realistic Articulated Object ModelingHao Zhang, Haolan Xu, Chun Feng, Varun Jampani, Narendra Ahuja. 6609-6620 [doi]
- Learning Dense Feature Matching via Lifting Single 2D Image to 3D SpaceYingping Liang, Yutao Hu 0002, Wenqi Shao, Ying Fu 0001. 6621-6631 [doi]
- Placeit3d: Language-Guided Object Placement in Real 3D ScenesAhmed Abdelreheem 0002, Filippo Aleotti, Jamie Watson, Zawar Qureshi, Abdelrahman Eldesokey, Peter Wonka, Gabriel J. Brostow, Sara Vicente, Guillermo Garcia-Hernando. 6645-6655 [doi]
- Trace3D: Consistent Segmentation Lifting via Gaussian Instance TracingHongyu Shen, Junfeng Ni, Yixin Chen, Weishuo Li, Mingtao Pei, Siyuan Huang. 6656-6666 [doi]
- Low-Light Image Enhancement Using Event-Based Illumination EstimationLei Sun 0009, Yuhan Bao, Jiajun Zhai, Jingyun Liang, Yulun Zhang 0001, Kaiwei Wang, Danda Pani Paudel, Luc Van Gool. 6667-6677 [doi]
- Hybrid-Grained Feature Aggregation with Coarse-to-Fine Language Guidance for Self-Supervised Monocular Depth EstimationWenyao Zhang, Hongsi Liu, Bohan Li 0015, Jiawei He 0002, Zekun Qi, Yunnan Wang, Shengyang Zhao, Xinqiang Yu, Wenjun Zeng 0001, Xin Jin 0014. 6678-6692 [doi]
- Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech RepresentationsJeong Hun Yeo, Minsu Kim 0001, Chae Won Kim, Stavros Petridis, Yong Man Ro. 6693-6703 [doi]
- Jigsaw++: Imagining Complete Shape Priors for Object ReassemblyJiaxin Lu 0001, Gang Hua 0001, Qixing Huang. 6704-6714 [doi]
- Seeing and Seeing Through the Glass: Real and Synthetic Data for Multi-Layer Depth EstimationHongyu Wen, Yiming Zuo 0001, Venkat Subramanian, Patrick Chen, Jia Deng 0001. 6715-6725 [doi]
- SpatialTrackerV2: Advancing 3D Point Tracking with Explicit Camera MotionYuxi Xiao, Jianyuan Wang, Nan Xue 0006, Nikita Karaev, Yuri Makarov, Bingyi Kang, Xing Zhu, Hujun Bao, Yujun Shen, Xiaowei Zhou 0001. 6726-6737 [doi]
- UST-SSM: Unified Spatio-Temporal State Space Models for Point Cloud Video ModelingPeiming Li, Ziyi Wang, Yulin Yuan, Hong Liu 0008, Xiangming Meng, Junsong Yuan 0001, Mengyuan Liu 0004. 6738-6747 [doi]
- A Simple Yet Mighty Hartley Diffusion Versatilist for Generalizable Dense Vision TasksQi Bi, Jingjun Yi, Huimin Huang 0002, Hao Zheng 0008, Haolan Zhan, Wei Ji 0011, Yawen Huang, Yuexiang Li, Yefeng Zheng 0001. 6748-6760 [doi]
- Seeing 3D Through 2D Lenses: 3D Few-Shot Class-Incremental Learning via Cross-Modal Geometric RectificationTuo Xiang, Xuemiao Xu, Bangzhen Liu, Jinyi Li, Yong Li, Shengfeng He. 6761-6771 [doi]
- DSO: Aligning 3D Generators with Simulation Feedback for Physical SoundnessRuining Li, Chuanxia Zheng, Christian Rupprecht 0001, Andrea Vedaldi. 6772-6783 [doi]
- Feed-Forward SceneDINO for Unsupervised Semantic Scene CompletionAleksandar Jevtic, Christoph Reich, Felix Wimbauer, Oliver Hahn 0001, Christian Rupprecht 0001, Stefan Roth 0001, Daniel Cremers. 6784-6796 [doi]
- Cycle-Consistent Learning for Joint Layout-to-Image Generation and Object DetectionXinhao Cai, Qiuxia Lai, Gensheng Pei, Xiangbo Shu, Yazhou Yao, Wenguan Wang. 6797-6807 [doi]
- IGL-Nav: Incremental 3D Gaussian Localization for Image-Goal NavigationWenxuan Guo, Xiuwei Xu, Hang Yin, Ziwei Wang 0001, Jianjiang Feng, Jie Zhou 0001, Jiwen Lu. 6808-6817 [doi]
- AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical ReasoningDejie Yang, Zijing Zhao, Yang Liu. 6818-6827 [doi]
- MemDistill: Distilling LiDAR Knowledge into Memory for Camera-Only 3D Object DetectionDonghyeon Kwon, YoungSeok Yoon, Hyeongseok Son, Suha Kwak. 6828-6838 [doi]
- Towards Long-Horizon Vision-Language-Action System: Reasoning, Acting and MemoryDaixun Li, Yusi Zhang, Mingxiang Cao, Donglai Liu, Weiying Xie, Tianlin Hui, Lunkai Lin, Zhiqiang Xie, Yunsong Li 0001. 6839-6848 [doi]
- Head2Body: Body Pose Generation from Multi-Sensory Head-Mounted InputsMinh Tran, Hongda Mao, Qingshuang Chen, Yelin Kim. 6849-6858 [doi]
- Task-Decoupled Bézier Surface Constraint for Uneven Low-Light Image EnhancementXingxiang Zhou, Xiangdong Su, Haoran Zhang, Wei Chen, Guanglai Gao. 6859-6868 [doi]
- Unleashing the Temporal Potential of Stereo Event Cameras for Continuous-Time 3D Object DetectionJae-Young Kang, Hoonhee Cho, Kuk-Jin Yoon. 6869-6881 [doi]
- PlaneRAS: Learning Planar Primitives for 3D Plane RecoveryFang Zhang, Wenzhao Zheng, Linqing Zhao, Zelan Zhu, Jiwen Lu, Xiuzhuang Zhou. 6882-6891 [doi]
- O-MaMa: Learning Object Mask Matching Between Egocentric and Exocentric ViewsLorenzo Mur-Labadia, Maria Santos-Villafranca, Jesus Bermudez-Cameo, Alejandro Pérez-Yus, Ruben Martinez-Cantin, Josechu J. Guerrero. 6892-6903 [doi]
- FedVLA: Federated Vision-Language-Action Learning with Dual Gating Mixture-of-Experts for Robotic ManipulationCui Miao, Tao Chang, Meihan Wu, Hongbin Xu, Chun Li, Ming Li 0073, Xiaodong Wang 0002. 6904-6913 [doi]
- How to Make Your Cell Tracker Say "I Dunno!"Richard D. Paul, Johannes Seiffarth, David Rügamer, Katharina Nöh, Hanno Scharr. 6914-6923 [doi]
- 3DSRBENCH: A Comprehensive 3D Spatial Reasoning BenchmarkWufei Ma, Haoyu Chen, Guofeng Zhang 0025, Yu-Cheng Chou, Jieneng Chen, Celso de Melo, Alan L. Yuille. 6924-6934 [doi]
- Harnessing Massive Satellite Imagery with Efficient Masked Image ModelingFengxiang Wang 0004, Hongzhen Wang, Di Wang 0023, Zonghao Guo, Zhenyu Zhong, Long Lan, Wenjing Yang 0002, Jing Zhang 0037. 6935-6947 [doi]
- Exploring the Adversarial Vulnerabilities of Vision-Language-Action Models in RoboticsTaowen Wang, Cheng Han 0001, James Liang, Wenhao Yang, Dongfang Liu, Luna Xinyu Zhang, Qifan Wang 0001, Jiebo Luo 0001, Ruixiang Tang. 6948-6958 [doi]
- Simultaneous Motion and Noise Estimation with Event CamerasShintaro Shiba, Yoshimitsu Aoki, Guillermo Gallego 0002. 6959-6969 [doi]
- EgoAgent: A Joint Predictive Agent Model in Egocentric WorldsLu Chen 0001, Yizhou Wang 0007, Shixiang Tang, Qianhong Ma, Tong He 0001, Wanli Ouyang, Xiaowei Zhou 0001, Hujun Bao, Sida Peng. 6970-6980 [doi]
- Power of Cooperative Supervision: Multiple Teachers Framework for Advanced 3D Semi-Supervised Object DetectionJin-Hee Lee, Jae-Keun Lee, Jeseok Kim, Kwon Soon. 6994-7003 [doi]
- Layer-Wise Vision Injection With Disentangled Attention for Efficient LVLMsXuange Zhang, Dengjie Li, Bo Liu, Zenghao Bao, Yao Zhou, Baisong Yang, Zhongying Liu, Yujie Zhong, Tongtong Yuan. 7004-7013 [doi]
- CMT: A Cascade MAR with Topology Predictor for Multimodal Conditional CAD GenerationJianyu Wu, Yizhou Wang 0007, Xiangyu Yue 0001, Xinzhu Ma, Jinyang Guo 0002, Dongzhan Zhou, Wanli Ouyang, Shixiang Tang. 7014-7024 [doi]
- Embodied Navigation with Auxiliary Task of Action Description PredictionHaru Kondoh, Asako Kanezaki. 7025-7036 [doi]
- Open-Vocabulary Octree-Graph for 3D Scene UnderstandingZhigang Wang 0002, Yifei Su, Chenhui Li, Dong Wang 0028, Yan Huang, Xuelong Li 0001, Bin Zhao 0001. 7037-7047 [doi]
- Learning an Implicit Physics Model for Image-Based Fluid SimulationEmily Yue-ting Jia, Jiageng Mao, Zhiyuan Gao, Yajie Zhao, Yue Wang. 7055-7057 [doi]
- PropVG: End-To-End Proposal-Driven Visual Grounding with Multi-Granularity DiscriminationMing Dai, Wenxuan Cheng, Jiedong Zhuang, Jiang-jiang Liu, Hongshen Zhao, Zhenhua Feng 0001, Wankou Yang. 7058-7068 [doi]
- StableDepth: Scene-Consistent and Scale-Invariant Monocular DepthZheng Zhang, Lihe Yang, Tianyu Yang, Chaohui Yu, Xiaoyang Guo, Yixing Lao, Hengshuang Zhao. 7069-7078 [doi]
- PoseAnchor: Robust Root Position Estimation for 3D Human Pose EstimationJun-hee Kim, Jumin Han, Seong-Whan Lee. 7079-7088 [doi]
- 4DSegStreamer: Streaming 4D Panoptic Segmentation via Dual ThreadsLing Liu, Jun Tian, Li Yi. 7089-7098 [doi]
- Color Matching Using Hypernetwork-Based Kolmogorov-Arnold NetworksArtem V. Nikonorov, Georgy Perevozchikov, Andrei Korepanov, Nancy Mehta, Mahmoud Afifi, Egor Ershov, Radu Timofte. 7099-7109 [doi]
- Boost 3D Reconstruction Using Diffusion-Based Monocular Camera CalibrationJunyuan Deng, Wei Yin 0006, Xiaoyang Guo, Qian Zhang 0001, Xiaotao Hu, Weiqiang Ren, Xiao-Xiao Long, Ping Tan 0002. 7110-7121 [doi]
- GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial TasksMuhammad Sohail Danish, Muhammad Akhtar Munir, Syed Roshaan Ali Shah, Kartik Kuckreja, Fahad Shahbaz Khan, Paolo Fraccaro, Alexandre Lacoste, Salman Khan 0001. 7132-7142 [doi]
- Single-Scanline Relative Pose Estimation for Rolling Shutter CamerasPetr Hruby, Marc Pollefeys. 7143-7153 [doi]
- 3D Mesh Editing Using Masked LRMsWill Gao, Dilin Wang, Yuchen Fan 0001, Aljaz Bozic, Tuur Stuyck, Zhengqin Li, Zhao Dong 0001, Rakesh Ranjan, Nikolaos Sarafianos. 7154-7165 [doi]
- HccePose(BF): Predicting Front & Back Surfaces to Construct Ultra-Dense 2D-3D Correspondences for Pose EstimationYulin Wang, Mengting Hu, Hongli Li, Chen Luo. 7166-7175 [doi]
- Information-Bottleneck Driven Binary Neural Network for Change DetectionKaijie Yin, Zhiyuan Zhang 0012, Shu Kong, Tian Gao 0004, Cheng-Zhong Xu 0001, Hui Kong 0001. 7176-7186 [doi]
- GaussianVideo: Efficient Video Representation via Hierarchical Gaussian SplattingAndrew Bond, Jui-Hsien Wang, Long Mai, Erkut Erdem, Aykut Erdem. 7187-7196 [doi]
- Vpr-Cloak: a First Look at Privacy Cloak Against Visual Place RecognitionShuting Dong, Mingzhi Chen 0003, Feng Lu, Hao Yu, Guanghao Li 0003, Zhe Wu 0006, Ming Tang, Chun Yuan 0003. 7197-7208 [doi]
- Event-Based Tiny Object Detection: A Benchmark Dataset and BaselineNuo Chen, Chao Xiao, Yimian Dai, Shiman He, Miao Li, Wei An 0003. 7209-7218 [doi]
- PhysTwin: Physics-Informed Reconstruction and Simulation of Deformable Objects from VideosHanxiao Jiang 0001, Hao-Yu Hsu, Kaifeng Zhang, Hsin-Ni Yu, Shenlong Wang, Yunzhu Li. 7219-7230 [doi]
- GaussianProperty: Integrating Physical Properties to 3D Gaussians with LMMsXinli Xu, Wenhang Ge, Dicong Qiu, Zhifei Chen, Dongyu Yan, Zhuoyun Liu, Haoyu Zhao, Hanfeng Zhao, Shunsi Zhang, Junwei Liang 0001, Ying-Cong Chen. 7231-7240 [doi]
- Neural Solver of Dichromatic Reflection Model for Specular Highlight RemovalGang Fu. 7241-7250 [doi]
- Retinex-MEF: Retinex-Based Glare Effects Aware Unsupervised Multi-Exposure Image FusionHaowen Bai, Jiangshe Zhang 0001, Zixiang Zhao, Lilun Deng, Yukun Cui, Shuang Xu. 7251-7261 [doi]
- Frequency-Aligned Knowledge Distillation for Lightweight Spatiotemporal ForecastingYuqi Li, Chuanguang Yang, Hansheng Zeng, Zeyu Dong, Zhulin An, Yongjun Xu 0001, Yingli Tian, Hao Wu. 7262-7272 [doi]
- Adaptive Dual Uncertainty Optimization: Boosting Monocular 3D Object Detection under Test-Time ShiftsZixuan Hu, Dongxiao Li, Xinzhu Ma, Shixiang Tang, Xiaotong Li, Wenhan Yang, Ling-Yu Duan. 7273-7283 [doi]
- CAD-Assistant: Tool-Augmented VLLMs as Generic CAD Task SolversDimitrios Mallis, Ahmet Serdar Karadeniz, Sebastian Cavada, Danila Rukhovich, Niki Foteinopoulou, Kseniya Cherenkova, Anis Kacem 0001, Djamila Aouada. 7284-7294 [doi]
- Dynamic Point Maps: A Versatile Representation for Dynamic 3D ReconstructionEdgar Sucar, Zihang Lai, Eldar Insafutdinov, Andrea Vedaldi. 7295-7305 [doi]
- Diffusion-Based 3D Hand Motion Recovery with Intuitive PhysicsYufei Zhang, Zijun Cui, Jeffrey O. Kephart, Qiang Ji. 7306-7317 [doi]
- Physics Context Builders: A Modular Framework for Physical Reasoning in Vision-Language ModelsVahid Balazadeh, Mohammadmehdi Ataei, Hyunmin Cheong, Amir Hosein Khasahmadi, Rahul G. Krishnan. 7318-7328 [doi]
- Measuring the Impact of Rotation Equivariance on Aerial Object DetectionXiuyu Wu, Xinhao Wang, Xiubin Zhu, Lan Yang 0007, Jiyuan Liu 0003, Xingchen Hu 0001. 7329-7339 [doi]
- VOccl3D: A Video Benchmark Dataset for 3D Human Pose and Shape Estimation Under Real OcclusionsYash Garg, Saketh Bachu, Arindam Dutta, Rohit Lal, Sarosij Bose, Calvin-Khang Ta, M. Salman Asif, Amit K. Roy Chowdhury. 7350-7360 [doi]
- Tracking Tiny Drones Against Clutter: Large-Scale Infrared Benchmark with Motion-Centric Adaptive AlgorithmJiahao Zhang, Zongli Jiang, Jinli Zhang, Yixin Wei, Liang Li, Yizheng Wang, Gang Wang. 7361-7371 [doi]
- TruthPrInt: Mitigating Large Vision-Language Models Object Hallucination via Latent Truthful-Guided Pre-InterventionJinhao Duan, Fei Kong, Hao Cheng 0015, James Diffenderfer, Bhavya Kailkhura, Lichao Sun 0001, Xiaofeng Zhu 0001, Xiaoshuang Shi, Kaidi Xu. 7372-7382 [doi]
- TerraMind: Large-Scale Generative Multimodality for Earth ObservationJohannes Jakubik, Felix Yang, Benedikt Blumenstiel, Erik Scheurer, Rocco Sedona, Stefano Maurogiovanni, Jente Bosmans, Nikolaos Dionelis, Valerio Marsocci, Niklas Kopp, Rahul Ramachandran, Paolo Fraccaro, Thomas Brunschwiler, Gabriele Cavallaro, Juan Bernabé-Moreno, Nicolas Longépé. 7383-7394 [doi]
- MM-Spatial: Exploring 3D Spatial Understanding in Multimodal LLMsErik A. Daxberger, Nina Wenzel, David Griffiths, Haiming Gang, Justin Lazarow, Gefen Kohavi, Kai Kang, Marcin Eichner, Yinfei Yang, Afshin Dehghan, Peter Grasch. 7395-7408 [doi]
- Autocompose: Automatic Generation of Pose Transition Descriptions for Composed Pose Retrieval Using Multimodal LLMsYi-Ting Shen, Sungmin Eum, Doheon Lee, Rohit Shete, Chiao-Yi Wang, Heesung Kwon, Shuvra S. Bhattacharyya. 7409-7418 [doi]
- Image-Guided Shape-From-Template Using Mesh Inextensibility ConstraintsThuy Tran, Ruochen Chen, Shaifali Parashar. 7419-7428 [doi]
- 3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object DetectionYung-Hsu Yang, Luigi Piccinelli, Mattia Segù, Siyuan Li 0008, Rui Huang 0012, Yuqian Fu, Marc Pollefeys, Hermann Blum, Zuria Bauer. 7429-7439 [doi]
- LUDVIG: Learning-Free Uplifting of 2D Visual Features to Gaussian Splatting ScenesJuliette Marrie, Romain Menegaux, Michael Arbel, Diane Larlus, Julien Mairal. 7440-7450 [doi]
- GeoMan: Temporally Consistent Human Geometry Estimation Using Image-to-Video DiffusionGwanghyun Kim, Xueting Li, Ye Yuan 0007, Koki Nagano, Tianye Li, Jan Kautz, Se Young Chun, Umar Iqbal 0001. 7451-7461 [doi]
- ClearSight: Human Vision-Inspired Solutions for Event-Based Motion DeblurringXiaopeng Lin, Yulong Huang 0001, Hongwei Ren, Zunchang Liu, Hongxiang Huang, Yue Zhou 0010, Haotian Fu, Bojun Cheng. 7462-7471 [doi]
- VOVTrack: Exploring the Potentiality in Raw Videos for Open-Vocabulary Multi-Object TrackingZekun Qian, Ruize Han, Junhui Hou, Linqi Song, Wei Feng 0005. 7472-7482 [doi]
- Unsupervised Identification of Protein Compositions and Conformations Via Implicit Content-Transformation DisentanglementMostofa Rafid Uddin, Jana Armouti, Min Xu 0009. 7483-7493 [doi]
- Not All Frame Features are Equal: Video-to-4D Generation via Decoupling Dynamic-Static FeaturesLiying Yang, Chen Liu, Zhenwei Zhu, Ajian Liu 0001, Hui Ma 0018, Jian Nong, Yanyan Liang 0001. 7494-7504 [doi]
- Future-Aware Interaction Network for Motion ForecastingShijie Li 0006, Chunyu Liu, Xun Xu 0002, Si Yong Yeo, XuLei Yang. 7505-7515 [doi]
- EventUPS: Uncalibrated Photometric Stereo Using an Event CameraJinxiu Liang, Bohan Yu, Siqi Yang, Haotian Zhuang, Jieji Ren, Peiqi Duan, Boxin Shi. 7516-7525 [doi]
- PHD: Personalized 3D Human Body Fitting with Point DiffusionHsuan-I Ho, Chen Guo, Po-Chen Wu, Ivan Shugurov, Chengcheng Tang, Abhay Mittal, Sizhe An, Manuel Kaufmann, Linguang Zhang. 7526-7537 [doi]
- Frequency Domain-Based Diffusion Model for Unpaired Image DehazingChengxu Liu 0001, Lu Qi 0001, Jinshan Pan, Xueming Qian, Ming-Hsuan Yang 0001. 7538-7547 [doi]
- Language Driven Occupancy PredictionZhu Yu 0001, Bowen Pang, Lizhe Liu, Runmin Zhang, Qiang Li, Si-Yuan Cao, Maochun Luo, Mingxia Chen, Sheng Yang, Hui-Liang Shen. 7548-7558 [doi]
- Rethinking the Upsampling Process in Light Field Super-Resolution with Spatial-Epipolar Implicit Image FunctionRuixuan Cong, Yu Wang, Mingyuan Zhao 0001, Da Yang 0001, Rongshan Chen, Hao Sheng 0001. 7559-7569 [doi]
- C4D: 4D Made from 3D Through Dual CorrespondencesShizun Wang, Zhenxiang Jiang, Xingyi Yang, Xinchao Wang. 7570-7580 [doi]
- Instance-Level Video Depth in Groups Beyond OcclusionsYuan Liang, Yang Zhou, Ziming Sun, Tianyi Xiang, Guiqing Li, Shengfeng He. 7581-7591 [doi]
- ScoreHOI: Physically Plausible Reconstruction of Human-Object Interaction via Score-Guided DiffusionAo Li, Jinpeng Liu, Yixuan Zhu, Yansong Tang. 7592-7602 [doi]
- Active Perception Meets Rule-Guided RL: A Two-Phase Approach for Precise Object Navigation in Complex EnvironmentsLiang Qin, Min Wang 0019, Peiwei Li, Wengang Zhou 0001, Houqiang Li. 7603-7612 [doi]
- MonoSOWA: Scalable Monocular 3D Object Detector Without Human AnnotationsJan Skvrna, Lukás Neumann. 7613-7623 [doi]
- Estimating 2D Camera Motion with Hybrid Motion BasisHaipeng Li 0001, Tianhao Zhou, Zhanglei Yang, Yi Wu, Yan Chen 0007, Zijing Mao, Shen Cheng, Bing Zeng 0001, Shuaicheng Liu. 7624-7633 [doi]
- AgroBench: Vision-Language Model Benchmark in AgricultureRisa Shinoda, Nakamasa Inoue, Hirokatsu Kataoka, Masaki Onishi, Yoshitaka Ushiku. 7634-7644 [doi]
- H3R: Hybrid Multi-view Correspondence for Generalizable 3D ReconstructionHeng Jia, Linchao Zhu, Na Zhao 0004. 7655-7665 [doi]
- From Abyssal Darkness to Blinding Glare: a Benchmark on Extreme Exposure Correction in Real WorldBo Wang 0108, Huiyuan Fu, Zhiye Huang, Siru Zhang, Xin Wang 0001, Huadong Ma. 7666-7675 [doi]
- Learning to See in the Extremely DarkHai Jiang 0006, Binhao Guan, Zhen Liu 0022, Xiaohong Liu 0001, Jian Yu, Zheng Liu, Songchen Han, Shuaicheng Liu. 7676-7685 [doi]
- Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action PolicyZhi Hou, Tianyi Zhang, Yuwen Xiong, Haonan Duan 0001, Hengjun Pu, Ronglei Tong, Chengyang Zhao, Xizhou Zhu, Yu Qiao 0001, Jifeng Dai, YunTao Chen. 7686-7697 [doi]
- Voyaging into Perpetual Dynamic Scenes from a Single ViewFengrui Tian, Tianjiao Ding, Jinqi Luo, Hancheng Min, René Vidal. 7698-7708 [doi]
- PacGDC: Label-Efficient Generalizable Depth Completion with Projection Ambiguity and ConsistencyHaotian Wang, Aoran Xiao, Xiaoqin Zhang 0002, Meng Yang, Shijian Lu. 7709-7720 [doi]
- ARMO: Autoregressive Rigging for Multi-Category ObjectsMingze Sun, Shiwei Mao, Keyi Chen 0013, Yurun Chen 0001, Shunlin Lu, Jingbo Wang 0003, Junting Dong, Ruqi Huang. 7721-7730 [doi]
- DCHM: Depth-Consistent Human Modeling for Multiview DetectionJiahao Ma, Tianyu Wang 0035, Miaomiao Liu 0001, David Ahmedt-Aristizabal, Chuong Nguyen. 7731-7740 [doi]
- Completing 3D Partial Assemblies with View-Consistent 2D-3D CorrespondenceWeihao Wang, Yu Lan, Mingyu You, Bin He 0003. 7741-7750 [doi]
- GSV3D: Gaussian Splatting-Based Geometric Distillation With Stable Video Diffusion for Single-Image 3D Object GenerationYe Tao, Jiawei Zhang, Yahao Shi, Dongqing Zou, Bin Zhou. 7751-7760 [doi]
- Learnable Feature Patches and Vectors for Boosting Low-Light Image Enhancement Without External KnowledgeXiaogang Xu 0002, Jiafei Wu, Qingsen Yan, Jiequan Cui, Richang Hong, Bei Yu 0001. 7761-7770 [doi]
- InstaScene: Towards Complete 3D Instance Decomposition and Reconstruction From Cluttered ScenesZesong Yang, Bangbang Yang, Liyuan Cui, Yuewen Ma, Wenqi Dong, Zhaopeng Cui, Chenxuan Cao, Hujun Bao. 7771-7781 [doi]
- TESPEC: Temporally-Enhanced Self-Supervised Pretraining for Event CamerasMohammad Mohammadi, Ziyi Wu 0002, Igor Gilitschenski. 7782-7793 [doi]
- SAME: Learning Generic Language-Guided Visual Navigation with State-Adaptive Mixture of ExpertsGengze Zhou, Yicong Hong, Zun Wang 0001, Chongyang Zhao 0003, Mohit Bansal, Qi Wu 0001. 7794-7807 [doi]
- CL-Splats: Continual Learning of Gaussian Splatting with Local OptimizationJan Ackermann, Jonas Kulhanek, Shengqu Cai, Haofei Xu, Marc Pollefeys, Gordon Wetzstein, Leonidas J. Guibas, Songyou Peng. 7808-7817 [doi]
- Learning 3D Scene Analogies With Neural Contextual Scene MapsJunho Kim, Gwangtak Bae, Eun Sun Lee, Young-Min Kim. 7828-7840 [doi]
- GausSim: Foreseeing Reality by Gaussian Simulator for Elastic ObjectsYidi Shao, Mu Huang, Chen Change Loy, Bo Dai 0002. 7841-7850 [doi]
- Enhancing Spatial Reasoning in Multimodal Large Language Models Through Reasoning-Based SegmentationZhenhua Ning, Zhuotao Tian, Shaoshuai Shi, Guangming Lu 0002, Daojing He, Wenjie Pei, Li Jiang 0009. 7851-7860 [doi]
- M-SpecGene: Generalized Foundation Model for RGBT Multispectral VisionKailai Zhou, Fuqiang Yang, Shixian Wang, Bihan Wen, Chongde Zi, Linsen Chen, Qiu Shen, Xun Cao. 7872 [doi]
- Cross-Modal Ship Re-Identification via Optical and SAR Imagery: A Novel Dataset and MethodHan Wang, Shengyang Li, Jian Yang, Yuxuan Liu, Yixuan Lv, Zhuang Zhou. 7873-7883 [doi]
- Global Motion Corresponder for 3D Point-Based Scene Interpolation Under Large MotionJunru Lin, Chirag Vashist, Mikaela Angelina Uy, Colton Stearns, Xuan Luo, Leonidas J. Guibas, Ke Li 0011. 7884-7893 [doi]
- AdvDreamer Unveils: Are Vision-Language Models Truly Ready for Real-World 3D Variations?Shouwei Ruan, Hanqing Liu, Yao Huang, Xiaoqi Wang, Caixin Kang, Hang Su 0006, Yinpeng Dong, Xingxing Wei 0001. 7894-7904 [doi]
- SpikeDiff: Zero-Shot High-Quality Video Reconstruction from Chromatic Spike Camera and Sub-Millisecond Spike StreamsSiqi Yang, Jinxiu Liang, Zhaojun Huang, Yeliduosi Xiaokaiti, Yakun Chang, Zhaofei Yu, Boxin Shi. 7905-7914 [doi]
- VA-MoE: Variables-Adaptive Mixture of Experts for Incremental Weather ForecastingHao Chen 0045, Tao Han 0002, Song Guo 0001, Jie Zhang 0076, Yonghan Dong, Yue Yu 0001, Lei Bai 0001. 7915-7924 [doi]
- AJAHR: Amputated Joint Aware 3D Human Mesh RecoveryHyunjin Cho, Giyun Choi, Jongwon Choi. 7925-7935 [doi]
- Event-Aided Dense and Continuous Point Tracking: Everywhere and AnytimeZhexiong Wan, Jianqin Luo, Yuchao Dai, Gim Hee Lee. 7936-7946 [doi]
- Equicaps: Predictor-Free Pose-Aware Pre-Trained Capsule NetworksAthinoulla Konstantinou, Georgios Leontidis, Mamatha Thota, Aiden Durrant. 7947-7957 [doi]
- A Structure-Aware and Motion-Adaptive Framework for 3D Human Pose Estimation with MambaYe Lu, Jie Wang, Jianjun Gao 0005, Rui Gong, Chen Cai, Kim-Hui Yap. 7958-7968 [doi]
- Learning Normal Flow Directly from EventsDehao Yuan, Levi Burner, Jiayi Wu, Minghui Liu, Jingxi Chen, Yiannis Aloimonos, Cornelia Fermüller. 7969-7979 [doi]
- Unsupervised Joint Learning of Optical Flow and Intensity with Event CamerasShuang Guo, Friedhelm Hamann, Guillermo Gallego 0002. 7980-7989 [doi]
- OV-SCAN: Semantically Consistent Alignment for Novel Object Discovery in Open-Vocabulary 3D Object DetectionAdrian Chow, Evelien Riddell, Yimu Wang, Sean Sedwards, Krzysztof Czarnecki 0001. 7990-8000 [doi]
- CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object CountingAtin Pothiraj, Elias Stengel-Eskin, Jaemin Cho 0001, Mohit Bansal. 8001-8010 [doi]
- RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous DrivingZhijian Huang, Chengjian Feng, Feng Yan, Baihui Xiao, Zequn Jie, Yujie Zhong, Xiaodan Liang, Lin Ma 0002. 8011-8021 [doi]
- Trial-Oriented Visual RearrangementYuyi Liu, Xinhang Song, Tianliang Qi, Shuqiang Jiang. 8022-8031 [doi]
- 6DOPE-GS: Online 6D Object Pose Estimation using Gaussian SplattingYufeng Jin, Vignesh Prasad, Snehal Jauhri, Mathias Franzius, Georgia Chalvatzaki. 8032-8043 [doi]
- AnyCalib: On-Manifold Learning for Model-Agnostic Single-View Camera CalibrationJavier Tirado-Garín, Javier Civera 0001. 8044-8055 [doi]
- Background Invariance Testing According to Semantic ProximityZukang Liao, Min Chen. 8056-8065 [doi]
- NuPlanQA: A Large-Scale Dataset and Benchmark for Multi-View Driving Scene Understanding in Multi-Modal Large Language ModelsSung-Yeon Park, Can Cui 0009, Yunsheng Ma, Ahmadreza Moradipari, Rohit Gupta, Kyungtae Han, Ziran Wang. 8066-8076 [doi]
- One Look is Enough: Seamless Patchwise Refinement for Zero-Shot Monocular Depth Estimation on High-Resolution ImagesByeongjun Kwon, Munchurl Kim. 8077-8087 [doi]
- Adapting Vehicle Detectors for Aerial Imagery to Unseen Domains with Weak SupervisionXiao Fang, Minhyek Jeon, Shuowen Hu, Zheyang Qin, Shayok Chakraborty, Stanislav Panev, Celso de Melo, Fernando De la Torre. 8088-8099 [doi]
- RegGS: Unposed Sparse Views Gaussian Splatting with 3DGS RegistrationChong Cheng, Yu Hu, Sicheng Yu, Beizhen Zhao, Zijian Wang, Hao Wang. 8100-8109 [doi]
- Perspose: 3D Human Pose Estimation with Perspective Encoding and Perspective RotationXiaoyang Hao, Han Li. 8110-8119 [doi]
- Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied NavigationZiyu Zhu, Xilin Wang, Yixuan Li, Zhuofan Zhang, Xiaojian Ma 0001, Yixin Chen 0003, Baoxiong Jia, Wei Liang 0008, Qian Yu, Zhidong Deng, Siyuan Huang 0001, Qing Li 0003. 8120-8132 [doi]
- Training-Free Generation of Temporally Consistent Rewards from VLMsYinuo Zhao, Jiale Yuan, Zhiyuan Xu, Xiaoshuai Hao, Xinyi Zhang, Kun Wu 0001, Zhengping Che, Chi Harold Liu, Jian Tang 0008. 8133-8143 [doi]
- LGA-Net: Learning Local and Global Affinities for Sparse Scribble Based Image ColorizationHongjin Lyu, Bo Li 0023, Paul L. Rosin, Yu-Kun Lai. 8144-8153 [doi]
- CObL: Toward Zero-Shot Ordinal Layering Without User PromptingAneel Damaraju, Dean Hazineh, Todd E. Zickler. 8154-8164 [doi]
- Hierarchical Material Recognition from Local AppearanceMatthew Beveridge, Shree K. Nayar. 8165-8176 [doi]
- Breaking Rectangular Shackles: Cross-View Object Segmentation for Fine-Grained Object Geo-LocalizationQingwang Zhang, Yingying Zhu. 8197-8206 [doi]
- MVGBench: A Comprehensive Benchmark for Multi-View Generation ModelsXianghui Xie, Jan Eric Lenssen, Gerard Pons-Moll. 8207-8218 [doi]
- Harnessing Input-Adaptive Inference for Efficient VLNDongwoo Kang, Akhil Perincherry, Zachary Coalson, Aiden Gabriel, Stefan Lee, Sanghyun Hong 0001. 8219-8229 [doi]
- From One to More: Contextual Part Latents for 3D GenerationShaocong Dong, Lihe Ding, Xiao Chen, Yaokun Li, Yuxin Wang, Yucheng Wang, Qi Wang, Jaehyeok Kim, Chenjian Gao, Zhanpeng Huang, Zibin Wang, Tianfan Xue, Dan Xu. 8230-8240 [doi]
- TopicGeo: An Efficient Unified Framework for GeolocationXin Wang, Xinlin Wang, Shuiping Gou. 8241-8251 [doi]
- MonoFusion: Sparse-View 4D Reconstruction via Monocular FusionZihan Wang, Jeff Tan, Tarasha Khurana, Neehar Peri, Deva Ramanan. 8252-8263 [doi]
- ETCH: Generalizing Body Fitting to Clothed Humans Via Equivariant TightnessBoqian Li, Haiwen Feng, Zeyu Cai, Michael J. Black, Yuliang Xiu. 8264-8274 [doi]
- Revisiting Image Fusion for Multi-Illuminant White-Balance CorrectionDavid Serrano-Lozano, Aditya Arora, Luis Herranz, Konstantinos G. Derpanis, Michael S. Brown, Javier Vazquez-Corral. 8275-8284 [doi]
- Stronger, Steadier & Superior: Geometric Consistency in Depth VFM Forges Domain Generalized Semantic SegmentationSiyu Chen 0004, Ting Han 0001, Changshe Zhang, Xin Luo, Meiliu Wu, Guorong Cai, Jinhe Su. 8285-8295 [doi]
- Partially Matching Submap Helps: Uncertainty Modeling and Propagation for Text to Point Cloud LocalizationMingtao Feng, Longlong Mei, Zijie Wu, Jianqiao Luo, Fenghao Tian, Jie Feng 0003, Weisheng Dong, Yaonan Wang 0001. 8296-8305 [doi]
- SAS: Segment Any 3D Scene with Integrated 2D PriorsZhuoyuan Li, Jiahao Lu 0001, Jiacheng Deng 0002, Hanzhi Chang, Lifan Wu, Yanzhe Liang, Tianzhu Zhang 0001. 8306-8318 [doi]
- Medical World ModelYijun Yang, Zhao-Yang Wang, Qiuping Liu, Shuwen Sun, Kang Wang 0016, Rama Chellappa, Zongwei Zhou, Alan L. Yuille, Lei Zhu 0003, Yu-Dong Zhang, Jieneng Chen. 8319-8329 [doi]
- NormalCrafter: Learning Temporally Consistent Normals from Video Diffusion PriorsYanrui Bin, Wenbo Hu, Haoyuan Wang, Xinya Chen, Bing Wang. 8330-8339 [doi]
- MATE: Motion-Augmented Temporal Consistency for Event-Based Point TrackingHan Han, Wei Zhai, Yang Cao 0010, Bin Li, Zhengjun Zha. 8340-8349 [doi]
- ObjectGS: Object-Aware Scene Reconstruction and Scene Understanding via Gaussian SplattingRuijie Zhu 0002, Mulin Yu, Linning Xu, Lihan Jiang, Yixuan Li 0002, Tianzhu Zhang 0001, Jiangmiao Pang, Bo Dai 0002. 8350-8360 [doi]
- DuCos: Duality Constrained Depth Super-Resolution via Foundation ModelZhiqiang Yan 0001, Zhengxue Wang, Haoye Dong, Jun Li 0027, Jian Yang 0003, Gim Hee Lee. 8361-8371 [doi]
- MaskHand: Generative Masked Modeling for Robust Hand Mesh Reconstruction in the WildMuhammad Usama Saleem, Ekkasit Pinyoanuntapong, Mayur Jagdishbhai Patel, Hongfei Xue, Ahmed Helmy, Srijan Das, Pu Wang 0001. 8372-8383 [doi]
- OpenRSD: Towards Open-Prompts for Object Detection in Remote Sensing ImagesZiyue Huang 0001, Yongchao Feng, Ziqi Liu, Shuai Yang, Qingjie Liu 0001, Yunhong Wang 0001. 8384-8394 [doi]
- Passing the Driving Knowledge TestMaolin Wei, Wanzhou Liu, Eshed Ohn-Bar. 8395-8406 [doi]
- Uncertainty-Aware Gradient Stabilization for Small Object DetectionHuixin Sun, Yanjing Li, Linlin Yang, Xianbin Cao 0001, Baochang Zhang 0001. 8407-8417 [doi]
- Learning 3D Object Spatial Relationships From Pre-Trained 2D Diffusion ModelsSangwon Baik, Hyeonwoo Kim, Hanbyul Joo. 8418-8428 [doi]
- Can Generative Geospatial Diffusion Models Excel as Discriminative Geospatial Foundation Models?Yuru Jia, Valerio Marsocci, Ziyang Gong, Xue Yang 0005, Maarten Vergauwen, Andrea Nascetti. 8429-8440 [doi]
- Towards Annotation-Free Evaluation: KPAScore for Human Keypoint DetectionXiaoxiao Wang, Chunxiao Li, Peng Sun, Boming Miao, Yunjian Zhang, Yao Zhu 0003. 8441-8450 [doi]
- 4D Visual Pre-Training for Robot LearningChengkai Hou, Yanjie Ze, Yankai Fu, Zeyu Gao, Songbo Hu, Yue Yu, Shanghang Zhang, Huazhe Xu. 8451-8461 [doi]
- CryoFastAR: Fast Cryo-EM AB Initio Reconstruction Made EasyJiakai Zhang, Shouchen Zhou, Haizhao Dai, Xinhang Liu, Peihao Wang, Zhiwen Fan, Yuan Pei, Jingyi Yu 0001. 8462-8471 [doi]
- Beyond Pixel Uncertainty: Bounding the OoD Objects in Road ScenesHuachao Zhu, Zelong Liu, Zhichao Sun 0004, Yuda Zou, Gui-Song Xia, Yongchao Xu. 8472-8481 [doi]
- HoliTracer: Holistic Vectorization of Geographic Objects from Large-Size Remote Sensing ImageryYu Wang, Bo Dang, Wanchun Li, Wei Chen, Yansheng Li. 8482-8491 [doi]
- Generative ZooTomasz Niewiadomski, Anastasios Yiannakidis, Hanz Cuevas-Velasquez, Soubhik Sanyal, Michael J. Black, Silvia Zuffi, Peter Kulits. 8492-8502 [doi]
- ST4RTrack: Simultaneous 4D Reconstruction and Tracking in the WorldHaiwen Feng, Junyi Zhang 0004, Qianqian Wang 0002, Yufei Ye 0001, Pengcheng Yu, Michael J. Black, Trevor Darrell, Angjoo Kanazawa. 8503-8513 [doi]
- DialNav: Multi-Turn Dialog Navigation with a Remote GuideLeekyeung Han, Hyunji Min, Gyeom Hwangbo, Jonghyun Choi, Paul Hongsuck Seo. 8514-8523 [doi]
- Event-guided Unified Framework for Low-light Video Enhancement, Frame Interpolation, and DeblurringTaewoo Kim 0003, Kuk-Jin Yoon. 8524-8534 [doi]
- AETHER: Geometric-Aware Unified World ModelingHaoyi Zhu, Yifan Wang 0025, Jianjun Zhou, Wenzheng Chang, Yang Zhou, Zizun Li, Junyi Chen, Chunhua Shen, Jiangmiao Pang, Tong He 0001. 8535-8546 [doi]
- PARTE: Part-Guided Texturing for 3D Human Reconstruction from a Single ImageHyeongjin Nam, Donghwan Kim, Gyeongsik Moon, Kyoung Mu Lee. 8547-8557 [doi]
- PLMP - Point-Line Minimal Problems for Projective SfMKim Kiehn, Albin Ahlbäck, Kathlén Kohn. 8558-8567 [doi]
- PS-Mamba: Spatial-Temporal Graph Mamba for Pose Sequence RefinementHaoye Dong, Gim Hee Lee. 8568-8578 [doi]
- Taxadiffusion: Progressively Trained Diffusion Model for Fine-Grained Species GenerationAmin Karimi Monsefi, Mridul Khurana, Rajiv Ramnath, Anuj Karpatne, Wei-Lun Chao, Cheng Zhang 0014. 8579-8589 [doi]
- Dynamic Reconstruction of Hand-Object Interaction with Distributed Force-Aware Contact RepresentationZhenjun Yu, Wenqiang Xu, Pengfei Xie, Yutong Li 0004, Brian W. Anthony, Zhuorui Zhang, Cewu Lu. 8590-8599 [doi]
- VLM4D: Towards Spatiotemporal Awareness in Vision Language ModelsShijie Zhou 0003, Alexander Vilesov, Xuehai He, Ziyu Wan, Shuwang Zhang, Aditya Nagachandra, Di Chang, Dongdong Chen, Xin Eric Wang, Achuta Kadambi. 8600-8612 [doi]
- Aligning Constraint Generation with Design Intent in Parametric CADEvan Casey, Tianyu Zhang, Shu Ishida, John Roger Thompson, Amir Khasahmadi, Joseph George Lambourne, Pradeep Kumar Jayaraman, Karl D. D. Willis. 8613-8622 [doi]
- Spatial Alignment and Temporal Matching Adapter for Video-Radar Remote Physiological MeasurementQian Liang, Ruixu Geng, Jinbo Chen, Haoyu Wang, Yan Chen, Yang Hu. 8623-8633 [doi]
- Bias in Gender Bias Benchmarks: How Spurious Features Distort EvaluationYusuke Hirota, Ryo Hachiuma, Boyi Li 0001, Ximing Lu, Michael Ross Boone, Boris Ivanovic, Yejin Choi 0001, Marco Pavone 0001, Yu-Chiang Frank Wang, Noa Garcia, Yuta Nakashima, Chao-Han Huck Yang. 8634-8644 [doi]
- AGO: Adaptive Grounding for Open World 3D Occupancy PredictionPeizheng Li, Shuxiao Ding, You Zhou, Qingwen Zhang, Onat Inak, Larissa Triess, Niklas Hanselmann, Marius Cordts, Andreas Zell. 8645-8655 [doi]
- Efficient Event Camera Data Pretraining with Adaptive Prompt FusionQuanmin Liang, Qiang Li, Shuai Liu 0009, Xinzi Cao, Jinyi Lu, Feidiao Yang, Wei Zhang 0161, Kai Huang 0001, Yonghong Tian 0001. 8656-8667 [doi]
- Unsupervised Part Discovery via Descriptor-Based Masked Image Restoration with Optimized ConstraintsJiahao Xia 0001, Yike Wu 0001, Wenjian Huang 0001, Jianguo Zhang 0001, Jian Zhang 0002. 8668-8677 [doi]
- Environment-Agnostic Pose: Generating Environment-Independent Object Representations for 6D Pose EstimationShaobo Zhang 0006, Yuhang Huang, Wanqing Zhao, Wei Zhao 0019, Ziyu Guan, Jinye Peng 0001. 8678-8687 [doi]
- OpenM3D: Open Vocabulary Multi-View Indoor 3D Object Detection without Human AnnotationsPeng-Hao Hsu, Ke Zhang 0028, Fu-En Wang, Tao Tu 0002, Ming-Feng Li, Yu-Lun Liu 0001, Albert Y. C. Chen 0001, Min Sun 0001, Cheng-Hao Kuo. 8688-8698 [doi]
- CATP-LLM: Empowering Large Language Models for Cost-Aware Tool PlanningDuo Wu, Jinghe Wang, Yuan Meng, Yanning Zhang, Le Sun, Zhi Wang 0001. 8699-8709 [doi]
- Online Dense Point Tracking with Streaming MemoryQiaole Dong, Yanwei Fu. 8710-8720 [doi]
- Timeformer: Capturing Temporal Relationships of Deformable 3D Gaussians for Robust ReconstructionDadong Jiang, Zhi Hou, Zhihui Ke, Xianghui Yang, Xiaobo Zhou 0003, Tie Qiu 0001. 8721-8732 [doi]
- Long-Context State-Space Video World ModelsRyan Po, Yotam Nitzan, Richard Zhang 0001, Berlin Chen, Tri Dao, Eli Shechtman, Gordon Wetzstein, Xun Huang. 8733-8744 [doi]
- MaGS: Reconstructing and Simulating Dynamic 3D Objects with Mesh-Adsorbed Gaussian SplattingShaojie Ma, Yawei Luo, Wei Yang 0011, Yi Yang 0001. 8745-8755 [doi]
- When Schrödinger Bridge Meets Real-World Image Dehazing with Unpaired TrainingYunwei Lan, Zhigao Cui, Xin Luo, Chang Liu 0165, Nian Wang 0001, Menglin Zhang, Yanzhao Su, Dong Liu 0002. 8756-8765 [doi]
- GM-MoE: Low-Light Enhancement with Gated-Mechanism Mixture-of-ExpertsMinwen Liao, Hao Bo Dong, Xinyi Wang, Kurban Ubul, Yihua Shao, Ziyang Yan. 8766-8776 [doi]
- CHARM3R: Towards Unseen Camera Height Robust Monocular 3D DetectorAbhinav Kumar 0004, Yuliang Guo, Zhihao Zhang, Xinyu Huang 0001, Liu Ren, Xiaoming Liu 0002. 8777-8788 [doi]
- CWNet: Causal Wavelet Network for Low-Light Image EnhancementTongshun Zhang, Pingping Liu, Yubing Lu, Mengen Cai, Zijian Zhang, Zhe Zhang, Qiuzhan Zhou. 8789-8799 [doi]
- Monomobility: Zero-Shot 3D Mobility Analysis From Monocular VideosHongyi Zhou, Yulan Guo, Xiaogang Wang, Kai Xu. 8800-8809 [doi]
- Test-Time Retrieval-Augmented Adaptation for Vision-Language ModelsXinqi Fan, Xueli Chen, Luoxiao Yang, Chuin Hong Yap, Rizwan Qureshi, Qi Dou, Moi Hoon Yap, Mubarak Shah. 8810-8819 [doi]
- TRACE: Learning 3D Gaussian Physical Dynamics from Multi-View VideosJinxi Li, Ziyang Song, Bo Yang 0027. 8820-8829 [doi]
- RnGCam: High-Speed Video from Rolling & Global Shutter MeasurementsKevin Tandi, Xiang Dai, Chinmay Talegaonkar, Gal Mishne, Nick Antipa. 8830-8840 [doi]
- SPLART: Articulation Estimation and Part-Level Reconstruction with 3D Gaussian SplattingShengjie Lin, Jiading Fang, Muhammad Zubair Irshad, Vitor Campagnolo Guizilini, Rares Andrei Ambrus, Greg Shakhnarovich, Matthew R. Walter. 8841-8851 [doi]
- FuXi-RTM: A Physics-Guided Prediction Framework with Radiative Transfer ModelinggQiusheng Huang, Xiaohui Zhong, Xu Fan, Hao Li. 8852-8862 [doi]
- Self-Supervised Monocular 4D Scene Reconstruction for Egocentric VideosChengbo Yuan, Geng Chen, Li Yi, Yang Gao. 8863-8874 [doi]
- Ideator: Jailbreaking and Benchmarking Large Vision-Language Models Using ThemselvesRuofan Wang, Juncheng Li 0018, Yixu Wang, Bo Wang, Xiaosen Wang, Yan Teng 0002, Yingchun Wang 0004, Xingjun Ma, Yu-Gang Jiang 0001. 8875-8884 [doi]
- 3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene UnderstandingTatiana Zemskova, Dmitry A. Yudin. 8885-8895 [doi]
- Diorama: Unleashing Zero-Shot Single-View 3D Indoor Scene ModelingQirui Wu, Denys Iliash, Daniel Ritchie, Manolis Savva, Angel X. Chang. 8896-8907 [doi]
- Bokehlicious: Photorealistic Bokeh Rendering with Controllable AperturesTim Seizinger, Florin-Alexandru Vasluianu, Marcos V. Conde, Zongwei Wu, Radu Timofte. 8908-8917 [doi]
- SuperEvent: Cross-Modal Learning of Event-Based Keypoint Detection for SLAMYannick Burkhardt, Simon Schaefer, Stefan Leutenegger. 8918-8928 [doi]
- Learning on the Go: A Meta-Learning Object Navigation ModelXiaorong Qin, Xinhang Song, Sixian Zhang, Xinyao Yu 0002, Xinmiao Zhang, Shuqiang Jiang. 8939-8949 [doi]
- PASG: A Closed-Loop Framework for Automated Geometric Primitive Extraction and Semantic Anchoring in Robotic ManipulationZhihao Zhu, Yifan Zheng, Siyu Pan, Yaohui Jin, Yao Mu 0001. 8950-8960 [doi]
- Unlocking Constraints: Source-Free Occlusion-Aware Seamless SegmentationYihong Cao, Jiaming Zhang 0001, Xu Zheng 0002, Hao Shi 0004, Kunyu Peng, Hang Liu, Kailun Yang 0001, Hui Zhang 0023. 8961-8972 [doi]
- Kestrel: 3D Multimodal LLM for Part-Aware Grounded DescriptionMahmoud Ahmed, Junjie Fei, Jian Ding 0001, Eslam Mohamed Bakr, Mohamed Elhoseiny. 8973-8983 [doi]
- ProGait: A Multi-Purpose Video Dataset and Benchmark for Transfemoral Prosthesis UsersXiangyu Yin 0002, Boyuan Yang 0001, Weichen Liu, Qiyao Xue, Abrar Alamri, Goeran Fiedler, Wei Gao 0006. 8984-8993 [doi]
- HFD-Teacher: High-Frequency Depth Distillation From Depth Foundation Models for Enhanced Depth CompletionZhiyuan Yang, Anqi Cheng, Haiyue Zhu, Tianjiao Li, Pey Yuen Tao, Kezhi Mao. 8994-9003 [doi]
- Detection, Pose Estimation and Segmentation for Multiple Bodies: Closing the Virtuous CircleMiroslav Purkrábek, Jiri Matas. 9004-9013 [doi]
- Benchmarking Multimodal Large Language Models Against Image CorruptionsXinkuan Qiu, Meina Kan, Yongbin Zhou, Shiguang Shan. 9014-9023 [doi]
- MixRI: Mixing Features of Reference Images for Novel Object Pose EstimationXinhang Liu, Jiawei Shi, Zheng Dang, Yuchao Dai. 9024-9035 [doi]
- INS-MMBench: A Comprehensive Benchmark for Evaluating LVLMs' Performance in InsuranceChenWei Lin, Hanjia Lyu, Xian Xu, Jiebo Luo 0001. 9036-9047 [doi]
- ReassembleNet: Learnable Keypoints and Diffusion for 2D Fresco ReconstructionAdeela Islam, Stefano Fiorini, Stuart James, Pietro Morerio, Alessio Del Bue. 9048-9057 [doi]
- SITE: Towards Spatial Intelligence Thorough EvaluationWenqi Wang 0003, Reuben Tan, Pengyue Zhu, Jianwei Yang, Zhengyuan Yang, Lijuan Wang, Andrey Kolobov, Jianfeng Gao 0001, Boqing Gong. 9058-9069 [doi]
- PASD: A Pixel-Adaptive Swarm Dynamics Approach for Unsupervised Low-Light Image EnhancementShuai Jin, Yuhua Qian, Feijiang Li, Guoqing Liu 0001, Xinyan Liang. 9070-9079 [doi]
- Wonderplay: Dynamic 3D Scene Generation From a Single Image and ActionsZizhang Li, Hong-Xing Yu, Wei Liu, Yin Yang, Charles Herrmann, Gordon Wetzstein, Jiajun Wu 0001. 9080-9090 [doi]
- Beyond the Destination: A Novel Benchmark for Exploration-Aware Embodied Question AnsweringKaixuan Jiang, Yang Liu 0119, Weixing Chen, Jingzhou Luo, Ziliang Chen 0001, Ling Pan, Guanbin Li, Liang Lin. 9091-9101 [doi]
- Not All Views Are Created Equal: Analyzing Viewpoint Instabilities in Vision Foundation ModelsMateusz Michalkiewicz, Sheena Bai, Mahsa Baktashmotlagh, Varun Jampani, Guha Balakrishnan. 9113-9123 [doi]
- CHROME: Clothed Human Reconstruction with Occlusion-Resilience and Multiview-Consistency from a Single ImageArindam Dutta, Meng Zheng 0002, Zhongpai Gao, Benjamin Planche, Anwesa Choudhuri, Terrence Chen, Amit K. Roy Chowdhury, Ziyan Wu 0001. 9124-9135 [doi]
- SkySense V2: A Unified Foundation Model for Multi-Modal Remote SensingYingying Zhang, Lixiang Ru, Kang Wu, Lei Yu 0005, Lei Liang, Yansheng Li 0001, Jingdong Chen. 9136-9146 [doi]
- ReCot: Reflective Self-Correction Training for Mitigating Confirmation Bias in Large Vision-Language ModelsMengxue Qu, Yibo Hu, Kunyang Han, Yunchao Wei, Yao Zhao 0001. 9147-9157 [doi]
- Easi3R: Estimating Disentangled Motion from DUSt3R Without TrainingXingyu Chen, Yue Chen, Yuliang Xiu, Andreas Geiger 0001, Anpei Chen. 9158-9168 [doi]
- PRE-Mamba: A 4D State Space Model for Ultra-High-Frequent Event Camera DerainingCiyu Ruan, Ruishan Guo, Zihang Gong, Jingao Xu, Wenhan Yang, Xinlei Chen. 9169-9180 [doi]
- Amodal3R: Amodal 3D Reconstruction from Occluded 2D ImagesTianhao Wu 0015, Chuanxia Zheng, Frank Guan, Andrea Vedaldi, Tat-Jen Cham. 9181-9193 [doi]
- Genhaze: Pioneering Controllable One-Step Realistic Haze Generation for Real-World DehazingSixiang Chen, Tian Ye 0001, Yunlong Lin, Yeying Jin, Yijun Yang, Haoyu Chen 0003, Jianyu Lai, Song Fei, Zhaohu Xing, Fugee Tsung, Lei Zhu 0003. 9194-9205 [doi]
- When Large Vision-Language Model Meets Large Remote Sensing Imagery: Coarse-to-Fine Text-Guided Token PruningJunwei Luo, Yingying Zhang, Xue Yang 0005, Kang Wu, Qi Zhu 0010, Lei Liang, Jingdong Chen, Yansheng Li 0001. 9206-9217 [doi]
- After the Party: Navigating the Mapping from Color to Ambient LightingFlorin-Alexandru Vasluianu, Tim Seizinger, Zongwei Wu, Radu Timofte. 9218-9229 [doi]
- Harnessing Uncertainty-Aware Bounding Boxes for Unsupervised 3D Object DetectionRuiyang Zhang, Hu Zhang 0005, Zhedong Zheng. 9230-9240 [doi]
- Perspective-Aware Reasoning in Vision-Language Models via Mental Imagery SimulationPhillip Y. Lee, Jihyeon Je, Chanho Park, Leonidas J. Guibas, Mikaela Angelina Uy, Minhyuk Sung. 9241-9251 [doi]
- 3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language NavigationJianzhe Gao, Rui Liu, Wenguan Wang. 9252-9262 [doi]
- GWM: Towards Scalable Gaussian World Models for Robotic ManipulationGuanxing Lu, Baoxiong Jia, Puhao Li, Yixin Chen 0003, Ziwei Wang, Yansong Tang, Siyuan Huang 0001. 9263-9274 [doi]
- Ross3d: Reconstructive Visual Instruction Tuning With 3D-AwarenessHaochen Wang, Yucheng Zhao, Tiancai Wang, Haoqiang Fan, Xiangyu Zhang 0005, Zhaoxiang Zhang 0001. 9275-9286 [doi]
- OMNI-DC: Highly Robust Depth Completion with Multiresolution Depth IntegrationYiming Zuo 0001, Willow Yang, Zeyu Ma 0004, Jia Deng 0001. 9287-9297 [doi]
- BlinkTrack: Feature Tracking Over 80 FPS via Events and ImagesYichen Shen 0004, Yijin Li, Shuo Chen, Guanglin Li 0005, Zhaoyang Huang, Hujun Bao, Zhaopeng Cui, Guofeng Zhang 0001. 9298-9308 [doi]
- GECO: Geometrically Consistent Embedding with Lightspeed InferenceRegine Hartwig, Dominik Muhle, Riccardo Marin, Daniel Cremers. 9309-9319 [doi]
- Can3Tok: Canonical 3D Tokenization and Latent Modeling of Scene-Level 3D GaussiansQuankai Gao, Iliyan Georgiev, Tuanfeng Y. Wang, Krishna Kumar Singh, Ulrich Neumann, Jae Shin Yoon. 9320-9331 [doi]
- GEOPARD: Geometric Pretraining for Articulation Prediction in 3D ShapesPradyumn Goyal, Dmitry Petrov, Sheldon Andrews, Yizhak Ben-Shabat, Hsueh-Ti Derek Liu, Evangelos Kalogerakis. 9332-9341 [doi]
- Emotive: Event-Guided Trajectory Modeling for 3D Motion EstimationZengyu Wan, Wei Zhai, Yang Cao 0010, Zhengjun Zha. 9342-9351 [doi]
- Dream-to-Recon: Monocular 3D Reconstruction with Diffusion-Depth Distillation from Single ImagesPhilipp Wulff, Felix Wimbauer, Dominik Muhle, Daniel Cremers. 9352-9362 [doi]
- FusionPhys: A Flexible Framework for Fusing Complementary Sensing Modalities in Remote Physiological MeasurementChenhang Ying, Huiyu Yang, Jieyi Ge, Zhaodong Sun, Xu Cheng 0003, Kui Ren 0001, Xiaobai Li. 9363-9373 [doi]
- BoxDreamer: Dreaming Box Corners for Generalizable Object Pose EstimationYuanhong Yu 0003, Xingyi He, Chen Zhao 0025, Junhao Yu, Jiaqi Yang 0002, Ruizhen Hu, Yujun Shen, Xing Zhu, Xiaowei Zhou 0001, Sida Peng. 9374-9384 [doi]
- Fine-Grained Spatiotemporal Grounding on Egocentric VideosShuo Liang, Yiwu Zhong, Zi-Yuan Hu, Yeyao Tao, Liwei Wang 0009. 9385-9395 [doi]
- Deep Space Weather Model: Long-Range Solar Flare Prediction from Multi-Wavelength ImagesShunya Nagashima, Komei Sugiura. 9396-9405 [doi]
- From Sharp to Blur: Unsupervised Domain Adaptation for 2D Human Pose Estimation Under Extreme Motion Blur Using Event CamerasYoungho Kim, Hoonhee Cho, Kuk-Jin Yoon. 9406-9417 [doi]
- CMB-ML: A Cosmic Microwave Background Dataset for the Oldest Possible Computer Vision TaskJames Amato, Yunan Xie, Leonel Medina-Varela, Ammar Aljerwi, Adam McCutcheon, T. Seth Rippentrop, Kristian Gonzalez, Jacques Delabrouille, Mustapha Ishak, Nicholas Ruozzi. 9418-9430 [doi]
- Fine-Grained Evaluation of Large Vision-Language Models in Autonomous DrivingYue Li, Meng Tian, ZhenYu Lin, Jiangtong Zhu, Dechang Zhu, Haiqiang Liu, Yueyi Zhang, Zhiwei Xiong, Xinhai Zhao. 9431-9442 [doi]
- Test-Time Prompt Tuning for Zero-Shot Depth CompletionChanhwi Jeong, Inhwan Bae, Jin-Hwi Park, Hae-Gon Jeon. 9443-9454 [doi]
- Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual DisparitiesLiuyi Wang, XinYuan Xia, Hui Zhao, Hanqing Wang, Tai Wang, Yilun Chen, Chengju Liu, Qijun Chen, Jiangmiao Pang. 9455-9465 [doi]
- Learning to See Inside Opaque Liquid Containers Using Speckle VibrometryMatan Kichler, Shai Bagon, Mark Sheinin. 9466-9476 [doi]
- monoVLN: Bridging the Observation Gap between Monocular and Panoramic Vision and Language NavigationRenjie Lu 0002, Yu Zhou, Hao Cheng 0012, Jingke Meng, Wei-Shi Zheng 0001. 9477-9486 [doi]
- Contact-Aware Amodal Completion for Human-Object Interaction via Multi-Regional InpaintingSeunggeun Chi, Enna Sachdeva, Pin-Hao Huang, Kwonjoon Lee. 9487-9496 [doi]
- Bring Your Rear Cameras for Egocentric 3D Human Pose EstimationHiroyasu Akada, Jian Wang, Vladislav Golyanik, Christian Theobalt. 9497-9507 [doi]
- LocalDyGS: Multi-view Global Dynamic Scene Modeling via Adaptive Local Implicit Feature DecouplingJiahao Wu, Rui Peng, Jianbo Jiao, Jiayu Yang, Luyang Tang, Kaiqiang Xiong, Jie Liang, Jinbo Yan, Runling Liu, Ronggang Wang. 9519-9529 [doi]
- Closed-Loop Transfer for Weakly-Supervised Affordance GroundingJiajin Tang, Zhengxuan Wei, Ge Zheng, Sibei Yang. 9530-9539 [doi]
- Combinative Matching for Geometric Shape AssemblyNahyuk Lee, Juhong Min, Junhong Lee, Chunghyun Park, Minsu Cho. 9540-9549 [doi]
- CogNav: Cognitive Process Modeling for Object Goal Navigation with LLMsYihan Cao, Jiazhao Zhang, Zhinan Yu, Shuzhen Liu, Zheng Qin 0002, Qin Zou 0001, Bo Du 0001, Kai Xu 0004. 9550-9560 [doi]
- DyGS-SLAM: Real-Time Accurate Localization and Gaussian Reconstruction for Dynamic ScenesXinggang Hu, Chenyangguang Zhang, Mingyuan Zhao, Yuanze Gui, Xiangkui Zhang, Xiangyang Ji. 9561-9571 [doi]
- Teaching VLMs to Localize Specific Objects from In-Context ExamplesSivan Doveh, Nimrod Shabtay, Eli Schwartz, Hilde Kuehne, Raja Giryes, Rogério Feris, Leonid Karlinsky, James R. Glass, Assaf Arbelle, Shimon Ullman, Muhammad Jehanzeb Mirza. 9572-9582 [doi]
- Dark-ISP: Enhancing RAW Image Processing for Low-Light Object DetectionJiasheng Guo, Xin Gao, Yuxiang Yan 0002, Guanghao Li 0001, Jian Pu. 9583-9593 [doi]
- Parameter-Efficient Adaptation of Geospatial Foundation Models Through Embedding DeflectionRomain Thoreau, Valerio Marsocci, Dawa Derksen. 9594-9604 [doi]
- MeasureXpert: Automatic Anthropometric Measurement Extraction from Two Unregistered, Partial, Posed, and Dressed Body ScansRan Zhao, Xinxin Dai, Pengpeng Hu, Vasile Palade, Adrian Munteanu 0001. 9605-9615 [doi]
- Details Matter for Indoor Open-Vocabulary 3D Instance SegmentationSanghun Jung, Jingjing Zheng, Ke Zhang 0028, Nan Qiao 0009, Albert Y. C. Chen 0001, Lu Xia, Chi Liu, Yuyin Sun, Xiao Zeng, Hsiang-Wei Huang, Byron Boots, Min Sun 0001, Cheng-Hao Kuo. 9627-9637 [doi]
- FlashDepth: Real-Time Streaming Video Depth Estimation at 2K ResolutionGene Chou, Wenqi Xian, Guandao Yang, Mohamed Abdelfattah, Bharath Hariharan, Noah Snavely, Ning Yu 0006, Paul Debevec. 9638-9648 [doi]
- Self-Supervised Learning of Hybrid Part-Aware 3D Representations of 2D Gaussians and SuperquadricsZhirui Gao, Renjiao Yi, Yuhang Huang, Wei Chen 0009, Chenyang Zhu 0002, Kai Xu 0004. 9649-9659 [doi]
- Shape of Motion: 4D Reconstruction From a Single VideoQianqian Wang 0002, Vickie Ye, Hang Gao, Weijia Zeng, Jake Austin, Zhengqi Li, Angjoo Kanazawa. 9660-9672 [doi]
- Amodal Depth Anything: Amodal Depth Estimation in the WildZhenyu Li 0007, Mykola Lavreniuk, Jian Shi, Shariq Farooq Bhat, Peter Wonka. 9673-9682 [doi]
- Training-Free Personalization via Retrieval and Reasoning on FingerprintsDeepayan Das, Davide Talon, Yiming Wang 0002, Massimiliano Mancini, Elisa Ricci 0001. 9683-9692 [doi]
- Tapnext: Tracking Any Point (Tap) as Next Token PredictionArtem Zholus, Carl Doersch, Yi Yang 0007, Skanda Koppula, Viorica Patraucean, Xu Owen He, Ignacio Rocco, Mehdi S. M. Sajjadi, Sarath Chandar, Ross Goroshin. 9693-9703 [doi]
- RayPose: Ray Bundling Diffusion for Template Views in Unseen 6D Object Pose EstimationJunwen Huang 0001, Shishir Reddy Vutukur, Peter KT Yu, Nassir Navab, Slobodan Ilic, Benjamin Busam. 9700-9710 [doi]
- PartField: Learning 3D Feature Fields for Part Segmentation and BeyondMing-Yu Liu 0001, Mikaela Angelina Uy, Donglai Xiang, Hao Su, Sanja Fidler, Nicholas Sharp, Jun Gao 0004. 9704-9715 [doi]
- RetinexMCNet: A Memory Controller Dominated Network for Low-Light Video Enhancement Based on RetinexMeiao Wang, Xuejing Kang, Yaxi Lu, Jie Xu. 9716-9725 [doi]
- GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language FieldsShunsuke Yasuki, Taiki Miyanishi, Nakamasa Inoue, Shuhei Kurita, Koya Sakamoto, Daichi Azuma, Masato Taki, Yutaka Matsuo. 9737-9748 [doi]
- Bridging the Sky and Ground: Towards View-Invariant Feature Learning for Aerial-Ground Person Re-IdentificationWajahat Khalid, Bin Liu, Xulin Li, Muhammad Waqas, Muhammad Sher Afgan. 9749-9758 [doi]
- CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-AffordanceJinming Li, Yichen Zhu 0001, Zhibin Tang, Junjie Wen, Minjie Zhu, Xiaoyu Liu, Chengmeng Li, Ran Cheng, Yaxin Peng, Yan Peng 0001, Feifei Feng. 9759-9769 [doi]
- Removing Out-of-Focus Reflective Flares via Color AlignmentFengbo Lan, Chang Wen Chen. 9770-9779 [doi]
- Proactive Scene Decomposition and ReconstructionBaicheng Li, Zike Yan, Dong Wu, Hongbin Zha. 9780-9789 [doi]
- Unified Category-Level Object Detection and Pose Estimation from RGB Images Using 3D PrototypesTom Fischer, Xiaojie Zhang, Eddy Ilg. 9790-9800 [doi]
- CAD-Recode: Reverse Engineering CAD Code From Point CloudsDanila Rukhovich, Elona Dupont, Dimitrios Mallis, Kseniya Cherenkova, Anis Kacem 0001, Djamila Aouada. 9801-9811 [doi]
- EvRT-DETR: Latent Space Adaptation of Image Detectors for Event-Based VisionDmitrii Torbunov, Yihui Ren 0001, Animesh Ghose, Odera Dim, Yonggang Cui. 9812-9821 [doi]
- IRASim: A Fine-Grained World Model for Robot ManipulationFangqi Zhu, Hongtao Wu, Song Guo, Yuxiao Liu, Chilam Cheang, Tao Kong. 9834-9844 [doi]
- WalkVLM: Aid Visually Impaired People Walking by Vision Language ModelZhiqiang Yuan, Ting Zhang, Yeshuang Zhu, Jiapei Zhang, Ying Deng, Zexi Jia, Peixiang Luo, Xiaoyue Duan, Jie Zhou 0016, Jinchao Zhang 0001. 9845-9854 [doi]
- CCL-LGS: Contrastive Codebook Learning for 3D Language Gaussian SplattingLei Tian, Xiaomin Li 0001, Liqian Ma, Hao Yin, Zirui Zheng, Hefei Huang, Taiqing Li, Huchuan Lu, Xu Jia 0012. 9855-9864 [doi]
- LDPose: Towards Inclusive Human Pose Estimation for Limb-Deficient Individuals in the WildJiaying Ying, Heming Du, Kaihao Zhang, Lincheng Li, Xin Yu 0002. 9865-9875 [doi]
- RS-vHeat: Heat Conduction Guided Efficient Remote Sensing Foundation ModelHuiyang Hu, Peijin Wang, Hanbo Bi, Boyuan Tong, Zhaozhi Wang, Wenhui Diao, Hao Chang, Yingchao Feng, Ziqi Zhang, Yaowei Wang 0001, Qixiang Ye, Kun Fu 0001, Xian Sun 0001. 9876-9887 [doi]
- Towards a Unified Copernicus Foundation Model for Earth VisionYi Wang 0072, Zhitong Xiong, Chenying Liu 0001, Adam J. Stewart, Thomas Dujardin, Nikolaos-Ioannis Bountos, Angelos Zavras, Franziska Gerken, Ioannis Papoutsis, Laura Leal-Taixé, Xiao Xiang Zhu 0001. 9888-9899 [doi]
- Learning Streaming Video Representation via Multitask TrainingYibin Yan, Jilan Xu, Shangzhe Di, Yikun Liu, Yudi Shi, Qirui Chen, Zeqian Li, Yifei Huang 0002, Weidi Xie. 9900-9912 [doi]
- LoftUp: Learning a Coordinate-Based Feature Upsampler for Vision Foundation ModelsHaiwen Huang, Anpei Chen, Volodymyr Havrylov, Andreas Geiger 0001, Dan Zhang. 9913-9923 [doi]
- Learning Visual Hierarchies in Hyperbolic Space for Image RetrievalZiwei Wang, Sameera Ramasinghe, Chenchen Hu, Julien Monteil, Loris Bazzani, Thalaiyasingam Ajanthan. 9924-9934 [doi]
- GMMamba: Group Masking Mamba for Whole Slide Image ClassificationTingting Zheng, Hongxun Yao, Kui Jiang, Yi Xiao 0003, Sicheng Zhao. 9935-9944 [doi]
- NullSwap: Proactive Identity Cloaking Against Deepfake Face SwappingTianyi Wang 0006, Shuaicheng Niu, Harry Cheng 0002, Xiao Zhang, Yinglong Wang 0001. 9945-9954 [doi]
- MaskControl: Spatio-Temporal Control for Masked Motion SynthesisEkkasit Pinyoanuntapong, Muhammad Usama Saleem, Korrawe Karunratanakul, Pu Wang 0001, Hongfei Xue, Chen Chen 0001, Chuan Guo 0002, Junli Cao, Jian Ren 0005, Sergey Tulyakov. 9955-9965 [doi]
- HairCUP: Hair Compositional Universal Prior for 3D Gaussian AvatarsByungjun Kim, Shunsuke Saito, Giljoo Nam, Tomas Simon, Jason M. Saragih, Hanbyul Joo, Junxuan Li. 9966-9976 [doi]
- Understanding Co-Speech Gestures in-the-WildSindhu B. Hegde, K. R. Prajwal, Taein Kwon, Andrew Zisserman. 9977-9987 [doi]
- DPoser-X: Diffusion Model as Robust 3D Whole-Body Human Pose PriorJunzhe Lu 0001, Jing Lin, Hongkun Dou, Ailing Zeng, Yue Deng 0001, Xian Liu, Zhongang Cai, Lei Yang 0059, Yulun Zhang 0001, Haoqian Wang, Ziwei Liu 0002. 9988-9997 [doi]
- Teeth Reconstruction and Performance Capture Using a Phone CameraWeixi Zheng, Jingwang Ling, Zhibo Wang 0003, Quan Wang, Feng Xu 0005. 9998-10008 [doi]
- Error Recognition in Procedural Videos Using Generalized Task GraphShih-Po Lee, Ehsan Elhamifar. 10009-10021 [doi]
- MoMaps: Semantics-Aware Scene Motion Generation with Motion MapsJiahui Lei, Kyle Genova, George Kopanas, Noah Snavely, Leonidas J. Guibas. 10022-10031 [doi]
- LongAnimation: Long Animation Generation with Dynamic Global-Local MemoryNan Chen, Mengqi Huang, Yihao Meng, Zhendong Mao 0001. 10032-10042 [doi]
- VIGFace: Virtual Identity Generation for Privacy-Free Face Recognition DatasetMinsoo Kim, Min-Cheol Sagong, Gi Pyo Nam, Junghyun Cho, Ig-Jae Kim. 10043-10053 [doi]
- Canonswap: High-Fidelity and Consistent Video Face Swapping Via Canonical Space ModulationXiangyang Luo, Ye Zhu, Yunfei Liu, Lijian Lin, Cong Wan, Zijian Cai, Yu Li, Shao-Lun Huang. 10064-10074 [doi]
- RoboFactory: Exploring Embodied Agent Collaboration with Compositional ConstraintsYiran Qin, Li Kang, Xiufeng Song, Zhenfei Yin, Xiaohong Liu 0001, Xihui Liu, Ruimao Zhang, Lei Bai 0001. 10075-10085 [doi]
- MotionStreamer: Streaming Motion Generation via Diffusion-Based Autoregressive Model in Causal Latent SpaceLixing Xiao, Shunlin Lu, Huaijin Pi, Ke-fan, Liang Pan, Yueer Zhou, Ziyong Feng, Xiaowei Zhou 0001, Sida Peng, Jingbo Wang 0003. 10086-10096 [doi]
- RapVerse: Coherent Vocals and Whole-Body Motion Generation from TextJiaben Chen, Xin Yan 0008, Yihang Chen, Siyuan Cen, Zixin Wang, Qinwei Ma, Haoyu Zhen, Kaizhi Qian, Lie Lu, Chuang Gan 0001. 10097-10107 [doi]
- GGTalker: Talking Head Systhesis with Generalizable Gaussian Priors and Identity-Specific AdaptationWentao Hu, Shunkai Li, Ziqiao Peng, Haoxian Zhang, Fan Shi, Xiaoqiang Liu, Pengfei Wan 0001, Di Zhang 0026, Hui Tian. 10108-10117 [doi]
- GraspCoT: Integrating Physical Property Reasoning for 6-DoF Grasping Under Flexible Language InstructionsXiaomeng Chu, Jiajun Deng, Guoliang You, Wei Liu, Xingchen Li, Jianmin Ji, Yanyong Zhang. 10130-10140 [doi]
- Asynchronous Event Error-Minimizing Noise for Safeguarding Event DatasetRuofei Wang, Peiqi Duan, Boxin Shi, Renjie Wan. 10141-10150 [doi]
- Exploiting Diffusion Prior for Task-Driven Image RestorationJaeha Kim, Junghun Oh, Kyoung Mu Lee. 10151-10161 [doi]
- Bridging Class Imbalance and Partial Labeling Via Spectral-Balanced Energy Propagation for Skeleton-Based Action RecognitionYandan Wang, Chenqi Guo, Yinglong Ma, Jiangyan Chen, Yuan Gao, Weiming Dong. 10162-10172 [doi]
- Towards Immersive Human-X Interaction: A Real-Time Framework for Physically Plausible Motion SynthesisKaiyang Ji, Ye Shi 0001, Zichen Jin, Kangyi Chen, Lan Xu 0003, Yuexin Ma, Jingyi Yu 0001, Jingya Wang 0001. 10173-10183 [doi]
- SynFER: Towards Boosting Facial Expression Recognition With Synthetic DataXilin He, Cheng Luo, Xiaole Xian, Bing Li 0024, Muhammad Haris Khan, ZongYuan Ge, Weicheng Xie 0001, Siyang Song, LinLin Shen, Bernard Ghanem, Xiangyu Yue. 10184-10195 [doi]
- ImHead: A Large-Scale Implicit Morphable Model for Localized Head ModelingRolandos-Alexandros Potamias, Stathis Galanakis, Jiankang deng, Athanasios Papaioannou, Stefanos Zafeiriou. 10196-10206 [doi]
- Animate Anyone 2: High-Fidelity Character Image Animation with Environment AffordanceLi Hu, Guangyuan Wang, Zhen Shen, Xin Gao, Dechao Meng, Lian Zhuo, Peng Zhang 0080, Bang Zhang, Liefeng Bo. 10207-10217 [doi]
- PVMamba: Parallelizing Vision Mamba via Dynamic State AggregationFei Xie, Zhongdao Wang, Weijia Zhang, Chao Ma 0004. 10218-10228 [doi]
- FlowStyler: Artistic Video Stylization Via Transformation Fields TransportsYuning Gong, Jiaming Chen, Xiaohua Ren, Yuanjun Liao, Yanci Zhang. 10229-10238 [doi]
- Controllable and Expressive One-Shot Video Head SwappingChaonan Ji, Jinwei Qi, Peng Zhang, Bang Zhang, Liefeng Bo. 10239-10250 [doi]
- Multi-Modal Multi-Platform Person Re-Identification: Benchmark and MethodRuiyang Ha, Songyi Jiang, Bin Li, Bikang Pan, Yihang Zhu, Junjie Zhang 0002, Xiatian Zhu, Shaogang Gong, Jingya Wang 0001. 10251-10261 [doi]
- HERO: Human Reaction Generation from VideosChengjun Yu, Wei Zhai, Yuhang Yang 0002, Yang Cao 0010, Zheng-Jun Zha. 10262-10274 [doi]
- Mixture of Experts Guided by Gaussian Splatters Matters: A New Approach to Weakly-Supervised Video Anomaly DetectionGiacomo D'Amicantonio, Snehashis Majhi, Quan Kong, Lorenzo Garattoni, Gianpiero Francesca, François Brémond, Egor Bondarev. 10275-10285 [doi]
- What If: Understanding Motion Through Sparse InteractionsStefan Andreas Baumann, Nick Stracke, Timy Phan, Björn Ommer. 10286-10296 [doi]
- Progressor: A Perceptually Guided Reward Estimator with Self-Supervised Online RefinementTewodros W. Ayalew, Xiao Zhang, Kevin Yuanbo Wu, Tianchong Jiang, Michael Maire, Matthew R. Walter. 10297-10306 [doi]
- How Far are AI-Generated Videos from Simulating the 3D Visual World: A Learned 3D Evaluation ApproachChirui Chang, Jiahui Liu 0012, Zhengzhe Liu, Xiaoyang Lyu, Yi-Hua Huang, Xin Tao 0001, Pengfei Wan 0001, Di Zhang 0026, Xiaojuan Qi 0001. 10307-10317 [doi]
- UniEgoMotion: A Unified Model for Egocentric Motion Reconstruction, Forecasting, and GenerationChaitanya Patel, Hiroki Nakamura, Yuta Kyuragi, Kazuki Kozuka, Juan Carlos Niebles, Ehsan Adeli 0001. 10318-10329 [doi]
- DAViD: Modeling Dynamic Affordance of 3D Objects Using Pre-Trained Video Diffusion ModelsHyeonwoo Kim, Sangwon Baik, Hanbyul Joo. 10330-10341 [doi]
- DNF-Intrinsic: Deterministic Noise-Free Diffusion for Indoor Inverse RenderingRongjia Zheng, Qing Zhang 0006, Chengjiang Long, Wei-Shi Zheng 0001. 10342-10352 [doi]
- RoboAnnotatorX: A Comprehensive and Universal Annotation Framework for Accurate Understanding of Long-Horizon Robot DemonstrationLongxin Kou, Fei Ni 0001, Yan Zheng 0002, Peilong Han, Jinyi Liu 0002, Haiqin Cui, Rui Liu, Jianye Hao. 10353-10363 [doi]
- FaceShield: Defending Facial Image Against Deepfake ThreatsJaehwan Jeong, Sumin In, Sieun Kim, Hannie Shin, Jongheon Jeong, Sang Ho Yoon, Jaewook Chung, Sangpil Kim. 10364-10374 [doi]
- Task-Oriented Human Grasp Synthesis via Context- and Task-Aware DiffusersAn-Lun Liu, Yu-Wei Chao, Yi-Ting Chen. 10375-10385 [doi]
- Ouroboros: Single-Step Diffusion Models for Cycle-Consistent Forward and Inverse RenderingShanlin Sun, Yifan Wang, Hanwen Zhang, Yifeng Xiong, Qin Ren, Ruogu Fang, Xiaohui Xie, Chenyu You. 10386-10397 [doi]
- Expressive Talking Human from Single-Image with Imperfect PriorsJun Xiang, Yudong Guo, Leipeng Hu, Boyang Guo, Yancheng Yuan, Juyong Zhang. 10398-10409 [doi]
- InteractAvatar: Modeling Hand-Face Interaction in Photorealistic Avatars with Deformable GaussiansKefan Chen, Sreyas Mohan, Justin Theiss, Sergiu Oprea, Srinath Sridhar 0002, Aayush Prakash. 10410-10420 [doi]
- Beyond Label Semantics:Language-Guided Action Anatomy for Few-Shot Action RecognitionZefeng Qian, Xincheng Yao, Yifei Huang, Chongyang Zhang, Jiangyong Ying, Hong Sun. 10421-10431 [doi]
- DynFaceRestore: Balancing Fidelity and Quality in Diffusion-Guided Blind Face Restoration with Dynamic Blur-Level Mapping and GuidanceHuu-Phu Do, Yu-Wei Chen, Yi-Cheng Liao, Chi-Wei Hsiao, Han-Yang Wang, Wei-chen Chiu, Ching-Chun Huang. 10432-10441 [doi]
- Few-Shot Image Quality Assessment via Adaptation of Vision-Language ModelsXudong Li, Zihao Huang, Yan Zhang 0109, Yunhang Shen, Ke Li 0015, Xiawu Zheng, Liujuan Cao, Rongrong Ji. 10442-10452 [doi]
- Unleashing High-Quality Image Generation in Diffusion Sampling Using Second-Order Levenberg-Marquardt-LangevinFangyikang Wang, Hubery Yin, Lei Qian, Yinan Li, Shaobin Zhuang, Huminhao Zhu, Yilin Zhang, Yanlong Tang, Chao Zhang 0029, Hanbin Zhao, Hui Qian 0001, Chen Li 0031. 10453-10464 [doi]
- VISION-XL: High Definition Video Inverse Problem Solver using Latent Image Diffusion ModelsTaesung Kwon, Jong Chul Ye. 10465-10474 [doi]
- Dynamic Group Detection using VLM-augmented Temporal Groupness GraphKaname Yokoyama, Chihiro Nakatani, Norimichi Ukita. 10475-10484 [doi]
- When Lighting Deceives: Exposing Vision-Language Models' Illumination Vulnerability Through Illumination Transformation AttackHanqing Liu, Shouwei Ruan, Yao Huang, Shiji Zhao, Xingxing Wei 0001. 10485-10495 [doi]
- Self-Calibrated Variance-Stabilizing Transformations for Real-World Image DenoisingSébastien Herbreteau, Michael Unser. 10496-10506 [doi]
- Reverse Convolution and its Applications to Image RestorationXuhong Huang, Shiqi Liu, Kai Zhang, Ying Tai, Jian Yang, Hui Zeng, Lei Zhang. 10507-10516 [doi]
- MamTiff-CAD: Multi-Scale Latent Diffusion with Mamba+ for Complex Parametric SequenceLiyuan Deng, Yunpeng Bai, Yongkang Dai, Xiaoshui Huang, Hongping Gan, Dongshuo Huang, Jiacheng Hao, Yilei Shi. 10517-10526 [doi]
- Local Scale Equivariance with Latent Deep Equilibrium CanonicalizerMd Ashiqur Rahman, Chiao-An Yang, Michael N. Cheng, Lim Jun Hao, Jeremiah Jiang, Teck-Yian Lim, Raymond A. Yeh. 10527-10537 [doi]
- HOMO-Feature: Cross-Arbitrary-Modal Image Matching with Homomorphism of Organized Major OrientationChenzhong Gao, Wei Li 0032, Desheng Weng. 10538-10548 [doi]
- DynamicID: Zero-Shot Multi-ID Image Personalization With Flexible Facial EditabilityXirui Hu, Jiahao Wang 0004, Hao Chen, Weizhan Zhang, Benqi Wang, Yikun Li, Haishun Nan. 10549-10559 [doi]
- Freedance: Towards Harmonic Free-Number Group Dance Generation Via a Unified FrameworkYiwen Zhao, Yang Wang, Liting Wen, Hengyuan Zhang, Xingqun Qi. 10560-10569 [doi]
- SILO: Solving Inverse Problems with Latent OperatorsRon Raphaeli, Sean Man, Michael Elad. 10570-10580 [doi]
- Learning Precise Affordances From Egocentric Videos for Robotic ManipulationGen Li 0008, Nikolaos Tsagkas, Jifei Song, Ruaridh Mon-Williams, Sethu Vijayakumar, Kun Shao, Laura Sevilla-Lara. 10581-10591 [doi]
- EfficientMT: Efficient Temporal Adaptation for Motion Transfer in Text-To-Video Diffusion ModelsYufei Cai, Hu Han 0001, Yuxiang Wei 0001, Shiguang Shan, Xilin Chen 0001. 10592-10601 [doi]
- X-Dancer: Expressive Music to Human Dance Video GenerationZeyuan Chen, Hongyi Xu, Guoxian Song, You Xie, Chenxu Zhang, Xin Chen 0040, Chao Wang 0088, Di Chang, Linjie Luo. 10602-10611 [doi]
- DeepMesh: Auto-Regressive Artist-Mesh Creation with Reinforcement LearningRuowen Zhao, Junliang Ye, Zhengyi Wang, Guangce Liu, Yiwen Chen, Yikai Wang 0001, Jun Zhu 0001. 10612-10623 [doi]
- SAM Encoder Breach by Adversarial Simplicial Complex Triggers Downstream Model FailuresYi Qin, Rui Wang, Tao Huang, Tong Xiao 0021, Liping Jing. 10624-10634 [doi]
- Text-IRSTD: Leveraging Semantic Text to Promote Infrared Small Target Detection in Complex ScenesFeng Huang 0007, Shuyuan Zheng, Zhaobing Qiu, Huanxian Liu, Huanxin Bai, Liqiong Chen. 10635-10644 [doi]
- AMDANet: Attention-Driven Multi-Perspective Discrepancy Alignment for RGB-Infrared Image Fusion and SegmentationHaifeng Zhong, Fan Tang, Zhuo Chen 0028, Hyung Jin Chang, Yixing Gao. 10645-10655 [doi]
- Im2Haircut: Single-View Strand-Based Hair Reconstruction for Human AvatarsVanessa Sklyarova, Egor Zakharov, Malte Prinzler, Giorgio Becherini, Michael J. Black, Justus Thies. 10656-10665 [doi]
- AFUNet: Cross-Iterative Alignment-Fusion Synergy for HDR Reconstruction via Deep Unfolding ParadigmXinyue Li, Zhangkai Ni, Wenhan Yang. 10666-10675 [doi]
- Tera: Rethinking Text-Guided Realistic 3D Avatar GenerationYanwen Wang, Yiyu Zhuang, Jiawei Zhang, Li Wang, Yifei Zeng, Xun Cao, Xinxin Zuo, Hao Zhu 0004. 10686-10697 [doi]
- A Unified Framework for Motion Reasoning and Generation in Human InteractionJeongeun Park, Sungjoon Choi, Sangdoo Yun. 10698-10707 [doi]
- Open-World Skill Discovery from Unsegmented Demonstration VideosJingwen Deng, Zihao Wang, Shaofei Cai, Anji Liu, Yitao Liang. 10708-10718 [doi]
- CLOT: Closed Loop Optimal Transport for Unsupervised Action SegmentationElena Belén Bueno-Benito, Mariella Dimiccoli. 10719-10729 [doi]
- Deep Adaptive Unfolded Network via Spatial Morphology Stripping and Spectral Filtration for Pan-SharpeningHebaixu Wang, Jiayi Ma. 10730-10740 [doi]
- EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric PerceptionSanjoy Chowdhury, Subrata Biswas, Sayan Nag, Tushar Nagarajan, Calvin Murdock, Ishwarya Ananthabhotla, Yijun Qian, Vamsi Krishna Ithapu, Dinesh Manocha, Ruohan Gao. 10741-10752 [doi]
- Towards Human-Like Virtual Beings: Simulating Human Behavior in 3D ScenesChen Liang, Wenguan Wang, Yi Yang 0001. 10753-10763 [doi]
- Reference-Based Super-Resolution via Image-Based Retrieval-Augmented Generation DiffusionByeonghun Lee, Hyunmin Cho, Hong Gyu Choi, Soo-Min Kang, Iljun Ahn, Kyong Hwan Jin. 10764-10774 [doi]
- Dual-Temporal Exemplar Representation Network for Video Semantic SegmentationXiaolong Xu, Lei Zhang 0005, Jiayi Li, Lituan Wang, Yifan Guan, Yu Yan, Leyi Zhang, Hao Song. 10775-10785 [doi]
- Vulnerability-Aware Spatio-Temporal Learning for Generalizable Deepfake Video DetectionDat Nguyen, Marcella Astrid, Anis Kacem 0001, Enjie Ghorbel, Djamila Aouada. 10786-10796 [doi]
- Multi-modal Identity ExtractionRyan Webster, Teddy Furon. 10797-10806 [doi]
- Joint Self-Supervised Video Alignment and Action SegmentationAli Shah Ali, Syed Ahmed Mahmood, Mubin Saeed, Andrey Konin, M. Zeeshan Zia, Quoc Huy Tran. 10807-10818 [doi]
- VSSD: Vision Mamba With Non-Causal State Space DualityYuheng Shi, Mingjia Li, Minjing Dong, Chang Xu. 10819-10829 [doi]
- EgoM2P: Egocentric Multimodal Multitask PretrainingGen Li 0010, Yutong Chen, Yiqian Wu, Kaifeng Zhao 0004, Marc Pollefeys, Siyu Tang 0001. 10830-10843 [doi]
- Efficient Multi-Person Motion Prediction by Lightweight Spatial and Temporal InteractionsYuanhong Zheng, Ruixuan Yu, Jian Sun. 10844-10853 [doi]
- E-NeMF: Event-based Neural Motion Field for Novel Space-time View Synthesis of Dynamic ScenesYan Liu, Zehao Chen, Haojie Yan, De Ma, Huajin Tang, Qian Zheng, Gang Pan 0001. 10854-10864 [doi]
- LayerAnimate: Layer-Level Control for AnimationYuxue Yang, Lue Fan, Zuzeng Lin, Feng Wang 0015, Zhaoxiang Zhang 0001. 10865-10874 [doi]
- AnimeGamer: Infinite Anime Life Simulation with Next Game State PredictionJunhao Cheng, Yuying Ge, Yixiao Ge, Jing Liao 0001, Ying Shan. 10875-10885 [doi]
- Humoto: A 4D Dataset of Mocap Human Object InteractionsJiaxin Lu 0001, Chun-Hao Paul Huang, Uttaran Bhattacharya, Qixing Huang, Yi Zhou. 10886-10897 [doi]
- InfiniteYou: Flexible Photo Recrafting While Preserving Your IdentityLiming Jiang, Qing Yan, Yumin Jia, Zichuan Liu, Hao Kang, Xin Lu. 10898-10907 [doi]
- Enhanced Pansharpening Via Quaternion Spatial-Spectral InteractionsDong Liu 0002, Chunhui Luo, Yuanfei Bao, Gang Yang, Jie Xiao 0002, Xueyang Fu, Zheng-Jun Zha. 10908-10918 [doi]
- CombatVLA: An Efficient Vision-Language-Action Model for Combat Tasks in 3D Action Role-Playing GamesPeng Chen, Pi Bu, Yingyao Wang, Xinyi Wang, Ziming Wang, Jie Guo, Yingxiu Zhao, Qi Zhu, Jun Song, Siran Yang, Jiamang Wang, Bo Zheng. 10919-10928 [doi]
- GestureLSM: Latent Shortcut Based Co-Speech Gesture Generation with Spatial-Temporal ModelingPinxin Liu, Luchuan Song, Junhua Huang, Haiyang Liu, Chenliang Xu. 10929-10939 [doi]
- MonSTeR: A Unified Model for Motion, Scene, Text RetrievalLuca Collorone, Matteo Gioia, Massimiliano Pappa, Paolo Leoni, Giovanni Ficarra, Or Litany, Indro Spinelli, Fabio Galasso. 10940-10949 [doi]
- UDC-VIT: A Real-World Video Dataset for Under-Display CamerasKyusu Ahn, Jisoo Kim, Sangik Lee, Hyungyu Lee, Byeonghyun Ko, Chanwoo Park, Jaejin Lee. 10950-10960 [doi]
- Blind Video Super-Resolution Based on Implicit KernelsQiang Zhu, Yuxuan Jiang 0015, Shuyuan Zhu, Fan Zhang 0017, David Bull 0001, Bing Zeng 0001. 10971-10981 [doi]
- F-Bench: Rethinking Human Preference Evaluation Metrics for Benchmarking Face Generation, Customization, and RestorationLu Liu 0005, Huiyu Duan, Qiang Hu 0003, Liu Yang, Chunlei Cai, Tianxiao Ye, Huayu Liu, Xiaoyun Zhang 0001, Guangtao Zhai. 10982-10994 [doi]
- Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion TransferQingyu Shi, Jianzong Wu, Jinbin Bai, Jiangning Zhang, Lu Qi 0001, Yunhai Tong, Xiangtai Li. 10995-11005 [doi]
- Latent Swap Joint Diffusion for 2D Long-Form Latent GenerationYusheng Dai, Chenxi Wang, Chang Li, Chen Wang, Kewei Li, Jun Du 0002, Lei Sun 0010, Jianqing Gao, Ruoyu Wang 0029, Jiefeng Ma. 11006-11015 [doi]
- Blind Noisy Image Deblurring Using Residual Guidance StrategyHeyan Liu, Jianing Sun, Jun Liu 0012, Xi-Le Zhao, Tingting Wu 0001, Tieyong Zeng. 11016-11025 [doi]
- Drawing Developmental Trajectory From Cortical Surface ReconstructionWenxuan Wu, Ruowen Qu, Zhongliang Liu, Zhuoyan Dai, Dongzi Shi, Sijin Yu, Tong Xiong, Shiping Liu, Xiangmin Xu, Xiaofen Xing, Xin Zhang 0013. 11026-11035 [doi]
- DreamActor-M1: Holistic, Expressive and Robust Human Image Animation with Hybrid GuidanceYuxuan Luo 0002, Zhengkun Rong, Lizhen Wang, Longhao Zhang, Tianshu Hu. 11036-11046 [doi]
- Diffuman4D: 4D Consistent Human View Synthesis From Sparse-View Videos With Spatio-Temporal Diffusion ModelsYudong Jin, Sida Peng, Xuan Wang, Tao Xie, Zhen Xu 0008, Yifan Yang, Yujun Shen, Hujun Bao, Xiaowei Zhou 0001. 11047-11057 [doi]
- DyWA: Dynamics-Adaptive World Action Model for Generalizable Non-Prehensile ManipulationJiangran Lyu, Ziming Li, Xuesong Shi, Chaoyi Xu, Yizhou Wang, He Wang. 11058-11068 [doi]
- Less is More: Improving Motion Diffusion Models with Sparse KeyframesJinseok Bae, Inwoo Hwang, Young-Yoon Lee, Ziyu Guo, Joseph Liu, Yizhak Ben-Shabat, Young Min Kim 0001, Mubbasir Kapadia. 11069-11078 [doi]
- DGTalker: Disentangled Generative Latent Space Learning for Audio-Driven Gaussian Talking HeadsXiaoxi Liang, Yanbo Fan, Qiya Yang, Xuan Wang 0009, Wei Gao, Ge Li. 11079-11088 [doi]
- VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action TokenizersYating Wang, Haoyi Zhu, Mingyu Liu, Jiange Yang, Haoshu Fang, Tong He 0001. 11089-11099 [doi]
- Temporal Unlearnable Examples: Preventing Personal Video Data from Unauthorized Exploitation by Object TrackingQiangqiang Wu, Yi Yu 0011, Chenqi Kong, Ziquan Liu, Jia Wan 0001, Haoliang Li, Alex C. Kot, Antoni B. Chan. 11110-11121 [doi]
- Frequency-Semantic Enhanced Variational Autoencoder for Zero-Shot Skeleton-Based Action RecognitionWenhan Wu, Zhishuai Guo, Chen Chen 0001, Hongfei Xue, Aidong Lu. 11122-11131 [doi]
- Learning Hierarchical Line Buffer for Image ProcessingJiacheng Li, Feiran Li, Daisuke Iso. 11132-11141 [doi]
- VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning TasksShiduo Zhang, Zhe Xu, Peiju Liu, Xiaopeng Yu, Yuan Li, Qinghui Gao, Zhaoye Fei, Zhangyue Yin, Zuxuan Wu, Yu-Gang Jiang 0001, Xipeng Qiu. 11142-11152 [doi]
- Trackverse: a Large-Scale Object-Centric Video Dataset for Image-Level Representation LearningYibing Wei, Samuel Church, Victor Suciu, Jinhong Lin, Cheng-En Wu. 11153-11163 [doi]
- Reangle-A-Video: 4D Video Generation as Video-to-Video TranslationHyeonho Jeong, Suhyeon Lee 0004, Jong Chul Ye. 11164-11175 [doi]
- Human-Object Interaction from Human-level InstructionsZhen Wu, Jiaman Li, Pei Xu 0005, C. Karen Liu. 11176-11186 [doi]
- KinMo: Kinematic-Aware Human Motion Understanding and GenerationPengfei Zhang, Pinxin Liu, Pablo Garrido 0001, Hyeongwoo Kim, Bindita Chaudhuri. 11187-11197 [doi]
- Beyond Spatial Frequency: Pixel-Wise Temporal Frequency-Based Deepfake Video DetectionTaehoon Kim, Jongwook Choi, Yonghyun Jeong, Haeun Noh, Jaejun Yoo, SeungRyul Baek, Jongwon Choi. 11198-11207 [doi]
- Causal-Entity Reflected Egocentric Traffic Accident Video SynthesisLei-Lei Li, Jianwu Fang, Junbin Xiao, Shanmin Pang, Hongkai Yu, Chen Lv 0001, Jianru Xue, Tat-Seng Chua. 11208-11218 [doi]
- WaveMamba: Wavelet-Driven Mamba Fusion for RGB-Infrared Object DetectionHaodong Zhu, Wenhao Dong, Linlin Yang, Hong Li 0016, Yuguang Yang 0007, Yangyang Ren, Qingcheng Zhu, Zichao Feng, Changbai Li, Shaohui Lin, Runqi Wang, Xiaoyan Luo, Baochang Zhang 0001. 11219-11229 [doi]
- Robust Test-Time Adaptation for Single Image Denoising Using Deep Gaussian PriorQing Ma, Pengwei Liang, Xiong Zhou, Jiayi Ma 0001, Junjun Jiang, Zhe Peng. 11230-11240 [doi]
- MemoryTalker: Personalized Speech-Driven 3D Facial Animation via Audio-Guided StylizationHyung Kyu Kim, Sangmin Lee, Hak Gu Kim. 11241-11251 [doi]
- Balancing Task-Invariant Interaction and Task-Specific Adaptation for Unified Image FusionXingyu Hu, Junjun Jiang, Chenyang Wang 0002, Kui Jiang, Xianming Liu 0005, Jiayi Ma 0001. 11262-11272 [doi]
- EVOLVE: Event-Guided Deformable Feature Transfer and Dual-Memory Refinement for Low-Light Video Object SegmentationJong-Hyeon Baek, Jiwon Oh, Yeong Jun Koh. 11273-11282 [doi]
- PatchScaler: An Efficient Patch-Independent Diffusion Model for Image Super-ResolutionYong Liu 0031, Hang Dong 0001, Jinshan Pan, Qingji Dong, Kai Chen 0023, Rongxiang Zhang, Lean Fu, Fei Wang 0008. 11283-11293 [doi]
- OneGT: One-Shot Geometry-Texture Neural Rendering for Head AvatarsJinshu Chen, Bingchuan Li, Fan Zhang, Songtao Zhao, Qian He. 11294-11304 [doi]
- Motionagent: Fine-Grained Controllable Video Generation via Motion Field AgentXinyao Liao, Xianfang Zeng, Liao Wang, Gang Yu 0002, Guosheng Lin, Chi Zhang 0007. 11305-11316 [doi]
- Disentangled Clothed Avatar Generation with Layered RepresentationWeitian Zhang, Yichao Yan, Sijing Wu, Manwen Liao, Xiaokang Yang 0001. 11327-11338 [doi]
- Augmented Mass-Spring Model for Real-Time Dense Hair SimulationJorge Alejandro Amador Herrera, Yi Zhou 0023, Xin Sun 0014, Zhixin Shu, Chengan He, Sören Pirk, Dominik L. Michels. 11339-11347 [doi]
- Punching Bag vs. Punching Person: Motion Transferability in VideosRaiyaan Abdullah, Jared Claypoole, Michael Cogswell, Ajay Divakaran, Yogesh S. Rawat. 11348-11358 [doi]
- Ock: Unsupervised Dynamic Video Prediction With Object-Centric KinematicsYeon-Ji Song, Jaein Kim, Suhyung Choi, Jin-Hwa Kim, Byoung-Tak Zhang. 11359-11368 [doi]
- FaceXFormer: A Unified Transformer for Facial AnalysisKartik Narayan, Vibashan VS, Rama Chellappa, Vishal M. Patel. 11369-11382 [doi]
- ContextFace: Generating Facial Expressions from Emotional ContextsMin-Jung Kim, Minsang Kim, Seung Jun Baek. 11383-11392 [doi]
- Laboring on Less Labors: RPCA Paradigm for Pan-SharpeningHonghui Xu, Chuangjie Fang, Yibin Wang, Jie Wu, Jianwei Zheng. 11393-11402 [doi]
- ShadowHack: Hacking Shadows via Luminance-Color Divide and ConquerJin Hu, Mingjia Li, Xiaojie Guo. 11403-11413 [doi]
- What we Need is Explicit Controllability: Training 3D Gaze Estimator Using Only Facial ImagesTingwei Li, Jun Bao, Zhenzhong Kuang, Buyu Liu. 11414-11424 [doi]
- Riemannian-Geometric Fingerprints of Generative ModelsHae Jin Song, Laurent Itti. 11425-11435 [doi]
- Unraveling the Smoothness Properties of Diffusion Models: A Gaussian Mixture PerspectiveYingyu Liang, Zhizhou Sha, Zhenmei Shi, Zhao Song 0002, Mingda Wan, Yufa Zhou 0001. 11436-11446 [doi]
- G-DexGrasp: Generalizable Dexterous Grasping Synthesis via Part-Aware Prior Retrieval and Prior-Assisted GenerationJuntao Jian, Xiuping Liu, Zixuan Chen, Manyi Li, Jian Liu, Ruizhen Hu. 11447-11457 [doi]
- FPEM: Face Prior Enhanced Facial Attractiveness Prediction for Live Videos with Face RetouchingHui Li, Xiaoyu Ren, Hongjiu Yu, Ying Chen 0011, Kai Li 0012, L. Wang, Xiongkuo Min, Huiyu Duan, Guangtao Zhai, Xu Liu 0006. 11458-11468 [doi]
- Diffusion-Based Imaginative Coordination for Bimanual ManipulationHuilin Xu, Jian Ding, Jiakun Xu, Ruixiang Wang, Jun Chen 0021, Jinjie Mai, Yanwei Fu 0001, Bernard Ghanem, Feng Xu 0001, Mohamed Elhoseiny. 11469-11479 [doi]
- WarpHE4D: Dense 4D Head Map Toward Full Head ReconstructionJongseob Yun, Yong Hoon Kwon, Min-Gyu Park, Ju-Mi Kang, Min-Ho Lee, Inho Chang, Ju Hong Yoon, Kuk-Jin Yoon. 11480-11490 [doi]
- PrimHOI: Compositional Human-Object Interaction via Reusable PrimitivesKai Jia, Tengyu Liu, Yixin Zhu 0001, Mingtao Pei, Siyuan Huang 0001. 11491-11501 [doi]
- Continuous-Time Human Motion Field from Event CamerasZiyun Wang 0001, Ruijun Zhang, Zi Yan Liu, Yufu Wang, Kostas Daniilidis. 11502-11512 [doi]
- Efficient Track AnythingYunyang Xiong, Chong Zhou, Xiaoyu Xiang, Lemeng Wu, Chenchen Zhu, Zechun Liu, Saksham Suri, Balakrishnan Varadarajan, Ramya Akula, Forrest N. Iandola, Raghuraman Krishnamoorthi, Bilge Soran, Vikas Chandra. 11513-11524 [doi]
- HAMoBE: Hierarchical and Adaptive Mixture of Biometric Experts for Video-Based Person ReIDYiyang Su, Yunping Shi, Feng Liu, Xiaoming Liu. 11525-11536 [doi]
- Multi-Object Sketch Animation by Scene Decomposition and Motion PlanningJingyu Liu, Zijie Xin, Yuhan Fu, Ruixiang Zhao, Bangxiang Lan, Xirong Li 0001. 11537-11546 [doi]
- ISP2HRNet: Learning to Reconstruct High Resolution Image from Irregularly Sampled Pixels via Hierarchical Gradient LearningYuanlin Wang, Ruiqin Xiong, Rui Zhao 0010, Jin Wang 0023, Xiaopeng Fan 0001, Tiejun Huang 0001. 11547-11557 [doi]
- LDIP: Long Distance Information Propagation for Video Super-ResolutionMichael Bernasconi, Abdelaziz Djelouah, Yang Zhang 0003, Markus Gross 0001, Christopher Schroers. 11558-11567 [doi]
- MBTI: Masked Blending Transformers with Implicit Positional Encoding for Frame-rate Agnostic Motion EstimationJungwoo Huh, Yeseung Park, Seongjean Kim, Jungsu Kim, Sanghoon Lee. 11568-11578 [doi]
- Sequential Keypoint Density Estimator: an Overlooked Baseline of Skeleton-Based Video Anomaly DetectionAnja Delic, Matej Grcic, Sinisa Segvic. 11579-11589 [doi]
- GameFactorly: Creating New Games with Generative Interactive VideosJiwen Yu, Yiran Qin, Xintao Wang 0002, Pengfei Wan 0001, Di Zhang 0026, Xihui Liu. 11590-11599 [doi]
- MOSCATO: Predicting Multiple Object State Change through ActionsParnian Zameni, Yuhan Shen, Ehsan Elhamifar. 11600-11611 [doi]
- FaceCraft4D: Animated 3D Facial Avatar Generation from a Single ImageFei Yin, Mallikarjun B. R. 0001, Chun-Han Yao, Rafal K. Mantiuk, Varun Jampani. 11612-11621 [doi]
- Decouple to Reconstruct: High Quality UHD Restoration Via Active Feature Disentanglement and Reversible FusionYidi Liu, Dong Liu 0002, Yuxin Ma, Jie Huang 0017, Wenlong Zhang, Xueyang Fu, Zheng-Jun Zha. 11622-11631 [doi]
- MOVE: Motion-Guided Few-Shot Video Object SegmentationKaining Ying, Hengrui Hu, Henghui Ding. 11632-11642 [doi]
- V2M4: 4D Mesh Animation Reconstruction from a Single Monocular VideoJianqi Chen, Biao Zhang 0005, Xiangjun Tang, Peter Wonka. 11643-11653 [doi]
- Event-Driven Storytelling with Multiple Lifelike Humans in a 3D SceneDonggeun Lim, Jinseok Bae, Inwoo Hwang, Seungmin Lee, Hwanhee Lee, Young Min Kim 0001. 11654-11664 [doi]
- Evolvinggrasp: Evolutionary Grasp Generation Via Efficient Preference AlignmentYufei Zhu, Yiming Zhong 0001, Zemin Yang, Peishan Cong, Jingyi Yu 0001, Xinge Zhu, Yuexin Ma. 11665-11674 [doi]
- Structure-Guided Diffusion Models for High-Fidelity Portrait Shadow RemovalWanchang Yu, Qing Zhang 0006, Rongjia Zheng, Wei-Shi Zheng 0001. 11675-11684 [doi]
- Efficient Autoregressive Shape Generation Via Octree-Based Adaptive TokenizationKangle Deng, Hsueh-Ti Derek Liu, Yiheng Zhu, Xiaoxia Sun, Chong Shang, Kiran S. Bhat, Deva Ramanan, Jun-Yan Zhu, Maneesh Agrawala, Tinghui Zhou. 11685-11696 [doi]
- MedVSR: Medical Video Super-Resolution with Cross State-Space PropagationXinyu Liu 0001, Guolei Sun, Cheng Wang, Yixuan Yuan, Ender Konukoglu. 11697-11707 [doi]
- EAMamba: Efficient All-Around Vision State Space Model for Image RestorationYu-Cheng Lin, Yu-Syuan Xu, Hao-Wei Chen, Hsien-Kai Kuo, Chun-Yi Lee. 11708-11719 [doi]
- Beyond Walking: A Large-Scale Image-Text Benchmark for Text-Based Person Anomaly SearchShuyu Yang, Yaxiong Wang, Li Zhu 0003, Zhedong Zheng. 11720-11730 [doi]
- SyncDiff: Synchronized Motion Diffusion for Multi-Body Human-Object Interaction SynthesisWenkun He, Yun Liu, Ruitao Liu, Li Yi. 11731-11743 [doi]
- MMAIF: Multi-Task and Multi-Degradation All-in-One for Image Fusion with Language GuidanceZihan Cao, Yu Zhong, Ziqi Wang, Liang-Jian Deng. 11744-11754 [doi]
- Fast Image Super-Resolution via Consistency Rectified FlowJiaqi Xu, Wenbo Li 0002, Haoze Sun, Fan Li, Zhixin Wang, Long Peng 0003, Jingjing Ren, Haoran Yang, Xiaowei Hu 0001, Renjing Pei, Pheng-Ann Heng. 11755-11765 [doi]
- GENMO: A GENeralist Model for Human MOtionJiefeng Li, Jinkun Cao, Haotian Zhang 0004, Davis Rempe, Jan Kautz, Umar Iqbal 0001, Ye Yuan 0007. 11766-11776 [doi]
- VAFlow: Video-to-Audio Generation with Cross-Modality Flow MatchingXihua Wang 0002, Xin Cheng 0008, Yuyue Wang 0003, Ruihua Song, Yunfeng Wang. 11777-11786 [doi]
- Event-Guided HDR Reconstruction with Diffusion PriorsYixin Yang 0008, Jiawei Zhang 0002, Yang Zhang, Yunxuan Wei, Dongqing Zou, Jimmy S. Ren, Boxin Shi. 11787-11796 [doi]
- Learning Efficient and Generalizable Human Representation with Human Gaussian ModelYifan Liu, Shengjun Zhang, Chensheng Dai, Yang Chen, Hao Liu, Chen Li, Yueqi Duan. 11797-11806 [doi]
- SMGDiff: Soccer Motion Generation using Diffusion Probabilistic ModelsHongdi Yang, Chengyang Li, Zhenxuan Wu, Gaozheng Li, Jingya Wang 0001, Jingyi Yu 0001, Zhuo Su 0006, Lan Xu 0003. 11807-11817 [doi]
- AffordDexGrasp: Open-Set Language-Guided Dexterous Grasp With Generalizable-Instructive AffordanceYi-Lin Wei, Mu Lin, Yuhao Lin, Jian-Jian Jiang, Xiao-Ming Wu 0002, Ling-An Zeng, Wei-Shi Zheng 0001. 11818-11828 [doi]
- Hierarchical Visual Prompt Learning for Continual Video Instance SegmentationJiahua Dong 0001, Hui Yin, Wenqi Liang, Hanbin Zhao, Henghui Ding, Nicu Sebe, Salman Khan 0001, Fahad Shahbaz Khan. 11829-11839 [doi]
- LVFace: Progressive Cluster Optimization for Large Vision Models in Face RecognitionJinghan You, Shanglin Li, Yuanrui Sun, Jiangchuan Wei, Mingyu Guo, Chao Feng, Jiao Ran. 11840-11849 [doi]
- Enpowering Your Pansharpening Models with Generalizability: Unified Distribution Is All You NeedYongchuan Cui, Peng Liu, Hui Zhang. 11850-11860 [doi]
- MotionShot: Adaptive Motion Transfer Across Arbitrary Objects for Text-to-Video GenerationYanchen Liu, Yanan Sun 0005, Zhening Xing, Junyao Gao 0002, Kai Chen 0026, Wenjie Pei. 11861-11871 [doi]
- Robust Adverse Weather Removal via Spectral-based Spatial GroupingYuhwan Jeong, Yunseo Yang, YoungHo Yoon, Kuk-Jin Yoon. 11872-11883 [doi]
- CarGait: Cross-Attention Based Re-ranking for Gait RecognitionGavriel Habib, Noa Barzilay, Or Shimshi, Rami Ben-Ari, Nir Darshan. 11884-11894 [doi]
- Lightweight and Fast Real-Time Image Enhancement via Decomposition of the Spatial-Aware Lookup TablesWontae Kim, Keuntek Lee, Nam Ik Cho. 11895-11905 [doi]
- WAVE: Warp-Based View Guidance for Consistent Novel View Synthesis Using a Single ImageJiwoo Park, Tae Eun Choi, Youngjun Jun, Seong Jae Hwang. 11906-11915 [doi]
- Unsupervised Visible-Infrared Person Re-Identification Under Unpaired SettingsHaoyu Yao, Bin Yang 0026, Wenke Huang 0003, Bo Du 0001, Mang Ye. 11916-11926 [doi]
- LightBSR: Towards Lightweight Blind Super-Resolution via Discriminative Implicit Degradation Representation LearningJiang Yuan, Ji Ma, Bo Wang 0057, Guanzhou Ke, Weiming Hu. 11927-11936 [doi]
- Multi-Identity Human Image Animation with Structural Video DiffusionZhenzhi Wang 0001, Yixuan Li 0002, Yanhong Zeng, Yuwei Guo 0002, Dahua Lin, Tianfan Xue, Bo Dai 0002. 11937-11947 [doi]
- Embodied Representation Alignment with Mirror NeuronsWentao Zhu, Zhining Zhang 0001, Yuwei Ren, Yin Huang, Hao Xu, Yizhou Wang. 11948-11957 [doi]
- EC-Flow: Enabling Versatile Robotic Manipulation from Action-Unlabeled Videos via Embodiment-Centric FlowYixiang Chen, Peiyan Li, Yan Huang, Jiabing Yang, Kehan Chen, Liang Wang. 11958-11968 [doi]
- Switch-a-View: View Selection Learned from Unlabeled In-the-Wild VideosSagnik Majumder, Tushar Nagarajan, Ziad Al-Halah, Kristen Grauman. 11969-11979 [doi]
- RAGNet: Large-Scale Reasoning-Based Affordance Segmentation Benchmark Towards General GraspingDongming Wu, Yanping Fu, Saike Huang, Yingfei Liu, Fan Jia 0006, Nian Liu 0002, Feng Dai, Tiancai Wang, Rao Muhammad Anwer, Fahad Shahbaz Khan, Jianbing Shen. 11980-11990 [doi]
- Ditailistener: Controllable High Fidelity Listener Video Generation with DiffusionMaksim Siniukov, Di Chang, Minh Tran 0004, Hongkun Gong, Ashutosh Chaubey, Mohammad Soleymani 0001. 11991-12001 [doi]
- Hipandas: Hyperspectral Image Joint Denoising and Super-Resolution by Image Fusion with the Panchromatic ImageShuang Xu, Zixiang Zhao, Haowen Bai, Chang Yu, Jiangjun Peng, Xiangyong Cao, Deyu Meng. 12002-12011 [doi]
- You Think, You ACT: the New Task of Arbitrary Text to Motion GenerationRunqi Wang, Caoyuan Ma, Guopeng Li, Hanrui Xu, Yuke Li, Zheng Wang 0007. 12012-12022 [doi]
- EgoMusic-Driven Human Dance Motion Estimation with Skeleton MambaQuang Nguyen, Nhat Le, Baoru Huang, Minh Nhat Vu, Chengcheng Tang, Van Nguyen, Ngan Le, Thieu Vo, Anh Nguyen 0003. 12023-12033 [doi]
- PersonaCraft: Personalized and Controllable Full-Body Multi-Human Scene Generation Using Occlusion-Aware 3D-Conditioned DiffusionGwanghyun Kim, Suh Yoon Jeon, Seunggyu Lee, Se Young Chun. 12034-12044 [doi]
- DADM: Dual Alignment of Domain and Modality for Face Anti-SpoofingJingyi Yang, Xun Lin, Zitong Yu, Liepiao Zhang, Xin Liu 0012, Hui Li 0089, Xiaochen Yuan, Xiaochun Cao. 12045-12056 [doi]
- Autoregressive Denoising Score Matching Is a Good Video Anomaly DetectorHanwen Zhang 0017, Congqi Cao, Qinyi Lv, Lingtong Min, Yanning Zhang 0001. 12057-12067 [doi]
- Ponimator: Unfolding Interactive Pose for Versatile Human-Human Interaction AnimationShaowei Liu, Chuan Guo 0002, Bing Zhou 0001, Jian Wang 0100. 12068-12077 [doi]
- Monocular Facial Appearance Capture in the WildYingyan Xu, Kate Gadola, Prashanth Chandran, Sebastian Weiss, Markus Gross 0001, Gaspard Zoss, Derek Bradley. 12078-12088 [doi]
- Avat3r: Large Animatable Gaussian Reconstruction Model for High-Fidelity 3D Head AvatarsTobias Kirschstein, Javier Romero 0002, Artem Sevastopolsky, Matthias Nießner, Shunsuke Saito. 12089-12100 [doi]
- Skeleton Motion Words for Unsupervised Skeleton-Based Temporal Action SegmentationUzay Gökay, Federico Spurio, Dominik R. Bach, Juergen Gall. 12101-12111 [doi]
- MagicMotion: Controllable Video Generation with Dense-to-Sparse Trajectory GuidanceQuanhao Li, Zhen Xing, Rui Wang 0095, Hui Zhang 0090, Qi Dai 0001, Zuxuan Wu. 12112-12123 [doi]
- DH-FaceVid-1K: A Large-Scale High-Quality Dataset for Face Video GenerationDonglin Di, He Feng, Wenzhang Sun, Yongjia Ma, Hao Li 0030, Wei Chen 0089, Lei Fan 0007, Tonghua Su, Xun Yang 0001. 12124-12134 [doi]
- Synthetic Video Enhances Physical Fidelity in Video SynthesisQi Zhao, Xingyu Ni, Ziyu Wang, Feng Cheng, Ziyan Yang, Lu Jiang, Bohan Wang. 12135-12146 [doi]
- TimeBooth: Disentangled Facial Invariant Representation for Diverse and Personalized Face AgingZepeng Su, Zhulin Liu, Zongyan Zhang, Tong Zhang 0015, C. L. Philip Chen. 12147-12157 [doi]
- DanceEditor: Towards Iterative Editable Music-Driven Dance Generation with Open-Vocabulary DescriptionsHengyuan Zhang, Zhe Li, Xingqun Qi, Mengze Li, Muyi Sun, Siye Wang, Man Zhang 0005, Sirui Han. 12158-12168 [doi]
- Identity Preserving 3D Head Stylization with Multiview Score DistillationBahri Batuhan Bilecen, Ahmet Berke Gokmen, Furkan Guzelant, Aysegul Dundar. 12169-12179 [doi]
- IDF: Iterative Dynamic Filtering Networks for Generalizable Image DenoisingDongjin Kim, Jaekyun Ko, Muhammad Kashif Ali, Tae-Hyun Kim. 12180-12190 [doi]
- GDKVM: Echocardiography Video Segmentation via Spatiotemporal Key-Value Memory with Gated Delta RuleRui Wang 0186, Yimu Sun, Jingxing Guo, Huisi Wu, Jing Qin 0001. 12191-12200 [doi]
- Who is a Better Talker: Subjective and Objective Quality Assessment for AI-Generated Talking HeadsYingjie Zhou 0003, Jiezhang Cao, Zicheng Zhang, Farong Wen, Yanwei Jiang, Jun Jia, Xiaohong Liu 0001, Xiongkuo Min, Guangtao Zhai. 12201-12211 [doi]
- Towards Efficient General Feature Prediction in Masked Skeleton ModelingShengkai Sun, Zefan Zhang, Jianfeng Dong, Zhiyong Cheng 0001, Xiaojun Chang, Meng Wang 0001. 12212-12221 [doi]
- Scaling Action Detection: AdaTAD++ with Transformer-Enhanced Temporal-Spatial AdaptationTanay Agrawal, Abid Ali 0002, Antitza Dantcheva, François Brémond. 12222-12231 [doi]
- How Would it Sound? Material-Controlled Multimodal Acoustic Profile Generation for Indoor ScenesMahnoor Fatima Saad, Ziad Al-Halah. 12232-12241 [doi]
- VideoSetDiff: Identifying and Reasoning Similarities and Differences in Similar VideosYue Qiu 0001, Yanjun Sun, Takuma Yagi, Shusaku Egami, Natsuki Miyata, Ken Fukuda, Kensho Hara, Ryusuke Sagawa. 12242-12252 [doi]
- MotionCtrl: A Real-Time Controllable Vision-Language-Motion ModelBin Cao, Sipeng Zheng, Ye Wang, Lujie Xia, Qianshan Wei, Qin Jin, Jing Liu, Zongqing Lu 0002. 12253-12262 [doi]
- Occlusion-Robust Stylization for Drawing-Based 3D AnimationSunjae Yoon, Gwanhyeong Koo, Younghwan Lee, Ji Woo Hong, Chang D. Yoo. 12263-12273 [doi]
- Rethinking Key-Frame-Based Micro-Expression Recognition: a Robust and Accurate Framework Against Key-Frame ErrorsZheyuan Zhang, Weihao Tang, Hong Chen. 12274-12283 [doi]
- What Changed and What Could Have Changed? State-Change Counterfactuals for Procedure-Aware Video Representation LearningChi-Hsi Kung, Frangil Ramirez, Juhyung Ha, Yi-Ting Chen 0001, David Crandall, Yi-Hsuan Tsai. 12294-12306 [doi]
- Devil is in the Uniformity: Exploring Diverse Learners Within Transformer for Image RestorationShihao Zhou 0003, Dayu Li, Jinshan Pan, Juncheng Zhou, Jinglei Shi, Jufeng Yang. 12307-12317 [doi]
- HADES: Human Avatar with Dynamic Explicit Hair StrandsZhanfeng Liao, Hanzhang Tu, Cheng Peng, Hongwen Zhang 0001, Boyao Zhou, Yebin Liu. 12318-12327 [doi]
- FlowDPS: Flow-Driven Posterior Sampling for Inverse ProblemsJeongsol Kim, Bryan Sangwoo Kim, Jong Chul Ye. 12328-12337 [doi]
- ZFusion: Efficient Deep Compositional Zero-Shot Learning for Blind Image Super-Resolution with Generative Diffusion PriorAlireza Esmaeilzehi, Hossein Zaredar, Yapeng Tian, Laleh Seyyed-Kalantari. 12338-12348 [doi]
- Wavelet Policy: Lifting Scheme for Policy Learning in Long-Horizon TasksHao Huang 0003, Shuaihang Yuan, Geeta Chandra Raju Bethala, Congcong Wen, Anthony Tzes, Yi Fang 0006. 12349-12359 [doi]
- VLIPP: Towards Physically Plausible Video Generation with Vision and Language Informed Physical PriorXindi Yang, Baolu Li, Yiming Zhang, Zhenfei Yin, Lei Bai 0001, Liqian Ma, Zhiyong Wang 0001, Jianfei Cai 0001, Tien-Tsin Wong, Huchuan Lu, Xu Jia 0012. 12360-12370 [doi]
- StreamDiffusion: A Pipeline-Level Solution for Real-Time Interactive GenerationAkio Kodaira, Chenfeng Xu, Toshiki Hazama, Takanori Yoshimoto, Kohei Ohno, Shogo Mitsuhori, Soichi Sugano, Hanying Cho, Zhijian Liu, Masayoshi Tomizuka, Kurt Keutzer. 12371-12380 [doi]
- DreamRelation: Relation-Centric Video CustomizationYujie Wei 0001, Shiwei Zhang 0001, Hangjie Yuan, Biao Gong, Longxiang Tang, Xiang Wang 0012, Haonan Qiu, Hengjia Li, Shuai Tan, Yingya Zhang, Hongming Shan. 12381-12393 [doi]
- ModSkill: Physical Character Skill ModularizationYiming Huang 0011, Zhiyang Dou, Lingjie Liu. 12394-12404 [doi]
- Stable Virtual Camera: Generative View Synthesis with Diffusion ModelsJensen Zhou, Hang Gao, Vikram Voleti, Aaryaman Vasishta, Chun-Han Yao, Mark Boss, Philip Torr 0001, Christian Rupprecht 0001, Varun Jampani. 12405-12414 [doi]
- Fine-Structure Preserved Real-World Image Super-Resolution Via Transfer Vae TrainingQiaosi Yi, Shuai Liu 0009, Rongyuan Wu, Lingchen Sun, Yuhui Wu 0001, Lei Zhang 0006. 12415-12426 [doi]
- Rethinking Bimanual Robotic Manipulation: Learning with Decoupled Interaction FrameworkJian-Jian Jiang, Xiao-Ming Wu 0002, Yi-Xiang He, Ling-An Zeng, Yi-Lin Wei, Dandan Zhang, Wei-Shi Zheng 0001. 12427-12437 [doi]
- LA-MOTR: End-to-End Multi-Object Tracking by Learnable AssociationPeng Wang 0015, Yongcai Wang, Hualong Cao, Wang Chen, Deying Li 0001. 12438-12448 [doi]
- Free-Form Motion Control: Controlling the 6D Poses of Camera and Objects in Video GenerationXincheng Shuai, Henghui Ding, Zhenyuan Qin, Hao Luo 0004, Xingjun Ma, Dacheng Tao. 12449-12458 [doi]
- Learning a Unified Template for Gait RecognitionPanjian Huang, Saihui Hou, JunZhou Huang, Yongzhen Huang. 12459-12469 [doi]
- Sliced Wasserstein Bridge for Open-Vocabulary Video Instance SegmentationZheyun Qin, Deng Yu, Chuanchen Luo, Zhumin Chen. 12470-12478 [doi]
- Semantic Alignment and Reinforcement for Data-Free Quantization of Vision TransformersYunshan Zhong, Yuyao Zhou, Yuxin Zhang 0002, Wanchen Sui, Shen Li, Yong Li, Fei Chao 0001, Rongrong Ji. 12479-12490 [doi]
- NeurOp-Diff: Continuous Remote Sensing Image Super-Resolution via Neural Operator DiffusionZihao Xu, Yuzhi Tang, Bowen Xu, Qingquan Li. 12491-12501 [doi]
- Gaussian Variation Field Diffusion for High-Fidelity Video-to-4D SynthesisBowen Zhang 0002, Sicheng Xu, Chuxin Wang, Jiaolong Yang, Feng Zhao 0004, Dong Chen 0003, Baining Guo. 12502-12513 [doi]
- Synchronization of Multiple VideosAvihai Naaman, Ron Shapira Weber, Oren Freifeld. 12514-12523 [doi]
- DeepShield: Fortifying Deepfake Video Detection with Local and Global Forgery AnalysisYinqi Cai, Jichang Li, Zhaolun Li, Weikai Chen 0001, Rushi Lan, Xi Xie, Xiaonan Luo, Guanbin Li. 12524-12534 [doi]
- Perceiving and Acting in First-Person: A Dataset and Benchmark for Egocentric Human-Object-Human InteractionsLiang Xu 0012, Chengqun Yang, Zili Lin, Fei Xu 0008, Yifan Liu, Congsheng Xu, Yiyi Zhang 0002, Jie Qin 0004, Xingdong Sheng, Yunhui Liu 0006, Xin Jin 0014, Yichao Yan, Wenjun Zeng 0001, Xiaokang Yang 0001. 12535-12548 [doi]
- Audio-Visual Controlled Video Diffusion with Masked Selective State Spaces Modeling for Natural Talking Head GenerationFa-Ting Hong, Zunnan Xu, Zixiang Zhou, Jun Zhou, Xiu Li 0001, Qin Lin 0003, Qinglin Lu, Dan Xu 0002. 12549-12558 [doi]
- SCORE: Scene Context Matters in Open-Vocabulary Remote Sensing Instance SegmentationShiqi Huang, Shuting He, Huaiyuan Qin, Bihan Wen. 12559-12569 [doi]
- VertexRegen: Mesh Generation with Continuous Level of DetailXiang Zhang, Yawar Siddiqui, Armen Avetisyan, Chris Xie, Jakob J. Engel, Henry Howard-Jenkins. 12570-12580 [doi]
- Multimodal Prompt Alignment for Facial Expression RecognitionFuyan Ma, Yiran He, Bin Sun 0001, Shutao Li 0001. 12581-12591 [doi]
- AU-Blendshape for Fine-Grained Stylized 3D Facial Expression ManipulationHao Li, Ju Dai, Feng Zhou 0007, Kaida Ning, Lei Li 0050, JunJun Pan. 12605-12614 [doi]
- GestureHYDRA: Semantic Co-Speech Gesture Synthesis via Hybrid Modality Diffusion Transformer and Cascaded-Synchronized Retrieval-Augmented GenerationQuanwei Yang, Luying Huang, Kaisiyuan Wang, Jiazhi Guan, Shengyi He, Fengguo Li, Hang Zhou 0009, Lingyun Yu 0002, Yingying Li, Haocheng Feng, Hongtao Xie. 12615-12625 [doi]
- FoundIR: Unleashing Million-Scale Training Data to Advance Foundation Models for Image RestorationHao Li 0058, Xiang Chen 0015, Jiangxin Dong, Jinhui Tang 0001, Jinshan Pan. 12626-12636 [doi]
- Highlight What You Want: Weakly-Supervised Instance-Level Controllable Infrared-Visible Image FusionZeyu Wang 0009, Jizheng Zhang, Haiyu Song 0002, Mingyu Ge, Jiayu Wang, Haoran Duan 0001. 12637-12647 [doi]
- Adaptive Hyper-Graph Convolution Network for Skeleton-Based Human Action Recognition with Virtual ConnectionsYouwei Zhou, Tianyang Xu 0001, Cong Wu 0006, Xiao-Jun Wu 0001, Josef Kittler. 12648-12658 [doi]
- Weakly Supervised Visible-Infrared Person Re-Identification via Heterogeneous Expert Collaborative Consistency LearningYafei Zhang, Lingqi Kong, Huafeng Li 0001, Jie Wen 0001. 12659-12669 [doi]
- PERSONA: Personalized Whole-Body 3D Avatar with Pose-Driven Deformations from a Single ImageGeonhee Sim, Gyeongsik Moon. 12670-12680 [doi]
- Derm1M: A Million-Scale Vision-Language Dataset Aligned with Clinical Ontology Knowledge for DermatologySiyuan Yan, Ming Hu, Yiwen Jiang, Xieji li, Hao Fei 0001, Philipp Tschandl, Harald Kittler, ZongYuan Ge. 12681-12690 [doi]
- FaceLift: Learning Generalizable Single Image 3D Face Reconstruction From Synthetic HeadsWeijie Lyu, Yi Zhou 0023, Ming-Hsuan Yang 0001, Zhixin Shu. 12691-12701 [doi]
- DexH2R: A Benchmark for Dynamic Dexterous Grasping in Human-To-Robot HandoverYouzhuo Wang, Jiayi Ye, Chuyang Xiao, Yiming Zhong 0001, Heng Tao, Hang Yu, Yumeng Liu, Jingyi Yu 0001, Yuexin Ma. 12702-12712 [doi]
- Precise Action-to-Video Generation Through Visual Action PromptsYuang Wang, Chao Wen, Haoyu Guo, Sida Peng, Minghan Qin, Hujun Bao, Xiaowei Zhou 0001, Ruizhen Hu. 12713-12724 [doi]
- Primal: Physically Reactive and Interactive Motor Model for Avatar LearningYan Zhang 0054, Yao Feng 0001, Alpár Cseke, Nitin Saini, Nathan Bajandas, Nicolas Heron, Michael J. Black. 12725-12736 [doi]
- Magicid: Hybrid Preference Optimization for Id-Consistent and Dynamic-Preserved Video CustomizationHengjia Li, Lifan Jiang, Xi Xiao, Tianyang Wang, Hongwei Yi, Boxi Wu, Deng Cai 0001. 12737-12746 [doi]
- Consistency Trajectory Matching for One-Step Generative Super-ResolutionWeiyi You, Mingyang Zhang, Leheng Zhang, Xingyu Zhou, Kexuan Shi, Shuhang Gu. 12747-12756 [doi]
- Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-Shot Skeleton-Based Action RecognitionJeonghyeok Do, Munchurl Kim. 12757-12768 [doi]
- Visual Chronicles: Using Multimodal LLMs to Analyze Massive Collections of ImagesBoyang Deng, Songyou Peng, Kyle Genova, Gordon Wetzstein, Noah Snavely, Leonidas J. Guibas, Thomas A. Funkhouser. 12769-12778 [doi]
- Latent-Reframe: Enabling Camera Control for Video Diffusion Models Without TrainingZhenghong Zhou, Jie An 0002, Jiebo Luo 0001. 12779-12789 [doi]
- Neuromanifold-Regularized KANs for Shape-fair Feature RepresentationsMazlum Ferhat Arslan, Weihong Guo, Shuo Li 0001. 12790-12799 [doi]
- Learning to Generalize Without Bias for Open-Vocabulary Action RecognitionYating Yu, Congqi Cao, Yifan Zhang 0001, Yanning Zhang 0001. 12800-12810 [doi]
- GeoAvatar: Adaptive Geometrical Gaussian Splatting for 3D Head AvatarSeungjun Moon, Hah Min Lew, Seungeun Lee, Ji-Su Kang, Gyeong-Moon Park. 12811-12821 [doi]
- MotionFollower: Editing Video Motion via Score-Guided DiffusionShuyuan Tu, Qi Dai 0001, Zihao Zhang, Sicheng Xie, Zhi-Qi Cheng, Chong Luo 0001, Xintong Han, Zuxuan Wu, Yu-Gang Jiang 0001. 12822-12831 [doi]
- InterSyn: Interleaved Learning for Dynamic Motion Synthesis in the WildYiyi Ma, Yuanzhi Liang, Xiu Li 0001, Chi Zhang 0012, Xuelong Li 0001. 12832-12841 [doi]
- MoFRR: Mixture of Diffusion Models for Face Retouching RestorationJiaxin Liu, Qichao Ying, Zhenxing Qian, Sheng Li 0006, Runqi Zhang, Jian Liu, Xinpeng Zhang 0001. 12842-12851 [doi]
- Image Intrinsic Scale Assessment: Bridging the Gap Between Quality and ResolutionVlad Hosu, Lorenzo Agnolucci, Daisuke Iso, Dietmar Saupe. 12863-12872 [doi]
- Frequency-Guided Posterior Sampling for Diffusion-Based Image RestorationDarshan Thaker, Abhishek Goyal, René Vidal. 12873-12882 [doi]
- GAS: Generative Avatar Synthesis from a Single ImageYixing Lu, Junting Dong, Youngjoong Kwon, Qin Zhao, Bo Dai 0002, Fernando De la Torre. 12883-12893 [doi]
- Less Static, More Private: Towards Transferable Privacy-Preserving Action Recognition by Generative Decoupled LearningZhi-Wei Xia, Kun-Yu Lin, Yuan-Ming Li, Wei-Jin Huang, Xian-Tuo Tan, Wei-Shi Zheng 0001. 12894-12903 [doi]
- Bitrate-Controlled Diffusion for Disentangling Motion and Content in VideoXiao Li 0030, Qi Chen 0009, Xiulian Peng, Kai Yu 0004, Xie Chen 0001, Yan Lu 0001. 12904-12914 [doi]
- MR-FIQA: Face Image Quality Assessment with Multi-Reference Representations from Synthetic Data GenerationFu-Zhao Ou, Chongyi Li, Shiqi Wang 0001, Sam Kwong. 12915-12925 [doi]
- Text-to-Any-Skeleton Motion Generation Without RetargetingQingyuan Liu, Ke Lu 0002, Kun Dong 0001, Jian Xue 0002, Zehai Niu, Jinbao Wang. 12926-12936 [doi]
- Blind2Sound: Self-Supervised Image Denoising Without Residual NoiseJiazheng Liu, Zejin Wang, Bohao Chen, Hua Han. 12937-12946 [doi]
- STaR: Seamless Spatial-Temporal Aware Motion Retargeting with Penetration and Consistency ConstraintsXiaohang Yang, Qing Wang, Jiahao Yang, Gregory G. Slabaugh, Shanxin Yuan. 12947-12955 [doi]
- ARIG: Autoregressive Interactive Head Generation for Real-Time ConversationsYing Guo, Xi Liu, Cheng Zhen, Pengfei Yan, Xiaoming Wei. 12956-12965 [doi]
- Towards a Universal Image Degradation Model via Content-Degradation DisentanglementWenbo Yang, Zhongling Wang, Zhou Wang. 12966-12975 [doi]
- Unified Multimodal Understanding via Byte-Pair Visual EncodingWanpeng Zhang 0002, Yicheng Feng, Hao Luo 0011, Yijiang Li, Zihao Yue, Sipeng Zheng, Zongqing Lu 0002. 12976-12986 [doi]
- Imore: Implicit Program-Guided Reasoning for Human Motion QAChen Li, Chinthani Sugandhika, Ee Yeo Keat, Eric P. Xing, Hao Zhang, Hong Yang, Deepu Rajan, Basura Fernando. 12987-12996 [doi]
- AdaDCP: Learning an Adapter with Discrete Cosine Prior for Clear-to-Adverse Domain GeneralizationQi Bi, Yixian Shen, Jingjun Yi, Gui-Song Xia. 12997-13008 [doi]
- MP-HSIR: A Multi-Prompt Framework for Universal Hyperspectral Image RestorationZhehui Wu, Yong Chen 0013, Naoto Yokoya, Wei He 0003. 13009-13020 [doi]
- MorphoGen: Efficient Unconditional Generation of Long-Range Projection Neuronal Morphology via a Global-to-Local FrameworkTianfang Zhu, Hongyang Zhou, Anan Li. 13021-13031 [doi]
- Adaptive Articulated Object Manipulation on the Fly with Foundation Model Reasoning and Part GroundingXiaojie Zhang, Yuanfei Wang, Ruihai Wu, Kunqi Xu, Yu Li 0022, Liuyu Xiang, Hao Dong 0003, Zhaofeng He 0001. 13032-13042 [doi]
- Scoring, Remember, and Reference: Catching Camouflaged Objects in VideosYu'ang Feng, Shuyong Gao, Fuzhen Yan, Yicheng Song, Lingyi Hong, Junjie Hu, Wenqiang Zhang. 13043-13052 [doi]
- Stylized-Face: A Million-Level Stylized Face Dataset for Face RecognitionZhengyuan Peng, Jianqing Xu, Yuge Huang, Jinkun Hao, Shouhong Ding, Zhizhong Zhang 0001, Xin Tan 0002, Lizhuang Ma. 13053-13064 [doi]
- GaussianSpeech: Audio-Driven Personalized 3D Gaussian AvatarsShivangi Aneja, Artem Sevastopolsky, Tobias Kirschstein, Justus Thies, Angela Dai, Matthias Nießner. 13065-13075 [doi]
- A Quality-Guided Mixture of Score-Fusion Experts Framework for Human RecognitionJie Zhu, Yiyang Su, Minchul Kim, Anil K. Jain 0001, Xiaoming Liu 0002. 13076-13086 [doi]
- VMBench: A Benchmark for Perception-Aligned Video Motion GenerationXinran Ling, Chen Zhu, Meiqi Wu, Hangyu Li, Xiaokun Feng, Cundian Yang, Aiming Hao, Jiashu Zhu, Jiahong Wu 0005, Xiangxiang Chu. 13087-13098 [doi]
- Capturing Head Avatar with Hand Contacts from a Monocular VideoHaonan He, Yufeng Zheng, Jie Song. 13099-13108 [doi]
- Tiling Artifacts and Trade-Offs of Feature Normalization in the Segmentation of Large Biological ImagesElena Buglakova, Anwai Archit, Edoardo D'Imprima, Julia Mahamid, Constantin Pape, Anna Kreshuk. 13109-13118 [doi]
- BlueNeg: A 35MM Negative Film Dataset for Restoring Channel-Heterogeneous DeteriorationHanyuan Liu, Chengze Li, Minshan Xie, Zhenni Wang, Jiawen Liang, Chi-Sing Leung, Tien-Tsin Wong. 13119-13128 [doi]
- 3: Generative Pretrained Multi-Path Motion Model for Text Conditional Human Motion GenerationJunyu Shi, Lijiang Liu, Yong Sun, Zhiyuan Zhang, Jinni Zhou, Qiang Nie. 13129-13139 [doi]
- Saliency-Aware Quantized Imitation Learning for Efficient Robotic ControlSeongmin Park, Hyungmin Kim, Sangwoo Kim, Wonseok Jeon, JuYoung Yang, Byeongwook Jeon, Yoonseon Oh, Jungwook Choi. 13140-13150 [doi]
- MAVFlow: Preserving Paralinguistic Elements with Conditional Flow Matching for Zero-Shot AV2AV Multilingual TranslationSungwoo Cho, Jeongsoo Choi, Sungnyun Kim, Se-Young Yun. 13151-13161 [doi]
- Privacy-Centric Deep Motion Retargeting for Anonymization of Skeleton-Based Motion VisualizationThomas Carr 0001, Depeng Xu 0001, Shuhan Yuan, Aidong Lu. 13162-13170 [doi]
- ChartCap: Mitigating Hallucination of Dense Chart CaptioningJunyoung Lim, Jaewoo Ahn, Gunhee Kim. 13171-13182 [doi]
- GenFlowRL: Shaping Rewards with Generative Object-Centric Flow in Visual Reinforcement LearningKelin Yu, Sheng Zhang 0004, Harshit Soora, Furong Huang, Heng Huang 0001, Pratap Tokekar, Ruohan Gao. 13183-13192 [doi]
- Align Your Rhythm: Generating Highly Aligned Dance Poses with Gating-Enhanced Rhythm-Aware Feature RepresentationCongyi Fan, Jian Guan 0001, Xuanjia Zhao, Dongli Xu, Youtian Lin, Tong Ye, Pengming Feng, Haiwei Pan. 13193-13202 [doi]
- Motion Synthesis with Sparse and Flexible Keyjoint ControlInwoo Hwang, Jinseok Bae, Donggeun Lim, Young Min Kim 0001. 13203-13213 [doi]
- UniPhys: Unified Planner and Controller with Diffusion for Flexible Physics-Based Character ControlYan Wu, Korrawe Karunratanakul, Zhengyi Luo, Siyu Tang 0001. 13214-13224 [doi]
- MMAD: Multi-Label Micro-Action Detection in VideosKun Li 0008, Pengyu Liu 0005, Dan Guo 0001, Fei Wang 0067, Zhiliang Wu, Hehe Fan, Meng Wang 0001. 13225-13236 [doi]
- UniRes: Universal Image Restoration for Complex DegradationsMo Zhou, Keren Ye, Mauricio Delbracio, Peyman Milanfar, Vishal M. Patel, Hossein Talebi. 13237-13247 [doi]
- SV4D 2.0: Enhancing Spatio-Temporal Consistency in Multi-View Video Diffusion for High-Quality 4D GenerationChun-Han Yao, Yiming Xie, Vikram Voleti, Huaizu Jiang, Varun Jampani. 13248-13258 [doi]
- Gait: Exploring X Modality for Generalized Gait RecognitionZengbin Wang, Saihui Hou, Junjie Li 0002, Xu Liu 0008, Chunshui Cao, Yongzhen Huang, Siye Wang, Man Zhang 0005. 13259-13269 [doi]
- MVTrajecter: Multi-View Pedestrian Tracking With Trajectory Motion Cost and Trajectory Appearance CostTaiga Yamane, Ryo Masumura, Satoshi Suzuki, Shota Orihashi. 13270-13280 [doi]
- A Plug-And-Play Physical Motion Restoration Approach for In-The-Wild High-Difficulty MotionsYouliang Zhang, Ronghui Li, Yachao Zhang 0001, Liang Pan, Jingbo Wang, Yebin Liu, Xiu Li 0001. 13281-13292 [doi]
- GazeGaussian: High-Fidelity Gaze Redirection with 3D Gaussian SplattingXiaobao Wei, Peng Chen, Guangyu Li, Ming Lu 0002, Hui Chen 0020, Feng Tian 0001. 13293-13303 [doi]
- MoGA: 3D Generative Avatar Prior for Monocular Gaussian Avatar ReconstructionZijian Dong, Longteng Duan, Jie Song 0006, Michael J. Black, Andreas Geiger 0001. 13304-13314 [doi]
- Light-a-Video: Training-Free Video Relighting via Progressive Light FusionYujie Zhou, Jiazi Bu, Pengyang Ling, Pan Zhang 0001, Tong Wu, Qidong Huang, Jinsong Li 0001, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Anyi Rao, Jiaqi Wang 0003, Li Niu 0002. 13315-13325 [doi]
- SVG-Head: Hybrid Surface-Volumetric Gaussians for High-Fidelity Head Reconstruction and Real-Time EditingHeyi Sun, Cong Wang 0045, Tian-Xing Xu, Jingwei Huang, Di Kang, Chunchao Guo, Song-Hai Zhang. 13326-13335 [doi]
- Go to Zero: Towards Zero-Shot Motion Generation with Million-Scale DataKe-fan, Shunlin Lu, Minyue Dai, Runyi Yu 0003, Lixing Xiao, Zhiyang Dou, Junting Dong, Lizhuang Ma, Jingbo Wang 0003. 13336-13348 [doi]
- StyleMotif: Multi-Modal Motion Stylization using Style-Content Cross FusionZiyu Guo, Yizhak Ben-Shabat, Young-Yoon Lee, Joseph Liu, Victor Zordan, Mubbasir Kapadia. 13349-13359 [doi]
- I2V3D: Controllable Image-to-Video Generation with 3D GuidanceZhiyuan Zhang, Dongdong Chen, Jing Liao. 13360-13371 [doi]
- Group-Wise Scaling and Orthogonal Decomposition for Domain-Invariant Feature Extraction in Face Anti-SpoofingSeungjin Jung, Kanghee Lee, Yonghyun Jeong, Haeun Noh, Jungmin Lee, Jongwon Choi. 13372-13381 [doi]
- FakeRadar: Probing Forgery Outliers to Detect Unknown Deepfake VideosZhaolun Li, Jichang Li, Yinqi Cai, Junye Chen, Xiaonan Luo, Guanbin Li, Rushi Lan. 13382-13392 [doi]
- StrandHead: Text to Hair-Disentangled 3D Head Avatars Using Human-Centric PriorsXiaokun Sun, Zeyu Cai, Ying Tai, Jian Yang 0003, Zhenyu Zhang 0005. 13393-13404 [doi]
- Puppet-Master: Scaling Interactive Video Generation as a Motion Prior for Part-Level DynamicsRuining Li, Chuanxia Zheng, Christian Rupprecht 0001, Andrea Vedaldi. 13405-13415 [doi]
- CameraCtrl II: Dynamic Scene Exploration via Camera-Controlled Video Diffusion ModelsHao He, Ceyuan Yang, Shanchuan Lin, Yinghao Xu 0001, Meng Wei 0007, Liangke Gui, Qi Zhao 0001, Gordon Wetzstein, Lu Jiang, Hongsheng Li 0001. 13416-13426 [doi]
- General Compression Framework for Efficient Transformer Object TrackingLingyi Hong, Jinglun Li, Xinyu Zhou 0006, Shilin Yan, Pinxue Guo, Kaixun Jiang, Zhaoyu Chen 0001, Shuyong Gao, Runze Li, Xingdong Sheng, Wei Zhang 0016, Hong Lu 0001, Wenqiang Zhang. 13427-13437 [doi]
- DynamicFace: High-Quality and Consistent Face Swapping for Image and Video Using Composable 3D Facial PriorsRunqi Wang, Yang Chen, Sijie Xu, Tianyao He, Wei Zhu, Dejia Song, Nemo Chen, Xu Tang 0007, Yao Hu 0002. 13438-13447 [doi]
- StreamMind: Unlocking Full Frame Rate Streaming Video Dialogue through Event-Gated CognitionXin Ding, Hao Wu 0067, Yifan Yang 0004, Shiqi Jiang 0002, Qianxi Zhang, Donglin Bai, Zhibo Chen, Ting Cao 0003. 13448-13459 [doi]
- CARP: Visuomotor Policy Learning via Coarse-to-Fine Autoregressive PredictionZhefei Gong, Pengxiang Ding, Shangke Lyu, Siteng Huang, Mingyang Sun, Wei Zhao, Zhaoxin Fan, Donglin Wang. 13460-13470 [doi]
- Unlocking the Potential of Diffusion Priors in Blind Face RestorationYunqi Miao, Zhiyu Qu, Mingqi Gao 0003, Changrui Chen, Jifei Song, Jungong Han, Jiankang deng. 13471-13480 [doi]
- Bridging Diffusion Models and 3D Representations: A 3D Consistent Super-Resolution FrameworkYi-Ting Chen, Ting-Hsuan Liao, Pengsheng Guo, Alexander Gerhard Schwing, Jia-Bin Huang. 13481-13490 [doi]
- $A_{0}$: An Affordance-Aware Hierarchical Model for General Robotic ManipulationRongtao Xu, Jian Zhang, Minghao Guo, Youpeng Wen, Haoting Yang, Min Lin, Jianzheng Huang, Zhe Li 0008, Kaidong Zhang, Liqiong Wang, Yuxuan Kuang, Meng Cao 0002, Feng Zheng 0001, Xiaodan Liang. 13491-13501 [doi]
- DisenQ: Disentangling Q-Former for Activity-BiometricsShehreen Azad, Yogesh Singh Rawat. 13502-13512 [doi]
- The Source Image Is the Best Attention for Infrared and Visible Image FusionSong Wang, Xie Han, Liqun Kuang, Boying Wang, Zhongyu Chen, Zherui Qiao, Fan Yang, Xiaoxia Liu, Bingyu Zhang, Zhixun Wang. 13513-13522 [doi]
- HUST: High-Fidelity Unbiased Skin Tone Estimation via Texture QuantizationZimin Ran, Xingyu Ren, Xiang An, Kaicheng Yang 0002, Ziyong Feng, Jing Yang 0038, Rolandos-Alexandros Potamias, Linchao Zhu, Jiankang deng. 13523-13532 [doi]
- AdaHuman: Animatable Detailed 3D Human Generation with Compositional Multiview DiffusionYangyi Huang, Ye Yuan 0007, Xueting Li, Jan Kautz, Umar Iqbal 0001. 13533-13543 [doi]
- Trokens: Semantic-Aware Relational Trajectory Tokens for Few-Shot Action RecognitionPulkit Kumar, Shuaiyi Huang, Matthew Walmer, Sai Saketh Rambhatla, Abhinav Shrivastava. 13544-13556 [doi]
- AnimateAnyMesh: A Feed-Forward 4D Foundation Model for Text-Driven Universal Mesh AnimationZijie Wu, Chaohui Yu, Fan Wang 0019, Xiang Bai. 13557-13568 [doi]
- Auto-Regressive Transformation for Image AlignmentKanggeon Lee, Soochahn Lee, Kyoung Mu Lee. 13569-13579 [doi]
- Controllable Weather Synthesis and Removal with Video Diffusion ModelsChih-Hao Lin, Zian Wang, Ruofan Liang, Yuxuan Zhang 0001, Sanja Fidler, Shenlong Wang, Zan Gojcic. 13580-13591 [doi]
- Sequential Gaussian Avatars with Hierarchical Motion ContextWangze Xu, Yifan Zhan, Zhihang Zhong, Xiao Sun. 13592-13603 [doi]
- TokenUnify: Scaling Up Autoregressive Pretraining for Neuron SegmentationYinda Chen, Haoyuan Shi, Xiaoyu Liu 0006, Te Shi 0003, Ruobing Zhang, Dong Liu 0002, Zhiwei Xiong, Feng Wu 0001. 13604-13613 [doi]
- SAM2LONG: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory TreeShuangrui Ding, Rui Qian 0001, Xiaoyi Dong, Pan Zhang 0001, Yuhang Zang, Yuhang Cao, Yuwei Guo 0002, Dahua Lin, Jiaqi Wang 0003. 13614-13624 [doi]
- T2Bs: Text-to-Character Blendshapes via Video GenerationJiahao Luo, Chaoyang Wang 0001, Michael Vasilkovsky, Vladislav Shakhrai, Di Liu, Peiye Zhuang, Sergey Tulyakov, Peter Wonka, Hsin-Ying Lee 0001, James Davis, Jian Wang. 13625-13637 [doi]
- TACO: Taming Diffusion for In-the-Wild Video Amodal CompletionRuijie Lu, Yixin Chen 0003, Yu Liu 0110, Jiaxiang Tang, Junfeng Ni, Diwen Wan, Gang Zeng, Siyuan Huang 0001. 13639-13650 [doi]
- Unfolding-Associative Encoder-Decoder Network with Progressive Alignment for PansharpeningShijie Fang, Hongping Gan. 13651-13661 [doi]
- AnyBimanual: Transferring Unimanual Policy for General Bimanual ManipulationGuanxing Lu, Tengbo Yu, Haoyuan Deng, Season Si Chen, Yansong Tang, Ziwei Wang 0001. 13662-13672 [doi]
- MOERL: When Mixture-Of-Experts Meet Reinforcement Learning for Adverse Weather Image RestorationTao Wang 0052, Peiwen Xia, Bo Li, Peng-Tao Jiang, Zhe Kong, Kaihao Zhang, Tong Lu 0002, Wenhan Luo. 13673-13683 [doi]
- LD-RPS: Zero-Shot Unified Image Restoration via Latent Diffusion Recurrent Posterior SamplingHuaqiu Li, Yong Wang, Tongwen Huang, Hailang Huang, Haoqian Wang, Xiangxiang Chu. 13684-13694 [doi]
- Dimensionx: Create Any 3D and 4D Scenes From a Single Image With Decoupled Video DiffusionWenqiang Sun, Shuo Chen, Fangfu Liu, Zilong Chen, Yueqi Duan, Jun Zhu 0001, Jun Zhang 0004, Yikai Wang 0001. 13695-13706 [doi]
- RoboTron-Mani: All-in-One Multimodal Large Model for Robotic ManipulationFeng Yan, Fanfan Liu, Yiyang Huang 0002, Zechao Guan, Liming Zheng, Yufeng Zhong 0001, Chengjian Feng, Lin Ma 0002. 13707-13718 [doi]
- LOMM: Latest Object Memory Management for Temporally Consistent Video Instance SegmentationSeunghun Lee 0002, Jiwan Seo, Minwoo Choi, Kiljoon Han, Jaehoon Jeong, Zane Durante, Ehsan Adeli 0001, Sang-Hyun Park, Sunghoon Im 0001. 13719-13729 [doi]
- Video Motion GraphsHaiyang Liu, Zhan Xu, Fa-Ting Hong, Hsin-Ping Huang, Yi Zhou, Yang Zhou. 13730-13740 [doi]
- Online Generic Event Boundary DetectionHyungrok Jung, Daneul Kim, Seunggyun Lim, Jeany Son, Jonghyun Choi. 13741-13750 [doi]
- 2 Actor: Continuous State Decomposition Via Diffusion Embeddings for Robotic ManipulationJiayi Li. 13751-13760 [doi]
- SemTalk: Holistic Co-Speech Motion Generation with Frame-Level Semantic EmphasisXiangyue Zhang, Jianfang Li 0001, Jiaxu Zhang, Ziqiang Dang, Jianqiang Ren, Liefeng Bo, Zhigang Tu 0001. 13761-13771 [doi]
- DuoCLR: Dual-Surrogate Contrastive Learning for Skeleton-Based Human Action SegmentationHaitao Tian. 13772-13782 [doi]
- VoluMe - Authentic 3D Video Calls from Live Gaussian Splat PredictionMartin de La Gorce, Charlie Hewitt, Tibor Takács, Robert Gerdisch, Zafiirah Hosenie, Givi Meishvili, Marek Kowalski, Thomas J. Cashman 0001, Antonio Criminisi. 13783-13792 [doi]
- EVDM: Event-based Real-World Video Deblurring with MambaZhijing Sun, Senyan Xu, Kean Liu, Runze Tian, Xueyang Fu, Zheng-Jun Zha. 13793-13803 [doi]
- From Enhancement to Understanding: Build a Generalized Bridge for Low-Light Vision via Semantically Consistent Unsupervised Fine-TuningSen Wang, Shao Zeng, Tianjun Gu, Zhizhong Zhang 0001, Ruixin Zhang, Shouhong Ding, Jingyun Zhang, Jun Wang 0006, Xin Tan 0002, Yuan Xie 0006, Lizhuang Ma. 13804-13814 [doi]
- Physical Degradation Model-Guided Interferometric Hyperspectral Reconstruction with Unfolding TransformerYuansheng Li, Yunhao Zou, Linwei Chen, Ying Fu. 13815-13825 [doi]
- Intra-Modal and Cross-Modal Synchronization for Audio-Visual Deepfake Detection and Temporal LocalizationAshutosh Anshul, Shreyas Gopal, Deepu Rajan, Eng Siong Chng. 13826-13836 [doi]
- FineMotion: A Dataset and Benchmark with Both Spatial and Temporal Annotation for Fine-Grained Motion Generation and EditingBizhu Wu, Jinheng Xie, Meidan Ding, Zhe Kong, Jianfeng Ren, Ruibin Bai, Rong Qu, LinLin Shen. 13837-13846 [doi]
- OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation ModelsGaojie Lin, Jianwen Jiang, Jiaqi Yang 0008, Zerong Zheng, Chao Liang, Yuan Zhang, Jingtuo Liu. 13848-13858 [doi]
- Context-Aware Academic Emotion Dataset and BenchmarkLuming Zhao, Jingwen Xuan, Jiamin Lou, Yonghui Yu, Wenwu Yang. 13859-13868 [doi]
- MotionLab: Unified Human Motion Generation and Editing via the Motion-Condition-Motion ParadigmZiyan Guo, Zeyu Hu, De Wen Soh, Na Zhao 0004. 13869-13879 [doi]
- Gradient-Reweighted Adversarial Camouflage for Physical Object Detection EvasionJiawei Liang, Siyuan Liang 0004, Tianrui Lou, Ming Zhang, Wenjin Li, Dunqiu Fan, Xiaochun Cao. 13880-13889 [doi]
- iManip: Skill-Incremental Learning for Robotic ManipulationZexin Zheng, Jia-Feng Cai, Xiao-Ming Wu 0002, Yi-Lin Wei, Yu-Ming Tang, Ancong Wu, Wei-Shi Zheng 0001. 13890-13900 [doi]
- Q-Norm: Robust Representation Learning via Quality-Adaptive NormalizationLanning Zhang, Ying Zhou, Fei Gao 0006, Ziyun Li 0002, Maoying Qiao, Jinlan Xu, Nannan Wang 0001. 13901-13911 [doi]
- Proxy-Bridged Game Transformer for Interactive Extreme Motion PredictionYanwen Fang, Wenqi Jia, Xu Cao, Peng-Tao Jiang, Guodong Li, Jintai Chen. 13912-13921 [doi]
- MeshAnything V2: Artist-Created Mesh Generation with Adjacent Mesh TokenizationYiwen Chen, Yikai Wang 0001, Yihao Luo, Zhengyi Wang, Zilong Chen, Jun Zhu 0001, Chi Zhang 0007, Guosheng Lin. 13922-13931 [doi]
- MDD: A Dataset for Text-and-Music Conditioned Duet Dance GenerationPrerit Gupta, Jason Alexander Fotso-Puepi, Zhengyuan Li, Jay Mehta, Aniket Bera. 13932-13941 [doi]
- $\pi$-AVAS: Can Physics-Integrated Audio-Visual Modeling Boost Neural Acoustic Synthesis?Susan Liang, Chao Huang 0033, Yunlong Tang 0001, Zeliang Zhang 0001, Chenliang Xu. 13942-13951 [doi]
- Exploring Weather-aware Aggregation and Adaptation for Semantic Segmentation under Adverse ConditionsYuwen Pan, Rui Sun 0006, Wangkai Li, Tianzhu Zhang 0001. 13952-13962 [doi]
- SemGes: Semantics-Aware Co-Speech Gesture Generation Using Semantic Coherence and Relevance LearningLanmiao Liu, Esam Ghaleb, Asli Özyürek, Zerrin Yumak. 13963-13973 [doi]
- Metric Convolutions: A Unifying Theory to Adaptive Image ConvolutionsThomas Dagès, Michael Lindenbaum, Alfred M. Bruckstein. 13974-13984 [doi]
- RobAVA: A Large-Scale Dataset and Baseline Towards Video Based Robotic Arm Action UnderstandingBaoli Sun, Ning Wang, Xinzhu Ma, Anqi Zou, Yihang Lu, Chuixuan Fan, Zhihui Wang 0001, Kun Lu 0003, Zhiyong Wang 0001. 13985-13994 [doi]
- IDFace: Face Template Protection for Efficient and Secure IdentificationSunpill Kim, Seunghun Paik, Chanwoo Hwang, Dongsoo Kim 0004, Junbum Shin, Jae Hong Seo. 13995-14005 [doi]
- Dual-Level Prototype Learning for Composite Degraded Image RestorationZhongze Wang, Haitao Zhao 0002, Lujian Yao, Jingchao Peng, Kaijie Zhao. 14006-14061 [doi]
- BVINet: Unlocking Blind Video Inpainting With Zero AnnotationsZhiliang Wu, Kerui Chen, Kun Li 0008, Hehe Fan, Yi Yang 0001. 14017-14027 [doi]
- HumanSAM: Classifying Human-Centric Forgery Videos in Human Spatial, Appearance, and Motion AnomalyChang Liu, Yunfan Ye, Fan Zhang, Qingyang Zhou, Yuchuan Luo, Zhiping Cai. 14028-14038 [doi]
- DreamDance: Animating Human Images by Enriching 3D Geometry Cues from 2D PosesYatian Pang, Bin Zhu, Bin Bin, Mingzhe Zheng, Francis E. H. Tay, Ser-Nam Lim, Harry Yang, Li Yuan 0007. 14039-14050 [doi]
- I2VControl: Disentangled and Unified Video Motion Synthesis ControlWanquan Feng, Tianhao Qi, Jiawei Liu 0001, Mingzhen Sun, Pengqi Tu, Tianxiang Ma, Fei Dai, Songtao Zhao, SiYu Zhou 0002, Qian He. 14051-14060 [doi]
- MeshLLM: Empowering Large Language Models to Progressively Understand and Generate 3D MeshShuangkang Fang, I-Chao Shen, Yufeng Wang 0004, Yi-Hsuan Tsai, Yi Yang 0033, Shuchang Zhou 0001, Wenrui Ding, Takeo Igarashi, Ming-Hsuan Yang 0001. 14061-14072 [doi]
- On-Device Diffusion Transformer Policy for Efficient Robot ManipulationYiming Wu 0005, Huan Wang 0001, Zhenghao Chen, Jianxin Pang, Dong Xu 0001. 14073-14083 [doi]
- Generic Event Boundary Detection via Denoising DiffusionJaejun Hwang, Dayoung Gong, Manjin Kim, Minsu Cho. 14084-14094 [doi]
- Learning Pixel-Adaptive Multi-Layer Perceptrons for Real-Time Image EnhancementJunyu Lou, Xiaorui Zhao, Kexuan Shi, Shuhang Gu. 14095-14105 [doi]
- Multi-Modal Few-Shot Temporal Action SegmentationZijia Lu, Ehsan Elhamifar. 14106-14116 [doi]
- SIMS: Simulating Stylized Human-Scene Interactions with Retrieval-Augmented Script GenerationWenjia Wang, Liang Pan, Zhiyang Dou, Jidong Mei, Zhouyingcheng Liao, Yuke Lou, Yifan Wu 0039, Lei Yang 0045, Jingbo Wang 0003, Taku Komura. 14117-14127 [doi]
- ProbRes: Probabilistic Jump Diffusion for Open-World Egocentric Activity RecognitionSanjoy Kundu, Shanmukha Vellamcheti, Sathyanarayanan N. Aakur. 14128-14140 [doi]
- Unified Adversarial Augmentation for Improving Palmprint RecognitionJianlong Jin, Chenglong Zhao, Ruixin Zhang, Sheng Shang, Yang Zhao 0002, Jun Wang, Jingyun Zhang, Shouhong Ding, Wei Jia 0001, Yunsheng Wu. 14141-14151 [doi]
- Not All Degradations are Equal: A Targeted Feature Denoising Framework for Generalizable Image Super-ResolutionHongjun Wang 0007, Jiyuan Chen, Zhengwei Yin, Xuan Song 0001, Yinqiang Zheng. 14152-14161 [doi]
- SHeaP: Self-Supervised Head Geometry Predictor Learned via 2D GaussiansLiam Schoneveld, Zhe Chen, Davide Davoli 0002, Jiapeng Tang, Saimon Terazawa, Ko Nishino, Matthias Nießner. 14162-14172 [doi]
- MultiModal Action Conditioned Video SimulationYichen Li, Antonio Torralba. 14173-14183 [doi]
- LHM: Large Animatable Human Reconstruction Model for Single Image to 3D in SecondsLingteng Qiu, Xiaodong Gu 0004, Peihao Li 0003, Qi Zuo, Weichao Shen, Junfei Zhang, Kejie Qiu, Weihao Yuan 0001, Guanying Chen, Zilong Dong, Liefeng Bo. 14184-14194 [doi]
- Learning Deblurring Texture Prior From Unpaired Data with Diffusion ModelChengxu Liu 0001, Lu Qi 0001, Jinshan Pan, Xueming Qian, Ming-Hsuan Yang 0001. 14195-14204 [doi]
- GUAVA: Generalizable Upper Body 3D Gaussian AvatarDongbin Zhang, Yunfei Liu 0001, Lijian Lin, Ye Zhu 0003, Yang Li, Minghan Qin, Yu Li 0003, Haoqian Wang. 14205-14217 [doi]
- Recognizing Actions From Robotic View for Natural Human-Robot InteractionZiyi Wang, Peiming Li, Hong Liu 0008, Zhichao Deng, Can Wang 0006, Jun Liu 0036, Junsong Yuan 0001, Mengyuan Liu 0001. 14218-14227 [doi]
- TARO: Timestep-Adaptive Representation Alignment with Onset-Aware Conditioning for Synchronized Video-To-Audio SynthesisTri Ton, Ji Woo Hong, Chang D. Yoo. 14228-14237 [doi]
- UniFuse: A Unified All-In-One Framework for Multi-Modal Medical Image Fusion Under Diverse Degradations and MisalignmentsDayong Su, Yafei Zhang, Huafeng Li, Jinxing Li, Yu Liu. 14238-14247 [doi]
- DexVLG: Dexterous Vision-Language-Grasp Model at ScaleJiawei He 0002, Danshi Li, Xinqiang Yu, Zekun Qi, Wenyao Zhang, Jiayi Chen 0003, Zhaoxiang Zhang 0001, Zhizheng Zhang 0011, Li Yi 0001, He Wang 0010. 14248-14258 [doi]
- Towards Explicit Exoskeleton for the Reconstruction of Complicated 3D Human AvatarsYifan Zhan, Qingtian Zhu, Muyao Niu, Mingze Ma, Jiancheng Zhao, Zhihang Zhong, Xiao Sun 0001, Yu Qiao 0001, Yinqiang Zheng. 14259-14269 [doi]
- AV-Flow: Transforming Text to Audio-Visual Human-Like InteractionsAggelina Chatziagapi, Louis-Philippe Morency, Hongyu Gong, Michael Zollhöfer, Dimitris Samaras, Alexander Richard. 14270-14282 [doi]
- Democratizing High-Fidelity Co-Speech Gesture Video GenerationXu Yang, Shaoli Huang, Shenbo Xie, Xuelin Chen, YiFei Liu, Changxing Ding. 14283-14292 [doi]
- Fine-Grained 3D Gaussian Head Avatars Modeling from Static Captures Via Joint Reconstruction and RegistrationYuan Sun 0003, Xuan Wang 0009, Cong Wang, WeiLi Zhang, Yanbo Fan, Yu Guo 0006, Fei Wang 0008. 14293-14304 [doi]
- Motion-2-To-3: Leveraging 2D Motion Data for 3D Motion GenerationsRuoxi Guo, Huaijin Pi, Zehong Shen, Qing Shuai, Zechen Hu, Zhumei Wang, Yajiao Dong, Ruizhen Hu, Taku Komura, Sida Peng, Xiaowei Zhou 0001. 14305-14316 [doi]
- IM-LUT: Interpolation Mixing Look-Up Tables for Image Super-ResolutionSejin Park 0002, Sangmin Lee, Kyong Hwan Jin, Seung-Won Jung. 14317-14325 [doi]
- TemCoCo: Temporally Consistent Multi-Modal Video Fusion with Visual-Semantic CollaborationMeiqi Gong, Hao Zhang 0073, Xunpeng Yi, Linfeng Tang, Jiayi Ma 0001. 14326-14335 [doi]
- Beyond the Frame: Generating 360° Panoramic Videos from Perspective VideosRundong Luo, Matthew Wallingford, Ali Fahardi, Noah Snavely, Wei-Chiu Ma. 14336-14345 [doi]
- SpinMeRound: Consistent Multi-View Identity Generation Using Diffusion ModelsStathis Galanakis, Alexandros Lattas, Stylianos Moschoglou, Bernhard Kainz, Stefanos Zafeiriou. 14346-14356 [doi]
- DIMO: Diverse 3D Motion Generation for Arbitrary ObjectsLinzhan Mou, Jiahui Lei, Chen Wang 0049, Lingjie Liu, Kostas Daniilidis. 14357-14368 [doi]
- OpenAnimals: Revisiting Person Re-Identification for Animals Towards Better GeneralizationSaihui Hou, Panjian Huang, Zengbin Wang, Yuan Liu, ZeYu Li, Man Zhang 0005, Yongzhen Huang. 14369-14379 [doi]
- Perception-as-Control: Fine-Grained Controllable Image Animation with 3D-Aware Motion RepresentationYingjie Chen, Yifang Men, Yuan Yao, Miaomiao Cui, Liefeng Bo. 14380-14389 [doi]
- Attention to Trajectory: Trajectory-Aware Open-Vocabulary TrackingYunhao Li, Yifan Jiao, Dan Meng 0001, Heng Fan 0001, Libo Zhang 0001. 14390-14398 [doi]
- UniPortrait: A Unified Framework for Identity-Preserving Single- and Multi-Human Image PersonalizationJunjie He, Yifeng Geng, Liefeng Bo. 14399-14408 [doi]
- Augmented and Softened Matching for Unsupervised Visible-Infrared Person Re-IdentificationZhiqi Pang, Chunyu Wang 0002, Lingling Zhao, Junjie Wang 0005. 14400-14409 [doi]
- SAMPLE: Semantic Alignment through Temporal-Adaptive Multimodal Prompt Learning for Event-Based Open-Vocabulary Action RecognitionJing Wang, Rui Zhao 0010, Ruiqin Xiong, Xingtao Wang, Xiaopeng Fan 0001, Tiejun Huang 0001. 14409-14419 [doi]
- Music-Aligned Holistic 3D Dance Generation via Hierarchical Motion ModelingXiaojie Li, Ronghui Li, Shukai Fang, Shuzhao Xie, Xiaoyang Guo, Jiaqing Zhou, Junkun Peng, Zhi Wang. 14420-14430 [doi]
- Structure Matters: Revisiting Boundary Refinement in Video Object SegmentationGuanyi Qin, Ziyue Wang 0005, Daiyun Shen, Haofeng Liu, Hantao Zhou, JunDe Wu, Runze Hu, Yueming Jin. 14431-14442 [doi]
- NoiseController: Towards Consistent Multi-View Video Generation via Noise Decomposition and CollaborationHaotian Dong, Xin Wang 0118, Di Lin 0002, Yipeng Wu, Qin Chen, Ruonan Liu, Kairui Yang, Ping Li 0016, Qing Guo 0005. 14443-14452 [doi]
- FED-PsyAU: Privacy-Preserving Micro-Expression Recognition Via Psychological Au Coordination and Dynamic Facial Motion ModelingJingting Li, Yu Qian, Lin Zhao, Su-Jing Wang. 14453-14463 [doi]
- MagicMirror: ID-Preserved Video Generation in Video Diffusion TransformersYuechen Zhang, Yaoyang Liu, Bin Xia, Bohao Peng, Zexin Yan, Eric Lo 0001, Jiaya Jia. 14464-14474 [doi]
- MotionDiff: Training-Free Zero-Shot Interactive Motion Editing via Flow-Assisted Multi-View DiffusionYikun Ma, Yiqing Li, Jiawei Wu, Xing Luo, Zhi Jin 0002. 14475-14485 [doi]
- Dense Policy: Bidirectional Autoregressive Learning of ActionsYue Su, Xinyu Zhan 0001, Hongjie Fang, Han Xue, Hao-Shu Fang, Yong-Lu Li 0001, Cewu Lu, Lixin Yang 0001. 14486-14495 [doi]
- PUMPS: Skeleton-Agnostic Point-Based Universal Motion Pre-Training for Synthesis in Human Motion TasksClinton Ansun Mo, Kun Hu, Chengjiang Long, Dong Yuan 0001, Wan-Chi Siu, Zhiyong Wang 0001. 14496-14506 [doi]
- Dirichlet-Constrained Variational Codebook Learning for Temporally Coherent Video Face RestorationBaoyou Chen, Ce Liu 0004, Weihao Yuan 0001, Zilong Dong, Siyu Zhu 0001. 14507-14516 [doi]
- Seeing Through Deepfakes: A Human-Inspired Framework for Multi-Face DetectionJuan Hu, Shaojing Fan, Terence Sim. 14517-14527 [doi]
- MistSense: Versatile Online Detection of Procedural and Execution MistakesConstantin Patsch, Yuankai Wu, Marsil Zakour, Driton Salihu, Eckehard Steinbach. 14528-14537 [doi]
- SEREP: Semantic Facial Expression Representation for Robust in-the-Wild Capture and RetargetingArthur Josi, Luiz Gustavo Hafemann, Abdallah Dib, Emeline Got, Rafael M. O. Cruz, Marc-André Carbonneau. 14538-14548 [doi]
- Clink! Chop! Thud! - Learning Object Sounds From Real-World InteractionsMengyu Yang, Yiming Chen, Haozheng Pei, Siddhant Agarwal, Arun Balajee Vasudevan, James Hays. 14549-14558 [doi]
- LUT-Fuse: Towards Extremely Fast Infrared and Visible Image Fusion via Distillation to Learnable Look-Up TablesXunpeng Yi, Yibing Zhang, Xinyu Xiang, Qinglong Yan, Han Xu 0001, Jiayi Ma 0001. 14559-14568 [doi]
- LiON-LoRA: Rethinking LoRA Fusion to Unify Controllable Spatial and Temporal Generation for Video DiffusionYisu Zhang, Chenjie Cao, Chaohui Yu, Jianke Zhu. 14569-14579 [doi]
- Morph: a Motion-Free Physics Optimization Framework for Human Motion GenerationZhuo Li, Mingshuang Luo, Ruibing Hou, Xin Zhao, Hao Liu, Hong Chang, Zimo Liu, Chen Li. 14580-14589 [doi]
- RoBridge: A Hierarchical Architecture Bridging Cognition and Execution for General Robotic ManipulationKaidong Zhang, Rongtao Xu, Pengzhen Ren, Junfan Lin, Hefeng Wu, Liang Lin, Xiaodan Liang. 14590-14601 [doi]
- DisCoRD: Discrete Tokens to Continuous Motion via Rectified Flow DecodingJungbin Cho, Junwan Kim, Jisoo Kim 0006, Minseo Kim, Mingu Kang, Sungeun Hong, Tae Hyun Oh, Youngjae Yu. 14602-14612 [doi]
- MixANT: Observation-Dependent Memory Propagation for Stochastic Dense Action AnticipationSyed Talal Wasim, Hamid Suleman, Olga Zatsarynna, Muzammal Naseer, Juergen Gall. 14613-14622 [doi]
- VoiceCraft-Dub: Automated Video Dubbing with Neural Codec Language ModelsSung-Bin Kim, Jeongsoo Choi, Puyuan Peng, Joon Son Chung, Tae Hyun Oh, David Harwath. 14623-14632 [doi]
- DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity UnderstandingThomas Kreutz, Max Mühlhäuser, Alejandro Sánchez Guinea. 14633-14643 [doi]
- Temporal Rate Reduction Clustering for Human Motion SegmentationXianghan Meng, Zhengyu Tong, Zhiyuan Huang, Chun-Guang Li. 14644-14654 [doi]
- DISTA-Net: Dynamic Closely-Spaced Infrared Small Target UnmixingShengdong Han, Shangdong Yang, Yuxuan Li 0004, Xin Zhang 0170, Xiang Li 0041, Jian Yang 0003, Ming-Ming Cheng, Yimian Dai. 14655-14664 [doi]
- Efficient Concertormer for Image Deblurring and BeyondPin-Hung Kuo, Jinshan Pan, Shao-Yi Chien, Ming-Hsuan Yang 0001. 14665-14675 [doi]
- ASCENT: Annotation-Free Self-Supervised Contrastive Embeddings for 3D Neuron Tracking in Fluorescence MicroscopyHaejun Han, Hang Lu. 14676-14687 [doi]
- InfiniDreamer: Arbitrarily Long Human Motion Generation Via Segment Score DistillationWenjie Zhuo, Fan Ma, Hehe Fan. 14688-14698 [doi]
- FLOAT: Generative Motion Latent Flow Matching for Audio-Driven Talking PortraitTaekyung Ki, Dongchan Min, Gyeongsu Chae. 14699-14710 [doi]
- VSRM: A Robust Mamba-Based Framework for Video Super-ResolutionDinh-Phu Tran, Dao Duy Hung, Daeyoung Kim 0001. 14711-14721 [doi]
- Face Retouching with Diffusion Data Generation and Spectral RestorementZhidan Xu, Xiaoqin Zhang, Shijian Lu. 14722-14731 [doi]
- Separation for Better Integration: Disentangling Edge and Motion in Event-Based DeblurringYufei Zhu, Hao Chen 0034, Yongjian Deng, Wei You. 14732-14742 [doi]
- 2HandedAfforder: Learning Precise Actionable Bimanual Affordances from Human VideosMarvin Heidinger, Snehal Jauhri, Vignesh Prasad, Georgia Chalvatzaki. 14743-14753 [doi]
- Flow Stochastic Segmentation NetworksFabio De Sousa Ribeiro, Omar Todd, Charles Jones, Avinash Kori, Raghav Mehta, Ben Glocker. 14754-14765 [doi]
- IAP: Invisible Adversarial Patch Attack Through Perceptibility-Aware Localization and Perturbation OptimizationSubrat Kishore Dutta, Xiao Zhang. 14766-14775 [doi]
- AnimalClue: Recognizing Animals by their TracesRisa Shinoda, Nakamasa Inoue, Iro Laina, Christian Rupprecht 0001, Hirokatsu Kataoka. 14776-14786 [doi]
- Dynamic Typography: Bringing Text to Life via Video Diffusion PriorZichen Liu, Yihao Meng, Hao Ouyang, Yue Yu 0008, Bolin Zhao, Daniel Cohen-Or, Huamin Qu. 14787-14797 [doi]
- Generating Physically Stable and Buildable Brick Structures from TextAva Pun, Kangle Deng, Ruixuan Liu, Deva Ramanan, Changliu Liu, Jun-Yan Zhu. 14798-14809 [doi]
- WIR3D: Visually-Informed and Geometry-Aware 3D Shape AbstractionRichard Liu, Daniel Fu, Noah Tan, Itai Lang, Rana Hanocka. 14810-14821 [doi]
- SparseFlex: High-Resolution and Arbitrary-Topology 3D Shape ModelingXianglong He, Zi-Xin Zou, Chia-Hao Chen, Yuan-Chen Guo, Ding Liang, Chun Yuan 0003, Wanli Ouyang, Yan-Pei Cao, Yangguang Li 0001. 14822-14833 [doi]
- Recammaster: Camera-Controlled Generative Rendering From a Single VideoJianhong Bai, Menghan Xia, Xiao Fu, Xintao Wang 0002, Lianrui Mu, Jinwen Cao, Zuozhu Liu, Haoji Hu, Xiang Bai, Pengfei Wan 0001, Di Zhang 0026. 14834-14844 [doi]
- Forecasting Continuous Non-Conservative Dynamical Systems in So(3)Lennart Bastian, Mohammad Rashed, Nassir Navab, Tolga Birdal. 14845-14855 [doi]
- Certifiably Optimal Anisotropic Rotation AveragingCarl Olsson, Yaroslava Lochman, Johan Malmport, Christopher Zach. 14856-14865 [doi]
- Deterministic Object Pose Confidence Region EstimationJinghao Wang, Zhang Li, Zi Wang, Banglei Guan, Yang Shang, Qifeng Yu. 14866-14875 [doi]
- RePoseD: Efficient Relative Pose Estimation With Known Depth InformationYaqing Ding 0001, Viktor Kocur, Václav Vávra, Zuzana Berger Haladová, Jian Yang 0003, Torsten Sattler, Zuzana Kukelova. 14876-14886 [doi]
- Diving into the Fusion of Monocular Priors for Generalized Stereo MatchingChengtang Yao, Lidong Yu, Zhidan Liu 0005, Jiaxi Zeng, Yuwei Wu 0001, Yunde Jia. 14887-14897 [doi]
- TIP-I2V: A Million-Scale Real Text and Image Prompt Dataset for Image-to-Video GenerationWenhao Wang, Yi Yang. 14898-14908 [doi]
- IntroStyle: Training-Free Introspective Style Attribution Using Diffusion FeaturesAnand Kumar, Jiteng Mu, Nuno Vasconcelos. 14909-14918 [doi]
- SCFlow: Implicitly Learning Style and Content Disentanglement with Flow ModelsPingchuan Ma 0006, Xiaopei Yang, Yusong Li, Ming Gui, Felix Krause 0002, Johannes Schusterbauer, Björn Ommer. 14919-14929 [doi]
- Compression-Aware One-Step Diffusion Model for JPEG Artifact RemovalJinpei Guo, Zheng Chen 0014, Wenbo Li, Yong Guo, Yulun Zhang 0001. 14930-14939 [doi]
- OminiControl: Minimal and Universal Control for Diffusion TransformerZhenxiong Tan, Songhua Liu, Xingyi Yang, Qiaochu Xue, Xinchao Wang. 14940-14950 [doi]
- Phantom: Subject-Consistent Video Generation via Cross-Modal AlignmentLijie Liu, Tianxiang Ma, Bingchuan Li, Zhuowei Chen, Jiawei Liu, Gen Li, Siyu Zhou, Qian He, Xinglong Wu. 14951-14961 [doi]
- Penalizing Boundary Activation for Object Completeness in Diffusion ModelsHaoyang Xu, Tianhao Zhao, Sibei Yang, Yutian Lin. 14962-14972 [doi]
- MatchDiffusion: Training-Free Generation of Match-CutsAlejandro Pardo, Fabio Pizzati, Tong Zhang 0001, Alexander Pondaven, Philip Torr 0001, Juan C. Pérez, Bernard Ghanem. 14973-14982 [doi]
- Dual-Expert Consistency Model for Efficient and High-Quality Video GenerationZhengyao Lv, Chenyang Si, Tianlin Pan, Zhaoxi Chen 0009, Kwan-Yee K. Wong, Yu Qiao 0001, Ziwei Liu 0002. 14983-14993 [doi]
- Realgeneral: Unifying Visual Generation Via Temporal in-Context Learning With Video ModelsYijing Lin, Mengqi Huang, Shuhan Zhuang, Zhendong Mao 0001. 14994-15004 [doi]
- Straighten Viscous Rectified Flow via Noise OptimizationJimin Dai, Jiexi Yan, Jian Yang 0003, Lei Luo 0001. 15005-15014 [doi]
- Trans-Adapter: A Plug-And-Play Framework for Transparent Image InpaintingYuekun Dai, Haitian Li, Shangchen Zhou, Chen Change Loy. 15015-15024 [doi]
- Scalable Dual Fingerprinting for Hierarchical Attribution of Text-to-Image ModelsJianwei Fei, Yunshu Dai, Peipeng Yu, Zhe Kong, Jiantao Zhou, Zhihua Xia. 15025-15034 [doi]
- QuantCache: Adaptive Importance-Guided Quantization with Hierarchical Latent and Layer Caching for Video GenerationJunyi Wu, Zhiteng Li, Zheng Hui, Yulun Zhang 0001, Linghe Kong, Xiaokang Yang 0001. 15035-15044 [doi]
- Learning Robust Image Watermarking with Lossless Cover RecoveryJiale Chen, Wei Wang 0077, Chongyang Shi 0001, Li Dong 0006, Xiping Hu. 15056-15065 [doi]
- Cross-Subject Mind Decoding from Inaccurate RepresentationsYangyang Xu, Bangzhen Liu, Wenqi Shao, Yong Du 0003, Shengfeng He, Tingting Zhu. 15066-15075 [doi]
- Tree-NeRV: Efficient Non-Uniform Sampling for Neural Video Representation via Tree-Structured Feature GridsJiancheng Zhao, Yifan Zhan, Qingtian Zhu, Mingze Ma, Muyao Niu, Zunian Wan, Xiang Ji 0005, Yinqiang Zheng. 15076-15085 [doi]
- HPSv3: Towards Wide-Spectrum Human Preference ScoreYuhang Ma, Xiaoshi Wu, Keqiang Sun, Hongsheng Li. 15086-15095 [doi]
- SummDiff: Generative Modeling of Video Summarization with DiffusionKwanseok Kim, Jaehoon Hahm, Sumin Kim, Jinhwan Sul, Byunghak Kim, Joonseok Lee. 15096-15106 [doi]
- Leveraging Panoptic Scene Graph for Evaluating Fine-Grained Text-to-Image GenerationXueqing Deng, Linjie Yang, Qihang Yu, Chenglin Yang, Liang-Chieh Chen. 15107-15116 [doi]
- MaTe: Images are All You Need for Material Transfer via Diffusion TransformerNisha Huang, Henglin Liu, Yizhou Lin, Kaer Huang, Chubin Chen, Jie Guo, Tong-Yee Lee, Xiu Li. 15117-15126 [doi]
- LEGO-Maker: A Semantic-Driven Algorithm for Text-to-3D GenerationYifei Zhang, Lei Chen. 15127-15136 [doi]
- ForCenNet: Foreground-Centric Network for Document Image RectificationPeng Cai, Qiang Li, Kaicheng Yang 0002, Dong Guo, Jia Li, Nan Zhou, Xiang An, Ninghua Yang, Jiankang deng. 15137-15146 [doi]
- VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded GenerationShoubin Yu, Difan Liu, Ziqiao Ma 0001, Yicong Hong, Yang Zhou 0019, Hao Tan 0002, Joyce Chai, Mohit Bansal. 15147-15158 [doi]
- Textured 3D Regenerative Morphing with 3D Diffusion PriorSonglin Yang, Yushi Lan, Honghua Chen, Xingang Pan. 15159-15170 [doi]
- Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention ScalingChao Zhou 0016, Tianyi Wei, Nenghai Yu. 15171-15181 [doi]
- Efficient Input-Level Backdoor Defense on Text-to-Image Synthesis via Neuron Activation VariationShengfang Zhai, Jiajun Li, Yue Liu 0008, Huanran Chen, Zhihua Tian, Wenjie Qu 0001, Qingni Shen, Ruoxi Jia 0001, Yinpeng Dong, Jiaheng Zhang. 15182-15193 [doi]
- CycleVAR: Repurposing Autoregressive Model for Unsupervised One-Step Image TranslationYi Liu, Shengqian Li, Zuzeng Lin, Feng Wang, Si Liu. 15194-15204 [doi]
- Magiccolor: Multi-Instance Sketch ColorizationYinhan Zhang, Yue Ma, Bingyuan Wang, Qifeng Chen, Zeyu Wang. 15205-15217 [doi]
- EmotiCrafter: Text-to-Emotional-Image Generation Based on Valence-Arousal ModelShengqi Dang, Yi He, Long Ling, Ziqing Qian, Nanxuan Zhao, Nan Cao 0001. 15218-15228 [doi]
- SDMATTE: Grafting Diffusion Models for Interactive MattingLongfei Huang, Yu Liang, Hao Zhang 0063, Jinwei Chen 0003, Wei Dong, Lunde Chen, Wanyu Liu, Bo Li, Peng-Tao Jiang. 15229-15239 [doi]
- Adaptive Caching for Faster Video Generation With Diffusion TransformersKumara Kahatapitiya, Haozhe Liu, Sen He 0001, Ding Liu, Menglin Jia, Chenyang Zhang, Michael S. Ryoo, Tian Xie 0003. 15240-15252 [doi]
- CoMPaSS: Enhancing Spatial Understanding in Text-to-Image Diffusion ModelsGaoyang Zhang, Bingtao Fu, Qingnan Fan, Qi Zhang, Runxing Liu, Hong Gu, Huaqi Zhang, Xinguo Liu. 15253-15265 [doi]
- Pinco: Position-Induced Consistent Adapter for Diffusion Transformer in Foreground-Conditioned InpaintingGuangben Lu, Yuzhen Du, Yizhe Tang, Zhimin Sun, Ran Yi 0002, Yifan Qi, Tianyi Wang, Lizhuang Ma, Fangyuan Zou. 15266-15276 [doi]
- Edicho: Consistent Image Editing in the WildQingyan Bai, Hao Ouyang, Yinghao Xu 0001, Qiuyu Wang, Ceyuan Yang, Ka Leong Cheng, Yujun Shen, Qifeng Chen 0001. 15277-15287 [doi]
- Photolithography Overlay Map Generation with Implicit Knowledge Distillation Diffusion TransformerYuan-Fu Yang, Hsiu-Hui Hsiao. 15288-15297 [doi]
- FlowChef: Steering of Rectified Flow Models for Controlled GenerationsMaitreya Patel, Song Wen 0001, Dimitris N. Metaxas, Yezhou Yang. 15308-15318 [doi]
- DiffVSR: Revealing an Effective Recipe for Taming Robust Video Super-Resolution Against Complex DegradationsXiaohui Li, Yihao Liu 0001, Shuo Cao, Ziyan Chen, Shaobin Zhuang, Xiangyu Chen 0006, Yinan He, Yi Wang, Yu Qiao 0001. 15319-15328 [doi]
- From Reflection to Perfection: Scaling Inference-Time Optimization for Text-to-Image Diffusion Models via Reflection TuningLe Zhuo, Liangbing Zhao, Sayak Paul, Yue Liao, Renrui Zhang, Yi Xin 0003, Peng Gao 0007, Mohamed Elhoseiny, Hongsheng Li 0001. 15329-15339 [doi]
- Visual Interestingness Decoded: How GPT-4O Mirrors Human InterestsFitim Abdullahu, Helmut Grabner. 15350-15364 [doi]
- Translation of Text Embedding Via Delta Vector to Suppress Strongly Entangled Content in Text-to-Image Diffusion ModelsEunseo Koh, Seunghoo Hong, Tae-young Kim, Simon S. Woo, Jae-Pil Heo. 15365-15374 [doi]
- Grouped Speculative Decoding for Autoregressive Image GenerationJunhyuk So, Juncheol Shin, Hyunho Kook, Eunhyeok Park. 15375-15384 [doi]
- Generating, Fast and Slow: Scalable Parallel Video Generation with Video Interface NetworksBhishma Dedhia, David Bourgin, Krishna Kumar Singh, Yuheng Li, Yan Kang, Zhan Xu, Niraj K. Jha, Yuchen Liu 0002. 15385-15394 [doi]
- DuoLoRA: Cycle-Consistent and Rank-Disentangled Content-Style PersonalizationAniket Roy, Shubhankar Borse, Shreya Kadambi, Debasmit Das, Shweta Mahajan, Risheek Garrepalli, Hyojin Park 0004, Ankita Nayak, Rama Chellappa, Munawar Hayat, Fatih Porikli. 15395-15404 [doi]
- Progressive Artwork Outpainting Via Latent Diffusion ModelsDae-Young Song, Jung-Jae Yu, Donghyeon Cho. 15405-15415 [doi]
- SynTag: Enhancing the Geometric Robustness of Inversion-Based Generative Image WatermarkingHan Fang, Kejiang Chen, Zehua Ma, Jiajun Deng, Yicong Li, Weiming Zhang 0001, Ee-Chien Chang. 15416-15425 [doi]
- Text Embedding Knows How to Quantize Text-Guided Diffusion ModelsHongjae Lee, Myungjun Son, Dongjea Kang, Seung-Won Jung. 15426-15436 [doi]
- Scene Graph Guided Generation: Enable Accurate Relations Generation in Text-to-Image Models via Textural RectificationGuibao Shen, Luozhou Wang, Jiantao Lin, Wenhang Ge, Chaozhe Zhang, Xin Tao 0001, Di Zhang 0026, Pengfei Wan 0001, Guangyong Chen, Yijun Li 0001, Ying-Cong Chen. 15437-15446 [doi]
- PUMA: Empowering Unified MLLM with Multi-Granular Visual GenerationRongyao Fang, Chengqi Duan, Kun Wang, Hao Li 0069, Linjiang Huang, Hao Tian 0006, Xingyu Zeng, Rui Zhao 0001, Jifeng Dai, Hongsheng Li 0001, Xihui Liu. 15447-15457 [doi]
- NeuralSVG: An Implicit Representation for Text-to-Vector GenerationSagi Polaczek, Yuval Alaluf, Elad Richardson, Yael Vinker, Daniel Cohen-Or. 15458-15468 [doi]
- IQA-Adapter: Exploring Knowledge Transfer from Image Quality Assessment to Diffusion-based Generative ModelsKhaled Abud, Sergey Lavrushkin, Alexey Kirillov, Dmitriy S. Vatolin. 15469-15480 [doi]
- DICE: Staleness-Centric Optimizations for Parallel Diffusion MoE InferenceJiajun Luo, Lizhuo Luo, Jianru Xu, Jiajun Song, Rongwei Lu, Chen Tang, Zhi Wang 0001. 15481-15490 [doi]
- Dual Recursive Feedback on Generation and Appearance Latents for Pose-Robust Text-to-Image DiffusionJiwon Kim, Pu-Reum Kim, Seonhwa Kim, Soobin Park, Eunju Cha, Kyong Hwan Jin. 15491-15500 [doi]
- Anti-Tamper Protection for Unauthorized Individual Image GenerationZelin Li 0002, Ruohan Zong, Yifan Liu 0019, Ruichen Yao, Yaokun Liu, Yang Zhang 0031, Dong Wang 0002. 15501-15510 [doi]
- Continual Personalization for Diffusion ModelsYu-Chien Liao, Jr-Jen Chen, Chi-Pin Huang, Ci-Siang Lin, Meng-Lin Wu, Yu-Chiang Frank Wang. 15511-15520 [doi]
- FreeCus: Free Lunch Subject-Driven Customization in Diffusion TransformersYanbing Zhang, Zhe Wang, Qin Zhou, Mengping Yang. 15521-15531 [doi]
- WikiAutoGen: Towards Multi-Modal Wikipedia-Style Article GenerationZhongyu Yang, Jun Chen 0005, Dannong Xu, Junjie Fei, Xiaoqian Shen, Liangbing Zhao, Chun-Mei Feng 0001, Mohamed Elhoseiny. 15532-15541 [doi]
- QuEST: Low-Bit Diffusion Model Quantization via Efficient Selective FinetuningHaoxuan Wang 0002, Yuzhang Shang, Zhihang Yuan, Junyi Wu 0002, Junchi Yan, Yan Yan 0002. 15542-15551 [doi]
- LazyMAR: Accelerating Masked Autoregressive Models Via Feature CachingFeihong Yan, Qingyan Wei, Jiayi Tang, Jiajun Li, Yulin Wang, Xuming Hu, Huiqi Li, Linfeng Zhang 0001. 15552-15561 [doi]
- SPADE: Spatial-Aware Denoising Network for Open-Vocabulary Panoptic Scene Graph Generation with Long- and Local-Range Context ReasoningXin Hu, Ke Qin, Guiduo Duan, Ming Li 0065, Yuan-Fang Li, Tao He 0007. 15562-15572 [doi]
- An Information-Theoretic Regularizer for Lossy Neural Image CompressionYingwen Zhang, Meng Wang 0017, Xihua Sheng, Peilin Chen 0001, Junru Li, Li Zhang 0006, Shiqi Wang 0001. 15573-15582 [doi]
- Dropletvideo: A Dataset and Approach to Explore Integral Spatio-Temporal Consistent Video GenerationRunze Zhang, Guoguang Du, Xiaochuan Li 0001, Qi Jia 0004, Liang Jin, Lu Liu 0009, Jingjing Wang, Cong Xu 0001, Zhenhua Guo 0003, Yaqian Zhao, Xiaoli Gong, RenGang Li, Baoyu Fan. 15583-15593 [doi]
- Timestep-Aware Diffusion Model for Extreme Image RescalingCe Wang, ZhenYu Hu, Wanjie Sun, Zhenzhong Chen 0001. 15594-15603 [doi]
- Split-And-Combine: Enhancing Style Augmentation for Single Domain GeneralizationZhen Zhang 0070, Shuai Yang 0003, Qianlong Dang, Zhize Wu, Lichuan Gu. 15616-15625 [doi]
- Att-Adapter: a Robust and Precise Domain-Specific Multi-Attributes T2i Diffusion Adapter Via Conditional Variational AutoencoderWonwoong Cho, Yan-Ying Chen, Matthew Klenk 0001, David I. Inouye, Yanxia Zhang. 15626-15635 [doi]
- VPO: Aligning Text-to-Video Generation Models with Prompt OptimizationJiale Cheng, Ruiliang Lyu, Xiaotao Gu, Xiao Liu 0036, Jiazheng Xu, Yida Lu, Jiayan Teng, Zhuoyi Yang, Yuxiao Dong, Jie Tang 0001, Hongning Wang, Minlie Huang. 15636-15645 [doi]
- RefEdit: A Benchmark and Method for Improving Instruction-Based Image Editing Model on Referring ExpressionsBimsara Pathiraja, Maitreya Patel, Shivam Singh, Yezhou Yang, Chitta Baral. 15646-15656 [doi]
- Reflect-DiT: Inference-Time Scaling for Text-to-Image Diffusion Transformers via In-Context ReflectionShufan Li, Konstantinos Kallidromitis, Akash Gokul, Arsh Koneru, Yusuke Kato, Kazuki Kozuka, Aditya Grover. 15657-15668 [doi]
- TryOn-Refiner: Conditional Rectified-Flow-Based Tryon Refiner for More Accurate Detail ReconstructionWen Qian. 15669-15679 [doi]
- CuRe: Cultural Gaps in the Long Tail of Text-to-Image SystemsAniket Rege, Zinnia Nie, Mahesh Ramesh, Unmesh Raskar, Zhuoran Yu, Aditya Kusupati, Yong Jae Lee, Ramya Korlakai Vinayak. 15680-15691 [doi]
- LeanVAE: An Ultra-Efficient Reconstruction VAE for Video Diffusion ModelsYu Cheng 0011, Fajie Yuan. 15692-15702 [doi]
- Tread: Token Routing for Efficient Architecture-Agnostic Diffusion TrainingFelix Krause 0002, Timy Phan, Ming Gui, Stefan Andreas Baumann, Vincent Tao Hu, Björn Ommer. 15703-15713 [doi]
- Bootstrap3D: Improving Multi-View Diffusion Model with Synthetic DataZeyi Sun 0002, Tong Wu, Pan Zhang 0001, Yuhang Zang, Xiaoyi Dong, Yuanjun Xiong, Dahua Lin, Jiaqi Wang 0003. 15714-15726 [doi]
- Cassic: Towards Content-Adaptive State-Space Models for Learned Image CompressionShiyu Qin, Jinpeng Wang 0002, Yimin Zhou 0011, Bin Chen 0011, Tianci Luo, Baoyi An, Tao Dai 0001, Shu-Tao Xia, Yaowei Wang 0001. 15727-15736 [doi]
- FullDiT: Video Generative Foundation Models with Multimodal Control via Full AttentionXuan Ju, Weicai Ye, Quande Liu, Qiulin Wang, Xintao Wang 0002, Pengfei Wan 0001, Di Zhang 0026, Kun Gai, Qiang Xu 0001. 15737-15747 [doi]
- Zero-Shot Depth Aware Image Editing With Diffusion ModelsRishubh Parihar, Sachidanand VS, R. Venkatesh Babu. 15748-15759 [doi]
- Stylekeeper: Prevent Content Leakage using Negative Visual Query GuidanceJaeseok Jeong 0002, Junho Kim, Gayoung Lee, Yunjey Choi, Youngjung Uh. 15760-15769 [doi]
- Global and Local Entailment Learning for Natural World ImagerySrikumar Sastry, Aayush Dhakal, Eric Xing, Subash Khanal, Nathan Jacobs. 15770-15780 [doi]
- Beyond Next-Token: Next-X Prediction for Autoregressive Visual GenerationSucheng Ren, Qihang Yu, Ju He, Xiaohui Shen, Alan L. Yuille, Liang-Chieh Chen. 15781-15791 [doi]
- Multi-Turn Consistent Image EditingZijun Zhou, Yingying Deng, Xiangyu He, Weiming Dong, Fan Tang. 15792-15801 [doi]
- Domain Generalizable Portrait Style TransferJiale Zhao, Xinyang Jiang, Junyao Gao, Yuhao Xue, Cairong Zhao. 15802-15811 [doi]
- TRKT: Weakly Supervised Dynamic Scene Graph Generation with Temporal-Enhanced Relation-Aware Knowledge TransferringZhu Xu, Ting Lei 0001, Zhimin Li, Guan Wang, Qingchao Chen, Yuxin Peng 0001, Yang Liu 0105. 15812-15821 [doi]
- Who Controls the Authorization? Invertible Networks for Copyright Protection in Text-to-Image SynthesisBaoyue Hu, Yang Wei 0002, Junhao Xiao, Wendong Huang, Xiuli Bi, Bin Xiao 0002. 15832-15841 [doi]
- SpectralAR: Spectral Autoregressive Visual GenerationYuanhui Huang 0002, Weiliang Chen, Wenzhao Zheng, Yueqi Duan, Jie Zhou 0001, Jiwen Lu. 15842-15852 [doi]
- From Reusing to Forecasting: Accelerating Diffusion Models With TaylorseersJiacheng Liu, Chang Zou, Yuanhuiyi Lyu, Junjie Chen, Linfeng Zhang. 15853-15863 [doi]
- SegmentDreamer: Towards High-Fidelity Text-to-3D Synthesis with Segmented Consistency Trajectory DistillationJiahao Zhu, Zixuan Chen, Guangcong Wang, Xiaohua Xie, Yi Zhou. 15864-15874 [doi]
- The Curse of Conditions: Analyzing and Improving Optimal Transport for Conditional Flow-Based GenerationHo Kei Cheng, Alexander Gerhard Schwing. 15875-15884 [doi]
- MUSE: Multi-Subject Unified Synthesis Via Explicit Layout Semantic ExpansionFei Peng 0003, JunQiang Wu, Yan Li 0043, Tingting Gao, Di Zhang 0026, Huiyuan Fu. 15885-15895 [doi]
- Rethink Sparse Signals for Pose-Guided Text-to-Image GenerationWenjie Xuan, Jing Zhang 0037, Juhua Liu, Bo Du 0001, Dacheng Tao. 15896-15906 [doi]
- Steering Guidance for Personalized Text-to-Image Diffusion ModelsSunghyun Park, Seokeon Choi, Hyoungwoo Park, Sungrack Yun. 15907-15916 [doi]
- CAFA: A Controllable Automatic Foley ArtistRoi Benita, Michael Finkelson, Tavi Halperin, Gleb Sterkin, Yossi Adi. 15917-15926 [doi]
- M2sformer: Multi-Spectral and Multi-Scale Attention With Edge-Aware Difficulty Guidance for Image Forgery LocalizationJu-Hyeon Nam, Dong-Hyun Moon, Sang-Chul Lee. 15927-15938 [doi]
- ReFlex: Text-Guided Editing of Real Images in Rectified Flow via Mid-Step Feature Extraction and Attention AdaptationJimyeong Kim, Jungwon Park, Yeji Song, Nojun Kwak, Wonjong Rhee. 15939-15948 [doi]
- IFAdapter: Instance Feature Control for Grounded Text-to-Image GenerationYinwei Wu, Xianpan Zhou, Bing Ma, Xuefeng Su, Kai Ma, Xinchao Wang. 15949-15959 [doi]
- EditClip: Representation Learning for Image EditingQian Wang, Aleksandar Cvejic, Abdelrahman Eldesokey, Peter Wonka. 15960-15970 [doi]
- Magic Insert: Style-Aware Drag-And-DropNataniel Ruiz, Yuanzhen Li, Neal Wadhwa, Yael Pritch, Michael Rubinstein, David E. Jacobs, Shlomi Fruchter. 15971-15981 [doi]
- Training-Free and Adaptive Sparse Attention for Efficient Long Video GenerationYifei Xia, Suhan Ling, Fangcheng Fu, Yujie Wang, Huixia Li, Xuefeng Xiao 0001, Bin Cui 0001. 15982-15993 [doi]
- SliderSpace: Decomposing the Visual Capabilities of Diffusion ModelsRohit Gandikota, Zongze Wu 0002, Richard Zhang 0001, David Bau, Eli Shechtman, Nicholas I. Kolkin. 15994-16003 [doi]
- DIVE: Taming DINO for Subject-Driven Video EditingYi Huang 0035, Wei Xiong 0008, He Zhang 0004, Chaoqi Chen, Jianzhuang Liu, Mingfu Yan, Shifeng Chen. 16004-16014 [doi]
- Fontanimate: High Quality Few-Shot Font Generation Via Animating Font Transfer ProcessBin Fu, Zixuan Wang, Kainan Yan, Shitian Zhao, Qi Qin, Jie Wen 0001, Junjun He, Peng Gao 0007. 16015-16025 [doi]
- PromptDresser: Improving the Quality and Controllability of Virtual Try-On via Generative Textual Prompt and Prompt-Aware MaskJeongho Kim 0007, Hoiyeong Jin, Sunghyun Park 0005, Jaegul Choo. 16026-16036 [doi]
- Scalable Image Tokenization with Index Backpropagation QuantizationFengyuan Shi 0001, Zhuoyan Luo, Yixiao Ge, Yujiu Yang 0001, Ying Shan, Limin Wang 0002. 16037-16046 [doi]
- Enhancing Image Restoration Transformer via Adaptive Translation EquivarianceJiakui Hu, Zhengjian Yao, Lujia Jin, Hangzhou He, Yanye Lu. 16047-16057 [doi]
- CharaConsist: Fine-Grained Consistent Character GenerationMengyu Wang 0003, Henghui Ding, Jianing Peng, Yao Zhao 0001, Yunpeng Chen, Yunchao Wei. 16058-16067 [doi]
- LiT: Delving into a Simple Linear Diffusion Transformer for Image GenerationJiahao Wang, Ning Kang 0001, Lewei Yao, Mengzhao Chen, Chengyue Wu, Songyang Zhang 0001, Shuchen Xue, Yong Liu 0033, Taiqiang Wu, Xihui Liu, Kaipeng Zhang, Shifeng Zhang, Wenqi Shao, Zhenguo Li, Ping Luo 0002. 16068-16078 [doi]
- IMG: Calibrating Diffusion Models via Implicit Multimodal GuidanceJiayi Guo, Chuanhao Yan, Xingqian Xu, Yulin Wang 0002, Kai Wang 0058, Gao Huang 0001, Humphrey Shi. 16079-16089 [doi]
- Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story GenerationAo Ma 0005, Jiasong Feng, Ke Cao 0001, Jing Wang 0021, Yun Wang, Quanwei Zhang, Zhanjie Zhang. 16102-16111 [doi]
- TextMaster: A Unified Framework for Realistic Text Editing via Glyph-Style Dual-ControlZhenyu Yan, Jian Wang, Aoqiang Wang, Yuhan Li, Wenxiang Shang, Zhu Hangcheng. 16112-16121 [doi]
- Guiding Diffusion Models With Adaptive Negative Sampling Without External ResourcesAlakh Desai, Nuno Vasconcelos. 16122-16131 [doi]
- LoRA.rar: Learning to Merge LoRAs via Hypernetworks for Subject-Style Conditioned Image GenerationDonald Shenaj, Ondrej Bohdal, Mete Ozay, Pietro Zanuttigh, Umberto Michieli. 16132-16142 [doi]
- Beyond Perspective: Neural 360-Degree Video CompressionAndy Regensky, Marc Windsheimer, Fabian Brand, André Kaup. 16143-16153 [doi]
- MCID: Multi-aspect Copyright Infringement Detection for Generated ImagesChuanwei Huang, Zexi Jia, Hongyan Fei, Yeshuang Zhu, Zhiqiang Yuan, Ying Deng, Jiapei Zhang, Xiaoyue Duan, Jinchao Zhang 0001, Jie Zhou 0016. 16154-16164 [doi]
- Text2Outfit: Controllable Outfit Generation With Multimodal Language ModelsYuanhao Zhai 0001, Yen-Liang Lin, Minxu Peng, Larry S. Davis, Ashwin Chandramouli, Junsong Yuan 0001, David S. Doermann. 16165-16174 [doi]
- Outlier-Aware Post-Training Quantization for Image Super-ResolutionHailing Wang, Jianglin Lu, Yitian Zhang, Yun Fu 0001. 16175-16184 [doi]
- SANA-Sprint: One-Step Diffusion with Continuous-Time Consistency DistillationJunsong Chen, Shuchen Xue, Yuyang Zhao, Jincheng Yu, Sayak Paul, Junyu Chen 0003, Han Cai, Song Han 0003, Enze Xie. 16185-16195 [doi]
- SEAL: Semantic Aware Image WatermarkingKasra Arabi, R. Teal Witter, Chinmay Hegde, Niv Cohen. 16196-16205 [doi]
- Modeling Human Gaze Behavior with Diffusion Models for Unified Scanpath PredictionGiuseppe Cartella, Vittorio Cuculo, Alessandro D'Amelio, Marcella Cornia, Giuseppe Boccignone, Rita Cucchiara. 16206-16216 [doi]
- What Changed? Detecting and Evaluating Instruction-Guided Image Edits with Multimodal Large Language ModelsLorenzo Baraldi 0001, Davide Bucciarelli, Federico Betti 0001, Marcella Cornia, Lorenzo Baraldi 0002, Nicu Sebe, Rita Cucchiara. 16217-16226 [doi]
- MeshPad: Interactive Sketch-Conditioned Artist-Reminiscent Mesh Generation and EditingHaoxuan Li, Ziya Erkoç, Lei Li 0038, Daniele Sirigatti, Vladislav Rosov, Angela Dai, Matthias Nießner. 16227-16237 [doi]
- PLADIS: Pushing the Limits of Attention in Diffusion Models at Inference Time by Leveraging SparsityKwanyoung Kim, Byeongsu Sim. 16238-16248 [doi]
- STIV: Scalable Text and Image Conditioned Video GenerationZongyu Lin, Wei Liu, Chen Chen 0005, Jiasen Lu, Wenze Hu, Tsu-Jui Fu, Jesse Allardice, Zhengfeng Lai, Liangchen Song, Bowen Zhang 0002, Cha Chen, Yiran Fei, Lezhi Li, Yinfei Yang, Yizhou Sun, Kai-Wei Chang 0001. 16249-16259 [doi]
- ForgeLens: Data-Efficient Forgery Focus for Generalizable Forgery Image DetectionYingjian Chen, Lei Zhang, Yakun Niu. 16270-16280 [doi]
- ObjectMate: A Recurrence Prior for Object Insertion and Subject-Driven GenerationDaniel Winter, Asaf Shul, Matan Cohen, Dana Berman, Yael Pritch, Alex Rav-Acha, Yedid Hoshen. 16281-16291 [doi]
- 3QE: Learning Discrete Distribution Discrepancy-Aware Quantization Error for Autoregressive-Generated Image DetectionYanran Zhang, Bingyao Yu, Yu Zheng 0015, Wenzhao Zheng, Yueqi Duan, Lei Chen 0069, Jie Zhou 0001, Jiwen Lu. 16292-16301 [doi]
- OmniCache: A Trajectory-Oriented Global Perspective on Training-Free Cache Reuse for Diffusion Transformer ModelsHuanpeng Chu, Wei Wu, Guanyu Feng, Yutao Zhang. 16302-16312 [doi]
- One-Step Specular Highlight Removal with Adapted Diffusion ModelsMahir Atmis, Levent Karacan, Mehmet Sarigül. 16313-16322 [doi]
- ART: Adaptive Relation Tuning for Generalized Relation PredictionGopika Sudhakaran, Hikaru Shindo, Patrick Schramowski, Simone Schaub-Meyer, Kristian Kersting, Stefan Roth 0001. 16323-16332 [doi]
- Transformed Low-rank Adaptation via Tensor Decomposition and Its Applications to Text-to-image ModelsZerui Tao, Yuhta Takida, Naoki Murata, Qibin Zhao, Yuki Mitsufuji. 16333-16344 [doi]
- DiGA3D: Coarse-to-Fine Diffusional Propagation of Geometry and Appearance for Versatile 3D InpaintingJingyi Pan 0001, Dan Xu, Qiong Luo 0001. 16345-16355 [doi]
- Holistic Unlearning Benchmark: A Multi-Faceted Evaluation for Text-to-Image Diffusion Model UnlearningSaemi Moon, Minjong Lee, Sangdon Park, Dongwoo Kim. 16356-16366 [doi]
- Make Me Happier: Evoking Emotions through Image Diffusion ModelsQing Lin, Jingfeng Zhang, Yew-Soon Ong, Mengmi Zhang. 16367-16376 [doi]
- Mv-Adapter: Multi-View Consistent Image Generation Made EasyZehuan Huang, Yuan-Chen Guo, Haoran Wang, Ran Yi 0002, Lizhuang Ma, Yan-Pei Cao, Lu Sheng. 16377-16387 [doi]
- On Large Multimodal Models as Open-World Image ClassifiersAlessandro Conti, Massimiliano Mancini, Enrico Fini, Yiming Wang 0002, Paolo Rota, Elisa Ricci 0001. 16388-16398 [doi]
- DiTFastAttnV2: Head-Wise Attention Compression for Multi-Modality Diffusion TransformersHanling Zhang, Rundong Su, Zhihang Yuan, Pengtao Chen, Mingzhu Shen, Yibo Fan, Shengen Yan, Guohao Dai 0001, Yu Wang 0002. 16399-16409 [doi]
- Dlfr-Gen: Diffusion-Based Video Generation With Dynamic Latent Frame RateZhihang Yuan, Rui Xie, Yuzhang Shang, Hanling Zhang, Siyuan Wang, Shengen Yan, Guohao Dai 0001, Yu Wang 0002. 16410-16419 [doi]
- Erasing More Than Intended? How Concept Erasure Degrades the Generation of Non-Target ConceptsIbtihel Amara, Ahmed Imtiaz Humayun, Ivana Kajic, Zarana Parekh, Natalie Harris, Sarah Young, Chirag Nagpal, Najoung Kim, Junfeng He, Cristina Nader Vasconcelos, Deepak Ramachandran, Golnoosh Farnadi, Katherine A. Heller, Mohammad Havaei, Negar Rostamzadeh. 16420-16430 [doi]
- DIMCIM: A Quantitative Evaluation Framework for Default-Mode Diversity and Generalization in Text-to-Image Generative ModelsRevant Teotia, Candace Ross, Karen Ullrich, Sumit Chopra, Adriana Romero-Soriano, Melissa Hall, Matthew J. Muckley. 16431-16440 [doi]
- From Linearity to Non-Linearity: How Masked Autoencoders Capture Spatial CorrelationsAnthony Bisulco, Rahul Ramesh, Randall Balliestro, Pratik Chaudhari. 16441-16450 [doi]
- Addressing Text Embedding Leakage in Diffusion-Based Image EditingSunung Mun, Jinhwan Nam, Sunghyun Cho, Jungseul Ok. 16451-16460 [doi]
- JailbreakDiffBench: A Comprehensive Benchmark for Jailbreaking Diffusion ModelsXiaolong Jin 0002, Zixuan Weng, Hanxi Guo, Chenlong Yin, Siyuan Cheng 0005, Guangyu Shen, Xiangyu Zhang 0001. 16461-16471 [doi]
- Greg: GEometry-Aware RegIon Refinement for Sign Language Video GenerationTongkai Shi, Lianyu Hu 0003, Fanhua Shang, Liqing Gao, Wei Feng 0005. 16472-16481 [doi]
- Reusing Computation in Text-to-Image Diffusion for Efficient Generation of Image SetsDale Decatur, Thibault Groueix, Wang Yifan 0001, Rana Hanocka, Vladimir G. Kim, Matheus Gadelha. 16482-16491 [doi]
- Repurposing 2D Diffusion Models with Gaussian Atlas for 3D GenerationTiange Xiang, Kai Li, Chengjiang Long, Christian Häne, Peihong Guo, Scott L. Delp, Ehsan Adeli 0001, Li Fei-Fei 0001. 16492-16502 [doi]
- Shot-by-Shot: Film-Grammar-Aware Training-Free Audio Description GenerationJunyu Xie, Tengda Han, Max Bain, Arsha Nagrani, Eshika Khandelwal, Gül Varol, Weidi Xie, Andrew Zisserman. 16503-16513 [doi]
- Generating Multi-Image Synthetic Data for Text-to-Image CustomizationNupur Kumari, Xi Yin 0001, Jun-Yan Zhu, Ishan Misra, Samaneh Azadi. 16524-16534 [doi]
- Deeply Supervised Flow-Based Generative ModelsInkyu Shin, Chenglin Yang, Liang-Chieh Chen. 16535-16544 [doi]
- Stroke2Sketch: Harnessing Stroke Attributes for Training-Free Sketch GenerationRui Yang, Huining Li, Yiyi Long, Xiaojun Wu, Shengfeng He. 16545-16554 [doi]
- DualReal: Adaptive Joint Training for Lossless Identity-Motion Fusion in Video CustomizationWenchuan Wang, Mengqi Huang, Yijing Tu, Zhendong Mao 0001. 16565-16575 [doi]
- Your Text Encoder Can Be an Object-Level Watermarking ControllerNaresh Kumar Devulapally, Mingzhen Huang, Vishal Asnani, Shruti Agarwal, Siwei Lyu, Vishnu Suresh Lokhande. 16576-16585 [doi]
- ICE-Bench: A Unified and Comprehensive Benchmark for Image Creating and EditingYulin Pan, Xiangteng He, Chaojie Mao, Zhen Han, Zeyinzi Jiang, Jingfeng Zhang, Yu Liu 0063. 16586-16596 [doi]
- Stable Score DistillationHaiming Zhu, Yangyang Xu, Chenshu Xu, Tingrui Shen, Wenxi Liu, Yong Du 0003, Jun Yu 0002, Shengfeng He. 16597-16606 [doi]
- KV-Edit: Training-Free Image Editing for Precise Background PreservationTianrui Zhu, Shiyi ZHANG, Jiawei Shao, Yansong Tang. 16607-16617 [doi]
- Edit360: 2D Image Edits to 3D Assets From Any AngleJunchao Huang, Xinting Hu, Shaoshuai Shi, Zhuotao Tian, Li Jiang 0009. 16618-16628 [doi]
- "Principal Components" Enable a New Language of ImagesXin Wen 0004, Bingchen Zhao, Ismail Elezi, Jiankang deng, Xiaojuan Qi 0001. 16641-16651 [doi]
- Teefusion: Blending Text Embeddings to Distill Classifier-Free GuidanceMinghao Fu 0001, Guo-Hua Wang, Xiaohao Chen, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang. 16652-16661 [doi]
- FiVE-Bench: A Fine-Grained Video Editing Benchmark for Evaluating Emerging Diffusion and Rectified Flow ModelsMinghan Li, Chenxi Xie, Yichen Wu, Lei Zhang, Mengyu Wang. 16672-16681 [doi]
- CompSlider: Compositional Slider for Disentangled Multiple-Attribute Image GenerationZixin Zhu, Kevin Duarte, Mamshad Nayeem Rizve, Chengyuan Xu, Ratheesh Kalarot, Junsong Yuan 0001. 16682-16691 [doi]
- InsViE-1M: Effective Instruction-Based Video Editing with Elaborate Dataset ConstructionYuhui Wu 0001, Liyi Chen 0002, Ruibin Li, Shihao Wang, Chenxi Xie, Lei Zhang 0006. 16692-16701 [doi]
- OmniVTON: Training-Free Universal Virtual Try-OnZhaotong Yang, Yuhui Li, Shengfeng He, Xinzhe Li 0003, Yangyang Xu, Junyu Dong, Yong Du 0003. 16702-16711 [doi]
- DreamRenderer: Taming Multi-Instance Attribute Control in Large-Scale Text-to-Image ModelsDewei Zhou, Mingwei Li, Zongxin Yang, Yi Yang 0001. 16712-16722 [doi]
- TAG-WM: Tamper-Aware Generative Image Watermarking via Diffusion Inversion SensitivityYuzhuo Chen, Zehua Ma, Han Fang, Weiming Zhang 0001, Nenghai Yu. 16723-16732 [doi]
- X2i: Seamless Integration of Multimodal Understanding Into Diffusion Transformer Via Attention DistillationJian Ma 0010, Qirong Peng, Xu Guo, Chen Chen 0015, Haonan Lu, Zhenyu Yang. 16733-16744 [doi]
- FreeFlux: Understanding and Exploiting Layer-Specific Roles in RoPE-Based MMDiT for Versatile Image EditingTianyi Wei, Yifan Zhou 0001, Dongdong Chen, Xingang Pan. 16745-16754 [doi]
- Vision-Language Interactive Relation Mining for Open-Vocabulary Scene Graph GenerationYukuan Min, Muli Yang, Jinhao Zhang, Yuxuan Wang, Aming Wu, Cheng Deng 0002. 16755-16764 [doi]
- YOLO-Count: Differentiable Object Counting for Text-to-Image GenerationGuanning Zeng, Xiang Zhang 0015, Zirui Wang, Haiyang Xu 0002, Zeyuan Chen, Bingnan Li, Zhuowen Tu. 16765-16775 [doi]
- UnZipLoRA: Separating Content and Style from a Single ImageChang Liu, Viraj Shah, Aiyu Cui, Svetlana Lazebnik. 16776-16785 [doi]
- Generative Adversarial DiffusionU.-Chae Jun, Jaeeun Ko, Jiwoo Kang. 16786-16796 [doi]
- Colors See Colors Ignore: Clothes Changing ReID with Color DisentanglementPriyank Pathak, Yogesh S. Rawat. 16797-16807 [doi]
- InstantEdit: Text-Guided Few-Step Image Editing with Piecewise Rectified FlowYiming Gong, Zhen Zhu, Minjia Zhang. 16808-16817 [doi]
- Adversarial Distribution Matching for Diffusion Distillation Towards Efficient Image and Video SynthesisYanzuo Lu, Yuxi Ren, Xin Xia 0014, Shanchuan Lin, Xing Wang, Xuefeng Xiao 0001, Andy J. Ma, Xiaohua Xie, Jian-Huang Lai. 16818-16829 [doi]
- Co-Painter: Fine-Grained Controllable Image Stylization via Implicit Decoupling and Adaptive InjectionBowen Fu, Wei Wei 0008, Jiaqi Tang 0005, Jiangtao Nie, Yanyu Ye, Xiaogang Xu 0002, Ying-Cong Chen, Lei Zhang 0001. 16830-16839 [doi]
- AIcomposer: Any Style and Content Image Composition via Feature IntegrationHaowen Li, Zhenfeng Fan, Zhang Wen, Zhengzhou Zhu, Yunjin Li. 16840-16850 [doi]
- PLA: Prompt Learning Attack Against Text-To-Image Generative ModelsXinqi Lyu, Yihao Liu, Yanjie Li, Bin Xiao. 16851-16860 [doi]
- Rethinking Layered Graphic Design Generation with a Top-Down ApproachJingye Chen, Zhaowen Wang, Nanxuan Zhao, Li Zhang, Difan Liu, Jimei Yang, Qifeng Chen 0001. 16861-16870 [doi]
- Memory-Efficient Generative Models via Product QuantizationJie Shao, Hanxiao Zhang, Hao Yu, Jianxin Wu. 16871-16881 [doi]
- Text2VDM: Text to Vector Displacement Maps for Expressive and Interactive 3D SculptingHengyu Meng, Duotun Wang, Zhijing Shao, Ligang Liu, Zeyu Wang 0003. 16882-16892 [doi]
- FreeScale: Unleashing the Resolution of Diffusion Models via Tuning-Free Scale FusionHaonan Qiu, Shiwei Zhang 0001, Yujie Wei 0001, Ruihang Chu, Hangjie Yuan, Xiang Wang 0012, Yingya Zhang, Ziwei Liu 0002. 16893-16903 [doi]
- DiffSim: Taming Diffusion Models for Evaluating Visual SimilarityYiren Song, Xiaokang Liu, Mike Zheng Shou. 16904-16915 [doi]
- Holistic Tokenizer for Autoregressive Image GenerationAnlin Zheng, Haochen Wang, Yucheng Zhao, Weipeng Deng, Tiancai Wang, Xiangyu Zhang 0005, Xiaojuan Qi 0001. 16916-16926 [doi]
- Scendi Score: Prompt-Aware Diversity Evaluation Via Schur Complement of Clip EmbeddingsAzim Ospanov, Mohammad Jalali, Farzan Farnia. 16927-16937 [doi]
- Toward Better Out-Painting: Improving the Image Composition With Initialization Policy ModelXuan Han, Yihao Zhao, Yanhao Ge, Mingyu You. 16938-16947 [doi]
- From Image to Video: An Empirical Study of Diffusion RepresentationsPedro Vélez, Luisa F. Polanía, Yi Yang 0007, Chuhan Zhang, Rishabh Kabra, Anurag Arnab, Mehdi S. M. Sajjadi. 16948-16958 [doi]
- An Inversion-Based Measure of Memorization for Diffusion ModelsZhe Ma 0002, Qingming Li, Xuhong Zhang 0002, Tianyu Du, Ruixiao Lin, Zonghui Wang, Shouling Ji, Wenzhi Chen. 16959-16969 [doi]
- Cap: Evaluation of Persuasive and Creative Image GenerationAysan Aghazadeh, Adriana Kovashka. 16970-16980 [doi]
- Versatile Transition Generation with Image-to-Video DiffusionZuhao Yang, Jiahui Zhang, Yingchen Yu, Shijian Lu, Song Bai 0001. 16981-16990 [doi]
- Ultra High-Resolution Image Inpainting with Patch-Based Content Consistency AdapterJianhui Zhang, Sheng Cheng, Qirui Sun, Jia Liu, Wang Luyang, Chaoyu Feng, Chen Fang, Lei Lei, Jue Wang 0001, Shuaicheng Liu. 16991-17000 [doi]
- MetaMorph: Multimodal Understanding and Generation via Instruction TuningShengbang Tong, David Fan 0001, Jiachen Zhu 0002, Yunyang Xiong, Xinlei Chen, Koustuv Sinha, Michael Rabbat, Yann LeCun, Saining Xie, Zhuang Liu 0003. 17001-17012 [doi]
- CSD-VAR: Content-Style Decomposition in Visual Autoregressive ModelsQuang-Binh Nguyen, Minh Luu, Quang Nguyen, Anh Tran 0001, Khoi Nguyen 0001. 17013-17023 [doi]
- AlignGuard: Scalable Safety Alignment for Text-to-Image GenerationRuntao Liu, Chen I Chieh, Jindong Gu, Jipeng Zhang, Renjie Pi, Qifeng Chen 0001, Philip Torr 0001, Ashkan Khakzar, Fabio Pizzati. 17024-17034 [doi]
- DiffIP: Representation Fingerprints for Robust IP Protection of Diffusion ModelsZhuoling Li, Haoxuan Qu, Jason Kuen, Jiuxiang Gu, Qiuhong Ke, Jun Liu 0036, Hossein Rahmani 0001. 17035-17045 [doi]
- FairHuman: Boosting Hand and Face Quality in Human Image Generation with Minimum Potential Delay Fairness in Diffusion ModelsYuxuan Wang, Tianwei Cao, Huayu Zhang, Zhongjiang He, Kongming Liang, Zhanyu Ma. 17046-17055 [doi]
- Processing and Acquisition Traces in Visual Encoders: What Does CLIP Know About Your Camera?Ryan Ramos, Vladan Stojnic, Giorgos Kordopatis-Zilos, Yuta Nakashima, Giorgos Tolias, Noa Garcia. 17056-17066 [doi]
- Spatial-Temporal Forgery Trace Based Forgery Image IdentificationYilin Wang, Zunlei Feng, Jiachi Wang, Hengrui Lou, Binjia Zhou, Jie Lei 0002, Mingli Song, Yijun Bei. 17067-17076 [doi]
- AM-Adapter: Appearance Matching Adapter for Exemplar-Based Semantic Image Synthesis In-the-WildSiyoon Jin, Jisu Nam, Jiyoung Kim, Dahyun Chung, Yeong-Seok Kim, Joonhyung Park, Heonjeong Chu, Seungryong Kim. 17077-17086 [doi]
- Aligning Global Semantics and Local Textures in Generative Video EnhancementZhikai Chen, Fuchen Long, Zhaofan Qiu, Ting Yao 0003, Wengang Zhou 0001, Jiebo Luo 0001, Tao Mei 0001. 17087-17096 [doi]
- Diffusion Epistemic Uncertainty with Asymmetric Learning for Diffusion-Generated Image DetectionYingsong Huang, Hui Guo, Jing Huang, Bing Bai, Qi Xiong. 17097-17107 [doi]
- Star: Spatial-Temporal Augmentation with Text-to-Video Models for Real-World Video Super-ResolutionRui Xie 0005, Yinhong Liu, Penghao Zhou, Chen Zhao 0002, Jun Zhou, Kai Zhang 0008, Zhenyu Zhang 0005, Jian Yang 0003, Zhenheng Yang, Ying Tai. 17108-17118 [doi]
- HYPDAE: Hyperbolic Diffusion Autoencoders for Hierarchical Few-Shot Image GenerationLingxiao Li, Kaixuan Fan, Boqing Gong, Xiangyu Yue 0001. 17119-17128 [doi]
- Preacher: Paper-to-Video Agentic SystemJingwei Liu, Ling Yang, Hao Luo, Fan Wang, Hongyan Li, Mengdi Wang. 17129-17139 [doi]
- Frequency-Aware Autoregressive Modeling for Efficient High-Resolution Image SynthesisZhuokun Chen, Jugang Fan, Zhuowei Yu, Bohan Zhuang, Mingkui Tan. 17140-17149 [doi]
- Model Reveals What to Cache: Profiling-Based Feature Reuse for Video Diffusion ModelsXuran Ma, Yexin Liu, Yaofu Liu, Xianfeng Wu, Mingzhe Zheng, Zihao Wang, Ser-Nam Lim, Harry Yang. 17150-17159 [doi]
- UniVG: A Generalist Diffusion Model for Unified Image Generation and EditingTsu-Jui Fu, Yusu Qian, Chen Chen, Wenze Hu, Zhe Gan, Yinfei Yang. 17160-17170 [doi]
- Draw Your Mind: Personalized Generation via Condition-Level Modeling in Text-to-Image Diffusion ModelsHyungjin Kim 0004, Seokho Ahn, Young-Duk Seo. 17171-17180 [doi]
- Spectral Image TokenizerCarlos Esteves, Mohammed Suhail, Ameesh Makadia. 17181-17190 [doi]
- VACE: All-in-One Video Creation and EditingZeyinzi Jiang, Zhen Han, Chaojie Mao, Jingfeng Zhang, Yulin Pan, Yu Liu. 17191-17202 [doi]
- RomanTex: Decoupling 3D-Aware Rotary Positional Embedded Multi-Attention Network for Texture SynthesisYifei Feng, Mingxin Yang, Shuhui Yang, Sheng Zhang, Jiaao Yu, Zibo Zhao 0001, Yuhong Liu, Jie Jiang 0015, Chunchao Guo. 17203-17213 [doi]
- ImageGen-CoT: Enhancing Text-to-Image in-context Learning with Chain-of-Thought ReasoningJiaqi Liao, Zhengyuan Yang, Linjie Li, Dianqi Li, Kevin Lin, Yu Cheng 0001, Lijuan Wang. 17214-17223 [doi]
- Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt EnsemblesEric Slyman, Md. Mehrab Tanjim, Kushal Kafle, Stefan Lee. 17224-17234 [doi]
- V.I.P.: Iterative Online Preference Distillation for Efficient Video Diffusion ModelsJisoo Kim, Wooseok Seo, Junwan Kim, SeungHo Park, Sooyeon Park, Youngjae Yu. 17235-17245 [doi]
- LOTA: Bit-Planes Guided AI-Generated Image DetectionHongsong Wang 0001, Renxi Cheng, Yang Zhang 0002, Chaolei Han 0001, Jie Gui. 17246-17255 [doi]
- X-Prompt: Generalizable Auto-Regressive Visual Learning with In-Context PromptingZeyi Sun 0002, Ziyang Chu, Pan Zhang 0001, Tong Wu, Yuhang Zang, Xiaoyi Dong, Yuanjun Xiong, Dahua Lin, Jiaqi Wang 0003. 17268-17280 [doi]
- Long Context Tuning for Video GenerationYuwei Guo 0002, Ceyuan Yang, Ziyan Yang, Zhibei Ma, Zhijie Lin 0001, Zhenheng Yang, Dahua Lin, Lu Jiang. 17281-17291 [doi]
- AnyI2V: Animating Any Conditional Image with Motion ControlZiye Li, Hao Luo 0004, Xincheng Shuai, Henghui Ding. 17302-17311 [doi]
- LMM4LMM: Benchmarking and Evaluating Large-Multimodal Image Generation With LMMsJiarui Wang, Huiyu Duan, Yu Zhao, Juntong Wang, Guangtao Zhai, Xiongkuo Min. 17312-17323 [doi]
- Omnipaint: Mastering Object-Oriented Editing Via Disentangled Insertion-Removal InpaintingYongsheng Yu, Ziyun Zeng, Haitian Zheng, Jiebo Luo 0001. 17324-17334 [doi]
- PlugMark: A Plug-In Zero-Watermarking Framework for Diffusion ModelsPengzhen Chen, Yanwei Liu 0001, Xiaoyan Gu 0001, Enci Liu, Zhuoyi Shang, Xiangyang Ji, Wu Liu 0005. 17335-17345 [doi]
- Streamlining Image Editing with Layered Diffusion BrushesPeyman Gholami, Robert Xiao. 17368-17378 [doi]
- StableCodec: Taming One-Step Diffusion for Extreme Image CompressionTianyu Zhang, Xin Luo, Li Li 0040, Dong Liu 0002. 17379-17389 [doi]
- Rethinking Discrete Tokens: Treating Them as Conditions for Continuous Autoregressive Image SynthesisPeng Zheng, Junke Wang, Yi Chang, Yizhou Yu, Rui Ma 0011, Zuxuan Wu. 17390-17400 [doi]
- Can We Achieve Efficient Diffusion without Self-Attention? Distilling Self-Attention Into ConvolutionsZiyi Dong, Chengxing Zhou, Weijian Deng, Pengxu Wei, Xiangyang Ji, Liang Lin. 17401-17410 [doi]
- DADet: Safeguarding Image Conditional Diffusion Models Against Adversarial and Backdoor Attacks via Diffusion Anomaly DetectionHongwei Yu, Xinlong Ding, Jiawei Li 0016, JinLong Wang, Yudong Zhang 0008, Rongquan Wang, Huimin Ma 0001, Jiansheng Chen 0001. 17411-17421 [doi]
- Latent Diffusion Models With Masked AutoencodersJunho Lee, Jeongwoo Shin, Hyungwook Choi, Joonseok Lee. 17422-17431 [doi]
- Imbalance in Balance: Online Concept Balancing in Generation ModelsYukai Shi, Jiarong Ou, Rui Chen, Haotian Yang, Jiahao Wang, Xin Tao 0001, Pengfei Wan 0001, Di Zhang 0026, Kun Gai. 17432-17442 [doi]
- OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented GenerationJunyuan Zhang, Qintong Zhang, Bin Wang 0065, Linke Ouyang, Zichen Wen, Ying Li, Ka Ho Chow, Conghui He, Wentao Zhang 0001. 17443-17453 [doi]
- Multi-Scenario Overlapping Text Segmentation with Depth AwarenessYang Liu, Xudong Xie, Yuliang Liu, Xiang Bai. 17454-17463 [doi]
- TextSSR: Diffusion-Based Data Synthesis for Scene Text RecognitionXingsong Ye, Yongkun Du, Yunbo Tao, Zhineng Chen. 17464-17473 [doi]
- EEdit ⚡: Rethinking the Spatial and Temporal Redundancy for Efficient Image EditingZexuan Yan, Yue Ma, Chang Zou, Wenteng Chen, Qifeng Chen, Linfeng Zhang. 17474-17484 [doi]
- RAGDiffusion: Faithful Cloth Generation via External Knowledge AssimilationYuhan Li 0003, Xianfeng Tan, Wenxiang Shang, Yubo Wu, Jian Wang, Xuanhong Chen, Yi Zhang, Hangcheng Zhu, Bingbing Ni. 17485-17495 [doi]
- Wasserstein Style Distribution Analysis and Transform for Stylized Image GenerationXi Yu, Xiang Gu, Zhihao Shi, Jian Sun. 17496-17505 [doi]
- Instruction-Based Image Editing with Planning, Reasoning, and GenerationLiya Ji, Chenyang Qi, Qifeng Chen. 17506-17515 [doi]
- Discovering Divergent Representations Between Text-To-Image ModelsLisa Dunlap, Joseph E. Gonzalez, Trevor Darrell, Fabian Caba Heilbron, Josef Sivic, Bryan C. Russell. 17516-17525 [doi]
- DDB: Diffusion Driven Balancing to Address Spurious CorrelationsAryan Yazdan Parast, Basim Azam, Naveed Akhtar. 17526-17535 [doi]
- HDR Image Generation via Gain Map Decomposed DiffusionYuanshen Guan, Ruikang Xu, Yinuo Liao, Mingde Yao, Lizhi Wang 0001, Zhiwei Xiong. 17536-17545 [doi]
- ESSENTIAL: Episodic and Semantic Memory Integration for Video Class-Incremental LearningJongseo Lee, Kyungho Bae, Kyle Min 0001, Gyeong-Moon Park, Jinwoo Choi 0001. 17546-17556 [doi]
- Fair Generation without Unfair Distortions: Debiasing Text-To-Image Generation with Entanglement-Free AttentionJeonghoon Park, Juyoung Lee, Chaeyeon Chung, Jaeseong Lee, Jaegul Choo, Jindong Gu. 17567-17576 [doi]
- Training-Free Text-Guided Image Editing with Visual Autoregressive ModelYufei Wang 0006, Lanqing Guo, Zhihao Li, Jiaxing Huang 0001, Pichao Wang, Bihan Wen, Jian Wang. 17577-17586 [doi]
- QR-LoRA: Efficient and Disentangled Fine-Tuning via QR Decomposition for Customized GenerationJiahui Yang, Yongjia Ma, Donglin Di, JianXun Cui, Hao Li 0030, Wei Chen 0089, Yan Xie, Xun Yang 0001, Wangmeng Zuo. 17587-17597 [doi]
- Uncover Treasures in DCT: Advancing JPEG Quality Enhancement by Exploiting Latent CorrelationsJing Yang, Qunliang Xing, Mai Xu, Minglang Qiao. 17598-17607 [doi]
- Accelerating Diffusion Transformer via Gradient-Optimized CacheJunxiang Qiu, Lin Liu, Shuo Wang 0008, Jinda Lu, Kezhou Chen, Yanbin Hao. 17608-17617 [doi]
- The Silent Assistant: NoiseQuery as Implicit Guidance for Goal-Driven Image GenerationRuoyu Wang 0034, Huayang Huang, Ye Zhu, Olga Russakovsky, Yu Wu 0011. 17618-17628 [doi]
- Progressive Growing of Video Tokenizers for Temporally Compact Latent SpacesAniruddha Mahapatra, Long Mai, David Bourgin, Yitian Zhang, Feng Liu 0015. 17629-17639 [doi]
- Multimodal Latent Diffusion Model for Complex Sewing Pattern GenerationShengqi Liu, Yuhao Cheng, Zhuo Chen 0060, Xingyu Ren, Wenhan Zhu, Lincheng Li, Mengxiao Bi, Xiaokang Yang 0001, Yichao Yan. 17640-17650 [doi]
- ArtEditor: Learning Customized Instructional Image Editor From Few-Shot ExamplesShijie Huang, Yiren Song, Yuxuan Zhang 0001, Hailong Guo, Xueyin Wang, Jiaming Liu. 17651-17662 [doi]
- Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMsYikang Zhou, Tao Zhang 0042, Shilin Xu 0001, Shihao Chen, Qianyu Zhou 0001, Yunhai Tong, Shunping Ji, Jiangning Zhang, Lu Qi 0001, Xiangtai Li. 17663-17674 [doi]
- MC-Bench: A Benchmark for Multi-Context Visual Grounding in the Era of MLLMsYunqiu Xu, Linchao Zhu, Yi Yang 0001. 17675-17687 [doi]
- Golden Noise for Diffusion Models: A Learning FrameworkZikai Zhou, Shitong Shao, Lichen Bai, Shufei Zhang, Zhiqiang Xu 0003, Bo Han, Zeke Xie. 17688-17697 [doi]
- Disrupting Model Merging: A Parameter-Level Defense without Sacrificing AccuracyJunhao Wei, Yu Zhe, Jun Sakuma. 17698-17707 [doi]
- Towards Stabilized and Efficient Diffusion Transformers Through Long-Skip-Connections With Spectral ConstraintsGuanjie Chen, Xinyu Zhao, Yucheng Zhou 0001, Xiaoye Qu, Tianlong Chen 0001, Yu Cheng 0001. 17708-17718 [doi]
- Learning Few-Step Diffusion Models by Trajectory Distribution MatchingYihong Luo, Tianyang Hu 0001, Jiacheng Sun, Yujun Cai, Jing Tang 0004. 17719-17728 [doi]
- End-to-End Entity-Predicate Association Reasoning for Dynamic Scene Graph GenerationLiwei Wang, Yanduo Zhang, Tao Lu 0001, Fang Liu, Huiqin Zhang, Jiayi Ma 0001, Huabing Zhou. 17729-17738 [doi]
- Harmonizing Visual Representations for Unified Multimodal Understanding and GenerationSize Wu, Wenwei Zhang, Lumin Xu, Sheng Jin 0007, Zhonghua Wu, Qingyi Tao, Wentao Liu 0002, Wei Li 0319, Chen Change Loy. 17739-17750 [doi]
- 3GS: Arbitrary Artistic Style into Arbitrary 3D Gaussian SplattingZhiyuan Fang, Rengan Xie, Xuancheng Jin, Qi Ye 0001, Wei Chen 0001, Wenting Zheng, Rui Wang 0004, Yuchi Huo. 17751-17760 [doi]
- HouseTour: A Virtual Real Estate A(I)gentAta Çelen, Marc Pollefeys, Dániel Baráth, Iro Armeni. 17761-17771 [doi]
- Forensic-MoE: Exploring Comprehensive Synthetic Image Detection Traces With Mixture of ExpertsMingqi Fang, Ziguang Li, Lingyun Yu 0002, Quanwei Yang, Hongtao Xie, Yongdong Zhang 0001. 17772-17782 [doi]
- LayerD: Decomposing Raster Graphic Designs into LayersTomoyuki Suzuki, Kang-Jun Liu, Naoto Inoue, Kota Yamaguchi. 17783-17792 [doi]
- Tikzero: Zero-Shot Text-Guided Graphics Program SynthesisJonas Belouadi, Eddy Ilg, Margret Keuper, Hideki Tanaka, Masao Utiyama, Raj Dabre, Steffen Eger, Simone Paolo Ponzetto. 17793-17806 [doi]
- ViLU: Learning Vision-Language Uncertainties for Failure PredictionMarc Lafon, Yannis Karmim, Julio Silva-Rodríguez, Paul Couairon, Clément Rambour, Raphaël Fournier-S'niehotta, Ismail Ben Ayed, Jose Dolz, Nicolas Thome. 17807-17817 [doi]
- Beyond Blur: A Fluid Perspective on Generative Diffusion ModelsGrzegorz Gruszczynski, Jakub J. Meixner, Michal Jan Wlodarczyk, Przemyslaw Musialski. 17818-17827 [doi]
- Conditional Visual Autoregressive Modeling for Pathological Image RestorationZiyi Liu, Zhe Xu, Jiabo Ma, Wenqiang Li, Ruixuan Wang, Bo Du, Hao Chen. 17828-17837 [doi]
- Subjective Camera 1.0: Bridging Human Cognition and Visual Reconstruction Through Sequence-Aware Sketch-Guided DiffusionHaoyang Chen, Dongfang Sun, Caoyuan Ma, Shiqin Wang, Kewei Zhang, Zheng Wang 0007, Zhixiang Wang 0001. 17838-17847 [doi]
- GlassWizard: Harvesting Diffusion Priors for Glass Surface DetectionWenxue Li 0003, Tian Ye 0001, Xinyu Xiong, Jinbin Bai, Feilong Tang, Wenxuan Song, Zhaohu Xing, Lie Ju, Guanbin Li, Lei Zhu 0003. 17848-17858 [doi]
- Skald: Learning-Based Shot Assembly for Coherent Multi-Shot Video CreationChen-Yi Lu, Md. Mehrab Tanjim, Ishita Dasgupta 0002, Somdeb Sarkhel, Gang Wu 0013, Saayan Mitra, Somali Chaterji. 17859-17868 [doi]
- LoRAverse: A Submodular Framework to Retrieve Diverse Adapters for Diffusion ModelsMert Sonmezer, Matthew Zheng, Pinar Yanardag. 17879-17888 [doi]
- HyTIP: Hybrid Temporal Information Propagation for Masked Conditional Residual Video CodingYi-Hsin Chen, Yi-Chen Yao, Kuan-Wei Ho, Chun-Hung Wu, Huu Tai Phung, Martin Benjak, Jörn Ostermann, Wen-Hsiao Peng. 17889-17898 [doi]
- DACoN: DINO for Anime Paint Bucket Colorization with Any Number of Reference ImagesKazuma Nagata, Naoshi Kaneko. 17899-17908 [doi]
- Lay-Your-Scene: Natural Scene Layout Generation with Diffusion TransformersDivyansh Srivastava, Xiang Zhang 0015, He Wen, Chenru Wen, Zhuowen Tu. 17909-17919 [doi]
- 2 Guide: Training-Free Text-to-Video Alignment Using Image LVLMJaemin Kim, Bryan Sangwoo Kim, Jong Chul Ye. 17920-17929 [doi]
- Hybrid Layout Control for Diffusion Transformer: Fewer Annotations, Superior AestheticsKeming Wu, Junwen Chen, Zhanhao Liang, Yinuo Wang, Ji Li, Chao Zhang, Bin Wang, Yuhui Yuan. 17930-17940 [doi]
- InfGen: A Resolution-Agnostic Paradigm for Scalable Image SynthesisTao Han 0002, Wanghan Xu, Junchao Gong, Xiaoyu Yue, Song Guo 0001, Luping Zhou, Lei Bai 0001. 17941-17950 [doi]
- VideoVAE+: Large Motion Video Autoencoding with Cross-Modal Video VAEYazhou Xing, Yang Fei, Yingqing He, Jingye Chen, Jiaxin Xie, Xiaowei Chi, Qifeng Chen 0001. 17951-17960 [doi]
- DOLLAR: Few-Step Video Generation Via Distillation and Latent Reward OptimizationZihan Ding, Chi Jin, Difan Liu, Haitian Zheng, Krishna Kumar Singh, Qiang Zhang, Yan Kang, Zhe Lin 0001, Yuchen Liu 0002. 17961-17971 [doi]
- Dual-Process Image GenerationGrace Luo, Jonathan Granskog, Aleksander Holynski, Trevor Darrell. 17972-17983 [doi]
- SpecGuard: Spectral Projection-Based Advanced Invisible WatermarkingInzamamul Alam, Md Tanvir Islam, Simon S. Woo, Khan Muhammad 0001. 17984-17993 [doi]
- DIA: The Adversarial Exposure of Deterministic Inversion in Diffusion ModelsSeunghoo Hong, Geonho Son, Juhun Lee, Simon S. Woo. 17994-18003 [doi]
- Supercharged One-Step Text-to-Image Diffusion Models with Negative PromptsViet Nguyen, Anh Nguyen, Trung Dao, Khoi Nguyen, Cuong Pham, Toan Tran, Anh Tran. 18004-18013 [doi]
- GFPack++: Attention-Driven Gradient Fields for Optimizing 2D Irregular PackingTianyang Xue, Lin Lu 0001, Yang Liu 0014, Mingdong Wu, Hao Dong 0003, Yanbin Zhang, Renmin Han, Baoquan Chen. 18014-18023 [doi]
- DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid TokenizerYecheng Wu, Junyu Chen 0003, Zhuoyang Zhang, Enze Xie, Jincheng Yu, Junsong Chen, Jinyi Hu, Yao Lu 0006, Song Han 0003, Han Cai. 18034-18045 [doi]
- Laconic: A 3D Layout Adapter for Controllable Image CreationLéopold Maillard, Tom Durand, Adrien Ramanana Rahary, Maks Ovsjanikov. 18046-18057 [doi]
- Preserve Anything: Controllable Image Synthesis with Object PreservationPrasen Kumar Sharma, Neeraj Matiyali, Siddharth Srivastava 0004, Gaurav Sharma 0004. 18058-18067 [doi]
- Rethinking DPO-Style Diffusion Aligning FrameworksXun Wu, Shaohan Huang, Lingjie Jiang, Furu Wei. 18068-18077 [doi]
- Ask and Remember: A Questions-Only Replay Strategy for Continual Visual Question AnsweringImad Eddine Marouf, Enzo Tartaglione, Stéphane Lathuilière, Joost van de Weijer 0001. 18078-18089 [doi]
- Contrastive Test-Time Composition of Multiple LoRA Models for Image GenerationTuna Han Salih Meral, Enis Simsar, Federico Tombari, Pinar Yanardag. 18090-18100 [doi]
- LLM Thought Divergence and Convergence for Dialogue-Based Image Generation ControlHui Li. 18101-18110 [doi]
- FreeMorph: Tuning-Free Generalized Image Morphing with Diffusion ModelYukang Cao, Chenyang Si, Jinghao Wang, Ziwei Liu 0002. 18111-18120 [doi]
- FramePainter: Endowing Interactive Image Editing with Video Diffusion PriorsYabo Zhang, Xinpeng Zhou, Yihan Zeng, Hang Xu 0004, Hui Li 0035, Wangmeng Zuo. 18121-18131 [doi]
- TurboVSR: Fantastic Video Upscalers and Where to Find ThemZhongdao Wang, Guodongfang Zhao, Jingjing Ren, Bailan Feng, Shifeng Zhang, Wenbo Li 0002. 18132-18142 [doi]
- PlanGen: Towards Unified Layout Planning and Image Generation in Auto-Regressive Vision Language ModelsRunze He, Bo Cheng 0016, Yuhang Ma, Qingxiang Jia, Shanyuan Liu, Ao Ma 0005, Xiaoyu Wu, Liebucha Wu, Dawei Leng, Yuhui Yin. 18143-18154 [doi]
- Turbo2K: Towards Ultra-Efficient and High-Quality 2K Video SynthesisJingjing Ren, Wenbo Li 0002, Zhongdao Wang, Haoze Sun, Bangzhen Liu, Haoyu Chen 0003, Jiaqi Xu, Aoxue Li, Shifeng Zhang, Bin Shao, Yong Guo, Lei Zhu 0003. 18155-18165 [doi]
- Anchor Token Matching: Implicit Structure Locking for Training-Free AR Image EditingTaihang Hu, Linxuan Li, Kai Wang 0060, Yaxing Wang, Jian Yang 0003, Ming-Ming Cheng. 18166-18176 [doi]
- Improving Rectified Flow with Boundary ConditionsXixi Hu 0001, Runlong Liao, Keyang Xu, Bo Liu 0042, Yeqing Li, Eugene Ie, Hongliang Fei, Qiang Liu 0001. 18177-18186 [doi]
- TokensGen: Harnessing Condensed Tokens for Long Video GenerationWenqi Ouyang, Zeqi Xiao, Danni Yang, Yifan Zhou 0001, Shuai Yang 0001, Lei Yang 0045, Jianlou Si, Xingang Pan. 18197-18206 [doi]
- Parametric Shadow Control for Portrait Generation in Text-to-Image Diffusion ModelsHaoming Cai, Tsung-Wei Huang, Shiv Gehlot, Brandon Y. Feng, Sachin Shah, Guan-Ming Su, Christopher A. Metzler. 18207-18217 [doi]
- Igd: Instructional Graphic Design With Multimodal Layer GeneratioYadong Qu, Hongtao Xie, Yongdong Zhang 0001, Shancheng Fang, Yuxin Wang 0002, Xiaorui Wang, Zhineng Chen. 18218-18228 [doi]
- GenDoP: Auto-regressive Camera Trajectory Generation as a Director of PhotographyMengchen Zhang 0001, Tong Wu, Jing Tan 0002, Ziwei Liu 0002, Gordon Wetzstein, Dahua Lin. 18229-18239 [doi]
- OURO: A Self-Bootstrapped Framework for Enhancing Multimodal Scene UnderstandingTianrun Xu, Guanyu Chen, Ye Li, Yuxin Xi, Zeyu Mu, Ruichen Wang, Tianren Zhang, Haichuan Gao, Feng Chen 0007. 18240-18251 [doi]
- CompleteMe: Reference-Based Human Image CompletionYu-Ju Tsai, Brian L. Price, Qing Liu 0017, Luis Figueroa, Daniil Pakhomov, Zhihong Ding, Scott Cohen, Ming-Hsuan Yang 0001. 18252-18261 [doi]
- REPA-E: Unlocking VAE for End-to-End Tuning with Latent Diffusion TransformersXingjian Leng, Jaskirat Singh, Yunzhong Hou, Zhenchang Xing, Saining Xie, Liang Zheng 0001. 18262-18272 [doi]
- EEGMirror: Leveraging EEG Data in the Wild Via Montage-Agnostic Self-Supervision for EEG to Video DecodingXuan-Hao Liu, Bao-Liang Lu, Wei-Long Zheng. 18273-18283 [doi]
- Accelerating Diffusion Sampling via Exploiting Local Transition CoherenceShangwen Zhu, Han Zhang 0010, Zhantao Yang, Qianyu Peng, Zhao Pu, Huangji Wang, Fan Cheng 0002. 18284-18293 [doi]
- SA-LUT: Spatial Adaptive 4D Look-Up Table for Photorealistic Style TransferZerui Gong, Zhonghua Wu, Qingyi Tao, Qinyue Li, Chen Change Loy. 18294-18303 [doi]
- Inpaint4Drag: Repurposing Inpainting Models for Drag-Based Image Editing via Bidirectional WarpingJingyi Lu, Kai Han 0001. 18304-18313 [doi]
- UniversalBooth: Model-Agnostic Personalized Text-To-Image GenerationSonghua Liu, Ruonan Yu, Xinchao Wang. 18314-18324 [doi]
- Unicombine: Unified Multi-Conditional Combination with Diffusion TransformerHaoxuan Wang, Jinlong Peng, Qingdong He, Hao Yang, Ying Jin, Jiafu Wu, Xiaobin Hu, Yanjie Pan, Zhenye Gan, Mingmin Chi, Bo Peng, Yabiao Wang. 18325-18334 [doi]
- UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text SynthesisYuanrui Wang, Cong Han 0002, Yafei Li, Zhipeng Jin, Xiawei Li, Sinan Du, Wen Tao, Shuanglong Li, Yi Yang 0031, Chun Yuan 0003, Liu Lin. 18335-18344 [doi]
- ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing EvaluationSherry X. Chen, Yi Wei, Luowei Zhou, Suren Kumar. 18345-18356 [doi]
- SUV: Suppressing Undesired Video Content via Semantic Modulation Based on Text EmbeddingsXiang Lv, Mingwen Shao, Lingzhuang Meng, Chang Liu 0115, Yecong Wan, Xinyuan Chen. 18357-18366 [doi]
- Neurons: Emulating the Human Visual Cortex Improves Fidelity and Interpretability in fMRI-to-Video ReconstructionHaonan Wang, Qixiang Zhang, Lehan Wang, Xuanqi Huang, Xiaomeng Li. 18367-18376 [doi]
- TF-TI2I: Training-Free Text-And-Image-To-Image Generation via Multi-Modal Implicit-Context Learning in Text-To-Image ModelsTeng-Fang Hsiao, Bo-Kai Ruan, Yi-Lun Wu, Tzu-Ling Lin, Hong-Han Shuai. 18377-18387 [doi]
- Semantic Discrepancy-Aware Detector for Image Forgery IdentificationZiye Wang, Minghang Yu, Chunyan Xu, Zhen Cui 0001. 18388-18398 [doi]
- FairGen: Enhancing Fairness in Text-to-Image Diffusion Models via Self-Discovering Latent DirectionsYilei Jiang, Wei-Hong Li 0001, Yiyuan Zhang, Minghong Cai, Xiangyu Yue 0001. 18411-18420 [doi]
- ConceptSplit: Decoupled Multi-Concept Personalization of Diffusion Models via Token-Wise Adaptation and Attention DisentanglementHabin Lim, Yeongseob Won, Juwon Seo, Park Park. 18421-18430 [doi]
- Randomized Autoregressive Visual GenerationQihang Yu, Ju He, Xueqing Deng, Xiaohui Shen, Liang-Chieh Chen. 18431-18441 [doi]
- Democratizing Text-to-Image Masked Generative Models with Compact Text-Aware One-Dimensional TokensDongwon Kim, Ju He, Qihang Yu, Chenglin Yang, Xiaohui Shen, Suha Kwak, Liang-Chieh Chen. 18442-18452 [doi]
- REGEN: Learning Compact Video Embedding with (Re-)Generative DecoderYitian Zhang, Long Mai, Aniruddha Mahapatra, David Bourgin, Yicong Hong, Jonah Casebeer, Feng Liu 0015, Yun Fu 0001. 18453-18462 [doi]
- FonTS: Text Rendering with Typography and Style ControlsWenda Shi, Yiren Song, Dengming Zhang, Jiaming Liu, Xingxing Zou. 18463-18474 [doi]
- USP: Unified Self-Supervised Pretraining for Image Generation and UnderstandingXiangxiang Chu, Renda Li, Yong Wang. 18475-18486 [doi]
- CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image GenerationHui Zhang 0090, Dexiang Hong, Yitong Wang, Jie Shao, Xinglong Wu, Zuxuan Wu, Yu-Gang Jiang 0001. 18487-18497 [doi]
- MVQA: Mamba with Unified Sampling for Efficient Video Quality AssessmentYachun Mi, Yu Li, Weicheng Meng, Chaofeng Chen, Chen hui, Shaohui Liu. 18498-18509 [doi]
- DMQ: Dissecting Outliers of Diffusion Models for Post-Training QuantizationDongyeun Lee, Jiwan Hur, Hyounguk Shon, Jae Young Lee 0002, Junmo Kim 0002. 18510-18520 [doi]
- CoMatch: Dynamic Covisibility-Aware Transformer for Bilateral Subpixel-Level Semi-Dense Image MatchingZizhuo Li, Yifan Lu, Linfeng Tang, Shihua Zhang, Jiayi Ma 0001. 18521-18530 [doi]
- Guiding Noisy Label Conditional Diffusion Models with Score-Based Discriminator CorrectionNguyen Cong Dat, Bao Hieu Tran, Tung Hoang-Thanh. 18531-18541 [doi]
- HiGarment: Cross-Modal Harmony Based Diffusion Model for Flat Sketch to Realistic Garment ImageJunyi Guo, Jingxuan Zhang, Fangyu Wu 0001, Huanda Lu, Qiufeng Wang 0001, Wenmian Yang, Eng Gee Lim, Dongming Lu. 18542-18551 [doi]
- TCFG: Truncated Classifier-Free Guidance for Efficient and Scalable Text-to-Image AccelerationXiaomeng Fu, Jia Li. 18552-18562 [doi]
- Benchmarking and Learning Multi-Dimensional Quality Evaluator for Text-To-3D GenerationYujie Zhang, Bingyang Cui, Qi Yang 0003, Zhu Li 0001, Yiling Xu. 18563-18574 [doi]
- Automated Red Teaming for Text-to-Image Models Through Feedback-Guided Prompt Iteration with Vision-Language ModelsWei Xu, Kangjie Chen, Jiawei Qiu, Yuyang Zhang, Run Wang, Jin-Mao, Tianwei Zhang, Lina Wang. 18575-18584 [doi]
- PASTA: Part-Aware Sketch-to-3D Shape Generation with Text-Aligned PriorSeungGwan Lee, Hwanhee Jung, Byoungsoo Koh, Qixing Huang, Sang Ho Yoon, Sangpil Kim. 18585-18595 [doi]
- Bridging Continuous and Discrete Tokens for Autoregressive Visual GenerationYuqing Wang, Zhijie Lin 0001, Yao Teng, Yuanzhi Zhu 0001, Shuhuai Ren, Jiashi Feng, Xihui Liu. 18596-18605 [doi]
- Di[M]O: Distilling Masked Diffusion Models Into One-Step GeneratorYuanzhi Zhu 0001, Xi Wang 0024, Stéphane Lathuilière, Vicky Kalogeiton. 18606-18618 [doi]
- Gain-MLP: Improving HDR Gain Map Encoding via a Lightweight MLPTrevor D. Canham, SaiKiran Kumar Tedla, Michael J. Murdoch, Michael S. Brown. 18619-18628 [doi]
- TrustMark: Robust Watermarking and Watermark Removal for Arbitrary Resolution ImagesTu Bui, Shruti Agarwal, John P. Collomosse. 18629-18639 [doi]
- Perceive, Understand and Restore: Real-World Image Super-Resolution with Autoregressive Multimodal Generative ModelsHongyang Wei, Shuaizheng Liu, Chun Yuan, Lei Zhang. 18640-18650 [doi]
- Dense2MoE: Restructuring Diffusion Transformer to MoE for Efficient Text-to-Image GenerationYouwei Zheng, Yuxi Ren, Xin Xia 0014, Xuefeng Xiao 0001, Xiaohua Xie. 18661-18670 [doi]
- Video-T1: Test-Time Scaling for Video GenerationFangfu Liu, Hanyang Wang 0003, Yimo Cai, Kaiyan Zhang, Xiaohang Zhan, Yueqi Duan. 18671-18681 [doi]
- Less-to-More Generalization: Unlocking More Controllability by In-Context GenerationShaojin Wu, Mengqi Huang, Wenxu Wu, Yufeng Cheng, Fei Ding, Qian He. 18682-18692 [doi]
- StyleSRN: Scene Text Image Super-Resolution with Text Style EmbeddingShengrong Yuan, Runmin Wang, Ke Hao, Xuqi Ma, Changxin Gao, Li Liu 0002, Nong Sang. 18693-18702 [doi]
- Sparse Fine-Tuning of Transformers for Generative TasksWei Chen 0124, Jingxi Yu, Zichen Miao, Qiang Qiu 0001. 18703-18713 [doi]
- FlexGen: Flexible Multi-View Generation from Text and Image InputsXinli Xu, Wenhang Ge, Jiantao Lin, Jiawei Feng, Lie Xu 0004, Hanfeng Zhao, Shunsi Zhang, Ying-Cong Chen. 18714-18724 [doi]
- Prompt-A-Video: Prompt your Video Diffusion Model via Preference-Aligned LLMYatai Ji, Jiacheng Zhang, Jie Wu 0001, Shilong Zhang, Shoufa Chen, Chongjian Ge, Peize Sun, Weifeng Chen, Wenqi Shao, Xuefeng Xiao 0001, Weilin Huang, Ping Luo 0002. 18725-18735 [doi]
- Learning Implicit Features with Flow-Infused Transformations for Realistic Virtual Try-OnDelong Zhang, Qiwei Huang, Yang Sun, Yuanliu Liu, Wei-Shi Zheng 0001, Pengfei Xiong, Wei Zhang 0009. 18736-18745 [doi]
- Aigi-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language ModelsZiyin Zhou, Yunpeng Luo, Yuanchen Wu, Ke Sun 0016, Jiayi Ji, Ke Yan, Shouhong Ding, Xiaoshuai Sun, Yunsheng Wu, Rongrong Ji. 18746-18758 [doi]
- Semantic Watermarking Reinvented: Enhancing Robustness and Generation Quality with Fourier IntegritySung-Ju Lee, Nam Ik Cho. 18759-18769 [doi]
- GigaTok: Scaling Visual Tokenizers to 3 Billion Parameters for Autoregressive Image GenerationTianwei Xiong, Jun Hao Liew, Zilong Huang, Jiashi Feng, Xihui Liu. 18770-18780 [doi]
- Collaborative Instance Object Navigation: Leveraging Uncertainty-Awareness to Minimize Human-Agent DialoguesFrancesco Taioli, Edoardo Zorzi, Gianni Franchi, Alberto Castellini, Alessandro Farinelli, Marco Cristani, Yiming Wang 0002. 18781-18792 [doi]
- ReasonVQA: A Multi-Hop Reasoning Benchmark with Structural Knowledge for Visual Question AnsweringDuong T. Tran, Trung-Kien Tran, Manfred Hauswirth, Danh Le Phuoc. 18793-18803 [doi]
- LOCATEdit: Graph Laplacian Optimized Cross Attention for Localized Text-Guided Image EditingAchint Soni, Meet Soni, Sirisha Rambhatla. 18804-18814 [doi]
- Region-Level Data Attribution for Text-To-Image Generative ModelsTrong Bang Nguyen, Phi-Le Nguyen, Simon Lucey, Minh Hoai. 18825-18833 [doi]
- Learned Image Compression with Hierarchical Progressive Context ModelingYuqi Li, Haotian Zhang, Li Li, Dong Liu. 18834-18843 [doi]
- Early Timestep Zero-Shot Candidate Selection for Instruction-Guided Image EditingJoowon Kim, Ziseok Lee, Donghyeon Cho, Sanghyun Jo, Yeonsung Jung, Kyungsu Kim, Eunho Yang. 18844-18854 [doi]
- GTR: Guided Thought Reinforcement Prevents Thought Collapse in RL-Based VLM Agent TrainingTong Wei, Yijun Yang, Junliang Xing, Yuanchun Shi, Zongqing Lu 0002, Deheng Ye. 18855-18865 [doi]
- Teleportraits: Training-Free People Insertion Into Any SceneJialu Gao, K. J. Joseph, Fernando De la Torre. 18866-18875 [doi]
- DCT-Shield: A Robust Frequency Domain Defense Against Malicious Image EditingAniruddha Bala, Rohit Chowdhury, Rohan Jaiswal, Siddharth Roheda. 18876-18884 [doi]
- Context Guided Transformer Entropy Modeling for Video CompressionJunlong Tong, Wei Zhang 0185, Yaohui Jin, Xiaoyu Shen 0001. 18885-18894 [doi]
- UIP2P: Unsupervised Instruction-Based Image Editing via Edit Reversibility ConstraintEnis Simsar, Alessio Tonioni, Yongqin Xian, Thomas Hofmann 0001, Federico Tombari. 18895-18905 [doi]
- CODA: Repurposing Continuous VAEs for Discrete TokenizationZeyu Liu, Zanlin Ni, Yeguo Hua, Xin Deng, Xiao Ma 0006, Cheng Zhong, Gao Huang 0001. 18906-18916 [doi]
- DiffDoctor: Diagnosing Image Diffusion Models Before TreatingYiyang Wang, Xi Chen 0119, Xiaogang Xu 0002, Sihui Ji, Yu Liu 0063, Yujun Shen, Hengshuang Zhao. 18917-18926 [doi]
- LEGION: Learning to Ground and Explain for Synthetic Image DetectionHengrui Kang, Siwei Wen, Zichen Wen, Junyan Ye, Weijia Li, Peilin Feng, Baichuan Zhou, Bin Wang 0065, Dahua Lin, Linfeng Zhang 0001, Conghui He. 18937-18947 [doi]
- DiT4SR: Taming Diffusion Transformer for Real-World Image Super-ResolutionZheng-Peng Duan, Jiawei Zhang 0002, Xin Jin 0005, Ziheng Zhang, Zheng Xiong, Dongqing Zou, Jimmy S. Ren, Chunle Guo, Chongyi Li. 18948-18958 [doi]
- Bi-Level Optimization for Self-Supervised AI-Generated Face DetectionMian Zou, Nan Zhong, Baosheng Yu, Yibing Zhan, Kede Ma. 18959-18968 [doi]
- VisualCloze: A Universal Image Generation Framework via Visual in-Context LearningZhong-Yu Li, Ruoyi Du, Juncheng Yan, Le Zhuo, Zhen Li, Peng Gao 0007, Zhanyu Ma, Ming-Ming Cheng. 18969-18979 [doi]
- From Imitation to Innovation: The Emergence of Ai's Unique Artistic Styles and the Challenge of Copyright ProtectionZexi Jia, Chuanwei Huang, Yeshuang Zhu, Hongyan Fei, Ying Deng, Zhiqiang Yuan, Jiapei Zhang, Jinchao Zhang 0001, Jie Zhou 0016. 18980-18989 [doi]
- AnyPortal: Zero-Shot Consistent Video Background ReplacementWenshuo Gao, Xicheng Lan, Shuai Yang 0001. 18990-18999 [doi]
- Neighboring Autoregressive Modeling for Efficient Visual GenerationYefei He, Yuanyu He, Shaoxuan He, Feng Chen, Hong Zhou, Kaipeng Zhang, Bohan Zhuang. 19000-19010 [doi]
- FastVAR: Linear Visual Autoregressive Modeling Via Cached Token PruningHang Guo 0002, Yawei Li 0001, Taolin Zhang 0003, Jiangshan Wang, Tao Dai 0001, Shu-Tao Xia, Luca Benini. 19011-19021 [doi]
- Enhancing Reward Models for High-Quality Image Generation: Beyond Text-Image AlignmentYing Ba, Tianyu Zhang, Yalong Bai, Wenyi Mo, Tao Liang, Bing Su 0001, Ji-Rong Wen. 19022-19031 [doi]
- Tune-Your-Style: Intensity-Tunable 3D Style Transfer with Gaussian SplattingYian Zhao, Rushi Ye, Ruochong Zheng, Zesen Cheng, Chaoran Feng, Jiashu Yang, Pengchong Qiao, Chang Liu, Jie Chen 0001. 19032-19042 [doi]
- QK-Edit: Revisiting Attention-based Injection in MM-DiT for Image and Video EditingTiancheng Shen, Zilong Huang, Xiangtai Li, Zhijie Lin 0001, Jiyang Liu, Yitong Wang, Jiashi Feng, Ming-Hsuan Yang 0001, Jun Hao Liew. 19043-19053 [doi]
- Beyond Isolated Words: Diffusion Brush for Handwritten Text-Line GenerationGang Dai 0002, Yifan Zhang 0004, Yutao Qin, Qiangya Guo, Shuangping Huang, Shuicheng Yan. 19054-19064 [doi]
- BadVideo: Stealthy Backdoor Attack Against Text-to-Video GenerationRuotong Wang 0008, Mingli Zhu, Jiarong Ou, Rui Chen, Xin Tao 0001, Pengfei Wan 0001, Baoyuan Wu. 19075-19084 [doi]
- Any2anytryon: Leveraging Adaptive Position Embeddings for Versatile Virtual Clothing TasksHailong Guo, Bohan Zeng, Yiren Song, Wentao Zhang 0001, Jiaming Liu, Chuang Zhang. 19085-19096 [doi]
- FICGen: Frequency-Inspired Contextual Disentanglement for Layout-driven Degraded Image GenerationWenzhuang Wang, Yifan Zhao, Mingcan Ma, Ming Liu, Zhonglin Jiang, Yong Chen, Jia Li. 19097-19107 [doi]
- An Empirical Study of Autoregressive Pre-Training from VideosJathushan Rajasegaran, Ilija Radosavovic, Rahul Ravishankar, Yossi Gandelsman, Christoph Feichtenhofer, Jitendra Malik. 19108-19118 [doi]
- Blended Point Cloud Diffusion for Localized Text-Guided Shape EditingEtai Sella, Noam Atia, Ron Mokady, Hadar Averbuch-Elor. 19119-19129 [doi]
- Training-Free Geometric Image Editing on Diffusion ModelsHanshen Zhu, Zhen Zhu 0006, Kaile Zhang, Yiming Gong, Yuliang Liu, Xiang Bai. 19130-19140 [doi]
- Video Color Grading via Look-Up Table GenerationSeungHyun Shin, Dongmin Shin, Jisu Shin 0002, Hae-Gon Jeon, Joon-Young Lee. 19141-19152 [doi]
- VSC: Visual Search Compositional Text-to-Image Diffusion ModelDo Huu Dat, Nam Hyeon-Woo, Po Yuan Mao, Tae Hyun Oh. 19153-19162 [doi]
- Videoauteur: Towards Long Narrative Video GenerationJunfei Xiao, Feng Cheng, Lu Qi, Liangke Gui, Yang Zhao 0003, Shanchuan Lin, Jiepeng Cen, Zhibei Ma, Alan L. Yuille, Lu Jiang. 19163-19173 [doi]
- Fine-Tuning Visual Autoregressive Models for Subject-Driven GenerationJiwoo Chung, Sangeek Hyun, Hyunjun Kim, Eunseo Koh, Minkyu Lee, Jae-Pil Heo. 19174-19184 [doi]
- Frequency-Guided Diffusion for Training-Free Text-Driven Image TranslationZheng Gao 0003, Jifei Song, Zhensong Zhang, Jiankang deng, Ioannis Patras. 19195-19205 [doi]
- SuperEdit: Rectifying and Facilitating Supervision for Instruction-Based Image EditingMing Li 0010, Xin Gu, Fan Chen, Xiaoying Xing, Longyin Wen, Chen Chen 0001, Sijie Zhu. 19206-19215 [doi]
- Pretrained Reversible Generation as Unsupervised Visual Representation LearningRongkun Xue, Jinouwen Zhang, Yazhe Niu, Dazhong Shen, Bingqi Ma, Yu Liu 0015, Jing Yang. 19216-19226 [doi]
- DLF: Extreme Image Compression with Dual-Generative Latent FusionNaifu Xue, Zhaoyang Jia, Jiahao Li, Bin Li, Yuan Zhang, Yan Lu. 19227-19236 [doi]
- REDUCIO! Generating 1K Video Within 16 Seconds Using Extremely Compressed Motion LatentsRui Tian, Qi Dai 0001, Jianmin Bao, Kai Qiu, Yifan Yang 0004, Chong Luo 0001, Zuxuan Wu, Yu-Gang Jiang 0001. 19237-19247 [doi]
- Tracing Copied Pixels and Regularizing Patch Affinity in Copy DetectionYichen Lu, Siwei Nie, Minlong Lu, Xudong Yang, Xiaobo Zhang, Peng Zhang. 19248-19257 [doi]
- Beyond Brain Decoding: Visual-Semantic Reconstructions to Mental Creation Extension Based on fMRIHaodong Jing, Dongyao Jiang, Yongqiang Ma, Haibo Hua, Bo Huang, Nanning Zheng 0001. 19258-19268 [doi]
- PixTalk: Controlling Photorealistic Image Processing and Editing with LanguageMarcos V. Conde, Zihao Lu, Radu Timofte. 19269-19279 [doi]
- ADCD-Net: Robust Document Image Forgery Localization via Adaptive DCT Feature and Hierarchical Content DisentanglementKahim Wong, Jicheng Zhou, Haiwei Wu, Yain-Whar Si, Jiantao Zhou 0001. 19280-19289 [doi]
- Towards Robust Defense Against Customization via Protective Perturbation Resistant to Diffusion-based PurificationWenkui Yang, Jie Cao 0002, Junxian Duan, Ran He 0001. 19290-19300 [doi]
- A Unified Framework for Industrial Cel-Animation Colorization with Temporal-Structural AwarenessXiaoyi Feng, Tao Huang, Peng Wang 0168, Zizhou Huang, Haihang Zhang, Yuntao Zou, Dagang Li 0001, Kaifeng Zou. 19301-19310 [doi]
- VQ-SGen: A Vector Quantized Stroke Representation for Creative Sketch GenerationJiawei Wang, Zhiming Cui, Changjian Li. 19311-19320 [doi]
- SEGA: A Stepwise Evolution Paradigm for Content-Aware Layout Generation with Design PriorHaoran Wang, Bo Zhao, Jinghui Wang, Hanzhang Wang, Huan Yang, Wei Ji, Hao Liu, Xinyan Xiao. 19321-19330 [doi]
- RAGD: Regional-Aware Diffusion Model for Text-to-Image GenerationZhennan Chen, Yajie Li, Haofan Wang, Zhibo Chen 0011, Zhengkai Jiang 0003, Jun Li, Qian Wang, Jian Yang, Ying Tai. 19331-19341 [doi]
- Engage for All: Making Ordinary Image Descriptions Appealing Again!Yuyan Chen, Yifan Jiang, Li Zhou, Jinghan Cao, Yu Guan, Ming-Hsuan Yang 0001, Qing Guo 0005. 19342-19352 [doi]
- Omegance: A Single Parameter for Various Granularities in Diffusion-Based SynthesisXinyu Hou, Zongsheng Yue, Xiaoming Li 0002, Chen Change Loy. 19353-19362 [doi]
- Generative Video Bi-FlowChen Liu 0029, Tobias Ritschel 0001. 19363-19372 [doi]
- AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video GenerationMoayed Haji Ali, Willi Menapace, Aliaksandr Siarohin, Ivan Skorokhodov, Alper Canberk, Kwot Sin Lee, Vicente Ordonez, Sergey Tulyakov. 19373-19385 [doi]
- CHORDS: Diffusion Sampling Accelerator with Multi-Core Hierarchical ODE SolversJiaqi Han, Haotian Ye, Puheng Li, Minkai Xu, James Zou 0001, Stefano Ermon. 19386-19395 [doi]
- T2I-Copilot: A Training-Free Multi-Agent Text-to-Image System for Enhanced Prompt Interpretation and Interactive GenerationChieh-Yun Chen, Min Shi, Gong Zhang 0011, Humphrey Shi. 19396-19405 [doi]
- PersonalVideo: High ID-Fidelity Video Customization without Dynamic and Semantic DegradationHengjia Li, Haonan Qiu, Shiwei Zhang 0001, Xiang Wang 0012, Yujie Wei 0001, Zekun Li, Yingya Zhang, Boxi Wu, Deng Cai 0001. 19406-19416 [doi]
- CopyrightShield: Enhancing Diffusion Model Security Against Copyright Infringement AttacksZhixiang Guo, Siyuan Liang 0004, Aishan Liu, Dacheng Tao. 19417-19426 [doi]
- Unified Visual Generation via Next-Set Prediction in Continuous DomainZhanzhou Feng, Qingpei Guo, Xinyu Xiao, Ruihan Xu 0002, Ming Yang 0007, Shiliang Zhang. 19427-19438 [doi]
- When and Where Do Data Poisons Attack Textual Inversion?Jeremy Styborski, Mingzhi Lyu, Jiayou Lu, Nupur Kapur, Adams Wai-Kin Kong. 19439-19449 [doi]
- Mobile Video DiffusionHaitam Ben Yahia, Denis Korzhenkov, Ioannis Lelekas, Amir Ghodrati, AmirHossein Habibian. 19450-19460 [doi]
- LayerLock: Non-Collapsing Representation Learning with Progressive FreezingGoker Erdogan, Nikhil Parthasarathy, Catalin Ionescu, Drew A. Hudson, Alexander Lerchner, Andrew Zisserman, Mehdi S. M. Sajjadi, João Carreira 0001. 19461-19470 [doi]
- Flow to the Mode: Mode-Seeking Diffusion Autoencoders for State-of-the-Art Image TokenizationKyle Sargent, Kyle Hsu, Justin Johnson 0001, Li Fei-Fei 0001, Jiajun Wu 0001. 19471-19481 [doi]
- Adaptive Routing of Text-to-Image Generation Requests between Large Cloud Model and Light-Weight Edge ModelZewei Xin, Qinya Li, Chaoyue Niu, Fan Wu 0006, Guihai Chen. 19482-19491 [doi]
- Exploring Multimodal Diffusion Transformers for Enhanced Prompt-Based Image EditingJoonghyuk Shin, Alchan Hwang, Yujin Kim, Daneul Kim, Jaesik Park. 19492-19502 [doi]
- JPEG Processing Neural Operator for Backward-Compatible CodingWoo Kyoung Han, Yongjun Lee, Byeonghun Lee, Sanghyun Park 0004, Sunghoon Im 0001, Kyong Hwan Jin. 19503-19512 [doi]
- EasyControl: Adding Efficient and Flexible Control for Diffusion TransformerYuxuan Zhang 0001, Yirui Yuan, Yiren Song, Haofan Wang, Jiaming Liu. 19513-19524 [doi]
- All Parts Matter: A Unified Mask-Free Virtual Try-On FrameworkChenghu Du, Shengwu Xiong 0001, Yi Rong. 19525-19534 [doi]
- Function-Centric Bayesian Network for Zero-Shot Object Goal NavigationSixian Zhang, Xinyao Yu 0002, Xinhang Song, Yiyao Wang, Shuqiang Jiang. 19535-19545 [doi]
- Attention to Neural Plagiarism: Diffusion Models Can Plagiarize Your Copyrighted Images!Zihang Zou, Boqing Gong, Liqiang Wang 0001. 19546-19556 [doi]
- Distilling Parallel Gradients for Fast ODE Solvers of Diffusion ModelsBeier Zhu, Ruoyu Wang, Tong Zhao, Hanwang Zhang, Chi Zhang 0067. 19557-19566 [doi]
- Advancing Text-to-3D Generation with Linearized Lookahead Variational Score DistillationYu Lei, Bingde Liu, Qingsong Xie, Haonan Lu, Zhijie Deng. 19567-19576 [doi]
- SuMa: A Subspace Mapping Approach for Robust and Effective Concept Erasure in Text-to-Image Diffusion ModelsKien Nguyen, Anh Tran 0001, Cuong Pham 0001. 19587-19596 [doi]
- LATINO-PRO: Latent Consistency Inverse Solver with Prompt OptimizationAlessio Spagnoletti, Jean Prost, Andrés Almansa, Nicolas Papadakis, Marcelo Pereyra. 19597-19607 [doi]
- Edit: Efficient Diffusion Transformers with Linear Compressed AttentionPhilipp Becker, Abhinav Mehrotra, Ruchika Chavhan, Malcolm Chadwick, Luca Morreale, Mehdi Noroozi, Alberto Gil C. P. Ramos, Sourav Bhattacharya. 19608-19616 [doi]
- Hate in Plain Sight: On the Risks of Moderating AI-Generated Hateful IllusionsYiting Qu, Ziqing Yang 0002, Yihan Ma 0001, Michael Backes 0001, Savvas Zannettou, Yang Zhang 0016. 19617-19627 [doi]
- Multimodal LLMs as Customized Reward Models for Text-to-Image GenerationShijie Zhou 0008, Ruiyi Zhang 0002, Huaisheng Zhu, Branislav Kveton, Yufan Zhou 0001, Jiuxiang Gu, Jian Chen 0043, Changyou Chen. 19638-19648 [doi]
- MH-LVC: Multi-Hypothesis Temporal Prediction for Learned Conditional Residual Video CodingHuu Tai Phung, Zong-Lin Gao, Yi-Chen Yao, Kuan-Wei Ho, Yi-Hsin Chen, Yu-Hsiang Lin, Alessandro Gnutti, Wen-Hsiao Peng. 19649-19658 [doi]
- Sculpting Memory: Multi-Concept Forgetting in Diffusion Models via Dynamic Mask and Concept-Aware OptimizationGen Li 0012, Yang Xiao, Jie Ji, Kaiyuan Deng, Bo Hui 0001, Linke Guo, Xiaolong Ma. 19659-19668 [doi]
- Depth AnyEvent: A Cross-Modal Distillation Paradigm for Event-Based Monocular Depth EstimationLuca Bartolomei 0001, Enrico Mannocci, Fabio Tosi, Matteo Poggi, Stefano Mattoccia. 19669-19678 [doi]
- LaRender: Training-Free Occlusion Control in Image Generation via Latent RenderingXiaohang Zhan, Dingming Liu. 19679-19688 [doi]
- MikuDance: Animating Character Art With Mixed Motion DynamicsJiaxu Zhang, Xianfang Zeng, Xin Chen 0040, Wei Zuo, Gang Yu 0002, Zhigang Tu 0001. 19689-19699 [doi]
- Diffusion Transformer Meets Multi-Level Wavelet Spectrum for Single Image Super-ResolutionPeng Du, Hui Li, Han Xu, Paul Barom Jeon, Dongwook Lee, Daehyun Ji, Ran Yang, Feng Zhu. 19700-19710 [doi]
- LOTS of Fashion! Multi-Conditioning for Image Generation via Sketch-Text PairingFederico Girella, Davide Talon, Ziyue Liu, Zanxi Ruan, Yiming Wang 0002, Marco Cristani. 19711-19720 [doi]
- Flowedit: Inversion-Free Text-Based Editing Using Pre-Trained Flow ModelsVladimir Kulikov 0001, Matan Kleiner, Inbar Huberman-Spiegelglas, Tomer Michaeli. 19721-19730 [doi]
- LayerTracer: Cognitive-Aligned Layered SVG Synthesis via Diffusion TransformerYiren Song, Danze Chen, Mike Zheng Shou. 19731-19741 [doi]
- ROAR: Reducing Inversion Error in Generative Image WatermarkingHanyi Wang, Han Fang, Shi-Lin Wang, Ee-Chien Chang. 19742-19751 [doi]
- Moto: Latent Motion Token as the Bridging Language for Learning Robot Manipulation from VideosYi Chen 0019, Yuying Ge, Weiliang Tang, Yizhuo Li 0001, Yixiao Ge, Mingyu Ding, Ying Shan, Xihui Liu. 19752-19763 [doi]
- Automated Model Evaluation for Object Detection Via Prediction Consistency and ReliabilitySeungju Yoo, Hyuk Kwon, Joong-Won Hwang, Kibok Lee 0003. 19764-19773 [doi]
- MIORe & VAR-MIORe: Benchmarks to Push the Boundaries of RestorationGeorge Ciubotariu, Zhuyun Zhou, Zongwei Wu, Radu Timofte. 19784-19793 [doi]
- Soft Local Completeness: Rethinking Completeness in XAIZiv Weiss Haddad, Oren Barkan, Yehonatan Elisha, Noam Koenigstein. 19794-19804 [doi]
- On the Provable Importance of Gradients for Autonomous Language-Assisted Image ClusteringBo Peng, Jie Lu 0001, Guangquan Zhang 0001, Zhen Fang 0001. 19805-19815 [doi]
- Inter2Former: Dynamic Hybrid Attention for Efficient High-Precision Interactive SegmentationYou Huang, Lichao Chen, Jiayi Ji, Liujuan Cao, Shengchuan Zhang, Rongrong Ji. 19816-19826 [doi]
- ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language TrackingXiaokun Feng, Shiyu Hu, Xuchen Li 0001, Dailing Zhang, Meiqi Wu, Jing Zhang 0110, Xiaotang Chen, Kaiqi Huang. 19850-19861 [doi]
- HiERO: Understanding the Hierarchy of Human Behavior Enhances Reasoning on Egocentric VideosSimone Alberto Peirone, Francesca Pistilli, Giuseppe Averta. 19862-19871 [doi]
- CaptionSmiths: Flexibly Controlling Language Pattern in Image CaptioningKuniaki Saito, Donghyun Kim 0006, KwanYong Park, Atsushi Hashimoto 0001, Yoshitaka Ushiku. 19872-19881 [doi]
- Multi-Modal Segment Anything Model for Camouflaged Scene SegmentationGuangyu Ren, Hengyan Liu, Michalis Lazarou, Tania Stathaki. 19882-19892 [doi]
- OracleFusion: Assisting the Decipherment of Oracle Bone Script with Structurally Constrained Semantic TypographyCaoshuo Li, Zengmao Ding, Xiaobin Hu, Bang Li, Donghao Luo 0001, AndyPian Wu, Chaoyang Wang, Chengjie Wang 0001, Taisong Jin, SevenShu, Yunsheng Wu, Yongge Liu, Rongrong Ji. 19893-19902 [doi]
- MRGen: Segmentation Data Engine for Underrepresented MRI ModalitiesHaoning Wu, Ziheng Zhao, Ya Zhang, Yanfeng Wang, Weidi Xie. 19903-19913 [doi]
- An Efficient Hybrid Vision Transformer for Tinyml ApplicationsFanhong Zeng, Huanan Li, Juntao Guan, Rui Fan 0001, Tong Wu, Xilong Wang, Rui Lai. 19914-19924 [doi]
- Graph Domain Adaptation With Dual-Branch Encoder and Two-Level Alignment for Whole Slide Image-Based Survival PredictionYuntao Shou, Xiangyong Cao, Peiqiang Yan, Qiaohui, Qian Zhao 0002, Deyu Meng. 19925-19935 [doi]
- DeRIS: Decoupling Perception and Cognition for Enhanced Referring Image Segmentation Through Loopback SynergyMing Dai, Wenxuan Cheng, Jiang-Jiang Liu 0001, Sen Yang, Wenxiao Cai, Yanpeng Sun, Wankou Yang. 19936-19946 [doi]
- Pretend Benign: A Stealthy Adversarial Attack by Exploiting Vulnerabilities in Cooperative PerceptionHongwei Lin, Dongyu Pan, Qiming Xia, Hai Wu, Cheng Wang 0003, Siqi Shen, Chenglu Wen. 19947-19956 [doi]
- CoraLSRT: Revisiting Coral Reef Semantic Segmentation by Feature Rectification via Self-Supervised GuidanceZiqiang Zheng, Yuk-Kwan Wong, Binh-Son Hua, Jianbo Shi, Sai Kit Yeung. 19967-19977 [doi]
- CNS-Bench: Benchmarking Image Classifier Robustness Under Continuous Nuisance ShiftsOlaf Dünkel, Artur Jesslen, Jiahao Xie, Christian Theobalt, Christian Rupprecht 0001, Adam Kortylewski. 19978-19988 [doi]
- Visual Test-Time Scaling for GUI Agent GroundingTiange Luo, Lajanugen Logeswaran, Justin Johnson 0001, Honglak Lee. 19989-19998 [doi]
- Multi-Schema Proximity Network for Composed Image RetrievalJiangming Shi, Xiangbo Yin, Yeyun Chen, Yachao Zhang 0001, Zhizhong Zhang 0001, Yuan Xie, Yanyun Qu. 19999-20008 [doi]
- ReferDINO: Referring Video Object Segmentation with Visual Grounding FoundationsTianming Liang, Kun-Yu Lin, Chaolei Tan, Jianguo Zhang 0001, Wei-Shi Zheng 0001, Jian-Fang Hu. 20009-20019 [doi]
- GECKO: Gigapixel Vision-Concept Contrastive Pretraining in HistopathologySaarthak Kapse, Pushpak Pati, Srikar Yellapragada, Srijan Das, Rajarsi R. Gupta, Joel H. Saltz, Dimitris Samaras, Prateek Prasanna. 20020-20030 [doi]
- Lumina-Image 2.0: a Unified and Efficient Image Generative FrameworkQi Qin, Le Zhuo, Yi Xin 0003, Ruoyi Du, Zhen Li 0026, Bin Fu, Yiting Lu, Xinyue Li 0001, Dongyang Liu, Xiangyang Zhu, Will Beddow, Erwann Millon, Victor Perez 0005, Wenhai Wang, Yu Qiao 0001, Bo Zhang 0069, Xiaohong Liu 0001, Hongsheng Li 0001, Chang Xu, Peng Gao 0007. 20031-20042 [doi]
- DiSCO-3D : Discovering and Segmenting Sub-Concepts from Open-Vocabulary Queries in NeRFDoriand Petit, Steve Bourgeois, Vincent Gay-Bellile, Florian Chabot, Loïc Barthe. 20043-20052 [doi]
- ESCNet: Edge-Semantic Collaborative Network for Camouflaged Object DetectionSheng Ye, Xin Chen 0032, Yan Zhang 0109, Xianming Lin, Liujuan Cao. 20053-20063 [doi]
- Growing a Twig to Accelerate Large Vision-Language ModelsZhenwei Shao, Mingyang Wang, Zhou Yu 0001, Wenwen Pan 0003, Yan Yang, Tao Wei, Hongyuan Zhang 0001, Ning Mao, Wei Chen 0001, Jun Yu 0002. 20064-20074 [doi]
- Test-time Adaptation for Foundation Medical Segmentation Model without Parametric UpdatesKecheng Chen, Xinyu Luo, Tiexin Qin, Jie Liu 0044, Hui Liu 0036, Victor Ho-fun Lee, Hong Yan 0001, Haoliang Li. 20075-20084 [doi]
- ResQ: A Novel Framework to Implement Residual Neural Networks on Analog Rydberg Atom Quantum ComputersNicholas S. DiBrita, Jason Han, Tirthak Patel. 20085-20094 [doi]
- What's Making That Sound Right Now? Video-Centric Audio-Visual LocalizationHahyeon Choi, Junhoo Lee, Nojun Kwak. 20095-20104 [doi]
- Task Vector Quantization for Memory-Efficient Model MergingYoungeun Kim, Seunghwan Lee, Aecheon Jung, Bogon Ryu, Sungeun Hong. 20105-20115 [doi]
- Bilateral Collaboration with Large Vision-Language Models for Open Vocabulary Human-Object Interaction DetectionYupeng Hu 0005, Changxing Ding, Chang Sun, Shaoli Huang, Xiangmin Xu. 20126-20136 [doi]
- SVTRv2: CTC Beats Encoder-Decoder Models in Scene Text RecognitionYongkun Du, Zhineng Chen, Hongtao Xie, Caiyan Jia, Yu-Gang Jiang 0001. 20147-20156 [doi]
- ProbMED: A Probabilistic Framework for Medical Multimodal BindingYuan Gao 0047, Sangwook Kim, Jianzhong You, Chris McIntosh. 20157-20167 [doi]
- VCA: Video Curious Agent for Long Video UnderstandingZeyuan Yang 0002, Delin Chen, Xueyang Yu, Maohao Shen, Chuang Gan 0001. 20168-20179 [doi]
- AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and PruningYiwu Zhong, Zhuoming Liu, Yin Li, Liwei Wang. 20180-20192 [doi]
- Instructseg: Unifying Instructed Visual Segmentation with Multi-Modal Large Language ModelsCong Wei, Yujie Zhong, Haoxian Tan, Yingsen Zeng, Yong Liu 0033, Hongfa Wang, Yujiu Yang 0001. 20193-20203 [doi]
- ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image GenerationCihang Peng, Qiming Hou, Zhong Ren 0001, Kun Zhou 0001. 20204-20214 [doi]
- Aligning Moments in Time Using Video QueriesYogesh Kumar 0004, Uday Agarwal, Manish Gupta 0001, Anand Mishra 0001. 20215-20225 [doi]
- 4M: Boosting Semi-Supervised Instance Segmentation with SAMHeeji Yoon, Heeseong Shin, Eunbeen Hong, Hyunwook Choi, Hansang Cho, Daun Jeong, Seungryong Kim. 20226-20236 [doi]
- LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM AgentsBoyu Chen, Zhengrong Yue, Siran Chen, Zikang Wang, Yang Liu, Peng Li, Yali Wang. 20237-20246 [doi]
- Pruning All-Rounder: Rethinking and Improving Inference Efficiency for Large Vision Language ModelsWei Suo, Ji Ma 0008, Mengyang Sun, Lin Yuanbo Wu, Peng Wang 0015, Yanning Zhang 0001. 20247-20256 [doi]
- Structure-Aware Semantic Discrepancy and Consistency for 3D Medical Image Self-Supervised LearningTan Pan, Zhaorui Tan, Kaiyu Guo, Dongli Xu, Weidi Xu, Chen Jiang 0006, Xin Guo 0010, Yuan Qi 0001, Yuan Cheng. 20257-20267 [doi]
- Ensemble Foreground Management for Unsupervised Object DiscoveryZiling Wu, Armaghan Moemeni, Praminda Caleb-Solly. 20268-20279 [doi]
- ARGUS: Hallucination and Omission Evaluation in Video-LLMsRuchit Rawal, Reza Shirkavand, Heng Huang 0001, Gowthami Somepalli, Tom Goldstein. 20280-20290 [doi]
- Feature Purification Matters: Suppressing Outlier Propagation for Training-Free Open-Vocabulary Semantic SegmentationShuo Jin, Siyue Yu, Bingfeng Zhang, Mingjie Sun, Yi Dong, Jimin Xiao. 20291-20300 [doi]
- Leveraging Prior Knowledge of Diffusion Model for Person SearchGiyeol Kim, Sooyoung Yang, Jihyong Oh, Myungjoo Kang, Chanho Eom. 20301-20312 [doi]
- Mind the Gap: Aligning Vision Foundation Models to Image Feature MatchingYuhan Liu 0006, Jingwen Fu, Yang Wu 0001, Kangyi Wu, Pengna Li, Jiayi Wu 0002, Sanping Zhou, Jingmin Xin. 20313-20323 [doi]
- COIN: Confidence Score-Guided Distillation for Annotation-Free Cell SegmentationSanghyun Jo, Seo Jin Lee, Seungwoo Lee, Seohyung Hong, Hyungseok Seo, Kyungsu Kim. 20324-20335 [doi]
- UniDxMD: Towards Unified Representation for Cross-Modal Unsupervised Domain Adaptation in 3D Semantic SegmentationZhengyin Liang, Hui Yin, Min Liang, Qianqian Du, Ying Yang, Hua Huang. 20346-20356 [doi]
- Two Losses, One Goal: Balancing Conflict Gradients for Semi-Supervised Semantic SegmentationRui Sun, Huayu Mai, Wangkai Li, Yujia Chen, Yuan Wang. 20357-20367 [doi]
- Learn2Synth: Learning Optimal Data Synthesis Using Hypergradients for Brain Image SegmentationXiaoling Hu 0002, Xiangrui Zeng, Oula Puonti, Juan Eugenio Iglesias, Bruce Fischl, Yaël Balbastre. 20368-20378 [doi]
- Bridging the Gap Between Ideal and Real-World Evaluation: Benchmarking AI-Generated Image Detection in Challenging ScenariosChunxiao Li, Xiaoxiao Wang, Meiling Li, Boming Miao, Peng Sun, Yunjian Zhang, Xiangyang Ji, Yao Zhu 0003. 20379-20389 [doi]
- ATAS: Any-to-Any Self-Distillation for Enhanced Open-Vocabulary Dense PredictionJuan Yeo, Soonwoo Cha, Jiwoo Song, Hyunbin Jin, Taesup Kim. 20390-20400 [doi]
- VideoOrion: Tokenizing Object Dynamics in VideosYicheng Feng, Yijiang Li, Wanpeng Zhang 0002, Sipeng Zheng, Hao Luo 0011, Zihao Yue, Zongqing Lu 0002. 20401-20412 [doi]
- Leveraging Debiased Cross-Modal Attention Maps and Code-Based Reasoning for Zero-Shot Referring Expression ComprehensionJuntao Chen, Wen Shen, Zhihua Wei, Lijun Sun, Hongyun Zhang. 20413-20424 [doi]
- ReMP-AD: Retrieval-Enhanced Multi-Modal Prompt Fusion for Few-Shot Industrial Visual Anomaly DetectionHongchi Ma, Guanglei Yang, Debin Zhao, Yanli Ji, Wangmeng Zuo. 20425-20434 [doi]
- Beyond Simple Edits: Composed Video Retrieval with Dense ModificationsOmkar Thawakar, Dmitry Demidov, Ritesh Thawkar, Rao Muhammad Anwer, Mubarak Shah, Fahad Shahbaz Khan, Salman Khan 0001. 20435-20444 [doi]
- Optimal Transport for Brain-Image Alignment: Unveiling Redundancy and Synergy in Neural Information ProcessingYang Xiao, Wang Lu, Jie Ji, Ruimeng Ye, Gen Li 0012, Xiaolong Ma, Bo Hui 0001. 20445-20455 [doi]
- Representation Shift: Unifying Token Compression with FlashattentionJoonmyung Choi, Sanghyeok Lee, Byungoh Ko, Eunseo Kim, Jihyung Kil, Hyunwoo J. Kim. 20456-20466 [doi]
- ZipVL: Accelerating Vision-Language Models Through Dynamic Token SparsityYefei He, Feng Chen, Jing Liu, Wenqi Shao, Hong Zhou, Kaipeng Zhang, Bohan Zhuang. 20477-20486 [doi]
- LaCoOT: Layer Collapse through Optimal TransportVictor Quétu, Zhu Liao, Nour Hezbri, Fabio Pizzati, Enzo Tartaglione. 20497-20507 [doi]
- Zero-Shot Compositional Video Learning with Coding Rate ReductionHeeSeok Jung, Jun-Hyeon Bak, Yujin Jeong, Gyugeun Lee, Jinwoo Ahn, Eun-Sol Kim. 20508-20518 [doi]
- DictAS: A Framework for Class-Generalizable Few-Shot Anomaly Segmentation via Dictionary LookupZhen Qu, Xian Tao, Xinyi Gong, Shichen Qu, Xiaopei Zhang, Xingang Wang, Fei Shen 0002, Zhengtao Zhang, Mukesh Prasad, Guiguang Ding. 20519-20528 [doi]
- End-to-End Multi-Modal Diffusion MambaChunhao Lu, Qiang Lu 0005, Meichen Dong, Jake Luo. 20529-20540 [doi]
- Vid-Group: Temporal Video Grounding Pretraining from Unlabeled Videos in the WildPeijun Bao, Chenqi Kong, Siyuan Yang 0001, Zihao Shao, Xinghao Jiang, Boon Poh Ng, Meng Hwa Er, Alex ChiChung Kot. 20541-20550 [doi]
- 2SF: Geometry-Guided Score Fusion for Multimodal Industrial Anomaly DetectionChengyu Tao, Xuanming Cao, Juan Du. 20551-20560 [doi]
- Balancing Conservatism and Aggressiveness: Prototype-Affinity Hybrid Network for Few-Shot SegmentationTianyu Zou, Shengwu Xiong 0001, Ruilin Yao, Yi Rong. 20561-20571 [doi]
- Fuzzy Contrastive Decoding to Alleviate Object Hallucination in Large Vision-Language ModelsJieun Kim, Jinmyeong Kim, Yoonji Kim, Sung-Bae Cho. 20572-20581 [doi]
- BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language ModelsJianting Tang, Yubo Wang, Haoyu Cao, Linli Xu. 20582-20592 [doi]
- NETracer: A Topology-Aware Iterative Tracing Approach for Tubular Structure ExtractionChao Liu 0043, Yangbo Jiang, Nenggan Zheng. 20593-20602 [doi]
- Robust Machine Unlearning for Quantized Neural Networks via Adaptive Gradient Reweighting with Similar LabelsYujia Tong, Yuze Wang 0011, Jingling Yuan, Chuang Hu. 20603-20612 [doi]
- Semantics Versus Identity: A Divide-and-Conquer Approach Towards Adjustable Medical Image De-IdentificationYuan Tian 0017, Shuo Wang, Rongzhao Zhang, Zijian Chen 0001, Yankai Jiang 0003, Chunyi Li, Xiangyang Zhu, Fang Yan 0002, Qiang Hu 0003, Xiaosong Wang 0001, Guangtao Zhai. 20613-20625 [doi]
- Towards Video Thinking Test: A Holistic Benchmark for Advanced Video Reasoning and UnderstandingYuanhan Zhang, Yunice Chew, Yuhao Dong, Aria Leo, Bo Hu, Ziwei Liu. 20626-20636 [doi]
- MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video ParsingLangyu Wang, Bingke Zhu, Yingying Chen 0003, Yiyuan Zhang, Ming Tang 0001, Jinqiao Wang. 20637-20646 [doi]
- Cross-View Isolated Sign Language Recognition via View Synthesis and Feature DisentanglementXin Shen, Xinyu Wang, Lei Shen, Kaihao Zhang, Xin Yu 0002. 20647-20657 [doi]
- Enhancing Prompt Generation with Adaptive Refinement for Camouflaged Object DetectionXuehan Chen, Guangyu Ren, Tianhong Dai, Tania Stathaki, Hengyan Liu. 20672-20682 [doi]
- Factorized Learning for Temporally Grounded Video-Language ModelsWenzheng Zeng, Difei Gao, Mike Zheng Shou, Hwee Tou Ng. 20683-20693 [doi]
- FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long TextBingchao Wang, Zhiwei Ning, Jianyu Ding, Xuanang Gao, Yin Li, Dongsheng Jiang, Jie Yang, Wei Liu. 20694-20704 [doi]
- G2PDiffusion: Cross-Species Genotype-to-Phenotype Prediction Via Evolutionary DiffusionMengdi Liu, Zhangyang Gao, Hong Chang 0001, Stan Z. Li, Shiguang Shan, Xilin Chen 0001. 20705-20714 [doi]
- Open-Ended Hierarchical Streaming Video Understanding with Vision Language ModelsHyolim Kang, Yunsu Park, Youngbeom Yoo, Yeeun Choi, Seon Joo Kim. 20715-20725 [doi]
- MOBIUS: Big-to-Mobile Universal Instance Segmentation via Multi-modal Bottleneck Fusion and Calibrated Decoder PruningMattia Segù, Marta Tintore Gazulla, Yongqin Xian, Luc Van Gool, Federico Tombari. 20726-20736 [doi]
- ViT-Linearizer: Distilling Quadratic Knowledge into Linear-Time Vision ModelsGuoyizhe Wei, Rama Chellappa. 20737-20747 [doi]
- The Scalability of Simplicity: Empirical Analysis of Vision-Language Learning with a Single TransformerWeixian Lei, Jiacong Wang, Haochen Wang, Xiangtai Li, Jun Hao Liew, Jiashi Feng, Zilong Huang. 20758-20769 [doi]
- Superpowering Open-Vocabulary Object Detectors for X-ray VisionPablo Garcia Fernandez, Lorenzo Vaquero, Mingxuan Liu, Feng Xue 0001, Daniel Cores, Nicu Sebe, Manuel Mucientes, Elisa Ricci 0001. 20770-20779 [doi]
- Rhythmguassian: Repurposing Generalizable Gaussian Model for Remote Physiological MeasurementHao Lu 0009, Yuting Zhang 0008, Jiaqi Tang 0005, Bowen Fu, Wenhang Ge, Wei Wei 0008, Kaishun Wu, Yingcong Chen. 20780-20790 [doi]
- Exploiting Domain Properties in Language-Driven Domain Generalization for Semantic SegmentationSeogkyu Jeon, Kibeom Hong, Hyeran Byun. 20791-20801 [doi]
- Keyframe-Oriented Vision Token Pruning: Enhancing Efficiency of Large Vision Language Models on Long-form Video ProcessingYudong Liu, Jingwei Sun 0002, Yueqian Lin, Jianyi Zhang, Jingyang Zhang, Ming Yin 0009, Qinsi Wang, Hai Li 0001, Yiran Chen 0001. 20802-20811 [doi]
- Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLMHan Wang, Yuxiang Nie, Yongjie Ye, Yanjie Wang, Shuai Li, Haiyang Yu 0004, Jinghui Lu, Can Huang 0002. 20812-20823 [doi]
- MobileViCLIP: An Efficient Video-Text Model for Mobile DevicesMin Yang 0011, Zihan Jia, Zhilin Dai, Sheng Guo 0005, Limin Wang 0002. 20824-20835 [doi]
- Stereo Any Video: Temporally Consistent Stereo MatchingJunpeng Jing, Weixun Luo, Ye Mao, Krystian Mikolajczyk. 20836-20846 [doi]
- Dynamic-DINO: Fine-Grained Mixture of Experts Tuning for Real-Time Open-Vocabulary Object DetectionYehao Lu, Minghe Weng, Zekang Xiao, Rui Jiang, Wei Su, Guangcong Zheng, Ping Luo 0002, Xi Li. 20847-20856 [doi]
- Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMsQizhe Zhang, Aosong Cheng, Ming Lu 0002, Renrui Zhang, Zhiyong Zhuo, Jiajun Cao, Shaobo Guo, Qi She, Shanghang Zhang. 20857-20867 [doi]
- Wave-Mambaad: Wavelet-Driven State Space Model for Multi-Class Unsupervised Anomaly DetectionQiao Zhang, Mingwen Shao, Xinyuan Chen, Xiang Lv, Kai Xu. 20868-20877 [doi]
- MaTVLM: Hybrid Mamba-Transformer for Efficient Vision-Language ModelingYingyue Li, Bencheng Liao, Wenyu Liu 0001, Xinggang Wang. 20878-20888 [doi]
- Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?Tianyuan Qu, Longxiang Tang, Bohao Peng, Senqiao Yang, Bei Yu 0001, Jiaya Jia. 20889-20899 [doi]
- Visual Textualization for Image Prompted Object DetectionYongjian Wu 0002, Yang Zhou 0036, Jiya Saiyin, Bingzheng Wei, Yan Xu 0001. 20900-20910 [doi]
- ASGS: Single-Domain Generalizable Open-Set Object Detection via Adaptive Subgraph SearchingYuxuan Yuan, Luyao Tang, Yixin Chen, Chaoqi Chen, Yue Huang 0001, Xinghao Ding. 20911-20921 [doi]
- UniConvNet: Expanding Effective Receptive Field While Maintaining Asymptotically Gaussian Distribution for ConvNets of Any ScaleYuhao Wang, Wei Xi. 20922-20933 [doi]
- On the Recovery of Cameras from Fundamental MatricesRakshith Madhavan, Federica Arrigoni. 20934-20943 [doi]
- SiM3D: Single-Instance Multiview Multimodal and Multisetup 3D Anomaly Detection BenchmarkAlex Costanzino, Pierluigi Zama Ramirez, Luigi Lella, Matteo Ragaglia, Alessandro Oliva, Giuseppe Lisanti, Luigi di Stefano. 20944-20953 [doi]
- ReME: A Data-Centric Framework for Training-Free Open-Vocabulary SegmentationXiwei Xuan, Ziquan Deng, Kwan-Liu Ma. 20954-20965 [doi]
- Multiverseg: Scalable Interactive Segmentation of Biomedical Imaging Datasets with in-Context GuidanceHallee E. Wong, Jose Javier Gonzalez Ortiz, John V. Guttag, Adrian V. Dalca. 20966-20980 [doi]
- The Devil Is in the Spurious Correlations: Boosting Moment Retrieval With Dynamic LearningXinyang Zhou, Fanyue Wei, Lixin Duan, Angela Yao, Wen Li 0001. 20981-20990 [doi]
- CLIPSym: Delving into Symmetry Detection with CLIPTinghan Yang, Md Ashiqur Rahman, Raymond A. Yeh. 21003-21013 [doi]
- EVEv2: Improved Baselines for Encoder-Free Vision-Language ModelsHaiwen Diao, Xiaotong Li, Yufeng Cui, Yueze Wang, Haoge Deng, Ting Pan, Wenxuan Wang 0002, Huchuan Lu, Xinlong Wang. 21014-21025 [doi]
- Describe, Adapt and Combine: Empowering CLIP Encoders for Open-Set 3D Object RetrievalZhichuan Wang, Yang Zhou 0007, Zhe Liu 0033, Rui Yu 0002, Song Bai 0001, Yulong Wang 0002, Xinwei He 0001, Xiang Bai. 21026-21036 [doi]
- Robustifying Zero-Shot Vision Language Models by Subspaces AlignmentJunhao Dong 0001, Piotr Koniusz, Liaoyuan Feng, Yifei Zhang, Hao Zhu 0010, Weiming Liu 0005, Xinghua Qu, Yew-Soon Ong. 21037-21047 [doi]
- Leveraging the Power of MLLMs for Gloss-Free Sign Language TranslationJungeun Kim, Hyeongwoo Jeon, Jongseong Bae, Ha-Young Kim. 21048-21058 [doi]
- Flash-Vstream: Efficient Real-Time Understanding for Long Video StreamsHaoji Zhang 0001, Yiqin Wang, Yansong Tang, Yong Liu 0033, Jiashi Feng, Xiaojie Jin. 21059-21069 [doi]
- V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position EncodingJunqi Ge, Ziyi Chen, Jintao Lin, Jinguo Zhu, Xihui Liu, Jifeng Dai, Xizhou Zhu. 21070-21084 [doi]
- OVG-HQ: Online Video Grounding with Hybrid-Modal QueriesRunhao Zeng, Jiaqi Mao, Minghao Lai, Minh-Hieu Phan, Yanjie Dong 0003, Wei Wang 0077, Qi Chen 0014, Xiping Hu. 21085-21096 [doi]
- Enhancing Zero-Shot Object Counting via Text-Guided Local Ranking and Number-Evoked Global AttentionShiwei Zhang 0004, Qi Zhou, Wei Ke 0003. 21097-21106 [doi]
- SegAnyPET: Universal Promptable Segmentation from Positron Emission Tomography ImagesYichi Zhang 0007, Le Xue, Wenbo Zhang, Lanlan Li, Yuchen Liu, Chen Jiang 0006, Yuan Cheng, Yuan Qi 0001. 21107-21116 [doi]
- Multi-View Slot Attention using Paraphrased Texts for Face Anti-SpoofingJeongmin Yu, Susang Kim, Kisu Lee, Taekyoung Kwon 0002, Won-Yong Shin, Ha-Young Kim. 21117-21128 [doi]
- 4D-Bench: Benchmarking Multi-Modal Large Language Models for 4D Object UnderstandingWenxuan Zhu, Bing Li 0024, Cheng Zheng 0002, Jinjie Mai, Jun Chen, Letian Jiang, Abdullah Hamdi, Sara Rojas Martinez, Chia-Wen Lin, Mohamed Elhoseiny, Bernard Ghanem. 21129-21143 [doi]
- Uncertainty-Driven Expert Control: Enhancing the Reliability of Medical Vision-Language ModelsXiao Liang, Di Wang 0011, Zhicheng Jiao, Ronghan Li, Pengfei Yang 0001, Quan Wang 0006, Tat-Seng Chua. 21144-21154 [doi]
- Probabilistic Prototype Calibration of Vision-Language Models for Generalized Few-Shot Semantic SegmentationJie Liu 0043, Jiayi Shen, Pan Zhou 0002, Jan-Jakob Sonke, Efstratios Gavves. 21155-21165 [doi]
- Reducing Unimodal Bias in Multi-Modal Semantic Segmentation With Multi-Scale Functional Entropy RegularizationXu Zheng 0002, Yuanhuiyi Lyu, Lutao Jiang, Danda Pani Paudel, Luc Van Gool, Xuming Hu. 21166-21176 [doi]
- Ouromamba: a Data-Free Quantization Framework for Vision MambaAkshat Ramachandran, Mingyu Lee, Huan Xu, Souvik Kundu 0009, Tushar Krishna. 21177-21186 [doi]
- MixA: A Mixed Attention Approach with Stable Lightweight Linear Attention to Enhance Efficiency of Vision Transformers at the EdgeSabbir Ahmed, Jingtao Li, Weiming Zhuang, Chen Chen, Lingjuan Lyu. 21187-21196 [doi]
- VAMBA: Understanding Hour-Long Videos with Hybrid Mamba-TransformersWeiming Ren, Wentao Ma, Huan Yang 0005, Cong Wei 0001, Ge Zhang 0009, Wenhu Chen. 21197-21208 [doi]
- SAMora: Enhancing SAM through Hierarchical Self-Supervised Pre-Training for Medical ImagesShuhang Chen, Hangjie Yuan, Pengwei Liu, Hanxue Gu, Tao Feng 0014, Dong Ni 0002. 21209-21219 [doi]
- FE-CLIP: Frequency Enhanced CLIP Model for Zero-Shot Anomaly Detection and SegmentationTao Gong, Qi Chu 0001, Bin Liu 0016, Wei Zhou 0021, Nenghai Yu. 21220-21230 [doi]
- Referring Expression Comprehension for Small ObjectsKanoko Goto, Takumi Hirose, Mahiro Ukai, Shuhei Kurita, Nakamasa Inoue. 21231-21242 [doi]
- Aid: Adapting Image2video Diffusion Models for Instruction-Guided Video PredictionZhen Xing, Qi Dai 0001, Zejia Weng, Zuxuan Wu, Yu-Gang Jiang 0001. 21243-21253 [doi]
- Principles of Visual Tokens for Efficient Video UnderstandingXinyue Hao 0001, Gen Li 0008, Shreyank N. Gowda, Robert B. Fisher, Jonathan Huang, Anurag Arnab, Laura Sevilla-Lara. 21254-21264 [doi]
- CutS3D: Cutting Semantics in 3D for 2D Unsupervised Instance SegmentationLeon Sick, Dominik Engel 0001, Sebastian Hartwig, Pedro Hermosilla, Timo Ropinski. 21265-21275 [doi]
- Learning Robust Stereo Matching in the Wild with Selective Mixture-of-ExpertsYun Wang 0053, Longguang Wang, Chenghao Zhang 0003, Yongjian Zhang, Zhanjie Zhang, Ao Ma, Chenyou Fan, Tin Lun Lam, Junjie Hu 0003. 21276-21287 [doi]
- Text-Guided Visual Prompt DINO for Generic SegmentationYuchen Guan, Chong Sun, Canmiao Fu, Zhipeng Huang 0024, Chun Yuan 0003, Chen Li 0031. 21288-21298 [doi]
- ETVA: Evaluation of Text-to-Video Alignment via Fine-Grained Question Generation and AnsweringKaisi Guan, Zhengfeng Lai, Yuchong Sun, Peng Zhang, Wei Liu, Kieran Liu, Meng Cao, Ruihua Song. 21299-21309 [doi]
- GEMeX: A Large-Scale, Groundable, and Explainable Medical VQA Benchmark for Chest X-Ray DiagnosisBo Liu 0049, Ke Zou, Li-Ming Zhan, Zexin Lu, Xiaoyu Dong, Yidi Chen, Chengqiang Xie, Jiannong Cao 0001, Xiao-Ming Wu 0003, Huazhu Fu. 21310-21320 [doi]
- Bias-Resilient Weakly Supervised Semantic Segmentation Using Normalizing FlowsXianglin Qiu, Xiaoyang Wang, Zhen Zhang, Jimin Xiao. 21321-21330 [doi]
- Multidimensional Byte Pair Encoding: Shortened Sequences for Improved Visual Data GenerationTim Elsner, Paula Usinger, Julius Nehring-Wirxel, Gregor Kobsik, Victor Czech, Yanjiang He, Isaak Lim, Leif Kobbelt. 21331-21341 [doi]
- MA-CIR: A Multimodal Arithmetic Benchmark for Composed Image RetrievalJaeseok Byun, Young-Kyun Jang, Seokhyeon Jeong, Donghyun Kim, Taesup Moon. 21342-21352 [doi]
- Cracking Instance Jigsaw Puzzles: An Alternative to Multiple Instance Learning for Whole Slide Image AnalysisXiwen Chen, Peijie Qiu, Wenhui Zhu, Hao Wang 0176, Huayu Li, Xuanzhao Dong, Xiaotong Sun, Xiaobing Yu, Yalin Wang 0001, Abolfazl Razi, Aristeidis Sotiras. 21353-21363 [doi]
- STDDNet: Harnessing Mamba for Video Polyp Segmentation via Spatial-aligned Temporal Modeling and Discriminative Dynamic Representation LearningGuilian Chen, Huisi Wu, Jing Qin 0001. 21364-21373 [doi]
- Latent Expression Generation for Referring Image Segmentation and GroundingSeonghoon Yu, Joonbeom Hong, Joonseok Lee, Jeany Son. 21374-21383 [doi]
- Skip-Vision: Efficient and Scalable Acceleration of Vision-Language Models Via Adaptive Token SkippingWeili Zeng, Ziyuan Huang, Kaixiang Ji, Yichao Yan. 21384-21397 [doi]
- LV-MAE: Learning Long Video Representations Through Masked-Embedding AutoencodersIlan Naiman, Emanuel Ben Baruch, Oron Anschel, Alon Shoshan, Igor Kviatkovsky, Manoj Aggarwal, Gérard G. Medioni. 21398-21407 [doi]
- CogCM: Cognition-Inspired Contextual Modeling for Audio-Visual Speech EnhancementFeixiang Wang, Shuang Yang, Shiguang Shan, Xilin Chen 0001. 21408-21418 [doi]
- Salvaging the Overlooked: Leveraging Class-Aware Contrastive Learning for Multi-Class Anomaly DetectionLei Fan 0007, Junjie Huang, Donglin Di, Anyang Su, Tianyou Song, Maurice Pagnucco, Yang Song 0001. 21419-21428 [doi]
- Adapting In-Domain Few-Shot Segmentation to New Domains Without Source Domain RetrainingQi Fan, Kaiqi Liu, Nian Liu 0002, Hisham Cholakkal, Rao Muhammad Anwer, Wenbin Li 0006, Yang Gao 0001. 21429-21439 [doi]
- OmniDiff: A Comprehensive Benchmark for Fine-Grained Image Difference CaptioningYuan Liu, Saihui Hou, Saijie Hou, Jiabao Du, Shibei Meng, Yongzhen Huang. 21440-21449 [doi]
- Adaptive Learning of High-Value Regions for Semi-Supervised Medical Image SegmentationTao Lei 0003, Ziyao Yang, Xingwu Wang, Yi Wang 0069, Xuan Wang 0022, Feiman Sun, Asoke K. Nandi. 21450-21459 [doi]
- COME: Dual Structure-Semantic Learning with Collaborative MOE for Universal Lesion Detection Across Heterogeneous Ultrasound DatasetsLingyu Chen, Yawen Zeng, Yue Wang, Peng Wan 0004, Guochen Ning, Hongen Liao, Daoqiang Zhang, Fang Chen 0007. 21460-21470 [doi]
- FLOSS: Free Lunch in Open-Vocabulary Semantic SegmentationYasser Benigmim, Mohammad Fahes, Tuan-Hung Vu, Andrei Bursuc, Raoul de Charette. 21471-21481 [doi]
- GaussianReg: Rapid 2D/3D Registration for Emergency Surgery Via Explicit 3D Modeling with Gaussian PrimitivesWeihao Yu 0004, Xiaoqing Guo, Xinyu Liu 0001, Yifan Liu, Hao Zheng, Yawen Huang, Yixuan Yuan. 21482-21491 [doi]
- METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language ModelsYuchen Liu 0006, Yaoming Wang, Bowen Shi 0003, Xiaopeng Zhang 0008, Wenrui Dai, Chenglin Li, Hongkai Xiong, Qi Tian 0001. 21492-21504 [doi]
- Rectifying Magnitude Neglect in Linear AttentionQihang Fan, Huaibo Huang, Yuang Ai, Ran He 0001. 21505-21514 [doi]
- Sparse-Dense Side-Tuner for Efficient Video Temporal GroundingDavid Pujol-Perich, Sergio Escalera, Albert Clapés. 21515-21524 [doi]
- MedSegFactory: Text-Guided Generation of Medical Image-Mask PairsJiawei Mao, Yuhan Wang 0001, Yucheng Tang, Daguang Xu, Kang Wang 0016, Yang Yang 0009, Zongwei Zhou, Yuyin Zhou. 21525-21535 [doi]
- CountSE: Soft Exemplar Open-Set Object CountingShuai Liu, Peng Zhang, Shiwei Zhang, Wei Ke. 21536-21546 [doi]
- Constructing Ophthalmic MLLM for Positioning-Diagnosis Collaboration Through Clinical Cognitive Chain ReasoningXinyao Liu, Diping Song. 21547-21556 [doi]
- Unified Open-World Segmentation with Multi-Modal PromptsYang Liu 0357, Yufei Yin, Chenchen Jing, Muzhi Zhu, Hao Chen 0041, Yuling Xi, Bo Feng, Hao Wang 0052, Shiyu Li, Chunhua Shen. 21557-21567 [doi]
- DecAD: Decoupling Anomalies in Latent Space for Multi-Class Unsupervised Anomaly DetectionXiaolei Wang, Xiaoyang Wang, Huihui Bai 0001, Eng Gee Lim, Jimin Xiao. 21568-21577 [doi]
- Few-Shot Pattern Detection via Template Matching and RegressionEunchan Jo, Dahyun Kang, Sanghyun Kim, Yunseon Choi, Minsu Cho. 21578-21588 [doi]
- Hierarchical Event Memory for Accurate and Low-Latency Online Video Temporal GroundingMinghang Zheng, Yuxin Peng, Benyuan Sun, Yi Yang, Yang Liu. 21589-21599 [doi]
- UKBOB: One Billion MRI Labeled Masks for Generalizable 3D Medical Image SegmentationEmmanuelle Bourigault, Amir Jamaludin, Abdullah Hamdi. 21600-21611 [doi]
- ILLUME: Illuminating Your LLMs to See, Draw, and Self-EnhanceChunwei Wang, Guansong Lu, Junwei Yang, Runhui Huang, Jianhua Han, Lu Hou 0002, Wei Zhang 0196, Hang Xu 0004. 21612-21622 [doi]
- Learning Yourself: Class-Incremental Semantic Segmentation with Language-Inspired Bootstrapped DisentanglementRuitao Wu, Yifan Zhao, Jia Li. 21623-21634 [doi]
- Hallucinatory Image Tokens: A Training-Free EAZY Approach to Detecting and Mitigating Object Hallucinations in LVLMsLiwei Che, Tony Qingze Liu, Jing Jia, Weiyi Qin, Ruixiang Tang, Vladimir Pavlovic 0001. 21635-21644 [doi]
- Class Token as Proxy: Optimal Transport-Assisted Proxy Learning for Weakly Supervised Semantic SegmentationJian Wang 0122, Tianhong Dai, Bingfeng Zhang, Siyue Yu, Eng Gee Lim, Jimin Xiao. 21645-21654 [doi]
- VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative VideosJiashuo Yu, Yue Wu 0013, Meng Chu, Zhifei Ren, Zizheng Huang, Pei Chu, Ruijie Zhang, Yinan He, Qirui Li, Songze Li, Zhenxiang Li, Zhongying Tu, Conghui He, Yu Qiao 0001, Yali Wang 0001, Yi Wang 0074, Limin Wang 0002. 21655-21666 [doi]
- Referring to Any PersonQing Jiang, Lin Wu, Zhaoyang Zeng, Tianhe Ren, Yuda Xiong, Yihao Chen, Qin Liu, Lei Zhang. 21667-21678 [doi]
- RA-BUSSeg: Relation-Aware Semi-Supervised Breast Ultrasound Image Segmentation via Adjacent Propagation and Cross-Layer AlignmentWanting Zhang, Zhenhui Ding, Guilian Chen, Huisi Wu, Jing Qin 0001. 21689-21698 [doi]
- ExCap3d: Expressive 3D Scene Understanding via Object Captioning with Varying DetailChandan Yeshwanth, Dávid Rozenberszki, Angela Dai. 21699-21709 [doi]
- DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMsJiahe Zhao, Rongkun Zheng, Yi Wang 0074, Helin Wang, Hengshuang Zhao. 21710-21720 [doi]
- Neuroverse3D: Developing in-Context Learning Universal Model for Neuroimaging in 3DJiesi Hu, Hanyang Peng, Yanwu Yang, Xutao Guo, Yang Shang, Pengcheng Shi, Chenfei Ye, Ting Ma 0001. 21721-21731 [doi]
- CT-ScanGaze: A Dataset and Baselines for 3D Volumetric Scanpath ModelingTrong-Thang Pham, Akash Awasthi, Saba Khan, Esteban Duran Marti, Tien-Phat Nguyen, Khoa Vo 0001, Minh Tran, Son Nguyen, Cuong Tran, Yuki Ikebe, Anh Totti Nguyen, Anh Nguyen 0003, Zhigang Deng 0001, Carol C. Wu, Hien Nguyen, Ngan Le. 21732-21743 [doi]
- CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in LiteracyZhibo Yang 0003, Jun Tang 0008, Zhaohai Li, Pengfei Wang, Jianqiang Wan, Humen Zhong, Xuejing Liu, Mingkun Yang, Peng Wang 0028, Shuai Bai, Lianwen Jin, Junyang Lin. 21744-21754 [doi]
- Exploring Probabilistic Modeling Beyond Domain Generalization for Semantic SegmentationI-Hsiang Chen, Hua-En Chang, Wei-Ting Chen, Jenq-Neng Hwang, Sy-Yen Kuo. 21755-21765 [doi]
- Describe Anything: Detailed Localized Image and Video CaptioningLong Lian, Yifan Ding 0002, Yunhao Ge, Sifei Liu, Hanzi Mao, Boyi Li 0001, Marco Pavone 0001, Ming-Yu Liu 0001, Trevor Darrell, Adam Yala, Yin Cui. 21766-21777 [doi]
- ViSpeak: Visual Instruction Feedback in Streaming VideosShenghao Fu, Qize Yang, Yuan-Ming Li, Yi-Xing Peng, Kun-Yu Lin, Xihan Wei, Jian-Fang Hu, Xiaohua Xie, Wei-Shi Zheng 0001. 21778-21788 [doi]
- Prototypes Are Balanced Units for Efficient and Effective Partially Relevant Video RetrievalWonJun Moon, Cheol-Ho Cho, Woojin Jun, Taeoh Kim, Inwoong Lee, Dongyoon Wee, Minho Shim, Jae-Pil Heo. 21789-21799 [doi]
- SciVid: Cross-Domain Evaluation of Video Models in Scientific ApplicationsYana Hasson, Pauline Luc, Liliane Momeni, Maks Ovsjanikov, Guillaume Le Moing, Alina Kuznetsova, Ira Ktena, Jennifer J. Sun, Skanda Koppula, Dilara Gokay, Joseph Heyward, Etienne Pot, Andrew Zisserman. 21800-21811 [doi]
- VideoAds for Fast-Paced Video UnderstandingZheyuan Zhang 0001, Wanying Dou, Linkai Peng, Hongyi Pan, Ulas Bagci, Boqing Gong. 21812-21821 [doi]
- Auto-Controlled Image Perception in MLLMs via Visual Perception TokensRunpeng Yu, Xinyin Ma, Xinchao Wang. 21822-21831 [doi]
- Keep Your Friends Close, and Your Enemies Farther: Distance-Aware Voxel-Wise Contrastive Learning for Semi-Supervised Multi-Organ SegmentationHaochen Zhao, Jianwei Niu 0002, Xuefeng Liu 0001, Xiaozheng Xie, Li Kuang, Haotian Yang, Bin Dai 0009, Hui Meng, Yong Wang. 21832-21842 [doi]
- SALAD - Semantics-Aware Logical Anomaly DetectionMatic Fucka, Vitjan Zavrtanik, Danijel Skocaj. 21843-21852 [doi]
- Refer to Any Segmentation Mask Group with Vision-Language PromptsShengcao Cao, Zijun Wei, Jason Kuen, Kangning Liu, Lingzhi Zhang, Jiuxiang Gu, Hyunjoon Jung, Liang-Yan Gui, Yu-Xiong Wang. 21853-21863 [doi]
- From Panels to Prose: Generating Literary Narratives from ComicsRagav Sachdeva, Andrew Zisserman. 21864-21873 [doi]
- When Confidence Fails: Revisiting Pseudo-Label Selection in Semi-Supervised Semantic SegmentationPan Liu, Jinshi Liu. 21874-21884 [doi]
- MSQ: Memory-Efficient Bit Sparsification QuantizationSeokho Han, Seoyeon Yoon, Jinhee Kim, Dongwei Wang, Kang Eun Jeon, Huanrui Yang, Jong Hwan Ko. 21885-21894 [doi]
- Towards a Universal 3D Medical Multi-Modality Generalization via Learning Personalized Invariant RepresentationZhaorui Tan, Xi Yang 0008, Tan Pan, Tianyi Liu, Chen Jiang 0006, Xin Guo 0010, Qiufeng Wang 0001, Anh Nguyen 0003, Yuan Qi 0001, Kaizhu Huang, Yuan Cheng. 21895-21905 [doi]
- Improving SAM for Camouflaged Object Detection via Dual Stream AdaptersJiaming Liu, Linghe Kong, Guihai Chen. 21906-21916 [doi]
- Triad: Empowering LMM-Based Anomaly Detection with Expert-Guided Region-of-Interest Tokenizer and Manufacturing ProcessYuanze Li, Shihao Yuan, Haolin Wang 0004, Qizhang Li, Ming Liu 0018, Chen Xu, Guangming Shi, Wangmeng Zuo. 21917-21926 [doi]
- Unveiling the Invisible: Reasoning Complex Occlusions Amodally with AURAZhixuan Li, Hyunse Yoon, Sanghoon Lee 0001, Weisi Lin. 21927-21937 [doi]
- Bridging the Gap Between Brain and Machine in Interpreting Visual Semantics: Towards Self-Adaptive Brain-to-Text DecodingJiaxuan Chen, Yu Qi, Yueming Wang, Gang Pan. 21938-21948 [doi]
- MobileIE: An Extremely Lightweight and Effective ConvNet for Real-Time Image Enhancement on Mobile DevicesHailong Yan, Ao Li 0007, Xiangtao Zhang, Zhe Liu 0019, Zenglin Shi, Ce Zhu, Le Zhang 0001. 21949-21960 [doi]
- DisTime: Distribution-Based Time Representation for Video Large Language ModelsYingsen Zeng, Zepeng Huang, Yujie Zhong, Chengjian Feng, Jie Hu, Lin Ma 0002, Yang Liu. 21961-21971 [doi]
- SmolDocling: An Ultra-Compact Vision-Language Model for End-To-End Multi-Modal Document ConversionAhmed S. Nassar, Matteo Omenetti, Maksym Lysak, Nikolaos Livathinos, Christoph Auer, Lucas Morin, Rafael Teixeira de Lima, Yusik Kim, A. Said Gurbuz, Michele Dolfi, Peter W. J. Staar. 21972-21983 [doi]
- WeaveSeg: Iterative Contrast-weaving and Spectral Feature-refining for Nuclei Instance SegmentationJiajia Li, Huisi Wu, Jing Qin 0001. 21984-21993 [doi]
- How Can Objects Help Video-Language Understanding?Zitian Tang, Shijie Wang, Junho Cho, Jaewook Yoo, Chen Sun 0002. 21994-22003 [doi]
- Everything is a Video: Unifying Modalities Through Next-Frame PredictionG. Thomas Hudson, Dean L. Slack, Thomas Winterbottom, Jamie Sterling, Chenghao Xiao, Junjie Shentu, Noura Al Moubayed. 22004-22013 [doi]
- LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMsHaoran Lou, Chunxiao Fan, Ziyan Liu, Yuexin Wu, Xinliang Wang. 22004-22024 [doi]
- Talking to DINO: Bridging Self-Supervised Vision Backbones with Language for Open-Vocabulary SegmentationLuca Barsellotti, Lorenzo Bianchi 0001, Nicola Messina, Fabio Carrara, Marcella Cornia, Lorenzo Baraldi 0001, Fabrizio Falchi, Rita Cucchiara. 22025-22035 [doi]
- CARIM: Caption-Based Autonomous Driving Scene Retrieval via Inclusive Text MatchingMinjoo Ki, Daejung Kim, Kisung Kim, Seon Joo Kim, Jinhan Lee. 22036-22045 [doi]
- Beyond Training: Dynamic Token Merging for Zero-Shot Video UnderstandingYiming Zhang, Zhuokai Zhao, Zhaorun Chen, Zenghui Ding, Xianjun Yang, Yining Sun. 22046-22055 [doi]
- Q-Frame: Query-Aware Frame Selection and Multi-Resolution Adaptation for Video-LLMsShaojie Zhang, Jiahui Yang, Jianqin Yin, Zhenbo Luo, Jian Luan 0001, MiLM Plus. 22056-22065 [doi]
- Normal and Abnormal Pathology Knowledge-Augmented Vision-Language Model for Anomaly Detection in Pathology ImagesJinsol Song, Jiamu Wang, Anh Tien Nguyen, Keunho Byeon, Sangjeong Ahn, Sung-Hak Lee, Jin Tae Kwak. 22066-22076 [doi]
- Modeling Saliency Dataset BiasMatthias Kümmerer, Harneet Singh Khanuja, Matthias Bethge. 22077-22088 [doi]
- ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language ModelsBingchen Gong, Diego Gomez 0003, Abdullah Hamdi, Abdelrahman Eldesokey, Ahmed Abdelreheem 0002, Peter Wonka, Maks Ovsjanikov. 22089-22099 [doi]
- HyPiDecoder: Hybrid Pixel Decoder for Efficient Segmentation and DetectionFengzhe Zhou, Humphrey Shi. 22100-22109 [doi]
- Benefit from Seen: Enhancing Open-Vocabulary Object Detection by Bridging Visual and Textual Co-Occurrence KnowledgeYanqi Li, Jianwei Niu, Tao Ren. 22110-22119 [doi]
- Quantifying and Narrowing the Unknown: Interactive Text-to-Video Retrieval Via Uncertainty MinimizationBingqing Zhang, Zhuo Cao, Heming Du, Yang Li, Xue Li, Jiajun Liu, Sen Wang. 22120-22130 [doi]
- Beyond Single Images: Retrieval Self-Augmented Unsupervised Camouflaged Object DetectionJi Du, Xin Wang 0118, Fangwei Hao, Mingyang Yu, Chunyuan Chen, Jiesheng Wu, Bin Wang, Jing Xu 0008, Ping Li 0016. 22131-22142 [doi]
- Mixa-Q: Revisiting Activation Sparsity for Vision Transformers From a Mixed-Precision Quantization PerspectiveWeitian Wang, Shubham Rai, Cecilia De la Parra, Akash Kumar 0001. 22143-22152 [doi]
- Advancing Visual Large Language Model for Multi-Granular Versatile PerceptionWentao Xiang, Haoxian Tan, Yujie Zhong, Cong Wei, Dengjie Li, Yujiu Yang 0001. 22153-22164 [doi]
- Controllable Latent Space Augmentation for Digital PathologySofiène Boutaj, Marin Scalbert, Pierre Marza, Florent Couzinie-Devy, Maria Vakalopoulou, Stergios Christodoulidis. 22165-22174 [doi]
- PS3: A Multimodal Transformer Integrating Pathology Reports with Histology Images and Biological Pathways for Cancer Survival PredictionManahil Raza, Ayesha Azam, Talha Qaiser, Nasir M. Rajpoot. 22175-22186 [doi]
- Mieb: Massive Image Embedding BenchmarkChenghao Xiao, Isaac Chung, Imene Kerboua, Jamie Stirling, Xin Zhang 0097, Márton Kardos, Roman Solomatin, Noura Al Moubayed, Kenneth C. Enevoldsen, Niklas Muennighoff. 22187-22198 [doi]
- Temperature in Cosine-based Softmax LossTakumi Kobayashi. 22199-22208 [doi]
- Interpretable Point Cloud Classification Using Multiple Instance LearningMatt De Vries, Reed Naidoo, Olga Fourkioti, Lucas G. Dent, Nathan Curry, Christopher Dunsby, Chris Bakal. 22209-22220 [doi]
- Zero-Shot Composed Image Retrieval via Dual-Stream Instruction-Aware DistillationWenliang Zhong, Robert A. Barton, Weizhi An, Feng Jiang 0012, Hehuan Ma, Yuzhi Guo, Abhishek Dan, Shioulin Sam, Karim Bouyarmane, JunZhou Huang. 22221-22231 [doi]
- DeFSS: Image-to-Mask Denoising Learning for Few-Shot SegmentationZishu Qin, Junhao Xu, Weifeng Ge. 22232-22240 [doi]
- Fine-Grained Abnormality Prompt Learning for Zero-Shot Anomaly DetectionJiawen Zhu 0001, Yew-Soon Ong, Chunhua Shen, Guansong Pang. 22241-22251 [doi]
- Efficient Fine-Tuning of Large Models Via Nested Low-Rank AdaptationLujun Li 0001, Cheng Lin 0001, Dezhi Li, You-Liang Huang, Wei Li 0286, Tianyu Wu, Jie Zou, Wei Xue 0002, Sirui Han, Yike Guo. 22252-22262 [doi]
- Bidirectional Likelihood Estimation with Multi-Modal Large Language Models for Text-Video RetrievalDohwan Ko, Ji Soo Lee, Minhyuk Choi, Zihang Meng, Hyunwoo J. Kim. 22263-22273 [doi]
- Object-Centric Video Question Answering with Visual Grounding and ReferringHaochen Wang, Qirui Chen, Cilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu 0002, Weidi Xie, Stratis Gavves. 22274-22284 [doi]
- Music Grounding by Short VideoZijie Xin, Minquan Wang, Jingyu Liu, Quan Chen 0006, Ye Ma, Peng Jiang 0002, Xirong Li 0001. 22285-22293 [doi]
- LLaFEA: Frame-Event Complementary Fusion for Fine-Grained Spatiotemporal Understanding in LMMsHanyu Zhou, Gim Hee Lee. 22294-22304 [doi]
- ResidualViT for Efficient Temporally Dense Video EncodingMattia Soldan, Fabian Caba Heilbron, Bernard Ghanem, Josef Sivic, Bryan C. Russell. 22305-22315 [doi]
- Alleviating Textual Reliance in Medical Language-Guided Segmentation via Prototype-Driven Semantic ApproximationShuchang Ye, Usman Naseem, Mingyuan Meng, Jinman Kim. 22316-22326 [doi]
- Controllable-Lpmoe: Adapting to Challenging Object Segmentation Via Dynamic Local Priors From Mixture-Of-ExpertsYanguang Sun, Jiawei Lian, Jian Yang, Lei Luo 0001. 22327-22337 [doi]
- Implicit Counterfactual Learning for Audio-Visual SegmentationMingfeng Zha, Tianyu Li 0003, Guoyin Wang 0001, Peng Wang 0023, Yangyang Wu, Yang Yang 0002, Heng Tao Shen. 22349-22360 [doi]
- Revisiting Efficient Semantic Segmentation: Learning Offsets for Better Spatial and Class Feature AlignmentShi-Chen Zhang, Yunheng Li, Yu-Huan Wu, Qibin Hou, Ming-Ming Cheng. 22361-22371 [doi]
- Rethinking Detecting Salient and Camouflaged Objects in Unconstrained ScenesZhangjun Zhou, Yiping Li, Chunlin Zhong, Jianuo Huang, Jialun Pei, Hua Li, He Tang 0002. 22372-22382 [doi]
- AHCPTQ: Accurate and Hardware-Compatible Post-Training Quantization for Segment Anything ModelWenlun Zhang, Yunshan Zhong, Shimpei Ando, Kentaro Yoshioka. 22383-22392 [doi]
- Pseudo-SD: Pseudo Controlled Stable Diffusion for Semi-Supervised and Cross-Domain Semantic SegmentationDong Zhao, Qi Zang, Shuang Wang 0001, Nicu Sebe, Zhun Zhong. 22393-22403 [doi]
- GUIOdyssey: A Comprehensive Dataset for Cross-App GUI Navigation on Mobile DevicesQuanfeng Lu, Wenqi Shao, Zitao Liu, Lingxiao Du, Fanqing Meng, Boxuan Li, Botong Chen, Siyuan Huang 0004, Kaipeng Zhang, Ping Luo 0002. 22404-22414 [doi]
- PathDiff: Histopathology Image Synthesis with Unpaired Text and Mask ConditionsMahesh Bhosale, Abdul Wasi, Yuanhao Zhai 0001, Yunjie Tian, Samuel P. Border, Nan Xi, Pinaki Sarder, Junsong Yuan 0001, David S. Doermann, Xuan Gong. 22415-22424 [doi]
- Learning Beyond Still Frames: Scaling Vision-Language Models with VideoYiyuan Zhang, Handong Jing, Jing Liu, Xiangyu Yue. 22425-22435 [doi]
- Is CLIP Ideal? No. Can We Fix It? Yes!Raphi Kang, Yue Song 0002, Georgia Gkioxari, Pietro Perona. 22436-22446 [doi]
- HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP ModelsZhixiang Wei, Guangting Wang, Xiaoxiao Ma 0006, Ke Mei, Huaian Chen, Yi Jin 0002, Fengyun Rao. 22447-22456 [doi]
- Dynamic Dictionary Learning for Remote Sensing Image SegmentationXuechao Zou, Yue Li, Shun Zhang, Kai Li 0023, Shiying Wang, Pin Tao, Junliang Xing, Congyan Lang. 22457-22466 [doi]
- Temporal-Aware Query Routing for Real-Time Video Instance SegmentationZesen Cheng, Kehan Li 0002, Yian Zhao, Hang Zhang, Chang Liu, Jie Chen 0001. 22467-22476 [doi]
- WINS: Winograd Structured Pruning for Fast Winograd ConvolutionCheonjun Park, Hyun Jae Oh, Mincheol Park, Hyunchan Moon, Minsik Kim 0001, Suhyun Kim 0001, Myung Kuk Yoon, Won Woo Ro. 22477-22487 [doi]
- Bridging Domain Generalization to Multimodal Domain Generalization via Unified RepresentationsHai Huang 0013, Yan Xia 0006, Sashuai Zhou, Hanting Wang, Shulei Wang, Zhou Zhao 0001. 22488-22498 [doi]
- Free-Moref: Instantly Multiplexing Context Perception Capabilities of Video-Mllms Within Single InferenceKuo Wang, Quanlong Zheng, Junlin Xie, Yanhao Zhang, Jinguo Luo, Haonan Lu, Liang Lin, Fan Zhou, Guanbin Li. 22499-22508 [doi]
- Towards Fine-Grained Interactive Segmentation in Images and VideosYuan Yao, Qiushi Yang, Miaomiao Cui, Liefeng Bo. 22509-22518 [doi]
- LLM-Assisted Semantic Guidance for Sparsely Annotated Remote Sensing Object DetectionWei Liao, Chunyan Xu, Chenxu Wang, Zhen Cui 0001. 22519-22528 [doi]
- Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report GenerationQin Zhou, Guoyan Liang, Xindi Li, Jingyuan Chen, Zhe Wang, Chang Yao 0001, Sai Wu. 22529-22538 [doi]
- Generalizable Object Re-Identification via Visual in-Context PromptingZhizhong Huang, Xiaoming Liu. 22539-22550 [doi]
- TAB: Transformer Attention Bottlenecks Enable User Intervention and Debugging in Vision-Language ModelsPooyan Rahmanzadehgervi, Hung Huy Nguyen, Rosanne Liu, Long Mai, Anh Totti Nguyen. 22551-22562 [doi]
- Anomaly Detection of Integrated Circuits Package Substrates Using the Large Vision Model SAIC: Dataset Construction, Methodology, and ApplicationRuiyun Yu, Bingyang Guo, Haoyuan Li 0003. 22563-22574 [doi]
- Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual SegmentationKaining Ying, Henghui Ding, Guangquan Jie, Yu-Gang Jiang 0001. 22575-22585 [doi]
- Streaming Videollms for Real-Time Procedural Video UnderstandingDibyadip Chatterjee, Edoardo Remelli, Yale Song, Bugra Tekin, Abhay Mittal, Bharat Bhatnagar, Necati Cihan Camgöz, Shreyas Hampali, Eric Sauser, Shugao Ma, Angela Yao, Fadime Sener. 22586-22598 [doi]
- Prompt-Driven Transferable Adversarial Attack on Person Re-identification with Attribute-Aware Textual InversionYuan Bian 0002, Min Liu 0008, Yunqi Yi, Xueping Wang, Shuai Jiang, Yaonan Wang 0001. 22599-22609 [doi]
- Frequency-Dynamic Attention Modulation for Dense PredictionLinwei Chen, Lin Gu, Ying Fu. 22620-22632 [doi]
- Memory-Efficient 4-bit Preconditioned Stochastic OptimizationJingyang Li, Kuangyu Ding, Kim-Chuan Toh, Pan Zhou 0002. 22633-22643 [doi]
- Cross-Category Subjectivity Generalization for Style-Adaptive Sketch Re-IDZechao Hu 0003, Zhengwei Yang 0001, Hao Li 0093, Zheng Wang 0007, Yixiong Zou. 22644-22653 [doi]
- FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language ModelsTianyu Fu 0004, Tengxuan Liu, Qinghao Han, Guohao Dai 0001, Shengen Yan, Huazhong Yang, Xuefei Ning, Yu Wang 0002. 22654-22663 [doi]
- Stepping Out of Similar Semantic Space for Open-Vocabulary SegmentationYong Liu 0033, Song-Li Wu, Sule Bai, Jiahao Wang, Yitong Wang, Yansong Tang. 22664-22675 [doi]
- CoTMR: Chain-of-Thought Multi-Scale Reasoning for Training-Free Zero-Shot Composed Image RetrievalZelong Sun, Dong Jing, Zhiwu Lu 0001. 22675-22684 [doi]
- CoHD: A Counting-Aware Hierarchical Decoding Framework for Generalized Referring Expression SegmentationZhuoyan Luo, Yinghao Wu, Tianheng Cheng, Yong Liu, Yicheng Xiao, Hongfa Wang, Xiao-Ping Zhang, Yujiu Yang. 22685-22694 [doi]
- Aligning Effective Tokens with Video Anomaly in Large Language ModelsYingxian Chen, Jiahui Liu 0012, Ruidi Fan, Yanwei Li, Chirui Chang, Shizhen Zhao, Wilton W. T. Fok, Xiaojuan Qi 0001, Yik-Chung Wu. 22695-22706 [doi]
- No More Sibling Rivalry: Debiasing Human-Object Interaction DetectionBin Yang, Yulin Zhang, Hong-Yu Zhou, Sibei Yang. 22707-22717 [doi]
- WSI-LLaVA: A Multimodal Large Language Model for Whole Slide ImageYuci Liang, Xinheng Lyu, Wenting Chen, Meidan Ding, Jipeng Zhang, Xiangjian He, Song Wu, Xiaohan Xing, Sen Yang 0006, Xiyue Wang, LinLin Shen. 22718-22727 [doi]
- Borrowing Eyes for the Blind Spot: Overcoming Data Scarcity in Malicious Video Detection Via Cross-Domain Retrieval AugmentationRongpei Hong, Jian Lang, Ting Zhong, Fan Zhou 0002. 22728-22737 [doi]
- Bridging Local Inductive Bias and Long-Range Dependencies With Pixel-Mamba for End-To-End Whole Slide Image AnalysisZhongwei Qiu, Hanqing Chao, Tiancheng Lin 0004, Wanxing Chang, Zijiang Yang 0009, Wenpei Jiao, Yixuan Shen, Yunshuo Zhang, Yelin Yang, Wenbin Liu, Hui Jiang, Yun Bian, Ke Yan 0006, Dakai Jin, Le Lu 0001. 22738-22747 [doi]
- DASH: Detection and Assessment of Systematic Hallucinations of VLMsMaximilian Augustin, Yannic Neuhaus, Matthias Hein 0001. 22748-22759 [doi]
- Sim-DETR: Unlock DETR for Temporal Sentence GroundingJiajin Tang, Zhengxuan Wei, Yuchen Zhu, Cheng Shi, Guanbin Li, Liang Lin, Sibei Yang. 22760-22771 [doi]
- ViCTr: Vital Consistency Transfer for Pathology Aware Image SynthesisOnkar Susladkar, Gayatri Deshmukh, Yalcin Tur, Gorkem Durak, Ulas Bagci. 22772-22782 [doi]
- Multi-Modal Multi-Task Unified Embedding Model (M3T-UEM): A Task-Adaptive Representation Learning FrameworkRohan Sharma, Changyou Chen, Feng-Ju Chang, Seongjun Yun, Xiaohu Xie, Rui Meng, Dehong Xu, Alejandro Mottini, Qingjun Cui. 22783-22793 [doi]
- 풟ℐℋ-CLIP: Unleashing the Diversity of Multi-Head Self-Attention for Training-Free Open-Vocabulary Semantic SegmentationSongsong Duan, Xi Yang, Nannan Wang. 22794-22803 [doi]
- SignRep: Enhancing Self-Supervised Sign RepresentationsRyan Wong 0003, Necati Cihan Camgöz, Richard Bowden. 22804-22814 [doi]
- Plug-in Feedback Self-Adaptive Attention in CLIP for Training-Free Open-Vocabulary SegmentationZhixiang Chi, Yanan Wu, Li Gu, Huan Liu 0014, Ziqiang Wang 0003, Yang Zhang, Yang Wang 0003, Konstantinos N. Plataniotis. 22815-22825 [doi]
- Feather the Throttle: Revisiting Visual Token Pruning for Vision-Language Model AccelerationMark Endo, Xiaohan Wang, Serena Yeung-Levy. 22826-22835 [doi]
- Intermediate Connectors and Geometric Priors for Language-Guided Affordance Segmentation on Unseen Object CategoriesYicong Li 0004, Yiyang Chen, Zhenyuan Ma, Junbin Xiao, Xiang Wang 0010, Angela Yao. 22836-22845 [doi]
- Integrating Biological Knowledge for Robust Microscopy Image Profiling on De Novo Cell LinesJiayuan Chen 0003, Thai-Hoang Pham, Yuanlong Wang, Ping Zhang 0016. 22846-22856 [doi]
- LLaVA-Prumerge: Adaptive Token Reduction for Efficient Large Multimodal ModelsYuzhang Shang, Mu Cai, Bingxin Xu, Yong Jae Lee, Yan Yan 0002. 22857-22867 [doi]
- Task-Specific Zero-Shot Quantization-Aware Training for Object DetectionChanghao Li, Xinrui Chen, Ji Wang, Kang Zhao, Jianfei Chen. 22868-22878 [doi]
- CapeLLM: Support-Free Category-Agnostic Pose Estimation with Multimodal Large Language ModelsJunho Kim, Hyungjin Chung, Byung-Hoon Kim. 22889-22898 [doi]
- Aurelia: Test-Time Reasoning Distillation in Audio-Visual LLMsSanjoy Chowdhury, Hanan Gani, Nishit Anand, Sayan Nag, Ruohan Gao, Mohamed Elhoseiny, Salman Khan 0001, Dinesh Manocha. 22899-22910 [doi]
- HERMES: Temporal-Coherent Long-form Understanding with Episodes and SemanticsGueter Josmy Faure, Jia-Fong Yeh, Min-Hung Chen, Hung-Ting Su, Shang-Hong Lai, Winston H. Hsu. 22911-22921 [doi]
- HRScene: How Far are VLMs from Effective High-Resolution Image Understanding?Yusen Zhang 0001, Wenliang Zheng, Aashrith Madasu, Peng Shi 0010, Ryo Kamoi, Hao Zhou, Zhuoyang Zou, Shu Zhao 0006, Sarkar Snigdha Sarathi Das, Vipul Gupta, Xiaoxin Lu, Nan Zhang, Ranran Haoran Zhang, Avitej Iyer, Renze Lou, Wenpeng Yin 0001, Rui Zhang 0037. 22922-22933 [doi]
- Cycle Consistency as Reward: Learning Image-Text Alignment Without Human PreferencesHyojin Bahng, Caroline Chan, Frédo Durand, Phillip Isola. 22934-22946 [doi]
- Griffon v2: Advancing Multimodal Perception with High-Resolution Scaling and Visual-Language Co-ReferringYufei Zhan, Shurong Zheng, Yousong Zhu, Hongyin Zhao, Fan Yang 0089, Ming Tang 0001, Jinqiao Wang. 22947-22957 [doi]
- LVBench: An Extreme Long Video Understanding BenchmarkWeihan Wang, Zehai He, Wenyi Hong, Yean Cheng, Xiaohan Zhang, Ji Qi 0003, Ming Ding 0004, Xiaotao Gu, Shiyu Huang 0001, Bin Xu 0001, Yuxiao Dong, Jie Tang 0001. 22958-22967 [doi]
- Addressing Representation Collapse in Vector Quantized Models with One Linear LayerYongxin Zhu, Bocheng Li, Yifei Xin, Zhihua Xia, Linli Xu. 22968-22977 [doi]
- MultiADS: Defect-Aware Supervision for Multi-Type Anomaly Detection and Segmentation in Zero-Shot LearningYlli Sadikaj, Hongkuan Zhou, Lavdim Halilaj, Stefan Schmid 0002, Steffen Staab, Claudia Plant. 22978-22988 [doi]
- Debiasing Trace Guidance: Top-Down Trace Distillation and Bottom-up Velocity Alignment for Unsupervised Anomaly DetectionXingjian Wang, Li Chai, Jiming Chen 0001. 22989-22998 [doi]
- ODDR: Outlier Detection & Dimension Reduction Based Defense Against Adversarial PatchesNandish Chattopadhyay, Amira Guesmi, Muhammad Abdullah Hanif, Bassem Ouni, Muhammad Shafique 0001. 22999-23008 [doi]
- Similarity Memory Prior is All You Need for Medical Image SegmentationHao Tang, Zhiqing Guo, Liejun Wang, Chao Liu. 23009-23018 [doi]
- CARL: Causality-Guided Architecture Representation Learning for an Interpretable Performance PredictorHan Ji, Yuqi Feng, Jiahao Fan, Yanan Sun. 23019-23029 [doi]
- CalliReader: Contextualizing Chinese Calligraphy via an Embedding-Aligned Vision-Language ModelYuxuan Luo, Jiaqi Tang, Chenyi Huang, Feiyang Hao, Zhouhui Lian. 23030-23040 [doi]
- Boosting Vision Semantic Density with Anatomy Normality Modeling for Medical Vision-Language Pre-TrainingWeiwei Cao, Jianpeng Zhang, Zhongyi Shui, Sinuo Wang, Zeli Chen, Xi Li, Le Lu, Xianghua Ye, Tingbo Liang, Qi Zhang, Ling Zhang. 23041-23050 [doi]
- CoSMIC: Continual Self-Supervised Learning for Multi-Domain Medical Imaging Via Conditional Mutual Information MaximizationYihang Liu, Ying Wen 0003, Longzhen Yang, Lianghua He, Heng Tao Shen. 23051-23062 [doi]
- Generalized Few-Shot Point Cloud Segmentation via LLM-Assisted Hyper-Relation MatchingZhaoyang Li 0010, Yuan Wang 0064, Guoxin Xiong, Wangkai Li, Yuwen Pan, Tianzhu Zhang 0001. 23063-23073 [doi]
- Enhancing Partially Relevant Video Retrieval with Hyperbolic LearningJun Li 0131, Jinpeng Wang 0002, Chaolei Tan, Niu Lian, Long Chen 0016, Yaowei Wang 0001, Min Zhang 0005, Shu-Tao Xia, Bin Chen 0011. 23074-23084 [doi]
- Accelerate 3D Object Detection Models via Zero-Shot Attention Key PruningLizhen Xu, Xiuxiu Bai, Xiaojun Jia, Jianwu Fang, Shanmin Pang. 23085-23094 [doi]
- 2: Multi-Task Framework With Structure-Aware and Style-Adaptive Character Representation for Open-Set Chinese Text RecognitionYangfu Li, Hongjian Zhan, Qi Liu, Li Sun, Yu-Jie Xiong, Yue Lu 0001. 23095-23104 [doi]
- GroundingSuite: Measuring Complex Multi-Granular Pixel GroundingRui Hu, Lianghui Zhu, Yuxuan Zhang, Tianheng Cheng, Lei Liu 0049, Heng Liu, Longjin Ran, Xiaoxin Chen 0001, Wenyu Liu 0001, Xinggang Wang. 23105-23114 [doi]
- Always Skip AttentionYiping Ji, Hemanth Saratchandran, Peyman Moghadam, Simon Lucey. 23115-23123 [doi]
- Training-Free Class Purification for Open-Vocabulary Semantic SegmentationQi Chen 0013, Lingxiao Yang, Yun Chen, Nailong Zhao, Jianhuang Lai, Jie Shao, Xiaohua Xie. 23124-23134 [doi]
- SeaS: Few-Shot Industrial Anomaly Image Generation with Separation and Sharing Fine-TuningZhewei Dai, Shilei Zeng, Haotian Liu, Xurui Li, Feng Xue 0001, Yu Zhou 0016. 23135-23144 [doi]
- SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement LearningLin Zhang 0055, Xianfang Zeng, Kangcong Li, Gang Yu 0002, Tao Chen 0003. 23145-23155 [doi]
- One Trajectory, One Token: Grounded Video Tokenization Via Panoptic Sub-Object TrajectoryChenhao Zheng, Jieyu Zhang 0001, Mohammadreza Salehi, Ziqi Gao, Vishnu Iyengar, Norimasa Kobori, Quan Kong, Ranjay Krishna. 23156-23166 [doi]
- Breaking the Encoder Barrier for Seamless Video-Language UnderstandingHandong Li, Yiyuan Zhang, Longteng Guo, Xiangyu Yue, Jing Liu. 23167-23176 [doi]
- SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMsJiahui Wang, Zuyan Liu, Yongming Rao, Jiwen Lu. 23177-23187 [doi]
- SUB: Benchmarking CBM Generalization via Synthetic Attribute SubstitutionsJessica Bader, Leander Girrbach, Stephan Alaniz, Zeynep Akata. 23188-23198 [doi]
- CLIPeR: Hierarchically Improving Spatial Representation of CLIP for Open-Vocabulary Semantic SegmentationLin Sun, Jiale Cao, Jin Xie 0005, Xiaoheng Jiang, Yanwei Pang. 23199-23209 [doi]
- A Token-Level Text Image Foundation Model for Document UnderstandingTongkun Guan, Zining Wang, Pei Fu, Zhengtao Guo, Wei Shen 0002, Kai Zhou, Tiezhu Yue, Chen Duan, Hao Sun, Qianyi Jiang, Junfeng Luo, Xiaokang Yang 0001. 23210-23220 [doi]
- ReferevErything: Towards Segmenting Everything we can Speak of in VideosAnurag Bagchi, Zhipeng Bao, Yu-Xiong Wang, Pavel Tokmakov, Martial Hebert. 23221-23231 [doi]
- Continual Multiple Instance Learning with Enhanced Localization for Histopathological Whole Slide Image AnalysisByung-Hyun Lee, Wongi Jeong, Woojae Han, Kyoungbun Lee, Se Young Chun. 23232-23242 [doi]
- From Trial to Triumph: Advancing Long Video Understanding via Visual Context Sample Scaling and Self-Reward AlignmentYucheng Suo, Fan Ma, Linchao Zhu, Tianyi Wang, Fengyun Rao, Yi Yang 0001. 23243-23255 [doi]
- Cross-Architecture Distillation Made Simple with Redundancy SuppressionWeijia Zhang, Yuehao Liu, Wu Ran, Chao Ma. 23256-23266 [doi]
- HiMTok: Learning Hierarchical Mask Tokens for Image Segmentation with Large Multimodal ModelTao Wang, Changxu Cheng, Lingfeng Wang 0003, Senda Chen, Wuyue Zhao. 23267-23278 [doi]
- DC-TTA: Divide-and-Conquer Framework for Test-Time Adaptation of Interactive SegmentationJihun Kim, Hoyong Kwon, Hyeokjun Kweon, Wooseong Jeong, Kuk-Jin Yoon. 23279-23289 [doi]
- VISO: Accelerating In-Orbit Object Detection with Language-Guided Mask Learning and Sparse InferenceMeiqi Wang, Han Qiu. 23300-23310 [doi]
- KDA: Knowledge Diffusion Alignment with Enhanced Context for Video Temporal GroundingRan Ran 0001, Jiwei Wei, Shiyuan He, Zeyu Ma 0002, Chaoning Zhang, Ning Xie 0003, Yang Yang 0002. 23311-23320 [doi]
- PVChat: Personalized Video Chat with One-Shot LearningYufei Shi, Weilong Yan, Gang Xu, Yumeng Li, Yucheng Chen, Zhenxi Li, Fei Yu, Ming Li, Si Yong Yeo. 23321-23331 [doi]
- Unsupervised Histopathological Image Semantic Segmentation with Overlapping Patches Consistency ConstraintWentian Cai, Weizhao Weng, Zihao Huang, Yandan Chen, Siquan Huang, Ping Gao, Victor C. M. Leung, Ying Gao 0004. 23332-23341 [doi]
- How Do Optical Flow and Textual Prompts Collaborate to Assist in Audio-Visual Semantic Segmentation?Yujian Lee, Peng Gao, Yongqi Xu, Wentao Fan 0001. 23342-23352 [doi]
- UINavBench: A Framework for Comprehensive Evaluation of Interactive Digital AgentsHarsh Agrawal, Eldon Schoop, Xinlei Pan, Anuj Mahajan, Ari Seff, Di Feng, Ruijia Cheng, Andres Romero Mier Y. Teran, Esteban Gomez, Abhishek Sundararajan, Forrest Huang, Amanda Swearngin, Mohana Prasad Sathya Moorthy, Jeffrey Nichols 0001, Alexander Toshev. 23353-23363 [doi]
- Adapt Foundational Segmentation Models with Heterogeneous Searching SpaceLi Yi, Jie Hu, Songan Zhang, Guannan Jiang. 23364-23373 [doi]
- Viperson: Flexibly Generating Virtual Identity for Person Re-IdentificationXiao-Wen Zhang, Delong Zhang, Yi-Xing Peng, Zhi Ouyang, Jingke Meng, Wei-Shi Zheng 0001. 23374-23384 [doi]
- SpikePack: Enhanced Information Flow in Spiking Neural Networks with High Hardware CompatibilityGuobin Shen, Jindong Li 0001, Tenglong Li, Dongcheng Zhao, Yi Zeng 0001. 23385-23395 [doi]
- Towards Robustness of Person Search Against CorruptionsWoojung Son, Yoonki Cho, Guoyuan An, Chanmi Lee, Sung-Eui Yoon. 23408-23418 [doi]
- Toward Long-Tailed Online Anomaly Detection Through Class-Agnostic ConceptsChiao-An Yang, Kuan-Chuan Peng, Raymond A. Yeh. 23419-23430 [doi]
- PathFinder: A Multi-Modal Multi-Agent System for Medical Diagnostic Decision-Making Applied to HistopathologyFatemeh Ghezloo, Mehmet Saygin Seyfioglu, Rustin Soraki, Wisdom Oluchi Ikezogwo, Beibin Li, Tejoram Vivekanandan, Joann G. Elmore, Ranjay Krishna, Linda G. Shapiro. 23431-23441 [doi]
- Beyond [cls]: Exploring the True Potential of Masked Image Modeling RepresentationsMarcin Przewiezlikowski, Randall Balestriero, Wojciech Jasinski, Marek Smieja, Bartosz Zielinski 0001. 23442-23452 [doi]
- Bringing RNNs Back to Efficient Open-Ended Video UnderstandingWeili Xu, Enxin Song, Wenhao Chai, Xuexiang Wen, Tian Ye 0001, Gaoang Wang. 23453-23465 [doi]
- Scheduling Weight Transitions for Quantization-Aware TrainingJunghyup Lee, Jeimin Jeon, Dohyung Kim 0006, Bumsub Ham. 23466-23475 [doi]
- Revisiting Adversarial Patch Defenses on Object Detectors: Unified Evaluation, Large-Scale Dataset, and New InsightsJunhao Zheng, Jiahao Sun, Chenhao Lin, Zhengyu Zhao 0001, Chen Ma, Chong Zhang, Chao Shen 0001, Cong Wang 0001, Qian Wang 0002. 23476-23486 [doi]
- Harnessing Vision Foundation Models for High-Performance, Training-Free Open Vocabulary SegmentationYuheng Shi, Minjing Dong, Chang Xu. 23487-23497 [doi]
- A Visual Leap in Clip Compositionality Reasoning Through Generation of Counterfactual SetsZexi Jia, Chuanwei Huang, Hongyan Fei, Yeshuang Zhu, Zhiqiang Yuan, Ying Deng, Jiapei Zhang, Jinchao Zhang 0001, Jie Zhou 0016. 23498-23507 [doi]
- AcZeroTS: Active Learning for Zero-Shot Tissue Segmentation in Pathology ImagesJiao Tang, Junjie Zhou, Bo Qian, Peng Wan 0004, Yingli Zuo, Wei Shao 0005, Daoqiang Zhang. 23508-23518 [doi]
- TinyViM: Frequency Decoupling for Tiny Hybrid Vision MambaXiaowen Ma, Zhenliang Ni, Xinghao Chen 0001. 23519-23529 [doi]
- FALCON: Resolving Visual Redundancy and Fragmentation in High-Resolution Multimodal Large Language Models via Visual RegistersRenshan Zhang, Rui Shao 0001, Gongwei Chen, Miao Zhang 0022, Kaiwen Zhou 0001, Weili Guan, Liqiang Nie. 23530-23540 [doi]
- SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video DiscretizationZhentao Tan, Ben Xue, Jian Jia, Junhao Wang, Wencai Ye, Shaoyun Shi, Mingjie Sun, Wenjin Wu, Quan Chen 0006, Peng Jiang 0002. 23541-23550 [doi]
- Visual Relation Diffusion for Human-Object Interaction DetectionPing Cao, Yepeng Tang, Chunjie Zhang 0001, Xiaolong Zheng 0001, Chao Liang 0001, Yunchao Wei, Yao Zhao 0001. 23551-23560 [doi]
- Flow-MIL: Constructing Highly-expressive Latent Feature Space for Whole Slide Image Classification using Normalizing FlowYingfan Ma, Bohan An, Ao Shen, Mingzhi Yuan, Minghong Duan, Manning Wang. 23561-23570 [doi]
- Harmonyseg: Tubular Structure Segmentation With Deep-Shallow Feature Fusion and Growth-Suppression Balanced LossYi Huangi, Ke Zhang, Wei Liu 0127, Yuanyuan Wang, Vishal M. Patel, Le Lu 0001, Xu Han 0007, Dakai Jin, Ke Yan 0006. 23571-23581 [doi]
- CompCap: Improving Multimodal Large Language Models with Composite CaptionsXiaohui Chen, Satya Narayan Shukla, Mahmoud Azab, Aashu Singh, Qifan Wang 0001, David Yang, Shengyun Peng, Hanchao Yu, Shen Yan 0007, Xuewen Zhang, Baosheng He. 23582-23592 [doi]
- TOGA: Temporally Grounded Open-Ended Video QA with Weak SupervisionAyush Gupta, Anirban Roy, Rama Chellappa, Nathaniel D. Bastian, Alvaro Velasquez, Susmit Jha. 23593-23603 [doi]
- Stable Diffusion Models Are Secretly Good at Visual In-Context LearningTrevine Oorloff, Vishwanath Sindagi, Wele Gedara Chaminda Bandara, Ali Shafahi, Amin Ghiasi, Charan Prakash, Reza Ardekani. 23604-23613 [doi]
- FOLDER: Accelerating Multi-Modal Large Language Models with Enhanced PerformanceHaicheng Wang, Zhemeng Yu, Gabriele Spadaro, Chen Ju, Victor Quétu, Shuai Xiao, Enzo Tartaglione. 23614-23625 [doi]
- Language Decoupling with Fine-Grained Knowledge Guidance for Referring Multi-Object TrackingGuangyao Li, Siping Zhuang, Yajun Jian, Yan Yan 0001, Hanzi Wang. 23626-23635 [doi]
- Prompt Guidance and Human Proximal Perception for HOT Prediction with Regional Joint LossYuxiao Wang 0003, Yu Lei, Zhenao Wei, Weiying Xue, Xinyu Jiang, Nan Zhuang, Qi Liu 0005. 23636-23645 [doi]
- Prior2former - Evidential Modeling of Mask Transformers for Assumption-Free Open-World Panoptic SegmentationSebastian Schmidt 0006, Julius Körner, Dominik Fuchsgruber, Stefano Gasperini, Federico Tombari, Stephan Günnemann. 23646-23656 [doi]
- ViLLa: Video Reasoning Segmentation with Large Language ModelRongkun Zheng, Lu Qi 0001, Xi Chen 0072, Yi Wang 0074, Kun Wang, Hengshuang Zhao. 23667-23677 [doi]
- DynImg: Key Frames with Visual Prompts are Good Representation for Multi-Modal Video UnderstandingXiaoyi Bao, Chenwei Xie, Hao Tang 0005, Tingyu Weng, Xiaofeng Wang, Yun Zheng, Xingang Wang. 23678-23688 [doi]
- Object-Level Correlation for Few-Shot SegmentationChunlin Wen, Yu Zhang 0004, Jie Fan, Hongyuan Zhu 0002, Xiu-Shen Wei, Yijun Wang, Zhiqiang Kou, Shuzhou Sun. 23689-23699 [doi]
- Vision-Language Neural Graph Featurization for Extracting Retinal LesionsTaimur Hassan, Anabia Sohail, Muzammal Naseer, Naoufel Werghi. 23700-23709 [doi]
- SSVQ: Unleashing the Potential of Vector Quantization with Sign-SplittingShuaiting Li, Juncan Deng, Chengxuan Wang, Kedong Xu, Rongtao Deng, Hong Gu, Haibin Shen, Kejie Huang. 23710-23719 [doi]
- RadGPT: Constructing 3D Image-Text Tumor DatasetsPedro R. A. S. Bassi, Mehmet Can Yavuz, Ibrahim Ethem Hamamci, Sezgin Er, Xiaoxi Chen, Wenxuan Li, Bjoern Menze, Sergio Decherchi, Andrea Cavalli, Kang Wang 0016, Yang Yang 0009, Alan L. Yuille, Zongwei Zhou. 23720-23730 [doi]
- SPA: Efficient User-Preference Alignment against Uncertainty in Medical Image SegmentationJiayuan Zhu, JunDe Wu, Cheng Ouyang, Konstantinos Kamnitsas, J. Alison Noble. 23731-23740 [doi]
- CoStoDet-DDPM: Collaborative Training of Stochastic and Deterministic Models Improves Surgical Workflow Anticipation and RecognitionKaixiang Yang, Xin Li, Qiang Li, Zhiwei Wang. 23741-23751 [doi]
- LangBridge: Interpreting Image as a Combination of Language EmbeddingsJiaqi Liao, Yuwei Niu, Fanqing Meng, Hao Li 0069, Changyao Tian, Yinuo Du, Yuwen Xiong, Dianqi Li, Xizhou Zhu, Li Yuan, Jifeng Dai, Yu Cheng 0001. 23752-23762 [doi]
- Know Your Attention Maps: Class-specific Token Masking for Weakly Supervised Semantic SegmentationJoëlle Hanna, Damian Borth. 23763-23772 [doi]
- VideoMiner: Iteratively Grounding Key Frames of Hour-Long Videos via Tree-Based Group Relative Policy OptimizationXinye Cao, Hongcan Guo, Jiawen Qian, Guoshun Nan, Chao Wang, Yuqi Pan, Tianhao Hou, Xiaojuan Wang, Yutong Gao 0001. 23773-23783 [doi]
- SparseVILA: Decoupling Visual Sparsity for Efficient VLM InferenceSamir Khaki, Junxian Guo, Jiaming Tang, Shang Yang, Yukang Chen, Konstantinos N. Plataniotis, Yao Lu 0006, Song Han 0003, Zhijian Liu. 23784-23794 [doi]
- Unbiased Region-Language Alignment for Open-Vocabulary Dense PredictionYunheng Li, Yuxuan Li 0004, Quan-Sheng Zeng 0001, Wenhai Wang, Qibin Hou, Ming-Ming Cheng. 23795-23805 [doi]
- Signs as Tokens: A Retrieval-Enhanced Multilingual Sign Language GeneratorRonglai Zuo, Rolandos-Alexandros Potamias, Evangelos Ververas, Jiankang deng, Stefanos Zafeiriou. 23806-23816 [doi]
- Flow4Agent: Long-form Video Understanding via Motion Prior from Optical FlowRuyang Liu, Shangkun Sun, Haoran Tang, Wei Gao 0003, Ge Li 0002. 23817-23827 [doi]
- ZIM: Zero-Shot Image Matting for AnythingBeomyoung Kim, Chanyong Shin, Joonhyun Jeong, Hyungsik Jung, Se-Yun Lee, Sewhan Chun, Dong-Hyun Hwang, Joonsang Yu. 23828-23838 [doi]
- An OpenMind for 3D Medical Vision Self-supervised LearningTassilo Wald, Constantin Ulrich, Jonathan Suprijadi, Sebastian Ziegler, Michal Nohel, Robin Peretzke, Gregor Köhler, Klaus Maier-Hein. 23839-23879 [doi]
- Make Your Training Flexible: Towards Deployment-Efficient Video ModelsChenting Wang, Kunchang Li, Tianxiang Jiang, Xiangyu Zeng, Yi Wang, Limin Wang. 23880-23891 [doi]
- OmniSAM: Omnidirectional Segment Anything Model for UDA in Panoramic Semantic SegmentationDing Zhong, Xu Zheng 0002, Chenfei Liao, Yuanhuiyi Lyu, Jialei Chen 0001, Shengyang Wu, Linfeng Zhang 0001, Xuming Hu. 23892-23901 [doi]
- LawDIS: Language-Window-Based Controllable Dichotomous Image SegmentationXinyu Yan 0001, Meijun Sun, Ge-Peng Ji, Fahad Shahbaz Khan, Salman Khan 0001, Deng-Ping Fan. 23902-23911 [doi]
- Modaltune: Fine-Tuning Slide-Level Foundation Models with Multi-Modal Information for Multi-Task Learning in Digital PathologyVishwesh Ramanathan, Tony Xu, Pushpak Pati, Faruk Ahmed, Maged Goubran, Anne L. Martel. 23912-23923 [doi]
- VFLowOpt: A Token Pruning Framework for LMMs with Visual Information Flow-Guided OptimizationSihan Yang 0001, Runsen Xu, Chenhang Cui, Tai Wang, Dahua Lin, Jiangmiao Pang. 23924-23934 [doi]
- $\mathcal{D}$-Attn: Decomposed Attention for Large Vision-and-Language ModelsChia-Wen Kuo, Sijie Zhu, Fan Chen, Xiaohui Shen, Longyin Wen. 23935-23944 [doi]
- Open-Vocabulary Hoi Detection With Interaction-Aware Prompt and Concept CalibrationTing Lei 0001, Shaofeng Yin, Qingchao Chen, Yuxin Peng 0001, Yang Liu 0105. 23945-23957 [doi]
- AirCache: Activating Inter-Modal Relevancy KV Cache Compression for Efficient Large Vision-Language Model InferenceKai Huang, Hao Zou, Bochen Wang, Ye Xi, Zhen Xie, Hao Wang. 23958-23967 [doi]
- Minerva: Evaluating Complex Video ReasoningArsha Nagrani, Sachit Menon, Ahmet Iscen, Shyamal Buch, Ramin Mehran, Nilpa Jha, Anja Hauth, Yukun Zhu, Carl Vondrick, Mikhail Sirotenko, Cordelia Schmid, Tobias Weyand. 23968-23978 [doi]
- MPG-SAM 2: Adapting SAM 2 with Mask Priors and Global Context for Referring Video Object SegmentationFu Rong, Meng Lan, Qian Zhang 0009, Lefei Zhang. 23979-23989 [doi]
- Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMsJeongseok Hyun, Sukjun Hwang, Su Ho Han, Taeoh Kim, Inwoong Lee, Dongyoon Wee, Joon-Young Lee, Seon Joo Kim, Minho Shim. 23990-24000 [doi]
- Scaling Tumor Segmentation: Best Lessons from Real and Synthetic DataQi Chen 0014, Xinze Zhou, Chen Liu, Hao Chen 0011, Wenxuan Li, Zekun Jiang, Ziyan Huang, Yuxuan Zhao, Dexin Yu, Junjun He, Yefeng Zheng 0001, Ling Shao 0001, Alan L. Yuille, Zongwei Zhou. 24001-24013 [doi]
- TAViS: Text-bridged Audio-Visual Segmentation with Foundation ModelsZiyang Luo, Nian Liu 0002, Xuguang Yang, Salman Khan 0001, Rao Muhammad Anwer, Hisham Cholakkal, Fahad Shahbaz Khan, Junwei Han 0001. 24014-24023 [doi]
- Teaching AI the Anatomy Behind the Scan: Addressing Anatomical Flaws in Medical Image Segmentation with Learnable PriorYoung Seok Jeon, Hongfei Yang, Huazhu Fu, Mengling Feng. 24024-24033 [doi]
- CLIP-Adapted Region-to-Text Learning for Generative Open-Vocabulary Semantic SegmentationJiannan Ge, Lingxi Xie, Hongtao Xie, Pandeng Li, Sun-Ao Liu, Xiaopeng Zhang 0008, Qi Tian 0001, Yongdong Zhang 0001. 24034-24044 [doi]
- ConformalSAM: Unlocking the Potential of Foundational Segmentation Models in Semi-Supervised Semantic Segmentation with Conformal PredictionDanhui Chen, Ziquan Liu, Chuxi Yang, Dan Wang, Yan Yan 0006, Yi Xu 0008, Xiangyang Ji. 24045-24055 [doi]
- LIRA: Inferring Segmentation in Large Multi-Modal Models with Local Interleaved Region AssistanceZhang Li, Biao Yang, Qiang Liu, Shuo Zhang, Zhiyin Ma, Liang Yin, Linger Deng, Yabo Sun, Yuliang Liu, Xiang Bai. 24056-24067 [doi]
- SimMLM: A Simple Framework for Multi-Modal Learning with Missing ModalitySijie Li, Chen Chen 0001, Jungong Han. 24068-24077 [doi]
- Naver: a Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic ReasoningZhixi Cai, Fucai Ke, Simindokht Jahangard, Maria Garcia de la Banda, Reza Haffari, Peter J. Stuckey, Hamid Rezatofighi. 24078-24089 [doi]
- 3: a Training-Free Approach for List-Wise Frame Selection in Video-LlmsHui Sun, Shiyin Lu, Huanyu Wang, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Ming Li. 24090-24101 [doi]
- Toward Fair and Accurate Cross-Domain Medical Image Segmentation: a Vlm-Driven Active Domain Adaptation ParadigmHongqiu Wang, Wu Chen, Xiangde Luo, Zhaohu Xing, Lihao Liu, Jing Qin 0001, Shaozhi Wu, Lei Zhu 0003. 24102-24112 [doi]
- Incremental Few-Shot Semantic Segmentation Via Multi-Level Switchable Visual PromptsMaoxian Wan, Kaige Li, Qichuan Geng, Weimin Shi, Zhong Zhou. 24113-24122 [doi]
- TopoTTA: Topology-Enhanced Test-Time Adaptation for Tubular Structure SegmentationJiale Zhou 0001, Wenhan Wang, Shikun Li, Xiaolei Qu, Xin Guo, Yizhong Liu, Wenzhong Tang, Xun Lin, Yefeng Zheng 0001. 24123-24134 [doi]
- MUSE-VL: Modeling Unified VLM through Semantic Discrete EncodingRongchang Xie, Chen Du, Ping Song, Chang Liu. 24135-24146 [doi]
- Token-Efficient VLM: High-Resolution Image Understanding Via Dynamic Region ProposalYitong Jiang, Jinwei Gu, Tianfan Xue, Ka-Chun Cheung, Pavlo Molchanov 0001, Hongxu Yin, Sifei Liu. 24147-24158 [doi]
- Vision-Language Models Can't See the ObviousYasser Dahou, Ngoc Dung Huynh, Phuc H. Le-Khac, Wamiq Reyaz Para, Ankit Singh, Sanath Narayan. 24159-24169 [doi]
- VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory BridgesYuxuan Wang 0004, Yiqi Song, Cihang Xie, Yang Liu 0003, Zilong Zheng. 24170-24181 [doi]
- One Polyp Identifies All: One-Shot Polyp Segmentation with SAM via Cascaded Priors and Iterative Prompt EvolutionXinyu Mao, Xiaohan Xing, Fei Meng, Jianbang Liu 0002, Fan Bai 0008, Qiang Nie, Max Q.-H. Meng. 24182-24191 [doi]
- Region-Aware Anchoring Mechanism for Efficient Referring Visual GroundingShuyi Ouyang, Ziwei Niu, Hongyi Wang 0002, Yen-Wei Chen 0001, Lanfen Lin. 24192-24202 [doi]
- VTimeCoT: Thinking by Drawing for Video Temporal Grounding and ReasoningJinglei Zhang 0003, Yuanfan Guo, Rolandos-Alexandros Potamias, Jiankang deng, Hang Xu 0004, Chao Ma 0004. 24203-24213 [doi]
- Training-Free Industrial Defect Generation with Diffusion ModelsRuyi Xu, Yen-Tzu Chiu, Tai-I Chen, Oscar Chew, Yung-Yu Chuang, Wen-Huang Cheng. 24214-24223 [doi]
- Kaputt: A Large-Scale Dataset for Visual Defect DetectionSebastian Höfer, Dorian Fritz Henning, Artemij Amiranashvili, Douglas Morrison, Mariliza Tzes, Ingmar Posner, Marc Matvienko, Alessandro Rennola, Anton Milan. 24224-24233 [doi]
- Snakes and Ladders: Two Steps Up for VideoMambaHui Lu, Albert Ali Salah, Ronald Poppe. 24234-24244 [doi]
- ChatReID: Open-Ended Interactive Person Retrieval via Hierarchical Progressive Tuning for Vision Language ModelsKe Niu 0004, Haiyang Yu 0004, Mengyang Zhao, Teng Fu 0001, Siyang Yi, Wei Lu, Bin Li 0015, Xuelin Qian, Xiangyang Xue 0001. 24245-24254 [doi]
- Images as Noisy Labels: Unleashing the Potential of the Diffusion Model for Open-Vocabulary Semantic SegmentationFan Li, Xuanbin Wang, Xuan Wangi, Zhaoxiang Zhang, Yuelei Xu. 24255-24265 [doi]
- Auto-Vocabulary Semantic SegmentationOsman Ülger, Maksymilian Kulicki, Yuki Asano 0001, Martin R. Oswald. 24266-24275 [doi]
- SIC: Similarity-Based Interpretable Image Classification with Neural NetworksTom Nuno Wolf, Emre Kavak, Fabian Bongratz, Christian Wachinger. 24276-24285 [doi]
- Timeexpert: an Expert-Guided Video Llm for Video Temporal GroundingZuhao Yang, Yingchen Yu, Yunqing Zhao, Shijian Lu, Song Bai 0001. 24286-24296 [doi]
- Enrich and Detect: Video Temporal Grounding With Multimodal LlmsShraman Pramanick, Effrosyni Mavroudi, Yale Song, Rama Chellappa, Lorenzo Torresani, Triantafyllos Afouras. 24297-24308 [doi]
- When Pixel Difference Patterns Meet ViT: PiDiViT for Few-Shot Object DetectionHongliang Zhou, Yongxiang Liu, Canyu Mo, Weijie Li, Bowen Peng, Li Liu 0002. 24309-24318 [doi]
- Player-Centric Multimodal Prompt Generation for Large Language Model Based Identity-Aware Basketball Video CaptioningZeyu Xi, Haoying Sun, Yaofei Wu, Junchi Yan, Haoran Zhang, Lifang Wu, Liang Wang 0001, Changwen Chen. 24330-24339 [doi]
- Synchronizing Task Behavior: Aligning Multiple Tasks During Test-Time TrainingWooseong Jeong, Jegyeong Cho, YoungHo Yoon, Kuk-Jin Yoon. 24340-24350 [doi]
- Agreement Aware and Dissimilarity Oriented GLOMRu Zeng, Yan Song, Yang Zhang, Yanling Hu, Hui Yu. 24351-24359 [doi]
- Conditional Latent Diffusion Models for Zero-Shot Instance SegmentationMaximilian Ulmer, Wout Boerdijk, Rudolph Triebel, Maximilian Durner. 24360-24369 [doi]
- Embodied Image Captioning: Self-Supervised Learning Agents for Spatially Coherent Image DescriptionsTommaso Galliena, Tommaso Apicella, Stefano Rosa, Pietro Morerio, Alessio Del Bue, Lorenzo Natale. 24370-24379 [doi]
- From Objects to Events: Unlocking Complex Visual Understanding in Object Detectors Via LLM-guided Symbolic ReasoningYuhui Zeng, Haoxiang Wu, Wenjie Nie, Guangyao Chen, Xiawu Zheng, Yunhang Shen, Jun Peng 0007, Yonghong Tian 0001, Rongrong Ji. 24380-24391 [doi]
- 2 MIL: Synchronizing Semantic and Topological Causalities in Multiple Instance Learning for Robust and Interpretable Survival AnalysisMin Cen, Zhenfeng Zhuang, Yuzhe Zhang, Min Zeng, Baptiste Magnier, Lequan Yu, Hong Zhang, Liansheng Wang 0002. 24392-24401 [doi]
- GenHancer: Imperfect Generative Models are Secretly Strong Vision-Centric EnhancersShijie Ma, Yuying Ge, Teng Wang 0007, Yuxin Guo, Yixiao Ge, Ying Shan. 24402-24412 [doi]
- Breaking Grid Constraints: Dynamic Graph Reconstruction Network for Multi-Organ SegmentationJunhao Xiao, Yang Wei 0002, Jingyu Wang, Yongchao Wang, Xiuli Bi, Bin Xiao 0002. 24413-24422 [doi]
- MaskSAM: Auto-Prompt SAM with Mask Classification for Volumetric Medical Image SegmentationBin Xie, Hao Tang 0005, Bin Duan, Dawen Cai, Yan Yan 0002, Gady Agam. 24423-24433 [doi]
- Large-Scale Pre-Training for Grounded Video Caption GenerationEvangelos Kazakos, Cordelia Schmid, Josef Sivic. 24434-24444 [doi]
- Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual GroundingTa Duc Huy, Duy Anh Huynh, Yutong Xie 0001, Yuankai Qi, Qi Chen 0014, Phi-Le Nguyen, Sen Kim Tran, Son Lam Phung, Anton van den Hengel, Zhibin Liao, Minh-Son To, Johan W. Verjans, Vu Minh Hieu Phan. 24445-24455 [doi]
- PBCAT: Patch-Based Composite Adversarial Training Against Physically Realizable Attacks on Object DetectionXiao Li, Yiming Zhu, Yifan Huang, Wei Zhang, Yingzhe He, Jie Shi, Xiaolin Hu. 24456-24466 [doi]
- Emulating Self-attention with Convolution for Efficient Image Super-ResolutionDongheon Lee, Seokju Yun, Youngmin Ro. 24467-24477 [doi]
- RareCLIP: Rarity-Aware Online Zero-Shot Industrial Anomaly DetectionJianfang He, Min Cao, Silong Peng, Qiong Xie. 24478-24487 [doi]
- MEH: A Multi-Style Dataset and Toolkit for Advancing Egyptian Hieroglyph RecognitionMaksim Golyadkin, Valeria Rubanova, Aleksandr Utkov, Dmitry Nikolotov, Ilya Makarov. 24488-24496 [doi]
- Hybrid-Tower: Fine-Grained Pseudo-Query Interaction and Generation for Text-to-Video RetrievalBangxiang Lan, Ruobing Xie, Ruixiang Zhao, Xingwu Sun, Zhanhui Kang, Gang Yang 0001, Xirong Li 0001. 24497-24506 [doi]
- Unbiased Missing-Modality Multimodal LearningRuiting Dai, Chenxi Li, Yandong Yan, Lisi Mo, Ke Qin, Tao He 0007. 24507-24517 [doi]
- ViM-VQ: Efficient Post-Training Vector Quantization for Visual MambaJuncan Deng, Shuaiting Li, Zeyu Wang 0010, Kedong Xu, Hong Gu, Kejie Huang. 24518-24527 [doi]
- MolParser: End-to-End Visual Recognition of Molecule Structures in the WildXi Fang, Jiankun Wang 0011, Xiaochen Cai, Shangqian Chen, Shuwen Yang, Haoyi Tao, Nan Wang, Lin Yao 0003, Linfeng Zhang 0002, Guolin Ke. 24528-24538 [doi]
- SpiLiFormer: Enhancing Spiking Transformers with Lateral InhibitionZeQi Zheng, Yanchen Huang, Yingchao Yu, Zizheng Zhu, Junfeng Tang, Zhaofei Yu, Yaochu Jin. 24539-24548 [doi]
- B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal TokensZhuqiang Lu, Zhenfei Yin, Mengwei He, Zhihui Wang 0001, Zicheng Liu, Zhiyong Wang 0001, Kun Hu. 24549-24559 [doi]
- DM-EFS: Dynamically Multiplexed Expanded Features Set form for Robust and Efficient Small Object DetectionAashish Sharma. 24569-24579 [doi]
- DiffTell: A High-Quality Dataset for Describing Image Manipulation ChangesZonglin Di, Jing Shi 0005, Yifei Fan, Hao Tan, Alexander Black 0001, John P. Collomosse, Yang Liu. 24580-24590 [doi]
- YOLOE: Real-Time Seeing AnythiAo Wang, Lihao Liu, Hui Chen 0013, Zijia Lin, Jungong Han, Guiguang Ding. 24591-24602 [doi]
- Mixture-of-Scores: Robust Image-Text Data Valuation via Three Lines of CodeSitong Wu, Haoru Tan, Yukang Chen, Shaofeng Zhang, Jingyao Li 0001, Bei Yu 0001, Xiaojuan Qi 0001, Jiaya Jia. 24603-24614 [doi]
- Allowing Oscillation Quantization: Overcoming Solution Space Limitation in Low Bit-Width QuantizationWeiying Xie, Zihan Meng, Jitao Ma, Wenjin Guo, Haowei Li, Haonan Qin, Leyuan Fang, Yunsong Li 0001. 24615-24624 [doi]
- SuperDec: 3D Scene Decomposition with Superquadric PrimitivesElisabetta Fedele, Boyang Sun, Leonidas J. Guibas, Marc Pollefeys, Francis Engelmann. 24625-24635 [doi]
- Diffusion Image PriorHamadi Chihaoui, Paolo Favaro. 24636-24644 [doi]
- Spatially-Varying AutofocusYingsi Qin, Aswin C. Sankaranarayanan, Matthew O'Toole. 24645-24654 [doi]
- Towards Foundational Models for Single-Chip RadarTianshu Huang, Akarsh Prabhakara, Chuhan Chen, Jay Karhade, Deva Ramanan, Matthew O'Toole, Anthony Rowe 0001. 24655-24665 [doi]
- Event-Based Visual VibrometryXinyu Zhou, Peiqi Duan, Yeliduosi Xiaokaiti, Chao Xu 0006, Boxin Shi. 24666-24676 [doi]
- CorrCLIP: Reconstructing Patch Correlations in CLIP for Open-Vocabulary Semantic SegmentationDengke Zhang, Fagui Liu, Quan Tang 0001. 24677-24687 [doi]
- E-SAM: Training-Free Segment Every Entity ModelWeiming Zhang, Dingwen Xiao, Lei Chen, Lin Wang. 24688-24697 [doi]
- Online Reasoning Video Segmentation with Just-in-Time Digital TwinsYiqing Shen 0003, Bohan Liu, Chenjia Li, Lalithkumar Seenivasan, Mathias Unberath. 24698-24706 [doi]
- Easy3D: A Simple Yet Effective Method for 3D Interactive SegmentationAndrea Simonelli, Norman Müller, Peter Kontschieder. 24707-24716 [doi]
- ForestFormer3D: A Unified Framework for End-to-End Segmentation of Forest LiDAR 3D Point CloudsBinbin Xiang, Maciej Wielgosz, Stefano Puliti, Kamil Král, Martin Krucek, Azim Missarov, Rasmus Astrup. 24717-24727 [doi]
- $\mathbf{X}^{\mathbf{2}}$-Gaussian: 4D Radiative Gaussian Splatting for Continuous-Time Tomographic ReconstructionWeihao Yu, Yuanhao Cai, Ruyi Zha, Zhiwen Fan, Chenxin Li, Yixuan Yuan. 24728-24738 [doi]
- Inverse Image-Based Rendering for Light Field Generation From Single ImagesHyunjun Jung, Hae-Gon Jeon. 24739-24749 [doi]
- HyperGCT: A Dynamic Hyper-GNN-Learned Geometric Constraint for 3D RegistrationXiyu Zhang 0001, Jiayi Ma 0001, Jianwei Guo, Wei Hu, Zhaoshuai Qi, Fei Hui, Jiaqi Yang 0002, Yanning Zhang 0001. 24750-24759 [doi]
- CounterPC: Counterfactual Feature Realignment for Unsupervised Domain Adaptation on Point CloudsFeng Yang, Yichao Cao, Xiu Su, Dan Niu, Xuanpeng Li. 24760-24769 [doi]
- AD-GS: Object-Aware B-Spline Gaussian Splatting for Self-Supervised Autonomous DrivingJiawei Xu, Kai Deng, Zexin Fan, Shenlong Wang, Jin Xie 0001, Jian Yang 0003. 24770-24779 [doi]
- Evagaussians: Event Stream Assisted Gaussian Splatting from Blurry ImagesWangbo Yu, Chaoran Feng 0001, Jianing Li 0001, Jiye Tang, Jiashu Yang, Zhenyu Tang 0004, Meng Cao 0002, Xu Jia 0012, Yuchao Yang, Li Yuan 0007, Yonghong Tian 0001. 24780-24790 [doi]
- Axis-Level Symmetry Detection with Group-Equivariant RepresentationWongyun Yu, Ahyun Seo, Minsu Cho. 24791-24800 [doi]
- STD-GS: Exploring Frame-Event Interaction for SpatioTemporal-Disentangled Gaussian Splatting to Reconstruct High-Dynamic SceneHanyu Zhou, Haonan Wang, Haoyue Liu 0001, Yuxing Duan, Luxin Yan, Gim Hee Lee. 24801-24810 [doi]
- Monocular Semantic Scene Completion via Masked Recurrent NetworksXuzhi Wang, Xinran Wu, Song Wang 0019, Lingdong Kong, Ziping Zhao. 24811-24822 [doi]
- Orion: A Holistic End-To-End Autonomous Driving Framework by Vision-Language Instructed Action GenerationHaoyu Fu, Diankun Zhang, Zongchuang Zhao, Jianfeng Cui, Dingkang Liang, Chong Zhang, Dingyuan Zhang, Hongwei Xie, Bing Wang, Xiang Bai. 24823-24834 [doi]
- All in One: Visual-Description-Guided Unified Point Cloud SegmentationZongyan Han, Mohamed El Amine Boudjoghra, Jiahua Dong 0001, Jinhong Wang, Rao Muhammad Anwer. 24835-24845 [doi]
- Bolt3D: Generating 3D Scenes in SecondsStanislaw Szymanowicz, Jason Y. Zhang 0004, Pratul P. Srinivasan, RuiQi Gao, Arthur Brussee, Aleksander Holynski, Ricardo Martin-Brualla, Jonathan T. Barron, Philipp Henzler. 24846-24857 [doi]
- PossLoss: A Reliable and Sensitive Facial Landmark Detection Loss FunctionQikui Zhu. 24858-24867 [doi]
- Unsupervised Rgb-D Point Cloud Registration for Scenes With Low Overlap and Photometric InconsistencyYejun Shou, Haocheng Wang, Lingfeng Shen, Qian Zheng, Gang Pan 0001, Yanlong Cao. 24868-24877 [doi]
- Semantic Causality-Aware Vision-Based 3D Occupancy PredictionDubing Chen, Huan Zheng, Yucheng Zhou 0001, Xianfei Li, Wenlong Liao, Tao He, Pai Peng, Jianbing Shen. 24878-24888 [doi]
- U-ViLAR: Uncertainty-Aware Visual Localization for Autonomous Driving via Differentiable Association and RegistrationXiaofan Li, Zhihao Xu, Chenming Wu, Zhao Yang, Yumeng Zhang, Jiang-Jiang Liu 0001, Haibao Yu, Xiaoqing Ye, Yuan Wang, Shirui Li, Xun Sun, Ji Wan, Jun Wang. 24889-24898 [doi]
- Benchmarking Burst Super-Resolution for Polarization Images: Noise Dataset and AnalysisInseung Hwang, Kiseok Choi, Hyunho Ha, Min H. Kim 0001. 24899-24909 [doi]
- Group Inertial Poser: Multi-Person Pose and Global Translationfrom Sparse Inertial Sensors and Ultra-Wideband RangingYing Xue, Jiaxi Jiang, Rayan Armani, Dominik Hollidt, Yi-Chi Liao 0001, Christian Holz 0001. 24910-24921 [doi]
- DreamCube: RGB-D Panorama Generation via Multi-Plane SynchronizationYukun Huang, Yanning Zhou 0003, Jianan Wang, Kaiyi Huang, Xihui Liu. 24922-24932 [doi]
- OcRFDet: Object-Centric Radiance Fields for Multi-View 3D Object Detection in Autonomous DrivingMingqian Ji, Shanshan Zhang 0001, Jian Yang 0003. 24933-24942 [doi]
- GaussianFlowOcc: Sparse and Weakly Supervised Occupancy Estimation using Gaussian Splatting and Temporal FlowSimon Boeder, Fabian Gigengack, Benjamin Risse. 24943-24954 [doi]
- SG-LDM: Semantic-Guided LiDAR Generation via Latent-Aligned DiffusionZhengkang Xiang, Zizhao Li, Amir Khodabandeh, Kourosh Khoshelham. 24965-24976 [doi]
- LookOut: Real-World Humanoid Egocentric NavigationBoxiao Pan, Adam W. Harley, Francis Engelmann, C. Karen Liu, Leonidas J. Guibas. 24977-24988 [doi]
- PointGAC: Geometric-Aware Codebook for Masked Point Cloud ModelingAbiao Li, Chenlei Lv, Yuming Fang 0001, Yifan Zuo 0001, Jian Zhang 0002, Guofeng Mei. 24989-24998 [doi]
- Statistical Confidence Rescoring for Robust 3D Scene Graph Generation from Multi-View ImagesQi Xun Yeo, Yanyan Li, Gim Hee Lee. 24999-25008 [doi]
- PRM: Photometric Stereo Based Large Reconstruction ModelWenhang Ge, Jiantao Lin, Guibao Shen, Jiawei Feng, Tao Hu 0011, Xinli Xu, Ying-Cong Chen. 25009-25018 [doi]
- 4D Gaussian Splatting SLAMYanyan Li 0001, Youxu Fang, Zunjie Zhu, Kunyi Li, Yong Ding, Federico Tombari. 25019-25028 [doi]
- BillBoard Splatting (BBSplat): Learnable Textured Primitives for Novel View SynthesisDavid Svitov, Pietro Morerio, Lourdes Agapito, Alessio Del Bue. 25029-25039 [doi]
- Baking Gaussian Splatting Into Diffusion Denoiser for Fast and Scalable Single-Stage Image-to-3D Generation and ReconstructionYuanhao Cai, He Zhang 0004, Kai Zhang 0045, Yixun Liang, Mengwei Ren, Fujun Luan, Qing Liu 0017, Soo Ye Kim, Jianming Zhang 0001, Zhifei Zhang, YuQian Zhou, Yulun Zhang 0001, Xiaokang Yang 0001, Zhe Lin 0001, Alan L. Yuille. 25062-25072 [doi]
- Discretized Gaussian Representation for Tomographic ReconstructionShaokai Wu, Yuxiang Lu, Yapan Guo, Wei Ji, Suizhi Huang, Fengyu Yang, Shalayiding Sirejiding, Qichen He, Jing Tong, Yanbiao Ji, Yue Ding 0001, Hongtao Lu 0001. 25073-25082 [doi]
- SuperMat: Physically Consistent PBR Material Estimation at Interactive RatesYijia Hong, Yuan-Chen Guo, Ran Yi 0002, Yulong Chen, Yan-Pei Cao, Lizhuang Ma. 25083-25093 [doi]
- RI3D: Few-Shot Gaussian Splatting with Repair and Inpainting Diffusion PriorsAvinash Paliwal, Xilong Zhou 0001, Wei Ye 0008, Jinhui Xiong, Rakesh Ranjan, Nima Khademi Kalantari. 25094-25103 [doi]
- Dual-S3D: Hierarchical Dual-Path Selective SSM-CNN for High-Fidelity Implicit ReconstructionLuoxi Zhang, Pragyan Shrestha, Yu Zhou, Chun Xie, Itaru Kitahara. 25104-25113 [doi]
- FastPoint: Accelerating 3D Point Cloud Model Inference via Sample Point Distance Prediction