Abstract is missing.
- DreamAnywhere: Object-Centric Panoramic 3D Scene GenerationEdoardo A. Dominici, Jozef Hladky, Floor Verhoeven, Lukas Radl, Thomas Deixelberger, Stefan Ainetter, Philipp Drescher, Stefan Hauswiesner, Arno Coomans, Giacomo Nazzaro, Konstantinos Vardis, Markus Steinberger. 1-11 [doi]
- ViSTA: Visual Storytelling using Multi-modal Adapters for Text-to-Image Diffusion ModelsSibo Dong, Ismail Shaheen, Maggie Shen, Rupayan Mallick, Sarah Adel Bargal. 12-21 [doi]
- Odo: Depth-Guided Diffusion for Identity-Preserving Body ReshapingSiddharth Khandelwal, Sridhar Kamath, Arjun Jain. 22-31 [doi]
- BiPO: Bidirectional Partial Occlusion Network for Text-to-Motion SynthesisSeong-Eun Hong, Soobin Lim, Juyeong Hwang, Minwook Chang, HyeongYeop Kang. 32-42 [doi]
- Reinforcement Learning-based Adaptive Control of Classifier-Free Guidance and Timestep Embeddings in Diffusion ModelsHaochen You, Baojing Liu, Hongyang He. 43-53 [doi]
- TS-PCI: Point Cloud Frame Interpolation with Time-Aware Point Cloud Sampling and Self-Supervised Learning StrategyKohei Matsuzaki, Keisuke Nonaka. 54-65 [doi]
- Enhanced Back-Projection of Vision Features for 3D Symmetry DetectionIsaac Aguirre, Ivan Sipiran. 66-76 [doi]
- OracleGS: Grounding Generative Priors for Sparse-View Gaussian SplattingAtakan Topaloglu, Kunyi Li, Michael Niemeyer, Nassir Navab, A. Murat Tekalp, Federico Tombari. 77-87 [doi]
- UnderWater SLAM with Laser-light sectioning method using ST-GATHeyang Gao, Kazuto Ichimaru, Takafumi Iwaguchi, Hiroshi Kawasaki. 88-96 [doi]
- Leveraging Pretrained Representations for Cross-Modal Point Cloud CompletionKshitij Kale, Hrishikesh U, V. Sreenidhe, Shylaja S. S. 97-105 [doi]
- Referring Change Detection in Remote Sensing ImageryYilmaz Korkmaz, Jay N. Paranjape, Celso M. de Melo, Vishal M. Patel. 106-116 [doi]
- Inpaint360GS: Efficient Object-Aware 3D Inpainting via Gaussian Splatting for 360° ScenesShaoxiang Wang, Shihong Zhang, Christen Millerdurai, Rüdiger Westermann, Didier Stricker, Alain Pagani. 117-127 [doi]
- A Multi-Agent Diffusion Approach for MRI Anomaly Segmentation via Modality-Specific LoRA SpecializationWafa Al Ghallabi, Muhammad Zaigham Zaheer, Ritesh Thawkar, Omkar Thawakar, Salman Khan 0001, Fahad Shahbaz Khan. 128-137 [doi]
- GenHSI: Controllable Generation of Human-Scene Interaction VideosZekun Li 0002, Rui Zhou, Rahul Sajnani, Xiaoyan Cong, Daniel Ritchie, Srinath Sridhar 0002. 138-149 [doi]
- SymNet: A Multi-Task Network for Joint Radio Map Reconstruction and Transmitter LocalizationLyuzhou Ye, Thanh-Dat Le, Yan Huang 0002. 150-159 [doi]
- LooC: Effective Low-Dimensional Codebook for Compositional Vector QuantizationJie Li, Kwan-Yee K. Wong, Kai Han 0001. 160-170 [doi]
- End-to-End Fine-Tuning of 3D Texture Generation using Differentiable RewardsAmirHossein Zamani, Tianhao Xie, Amir G. Aghdam, Tiberiu Popa, Eugene Belilovsky. 171-180 [doi]
- IDEAL-M3D: Instance Diversity-Enriched Active Learning for Monocular 3D DetectionJohannes Meier, Florian Günther, Riccardo Marin, Oussema Dhaouadi, Jacques Kaiser, Daniel Cremers. 181-191 [doi]
- FAE-Net: Fashion Attribute Editing via Disentangled Latent Conditioning in Diffusion ModelsP. Rajith Bhargav, Gaurab Bhattacharya, Vivek B. S., Jayavardhana Gubbi. 192-201 [doi]
- DiT-VTON: Diffusion Transformer Framework for Unified Multi-Category Virtual Try-On and Virtual Try-All with Integrated Image EditingQi Li, Shuwen Qiu, Kee Kiat Koo, Julien Han, Karim Bouyarmane. 202-211 [doi]
- MAESTRO: Masked AutoEncoders for Multimodal, Multitemporal, and Multispectral Earth Observation DataAntoine Labatie, Michael Vaccaro, Nina Lardiere, Anatol Garioud, Nicolas Gonthier. 212-224 [doi]
- TA-Prompting: Enhancing Video Large Language Models for Dense Video Captioning via Temporal AnchorsWei-Yuan Cheng, Kai-Po Chang, Chi-Pin Huang, Fu-En Yang, Yu-Chiang Frank Wang. 225-235 [doi]
- Towards Fast and Scalable Normal Integration using Continuous ComponentsFrancesco Milano 0001, Jen Jen Chung, Lionel Ott, Roland Siegwart. 236-244 [doi]
- A Framework for Real-Time Surgical Phase Recognition with Application to Robot-Assisted Partial NephrectomyMarco Mezzina, Tom Vercauteren, Tinne Tuytelaars, Matthew B. Blaschko. 245-254 [doi]
- A Woman with a Knife or A Knife with a Woman? Measuring Directional Bias Amplification in Image CaptionsRahul Nair 0007, Bhanu Tokas, Hannah Kerner. 255-264 [doi]
- Forget Less by Learning Together through Concept ConsolidationArjun Ramesh Kaushik, Naresh Kumar Devulapally, Vishnu Suresh Lokhande, Nalini K. Ratha, Venu Govindaraju. 265-275 [doi]
- Action Anticipation at a Glimpse: To What Extent Can Multimodal Cues Replace Video?Manuel Benavent-Lledó, Konstantinos Bacharidis, Victoria Manousaki, Konstantinos E. Papoutsakis, Antonis A. Argyros, José García Rodríguez 0001. 276-286 [doi]
- VISTA: A Vision and Intent-Aware Social Attention Framework for Multi-Agent Trajectory PredictionStephane Da Silva Martins, Emanuel Aldea, Sylvie Le Hégarat-Mascle. 287-296 [doi]
- ChameleonTuner: Automatic ISP Color Tuning in Subjective ScenariosZijie Tan, Yuxin Yue, Bahador Rashidi. 297-307 [doi]
- ART: Actor-Related Tubelet for Detecting Complex-shaped Action TubesJiaojiao Zhao. 308-317 [doi]
- Training-free Multi-view 4D Human Motion Reconstruction Virtual Reality SystemYijie Li, Ce Zheng, Yijie He, Joel Julin, Ryosuke Ichikari, Satoki Ogiso, Satoshi Nakae, Akihiro Sato, Takeshi Kurata, László A. Jeni. 318-327 [doi]
- EmojiDiff: Advanced Facial Expression Control with High Identity Preservation in Portrait GenerationLiangwei Jiang, Ruida Li, Zhifeng Zhang, Shuo Fang, Chenguang Ma. 328-338 [doi]
- OW-Rep: Open World Object Detection with Instance Representation LearningSunoh Lee, Minsik Jeon, Jihong Min, Junwon Seo. 339-349 [doi]
- Cluster-Guided Adversarial Perturbations for Robust Contrastive LearningSeongyun Seo, Sungmin Han, Jeonghyun Lee, Sangkyun Lee. 350-359 [doi]
- A Universal Self-Attention Enhancement for Bridging Low-bit Quantization and Vision TransformersJiahe Qian, Peisong Wang, Zhengyang Zhuge, Qinghao Hu 0001, Jian Cheng 0001. 360-370 [doi]
- Overcoming Fine-Grained Visual Challenges in Animal Re-Identification via Semantic Feature AlignmentYihao Wu, Di Zhao, Yuzhuo Li, Matthew Alajas, Alistair S. Glen, Jingfeng Zhang, Gillian Dobbie, Daniel Wilson, Yun Sing Koh. 371-381 [doi]
- M4U: Evaluating Multilingual Understanding and Reasoning for Large Multimodal ModelsHongyu Wang, Jiayu Xu, Senwei Xie, Ruiping Wang 0001, Jialin Li, Zhaojie Xie, Bin Zhang, Chuyan Xiong, Xilin Chen 0001. 382-392 [doi]
- RAT4D: Rig and Animate Objects without Surface Templates in 4DMosam Dabhi, Simon Lucey, László A. Jeni. 393-401 [doi]
- AFL-PRF: Adaptive Federated Learning for Low-Quality Data: Enhancing Performance, Robustness, and FairnessPinrui Yu, Yiming Xie, Longtian Ye, Geng Yuan, Ningfang Mi, Xue Lin 0001. 402-411 [doi]
- Eff-GRot: Efficient and Generalizable Rotation Estimation with TransformersFanis Mathioulakis, Gorjan Radevski, Tinne Tuytelaars. 412-421 [doi]
- DreamMakeup: Face Makeup Customization using Latent Diffusion ModelsGeon Yeong Park, Inhwa Han, Serin Yang, Yeobin Hong, Seongmin Jeong, Heechan Jeon, Myeongjin Goh, Sung Won Yi, Jin Nam, Jong Chul Ye. 422-430 [doi]
- Morphing Through Time: Diffusion-Based Bridging of Temporal Gaps for Robust Alignment in Change DetectionSeyedehanita Madani, Vishal Patel 0001. 431-439 [doi]
- AdaptViG: Adaptive Vision GNN with Exponential Decay GatingMustafa Munir, Md Mostafijur Rahman, Radu Marculescu. 440-450 [doi]
- MooTrack360: A Novel Fisheye Camera Dataset for Robust Multi Dairy Cow Detection and TrackingRasmus G. K. Christiansen, Toan Van Nguyen 0002, Lasse Rose Malskær, Leon Bodenhagen, Dirk Kraft. 451-460 [doi]
- MDUNet: Multimodal Decoding UNet for Passive Occluder-Aided Non-line-of-sight 3D ImagingFadlullah Raji, John Murray-Bruce. 461-471 [doi]
- Interleaved Vision-and-Language Generation via Generative VokenKaizhi Zheng, Xuehai He, Xin Eric Wang. 472-482 [doi]
- Root Completion from Intraoral Scans of Tooth Crowns using Diffusion with Patch PerturbationYohan Jang, In-Seok Song, Seungjun Baek 0001. 483-492 [doi]
- Systematic Analysis of the Unintentional CSAM-Generation-Potential of Text-to-Image ModelsNicolas Göller, Martin Steinebach. 493-502 [doi]
- SGPMIL: Sparse Gaussian Process Multiple Instance LearningAndreas Lolos, Stergios Christodoulidis, Aris L. Moustakas, Jose Dolz, Maria Vakalopoulou. 503-513 [doi]
- Understanding Human-Like Biases in VLMs via Subjective Face AnalyticsChaitanya Roygaga, Aparna Bharati. 514-526 [doi]
- M-ErasureBench: A Comprehensive Multimodal Evaluation Benchmark for Concept Erasure in Diffusion ModelsJu-Hsuan Weng, Jia-Wei Liao, Cheng-Fu Chou, Jun-Cheng Chen. 527-536 [doi]
- Revisiting Layer Normalization for Point Cloud Test Time AdaptationMoslem Yazdanpanah, Ali Bahri, Mehrdad Noori, Sahar Dastani, Samuel Barbeau, David Osowiechi, Gustavo Adolfo Vargas Hakim, Ismail Ben Ayed, Christian Desrosiers. 537-546 [doi]
- Learning to Animate Images from A Few Videos to Portray Delicate Human ActionsHaoxin Li, Yingchen Yu, Qilong Wu, Hanwang Zhang, Song Bai 0001, Boyang Li 0001. 547-559 [doi]
- One-Shot Fine-Grained Re-Identification of Paint Marked Honey Bees using Vision Foundation ModelsLuke Meyers, Josué A. Rodríguez-Cordero, Rémi Mégret. 560-569 [doi]
- From Street to Orbit: Training-Free Cross-View Retrieval via Location Semantics and LLM GuidanceJeongho Min, Dongyoung Kim, Jaehyup Lee. 570-579 [doi]
- Mitigating Backdoor Attacks via Trigger Reconstruction and Model HardeningGuanhong Tao 0001, Siyuan Cheng 0005, Guangyu Shen, Yingqi Liu, Shengwei An, Zhuo Zhang 0002, Zhenting Wang, Hanxi Guo, Xiangyu Zhang 0001. 580-590 [doi]
- Network-agnostic distortion-robust projections for wide-angle image understandingAkshaya Athwale, Ola Ahmad, Jean-François Lalonde. 591-601 [doi]
- 4D-Animal: Freely Reconstructing Animatable 3D Animals from VideosShanShan Zhong, Jiawei Peng, Zehan Zheng, Zhongzhan Huang, Wufei Ma, Guofeng Zhang 0025, Qihao Liu, Alan L. Yuille, Jieneng Chen. 602-612 [doi]
- Text Slider: Efficient and Plug-and-Play Continuous Concept Control for Image/Video Synthesis via LoRA AdaptersPin-Yen Chiu, I-Sheng Fang, Jun-Cheng Chen. 613-622 [doi]
- Cluster-based Pseudo-labeling for Semi-Supervised LiDAR Semantic SegmentationQingju Guo, Shuang Li 0008, Jing Geng, Binhui Xie, Jiawei Shan, Wei Li 0111. 623-634 [doi]
- Human Pose Aggregation for Multi-View Temporal Video AlignmentFabien Delattre, Tsung-Wei Huang, Guan-Ming Su, Erik G. Learned-Miller. 635-646 [doi]
- Marshaled Learning: Bridging Large Neural Networks with Memory-Constrained Trusted Execution Environments in Federated LearningShiwei Ding, Xiaoyong Yuan, Zhenlin Wang 0003, Lan Emily Zhang, Giuseppe Ateniese. 647-656 [doi]
- Feature-Disentangling RGB-NIR Fusion Network for Remote Driver Physiological MeasurementTayssir Bouraffa, Ziyuan Wang, Daniel Strüber 0001. 657-666 [doi]
- Prompt-OT: An Optimal Transport Regularization Paradigm for Knowledge Preservation in Vision-Language Model AdaptationXiwen Chen, Wenhui Zhu, Peijie Qiu, Hao Wang 0176, Huayu Li, Haiyu Wu, Aristeidis Sotiras, Yalin Wang 0001, Abolfazl Razi. 667-676 [doi]
- Zero-Shot Video Deraining with Video Diffusion ModelsTuomas Varanka, Juan Luis Gonzalez 0001, Hyeongwoo Kim, Pablo Garrido 0001, Xu Yao. 677-687 [doi]
- Joint Modeling of Corruption-Driven and Information-Limited Uncertainty for Robust 3D Gaussian SplattingZeji Hui, Amirali Khodadadian Gostar, Weiqin Chuah, Alireza Bab-Hadiashar, Ruwan B. Tennakoon. 688-697 [doi]
- Data-Driven Lipschitz Continuity: A Cost-Effective Approach to Improve Adversarial RobustnessErh-Chung Chen, Pin-Yu Chen, I-Hsin Chung, Che-Rung Lee. 698-707 [doi]
- CADE: Continual Weakly-supervised Video Anomaly Detection with EnsemblesSatoshi Hashimoto, Tatsuya Konishi, Tomoya Kaichi, Kazunori Matsumoto, Mori Kurokawa. 708-717 [doi]
- PaRaChute: Pathology-Radiology Cross-Modal Fusion for Missing-Modality-Robust Survival PredictionPietro Caforio, Isabella Poles, Marco D. Santambrogio. 718-728 [doi]
- How to Design and Train Your Implicit Neural Representation for Video CompressionMatthew Gwilliam, Roy Zhang, Namitha Padmanabhan, Hongyang Du 0002, Abhinav Shrivastava. 729-739 [doi]
- Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?Annika Mütze, Sadia Ilyas, Christian Dörpelkus, Matthias Rottmann. 740-750 [doi]
- Conjuring Positive Pairs for Efficient Unification of Representation Learning and Image SynthesisImanol G. Estepa, Jesús M. Rodríguez-de-Vera, Ignacio Sarasúa, Bhalaji Nagarajan, Petia Radeva. 751-761 [doi]
- DICE: Discrete Inversion Enabling Controllable Editing for Masked Generative ModelsXiaoxiao He, Quan Dao, Ligong Han, Song Wen 0001, Minhao Bai, Di Liu 0003, Han Zhang 0010, Felix Juefei-Xu, Chaowei Tan, Bo Liu 0005, Martin Renqiang Min, Kang Li, Faez Ahmed, Akash Srivastava, Hongdong Li, JunZhou Huang, Dimitris N. Metaxas. 762-772 [doi]
- Deepfake Detection that Generalizes Across BenchmarksAndrii Yermakov, Jan Cech, Jiri Matas, Mario Fritz. 773-783 [doi]
- Unified Video Anomaly Detection Model for Detecting Different Anomaly TypesKijung Lee, Youngwan Jo, Sunghyun Ahn, Sanghyun Park. 784-794 [doi]
- SCORP: Scene-Consistent Object Refinement via Proxy Generation and TuningZiwei Chen, Ziling Liu, Zitong Huang, Mingqi Gao 0003, Feng Zheng 0001. 795-805 [doi]
- CountingDINO A Training-free Pipeline for Class-Agnostic Counting using Unsupervised BackbonesGiacomo Pacini, Lorenzo Bianchi 0001, Luca Ciampi, Nicola Messina, Giuseppe Amato 0001, Fabrizio Falchi. 806-815 [doi]
- ViGG: Robust RGB-D Point Cloud Registration using Visual-Geometric Mutual GuidanceCongjia Chen, Shen Yan, Yufu Qu. 816-826 [doi]
- Gaussian Representations for VideoSachin Shah, Anustup Choudhury, Guan-Ming Su, Jaclyn Pytlarz, Christopher A. Metzler, Trisha Mittal. 827-837 [doi]
- MSRTrack: LLM-Powered Object Tracking with Motion and Semantic ReasoningTong Shen, Di Wang 0003, José M. F. Moura. 838-848 [doi]
- Enabling High-Quality In-the-Wild Imaging from Severely Aberrated Metalens BurstsDebabrata Mandal, Zhihan Peng, Yujie Wang, Praneeth Chakravarthula. 849-859 [doi]
- Boosting Medical Vision-Language Pretraining via Momentum Self-Distillation under Limited Computing ResourcesPhuc Pham, Nhu Pham, Ngoc Quoc Ly. 860-868 [doi]
- Beyond Realism: Learning the Art of Expressive Composition with StickerNetHaoming Lu, David Kocharian, Humphrey Shi. 869-878 [doi]
- Analysis of Text Accuracy and Visual Alignment in Vision-Language Models for Artistic Text GenerationFatima Alderazi, Motaz Alfarraj. 879-887 [doi]
- MEDAL: multi-modal MEta-space Distillation and ALignment for Visual Compatibility LearningDween Rabius Sanny, Vinay Kumar Verma, Prateek Sircar, Deepak Gupta. 888-897 [doi]
- PS3: Part level instance segmentation in 3DHong-Xuan Yen, Chiamin Chen, Yanqing Wang, Yu-Lun Liu, Min Sun. 898-906 [doi]
- Saliency-Guided DETR for Moment Retrieval and Highlight DetectionAleksandr Gordeev, Vladimir Dokholyan, Irina Tolstykh, Maksim Kuprashevich. 907-916 [doi]
- Accelerated Dose Generation in Gamma Knife Radiosurgery Using a Wavelet Diffusion Model for Sparse RepresentationSangyoon Lee, Shubuendu Mishra, Yoichi Watanabe. 917-926 [doi]
- DermEVAL: A Dermatologist-Reviewed Benchmark for Multimodal Large Language ModelsHongjin Zhao, Weihao Li, Zhenyue Qin, Ge-Peng Ji, Yang Liu, Tom Gedeon, Nick Barnes. 927-937 [doi]
- SynPlay: Large-Scale Synthetic Human Data with Real-World Diversity for Aerial-View PerceptionJinsub Yim, Hyungtae Lee, Sungmin Eum, Yi-Ting Shen, Yan Zhang, Heesung Kwon, Shuvra S. Bhattacharyya. 938-947 [doi]
- Do generative video models understand physical principles?Saman Motamed, Laura Culp, Kevin Swersky, Priyank Jaini, Robert Geirhos. 948-958 [doi]
- ZonUI-3B: Competitive GUI Grounding with a 3B VLM Trained on a Single Consumer GPUZongHan Hsieh, ShengJing Yang, Tzer-jen Wei. 959-966 [doi]
- No MoCap Needed: Post-Training Motion Diffusion Models with Reinforcement Learning using Only Textual PromptsGirolamo Macaluso, Lorenzo Mandelli, Mirko Bicchierai, Stefano Berretti, Andrew D. Bagdanov. 967-976 [doi]
- MIX-based Foreground and Background Patch Augmentation Guided by Physics and Material Properties for X-ray DetectionXintong Liu, Dongliang Chang, Yujun Tong, Zhanyu Ma. 977-987 [doi]
- Reverse PersonalizationHan Wei Kung, Tuomas Varanka, Nicu Sebe. 988-999 [doi]
- Beyond the Encoder: Joint Encoder-Decoder Contrastive Pre-Training Improves Dense PredictionSébastien Quetin, Tapotosh Ghosh, Farhad Maleki. 1000-1010 [doi]
- HyperPose: Hyper-pose Embeddings for 3D-Aware Generative Models with Self-Supervised Disentangling of Pose and SceneMijeong Kim, Namgi Kim, Bohyung Han. 1011-1021 [doi]
- Learning Mask-Aware Offsets: Two-branch Deformable Attention Networks for Inpainting with Masked Region AvoidanceHyeongseok Oh, Joonki Paik. 1022-1031 [doi]
- Salience-SGG: Enhancing Unbiased Scene Graph Generation with Iterative Salience EstimationRunfeng Qu, Ole Hall, Pia Bideau, Julie Ouerfelli-Ethier, Martin Rolfs, Klaus Obermayer, Olaf Hellwich. 1032-1042 [doi]
- SmokeBench: Evaluating Multimodal Large Language Models for Wildfire Smoke DetectionTianye Qi, Weihao Li, Nick Barnes. 1043-1053 [doi]
- Visibility guided Self-Supervised Occlusion-Resilient Human Pose EstimationArindam Dutta, Sarosij Bose, Rohit Kundu, Calvin-Khang Ta, Saketh Bachu, Konstantinos Karydis, Amit K. Roy Chowdhury. 1054-1063 [doi]
- Diverse Sketch Colorization with Content-Enhanced Style Representation and Recolorization DistillationShuangming Mao, Haixiang Zhu. 1064-1073 [doi]
- GateFusion: Hierarchical Gated Cross-Modal Fusion for Active Speaker DetectionYu Wang, Juhyung Ha, Frangil M. Ramirez, Yuchen Wang, David J. Crandall. 1074-1083 [doi]
- MR-Pruner: Training-free Multi-resolution Visual Token Pruning for Multi-modal Large Language ModelsSeunghoon Han, Hyewon Lee, Soyoung Park, Jong-Ryul Lee, Sungsu Lim. 1084-1093 [doi]
- SpikeRain: Towards Energy-Efficient Single Image Deraining with Spiking Neural NetworksMd Tanvir Islam, Inzamamul Alam, Sambit Bakshi, Khan Muhammad 0001, Javier Del Ser, Sangtae Ahn. 1094-1105 [doi]
- MBTI: Metric-Based Textual Inversion for Fine-Grained Image GenerationByungkwan Chae, Youngjae Choi, Heewon Kim. 1106-1116 [doi]
- ImageNet-sES: A First Systematic Study of Sensor-Environment Simulation Anchored by Real RecapturesJi Yoon Kim, Eunsu Baek, Hyung-Sin Kim. 1117-1126 [doi]
- MomentMix Augmentation with Length-Aware DETR for Temporally Robust Moment RetrievalSeojeong Park, Jiho Choi, Kyungjune Baek, Hyunjung Shim. 1127-1136 [doi]
- From Lightweight CNNs to SpikeNets: Benchmarking Accuracy-Energy Tradeoffs with Pruned Spiking SqueezeNetRadib Bin Kabir, Tawsif Tashwar Dipto, Mehedi Ahamed, Sabbir Ahmed, Md. Hasanul Kabir. 1137-1146 [doi]
- AFRAgent : An Adaptive Feature Renormalization Based High Resolution Aware GUI agentNeeraj Anand, Rishabh Jain 0001, Sohan Patnaik, Balaji Krishnamurthy, Mausoom Sarkar. 1147-1158 [doi]
- BanglaProtha: Evaluating Vision Language Models in Underrepresented Long-tail Cultural ContextsMd Fahim, Md Sakib Ul Rahman Sourove, Akm Moshiur Rahman, Md Farhan Ishmam, Md Tasmim Rahman Adib, Fariha Tanjim Shifat, Fabiha Haider, Farhad Alam Bhuiyan. 1159-1169 [doi]
- CommonForms: A Large, Diverse Dataset for Form Field DetectionJoe Barrow. 1170-1179 [doi]
- Beyond Real Weights: Hypercomplex Representations for Stable QuantizationJawad Ibn Ahad, Maisha Rahman, Amrijit Biswas, Muhammad Rafsan Kabir, Robin Krambroeckers, Sifat Momen, Nabeel Mohammed, Shafin Rahman. 1180-1190 [doi]
- mEOL: Training-Free Instruction-Guided Multimodal Embedder for Vector Graphics and Image RetrievalKyeong Seon Kim, Seong-Eun Baek, JungMok Lee, Tae Hyun Oh. 1191-1200 [doi]
- Contrastive Integrated Gradients: A Feature Attribution-Based Method for Explaining Whole Slide Image ClassificationAnh Mai Vu, Tuan L. Vo, Ngoc Lam Quang Bui, Nam N. B. Le, Akash Awasthi, Huy Quoc Vo, Thanh Huy Nguyen, Zhu Han 0001, Chandra Mohan, Hien Van Nguyen. 1201-1210 [doi]
- PSA-MIL: A Probabilistic Spatial Attention-Based Multiple Instance Learning for Whole Slide Image ClassificationSharon Peled, Yosef E. Maruvka, Moti Freiman. 1211-1220 [doi]
- Fully Unsupervised Self-debiasing of Text-to-Image Diffusion ModelsKorada Sri Vardhana, Shrikrishna Lolla, Soma Biswas. 1221-1230 [doi]
- Model-free Domain Adaptation for Concealed Multimodal Large-Language ModelsYu Mitsuzumi, Akisato Kimura, Hisashi Kashima. 1231-1241 [doi]
- CAAC: Confidence-Aware Attention Calibration to Reduce Hallucinations in Large Vision-Language ModelsMehrdad Fazli, Bowen Wei, Ahmet Sari, Ziwei Zhu 0001. 1242-1251 [doi]
- LiDAR-DHMT: LiDAR-Adaptive Dual Hierarchical Mask Transformer for Robust Freespace Detection and Semantic SegmentationSiyu Chen 0004, Ting Han 0001, Changshe Zhang, Xin Luo, Huan Chen 0025, Meiliu Wu, Guorong Cai, Jinhe Su. 1252-1261 [doi]
- Mixed Diffusion for 3D Indoor Scene SynthesisSiyi Hu, Diego Martín Arroyo, Stephanie Debats, Fabian Manhardt, Luca Carlone, Federico Tombari. 1262-1272 [doi]
- PiSA: A Self-Augmented Data Engine and Training Strategy for 3D Understanding with Large ModelsZilu Guo, Hongbin Lin, Zhihao Yuan, Chaoda Zheng, Pengshuo Qiu, Dongzhi Jiang, Renrui Zhang, Chun-Mei Feng 0001, Zhen Li 0026. 1273-1283 [doi]
- MARS: a Multimodal Alignment and Ranking System for Few-Shot SegmentationNico Catalano, Stefano Samele, Paolo Pertino, Matteo Matteucci. 1284-1293 [doi]
- SilverLining: Data-First Mitigation of Spatial and Spectral Shortcuts Without Introducing New ConfoundersBalagopal Unnikrishnan, Michael Brudno, Chris McIntosh. 1294-1303 [doi]
- Distilling Diversity and Control in Diffusion ModelsRohit Gandikota, David Bau. 1304-1313 [doi]
- Narrating For You: Prompt-guided Audio-visual Narrating Face Generation Employing Multi-entangled Latent SpaceAashish Chandra K, Aashutosh A V, Abhijit Das 0001. 1314-1323 [doi]
- Explaining the Unseen: Multimodal Vision-Language Reasoning for Situational Awareness in Underground Mining DisastersMizanur Rahman Jewel, Mohamed Elmahallawy, Sanjay Madria, Samuel Frimpong. 1324-1333 [doi]
- FALCONEye: Finding Answers and Localizing Content in ONE-hour-long videos with multi-modal LLMsCarlos Plou, Cesar Borja, Ruben Martinez-Cantin, Ana C. Murillo. 1334-1344 [doi]
- Autocorrelation-based Fiducial Markers for TraceabilityIsmail Bencheikh, Max Dunitz, Marie d'Autume, Enric Meinhardt-Llopis, Marc Pic, Gabriele Facciolo, Pablo Musé. 1345-1354 [doi]
- GrounDiff: Diffusion-Based Ground Surface Generation from Digital Surface ModelsOussema Dhaouadi, Johannes Meier, Jacques Kaiser, Daniel Cremers. 1355-1364 [doi]
- QuadraNet V2: Efficient and Sustainable Training of High-Order Neural Networks with Quadratic AdaptationChenhui Xu, Fuxun Yu, Jinjun Xiong, Xiang Chen 0010. 1365-1373 [doi]
- AutoSew: A Geometric Approach to Stitching Prediction with Graph Neural NetworksPablo Ríos-Navarro, Elena Garces 0001, Jorge Lopez-Moreno. 1374-1383 [doi]
- SaccadeX: Directed Acyclic Graph-based Semi-Supervised Learning of Continuous Ocular Dynamics from Sparse Neuromorphic StreamsNuwan Sriyantha Bandara, Thivya Kandappu, Archan Misra. 1384-1394 [doi]
- Federated Model Synchronization for Diagnostic Redefinition through a Novel Selective Parameter UnlearningMayank Kumar Kundalwal, Mamta, Deepak Mishra 0003, Asif Ekbal. 1395-1404 [doi]
- A Fast, Simple, and Flexible Scale Informative Feature Transform Module for Arbitrary Scale Image Super-ResolutionAupendu Kar, Prabir Kumar Biswas. 1405-1414 [doi]
- MageBench: Bridging Large Multimodal Models to AgentsMiaosen Zhang, Qi Dai 0001, Yifan Yang 0004, Jianmin Bao, Dongdong Chen 0001, Kai Qiu, Chong Luo 0001, Xin Geng 0001, Baining Guo. 1415-1427 [doi]
- You May Speak Freely: Improving the Fine-Grained Visual Recognition Capabilities of Multimodal Large Language Models with Answer ExtractionLogan Lawrence, Oindrila Saha, Megan Wei, Chen Sun 0002, Subhransu Maji, Grant Van Horn. 1428-1437 [doi]
- InteracTalker: Prompt-Based Human-Object Interaction with Co-Speech Gesture GenerationSreehari Rajan, Kunal Bhosikar, Charu Sharma. 1438-1447 [doi]
- ITSELF: Attention Guided Fine-Grained Alignment for Vision-Language RetrievalTien-Huy Nguyen, Huu-Loc Tran, Thanh Duc Ngo. 1448-1458 [doi]
- MarineEval: Assessing the Marine Intelligence of Vision-Language ModelsYuk-Kwan Wong, Tuan-An To, Jipeng Zhang, Ziqiang Zheng, Sai Kit Yeung. 1459-1470 [doi]
- Identity Verification from Human Scent using Channel Representation of 2D Gas Chromatography-Mass Spectrometry DataRadim Spetlík, Jan Hlavsa, Jana Cechová, Petra Pojmanová, Jirí Matas, Stepán Urban. 1471-1480 [doi]
- milliMamba: Specular-Aware Human Pose Estimation via Dual mmWave Radar with Multi-Frame Mamba FusionNiraj Prakash Kini, Shiau-Rung Tsai, Guan-Hsun Lin, Wen-Hsiao Peng, Ching-Wen Ma, Jenq-Neng Hwang. 1481-1490 [doi]
- OpenCowID: Zero-Shot Visual Identification of Dairy CowsOmkar Prabhune, Younghyun Kim. 1491-1500 [doi]
- QCFace: Image Quality Control for boosting Face Representation & RecognitionDuc-Phuong Doan-Ngo, Thanh-Dang Diep, Thanh Nguyen-Duc, Thanh-Sach Le, Nam Thoai. 1501-1511 [doi]
- MMHOI: Modeling Complex 3D Multi-Human Multi-Object InteractionsKaen Kogashi, Anoop Cherian, Meng-Yu Jennifer Kuo. 1512-1521 [doi]
- BrightRate: Quality Assessment for User-Generated HDR VideosShreshth Saini, Bowen Chen, Yilin Wang 0001, Neil Birkbeck, Balu Adsumilli, Alan C. Bovik. 1522-1532 [doi]
- Reviving Unsupervised Optical Flow: Concept Reevaluation, Multi-Scale Advances and Full Open-Source ReleaseAzin Jahedi, Marc Rivinius, Noah Berenguel Senn, Andrés Bruhn. 1533-1542 [doi]
- UniCoRN: Latent Diffusion-based Unified Controllable Image Restoration Network across Multiple DegradationsDebabrata Mandal, Soumitri Chattopadhyay, Guansen Tong, Praneeth Chakravarthula. 1543-1553 [doi]
- DRWKV: Focusing on Object Edges for Low-Light Image EnhancementXuecheng Bai, Yuxiang Wang, Boyu Hu, Qinyuan Jie, Chuanzhi Xu, Kechen Li, Hongru Xiao, Vera Chung. 1554-1564 [doi]
- Layout Anything: One Transformer for Universal Room Layout EstimationMd Sohag Mia, Muhammad Abdullah Adnan. 1565-1574 [doi]
- BOP-Distrib: Revisiting 6D Pose Estimation Benchmarks for Better Evaluation under Visual AmbiguitiesBoris Meden, Asma Brazi, Fabrice Mayran de Chamisso, Steve Bourgeois, Vincent Lepetit. 1575-1585 [doi]
- Cosine Similarity is Almost All You Need (for Prototypical-Part Models)Luke Moffett, Frank Willard, Maximillian Machado, Emmanuel Mokel, Jon Donnelly, Zhicheng Guo, Adam Costarino, Julia Yang, Giyoung Kim, Alina Jade Barnett, Cynthia Rudin. 1586-1596 [doi]
- ORCA: Object Recognition and Comprehension for Archiving Marine SpeciesYuk-Kwan Wong, Haixin Liang, Zeyu Ma 0002, Yiwei Chen 0003, Ziqiang Zheng, Rinaldi Gotama, Pascal Sebastian, Lauren D. Sparks, Sai Kit Yeung. 1597-1609 [doi]
- Multimodal Medical Image Binding via Shared Text EmbeddingsYunhao Liu, Suyang Xi, Shiqi Liu, Hong Ding, Chicheng Jin, Chong Zhong, Junjun He, Catherine C. Liu, Yiqing Shen 0003. 1610-1620 [doi]
- PHYSPLAT: A Framework for Photorealistic Hybrid Simulation of Real and Synthetic Elements using 3D Gaussian SplattingMario Alfonso-Arsuaga, Henar Dominguez-Elvira, Jorge Casas-Guerrero, Andrea Castiella-Aguirrezabala, Lorenzo Costabile-Dominguez, Jorge García-González 0001, Maria Naranjo-Almeida, Marc Comino Trinidad, Jorge Lopez-Moreno. 1621-1631 [doi]
- ArchitectHead: Continuous Level of Detail Control for 3D Gaussian Head AvatarsPeizhi Yan, Rabab Ward, Qiang Tang 0002, Shan Du 0001. 1632-1642 [doi]
- Uncertainty-Aware Subset Selection for Robust Visual Explainability under Distribution ShiftsMadhav Gupta, Vishak Prasad, Ganesh Ramakrishnan. 1643-1652 [doi]
- The Perceptual Observatory Characterizing Robustness and Grounding in MLLMsTejas Anvekar, Fenil Denish Bardoliya, Pavan K. Turaga, Chitta Baral, Vivek Gupta 0001. 1653-1663 [doi]
- FAST-EQA: Efficient Embodied Question Answering with Global and Local Region RelevancyHaochen Zhang, Nirav Savaliya, Faizan Siddiqui, Enna Sachdeva. 1664-1673 [doi]
- RapidMV: Leveraging Spatio-Angular Latent Space for Efficient and Consistent Text-to-Multi-View SynthesisSeungwook Kim 0005, Yichun Shi, Kejie Li, Minsu Cho, Peng Wang 0001. 1674-1684 [doi]
- Diffusion-Based Authentication of Copy Detection Patterns: A Multimodal Framework with Printer Signature ConditioningBolutife Atoki, Iuliia Tkachenko, Bertrand Kerautret, Carlos Crispim Junior. 1685-1694 [doi]
- 2 : Analysis and Detection of Adversarial Threats in Visual Perception for End-to-End Autonomous Driving SystemsIshan Sahu, Somnath Hazra, Somak Aditya, Soumyajit Dey. 1695-1704 [doi]
- SSplain: Sparse and Smooth Explainer for Retinopathy of Prematurity ClassificationElifnur Sunger, Tales Imbiriba, J. Peter Campbell, Deniz Erdogmus, Stratis Ioannidis, Jennifer G. Dy. 1705-1715 [doi]
- Tables Guide Vision: Learning to See the Heart through Tabular DataMarta Hasny, Maxime Di Folco, Keno Bressem, Julia A. Schnabel. 1716-1725 [doi]
- SAFER-AiD: Saccade-Assisted Foveal-peripheral vision Enhanced Reconstruction for Adversarial DefenseJiayang Liu, Daniel Tso, Yiming Bu, Qinru Qiu. 1726-1735 [doi]
- Enhancing Object Detection Training via Joint Image-Annotation GenerationRoy Uziel, Oded Bialer. 1736-1745 [doi]
- Descrip3D: Enhancing Large Language Model-based 3D Scene Understanding with Object-Level Text DescriptionsJintang Xue, Ganning Zhao, Jie-En Yao, Hong-En Chen, Yue Hu, Meida Chen, Suya You, C. C. Jay Kuo. 1746-1756 [doi]
- From SAM to DINOv2: Towards Distilling Foundation Models to Lightweight Baselines for Generalized Polyp SegmentationShivanshu Agnihotri, Snehashis Majhi, Deepak Ranjan Nayak, Debesh Jha. 1757-1766 [doi]
- Not Like Transformers: Drop the Beat Representation for Dance Generation with Mamba-Based Diffusion ModelSangJune Park, Inhyeok Choi, Donghyeon Soon, Youngwoo Jeon, Kyungdon Joo. 1767-1776 [doi]
- BoxSplitGen: A Generative Model for 3D Part Bounding Boxes in Varying GranularityJuil Koo, Wei-Tung Lin, Chanho Park, Chanhyeok Park, Minhyuk Sung. 1777-1787 [doi]
- 3D Gaussian Point EncodersJim James, Benjamin Wilson 0001, Simon Lucey, James Hays. 1788-1797 [doi]
- HumanGuideNet: Adapter-Based Alignment of Deep Neural Networks with Human Similarity JudgmentsXufu Liu, Yifan Yang, Zhengxin Zhang. 1798-1808 [doi]
- Low-Rank Expert Merging for Multi-Source Domain Adaptation in Person Re-IdentificationTaha Mustapha Nehdi, Nairouz Mrabah, Atif Belal, Marco Pedersoli, Eric Granger. 1809-1819 [doi]
- MEGA-PCC: A Mamba-based Efficient Approach for Joint Geometry and Attribute Point Cloud CompressionKai Hsiang Hsieh, Monyneath Yim, Wen-Hsiao Peng, Jui-Chiu Chiang. 1820-1830 [doi]
- HyPCA-Net: Advancing Multimodal Fusion in Medical Image AnalysisJoy Dhar, Manish Kumar Pandey, Debashis Das Chakladar, Maryam Haghighat, Azadeh Alavi, Sajib Mistry, Nayyar Zaidi. 1831-1840 [doi]
- CycleSL: Server-Client Cyclical Update Driven Scalable Split LearningMengdi Wang 0002, Efe Bozkir, Enkelejda Kasneci. 1841-1851 [doi]
- 3DSceneEditor: Controllable 3D Scene Editing with Gaussian SplattingZiyang Yan, Yihua Shao, Minwen Liao, Siyu Chen 0021, Nan Wang, Muyuan Lin, Jenq-Neng Hwang, Hao Zhao 0002, Fabio Remondino, Lei Li 0050. 1852-1863 [doi]
- Segmentation-Aware Latent Diffusion for Satellite Image Super-Resolution: Enabling Smallholder Farm Boundary DelineationAditi Agarwal, Anjali Jain, Nikita Saxena, Ishan Deshpande, Michal Kazmierski, Abigail Annkah, Nadav Sherman, Karthikeyan Shanmugam 0001, Alok Talekar, Vaibhav Rajan. 1864-1874 [doi]
- mmWEAVER: Environment-Specific mmWave Signal Synthesis from a Photo and Activity DescriptionMahathir Monjur, Shahriar Nirjon. 1875-1884 [doi]
- Detection-Driven Object Count Optimization for Text-to-Image Diffusion ModelsOz Zafar, Yuval Cohen, Lior Wolf, Idan Schwartz. 1885-1894 [doi]
- Roadside Monocular 3D Detection Prompted by 2D DetectionYechi Ma, Wei Hua, Yanan Li, Shu Kong. 1895-1905 [doi]
- UniCalib: Targetless LiDAR-camera Calibration via Probabilistic Flow on Unified Depth RepresentationsShu Han, Xubo Zhu, Ji Wu 0012, Ximeng Cai, Wen Yang 0001, Huai-yu, Gui-Song Xia. 1906-1915 [doi]
- Color Bind: Exploring Color Perception in Text-to-Image ModelsShay Shomer Chai, Wenxuan Peng, Bharath Hariharan, Hadar Averbuch-Elor. 1916-1925 [doi]
- ASC: Learning Augmentation Severity-Consistent Representations Improves Generalization via Augmentation SearchAmirhossein Alamdar, Hossein Jafarinia, Mahdi Noori, Mohammad Hossein Rohban. 1926-1936 [doi]
- Detecting Out-of-Distribution Objects through Class-Conditioned InpaintingQuang Huy Nguyen, Jin Peng Zhou, Zhenzhen Liu, Khanh-Huyen Bui, Kilian Q. Weinberger, Wei-Lun Chao, Dung D. Le. 1937-1947 [doi]
- Snapmoji: Instant Generation of Animatable Dual-Stylized AvatarsEric Ming Chen, Di Liu 0003, Sizhuo Ma, Michael Vasilkovsky, Bing Zhou 0001, Qiang Gao, Wenzhou Wang, Jiahao Luo, Dimitris N. Metaxas, Vincent Sitzmann, Jian Wang 0100. 1948-1958 [doi]
- Seeing is Believing (and Predicting): Context-Aware Multi-Human Behavior Prediction with Vision Language ModelsUtsav Panchal, Yuchen Liu, Luigi Palmieri, Ilche Georgievski, Marco Aiello 0001. 1959-1968 [doi]
- False Alarm Rectification for Early Smoke SegmentationHongjin Zhao, Weihao Li, Ge-Peng Ji, Nick Barnes. 1969-1978 [doi]
- Interaction-via-Actions: Cattle Interaction Detection with Joint Learning of Action-Interaction Latent SpaceRen Nakagawa, Yang Yang 0124, Risa Shinoda, Hiroaki Santo, Kenji Oyama, Fumio Okura, Takenao Ohkawa. 1979-1988 [doi]
- Semi-Supervised Hierarchical Open-Set ClassificationErik Wallin, Fredrik Kahl, Lars Hammarstrand. 1989-1998 [doi]
- ClusterMine: Robust Label-Free Visual Out-Of-Distribution Detection via Concept Mining from Text CorporaNikolas Adaloglou, Diana Petrusheva, Mohamed Asker, Felix Michels, Markus Kollmann. 1999-2010 [doi]
- CURIO: Curvature-Aligned and Efficient OCR for Low-Resource Historical ManuscriptsSai Madhusudan Gunda, Tathagata Ghosh, Simran Singh Sandral, Ravi Kiran Sarvadevabhatla. 2011-2021 [doi]
- DoTA: Latent Distribution Conditioned Data Attribution for Diffusion ModelsNinad Joshi, Vivek Srivastava, Shirish S. Karande. 2022-2031 [doi]
- Learnable Query-Enhanced Pose TransformationYi-Zhen Wang, Hong-Han Shuai. 2032-2041 [doi]
- CAMP-VQA: Caption-Embedded Multimodal Perception for No-Reference Quality Assessment of Compressed VideoXinyi Wang 0011, Angeliki Katsenou, Junxiao Shen, David Bull 0001. 2042-2051 [doi]
- Evaluating Text-to-Image and Text-to-Video Synthesis with a Conditional Fréchet DistanceJaywon Koo, Jefferson Hernandez, Moayed Haji Ali, Ziyan Yang, Vicente Ordonez. 2052-2062 [doi]
- From Bands to Depth: Understanding Bathymetry Decisions on Sentinel-2Satyaki Roy Chowdhury, Aswathnarayan Radhakrishnan, Hari Subramoni. 2063-2072 [doi]
- Pyramidal Spectrum: Frequency-based Hierarchically Vector Quantized VAE for VideosTushar Prakash, Onkar Susladkar, Inderjit S. Dhillon, Sparsh Mittal. 2073-2082 [doi]
- PRISM-CAFO: Prior-conditioned Remote-sensing Infrastructure Segmentation and Mapping for CAFOsOishee Bintey Hoque, Nibir Chandra Mandal, Kyle Luong, Amanda Wilson, Samarth Swarup, Madhav V. Marathe, Abhijin Adiga. 2083-2093 [doi]
- Dressing the Imagination: A Dataset for AI-Powered Translation of Text into Fashion Outfits and A Novel NeRA Adapter for Enhanced Feature AdaptationGayatri Deshmukh, Somsubhra De, Chirag Sehgal, Jishu Sen Gupta, Sparsh Mittal. 2094-2103 [doi]
- EllipssianNet: Image-guided Sampling of 2D Gaussians for Gaussian SplattingMyoungGon Kim, Jeonghyeon Ahn, Seohyeon Park, Hyemi Kim, Seunghyun Park, Jung Ho Hwang, JungHyun Han. 2104-2113 [doi]
- Zero-Shot Coreset Selection via Iterative Subspace SamplingBrent A. Griffin, Jacob Marks, Jason J. Corso. 2114-2124 [doi]
- MorphXAI: An Explainable Framework for Morphological Analysis of Parasites in Blood Smear ImagesAqsa Yousaf, Sint Sint Win, Megan Coffee, Habeeb Olufowobi. 2125-2134 [doi]
- WWE-UIE: A Wavelet & White Balance Efficient Network for Underwater Image EnhancementChing-Heng Cheng, Jen-Wei Lee, Chia-Ming Lee, Chih-Chung Hsu. 2135-2145 [doi]
- SPAR-Det: Segmentation-guided and Prior-Aided Routing for Small Object DetectionSeungchan Kwon, Gyuil Lim, Youngjoon Han. 2146-2155 [doi]
- GeoHSAF: Geometric Hippocampus Shape Analysis Framework for Longitudinal Alzheimer's Disease ClassificationMubarak Olaoluwa, Heni Loukil, Arafet Sbei, Hassen Drira. 2156-2167 [doi]
- BAFIS: Dataset + Framework to assess occupational Bias and Human Preference in modern Text-to-image ModelsThomas Klassert, Adrian Ulges, Biying Fu. 2168-2177 [doi]
- Imitating the Functionality of Image-to-Image Models Using a Single ExampleNurit Spingarn, Tomer Michaeli. 2178-2187 [doi]
- Beyond the Highlights: Video Retrieval with Salient and Surrounding ContextsJaehun Bang, Moon Ye-Bin, Tae Hyun Oh, Kyungdon Joo. 2188-2197 [doi]
- SCORE: Soft Label Compression-Centric Dataset Condensation via Coding Rate OptimizationBowen Yuan, Yuxia Fu, Zijian Wang 0009, Yadan Luo, Zi Huang. 2198-2208 [doi]
- Sketch2Stitch: GANs for Abstract Sketch-Based Dress SynthesisFaizan Farooq Khan, Eslam Abdelrahman, Davide Morelli, Marcella Cornia, Rita Cucchiara, Mohamed Elhoseiny. 2209-2219 [doi]
- AnyBald: Toward Realistic Diffusion-Based Hair Removal In-The-WildYongJun Choi, Seungoh Han, Soomin Kim, Sumin Son, Mohsen Rohani, Edgar Maucourant, Dongbo Min, Kyungdon Joo. 2220-2230 [doi]
- Understanding Generative AI Capabilities in Everyday Image Editing TasksBrandon Collins, Mohammad Reza Taesiri, Logan Bolton, Viet Dac Lai, Franck Dernoncourt, Trung Bui, Anh Totti Nguyen. 2231-2241 [doi]
- Reconstructing Realistic and Relightable EyesWesley Khademi, Jogendra Kundu, Yatong An, Alexander Fix, David Colmenares. 2242-2252 [doi]
- 1LoRa: Summation Compression for Very Low-Rank AdaptationAlessio Quercia, Zhuo Cao, Arya Bangun, Richard D. Paul, Abigail Morrison, Ira Assent, Hanno Scharr. 2253-2262 [doi]
- Illuminating Darkness: Learning to Enhance Low-light Images In-the-WildS. M. A. Sharif, Abdur Rehman, Zain ul Abidin, Fayaz Ali Dharejo, Radu Timofte, Rizwan Ali Naqvi. 2263-2272 [doi]
- DOODLE: Diffusion-based Out-of-Distribution Learning for Open-set LiDAR Semantic SegmentationChanggyoon Oh, Hyeonseong Kim, Daehyun We, Jongoh Jeong, Yujeong Chae, Kuk-Jin Yoon. 2273-2283 [doi]
- RobustFormer: Noise-Robust Pre-training for Images and VideosAshish Bastola, Nishant Luitel, Hao Wang 0176, Danda Pani Paudel, Roshni Poudel, Abolfazl Razi. 2284-2294 [doi]
- CVP: Central-Peripheral Vision-Inspired Multimodal Model for Spatial ReasoningZeyuan Chen, Xiang Zhang 0015, Haiyang Xu 0002, Jianwen Xie, Zhuowen Tu. 2295-2305 [doi]
- Trajectory Tactics: When Transformers Learn Exploration to Generate Online SignatureAnurag Pandey 0004, Aditya Nigam, Arnav Bhavsar, Ashutosh Sharma, Basu Verma, Divya Acharya, Mohd Amir. 2306-2315 [doi]
- BrandFusion: Aligning Image Generation with Brand StylesParul Gupta, Varun Khurana, Yaman Kumar Singla, Balaji Krishnamurthy, Abhinav Dhall. 2316-2326 [doi]
- Intra-Class Probabilistic Embeddings for Uncertainty Estimation in Vision-Language ModelsZhenxiang Lin, Maryam Haghighat, Will Browne, Dimity Miller. 2327-2337 [doi]
- FARF-Net: Frequency-guided Adaptive Receptive Field Network for Edge-enhanced Polyp SegmentationXue Li, Aiwen Jiang, Hongqian Yu, Yang Xiao. 2338-2347 [doi]
- Discrete Facial Encoding: A Framework for Data-driven Facial Display DiscoveryMinh Tran 0004, Maksim Siniukov, Zhangyu Jin, Mohammad Soleymani 0001. 2348-2358 [doi]
- Knowledge to Sight: Reasoning over Visual Attributes via Knowledge Decomposition for Abnormality GroundingJun Li, Che Liu 0002, Wenjia Bai, Mingxuan Liu, Rossella Arcucci, Cosmin I. Bercea, Julia A. Schnabel. 2359-2369 [doi]
- DenseBEV: Transforming BEV Grid Cells into 3D ObjectsMarius Dähling, Sebastian Krebs, J. Marius Zöllner. 2370-2379 [doi]
- Human knowledge integrated multi-modal learning for single source domain generalizationAyan Banerjee 0001, Kuntal Thakur, Sandeep K. S. Gupta. 2380-2391 [doi]
- GraspDiffusion: Synthesizing Realistic Whole-body Hand-Object InteractionPatrick Kwon, Chen Chen, Hanbyul Joo. 2392-2403 [doi]
- ScoliGaitX: A Deep Multi-Modal Fusion Network for Scoliosis Assessment via Gait Video AnalysisKaushik Vishwakarma, Aditya Nigam. 2404-2413 [doi]
- Non-Contact Blood Pressure Estimation from Face Videos via Physiology-Aware Contrastive LearningJaeHyuk Son, Young-Seok Choi. 2414-2423 [doi]
- Ordinal-Aware Multimodal Engagement Recognition for Collaborative LearningNha Tran, Dat Ly, Phi Ta, Hung Nguyen 0001, Hien D. Nguyen 0002. 2424-2433 [doi]
- DynaGSLAM: Real-Time Gaussian-Splatting SLAM for Online Rendering, Tracking, Motion Predictions of Moving Objects in Dynamic ScenesRunfa Blark Li, Mahdi Shaghaghi, Keito Suzuki, Xinshuang Liu, Varun Moparthi, Bang Du, Walker Curtis, Martin Renschler, Ki Myung Brian Lee, Nikolay Atanasov 0001, Truong Q. Nguyen. 2434-2444 [doi]
- Test-Time Adaptation through Semantically-guided Feature Decomposition for Few-shot Chest X-ray DiagnosisJayant Mahawar, Angshuman Paul. 2445-2454 [doi]
- RobustGait: Robustness Analysis for Appearance Based Gait RecognitionReeshoon Sayera, Akash Kumar 0016, Sirshapan Mitra, Prudvi Kamtam, Yogesh S. Rawat. 2451-2552 [doi]
- FlowMorph: Revealing an Optimizable Flow Latent Space for Controlled Image MorphingYan Zheng, Yi Yang 0001, Lanqing Guo, Zhangyang Wang. 2455-2464 [doi]
- PVeRA: Probabilistic Vector-Based Random Matrix AdaptationLeo Fillioux, Enzo Ferrante, Paul-Henry Cournède, Maria Vakalopoulou, Stergios Christodoulidis. 2465-2474 [doi]
- Harnessing Object Grounding for Time-Sensitive Video UnderstandingTz-Ying Wu, Sharath Nittur Sridhar, Subarna Tripathi. 2475-2484 [doi]
- TaxonRL: Reinforcement Learning with Intermediate Rewards for Interpretable Fine-Grained Visual ReasoningMaximilian von Klinski, Maximilian Schall. 2485-2498 [doi]
- Revisiting Retentive Networks for Fast Range-View 3D LiDAR Semantic SegmentationSimone Mosco, Daniel Fusaro, Wanmeng Li, Alberto Pretto. 2499-2509 [doi]
- Zero-shot Hierarchical Plant Segmentation via Foundation Segmentation Models and Text-to-image AttentionJunhao Xing, Ryohei Miyakawa, Yang Yang 0124, Xinpeng Liu 0007, Risa Shinoda, Hiroaki Santo, Yosuke Toda, Fumio Okura. 2510-2519 [doi]
- Moiré Zero: An Efficient and High-Performance Neural Architecture for Moiré RemovalSeungryong Lee, Woojeong Baek, Younghyun Kim, Eunwoo Kim, Haru Moon, Donggon Yoo, Eunbyung Park. 2520-2530 [doi]
- LENVIZ: A High-Resolution Low-Exposure Night Vision Benchmark DatasetManjushree B. Aithal, Rosaura G. VidalMata, Manikandtan Kartha, Gong Chen, Eashan Adhikarla, Lucas N. Kristen, Zhicheng Fu, Nikhil A. Madusudhana, Joe Nasti. 2531-2540 [doi]
- A-V Representation Learning via Audio Shift Prediction for Multimodal Deepfake Detection and Temporal LocalizationAshutosh Anshul, Eng Siong Chng, Deepu Rajan. 2553-2563 [doi]
- CraftSVG: Multi-Object Text-to-SVG Synthesis via Layout Guided DiffusionAyan Banerjee 0002, Nityanand Mathur, Josep Lladós 0001, Umapada Pal 0001, Anjan Dutta 0001. 2564-2574 [doi]
- Shift-Equivariant Complex-Valued Convolutional Neural NetworksQuentin Gabot, Teck-Yian Lim, Jérémy Fix, Joana Frontera-Pons, Chengfang Ren, Jean Philippe Ovarlez. 2575-2584 [doi]
- ObjectMeshDeform : Towards recovering precise 3D geometry of real objects via image-guided mesh deformation of 3D generative priorsSiddharth Katageri, Sanjana Sinha, Sourav Ghosh, Soumyadip Maity, Brojeshwar Bhowmick. 2585-2595 [doi]
- Memory-Augmented Representation for Efficient Event-based Visuomotor Policy Learning with Adaptive Perception and ControlUday Kamal, Saibal Mukhopadhyay. 2596-2605 [doi]
- PADM: A Physics-aware Diffusion Model for Attenuation CorrectionTrung-Kien Pham, Hoang Minh Vu, Anh Duc Chu, Dac Thai Nguyen, Trung Thanh Nguyen 0006, Thao-Nguyen Truong, Hong Son Mai, Phi-Le Nguyen. 2606-2615 [doi]
- NerVast: Compression-Efficient Scaling of Implicit Neural Video Representations via Scene-based Parameter-sharingYunheon Lee, Juncheol Ye, Jaehong Kim 0002, Dongsu Han. 2616-2625 [doi]
- CineVerse: Consistent Keyframe Synthesis for Cinematic Scene CompositionQuynh Phung, Long Mai, Fabian David Caba Heilbron, Feng Liu 0015, Jia-Bin Huang 0001, Cusuh Ham. 2626-2636 [doi]
- MMCM: Multimodality-aware Metric using Clustering-based Modes for Probabilistic Human Motion PredictionKyotaro Tokoro, Hiromu Taketsugu, Norimichi Ukita. 2637-2647 [doi]
- Face-LLaVA: Facial Expression and Attribute Understanding through Instruction TuningAshutosh Chaubey, Xulang Guan, Mohammad Soleymani 0001. 2648-2660 [doi]
- ConsensusXAI: A framework to examine class-wise agreement in medical imagingAbbas Haider, David Wright, Ruth E. Hogg, Hui Wang 0001, Tunde Peto, Richard Gault. 2661-2669 [doi]
- Real-Time Tracking of Flexible Markers in Low-Contrast Fluoroscopy Using a Deep Neural Network Trained Solely on Synthetic DataTomoki Uchiyama, Yukinobu Sakata, Ryusuke Hirai, Hitoshi Ishikawa, Shinichiro Mori. 2670-2679 [doi]
- OpenLVLM-MIA: A Controlled Benchmark Revealing the Limits of Membership Inference Attacks on Large Vision-Language ModelsRyoto Miyamoto, Xin Fan 0011, Fuyuko Kido, Tsuneo Matsumoto, Hayato Yamana. 2680-2689 [doi]
- DMAT: An End-to-End Framework for Joint Atmospheric Turbulence Mitigation and Object DetectionPaul R. Hill, Zhiming Liu, Alin Achim, David Bull 0001, Nantheera Anantrasirichai. 2690-2699 [doi]
- Divide and Refine: Enhancing Multimodal Representation and Explainability for Emotion Recognition in ConversationAnh-Tuan Mai, Cam-Van Thi Nguyen, Duc-Trong Le. 2700-2709 [doi]
- iMotion-LLM: Instruction-Conditioned Trajectory GenerationAbdulwahab Felemban, Nussair Hroub, Jian Ding 0001, Eslam Abdelrahman, Xiaoqian Shen, Abduallah A. Mohamed, Mohamed Elhoseiny. 2710-2720 [doi]
- SasMamba: A Lightweight Structure-Aware Stride State Space Model for 3D Human Pose EstimationHu Cui, Wenqiang Hua, RenJing Huang, Shurui Jia, Tessai Hayama. 2721-2730 [doi]
- SUGAR: A Sweeter Spot for Generative Unlearning of Many IdentitiesDung Thuy Nguyen, Quang Nguyen, Preston K. Robinette, Eli Jiang, Taylor T. Johnson, Kevin Leach. 2731-2740 [doi]
- Mitigating the Modality Gap: Few-Shot Out-of-Distribution Detection with Multi-modal Prototypes and Image Bias EstimationYimu Wang, Evelien Riddell, Adrian Chow, Sean Sedwards, Krzysztof Czarnecki 0001. 2741-2751 [doi]
- Matching Semantically Similar Non-Identical ObjectsYusuke Marumo, Kazuhiko Kawamoto, Satomi Tanaka, Shigenobu Hirano, Hiroshi Kera. 2752-2764 [doi]
- UI-Styler: Ultrasound Image Style Transfer with Class-Aware Prompts for Cross-Device Diagnosis Using a Frozen Black-Box Inference NetworkNhat-Tuong Do-Tran, Ngoc-Hoang-Lam Le, Ching-Chun Huang. 2765-2774 [doi]
- Tables Decoded: DELTA for Structure, TarQA for UnderstandingJahanvi Rajput, Dhruv Kudale, Saikiran Kasturi, Utkarsh Verma, Ganesh Ramakrishnan. 2775-2785 [doi]
- What Happens When: Learning Temporal Orders of Events in VideosDaechul Ahn, Yura Choi, Hyeonbeom Choi, Seongwon Cho, San Kim, Jonghyun Choi. 2786-2796 [doi]
- UNO: Unifying One-stage Video Scene Graph Generation via Object-Centric Visual Representation LearningHuy Le 0001, Nhat Chung, Tung Kieu, Jingkang Yang, Ngan Le. 2797-2807 [doi]
- Personalized Image Privacy Advisors via Federated Daisy-ChainingSourasekhar Banerjee, Vengateswaran Subramaniam, Debaditya Roy, Vigneshwaran Subbaraju, Monowar Bhuyan. 2808-2817 [doi]
- DiRe: Diversity-promoting Regularization for Dataset CondensationSaumyaranjan Mohanty, Aravind Reddy, Konda Reddy Mopuri. 2818-2827 [doi]
- Vision-informed Semantic Text Alignment for Open-set Recognition in Remote SensingSiddhant Gole, Akash Pal, Ankit Jha, Subhasis Chaudhuri, Biplab Banerjee. 2828-2837 [doi]
- Anatomy-VLM: A Fine-grained Vision-Language Model for Medical InterpretationDifei Gu, Yunhe Gao, Mu Zhou, Dimitris N. Metaxas. 2838-2847 [doi]
- Temporal Object Captioning for Street Scene Videos from LiDAR TracksVignesh Gopinathan, Urs Zimmermann, Michael Arnold, Matthias Rottmann. 2848-2857 [doi]
- STARS: Self-supervised Tuning for 3D Action Recognition in Skeleton SequencesSoroush Mehraban, Mohammad Javad Rajabi, Andrea Iaboni, Babak Taati. 2858-2868 [doi]
- RAVU: Retrieval Augmented Video Understanding with Compositional Reasoning over GraphSameer Malik, Ayush Singh, Moyuru Yamada, Dishank Aggarwal. 2869-2878 [doi]
- Conditional Text-to-Image Generation with Reference GuidanceTaewook Kim, Ze Wang 0008, Zhengyuan Yang, Jiang Wang 0012, Lijuan Wang, Zicheng Liu 0001, Qiang Qiu 0001. 2879-2889 [doi]
- Improved Wildfire Spread Prediction with Time-Series Data and the WSTS+ BenchmarkSaad Lahrichi, Jake Bova, Jesse Johnson, Jordan M. Malof. 2890-2900 [doi]
- From Few-Shot to Zero-Shot Pallet Load Recognition: A Deployed Embedding-Based Vision System for Industrial LogisticsJuan Jesús Losada Del Olmo, Emilio Pardo Ballesteros, Pedro E. López-de-Teruel, Alberto Ruiz. 2901-2911 [doi]
- Graph-Based Spectral Attention with Multi-Spectral Images for Illuminant EstimationDong-Hoon Kang, Seung-Yeop Baek, Jong-Ok Kim. 2912-2922 [doi]
- Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated ProcessingSaarthak Kapse, Robin Betz, Srinivasan Sivanandan. 2923-2933 [doi]
- Extreme Amodal Face DetectionChanglin Song, Yunzhong Hou, Michael Randall Barnes, Rahul Shome, Dylan Campbell. 2934-2943 [doi]
- ENCORE: A Neural Collapse Perspective on Out-of-Distribution Detection in Deep Neural NetworksA. Q. M. Sazzad Sayyed, Nathaniel D. Bastian, Francesco Restuccia 0001. 2944-2953 [doi]
- Performance of Conformal Prediction in Capturing Aleatoric UncertaintyMisgina Tsighe Hagos, Claes Lundström. 2954-2963 [doi]
- Scalpel: Fine-Grained Alignment of Attention Activation Manifolds via Mixture Gaussian Bridges to Mitigate Multimodal HallucinationZiqiang Shi, Rujie Liu, Shanshan Yu, Satoshi Munakata, Koichi Shirahata. 2964-2973 [doi]
- Unified Alignment Protocol: Making Sense of the Unlabeled Data in New DomainsSabbir Ahmed, Mamshad Nayeem Rizve, Abdullah Al Arafat, Jacqueline Tiffany Liu, Rahim Hossain, Mohaiminul Al Nahian, Adnan Siraj Rakin. 2974-2983 [doi]
- Feedback Alignment Meets Low-Rank Manifolds: A Structured Recipe for Local LearningArani Roy, Marco Paul E. Apolinario, Shristi Das Biswas, Kaushik Roy 0001. 2984-2992 [doi]
- Learning from Unknown for Open-Set Test-Time AdaptationTaki Hasan Rafi, Amit Agarwal, Hitesh Laxmichand Patel, Dong-Kyu Chae. 2993-3004 [doi]
- Streaming Real-Time Trajectory Prediction Using Endpoint-Aware ModelingAlexander Prutsch, David Schinagl, Horst Possegger. 3005-3014 [doi]
- StreetView-Waste: A Multi-Task Dataset for Urban Waste ManagementDiogo J. Paulo, João Martins, Hugo Proença 0001, João C. Neves 0001. 3015-3025 [doi]
- AnyAnomaly: Zero-Shot Customizable Video Anomaly Detection with LVLMSunghyun Ahn, Youngwan Jo, Kijung Lee, Sein Kwon, Inpyo Hong, Sanghyun Park 0003. 3026-3035 [doi]
- SkelSplat: Robust Multi-view 3D Human Pose Estimation with Differentiable Gaussian RenderingLaura Bragagnolo, Leonardo Barcellona, Stefano Ghidoni. 3036-3046 [doi]
- Evaluating the Capability of Video Question Generation for Expert Knowledge ElicitationHuaying Zhang, Atsushi Hashimoto 0001, Tosho Hirasawa. 3047-3056 [doi]
- Dragonite: Single-Step Drag-based Image Editing with Geometric-Semantic GuidanceMeng-Ting Jhong, Tai-Ming Huang, Shung-Fu Chen, Wen-Huang Cheng, Kai-Lung Hua. 3057-3066 [doi]
- Augmenting with NeRFs: Fast Relocalization on Densified DatasetsMichael Tomadakis, Rebecca Borissova, Yuxuan Zhang, Sanjeev J. Koppal. 3067-3076 [doi]
- GASP: Unifying Geometric and Semantic Self-Supervised Pre-training for Autonomous DrivingWilliam Ljungbergh, Adam Lilja, Adam Tonderski, Arvid Laveno Ling, Carl Lindström, Willem Verbeke, Junsheng Fu, Christoffer Petersson, Lars Hammarstrand, Michael Felsberg. 3077-3087 [doi]
- Towards Reliable Test-Time Adaptation: Style Invariance as a Correctness LikelihoodGilhyun Nam, Taewon Kim, Joonhyun Jeong, Eunho Yang. 3088-3097 [doi]
- TalkingPose: Efficient Face and Gesture Animation with Feedback-guided Diffusion ModelAlireza Javanmardi, Pragati Jaiswal, Tewodros Amberbir Habtegebrial, Christen Millerdurai, Shaoxiang Wang, Alain Pagani, Didier Stricker. 3098-3108 [doi]
- Large Sign Language Models: Toward 3D American Sign Language TranslationSen Zhang, Xiaoxiao He, Di Liu 0003, Zhaoyang Xia, Mingyu Zhao, Chaowei Tan, Vivian Li, Bo Liu 0005, Dimitris N. Metaxas, Mubbasir Kapadia. 3109-3119 [doi]
- Crafting Descriptive Information for a Zero-shot Method to Improve Knowledge-Based Visual Question Answering PerformanceMohammad Mahdi Moradi, Sudhir Mudur. 3120-3128 [doi]
- Learning Action Hierarchies via Hybrid Geometric DiffusionArjun Ramesh Kaushik, Nalini K. Ratha, Venu Govindaraju. 3129-3139 [doi]
- Learning Group Actions In Disentangled Latent Image RepresentationsFarhana Hossain Swarnali, Miaomiao Zhang 0002, Tonmoy Hossain. 3140-3149 [doi]
- GAITGen: Disentangled Motion-Pathology Impaired Gait Generative Model - Bringing Motion Generation to the Clinical DomainVida Adeli, Soroush Mehraban, Majid Mirmehdi, Alan L. Whone, Benjamin Filtjens, Amirhossein Dadashzadeh, Alfonso Fasano, Andrea Iaboni, Babak Taati. 3150-3161 [doi]
- Gradient-Free Classifier Guidance for Diffusion Model SamplingRahul Shenoy, Zhihong Pan 0001, Kaushik Balakrishnan, Qisen Cheng, Yongmoon Jeon, Heejune Yang, Jaewon Kim. 3162-3171 [doi]
- Mitigating Object and Action Hallucinations in Multimodal LLMs via Self-Augmented Contrastive AlignmentKai-Po Chang, Wei-Yuan Cheng, Chi-Pin Huang, Fu-En Yang, Yu-Chiang Frank Wang. 3172-3181 [doi]
- Guided Model Merging for Hybrid Data Learning: Leveraging Centralized Data to Refine Decentralized ModelsJunyi Zhu 0002, Ruicong Yao, Taha Ceritli, Savas Özkan, Matthew B. Blaschko, Eunchung Noh, Jeongwon Min, Cho Jung Min, Mete Ozay. 3182-3192 [doi]
- Fused Similarity Measure Based Alignment with Dual-Scale Adaptive Selection for Weakly Supervised Video Anomaly DetectionYue-Gao Lu, Hong-Jie Xing, Chun-Guo Li. 3193-3202 [doi]
- PointNet4D: A Lightweight 4D Point Cloud Video Backbone for Online and Offline Perception in Robotic ApplicationsYunze Liu, Zifan Wang, Peiran Wu, Jiayang Ao. 3203-3212 [doi]
- Cross-Modal Event Encoder: Bridging Image-Text Knowledge to Event StreamsSungHeon Jeong 0001, Hanning Chen, Sanggeon Yun, Suhyeon Cho, Wenjun Huang 0001, Xiangjian Liu, Mohsen Imani. 3213-3222 [doi]
- SAIL: Self-supervised Learning of Lighting-Invariant Representations from Real Images with Latent DiffusionHala Djeghim, Céline Loscos, Désiré Sidibé. 3223-3232 [doi]
- PSDiffusion: Harmonized Multi-Layer Image Generation via Layout and Appearance AlignmentDingbang Huang, Wenbo Li, Yifei Zhao, Xinyu Pan, Yanhong Zeng, Bo Dai 0002. 3233-3242 [doi]
- Nerve: Neighbourhood & Entropy-guided Random-walk for training free open-Vocabulary sEgmentationKunal Mahatha, Jose Dolz, Christian Desrosiers. 3243-3253 [doi]
- CLIP's Visual Embedding Projector is a Few-shot CornucopiaMohammad Fahes, Tuan-Hung Vu, Andrei Bursuc, Patrick Pérez, Raoul de Charette. 3254-3264 [doi]
- RegionAligner: Bridging Ego-Exo Views for Object Correspondence via Unified Text-Visual LearningYuhao Su, Ehsan Elhamifar. 3265-3274 [doi]
- Towards Streaming LiDAR Object Detection with Point Clouds as Egocentric SequencesMellon M. Zhang, Glen Chou, Saibal Mukhopadhyay. 3275-3284 [doi]
- Show Me: Unifying Instructional Image and Video Generation with Diffusion ModelsYujiang Pu, Zhanbo Huang, Vishnu Boddeti, Yu Kong 0001. 3285-3296 [doi]
- VOCAL: Visual Odometry via ContrAstive LearningChi-Yao Huang, Zeel Bhatt, Yezhou Yang. 3297-3309 [doi]
- Pose-Diverse Multi-View Virtual Try-on from a Single Frontal Image via Diffusion TransformerSeonghee Han, Minchang Chung, Gyeongsu Cho, Kyungdon Joo, Taehwan Kim. 3310-3319 [doi]
- SimForce: Force and Surface Electromyography from Full Body Video with Graph Neural NetsEsha Dasgupta, Boeun Kim, Sang Hoon Yeo, Hyung Jin Chang. 3320-3329 [doi]
- SCATR: Mitigating New Instance Suppression in LiDAR-based Tracking-by-Attention via Second Chance Assignment and Track Query DropoutBrian Cheong, Letian Wang, Sandro Papais, Steven L. Waslander. 3330-3339 [doi]
- +: Scaling UAV-to-Satellite Image Registration for Target Geolocalization and Geospatial Augmented RealityZhiyun Deng, Austin Case, Luis Sentis. 3340-3349 [doi]
- Blur2Sharp: Human Novel Pose and View Synthesis with Generative Prior RefinementChia-Hern Lai, I-Hsuan Lo, Yen-Ku Yeh, Thanh Nguyen Truong, Ching-Chun Huang. 3350-3359 [doi]
- Power of Boundary and Reflection: Semantic Transparent Object Segmentation using Pyramid Vision Transformer with Transparent CuesTuan Anh Vu, Hai Nguyen-Truong, Ziqiang Zheng, Binh-Son Hua, Qing Guo 0005, Ivor W. Tsang, Sai Kit Yeung. 3360-3369 [doi]
- HEART-PFL: Stable Personalized Federated Learning under Heterogeneity with Hierarchical Directional Alignment and Adversarial Knowledge TransferMinJun Kim, Minje Kim. 3370-3379 [doi]
- Detecting Social Engagement of Elderly From Lifelog Image-streams to Identify Effective Cues for Autobiographic RecallVengateswaran Subramaniam, Vigneshwaran Subbaraju, Debaditya Roy, Pramath Krishna, Thivya Kandappu, Qianli Xu. 3380-3389 [doi]
- HistoMILKD: A Multiple Instance Learning based Multi-Teacher Knowledge Distillation Framework for Whole Slide Image ClassificationMayur Mallya, Ali Khajegili Mirabadi, Hossein Farahani, Ali Bashashati. 3390-3400 [doi]
- Stroke Modeling Enables Vectorized Character Generation with Large Vectorized Glyph ModelXinyue Zhang, Haolong Li, Jiawei Ma, Chen Ye. 3401-3410 [doi]
- CasTex: Cascaded Text-to-Texture Synthesis via Explicit Texture Maps and Physically-Based ShadingMishan Aliev, Dmitry Baranchuk, Kirill Struminsky. 3411-3420 [doi]
- DATTA: Domain-Adversarial Test-Time Adaptation for Cross-Domain WiFi-Based Human Activity RecognitionJulian Strohmayer, Rafael Sterzinger, Matthias Wödlinger, Martin Kampel. 3421-3430 [doi]
- MixER: From Cross-Modal to Mixed-Modal Visible-Infrared Re-IdentificationMahdi Alehdaghi, Rajarshi Bhattacharya, Pourya Shamsolmoali, Rafael M. O. Cruz, Eric Granger. 3431-3440 [doi]
- LighthouseGS: Indoor Structure-aware 3D Gaussian Splatting for Panorama-Style Mobile CapturesSeungoh Han, Jaehoon Jang 0001, Hyunsu Kim, Jaeheung Surh, Junhyung Kwak, Hyowon Ha, Kyungdon Joo. 3441-3450 [doi]
- ⚡FLARES⚡: Fast and Accurate LiDAR Multi-Range Semantic SegmentationBin Yang, Alexandru Paul Condurache. 3451-3461 [doi]
- Language Integration in Fine-Tuning Multimodal Large Language Models for Image-Based RegressionRoy H. Jennings, Genady Paikin, Roy Shaul, Evgeny Soloveichik. 3462-3471 [doi]
- MANTA: Physics-Informed Generalized Underwater Object TrackingSuhas Srinath, Hemang Jamadagni, Aditya Chandrasekar, Prathosh A. P.. 3472-3482 [doi]
- KD360-VoxelBEV: LiDAR and 360-degree Camera Cross Modality Knowledge Distillation for Bird's-Eye-View SegmentationWenke E, Yixin Sun, Jiaxu Liu 0002, Hubert P. H. Shum, Amir Atapour Abarghouei, Toby P. Breckon. 3483-3493 [doi]
- 3: Modular Adaptation of Foundation Models for Multi-Modal Medical AIMohammad Areeb Qazi, Munachiso S. Nwadike, Ibrahim Almakky, Mohammad Yaqub, Numan Saeed. 3494-3503 [doi]
- SPOC: Spatially-Progressing Object State Change Segmentation in VideoPriyanka Mandikal, Tushar Nagarajan, Alex Stoken, Zihui Xue, Kristen Grauman. 3504-3513 [doi]
- Self-Supervised Visual Prompting for Cross-Domain Road Damage DetectionXi Xiao, Zhuxuanzi Wang, Mingqiao Mo, Chen Liu 0020, Chenrui Ma, Yanshu Li, Smita Krishnaswamy, Xiao Wang 0004, Tianyang Wang 0004. 3514-3524 [doi]
- Data-Driven Loss Functions for Inference-Time Optimization in Text-to-ImageSapir Esther Yiflach, Yuval Atzmon, Gal Chechik. 3525-3535 [doi]
- Multi-Modal Soccer Scene Analysis with Masked Pre-TrainingMarc Peral, Guillem Capellera, Luis Ferraz, Antonio Rubio 0001, Antonio Agudo. 3536-3545 [doi]
- Visual Detector Compression via Location-Aware Discriminant AnalysisQizhen Lan, Jung Im Choi, Qing Tian 0003. 3546-3555 [doi]
- Latent Uncertainty-Aware Multi-View SDF Scan CompletionFaezeh Zakeri, Lukas Ruppert, Raphael Braun, Hendrik P. A. Lensch. 3556-3566 [doi]
- Comp4D: Compositional 4D Scene GenerationHanwen Liang, Dejia Xu, Neel P. Bhatt, Hezhen Hu, Hanxue Liang, Konstantinos N. Plataniotis. 3567-3577 [doi]
- SENCA-st: Integrating Spatial Transcriptomics and Histopathology with Cross Attention Shared Encoder for Region Identification in Cancer PathologyShanaka Liyanaarachchi, Chathurya Wijethunga, Shihab Aaqil Ahamed, Akthas Absar, Ranga Rodrigo. 3578-3787 [doi]
- Towards High-Fidelity, Identity-Preserving Real-Time Makeup Transfer: Decoupling Style GenerationKin Ching Lydia Chau, Zhi Yu, Ruowei Jiang. 3588-3597 [doi]
- Feature Inversion as a Lens on Vision EncodersEduard Allakhverdov, Dmitrii Tarasov, Elizaveta Goncharova, Andrey Kuznetsov. 3598-3605 [doi]
- MuSACo: Multimodal Subject-Specific Selection and Adaptation for Expression Recognition with Co-TrainingMuhammad Osama Zeeshan, Natacha Gillet, Alessandro Lameiras Koerich, Marco Pedersoli, François Brémond, Eric Granger. 3606-3616 [doi]
- SCALEX: Scalable Concept and Latent Exploration for Diffusion ModelsE. Zhixuan Zeng, Yuhao Chen 0001, Alexander Wong. 3617-3627 [doi]
- DCSHARP: 3D Gaussian Splatting with Direction Cosine Spherical Harmonics and Shape-Aware PruningAhmed Hasssan, Jian Meng, Yuanbo Xiangli, Jae-sun Seo. 3628-3637 [doi]
- DOTGraph: CLIP-Driven Feature Disentanglement and Optimal Transport based Graph Learning for Few-Shot SegmentationShreya Biswas, Zhaozheng Yin. 3638-3647 [doi]
- Delta-LLaVA: Base-then-Specialize Alignment for Token-Efficient Vision-Language ModelsMohamad Zamini, Diksha Shukla. 3648-3657 [doi]
- Sketch-guided Cage-based 3D Gaussian Splatting DeformationTianhao Xie, Noam Aigerman, Eugene Belilovsky, Tiberiu Popa. 3658-3667 [doi]
- Autoregressive Styled Text Image Generation, but Make it ReliableCarmine Zaccagnino, Fabio Quattrini, Vittorio Pippi, Silvia Cascianelli, Alessio Tonioni, Rita Cucchiara. 3668-3678 [doi]
- Universal Neural Architecture Space: Covering ConvNets, Transformers and Everything in BetweenOndrej Týbl, Lukás Neumann. 3679-3688 [doi]
- Sea-CLIP: Mining Semantic-Aware Representations for Few-Shot Anomaly Detection with CLIPXiao Guo, Zhimin Chen, Carlos D. Castillo, Hongcheng Wang, Xiaoming Liu. 3689-3699 [doi]
- CLIP-IT: CLIP-based Pairing of Histology Images with Privileged Textual InformationBanafsheh Karimian, Giulia Avanzato, Soufiane Belharbi, Alexis Guichemerre, Luke McCaffrey, Mohammadhadi Shateri, Eric Granger. 3700-3709 [doi]
- LightGazeNet: A Lightweight GNN-based Architecture for Gaze EstimationHeena Patel, Anirban Chowdhury, Pooja Jigar Choksy, Samiksha Pradeep Pachade, Ajinkya Puar. 3710-3719 [doi]
- Codebook Knowledge with Mamba-Transformer For Low-Light Image EnhancementRunhua Deng, Aiwen Jiang, Long Peng 0003, Qiuhai Yan. 3720-3729 [doi]
- TICLS: Tightly Coupled Language Text SpotterLeeje Jang, Yijun Lin 0001, Yao-Yi Chiang, Jerod J. Weinman. 3730-3740 [doi]
- Perception-Inspired Color Space Design for Photo White Balance EditingYang Cheng 0008, Ziteng Cui, Lin Gu 0003, Shenghan Su, Zenghui Zhang. 3741-3749 [doi]
- CLUE: Bringing Machine Unlearning to Mobile DevicesA. Q. M. Sazzad Sayyed, Nathaniel D. Bastian, Michael J. De Lucia, Ananthram Swami, Francesco Restuccia 0001. 3750-3759 [doi]
- FairScene: Learning Class-Disentangled 2D/3D Representations for Semantic Scene CompletionDian Jia, Pei Yu, Wei Tang 0016. 3760-3770 [doi]
- Frequency Is What You Need: Considering Word Frequency When Text Masking Benefits Vision-Language Model Pre-trainingMingliang Liang, Martha A. Larson. 3771-3780 [doi]
- Event-based Graph Representation with Spatial and Motion Vectors for Asynchronous Object DetectionAayush Atul Verma, Arpitsinh Vaghela, Bharatesh Chakravarthi, Kaustav Chanda, Yezhou Yang. 3781-3791 [doi]
- ART-ASyn: Anatomy-aware Realistic Texture-based Anomaly Synthesis Framework for Chest X-RaysQinyi Cao, Jianan Fan, Tom Weidong Cai. 3792-3802 [doi]
- High-Rate Mixout: Revisiting Mixout for Robust Domain GeneralizationMasih Aminbeidokhti, Heitor Rapela Medeiros, Srikanth Muralidharan, Eric Granger, Marco Pedersoli. 3803-3812 [doi]
- MuseDance: A Diffusion-based Music-Driven Image Animation SystemZhikang Dong, Weituo Hao, Ju-Chiang Wang, Peng Zhang, Pawel Polak. 3813-3824 [doi]
- A Little More Like This: Text-to-Image Retrieval with Vision-Language Models Using Relevance FeedbackBulat Khaertdinov, Mirela Popa, Nava Tintarev. 3825-3834 [doi]
- Bi-ICE: An Inner Interpretable Framework for Image Classification via Bi-directional Interactions between Concept and Input EmbeddingsJinyung Hong, Yearim Kim, Keun Hee Park, Sangyu Han, Nojun Kwak, Theodore P. Pavlic. 3835-3845 [doi]
- DTMIR-Pro: Domain Translation with Prompt-based Latent-Space Generalization for Multi-Weather Image RestorationAshutosh Kulkarni, Prashant W. Patil, Santosh Kumar Vipparthi, Subrahmanyam Murala, Balasubramanian Raman. 3846-3856 [doi]
- ObjectCore - Efficient Few-shot Logical Anomaly Detection using Object RepresentationsMatic Fucka, Vitjan Zavrtanik, Danijel Skocaj. 3857-3867 [doi]
- A Novel Metric for Detecting Memorization in Generative Models for Brain MRI SynthesisAntonio Scardace, Lemuel Puglisi, Francesco Guarnera, Sebastiano Battiato, Daniele Ravì. 3868-3877 [doi]
- Unsupervised Modular Adaptive Region Growing and RegionMix Classification for Wind Turbine SegmentationRaül Pérez-Gonzalo, Riccardo Magro, Andreas Espersen, Antonio Agudo. 3878-3888 [doi]
- Gen-AFFECT: Generation of Avatar Fine-grained Facial Expressions with Consistent identiTyHao Yu 0014, Rupayan Mallick, Margrit Betke, Sarah Adel Bargal. 3889-3899 [doi]
- FlowEO: Generative Unsupervised Domain Adaptation for Earth ObservationGeorges Le Bellier, Nicolas Audebert. 3900-3907 [doi]
- Efficient Vision Transformers via Token Merging with Head-Wise Attention CorrectionYuki Ichikawa, Masato Motomura, Thiem Van Chu, Daichi Fujiki. 3908-3917 [doi]
- 2S-CEDiff: A Two-Stage Diffusion Framework for Generating High-Fidelity Contrast-Enhanced CT Images from Non-Contrast ScansYibang Wu, Tzung-Dau Wang, Shang-Hong Lai. 3918-3927 [doi]
- JOCA: Task-Driven Joint Optimisation of Camera Hardware and Adaptive Camera Control AlgorithmsChengyang Yan, Mitch Bryson, Donald G. Dansereau. 3928-3938 [doi]
- CAPE: A CLIP-Aware Pointing Ensemble of Complementary Heatmap Cues for Embodied Reference UnderstandingFevziye Irem Eyiokur, Dogucan Yaman, Hazim Kemal Ekenel, Alexander Waibel. 3939-3950 [doi]
- Online Episodic Memory Visual Query Localization with Egocentric Streaming Object MemoryZaira Manigrasso, Matteo Dunnhofer, Antonino Furnari, Moritz Nottebaum, Antonio Finocchiaro, Davide Marana, Rosario Forte, Giovanni Maria Farinella, Christian Micheloni. 3951-3960 [doi]
- Mobile-Oriented Video Diffusion: Enabling Text-to-Video Generation on Mobile Devices Without Retraining, Compression, or PruningBosung Kim, Kyuhwan Lee, Isu Jeong, Jungmin Cheon, Yeojin Lee, Seulki Lee 0002. 3961-3971 [doi]
- WorkZone3D: A Multimodal Dataset for 3D Work Zone Perception in Autonomous DrivingShounak Sural, Nishad Sahu, Ragunathan Raj Rajkumar. 3972-3981 [doi]
- Unconditional Priors Matter! Improving Conditional Generation of Fine-Tuned Diffusion ModelsPrin Phunyaphibarn, Phillip Y. Lee, Jaihoon Kim, Minhyuk Sung. 3982-3992 [doi]
- Training-free Detection of Text-to-video Generations via Over-coherenceJonathan Brokman, Oren Rachmil, Omer Hofman, Roy Betser, Amit Giloni, Roman Vainshtein, Hisashi Kojima. 3993-4003 [doi]
- ReBrain: Brain MRI Reconstruction from Sparse CT Slice via Retrieval-Augmented DiffusionJunming Liu, Yifei Sun, Weihua Cheng, Yujin Kang, Yirong Chen, Ding Wang, Guosun Zeng. 4004-4014 [doi]
- Efficient Text-Guided Convolutional Adapter for the Diffusion ModelAryan Das, Koushik Biswas, Swalpa Kumar Roy, Badri Narayana Patro, Vinay Kumar Verma. 4015-4024 [doi]
- FLoMo-Net: A Novel Task-Adaptive Mixture of Experts Routing Framework with Frequency and Uncertainty Correction for Medical Image SegmentationMd. Rayhan Ahmed, Patricia Lasserre. 4025-4035 [doi]
- From Detection to Anticipation: Online Understanding of Struggles across Various Tasks and ActivitiesShijia Feng, Michael Wray, Walterio W. Mayol-Cuevas. 4036-4045 [doi]
- CaRS: A Causal Intervention Segmentation Framework and Benchmark Dataset for Autonomous Driving under Transitional Weather ConditionsMadhavi Kondapally, K. Naveen Kumar, C. Krishna Mohan, Sobhan Babu. 4046-4056 [doi]
- Domain Generalizing DINO for Visual Regression via Latent Distractor Subspace ConsistencyNikhil Reddy, Chetan Arora 0001, Mahsa Baktashmotlagh. 4057-4066 [doi]
- WALDO: Where Unseen Model-based 6D Pose Estimation Meets OcclusionSajjad Pakdamansavoji, Yintao Ma, Amir Rasouli, Tongtong Cao. 4067-4076 [doi]
- Decoupling Shape and Texture in SAM-2 via Controlled Texture ReplacementInbal Cohen, Boaz Meivar, Peihan Tu, Shai Avidan, Gal Oren 0001. 4077-4086 [doi]
- HumanBench: Two Heads, No Legs, But Mostly Human, the State of Generative Capabilities in T2I ModelsAnubhooti Jain, Mayank Vatsa, Richa Singh 0001. 4087-4096 [doi]
- SOAF: Scene Occlusion-aware Neural Acoustic FieldHuiyu Gao, Jiahao Ma, David Ahmedt-Aristizabal, Chuong Nguyen, Miaomiao Liu 0001. 4097-4107 [doi]
- FedSCAl: Leveraging Server and Client Alignment for Unsupervised Federated Source-Free Domain AdaptationM. Yashwanth, Sampath Koti, Arunabh Singh, Shyam Marjit, Anirban Chakraborty 0001. 4108-4117 [doi]
- Structure-Aware Feature Rectification with Region Adjacency Graphs for Training-Free Open-Vocabulary Semantic SegmentationQiming Huang, Hao Ai, Jianbo Jiao. 4118-4127 [doi]
- One Model, Many Behaviors: Training-Induced Effects on Out-of-Distribution DetectionGerhard Krumpl, Henning Avenhaus, Horst Possegger. 4128-4138 [doi]
- TalkingHeadBench: A Multi-Modal Benchmark & Analysis of Talking-Head DeepFake DetectionXinqi Xiong, Prakrut Patel, Qingyuan Fan, Amisha Wadhwa, Sarathy Selvam, Xiao Guo, Luchao Qi, Xiaoming Liu, Roni Sengupta. 4139-4149 [doi]
- Rethinking Real Image Editing: Unleashing Diverse Editing Operators via Multi-Objective OptimizationSiyuan Wang, Xi Yang 0008, Zihao Zhou, Huiru Shao, Rui Zhang 0012, Qiufeng Wang, Guangliang Cheng, Kaizhu Huang. 4150-4159 [doi]
- Decomposition Sampling for Efficient Region Annotations in Active LearningJingna Qiu, Frauke Wilm, Mathias Öttl, Jonas Utz, Maja Schlereth, Moritz Schillinger, Marc Aubreville, Katharina Breininger. 4160-4169 [doi]
- DNA: Dual-branch Network with Adaptation for Open-Set Online Handwriting GenerationTsai-Ling Huang, Nhat-Tuong Do-Tran, Ngoc-Hoang-Lam Le, Hong-Han Shuai, Ching-Chun Huang. 4170-4179 [doi]
- STEG-AIW: Spatio-Temporal Gating and Adaptive-Timestep Inference for Efficient Spiking Neural NetworksGulfam Ahmed Saju, Anton Spirkin, Felipe Marcelino, Yuchou Chang. 4180-4189 [doi]
- Enhancing Visual Planning with Auxiliary Tasks and Multi-token PredictionCe Zhang 0010, Yale Song, Ruta Desai, Michael Louis Iuzzolino, Joseph Tighe, Gedas Bertasius, Satwik Kottur. 4190-4200 [doi]
- Self-Supervised Compression and Artifact Correction for Streaming Underwater Imaging SonarRongsheng Qian, Chi Xu 0004, Xiaoqiang Ma, Hao Fang 0012, Yili Jin 0001, William I. Atlas, Jiangchuan Liu. 4201-4211 [doi]
- Perceptually Guided 3DGS Streaming and Rendering for Mixed RealityYunxiang Zhang, Sai Harsha Mupparaju, Kenneth Chen, Jenna Kang, Xinyu Zhang, Maito Omori, Kazuyuki Arimatsu, Qi Sun 0003. 4212-4222 [doi]
- Unlocking Vision-Language Models for Video Anomaly Detection via Fine-Grained PromptingShu Zou, Xinyu Tian, Lukas Wesemann, Fabian Waschkowski, Zhaoyuan Yang, Jing Zhang 0052. 4223-4233 [doi]
- Unsupervised Memorability Modeling from Tip-of-the-Tongue Retrieval QueriesSree Bhattacharyya, Yaman Kumar Singla, Sudhir Yarram, Somesh Singh 0003, Harini S. I, James Z. Wang 0001. 4234-4241 [doi]
- Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal ModelsYuxiao Chen, Jue Wang 0010, Zhikang Zhang, Jingru Yi, Xu Zhang, Yang Zou, Zhaowei Cai, Jianbo Yuan, Xinyu Li, Hao Yang 0043, Davide Modolo. 4242-4252 [doi]
- Guided Texture Segmentation via Coordinate-Aware Class-Ratio MappingBishal Ranjan Swain, Kyung Joo Cheoi, Jaepil Ko. 4253-4261 [doi]
- Empowering Source-Free Domain Adaptation via MLLM-Guided Reliability-Based Curriculum LearningDongjie Chen, Kartik Patwari, Zhengfeng Lai, Xiaoguang Zhu, Sen-Ching S. Cheung, Chen-Nee Chuah. 4262-4272 [doi]
- ExDDV: A New Dataset for Explainable Deepfake Detection in VideoVlad Hondru, Eduard Hogea, Darian M. Onchis, Radu-Tudor Ionescu. 4273-4284 [doi]
- AGENet: Adaptive Edge-aware Geodesic Distance Learning for Few-Shot Medical Image SegmentationZiyuan Gao. 4285-4294 [doi]
- CONSTANT: Towards High-Quality One-Shot Handwriting Generation with Patch Contrastive Enhancement and Style-Aware QuantizationAnh Duy Le, Van-Linh Pham, Thanh-Nam Vo, Xuan Toan Mai, Tuan Anh Tran 0001. 4295-4304 [doi]
- DCText: Scheduled Attention Masking for Visual Text Generation via Divide-and-Conquer StrategyJaewoo Song, Jooyoung Choi 0001, Kanghyun Baek, Sangyub Lee 0005, Daemin Park, Sungroh Yoon. 4305-4314 [doi]
- VFace: A Training-Free Approach for Diffusion-Based Video Face SwappingSanoojan Baliah, Yohan Abeysinghe, Rusiru Thushara, Khan Muhammad 0001, Abhinav Dhall, Karthik Nandakumar, Muhammad Haris Khan. 4315-4324 [doi]
- VividAnimator: An End-to-End Audio and Pose-driven Half-Body Human Animation FrameworkDonglin Huang, Yongyuan Li, Tianhang Liu, Junming Huang 0002, Xiaoda Yang, Chi Wang 0004, Weiwei Xu 0003. 4325-4334 [doi]
- Fine-grained Defocus Blur Control for Generative Image ModelsAyush Shrivastava, Connelly Barnes, Xuaner Zhang, Lingzhi Zhang, Andrew Owens, Sohrab Amirghodsi, Eli Shechtman. 4335-4344 [doi]
- CalibBEV: LiDAR-Camera Calibration via BEV AlignmentFilippo D'Addeo, Lorenzo Cipelli, Adriano Cardace, Emanuele Ghelfi, Andrea Zinelli, Massimo Bertozzi. 4345-4354 [doi]
- X-JEPA: A Novel Joint Learning Cross-Modal Predictive Alignment Framework for Remote Sensing Image RetrievalShabnam Choudhury, Yash Salunkhe, Vaibhav Rajan, Subhasis Chaudhuri, Biplab Banerjee. 4355-4364 [doi]
- SSMRadNet : A Sample-wise State-Space Framework for Efficient and Ultra-Light Radar Segmentation and Object DetectionAnuvab Sen, Mir Sayeed Mohammad, Saibal Mukhopadhyay. 4365-4374 [doi]
- Rank-based Geographical Regularization: Revisiting Contrastive Self-Supervised Learning for Multispectral Remote Sensing ImageryTom Burgert, Leonard W. Hackel, Paolo Rota, Begüm Demir. 4375-4385 [doi]
- OMeGa: Joint Optimization of Explicit Meshes and Gaussian Splats for Robust Scene-Level Surface ReconstructionYuhang Cao, Haojun Yan, Danya Yao. 4386-4395 [doi]
- Confidence Through Parallel Attention for Depth and Uncertainty Estimation in Dynamic EnvironmentsOnkar Susladkar, Rohit Pawar, Chirag Sehgal, Samaksh Ujjawal, Sparsh Mittal. 4396-4406 [doi]
- BiNAR: A Bi-Modal Framework for Non-Aligned RGB-IR 3D Reconstruction via Gaussian SplattingZhongwen Wang, Han Ling, Weihao Zhang, Yinghui Sun, Quansen Sun. 4407-4416 [doi]
- Spec-Gloss Surfels and Normal-Diffuse Priors for Relightable Glossy ObjectsGeorgios Kouros, Minye Wu, Tinne Tuytelaars. 4417-4426 [doi]
- Occlusion Boundary and Depth: Mutual Enhancement via Multi-Task LearningLintao Xu, Yinghao Wang, Chaohui Wang. 4427-4437 [doi]
- Ego-EXTRA: video-language Egocentric Dataset for EXpert-TRAinee assistanceFrancesco Ragusa, Michele Mazzamuto, Rosario Forte, Irene D'Ambra, James Fort, Jakob J. Engel, Antonino Furnari, Giovanni Maria Farinella. 4438-4450 [doi]
- Similarity-aware Probabilistic Embeddings Modeling for Video-Text RetrievalYuliang Huang, Pengxu Wei, Zhicheng Dong, Liang Lin. 4451-4460 [doi]
- PromptGAR: Flexible Promptive Group Activity RecognitionZhangyu Jin, Andrew Feng, Ankur Chemburkar, Celso Miguel de Melo. 4461-4471 [doi]
- Spacewalk-18: A Benchmark for Multimodal and Long-form Procedural Video Understanding in Novel DomainsZitian Tang, Rohan Myer Krishnan, Zhiqiu Yu, Chen Sun 0002. 4472-4482 [doi]
- Broadcast2Pitch: Game State Reconstruction from Unconstrained Soccer VideosYin May Oo, Yewon Hwang, Muhammad Amrulloh Robbani, Vanyi Chao, Ankhzaya Jamsrandorj, Hoang Quoc Nguyen, Kyung-Ryoul Mun, Jinwook Kim. 4483-4493 [doi]
- *Xin Hu, Taotao Jing, Renran Tian, Zhengming Ding. 4494-4503 [doi]
- DARB-Splatting: Generalizing Splatting with Decaying Anisotropic Radial Basis FunctionsHashiru Pramuditha, Vinasirajan Viruthshaan, Vishagar Arunan, Saeedha Nazar, Sameera Ramasinghe, Simon Lucey, Ranga Rodrigo. 4504-4514 [doi]
- Surgical Gaussian Surfels: Highly Accurate Real-time Surgical Scene Rendering using Gaussian SurfelsIdris O. Sunmola, Zhenjun Zhao, Samuel Schmidgall, Yumeng Wang, Paul Maria Scheikl, Viet Pham, Axel Krieger. 4515-4524 [doi]
- Gated Temporal Fusion Transformers for Robust Multi-Object TrackingJinho Kim, Kuk-Jin Yoon. 4525-4534 [doi]
- SIAM: Synchronous Interaction Attention for Human Mesh RecoveryNiaz Ahmad, Saif Ullah, Youngmoon Lee, Guanghui Wang. 4535-4545 [doi]
- SynchroRaMa : Lip-Synchronized and Emotion-Aware Talking Face Generation via Multi-Modal Emotion EmbeddingPhyo Thet Yee, Dimitrios Kollias, Sudeepta Mishra, Abhinav Dhall. 4546-4555 [doi]
- Are All Marine Species Created Equal? Performance Disparities in Underwater Object DetectionMelanie Wille, Tobias Fischer 0001, Scarlett Raine. 4556-4565 [doi]
- LVM-Lite: Training Large Vision Models with Efficient Sequential ModelingXianhang Li, Hongru Zhu, Sucheng Ren, Linjie Yang, Peng Wang 0001, Heng Wang, Xiaohui Shen, Qing Liu, Cihang Xie. 4566-4576 [doi]
- HiGlassRM: Learning to Remove High-prescription Glasses via Synthetic Dataset GenerationSebin Lee, Heewon Kim. 4577-4586 [doi]
- Transformer-Based Inpainting for Real-Time 3D Streaming in Sparse Multi-Camera SetupsLeif Van Holland, Domenic Zingsheim, Mana Takhsha, Hannah Dröge, Patrick Stotko, Markus Plack, Reinhard Klein. 4587-4598 [doi]
- SeaClips: A Video Dataset for Maritime Object DetectionFranziska Denk, Christian Rankl, Shaban Almouahed, David Moser, Robert Sablatnig. 4599-4610 [doi]
- UniDiff: Parameter-Efficient Adaptation of Diffusion Models for Land Cover Classification with Multi-Modal Remotely Sensed Imagery and Sparse AnnotationsYuzhen Hu, Saurabh Prasad. 4611-4620 [doi]
- CropAT: Leveraging Diffusion-Generated Target-Like Cropped Objects for Pseudo-Label Refinement in Domain-Adaptive Object DetectionChen-Che Huang, Tzuhsuan Huang, Jun-Cheng Chen. 4621-4630 [doi]
- Beyond Faces: A Multimodal Person Clustering for Unconstrained EnvironmentsSahngmin Yoo, Sangwon Lee, Seongin Jo. 4631-4640 [doi]
- Eye-for-an-eye: Appearance Transfer with Dense Semantic Correspondence in Diffusion ModelsSooyeon Go, Kyungmook Choi, Minjung Shin, Youngjung Uh. 4641-4650 [doi]
- Towards Photorealistic Style Transfer with Multimodal Guidance and Robustness to Content Images in Arbitrary StylesRuikai Zhou, Yating Liu, Yi Xu. 4651-4660 [doi]
- Hierarchical Adaptive networks with Task vectors for Test-Time AdaptationSameer Ambekar, Marta Hasny, Laura Daza, Daniel Lang 0003, Julia A. Schnabel. 4661-4672 [doi]
- Automated Pore Detection from In-Situ FDM 3D Printing Video: A Comparative Evaluation of Modern Segmentation ModelsAbdullah Al Ahad Khan, Md Shariful Islam, Lin Li, Lai Jiang, Noushin Ghaffari. 4673-4681 [doi]
- Safe Vision-Language Models via Unsafe Weights ManipulationMoreno D'incà, Elia Peruzzo, Xingqian Xu, Humphrey Shi, Nicu Sebe, Massimiliano Mancini. 4682-4692 [doi]
- SOPHY: Generating Simulation-Ready Objects with PHYsical MaterialsJunyi Cao, Evangelos Kalogerakis. 4693-4704 [doi]
- Generalization of Real World Video Deblurring by Image-to-image TranslationKassymzhomart Aitbek, Seungjoon Yang. 4705-4714 [doi]
- A Dataset and Framework for Learning State-invariant Object RepresentationsRohan Sarkar, Avinash C. Kak. 4715-4723 [doi]
- Better Safe Than Sorry? Overreaction Problem of Vision Language Models in Visual Emergency RecognitionDasol Choi, Seunghyun Lee, Youngsook Song. 4724-4732 [doi]
- Optimizing LVLMs with On-Policy Data for Effective Hallucination MitigationChengzhi Yu, Yifan Xu, Yifan Chen, Wenyi Zhang. 4733-4743 [doi]
- Countering Multi-modal Representation Collapse through Rank-targeted FusionSeulgi Kim, Kiran Kokilepersaud, Mohit Prabhushankar, Ghassan Alregib. 4744-4754 [doi]
- Learning Unified Spatio-temporal Representations for Efficient Compressed Video UnderstandingShristi Das Biswas, Efstathia Soufleri, Arani Roy, Kaushik Roy 0001. 4755-4765 [doi]
- More Than Memory Savings: Zeroth-Order Optimization Mitigates Forgetting in Continual LearningWanhao Yu, Zheng Wang, Shuteng Niu, Sen Lin, Li Yang. 4766-4776 [doi]
- Global Focal and Radial Distortion Averaging from Radial Fundamental Matrices for Robust Self-CalibrationSergei Solonets, Daniil Sinitsyn, Daniel Cremers. 4777-4786 [doi]
- UCDSC: Open Set UnCertainty aware Deep Simplex Classifier for Medical Image DatasetsArnav Aditya, Nitin Kumar 0003, Saurabh J. Shigwan. 4787-4796 [doi]
- DODA: Adapting Object Detectors to Dynamic Agricultural Environments in Real-Time with DiffusionShuai Xiang, Pieter M. Blok, James Burridge, Haozhou Wang, Wei Guo 0002. 4797-4807 [doi]
- Structured Context Learning for Generic Event Boundary DetectionXin Gu 0003, Congcong Li, Xinyao Wang, Dexiang Hong, Libo Zhang 0001, Tiejian Luo, Longyin Wen, Heng Fan 0001. 4808-4817 [doi]
- Sun-E: Dataset and Benchmark for Event-Based Sun SensingSydney Dolan, Alessandro Golkar. 4818-4826 [doi]
- FCC: Fully Connected Correlation for One-Shot SegmentationSeonghyeon Moon, Haein Kong, Muhammad Haris Khan, Mubbasir Kapadia, Yuewei Lin. 4827-4837 [doi]
- MoRe: Monocular Geometry Refinement via Graph Optimization for Cross-View ConsistencyDongki Jung, Jaehoon Choi, Yonghan Lee 0001, Sungmin Eum, Heesung Kwon, Dinesh Manocha. 4838-4848 [doi]
- ProSkill: Segment-Level Skill Assessment in Procedural VideosMichele Mazzamuto, Daniele Di Mauro, Gianpiero Francesca, Giovanni Maria Farinella, Antonino Furnari. 4849-4858 [doi]
- MergeSlide: Continual Model Merging and Task-to-Class Prompt-Aligned Inference for Lifelong Learning on Whole Slide ImagesDoanh C. Bui, Ba-Hung Ngo, Hoai Luan Pham, Khang Nguyen 0001, Maï K. Nguyen, Yasuhiko Nakashima. 4859-4868 [doi]
- 2A: Convolution-free Local Linear Attention for SpatioTemporal Event ProcessingYusuke Sekikawa, Jun Nagata, Itsumi Araki, Andreu Girbau. 4869-4880 [doi]
- Dronaquatics: Real-time Swimming Analytics Using Drone Captured ImageryThu Tran, Harold Abraham Joseph, Kichang Lee, Kenny Tsu Wei Choo, Dong Ma 0001, Shaohui Foong, Thivya Kandappu, JeongGil Ko, Rajesh Balan. 4881-4889 [doi]
- Histopath-C: Towards Realistic Domain Shifts for Histopathology Vision-Language AdaptationMehrdad Noori, Gustavo Adolfo Vargas Hakim, David Osowiechi, Fereshteh Shakeri, Ali Bahri, Moslem Yazdanpanah, Sahar Dastani, Ismail Ben Ayed, Christian Desrosiers. 4890-4900 [doi]
- Robust Multimodal Emotion Recognition from Incomplete Modalities via Query-Based Unimodal and Cross-Modal LearningRyo Miyoshi, Mayu Otani, Yuki Okafuji. 4901-4911 [doi]
- WiSE-OD: Benchmarking Robustness in Infrared Object DetectionHeitor Rapela Medeiros, Atif Belal, Masih Aminbeidokhti, Eric Granger, Marco Pedersoli. 4912-4921 [doi]
- Patch-wise Retrieval: A Bag of Practical Techniques for Instance-level MatchingWon-Seok Choi 0001, Sohwi Lim, Nam Hyeon-Woo, Moon Ye-Bin, Dong-ju Jeong, Jinyoung Hwang, Tae Hyun Oh. 4922-4931 [doi]
- Gaussian Swaying ⚑: Surface-Based Framework for Aerodynamic Simulation with 3D GaussiansHongru Yan, Xiang Zhang 0015, Zeyuan Chen, Fangyin Wei, Zhuowen Tu. 4932-4942 [doi]
- Restora-Flow: Mask-Guided Image Restoration with Flow MatchingArnela Hadzic, Franz Thaler, Lea Bogensperger, Simon Johannes Joham, Martin Urschler. 4943-4952 [doi]
- PrevMatch: Revisiting and Maximizing Temporal Knowledge in Semi-Supervised Semantic SegmentationWooSeok Shin, Hyun-Joon Park, Jin Sob Kim, Juan Yun, Se-Hong Park, Sung Won Han 0003. 4953-4963 [doi]
- One-shot Portrait Stylization via Geometric AlignmentXinrui Wang, Zilin Guo, Zhuoru Li, Jinze Yu, Heng Zhang, Yusuke Iwasawa, Yutaka Matsuo, Jiaxian Guo. 4964-4973 [doi]
- Zero-Shot Table Extraction in Business Documents: A Unified Benchmark with Error Taxonomy and Ecological AnalysisEliott Thomas, Mickaël Coustaty, Aurélie Joseph, Tri-Cong Pham, Gaspar Deloin, Elodie Carel, Vincent Poulain D'Andecy, Jean-Marc Ogier. 4974-4983 [doi]
- SegMango: Early Deep Mango Yield Prediction based on Flower Segmentation and Weather DataJanaksinh Ven, Charu Sharma, Syed Azeemuddin. 4984-4993 [doi]
- Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial ImageryMai Tsujimoto, Junjue Wang, Weihao Xuan, Naoto Yokoya. 4994-5003 [doi]
- PoseGaussian: Pose-Driven Novel View Synthesis for Robust 3D Human ReconstructionJu Shen, Chen Chen 0001, Tam V. Nguyen 0002, Vijayan K. Asari. 5004-5015 [doi]
- Timestamp Query Transformer for Temporal Action SegmentationTieqiao Wang, Sinisa Todorovic. 5016-5025 [doi]
- QC-SF: Improving Computer Vision for Airborne LiDAR Point Clouds of Boreal Forests with Quebec Simulated Forest DatasetOlivier Stocker, Reza Mahmoudi Kouhi, Omid Reisi Gahrouei, Thierry Badard, Éric Guilbert. 5026-5036 [doi]
- RemEdit: Efficient Diffusion Editing with Riemannian GeometryEashan Adhikarla, Brian D. Davison 0001. 5037-5046 [doi]
- GrowTAS: Progressive Expansion from Small to Large Subnets for Efficient ViT Architecture SearchHyunju Lee, Youngmin Oh 0001, Jeimin Jeon, Donghyeon Baek, Bumsub Ham. 5047-5056 [doi]
- Subspace-Guided Knowledge Distillation for Efficient Model TransferZeeshan Hayder, Ali Cheraghian, Lars Petersson, Mehrtash Harandi. 5057-5066 [doi]
- TimeRefine: Temporal Grounding with Time Refining Video LLMXizi Wang, Feng Cheng, Ziyang Wang, Huiyu Wang, Md Mohaiminul Islam, Lorenzo Torresani, Mohit Bansal, Gedas Bertasius, David Crandall. 5067-5078 [doi]
- Curve Skeletonization in Continuous domain for Meshes and Point CloudsJai Bardhan, Ramya Hebbalaguppe, Aravind Udupa. 5079-5089 [doi]
- Gene-DML: Dual-Pathway Multi-Level Discrimination for Gene Expression Prediction from Histopathology ImagesYaxuan Song, Jianan Fan, Hang Chang, Tom Weidong Cai. 5090-5099 [doi]
- Color Preserving CMOS-SPAD Fusion for Multi-Frame HDRAleksi Suonsivu, Lauri Salmela, Lassi Helin, Leevi Uosukainen, Giacomo Boracchi. 5100-5109 [doi]
- Unsupervised Segmentation by Diffusing, Walking and CuttingDaniela Ivanova, Marco Aversa, Paul Henderson, John Williamson 0001. 5110-5120 [doi]
- Learning spatio-temporal feature representations for video-based gaze estimationAlexandre Personnic, Mihai Bâce. 5121-5130 [doi]
- ImageChain: Advancing Sequential Image-to-Text Reasoning in Multimodal Large Language ModelsDanae Sánchez Villegas, Ingo Ziegler, Desmond Elliott. 5131-5141 [doi]
- Edge-Aware Image Manipulation via Diffusion Models with a Novel Structure-Preservation LossMinsu Gong, Nuri Ryu, Jungseul Ok, Sunghyun Cho. 5142-5153 [doi]
- 3D Superquadric SplattingDaniel MacSwayne, Ales Leonardis, Jianbo Jiao. 5154-5163 [doi]
- Controllable Long-term Motion Generation with Extended Joint TargetsEunjong Lee, Eunhee Kim, Sanghoon Hong, Eunho Jung, Jihoon Kim. 5164-5173 [doi]
- ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric VideosPeiran Wu, Yunze Liu, Miao Liu, Junxiao Shen. 5174-5183 [doi]
- RPT-SR: Regional Prior attention Transformer for infrared image Super-ResolutionYoungwan Jin, Incheol Park, Yagiz Nalçakan, Hyeongjin Ju, Sanghyeop Yeo, Shiho Kim. 5184-5193 [doi]
- LASOR: Towards Clinically Transparent and Explainable Ophthalmic Report Generation via Lesion-Aware SegmentationJian Park, Hyunseon Won, Jeeeun Kim, Joon Seo Hwang, Jeong Mo Han, Ji-In Park, Daniel Duck-Jin Hwang, Jinyoung Han. 5194-5204 [doi]
- Quantifying the Limits of Segmentation Foundation Models: Modeling Challenges in Segmenting Tree-Like and Low-Contrast ObjectsYixin Zhang, Nicholas Konz, Kevin Kramer, Maciej A. Mazurowski. 5205-5215 [doi]
- Lorentz Entailment Cone for Semantic SegmentationZahid Hasan 0001, Masud Ahmed, Nirmalya Roy. 5216-5225 [doi]
- WarpRF: Multi-View Consistency for Training-Free Uncertainty Quantification and Applications in Radiance FieldsSadra Safadoust, Fabio Tosi, Fatma Güney, Matteo Poggi. 5226-5235 [doi]
- GAEA: A Geolocation Aware Conversational AssistantRon Campos, Ashmal Vayani, Parth Parag Kulkarni, Rohit Gupta 0012, Aizan Zafar, Aritra Dutta, Mubarak Shah. 5236-5246 [doi]
- WSSSP-Net: Weakly Supervised Semantic Segmentation Plugin Network for Face Anti-SpoofingKrzysztof Galus, Piotr Syga, Piotr Kawa. 5247-5257 [doi]
- Concord: Concept-Informed Diffusion for Dataset DistillationJianyang Gu, Haonan Wang, Ruoxi Jia 0001, Saeed Vahidian, Vyacheslav Kungurtsev, Wei Jiang 0009, Yiran Chen 0001. 5258-5268 [doi]
- Improving Out-of-Distribution Detection using Segmented Images and Cross-View Attention FusionAlexander Politowicz, Sahisnu Mazumder, Bing Liu 0001. 5269-5279 [doi]
- An improved architecture for part-based animal re-identification through semantic segmentation distillationEugênio Dias Ribeiro Neto, Marc Chaumont, Gérard Subsol, Michel De Garine-Wichatitsky, Hélène Guis. 5280-5289 [doi]
- FB-4D: Spatial-Temporal Coherent Dynamic 3D Content Generation with Feature BanksJinwei Li, Huan-ang Gao, Wenyi Li, Haohan Chi, Chenyu Liu, Chenxi Du, Yiqian Liu, Mingju Gao, Guiyu Zhang, Zongzheng Zhang, Li Yi 0001, Yao Yao, Jingwei Zhao, Hongyang Li 0001, Yikai Wang, Hao Zhao 0002. 5290-5301 [doi]
- Hestia: Voxel-Face-Aware Hierarchical Next-Best-View Acquisition for Efficient 3D ReconstructionCheng-You Lu, Zhuoli Zhuang, Nguyen Thanh Trung Le, Da Xiao, Yu-Cheng Fred Chang, Thomas Do, Srinath Sridhar 0002, Chin-Teng Lin. 5302-5312 [doi]
- 3: Reconstruction, Raw, and Rain: Deraining Directly in the Bayer DomainNate Rothschild, Moshe Kimhi, Avi Mendelson, Chaim Baskin. 5313-5321 [doi]
- An Efficient Multi-Rater Setup Towards Personalized and Diversified Medical Image SegmentationSajed Almorsy, Ayman Khalafallah, Marwan Torki. 5322-5331 [doi]
- HiMix : Hierarchical Visual-Textual Mixing Network for Lesion SegmentationSoojin Hwang, Jaeyoon Sim, Won Hwa Kim. 5332-5341 [doi]
- FSP-DETR: Few-Shot Prototypical Parasitic Ova DetectionShubham Trehan, Udhav Ramachandran, Akash Rao, Ruth Scimeca, Sathyanarayanan N. Aakur. 5342-5351 [doi]
- DF-Mamba: Deformable State Space Modeling for 3D Hand Pose Estimation in InteractionsYifan Zhou, Takehiko Ohkawa, Guwenxiao Zhou, Kanoko Goto, Takumi Hirose, Yusuke Sekikawa, Nakamasa Inoue. 5352-5363 [doi]
- Context-Preserving Dermoscopic Editing: Mask-Guided Lesion-Aware Diffusion for Attribute ModificationTao Sun, Yun Jiang, Yarong Jin, Huanting Guo, Zequn Zhang. 5364-5373 [doi]
- How I Met Your Bias: Investigating Bias Amplification in Diffusion ModelsNathan Roos, Ekaterina Iakovleva, Ani Gjergji, Vito Paolo Pastore, Enzo Tartaglione. 5374-5383 [doi]
- BREEN: Bridge Data-Efficient Encoder-Free Multimodal Learning with Learnable QueriesTianle Li, Yongming Rao, Winston Hu, Yu Cheng. 5384-5395 [doi]
- ProtoGMVAE: A Variational Auto-Encoder with True Gaussian Mixture Prior for Prototypical-based Self-ExplainabilityMartin Blanchard, Christophe Ducottet, Damien Muselet, Olivier Delézay. 5396-5405 [doi]
- AEON: Adaptive Embedding Optimized Noise for Robust Watermarking in Diffusion ModelsMuhammad Shahid Muneer, Simon S. Woo. 5406-5415 [doi]
- Revisiting Vision-Language Foundations for No-Reference Image Quality AssessmentAnkit Yadav, Ta Duc Huy, Lingqiao Liu. 5416-5425 [doi]
- Semi-supervised Domain Adaptation via Mutual Alignment through Joint ErrorDexuan Zhang, Thomas Westfechtel, Tatsuya Harada. 5426-5436 [doi]
- Unified Control for Inference-Time Guidance of Denoising Diffusion ModelsMaurya Goyal, Anuj Singh, Hadi Jamali Rad. 5437-5446 [doi]
- Learning Subglacial Bed Topography from Sparse Radar with Physics-Guided ResidualsBayu Adhi Tama, Jianwu Wang 0001, Vandana Pursnani Janeja, Mostafa Cham. 5447-5456 [doi]
- 4D Multimodal Co-attention Fusion Network with Latent Contrastive Alignment for Alzheimer's DiagnosisYuxiang Wei 0004, Yanteng Zhang, Xi Xiao, Tianyang Wang 0004, Xiao Wang 0004, Vince D. Calhoun. 5457-5466 [doi]
- One-Cycle Structured Pruning via Stability-Driven Subnetwork SearchDeepak Ghimire, Dayoung Kil, Seonghwan Jeong, Jaesik Park, Seong-Heum Kim. 5467-5476 [doi]
- PredMapNet: Future and Historical Reasoning for Consistent Online HD Vectorized Map ConstructionBo Lang, Nirav Savaliya, Zhihao Zheng, Jinglun Feng, Zheng-Hang Yeh, Mooi Choo Chuah. 5477-5487 [doi]
- Multi-view stereo with multiple projectors for oneshot entire shape scan based on Neural SDF and DSSS demultiplexingKota Nishihara, Ryo Furukawa 0001, Ryusuke Sagawa, Hiroshi Kawasaki. 5488-5497 [doi]
- FreeCond: Free Lunch in the Input Conditions of Text-Guided InpaintingTeng-Fang Hsiao, Bo-Kai Ruan, Sung-Lin Tsai, Yi-Lun Wu, Hong-Han Shuai. 5498-5508 [doi]
- ControlEvents: Controllable Synthesis of Event Camera Data with Foundational Prior from Image Diffusion ModelsYixuan Hu, Yuxuan Xue 0001, Simon Klenk, Daniel Cremers, Gerard Pons-Moll. 5509-5519 [doi]
- DPBridge: Latent Diffusion Bridge for Dense PredictionHaorui Ji, Taojun Lin, Hongdong Li. 5520-5530 [doi]
- PatchEAD: Unifying Industrial Visual Prompting Frameworks for Patch-Exclusive Anomaly DetectionPo-Han Huang, Jeng-Lin Li, Po-Hsuan Huang, Ming-Ching Chang, Wei-Chao Chen. 5531-5540 [doi]
- SurfDist: Interpretable Three-Dimensional Instance Segmentation Using Curved Surface PatchesJackson Borchardt, Saul Kato. 5541-5549 [doi]
- CRISP: Cylindrical Rendering for In-Stream Point CloudsHyungwoo Kang, Seonyoung Jang, YeoJun Yoon, Byung Tae Oh. 5550-5559 [doi]
- INRetouch: Context Aware Implicit Neural Representation for Photography RetouchingOmar Elezabi, Marcos V. Conde, Zongwei Wu, Radu Timofte. 5560-5569 [doi]
- Line Art Colorization with Offset Prior-based Diffusion ModelXuan Zhu, Miao Cao, Fang-Lue Zhang, Yu-Kun Lai, Paul L. Rosin. 5570-5580 [doi]
- Food Image Generation on Multi-Noun CategoriesXinyue Pan, Yuhao Chen 0001, Jiangpeng He, Fengqing Zhu 0001. 5581-5590 [doi]
- RobuMTL: Enhancing Multi-Task Learning Robustness Against Weather ConditionsTasneem Shaffee, Sherief Reda. 5592-5600 [doi]
- EndoPBR: Photorealistic Synthetic Data for Surgical 3D Vision via Physically-based RenderingJohn J. Han, Jie Ying Wu. 5601-5611 [doi]
- Inpainting of Sparse Depth Maps from Monocular Depth-from-Focus on Pixel Processor ArraysMaciej Lewandowski, Piotr Dudek. 5612-5622 [doi]
- DMS2F-HAD: A Dual-branch Mamba-based Spatial-Spectral Fusion Network for Hyperspectral Anomaly DetectionAayushma Pant, Lakpa Dorje Tamang, Tsz-Kwan Lee, Sunil Aryal. 5623-5632 [doi]
- F-ViTA: Foundation Model Guided Visible-to-Infrared TranslationJay N. Paranjape, Celso M. de Melo, Vishal M. Patel. 5633-5642 [doi]
- KFS-Bench: Comprehensive Evaluation of Key Frame Sampling in Long Video UnderstandingZongyao Li, Kengo Ishida, Satoshi Yamazaki, Xiaotong Ji, Jianquan Liu. 5643-5652 [doi]
- FujiView: Multimodal Late-Fusion for Predicting Scenic VisibilityBryce Bible, Nehal Hasnaeen, Hairong Qi 0001. 5653-5661 [doi]
- Improving Animal Pose Estimation through Species Similarity Measures and Rigorous Label DefinitionMedhashree Parhy, Shaan Chanchani, Claire Kim, Josh Mansky, Zian Pan, Parth Thakre, Haoyu Chen, Amy R. Reibman. 5662-5671 [doi]
- Grounding Descriptions in Images informs Zero-Shot Visual RecognitionShaunak Halbe, Junjiao Tian, K. J. Joseph, James Seale Smith, Katherine Stevo, Vineeth N. Balasubramanian, Zsolt Kira. 5672-5681 [doi]
- Semi-supervised Key-Point Estimation for Echocardiography VideoSeok-Hwan Oh, Hyeon-Jik Lee, Guil Jung, Myeong-Gee Kim, Young-Min Kim, Hyuksool Kwon, Hyeon-Min Bae. 5682-5692 [doi]
- Anatomically-guided masked autoencoder pre-training for aneurysm detectionAlberto Mario Ceballos-Arroyo, Jisoo Kim, Chu-Hsuan Lin, Lei Qin, Geoffrey S. Young, Huaizu Jiang. 5693-5694 [doi]
- Style-Friendly SNR Sampler for Style-Driven GenerationJooyoung Choi 0001, Chaehun Shin, Yeongtak Oh, Heeseung Kim, Jungbeom Lee, Sungroh Yoon. 5703-5713 [doi]
- Lose Your Self (LoYS): an adversarial entropy-based unsupervised approach for model debiasingVito Paolo Pastore, Massimiliano Ciranni, Vittorio Murino. 5714-5723 [doi]
- MagicDrive3D: Controllable 3D Generation for Any-View Rendering in Street ScenesRuiyuan Gao 0001, Kai Chen 0023, Zhihao Li 0002, Lanqing Hong, Zhenguo Li, Qiang Xu 0001. 5724-5733 [doi]
- Grounding Degradations in Natural Language for All-In-One Video RestorationMuhammad Kamran Janjua, Amirhosein Ghasemabadi, Kunlin Zhang, Mohammad Salameh, Chao Gao, Di Niu. 5734-5743 [doi]
- ControlVP: Interactive Geometric Refinement of AI-Generated Images with Consistent Vanishing PointsRyota Okumura, Kaede Shiohara, Toshihiko Yamasaki. 5744-5753 [doi]
- Enhancing Vision Language Corruption Robustness using Cross-Distribution & Prompted DenoisersSameer Shafayet Latif, Sadab Shiper, K. M. Rahiduzzaman Kiran, Md Farhan Ishmam, Md Azam Hossain, Abu Raihan Mostofa Kamal, Md. Hamjajul Ashmafee. 5754-5765 [doi]
- BlendCLIP: Bridging Synthetic and Real Domains for Zero-Shot 3D Object Classification with Multimodal PretrainingAjinkya Khoche, Gergo László Nagy, Maciej Wozniak 0001, Thomas Gustafsson, Patric Jensfelt. 5766-5775 [doi]
- Towards Egocentric 3D Hand Pose Estimation in Unseen DomainsWiktor Mucha, Michael Wray, Martin Kampel. 5776-5786 [doi]
- Direct Visual Grounding by Directing Attention of Visual TokensParsa Esmaeilkhani, Longin Jan Latecki. 5787-5797 [doi]
- Motion-Aware Graph Fusion Network for 3D Human Pose EstimationYen Pham, Xiaohui Yuan 0001, Chengyuan Zhuang. 5798-5808 [doi]
- UniGaze: Towards Universal Gaze Estimation via Large-scale Pre-TrainingJiawei Qin, Xucong Zhang, Yusuke Sugano. 5809-5820 [doi]
- Unsupervised Discovery of Long-Term Spatiotemporal Periodic Workflows in Human ActivitiesFan Yang 0032, Quanting Xie, Atsunori Moteki, Shoichi Masui, Shan Jiang 0006, Kanji Uchino, Yonatan Bisk, Graham Neubig. 5821-5832 [doi]
- VAST-ReID: A Low-Light Benchmark Dataset for Person Re-Identification with Visual and Attribute-Rich Semantic TrackingHammad Khan, Rakesh Kumar Giri, Kamalakar Vijay Thakare, Heeseung Choi, Hyungjoo Jung, Debi Prosad Dogra, Ig-Jae Kim. 5833-5841 [doi]
- DexAvatar: 3D Sign Language Reconstruction with Hand and Body Pose PriorsKaustubh Kundu, Hrishav Bakul Barua, Lucy M. Robertson-Bell, Zhixi Cai, Kalin Stefanov. 5842-5852 [doi]
- DREAM: Dynamic Prompts and GuidedMix for Efficient Continual Adaptation of Visual-Language ModelsEvelyn Chee, Mong-Li Lee, Wynne Hsu. 5853-5863 [doi]
- brat : Aligned Multi-View Embeddings for Brain MRI AnalysisMaxime Kayser, Maksim Gridnev, Wanting Wang, Max Bain, Aneesh Rangnekar, Avijit Chatterjee, Aleksandr Petrov, Harini Veeraraghavan, Nathaniel C. Swinburne. 5864-5874 [doi]
- Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment ScoreEman Ali, Sathira Silva, Chetan Arora 0001, Muhammad Haris Khan. 5875-5885 [doi]
- Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset GenerationLiu He, Xiao Zeng, Yizhi Song, Albert Y. C. Chen 0001, Lu Xia, Shashwat Verma, Sankalp Dayal, Min Sun, Cheng-Hao Kuo, Daniel G. Aliaga. 5886-5897 [doi]
- CLIP-UP: CLIP-Based Unanswerable Problem Detection for Visual Question AnsweringBen Vardi, Oron Nir, Ariel Shamir. 5898-5908 [doi]
- Isolating the Role of Temporal Information in Video Saliency: A Controlled Experimental AnalysisPeter El-Jiz, Matthias Kuemmerer, Matthias Tangemann, Matthias Bethge, Andreas M. Bartels, Michael M. Bannert. 5909-5918 [doi]
- Diffusion-Based Action Recognition Generalizes to Untrained DomainsRogério Guimarães, Frank Xiao, Pietro Perona, Markus Marks. 5919-5933 [doi]
- CORA: Consistency-Guided Semi-Supervised Framework for Reasoning SegmentationPrantik Howlader, Hoang Nguyen-Canh, Srijan Das, Jingyi Xu, Hieu Le 0001, Dimitris Samaras. 5934-5944 [doi]
- Hierarchical Instance Tracking to Balance Privacy Preservation with Accessible InformationNeelima Prasad, Jarek Reynolds, Neel Karsanbhai, Tanusree Sharma, Lotus Zhang, Abigale Stangl, Yang Wang 0005, Leah Findlater, Danna Gurari. 5945-5955 [doi]
- Causality-Driven Audits of Model RobustnessNathan Drenkow, William Paul, Chris Ribaudo, Mathias Unberath. 5956-5966 [doi]
- BAFLE-DCT: Bypassing Adversarial Filters via Frequency-Selective Embedding in the DCT DomainThilina Mendis, Farah I. Kandah, Sathyanarayanan N. Aakur. 5967-5976 [doi]
- Logit-Adjusted Test-Time Adaptation under Partial Class ImbalanceThilina Weerasinghe, Ruwan B. Tennakoon, Weiqin Chuah, Alireza Bab-Hadiashar. 5977-5985 [doi]
- Test Time Adaptation Using Adaptive Quantile RecalibrationParia Mehrbod, Pedro Vianna, Géraldin Nanfack, Guy Wolf, Eugene Belilovsky. 5986-5995 [doi]
- OSEG: Improving Diffusion sampling through Orthogonal Smoothed Energy GuidanceMasud An Nur Islam Fahim, Nazmus Saqib, Joon-Min Gil. 5996-6005 [doi]
- Hymavi : A Hybrid Mamba-Attention Network in Multi-View Framework for Volumetric Medical Image SegmentationSy Dat Tran, Jin-Kyu Gahm. 6006-6015 [doi]
- RoadBench: A Vision-Language Foundation Model and Benchmark for Road Damage UnderstandingXi Xiao, Yunbei Zhang, Janet Wang, Lin Zhao, Yuxiang Wei 0004, Hengjia Li, Yanshu Li, Xiao Wang 0004, Swalpa Kumar Roy, Hao Xu, Tianyang Wang 0004. 6016-6026 [doi]
- IMKD: Intensity-Aware Multi-Level Knowledge Distillation for Camera-Radar FusionShashank Mishra, Karan Patil, Didier Stricker, Jason R. Rambach. 6027-6038 [doi]
- LogicCBMs: Logic-Enhanced Concept-Based LearningDeepika Vemuri, Gautham Bellamkonda, Aditya Pola, Vineeth N. Balasubramanian. 6039-6048 [doi]
- Understanding the Visual Projection Space of Multimodal LLMsSungHeon Jeong 0001, Yoojeong Song, Hyungjoon Kim. 6049-6058 [doi]
- NoHumansRequired: Autonomous High-Quality Image Editing Triplet MiningMaksim Kuprashevich, Grigorii Alekseenko, Irina Tolstykh, Georgii Fedorov, Bulat Suleimanov, Vladimir Dokholyan, Aleksandr Gordeev. 6059-6068 [doi]
- SSMT-Net: A Semi-Supervised Multitask Transformer-Based Network for Thyroid Nodule Segmentation in Ultrasound ImagesMuhammad Umar Farooq, Abd Ur Rehman, Azka Rehman, Muhammad Usman 0026, Dong-Kyu Chae. 6069-6079 [doi]
- Gaussian Splatting Map Registration with Orthographic Bird's-Eye-View RenderingsH. Leblond, G. Simon, R. Martins, Cédric Demonceaux, M.-O. Berger. 6080-6089 [doi]
- MUSE: Model-based Uncertainty-aware Similarity Estimation for zero-shot 2D Object Detection and SegmentationSungmin Cho, Sungbum Park, Insoo Oh. 6090-6100 [doi]
- MVAT: Multi-View Aware Teacher for Weakly Supervised 3D Object DetectionSaad Lahlali, Alexandre Fournier-Montgieux, Nicolas Granger 0001, Hervé Le Borgne, Quoc-Cuong Pham. 6101-6110 [doi]
- ODEt(ODEl): Shortcutting the Time and the Length in Diffusion and Flow Models for Faster SamplingDenis A. Gudovskiy, Wenzhao Zheng, Tomoyuki Okuno, Yohei Nakata, Kurt Keutzer. 6111-6120 [doi]
- TM-Adapter: Temporal Merge Adapter for Efficient Global Temporal ModelingWoo Joo Hahm, Seungwoo Jang, Hyeon Tak Kim, Daeun Lee, Kwangsu Kim. 6121-6131 [doi]
- Diagnose Like A REAL Pathologist: An Uncertainty-Focused Approach for Trustworthy Multi-Resolution Multiple Instance LearningSungrae Hong, Sol Lee, Jisu Shin 0001, Jiwon Jeong, Mun Yong Yi. 6132-6141 [doi]
- Align Video Diffusion Model with Online Video-Centric Preference OptimizationJiacheng Zhang, Jie Wu 0001, Weifeng Chen, Yatai Ji, Xuefeng Xiao 0001, Weilin Huang, Kai Han. 6142-6152 [doi]
- SceneProp: Combining Neural Network and Markov Random Field for Scene-Graph GroundingKeita Otani, Tatsuya Harada. 6153-6162 [doi]
- GHOST: Getting to the Bottom of Hallucinations with A Multi-round Consistency BenchmarkVibashan VS, Nadine Chang, Jenny Schmalfuss, Vishal M. Patel, Zhiding Yu, José M. Álvarez 0004. 6163-6173 [doi]
- GeneVA: A Dataset of Human Annotations for Generative Text to Video ArtifactsJenna Kang, Maria Beatriz Silva, Patsorn Sangkloy, Kenneth Chen, Niall L. Williams, Qi Sun 0003. 6174-6183 [doi]
- Zero-Shot Domain Generalisation via Prompt-Driven Feature RefinementTingrui Qiao, Di Zhao, Caroline Walker, Chris Cunningham, Yun Sing Koh. 6184-6193 [doi]
- Can Image Splicing and Copy-Move Forgery Be Detected by the Same Model? Forensim: An Attention-Based State-Space ApproachSoumyaroop Nandi, Prem Natarajan. 6194-6204 [doi]
- Distilling Offline Action Detection Models into Real-Time Streaming ModelsDeep Anil Patel, Yasunori Babazaki, Yasuto Nagase, Iain Melvin, Martin Renqiang Min. 6205-6214 [doi]
- AuthGuard: Generalizable Deepfake Detection via Language GuidanceGuangyu Shen, Zhihua Li, Xiang Xu, Tianchen Zhao, Zheng Zhang 0001, Dongsheng An, Zhuowen Tu, Yifan Xing, Qin Zhang. 6215-6225 [doi]
- GroupPortrait: Multi-ID Portrait Generation with High Identity Preservation and Fine-Grained ControlMeijia Huang, Ruida Li, Bing Ma, Liangwei Jiang, Shuo Fang, Chenguang Ma. 6226-6235 [doi]
- GFT-GCN: Privacy-Preserving 3D Face Mesh Recognition with Spectral DiffusionHichem Felouat, Hanrui Wang 0005, Isao Echizen. 6236-6245 [doi]
- 3P: Towards Forecasting Long-horizon Real-world Anomaly from NormalcyQuentin Mérilleau, Snehashis Majhi, Antitza Dantcheva, Quan Kong, Lorenzo Garattoni, Gianpiero Francesca, François Brémond. 6246-6255 [doi]
- See, Record, Do: Automated Generation of UI Workflows from Tutorial VideosAdam Beauchaine, Craig A. Shue. 6256-6265 [doi]
- Video and Language Alignment in 2D Systems for 3D Multi-object Scenes with Multi-Information Derivative-Free ControlJason Armitage, Rico Sennrich. 6266-6276 [doi]
- FocalComm: Hard Instance-Aware Multi-Agent PerceptionDereje Shenkut, Vijayakumar Bhagavatula. 6277-6286 [doi]
- SFMNet: Sparse Focal Modulation for 3D Object DetectionOren Shrout, Ayellet Tal. 6287-6297 [doi]
- MoSCo: Real-time and Efficient Text-to-Motion Synthesis via Delta TrainingZhiyuan Zhang, Lingqiao Liu. 6298-6308 [doi]
- VLMDiff: Leveraging Vision-Language Models for Multi-Class Anomaly Detection with DiffusionSamet Hicsonmez, Abd El Rahman Shabayek, Djamila Aouada. 6309-6319 [doi]
- Predicting Task fMRI Contrasts from Resting-State fMRI Using Sparse 3D ConvolutionsIvan Sviridov, Maria Boyko, Maksim Sharaev. 6320-6329 [doi]
- SceneEdited: A City-Scale Benchmark for 3D HD Map Updating via Image-Guided Change DetectionChun-Jung Lin, Tat-Jun Chin, Sourav Garg, Feras Dayoub. 6330-6339 [doi]
- Overcoming Small Data Limitations in Video-Based Infant Respiration EstimationLiyang Song, Hardik Bishnoi, Sai Kumar Reddy Manne, Sarah Ostadabbas, Briana J. Taylor, Michael Wan. 6340-6349 [doi]
- Non-Aligned Reference Image Quality Assessment for Novel View SynthesisAbhijay Ghildyal, Rajesh Sureddi, Nabajeet Barman, Saman Zadtootaghaj, Alan C. Bovik. 6350-6359 [doi]
- Pointmap-Conditioned Diffusion for Consistent Novel View SynthesisThang-Anh-Quan Nguyen, Laurent Caraffa, Jean-Philippe Tarel, Roland Brémond. 6360-6370 [doi]
- TED-4DGS: Temporally Activated and Embedding-based Deformation for 4DGS CompressionCheng-Yuan Ho, Hebi Yang, Jui-Chiu Chiang, Yu-Lun Liu 0001, Wen-Hsiao Peng. 6371-6380 [doi]
- QUOTA: Quantifying Objects with Text-to-Image Models for Any DomainWenfang Sun, Yingjun Du, Gaowen Liu, Yefeng Zheng 0001, Cees G. M. Snoek. 6381-6390 [doi]
- Single-step Diffusion for Image Compression at Ultra-Low BitratesChanung Park, Joo Chan Lee, Jong Hwan Ko. 6391-6400 [doi]
- Virtually Unrolling the Herculaneum Papyri by Diffeomorphic Spiral FittingPaul Henderson. 6401-6411 [doi]
- Diffusion Noise Optimization for Synthetic VLM TrainingRen Ohkubo, Rintaro Yanagi, Hirokatsu Kataoka, Yutaka Satoh. 6412-6421 [doi]
- Histogram Assisted Quality Aware Generative Model for Resolution Invariant NIR Image ColorizationAbhinav Attri, Rajeev Ranjan Dwivedi, Samiran Das, Vinod Kumar Kurmi. 6422-6431 [doi]
- Polymorph: Energy-Efficient Multi-Label Classification for Video Streams on Embedded DevicesSaeid Ghafouri, Mohsen Fayyaz, Xiangchen Li, Deepu John, Bo Ji 0001, Dimitrios S. Nikolopoulos, Hans Vandierendonck. 6432-6441 [doi]
- A Unified Diffusion-Based Framework for Multi-Agent Trajectory Prediction Integrating Structured Multi-Modal RepresentationsChenxi Yang, Suyang Xi, Hong Ding, Yiqing Shen 0003, Yunhao Liu. 6442-6452 [doi]
- ChartQA-X: Generating Explanations for Visual Chart ReasoningShamanthak Hegde, Pooyan Fazli, Hasti Seifi. 6453-6463 [doi]
- Distribution Highlighted Reference-based Label Distribution Learning for Facial Age EstimationSatoshi Suzuki, Shin'ya Yamaguchi, Shoichiro Takeda, Takuhiro Kaneko, Shota Orihashi, Ryo Masumura. 6464-6473 [doi]
- T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video GenerationYubin Chen, Xuyang Guo, Zhenmei Shi, Zhao Song 0002, Jiahao Zhang. 6474-6485 [doi]
- UniTabBank: A Large Scale Multi-Lingual, Multi-Layout, Multi-Type, Multi-Format Dataset for Table DetectionAjoy Mondal, Saumya Mundra, Avijit Dasgupta, C. V. Jawahar. 6486-6495 [doi]
- R-MMA: Enhancing Vision-Language Models with Recurrent Adapters for Few-Shot and Cross-Domain GeneralizationMd Fahim, Md Farhan Ishmam, Mir Sazzat Hossain, M. Ashraful Amin, Amin Ahsan Ali, AKM Mahbubur Rahman. 6496-6506 [doi]
- Hybrid State Representation for Video Procedure PlanningWoo Suk Choi, Youwon Jang, Minsu Lee 0001, Byoung-Tak Zhang. 6507-6516 [doi]
- Training-Free Few-Shot Segmentation via Vision-Language Guided PromptingEuihyun Yoon, Taejin Park, Jaekoo Lee. 6517-6526 [doi]
- High-Level Semantics and Low-Level Features Fusion for Multi-Scale Object Detection in Dynamic Construction EnvironmentsMahdi Bonyani, Maryam Soleymani, Chao Wang 0046. 6527-6536 [doi]
- Mean-Shift Distillation for Diffusion Mode SeekingVikas Thamizharasan, Nikitas Chatzis, Iliyan Georgiev, Matthew Fisher, Evangelos Kalogerakis, Difan Liu, Nanxuan Zhao, Michal Lukác. 6537-6546 [doi]
- TacticalCalib: End-to-End 6-DoF Camera Pose Regression for Tactical Camera CalibrationLiang Fan, Xiaoqian Liu, Zhi Chen, Lingkai Yang. 6547-6556 [doi]
- F-INR: Functional Tensor Decomposition for Implicit Neural RepresentationsSai Karthikeya Vemuri, Tim Büchner, Joachim Denzler. 6557-6568 [doi]
- V2XScene: Multi-View Consistent 3D Scene Simulation for Collaborative PerceptionYanfei Li, Yi Gong, Yuan Zeng. 6569-6579 [doi]
- WiSAR3D - Aerial LiDAR dataset for 3D object detectionOren Shrout, Ori Nizan, Yizhak Ben-Shabat, Ayellet Tal. 6580-6589 [doi]
- A Deep Network for Object Detection on Inland WatersDennis Grießer, Bastian Goldluecke, Matthias O. Franz, Georg Umlauf. 6590-6599 [doi]
- CoreCaption: Core Caption based Text-to-Video RetrievalJunKyu Jang. 6600-6610 [doi]
- ZebraPose: Zebra Detection and Pose Estimation using only Synthetic DataElia Bonetto, Aamir Ahmad. 6611-6620 [doi]
- OPFormer: Object Pose Estimation leveraging foundation model with geometric encodingArtem Moroz, Vít Zeman, Martin Miksík, Elizaveta Isianova, Miroslav David, Pavel Burget, Varun Burde. 6621-6632 [doi]
- FAIR-SIGHT: Fairness Assurance in Image Recognition via Simultaneous Conformal Thresholding and Dynamic Output RepairArya Fayyazi, Mehdi Kamal, Massoud Pedram. 6633-6642 [doi]
- GDoFS: Gaussian DoF Separation for Plausible 3D Geometry in Sparse-View 3DGSYongSung Kim, Jooyoung Choi 0001, Sungroh Yoon. 6643-6652 [doi]
- Learning Beyond Labels: Self-Supervised Handwritten Text RecognitionShree Mitra, Ajoy Mondal, C. V. Jawahar. 6653-6663 [doi]
- Guiding What Not to Generate: Automated Negative Prompting for Text-Image AlignmentSangha Park, Eunji Kim 0002, Yeongtak Oh, Jooyoung Choi 0001, Sungroh Yoon. 6664-6675 [doi]
- Neural Geometry Image-Based Representations with Optimal Transport (OT)Xiang Gao 0045, Yuanpeng Liu, Jiazhi Li 0001, Xinmu Wang, Minghao Guo, Yu Guo, Xiyun Song, Heather Yu, Zhiqiang Lao, Xianfeng David Gu. 6676-6686 [doi]
- RealDroneVision: Dataset and Architecture Advancements for Small-Object Drone DetectionArun Kumar Sivapuram, Pranav R. T. Peddinti, Harish Puppala, Komuravelli Prashanth, Jaladi Sri Harsha, Rama Krishna Sai S. Gorthi. 6687-6695 [doi]
- PerVL-Bench: Benchmarking Multimodal Personalization for Large Vision-Language ModelsMinSung Kim. 6696-6704 [doi]
- TRACE: Confounder-free Adversarial Fine-tuning for Robust Object DetectionWonho Lee, Jisu Lee, Hyunsik Na, Sohee Park, Daeseon Choi. 6705-6714 [doi]
- Zero-LEAD: Source-Free Universal Domain Adaptation for Abdominal Multi-Organ SegmentationAhmed El Sayed, Marwan Torki. 6715-6723 [doi]
- Correcting and Quantifying Systematic Errors in 3D Box Annotations for Autonomous DrivingAlexandre Justo Miro, Ludvig af Klinteberg, Bogdan Timus, Aron Asefaw, Ajinkya Khoche, Thomas Gustafsson, Sina Sharif Mansouri, Masoud Daneshtalab. 6724-6732 [doi]
- FastHMR: Accelerating Human Mesh Recovery via Token and Layer Merging with Diffusion DecodingSoroush Mehraban, Andrea Iaboni, Babak Taati. 6733-6743 [doi]
- Point2Pose: A Generative Framework for 3D Human Pose Estimation with Multi-View Point Cloud DatasetHyunsoo Lee, Daeum Jeon, Hyeokjae Oh. 6744-6753 [doi]
- UniVid: Unifying Vision Tasks with Pre-trained Video Generation ModelsLan Chen, Yuchao Gu, Qi Mao 0002. 6754-6763 [doi]
- Optimal Transport for Rectified Flow Image Editing: Unifying Inversion-Based and Direct MethodsMarian Lupascu, Mihai-Sorin Stupariu. 6764-6774 [doi]
- Synthesizing Compositional Videos from Text DescriptionPrajwal Singh, Kuldeep Kulkarni, Shanmuganathan Raman, Harsh Rangwani. 6775-6784 [doi]
- S2O: Static to Openable Enhancement for Articulated 3D ObjectsDenys Iliash, Hanxiao Jiang 0001, Yiming Zhang 0019, Manolis Savva, Angel X. Chang. 6785-6795 [doi]
- HodgeFormer: Transformers for Learnable Operators on Triangular Meshes through Data-Driven Hodge MatricesAkis Nousias, Stavros Nousias. 6796-6805 [doi]
- Exploring Automated Recognition of Instructional Activity and Discourse from Multimodal Classroom DataIvo Bueno, Ruikun Hou, Babette Bühler, Tim Fütterer, James Drimalla, Jonathan K. Foster, Peter A. Youngs, Peter Gerjets, Ulrich Trautwein, Enkelejda Kasneci. 6806-6817 [doi]
- From Prompt to Production: Automating Brand-Safe Marketing Imagery with Text-to-Image ModelsParmida Atighehchian, Henry Wang, Andrei Kapustin, Boris Lerner, Tiancheng Jiang, Taylor Jensen, Negin Sokhandan. 6818-6826 [doi]
- Equivariant Sampling for Improving Diffusion Model-based Image RestorationChenxu Wu, Qingpeng Kong, Peiang Zhao, Wendi Yang, Wenxin Ma, Fenghe Tang, Zihang Jiang, S. Kevin Zhou. 6827-6839 [doi]
- PoseAdapt: Sustainable Human Pose Estimation via Continual Learning Benchmarks and ToolkitMuhammad Saif Ullah Khan, Didier Stricker. 6840-6850 [doi]
- SAVeD: Learning to Denoise Low-SNR Video for Improved Downstream PerformanceSuzanne Stathatos, Michael Hobley, Pietro Perona, Markus Marks. 6851-6861 [doi]
- ATM: Enhanced Alignment for Text-to-Motion GenerationKe Han, Yueming Lyu, Weichen Yu, Nicu Sebe. 6862-6872 [doi]
- Memoire: Learning User Personas from Gallery Tags for Personalized Photo CurationPraful Mathur, Mohsin Iftekhar, Aman Sharma, Sarvesh Tiwari, Meghali Deka, Sathish Cherukuri, Roopa Sheshadri, Rakesh Valusa. 6873-6882 [doi]
- CSGaussian: Progressive Rate-Distortion Compression and Segmentation for 3D Gaussian SplattingYu-Jen Tseng, Chia-Hao Kao, Jing-Zhong Chen, Alessandro Gnutti, Shao-Yuan Lo, Yen-Yu Lin, Wen-Hsiao Peng. 6883-6892 [doi]
- Test-Time Adaptation for Video Highlight Detection Using Meta-Auxiliary Learning and Cross-Modality HallucinationsZahidul Islam, Sujoy Paul, Mrigank Rochan. 6893-6902 [doi]
- SD-CSFL: A Synthetic Data-Driven Conformity Scoring Framework for Robust Federated LearningEbtisaam Alharbi, Abdulrahman Kerim, Leandro Soriano Marcolino, Qiang Ni. 6903-6912 [doi]
- Alignment and Distillation: A Robust Framework for Multimodal Domain Generalizable Human Action RecognitionHyeonbin Ji, Juyeob Lee, Eunil Park. 6913-6924 [doi]
- Procedure Learning via Regularized Gromov-Wasserstein Optimal TransportSyed Ahmed Mahmood, Ali Shah Ali, Umer Ahmed, Fawad Javed Fateh, M. Zeeshan Zia, Quoc Huy Tran. 6925-6935 [doi]
- Clear Sights on Site: A Spatial-Adaptive Channel Network for Deblurring Construction Site ImagesMahdi Bonyani, Maryam Soleymani, Chao Wang 0046. 6936-6945 [doi]
- SegMo: Segment-aligned Text to 3D Human Motion GenerationBowen Dang, Lin Wu, Xiaohang Yang, Zheng Yuan, Zhixiang Chen. 6946-6955 [doi]
- From Darkness to Detail: Frequency-Aware SSMs for Low-Light VisionEashan Adhikarla, Kai Zhang 0039, Gong Chen, John W. Nicholson 0001, Brian D. Davison 0001. 6956-6967 [doi]
- Multimodal Adversarial Defense for Vision-Language Models by Leveraging One-To-Many RelationshipsFuta Waseda, Antonio Tejero-de-Pablos, Isao Echizen. 6968-6977 [doi]
- ForestSplats: Deformable transient field for Gaussian Splatting in the WildWongi Park, Myeongseok Nam, Siwon Kim, Sangwoo Jo, Soomok Lee. 6978-6987 [doi]
- Graph Query Networks for Object Detection with Automotive RadarLoveneet Saini, Hasan Tercan, Tobias Meisen. 6988-6997 [doi]
- FlowCLAS: Enhancing Normalizing Flow-Based Anomaly Segmentation Via Contrastive LearningChang Won Lee, Selina Leveugle, Paul Grouchy, Chris Langley, Svetlana Stolpner, Jonathan Kelly, Steven L. Waslander. 6998-7007 [doi]
- ScoreNet: Netting Lightweight Quality Scores for Better Visual Assessment with Large Multi-Modality ModelsBahador Rashidi, Kiarash Aghakasiri, Shupei Zhang, Amirmohsen Sattarifard, Yue Zhang 0025, Chao Gao. 7008-7018 [doi]
- VectorSynth: Fine-Grained Satellite Image Synthesis with Structured SemanticsDaniel Cher, Brian Wei, Srikumar Sastry, Nathan Jacobs. 7019-7029 [doi]
- Digital Forensic AI You Can Explain: A Case Study on Video Source Camera IdentificationMaryna Veksler, Kemal Akkaya, A. Selcuk Uluagac. 7030-7039 [doi]
- Modeling and Learning Multiple Hypotheses for Monocular 3D Object DetectionHyeonjeong Park, Peixi Xiong, Pei Yu, Wei Tang 0016. 7040-7050 [doi]
- SGD-Mix: Enhancing Domain-Specific Image Classification with Label-Preserving Data AugmentationYixuan Dong, Fang-Yi Su, Jung-Hsien Chiang. 7051-7061 [doi]
- DreamCatcher: Efficient Multi-Concept Customization via Representation FinetuningJungwon Lee, Changhun Lee, Eunhyeok Park. 7062-7072 [doi]
- Enhancing Monocular 3D Hand Reconstruction with Learned Texture PriorsGiorgos Karvounas, Nikolaos Kyriazis, Iason Oikonomidis, Georgios Pavlakos, Antonis A. Argyros. 7073-7083 [doi]
- PALMS+: Modular Image-Based Floor Plan Localization Leveraging Depth Foundation ModelYunqian Cheng, Benjamin Princen, Roberto Manduchi. 7084-7093 [doi]
- IPCD: Intrinsic Point-Cloud DecompositionShogo Sato, Takuhiro Kaneko, Shoichiro Takeda, Tomoyasu Shimada, Kazuhiko Murasaki, Taiga Yoshida, Ryuichi Tanida, Akisato Kimura. 7094-7103 [doi]
- Multimodal Graph Representation Learning over Arbitrary Sets of ModalitiesSantosh V. Patapati, Trisanth Srinivasan. 7104-7115 [doi]
- FNOpt: Resolution-Agnostic, Self-Supervised Cloth Simulation using Meta-Optimization with Fourier Neural OperatorsRuochen Chen, Thuy Tran, Shaifali Parashar. 7116-7125 [doi]
- D2Mamba: Dual Domain Guided Informed Search in State Space Model for Underwater Image EnhancementAlik Pramanick, Soumajit Roy, Arijit Sur. 7126-7136 [doi]
- Image-Guided Semantic Pseudo-LiDAR Point Generation for 3D Object DetectionMinseung Lee, Seokha Moon, Seung Joon Lee, Reza Mahjourian, Jinkyu Kim. 7137-7147 [doi]
- HABIT: Human Action Benchmark for Interactive Traffic in CARLAMohan Ramesh, Mark Azer, Fabian Flohr. 7148-7157 [doi]
- EVTP-IVS: Effective Visual Token Pruning For Unifying Instruction Visual Segmentation In Multi-Modal Large Language ModelsWenhui Zhu, Xiwen Chen, Zhipeng Wang, Shao Tang, Sayan Ghosh, Xuanzhao Dong, Rajat Koner, Yalin Wang 0001. 7158-7167 [doi]
- AuViRe: Audio-visual Speech Representation Reconstruction for Deepfake Temporal LocalizationChristos Koutlis, Symeon Papadopoulos. 7168-7177 [doi]
- Exploring the Boundaries of Diffusion Models for Offline Writer Identification with Sparse and Intra-Variable DataAritra Dey, Chandranath Adak, Kumari Priya, Soumi Chattopadhyay, Sukalpa Chanda. 7178-7187 [doi]
- CLoCKDistill: Consistent Location and Context aware Knowledge Distillation for DETRsQizhen Lan, Qing Tian 0003. 7188-7197 [doi]
- MaxInfo: A Training-Free Key-Frame Selection Method Using Maximum Volume for Enhanced Video UnderstandingPengyi Li 0003, Irina Abdullaeva, Alexander Gambashidze, Andrey Kuznetsov, Ivan V. Oseledets. 7198-7207 [doi]
- Cycle-Consistent Multi-Graph Matching for Self-Supervised Annotation of C. ElegansSebastian Stricker, Christoph Karg, Lisa Hutschenreiter, Bogdan Savchynskyy, Dagmar Kainmueller. 7208-7217 [doi]
- Automated Suturing Skill Assessment in Robot-assisted Surgery from Endoscopic Videos using Clinically-guided Evaluation CriteriaAtharva Sunil Deo, Ujjwal Pasupulety, Nicholas Matsumoto, Jay Moran, Cherine Yang, Jeanine Kim, Rafal Dariusz Kocielnik, Aurash Naser-Tavakolian, Andrew J. Hung. 7218-7228 [doi]
- Deep Image Decomposition for Medical Imaging Anonymization and CurationYael Elkin, Gal Ben-Arie, Tammy Riklin-Raviv. 7229-7238 [doi]
- Intraoperative 2D/3D Registration via Spherical Similarity Learning and Differentiable Levenberg-Marquardt OptimizationMinheng Chen, Youyong Kong. 7239-7249 [doi]
- ACuRE: Accurate Continuity-Regularized SpO2 Estimation Using Liquid Time-Constant NetworksShahzad Ahmad, Divya Mishra, Sania Bano, Sukalpa Chanda, Yogesh Singh Rawat. 7250-7259 [doi]
- CAST: Evaluating Multi-Object Trackers with Context-Aware Switch and Transfer ScoresJin Bai 0001, Gregory D. Hager. 7260-7268 [doi]
- Advancing Player Identification and Tracking with Global ID Fusion (GIF)Karol Wojtulewicz, Minxing Liu, Niklas Carlsson. 7269-7280 [doi]
- Distilling What and Why: Enhancing Driver Intention Prediction with MLLMsSainithin Artham, Avijit Dasgupta, Shankar Gangisetty, C. V. Jawahar. 7281-7290 [doi]
- LASER: Lip Landmark Assisted Speaker Detection for RobustnessLe Thien Phuc Nguyen, Zhuoran Yu, Yong Jae Lee. 7291-7300 [doi]
- VADER: Towards Causal Video Anomaly Understanding with Relation-Aware Large Language ModelsYing Cheng, Yu-Ho Lin, Min-Hung Chen, Fu-En Yang, Shang-Hong Lai. 7301-7311 [doi]
- SCAdapter: Content-Style Disentanglement for Diffusion Style TransferLuan Thanh Trinh. 7312-7321 [doi]
- T2LF: LLM-Guided Multimodal Diffusion for Text-to-Light Field SynthesisSoyoung Yoon, Namhyuk Ahn, In Kyu Park. 7322-7332 [doi]
- VideoSketcher: A Training-Free Approach for Coherent Video Sketch TransferHuining Li, Bangzhen Liu, Rui Yang, Yang Zhou, Chenshu Xu, Xufang Pang, Shengfeng He. 7333-7343 [doi]
- Zero-Shot Audio-Visual Editing via Cross-Modal Delta DenoisingYan-Bo Lin, Kevin Lin, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Chung-Ching Lin, Xiaofei Wang, Gedas Bertasius, Lijuan Wang. 7344-7354 [doi]
- SceneEval: Evaluating Semantic Coherence in Text-Conditioned 3D Indoor Scene SynthesisHou In Ivan Tam, Hou In Derek Pun, Austin T. Wang, Angel X. Chang, Manolis Savva. 7355-7365 [doi]
- IPTQ-ViT: Post-Training Quantization of Non-linear Functions for Integer-only Vision TransformersGihwan Kim, Jemin Lee, Hyungshin Kim. 7366-7375 [doi]
- MM-TS: Multi-Modal Temperature and Margin Schedules for Contrastive Learning with Long-Tail DataSiarhei Sheludzko, Dhimitrios Duka, Bernt Schiele, Hilde Kuehne, Anna Kukleva. 7376-7386 [doi]
- Boosting Unsupervised Video Instance Segmentation with Automatic Quality-Guided Self-TrainingKaixuan Lu, Mehmet Onurcan Kaya, Dim P. Papadopoulos. 7387-7397 [doi]
- Locally Explaining Prediction Behavior via Gradual Interventions and Measuring Property GradientsNiklas Penzel, Joachim Denzler. 7398-7408 [doi]
- Beyond Paired Data: Self-Supervised UAV Geo-Localization from Reference Imagery AloneTristan Amadei, Enric Meinhardt-Llopis, Benedicte Bascle, Corentin Abgrall, Gabriele Facciolo. 7409-7419 [doi]
- Where is the Watermark? Interpretable Watermark Detection at the Block LevelMaria Bulychev, Neil G. Marchant, Benjamin I. P. Rubinstein. 7420-7429 [doi]
- PointSt3R: Point Tracking through 3D Grounded CorrespondenceRhodri Guerrier, Adam W. Harley, Dima Damen. 7430-7439 [doi]
- Uplifting Table Tennis: A Robust, Real-World Application for 3D Trajectory and Spin EstimationDaniel Kienzle, Katja Ludwig, Julian Lorenz, Shin'ichi Satoh 0001, Rainer Lienhart. 7440-7449 [doi]
- FairVLM: Enhancing Fairness and Prompt Sensitivity in Vision Language Models for Medical Image SegmentationMotiur Rahman 0001, Saeka Rahman, Smriti Bhatt, Miad Faezipour. 7450-7460 [doi]
- SHaSaM: Submodular Hard Sample Mining for Fair Facial Attribute RecognitionAnay Majee, Rishabh Iyer 0001. 7461-7471 [doi]
- 3Net: Dual-Camera Super-Resolution via Domain Modulation and Multi-scale MatchingCong Guan, Jiacheng Ying, Yuya Ieiri, Osamu Yoshie. 7472-7481 [doi]
- SuperRivolution: Fine-Scale Rivers from Coarse Temporal Satellite ImageryRangel Daroya, Subhransu Maji. 7482-7492 [doi]
- Adversarial Pseudo-replay for Exemplar-free Class-incremental LearningHiroto Honda. 7493-7502 [doi]
- DiffRegCD: Integrated Registration and Change Detection with Diffusion FeaturesSeyedehanita Madani, Rama Chellappa, Vishal M. Patel. 7503-7512 [doi]
- HDR Reconstruction Boosting with Training-Free and Exposure-Consistent DiffusionYo-Tin Lin, Su-Kai Chen, Hou-Ning Hu, Yen-Yu Lin, Yu-Lun Liu. 7513-7523 [doi]
- Optimizing against Infeasible Inclusions from Data for Semantic Segmentation through MorphologyShamik Basu, Luc Van Gool, Christos Sakaridis. 7524-7533 [doi]
- 3D Cell Oversegmentation Correction via Geo-Wasserstein DivergencePeter Chen, Bryan Chang, Olivia Annette Creasey, Julie Beth Sneddon, Zev J. Gartner, Yining Liu. 7534-7543 [doi]
- TopoRec: Point Cloud Recognition Using Topological Data AnalysisAnirban Ghosh 0002, Iliya Kulbaka, Ian Dahlin, Ayan Dutta 0001. 7544-7553 [doi]
- MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic GraspingVineet Bhat, Naman Patel, Prashanth Krishnamurthy, Ramesh Karri, Farshad Khorrami. 7554-7564 [doi]
- Remote Sensing Forestry Similarity ConvolutionShikuan Wang, Yuangong Chen, Jianzhou Gong, Lingyi Meng, Mengquan Wu, Longxing Liu, Haiwei Yuan, Mingbin Guo. 7565-7575 [doi]
- RampWatch: An In-the-Wild Dataset and Text-Guided Detection Framework for Recreational VesselsMalik Muhammad Asim, Claire B. Smallwood, Abdullah Tariq, Johnny Lo, Syed Zulqarnain Gilani. 7576-7585 [doi]
- Enhancing Reverse Distillation with Core Exemplar Learning for Unified Multi-Class Anomaly DetectionHeechul Lim, Min-Soo Kim, Hyun-Boo Lee, Suk-Ju Kang, Kang-Wook Chon, Haeyun Lee. 7586-7595 [doi]
- Leveraging Sparsity for Privacy in Collaborative InferenceMaximilian Andreas Hoefler, Karsten Müller 0001, Wojciech Samek. 7596-7604 [doi]
- Improvise, Adapt, Overcome - Telescopic Adapters for Efficient Fine-tuning of Vision Language Models in Medical ImagingUjjwal Mishra, Vinita Shukla, Praful Hambarde, Amit Shukla 0002. 7605-7615 [doi]
- SVD-Det: A Lightweight Framework for Video Forgery Detection Using Semantic and Visual Defect CuesTsung-Shan Yang, Tianyu Zhang, Feng Qian, Bing Yan, C. C. Jay Kuo. 7616-7625 [doi]
- Joint Optimization of Camera Model and Deep Neural Network for Image RecognitionYouta Noboru, Yuko Ozasa, Masayuki Tanaka. 7626-7635 [doi]
- Training-free Conditional Image Embedding Framework Leveraging Large Vision Language ModelsMasayuki Kawarada, Kosuke Yamada, Antonio Tejero-de-Pablos, Naoto Inoue. 7636-7646 [doi]
- ReFineVQA: Iterative Refinement of Video Description via Feedback Generation for Video Question AnsweringJeongwan Shin, Chan Hur, Seongmin Cho, Jaeho Choi, Hyeyoung Park. 7647-7657 [doi]
- MIST: Multilingual Incidental Dataset for Scene Text DetectionSaumya Mundra, Ajoy Mondal, C. V. Jawahar. 7658-7667 [doi]
- Multi-Grained Text-Guided Image Fusion for Multi-Exposure and Multi-Focus ScenariosMingwei Tang, Jiahao Nie 0002, Guang Yang, Ziqing Cui, Jie Li. 7668-7678 [doi]
- MemeTAG: Keyword-Driven Meme Classification through Tag Embedding ReconstructionAkshit Sharma, Prashant W. Patil. 7679-7688 [doi]
- Leveraging Semantic Attribute Binding for Free-Lunch Color Control in Diffusion ModelsHéctor Laria Mantecon, Alexandra Gomez-Villa, Jiang Qin, Muhammad Atif Butt, Bogdan Raducanu, Javier Vazquez-Corral, Joost van de Weijer 0001, Kai Wang 0060. 7689-7698 [doi]
- MedPEFT-CL: Dual-Phase Parameter-Efficient Continual Learning with Medical Semantic Adapter and Bidirectional Memory ConsolidationZiyuan Gao, Philippe Morel. 7699-7708 [doi]
- Splatter Layout: Geometry-embedded 3D Reconstruction via Surface UnfoldingBryan Heryanto, Tackgeun You, Chanwoo Kim, Hwasup Lim. 7709-7718 [doi]
- HOLO: Holistic Lightweight Optimization for Scene Understanding with Auto-Annotation and Multimodal LearningXiaoyun Hu, Xiaohan Yan, Nan Wang, Gang Wei, Zhicheng Wang 0022. 7719-7729 [doi]
- KMOPS: Keypoint-Driven Method for Multi-Object Pose and Metric Size Estimation from Stereo ImagesYing-Kun Wu, Yi Shen, Tzuhsuan Huang, I-Sheng Fang, Jun-Cheng Chen. 7730-7739 [doi]
- PDV: Prompt Directional Vectors for Zero-shot Composed Image RetrievalOsman Tursun, Sinan Kalkan, Simon Denman, Clinton Fookes. 7740-7749 [doi]
- GRAPE (Gaussian Rendering for Accelerated Pixel Enhancement) Brings Fast and Lightweight Arbitrary Super-ResolutionJung In Jang, Kyong Hwan Jin. 7750-7758 [doi]
- Fetal and Neonatal Cortical Surface Reconstruction with Anatomical Normal-guidance and Perceptual EnhancementsJiyang Lee, Woori Bae, U.-Geun Ji, Hanyeol Yang, Jong-Min Lee. 7759-7768 [doi]
- View-aware Cross-modal Distillation for Multi-view Action RecognitionTrung Thanh Nguyen 0006, Yasutomo Kawanishi, Vijay John, Takahiro Komamizu, Ichiro Ide. 7769-7778 [doi]
- NRGMark: Localized Watermarking for Energy Transparency in ImagesShruti Agarwal, Élie Michel, Vishal Asnani, Tania Mathern, John P. Collomosse. 7779-7788 [doi]
- Test-Time Consistency in Vision Language ModelsShih-Han Chou, Shivam Chandhok, James J. Little, Leonid Sigal. 7789-7798 [doi]
- Revisiting an Old Perspective Projection for Monocular 3D Morphable Models RegressionToby Chong, Ryota Nakajima. 7799-7808 [doi]
- General and Domain-Specific Zero-shot Detection of Generated Images via Conditional LikelihoodRoy Betser, Omer Hofman, Roman Vainshtein, Guy Gilboa. 7809-7820 [doi]
- Co-STAR: Collaborative Curriculum Self-Training with Adaptive Regularization for Source-Free Video Domain AdaptationAmirhossein Dadashzadeh, Parsa Esmati, Majid Mirmehdi. 7821-7831 [doi]
- Being Positive about Negative Queries: Exclusion Aware Multimodal Retrieval using Disentangled RepresentationsPrachi, Sumit Bhatia, Srikanta Bedathur. 7832-7841 [doi]
- DualRes: Production-ready Dynamic Object DetectionJibril El Hassani, Thomas Verelst. 7842-7851 [doi]
- Semantic Map Guided Bird's-Eye View Learning for Online HD Map ConstructionHuantao Ren, Hesham M. Eraqi, ABM Musa, Mohamed N. Moustafa 0001. 7852-7861 [doi]
- ISALux: Illumination and Semantics-Aware Transformer Employing Mixture of Experts for Low Light Image EnhancementRaul Balmez, Alexandru Brateanu, Ciprian Orhei, Codruta O. Ancuti, Cosmin Ancuti. 7862-7872 [doi]
- FastPose-ViT: A Vision Transformer for Real-Time Spacecraft Pose EstimationPierre Ancey, Andrew Lawrence Price, Saqib Javed, Mathieu Salzmann. 7873-7882 [doi]
- QuEENet: Quantum-Enhanced Expressive Network for Image ClassificationShashank Bayal, Rushikesh Govind Dawane, Komal, Santosh Kumar Vipparthi, Subrahmanyam Murala. 7883-7892 [doi]
- SOLAR: Switchable Output Layer for Accuracy and Robustness in Once-for-All TrainingShaharyar Ahmed Khan Tareen, Lei Fan, Xiaojing Yuan, Qin Lin, Bin Hu. 7893-7902 [doi]
- FG-Tracer: Tracing Information Flow in Multimodal Large Language Models in Free-Form GenerationAlessia Saporita, Vittorio Pipoli, Federico Bolelli, Lorenzo Baraldi 0001, Andrea Acquaviva, Elisa Ficarra. 7903-7912 [doi]
- Patch Your Matcher: Correspondence-Aware Image-to-Image Translation Unlocks Cross-Modal Matching via Single-Modality PriorsAnton Frolov 0003, Volker Rodehorst. 7913-7924 [doi]
- Diversity Preserving Coresets for Image Quality AssessmentArpita Nema, Hanwei Zhu, Xi Zhang, Weisi Lin. 7925-7934 [doi]
- SAVE: Sparse Autoencoder-Driven Visual Information Enhancement for Mitigating Object HallucinationSangha Park, Seungryong Yoo, Jisoo Mok, Sungroh Yoon. 7935-7944 [doi]
- NavMapFusion: Diffusion-based Fusion of Navigation Maps for Online Vectorized HD Map ConstructionThomas Monninger, Zihan Zhang, Steffen Staab, Sihao Ding 0004. 7945-7954 [doi]
- GFT: Graph Feature Tuning for Efficient Point Cloud AnalysisManish Dhakal, Venkat R. Dasari, Rajshekhar Sunderraman, Yi Ding. 7955-7964 [doi]
- QAL: A Loss for Recall-Precision Balance in 3D ReconstructionPranay Meshram, Yash Turkar, Kartikeya Singh, Praveen Raj Masilamani, Charuvahan Adhivarahan, Karthik Dantu. 7965-7974 [doi]
- Meta-YOLO: Metadata-Guided Real-Time Object Detector in Aerial ImageryDeukryeol Yoon, Seonghak Kim, Young-Hwa Sung, Jinho Jung. 7975-7984 [doi]
- Q-Former Autoencoder: A Modern Framework for Medical Anomaly DetectionFrancesco Dalmonte, Emirhan Bayar, Emre Akbas, Mariana-Iuliana Georgescu. 7985-7995 [doi]
- AusSmoke meets MultiNatSmoke: a fully-labelled diverse smoke segmentation datasetWeihao Li, Hongjin Zhao, Gao Zhu, Ge-Peng Ji, Nicholas Wilson, Marta Yebra, Nick Barnes. 7996-8006 [doi]
- NAPP: Noise-Adaptive Prototype Perturbation for Few-Shot LearningIlhwan Kim, Sangwoo Yun, Dongheon Lee, seongsu Kim, Joonki Paik. 8007-8016 [doi]
- GaussianHeadTalk: Wobble-Free 3D Talking Heads with Audio Driven Gaussian SplattingMadhav Agarwal, Mingtian Zhang, Laura Sevilla-Lara, Steven McDonagh 0001. 8017-8027 [doi]
- Splannequin: Freezing Monocular Mannequin-Challenge Footage with Dual-Detection SplattingHao-Jen Chien, Yi-Chuan Huang, Chung-Ho Wu, Wei-Lun Chao, Yu-Lun Liu 0001. 8028-8040 [doi]
- Optimization-Free Style Transfer for 3D Gaussian SplatsRaphael Du Sablon, David Hart. 8041-8051 [doi]
- PEaRL: Pathway-Enhanced Representation Learning for Gene and Pathway Expression Prediction from HistologySejuti Majumder, Saarthak Kapse, Moinak Bhattacharya, Xuan Xu, Alisa Yurovsky, Prateek Prasanna. 8052-8062 [doi]
- Flood-LDM: Generalizable Latent Diffusion Models for rapid and accurate zero-shot High-Resolution Flood MappingSun Han Neo, Sachith Seneviratne, Herath Mudiyanselage Viraj Vidura Herath, Abhishek Saha, Sanka Rasnayaka, Lucy Amanda Marshall. 8063-8072 [doi]
- LangPose: Language-Aligned Motion for Robust 3D Human Pose EstimationLongyun Liao, Rong Zheng 0001. 8073-8083 [doi]
- SphereEdit: Spherical Semantic Editing in Diffusion ModelsSalamata Konate, Hassan Hamidi, Elham Dolatabadi, Frank Rudzicz, Laleh Seyyed-Kalantri. 8084-8093 [doi]
- FedEFC: Federated Learning Using Enhanced Forward Correction Against Noisy LabelsSeunghun Yu, Jin-Hyun Ahn, Joonhyuk Kang. 8094-8102 [doi]
- Photo Dating by Facial Age AggregationJakub Paplhám, Vojtech Franc. 8103-8112 [doi]
- Scalable Video Action Anticipation with Cross Linear Attentive MemoryZeyun Zhong, Manuel Martin, David Schneider 0006, David J. Lerch, Chengzhi Wu, Frederik Diederichs, Juergen Gall, Jürgen Beyerer. 8113-8123 [doi]
- DUDA: Distilled Unsupervised Domain Adaptation for Lightweight Semantic SegmentationBeomseok Kang, Niluthpol Chowdhury Mithun, Abhinav Rajvanshi, Han-Pang Chiu, Supun Samarasekera. 8124-8135 [doi]
- Generalizing Sports Feedback Generation by Watching Competitions and Reading Books: A Rock Climbing Case StudyArushi Rai, Adriana Kovashka. 8136-8145 [doi]
- START: Spatial and Textual Learning for Chart UnderstandingZhuoming Liu 0001, Xiaofeng Gao 0002, Feiyang Niu, Qiaozi Gao, Liu Liu, Robinson Piramuthu. 8146-8156 [doi]
- VRAgent: Self-Refining Agent for Zero-Shot Multimodal Video RetrievalKetul Shah, Pankaj Nathani, Rama Chellappa, Fabian Caba Heilbron. 8157-8167 [doi]
- MapVerse: A Benchmark for Geospatial Question Answering on Diverse Real-World MapsSharat Bhat, Harshita Khandelwal, Tushar Kataria, Vivek Gupta 0001. 8168-8178 [doi]
- IMPACT: Interpretable Most Important Person Analysis and Classification using Transformer-based ModelsAkshat Rampuria, Kamakshya Prasad Nayak, Kamalakar Vijay Thakare, Tushar Joshi, Aditya Dhananjay Singh, Haesol Park, Heeseung Choi, Hyungjoo Jung, Debi Prosad Dogra, Ig-Jae Kim. 8179-8187 [doi]
- SurgXBench: Explainable Vision-Language Model Benchmark for SurgeryJiajun Cheng, Xianwu Zhao, Sainan Liu, Xiaofan Yu, Ravi Prakash, Patrick J. Codd, Jonathan Elliott Katz, Shan Lin. 8188-8198 [doi]
- SeqFeedNet: Sequential Feature Feedback Network for Background SubtractionYu-Shun Huang, Jing-Ming Guo, Yi-Xiang Yang. 8199-8208 [doi]
- Robust Scene Coordinate Regression via Geometrically-Consistent Global DescriptorsSon Tung Nguyen, Alejandro Fontán, Michael Milford, Tobias Fischer 0001. 8209-8219 [doi]
- VitaGlyph: Vitalizing Artistic Typography with Flexible Dual-branch Diffusion ModelsKailai Feng, Yabo Zhang, Haodong Yu, Zhilong Ji, Jinfeng Bai, Hongzhi Zhang, Wangmeng Zuo. 8220-8230 [doi]
- CaFlow: Enhancing Long-Term Action Quality Assessment with Causal Counterfactual FlowRuisheng Han, Kanglei Zhou, Shuang Chen 0010, Amir Atapour Abarghouei, Hubert P. H. Shum. 8231-8241 [doi]
- AortaDiff: A Unified Multitask Diffusion Framework for Contrast-Free AAA ImagingYuxuan Ou, Ning Bi, Jiazheng Pan, Jiancheng Yang, Boliang Yu, Usama Zidan, Regent Lee, Vicente Grau. 8242-8251 [doi]
- DirectDrag: High-Fidelity, Mask-Free, Prompt-Free Drag-based Image Editing via Readout-Guided Feature AlignmentSheng-Hao Liao, Shang-Fu Chen, Tai-Ming Huang, Wen-Huang Cheng, Kai-Lung Hua. 8252-8261 [doi]
- Bridging the Domain Gap in Small Multimodal Models: A Dual-level Alignment PerspectiveAveen Dayal, Peketi Divya, Nidhi Tiwari, Linga Reddy Cenkeramaddi, C. Krishna Mohan, Abhinav Kumar 0001. 8262-8271 [doi]
- Crash2DocAI: Automated Integration of Post-Crash Car Part Images into Technical ReportsVáclav Divis, Jessica Giovagnola, Khalil Ben Chikha, Marek Hrúz. 8272-8281 [doi]
- Conversational Image Generation: Towards Multi-Round Personalized Generation with Multi-Modal Language ModelsHaochen Zhang, Animesh Sinha, Felix Juefei-Xu, Haoyu Ma, Kunpeng Li, Zhipeng Fan, Xiaoliang Dai, Tingbo Hou, Peizhao Zhang, Zecheng He. 8282-8291 [doi]
- CSF-Net: Context-Semantic Fusion Network for Large Mask InpaintingChae-Yeon Heo, Yeong-Jun Cho. 8292-8301 [doi]
- SceneShine: Illumination-aware Human Scene Gaussian Re-Splatting from Mobile Device VideoXuqian Ren, Wenjia Wang, Mai Ngoc Nguyen, Juho Kannala, Esa Rahtu. 8302-8312 [doi]
- See, Think, Learn: A Self-Taught Multimodal ReasonerSourabh Sharma, Sonam Gupta, Sadbhawna. 8313-8322 [doi]
- SpecGen: Neural Spectral BRDF Generation via Spectral-Spatial Tri-plane AggregationZhenyu Jin, Wenjie Li, Zhanyu Ma, Heng Guo 0003. 8323-8332 [doi]
- Pretraining Helps When Capacity Allows: Evidence from Ultra-Small ConvNetsSrikanth Muralidharan, Heitor Rapela Medeiros, Masih Aminbeidokhti, Eric Granger, Marco Pedersoli. 8333-8342 [doi]
- Mem-MLP: Real-Time 3D Human Motion Generation from Sparse InputsSinan Mutlu, Georgios-Fotios Angelis, Savas Özkan, Paul Wisbey, Anastasios Drosou, Mete Ozay. 8343-8352 [doi]
- UltraClean: A Simple Framework to Train Robust Neural Networks against Backdoor AttacksBingyin Zhao, Yingjie Lao. 8353-8363 [doi]
- GorillaWatch: An Automated System for In-the-Wild Gorilla Re-Identification and Population MonitoringMaximilian Schall, Felix Leonard Knöfel, Noah Elias König, Jan Jonas Kubeler, Maximilian von Klinski, Joan Wilhelm Linnemann, Xiaoshi Liu, Iven Jelle Schlegelmilch, Ole Woyciniuk, Alexandra Schild, Dante Wasmuht, Magdalena Bermejo Espinet, German Illera Basas, Gerard de Melo. 8364-8375 [doi]
- Reciprocal Teaching: Dynamic Multi-Model Teacher-Student Learning for Multiple Noisy AnnotationsWenjie Ai, Cuong C. Nguyen, Adrian Hilton 0001, Gustavo Carneiro 0001. 8376-8385 [doi]
- DuPLUS: Dual-Prompt Vision-Language Framework for Universal Medical Image Segmentation and PrognosisNuman Saeed, Tausifa Jan Saleem, Fadillah A. Maani, Muhammad Ridzuan, Hu Wang 0005, Mohammad Yaqub. 8386-8395 [doi]
- TriaGS: Differentiable Triangulation-Guided Geometric Consistency for 3D Gaussian SplattingQuan Tran, Tuan Dang. 8396-8405 [doi]
- SDT-6D: Fully Sparse Depth-Transformer for Staged End-to-End 6D Pose Estimation in Industrial Multi-View Bin PickingNico Leuze, Maximilian Hoh, Samed Dogan, Nicolas R.-Peña, Alfred Schöttl. 8406-8415 [doi]
- Generalized Category Discovery for LiDAR Semantic SegmentationMinseok Kim, Jiyong Boo, Kuk-Jin Yoon. 8416-8426 [doi]
- ICONIC-444: A 3.1-Million-Image Dataset for OOD Detection ResearchGerhard Krumpl, Henning Avenhaus, Horst Possegger. 8427-8436 [doi]
- Any Detector Can Detect AnythingThomas E. Huang, Siyuan Li 0008, Martin Danelljan, Henghui Ding, Luc Van Gool, Fisher Yu 0001. 8437-8447 [doi]
- Towards Unconstrained Cross-View Pose EstimationAlexander Wollam, Kyle Ashley, Maxim Shugaev, Oliver Arend, Ilya Semenov, Hadis Dashtestani, Sumved Ravi, Nathan Jacobs. 8448-8457 [doi]
- Disentangle and Regularize: Sign Language Production with Articulator-Based Disentanglement and Channel-Aware RegularizationSümeyye Meryem Tasyürek, Tugçe Kiziltepe, Hacer Yalim Keles. 8458-8467 [doi]
- SmoothDiffusion-VE: Real-time Generative Video Editing Using Adaptive Feature CacheMustafa Munir, Sophia Zalewski, Shiqiu Liu, David Tarjan, Sushmitha Belede, Anjul Patney, Radu Marculescu. 8468-8478 [doi]
- SafeguardGS: 3D Gaussian Primitive Pruning While Avoiding Catastrophic Scene DestructionYongjae Lee, Zhaoliang Zhang, Deliang Fan. 8479-8489 [doi]
- Uncertainty-Aware Vision-Language Segmentation for Medical ImagingAryan Das, Tanishq Rachamalla, Koushik Biswas, Swalpa Kumar Roy, Vinay Kumar Verma. 8490-8499 [doi]
- Stabilizing Direct Training of Spiking Neural Networks: Membrane Potential Initialization and Threshold-robust Surrogate GradientHyunho Kook, Byeongho Yu, Jeong Min Oh, Eunhyeok Park. 8500-8510 [doi]
- DocWaveDiff: A Predict-and-Refine approach for Document Image Enhancement with Wavelet U-Nets and Diffusion modelsMatteo Marulli, Marco Bertini 0001. 8511-8520 [doi]
- Chain-of-Look Spatial Reasoning for Dense Surgical Instrument CountingRishikesh Bhyri, Brian R. Quaranto, Junsong Yuan 0001, Peter C. W. Kim, Nan Xi. 8521-8530 [doi]
- Rethinking Latent Variable in Learned Image CompressionFangZhou Yi, Zhicheng Gong, Hui Zeng 0003. 8531-8540 [doi]
- AugMapNet: Improving Spatial Latent Structure via BEV Grid Augmentation for Enhanced Vectorized Online HD Map ConstructionThomas Monninger, Md Zafar Anwar, Stanislaw Antol, Steffen Staab, Sihao Ding 0004. 8541-8550 [doi]
- From Cognitive Priors to Instance Semantics: A Unified Framework for Multi-task Affective ComputingGuanyu Hu 0003, Dimitrios Kollias, Xinyu Yang 0001. 8551-8562 [doi]
- FuLLaMa: Training-free Diffusion-based Object Removal with Context PreservationIlke Demir, Umur Aybars Ciftci. 8563-8573 [doi]
- STRinGS: Selective Text Refinement in Gaussian SplattingAbhinav Raundhal, Gaurav Behera, P. J. Narayanan, Ravi Kiran Sarvadevabhatla, Makarand Tapaswi. 8574-8583 [doi]
- VIZOR: Viewpoint-Invariant Zero-Shot Scene Graph Generation for 3D Scene ReasoningVivek Madhavaram, Vartika Sengar, Arkadipta De, Charu Sharma. 8584-8595 [doi]
- Relevance-aware Multi-context Contrastive Decoding for Retrieval-augmented Visual Question AnsweringJongha Kim, Byungoh Ko, Jeehye Na, Jinsung Yoon, Hyunwoo J. Kim. 8596-8605 [doi]
- CanKD: Cross-Attention-based Non-local operation for Feature-based Knowledge DistillationShizhe Sun, Wataru Ohyama. 8606-8616 [doi]
- FlyPose: Towards Robust Human Pose Estimation From Aerial ViewsHassaan Farooq, Marvin Brenner, Peter Stütz. 8617-8627 [doi]
- MedROV: Towards Real-Time Open-Vocabulary Detection Across Diverse Medical Imaging ModalitiesTooba Tehreem Sheikh, Jean Lahoud, Rao Muhammad Anwer, Fahad Shahbaz Khan, Salman Khan 0001, Hisham Cholakkal. 8628-8638 [doi]
- Exploiting Label-Independent Regularization from Spatial Patterns for Whole Slide Image AnalysisWeiyi Wu, Xinwen Xu, Chongyang Gao, Xingjian Diao, Siting Li, Jiang Gui. 8639-8649 [doi]
- SVS-GAN for Semantic Synthesis of Traffic Videos for Autonomous DrivingKhaled M. Seyam, Julian Wiederer, Markus Braun 0003, Bin Yang 0009. 8650-8659 [doi]
- *Pengfei Gu, Huimin Li, Haoteng Tang, Dongkuan Xu, Erik Enriquez, Dongchul Kim, Bin Fu, Danny Z. Chen. 8660-8669 [doi]
- NeuroBridge: Few-Shot Cross-Modal Neuron Re-identification via Dual-Channel Deep Metric LearningWenwei Li, Mingwei Liao, Lingyi Cai, Anan Li. 8670-8679 [doi]
- Sketch3R: Rapid and Realistic 3D VR Sketch Creation to Shape RetrievalMritunjoy Halder, Shivam Ashok Shukla, Lokender Tiwari, Raghav Mittal, Brojeshwar Bhowmick. 8680-8689 [doi]
- PhyEduVideo: A Benchmark for Evaluating Text-to-Video Models for Physics EducationK. M. Megha Mariam, Aditya Arun 0001, Zakaria Laskar, C. V. Jawahar. 8690-8699 [doi]
- Dual-Domain Multimodal Hyperbolic Fusion for Cardiopulmonary Disease Diagnosis in Emergency CareKe Nan, Maggie Samaan, Benjamin Burns, Xia Ning, Yuchi Han, Yuan Xue. 8700-8710 [doi]