Abstract is missing.
- Frontmatter [doi]
- I Don't Need Solution. I Need Emotional Support : Empathetic LLMs based on Emotional ValidationSuhyune Son, Jungwoo Lim, Myunghoon Kang, Seongtae Hong, Yuna Hur, Evelyn Hayoon Zi, HeuiSeok Lim. 1-26 [doi]
- Extraction of Texters' Explicit Emotion Expressions in Crisis ConversationsGreg Buda, Ignacio J. Tripodi, Kelly L. Zuromski, Margaret Meagher, Elizabeth A. Olson. 27-44 [doi]
- WikiVideo: Article Generation from Multiple VideosAlexander Martin 0006, Reno Kriz, William Gantt Walden, Kate Sanders 0002, Hannah Recknor, Eugene Yang 0001, Francis Ferraro, Benjamin Van Durme. 45-70 [doi]
- Large Language Models Are Effective Human Annotation Assistants, But Not Good Independent AnnotatorsFeng Gu, Zongxia Li, Carlos Rafael Colon, Benjamin Evans, Ishani Mondal, Jordan Lee Boyd-Graber. 71-89 [doi]
- Accelerating LLM Fine-Tuning via Embedding Knowledge TransferMeishu Peng, Ziyue Zhang, Yi Zhang, Pengyang Wang, Zixuan Yuan, Denghui Zhang. 90-107 [doi]
- Understanding Secret Leakage Risks in Code LLMs: A Tokenization PerspectiveMeifang Chen, Zhe Yang, Huang Nianchen, Yizhan Huang, Yichen Li 0003, Zihan Li, Michael R. Lyu. 108-119 [doi]
- MALLM-GAN: Multi-Agent Large Language Model as Generative Adversarial Network for Synthesizing Tabular DataYaobin Ling, Xiaoqian Jiang, Yejin Kim. 120-136 [doi]
- EMCompress: Video-LLMs with Endomorphic Multimodal CompressionZheyu Fan, Jiateng Liu, Yuji Zhang 0002, Zihan Wang, Yi R. Fung 0001, Manling Li, Heng Ji 0001. 137-162 [doi]
- Learning from Contrastive Prompts: An Automated Prompt Optimization FrameworkMingqi Li, Karan Aggarwal, Yong Xie 0002, Aitzaz Ahmad, Stephen Lau. 163-188 [doi]
- Private Seeds, Public LLMs: Realistic and Privacy-Preserving Synthetic Data GenerationQian Ma, Sarah Rajtmajer. 189-210 [doi]
- ToolScope: An Agentic Framework for Vision-Guided and Long-Horizon Tool UseMengjie Deng, Guanting Dong 0001, Zhicheng Dou. 211-225 [doi]
- VChain: Chain-of-Visual-Thought for Reasoning in Video GenerationZiqi Huang, Ning Yu, Gordon Chen, Haonan Qiu, Paul Debevec, Ziwei Liu 0002. 226-250 [doi]
- Diversity Collapse in Multi-Agent LLM Systems: Structural Coupling and Collective Failure in Open-Ended Idea GenerationNuo Chen 0002, Yicheng Tong, Yuzhe Yang, Yufei He, Xueyi Zhang, Qingyun Zou, Qian Wang 0002, Bingsheng He. 251-306 [doi]
- Justice in Judgment: Unveiling (Hidden) Bias in LLM-assisted Peer ReviewsSai Suresh Macharla Vasu, Ivaxi Sheth, Hui-Po Wang, Ruta Binkyte, Mario Fritz. 307-330 [doi]
- A Study of LLMs' Preferences for Libraries and Programming LanguagesLukas Twist, Jie M. Zhang, Mark Harman, Don Syme, Joost Noppen, Helen Yannakoudakis, Detlef D. Nauck. 331-351 [doi]
- Unveiling Inherent Visual Grounding in Multimodal LLMs for Text-Rich ImagesShijie Zhou 0008, Jihyung Kil, Ming Li 0010, Jiuxiang Gu, Curtis Wigington, Rajiv Jain, Changyou Chen, Ruiyi Zhang 0002. 352-370 [doi]
- PUMA: Projected Universal Multilingual ASR for Low-Resource Settings. Application to Diverse African LanguagesIlyes Oukid, Bilal Faye, Hanane Azzag, Mustapha Lebbah, Said Yacine Boulahia. 371-382 [doi]
- MGPO: Thinking with Images via Multi-Turn Grounding-Based Reinforcement LearningXinyu Huang, Yuhao Dong, Weiwei Tian, Bo Li, Rui Feng 0001, Ziwei Liu. 383-399 [doi]
- How Grounded is Wikipedia? A Study on Structured Evidential Support and RetrievalWilliam Gantt Walden, Kathryn Ricci, Miriam Wanner, Zhengping Jiang, Chandler May, Rongkun Zhou, Benjamin Van Durme. 400-420 [doi]
- Jailbreaking Attacks vs. Content Safety Filters: How Far Are We in the LLM Safety Arms Race?Yuan Xin, Dingfan Chen, Linyi Yang, Michael Backes 0001, Xiao Zhang. 421-445 [doi]
- BrowseConf: Confidence-Guided Test-Time Scaling for Web AgentsLitu Ou, Kuan Li, Huifeng Yin, Liwen Zhang, Zhongwang Zhang, Xixi Wu, Rui Ye, Zile Qiao, Yong Jiang 0005, Pengjun Xie, Fei Huang 0002, Jingren Zhou 0001. 446-465 [doi]
- HyperEdit: Unlocking Instruction-based Text Editing in LLMs via HypernetworksYiming Zeng 0012, Jinghan Cao, Zexin Li 0001, Wanhao Yu, Zhankai Ye, Dawei Xiang, Ting Hua, Xin Liu, Shangqian Gao, Tingting Yu. 466-480 [doi]
- Strategy-Induct: Task-Level Strategy Induction for Instruction GenerationPo-Chun Chen, Hen-Hsen Huang, Hsin-Hsi Chen. 481-504 [doi]
- Idiom Understanding as a Tool to Measure the Dialect GapDavid Beauchemin, Yan Tremblay, Mohamed Amine Youssef, Richard Khoury. 505-522 [doi]
- Logic Jailbreak: Efficiently Unlocking LLM Safety Restrictions Through Formal Logical ExpressionJingyu Peng, Maolin Wang 0001, Nan Wang, Jiatong Li, Yuchen Li 0006, Yuyang Ye 0002, Wanyu Wang, Pengyue Jia, Kai Zhang 0038, Xiangyu Zhao 0001. 523-543 [doi]
- Two Heads Are Better Than One: Audio-Visual Speech Error Correction with Dual HypothesesSungnyun Kim, Kangwook Jang, Sungwoo Cho, Joon Son Chung, Hoirin Kim, Se-Young Yun. 544-564 [doi]
- Towards Hierarchical Multi-Step Reward Models for Enhanced Reasoning in Large Language ModelsTeng Wang, Zhangyi Jiang, Zhenqi He, Hailei Gong, Shenyang Tong, Wenhan Yang, ZeYu Li, Yanan Zheng, Zifan He, Zewen Ye, Shengjie Ma, Jianping Zhang. 565-576 [doi]
- SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning EvaluationLongteng Guo, Xuanxu Lin, Dongze Hao, Tongtian Yue, Pengkang Huo, Jiatong Ma, Yuchen Liu, Jing Liu 0001. 577-601 [doi]
- UrBLiMP: A Benchmark for Evaluating the Linguistic Competence of Large Language Models in UrduFarah Adeeba, Brian Dillon, Hassan Sajjad 0001, Rajesh Bhatt. 602-617 [doi]
- ANCHOR: LLM-driven Subject Conditioning for Text-to-Image SynthesisAashish Anantha Ramakrishnan, Sharon X. Huang, Dongwon Lee 0001. 618-638 [doi]
- Personalized Benchmarking: Evaluating LLMs by Individual PreferencesCristina Garbacea, Heran Wang, Chenhao Tan. 639-675 [doi]
- Op-Fed: Opinion, Stance, and Monetary Policy Annotations on FOMC Transcripts Using Active LearningAlisa Kanganis, Katherine A. Keith. 676-699 [doi]
- C³D: Enhancing LLM Reasoning via Confidence-Guided Contrastive DecodingYufeng Zhang, Xuepeng Wang, Lingxiang Wu, Jinqiao Wang. 700-712 [doi]
- Do LLMs Really Know What They Don't Know? Internal States Mainly Reflect Knowledge Recall Rather Than TruthfulnessChi Seng Cheang, Hou Pong Chan, Wenxuan Zhang 0001, Yang Deng 0002. 713-730 [doi]
- Enhancing Hallucination Detection via Future ContextJoosung Lee, Cheonbok Park, Hwiyeol Jo, Jeonghoon Kim, Joonsuk Park, Kang Min Yoo. 731-749 [doi]
- MTO: A Multi-turn Conversational Text-to-OverpassQL Dataset for Enhanced OpenStreetMap Query GenerationHaodi Zhang, Xinrui Zhu, Mingze Kong, Zhidan Liu 0001, Tao Fan 0002, Kaishun Wu, Yuanfeng Song. 750-771 [doi]
- A Dual-Phase Self-Evolution Framework for Large Language ModelsHaoran Sun, Zekun Zhang, Shaoning Zeng. 772-782 [doi]
- Preference-Aware Memory Update for Long-Term LLM AgentsHaoran Sun, Zekun Zhang, Shaoning Zeng. 783-793 [doi]
- Understanding In-Context Learning Beyond Transformers: An Investigation of State Space and Hybrid ArchitecturesShenran Wang, Timothy Tin-Long Tse, Jian Zhu. 794-820 [doi]
- C²DLM: Causal Concept-Guided Diffusion Large Language ModelsKairong Han, Nuanqiao Shan, Ziyu Zhao 0001, Zijing Hu, XinPeng Dong, Ye Jun Jian, Lujia Pan, Fei Wu 0001, Kun Kuang 0001. 821-838 [doi]
- CMTD: Cognitive Modeling with Traits and Distortions for Multimodal Emotion Recognition in ConversationsMinh-Tien Nguyen, Huu-Loi Le, Manh-Cuong Phan, Hajime Hotta. 839-854 [doi]
- Bridging the Culture Gap: A Framework for LLM-Driven Socio-Cultural Localization of Math Word Problems in Low-Resource LanguagesIsrael Abebe Azime, Tadesse Destaw Belay, Dietrich Klakow, Philipp Slusallek, Anshuman Chhabra. 855-870 [doi]
- Stop Guessing When to Stop Testing: Efficient Model Evaluation with Just Enough DataOfir Arviv, Kristjan Greenewald, Yotam Perlitz, Hadar Mulian, Michal Shmueli-Scheuer, Leshem Choshen. 871-881 [doi]
- AnyGraph: Graph Foundation Model in the WildLianghao Xia, Chao Huang. 882-896 [doi]
- DOSE: Data Selection for Multi-Modal LLMs via Off-the-Shelf ModelsBiao Wu 0006, Yiwu Zhong, Meng Fang, Ling Chen 0006. 897-911 [doi]
- MergeIT: From Selection to Merging for Efficient Instruction TuningHongyi Cai, Yuqian Fu, Hongming Fu, Bo Zhao 0038. 912-923 [doi]
- The Illusion of Insight in Reasoning ModelsLiv G. d'Aliberti, Manoel Horta Ribeiro. 924-966 [doi]
- Adaptive Layer Selection for Layer-Wise Token Pruning in LLM InferenceRei Taniguchi, Yuyang Dong, Makoto Onizuka, Chuan Xiao 0001. 967-986 [doi]
- Aligning What LLMs Do and Say: Towards Self-Consistent ExplanationsSahar Admoni, Ofra Amir, Assaf Hallak, Yftah Ziser. 987-1003 [doi]
- TARo: Token-level Adaptive Routing for LLM Test-time AlignmentArushi Rai, Qiang Zhang, Hanqing Zeng, Yunkai Zhang, Dipesh Tamboli, Xiangjun Fan, Zhuokai Zhao, Lizhu Zhang. 1004-1025 [doi]
- ProRank: Prompt Warmup via Reinforcement Learning for Small Language Models RerankingXianming Li, Aamir Shakir, Rui Huang, Julius Lipp, Benjamin Clavié, Jing Li. 1026-1037 [doi]
- ChemAmp: Amplified Chemistry Tools via Composable AgentsZhucong Li, Powei Chang, Jin Xiao, Zhijian Zhou, Qianyu He, Jiaqing Liang, Fenglei Cao, Yinghui Xu 0001, Yuan Qi 0001. 1038-1053 [doi]
- CodeContests-O: Powering LLMs via Feedback-Driven Iterative Test Case GenerationJianfeng Cai 0008, Jinhua Zhu 0001, Ruopei Sun, Kangwen Zhao, Dongyun Xue, Mingxiao Feng, Wengang Zhou 0001, Houqiang Li. 1054-1072 [doi]
- Hybrid-Vector Retrieval for Visually Rich Documents: Combining Single-Vector Efficiency and Multi-Vector AccuracyJuyeon Kim 0001, Geon Lee, Dongwon Choi, Taeuk Kim, Kijung Shin. 1073-1089 [doi]
- Multi-Scale Spectral Selection and Entropy-Guided Uncertainty Fusion for Multimodal Rumor DetectionZongliang Han, Wenyu Guo, Guoqing Jin, Yang Liu, Fan Li, Dong Yu, Yan Song, Fengzhen Zhang. 1090-1100 [doi]
- Covariance Matrix-Driven Image Channel Allocation for Multimodal Fake News DetectionZongliang Han, Wenyu Guo, Guoqing Jin, Yang Liu, Yan Song, Dong Yu, Wang Min. 1101-1115 [doi]
- Mechanistic Insights into Deferred Semantic Drift in LLMsJingjie Zeng, Huayang Li, Liang Yang 0003, Shaowu Zhang 0002, Yuanyuan Sun, Hongfei Lin. 1116-1137 [doi]
- JointCQ: Improving Factual Hallucination Detection with Joint Claim and Query GenerationFan Xu, Huixuan Zhang, Zhenliang Zhang 0003, Jiahao Wang, Xiaojun Wan 0001. 1138-1159 [doi]
- Pseudo2Real: Task Arithmetic for Pseudo-Label Correction in Automatic Speech RecognitionYi-Cheng Lin, Yu-Hsuan Li Liang, Hsuan Su, Tzu-Quan Lin, Shang-Tse Chen, Yun-Nung Chen, Hung-yi Lee. 1160-1175 [doi]
- SGA-MCTS: Decoupling Planning from Execution via Training-Free Atomic Experience RetrievalXin Xie, Dongyun Xue, Wuguannan Yao, Mingxiao Feng, Wengang Zhou 0001, Xiang Qi, Houqiang Li, Peng Zhang 0080. 1176-1193 [doi]
- Robustness via Referencing: Defending against Prompt Injection Attacks by Referencing the Executed InstructionYulin Chen, Haoran Li, Yuan Sui 0001, Yue Liu 0008, Yufei He, Xiaoling Bai, Chi Fei, Li Yabo, Haozhe Ma, Yangqiu Song, Bryan Hooi. 1194-1215 [doi]
- Differentially Private Synthetic Text Generation for Retrieval-Augmented Generation (RAG)Junki Mori, Kazuya Kakizaki, Taiki Miyagawa, Jun Sakuma. 1216-1235 [doi]
- When Slower Isn't Truer: Inverse Scaling Law of Truthfulness in Multimodal ReasoningSitong Fang, Wenjing Cao, Jiahao Li, Xuyao Wang, Chi-Min Chan, Sirui Han, Juntao Dai, Yike Guo, Yaodong Yang 0001, Jiaming Ji. 1236-1263 [doi]
- StressTest: Can YOUR Speech LM Handle the Stress?Iddo Yosha, Gallil Maimon, Yossi Adi. 1264-1285 [doi]
- EVADE: LLM-Based Explanation Generation and Validation for Error Detection in NLILongfei Zuo, Barbara Plank, Siyao Peng. 1286-1300 [doi]
- AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAGQijie You, Wenkai Yu, Hao Liang 0017, Zhen Hao Wong, Wentao Zhang 0001. 1301-1335 [doi]
- Attention to Non-AdoptersKaitlyn Zhou, Kristina Gligoric, Myra Cheng, Michelle S. Lam, Vyoma Raman, Boluwatife Aminu, Caeley Woo, Michael Brockman, Hannah Cha, Dan Jurafsky. 1336-1366 [doi]
- Ready to Translate, Not to Represent? Bias and Performance Gaps in Multilingual LLMs Across Language Families and DomainsMd. Faiyaz Abdullah Sayeedi, Subhey Sadi Rahman, Md. Mahbub Alam, Md. Adnanul Islam, Jannatul Ferdous Deepti, Tasnim Mohiuddin, Md Mofijul Islam, Swakkhar Shatabda. 1367-1391 [doi]
- Music Audio-Visual Question Answering Requires Specialized Multimodal DesignsWenhao You, Xingjian Diao, Wenjun Huang, Chunhui Zhang, Keyi Kong, Weiyi Wu, Chiyu Ma, Zhongyu Ouyang, Tingxuan Wu, Ming Cheng 0004, Soroush Vosoughi, Jiang Gui. 1392-1426 [doi]
- TemporalVLM: Video LLMs for Temporal Reasoning in Long VideosFawad Javed Fateh, Umer Ahmed, Hamza Khan, M. Zeeshan Zia, Quoc Huy Tran. 1427-1447 [doi]
- Mitigating Judgment Preference Bias in Large Language Models through Group-Based PollingShuliang Liu, Zhipeng Xu, Zhenghao Liu 0001, Yukun Yan, Minghe Yu 0001, Yu Gu 0002, Chong Chen, Huiyuan Xie, Ge Yu 0001. 1448-1464 [doi]
- Enhancing Long-Chain Reasoning Distillation through Error-Aware Self-ReflectionZhuoyang Wu, Xinze Li, Zhenghao Liu, Yukun Yan, Zhiyuan Liu 0001, Minghe Yu, Cheng Yang 0002, Yu Gu 0002, Ge Yu 0001, Maosong Sun 0001. 1465-1482 [doi]
- New Compendium of a Myriad of Plants: A New Dataset Describing Ancient Chinese PlantsXiaobin Shen, Zhongqing Wang, Shichen Li, Chu-Ren Huang, Guodong Zhou 0001. 1483-1498 [doi]
- Generative Interfaces for Language ModelsJiaqi Chen, Yanzhe Zhang, Yutong Zhang, Yijia Shao, Diyi Yang. 1499-1519 [doi]
- EvoEdit: Evolving Null-space Alignment for Robust and Efficient Knowledge EditingSicheng Lyu, Yu Gu, Xinyu Wang 0061, Jerry Huang, Sitao Luan, Yufei Cui, Xiao-Wen Chang, Peng Lu 0006. 1520-1540 [doi]
- Efficient Reasoning for LLMs through Speculative Chain-of-ThoughtJikai Wang, Juntao Li 0005, Jianye Hou, Yan Bowen, Lijun Wu 0003, Min Zhang 0005. 1541-1553 [doi]
- From Coarse to Fine: Self-Adaptive Hierarchical Planning for LLM AgentsHaoran Tan, Zeyu Zhang, Chen Ma 0001, Tianze Liu, Quanyu Dai, Xu Chen. 1554-1569 [doi]
- Data-Centric Perspectives on Agentic Retrieval-Augmented Generation: A SurveyJingwen Deng, Jihao Huang, Zhen Hao Wong, Hao Liang 0017, Quanqing Xu, Bin Cui 0001, Wentao Zhang 0001. 1570-1588 [doi]
- WISCA: A Lightweight Model Transition Method to Improve LLM Training via Weight ScalingJiacheng Li, Jianchao Tan, Zhidong Yang, Pingwei Sun, Feiye Huo, Jiayu Qin, Xiangyu Zhang, Maoxin He, Guangming Tan, Weile Jia, Xunliang Cai, Tong Zhao. 1589-1601 [doi]
- Disentangling Codemixing in Chats: The NUS ABC Codemixed CorpusSvetlana Churina, Akshat Gupta, Nur Insyirah Binte Imam Mujtahid, Kokil Jaidka. 1602-1624 [doi]
- When Thoughts Meet Facts: Reusable Reasoning for Long-Context LMsSoyeong Jeong, Taehee Jung, Sung Ju Hwang, Joo-Kyung Kim, Dongyeop Kang. 1625-1646 [doi]
- Infinity-Parser: Layout-Aware Reinforcement Learning with High-quality Document Parsing DatasetBaode Wang, Biao Wu, Weizhen Li, Meng Fang, Zuming Huang, Jun Huang, Yanjie Liang, Haozhe Wang 0016, Ling Chen, Wei Chu, Yuan Qi. 1647-1667 [doi]
- Lunar-Bench: Towards Evaluating Task-Oriented Reasoning of LLMs in Lunar Exploration ScenariosXin-Yu Xiao, Ye Tian, Erwei Yin, Zhixian He, Shiqi Wang, Yalei Liu, Qianchen Xia. 1668-1705 [doi]
- BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable RewardsYupeng Chang, Yuan Wu 0002, Yi Chang 0001. 1706-1725 [doi]
- Rethinking Research on Stereotypes: An Analysis through Social Psychological and Computational PerspectivesKaustubh Shivshankar Shejole, Pushpak Bhattacharyya. 1726-1747 [doi]
- Do LLMs Catch Their Own Mistakes? A Comprehensive Benchmark for Reflective Tool Use LLMsZheyuan Liu 0010, Liqiang Xiao, Yang Li, Hyokun Yun, Lihong Li 0001, Chao Zhang 0014, Meng Jiang 0001. 1748-1773 [doi]
- Understanding Generalization in Role-Playing Models via Information TheoryYongqi Li 0002, Hao Lang, Fei Huang 0002, Tieyun Qian, Yongbin Li 0001. 1774-1809 [doi]
- A Multilingual Dataset and Empirical Validation for the Mutual Reinforcement Effect in Information ExtractionChengguang Gan, Sunbowen Lee, Qingyu Yin, Yunhao Liang, Xinyang He, Hanjun Wei, Younghun Lim, Shijian Wang, Hexiang Huang, Qinghao Zhang, Shiwen Ni, Tatsunori Mori. 1810-1829 [doi]
- TRACE: An Experiential Framework for Coherent Multi-hop Knowledge Graph Question AnsweringYingxu Wang, Jiaxin Huang, Mengzhu Wang, Nan Yin. 1830-1851 [doi]
- Can LLMs See Without Pixels? Benchmarking Spatial Intelligence from Textual DescriptionsZhongbin Guo, Zhen Yang, YuShan Li, Xinyue Zhang, Wenyu Gao, Jiacheng Wang, Chengzhi Li, Xiangrui Liu, Ping Jian. 1852-1897 [doi]
- Lil: Less is Less When Applying Post-Training Sparse-Attention Algorithms in Long-Decode StageJunhao Hu, Fangze Li, Mingtao Xu, Feifan Meng, Shiju Zhao, Tiancheng Hu, Ting Peng, Anmin Liu, Wenrui Huang, Chenxu Liu, Ziyue Hua, Tao Xie 0001. 1898-1912 [doi]
- Static Models, Dynamic World: A Unified Perspective on Temporal Perception in Large Language ModelsChenhao Li, Dandan Song 0005, Changzhi Zhou, Jun Yang, Yuhang Tian, Huipeng Ma, Guangyuan Feng, Luan Zhang, Xudong Li, Ke Duan. 1913-1932 [doi]
- Decomposed Trust: Privacy, Adversarial Robustness, Ethics, and Fairness in Low-Rank LLMsDaniel Agyei Asante, Md Mokarram Chowdhury, Yang Li. 1933-1952 [doi]
- Beyond Token Length: Step Pruner for Efficient and Accurate Reasoning in Large Language ModelsCanhui Wu, Qiong Cao, Chang Li, Zhenfang Wang, Chao Xue 0003, Yuwei Fan, Wei Xi 0003, Xiaodong He 0001. 1953-1974 [doi]
- Exploring Reasoning Reward Model for AgentsKaixuan Fan, Kaituo Feng, Manyuan Zhang, Tianshuo Peng, Zhixun Li, Yilei Jiang, Shuang Chen, Xiangyu Yue 0001. 1975-1991 [doi]
- MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn DialoguesZheyuan Liu 0010, Dongwhi Kim, Yixin Wan, Xiangchi Yuan, Zhaoxuan Tan, Fengran Mo, Meng Jiang 0001. 1992-2036 [doi]
- REAP: Towards Effective Training-Free Chemical Reasoning with Explicit Atomic PriorsMingxu Zhang, Dazhong Shen, Qi Zhang, Ying Sun. 2037-2062 [doi]
- Towards Self-Improving Error Diagnosis in Multi-Agent SystemsJiazheng Li, Emine Yilmaz, Bei Chen, Thu Le. 2063-2077 [doi]
- MulDimIF: A Multi-Dimensional Constraint Framework for Evaluating and Improving Instruction Following in Large Language ModelsJunjie Ye 0005, Caishuang Huang, Zhuohan Chen, Wenjie Fu 0013, Chenyuan Yang, Leyi Yang, Yilong Wu, Peng Wang, Meng Zhou, Xiaolong Yang, Tao Gui, Qi Zhang, Zhongchao Shi, Jianping Fan 0007, Xuanjing Huang 0001. 2078-2104 [doi]
- Text2Mem: A Unified Memory Operation Language for Memory Operating SystemLeo Wang, Lihai Yang, Boyu Chen, Kerun Xu, Gongyi Zou, Bo Tang 0011, Feiyu Xiong, Siheng Chen, Zhiyu Li. 2105-2119 [doi]
- AMO-Bench: Large Language Models Still Struggle in High School Math CompetitionsJunlin Liu, Shengnan An, Shuang Zhou, Dan Ma, Yehao Lin, Xinxuan Lv, Xuanlin Wang, Xiaoyu Li, Ziwen Wang, Xuezhi Cao, Xunliang Cai. 2120-2137 [doi]
- Solver-Independent Automated Problem Formulation via LLMs for High-Cost Simulation-Driven DesignYuchen Li, Handing Wang, Bing Xue 0001, Mengjie Zhang 0001, Yaochu Jin. 2138-2153 [doi]
- When Facts Change: Temporal Knowledge Conflict Resolution in LLMsJonas Wallat, Wolfgang Nejdl, Sandipan Sikdar. 2154-2184 [doi]
- SCRIPT: A Subcharacter Compositional Representation Injection Module for Korean Pre-Trained Language ModelsSungho Kim, Juhyeong Park, Eda Atalay, SangKeun Lee 0001. 2185-2213 [doi]
- PibE-MPP: A Play-it-by-Ear Masking Performance Plug-in for LLMsMengwei Wang, Simin Niu, Xun Liang 0001, Yuefeng Ma, Sensen Zhang, Jiawei Yang, Shichao Song, Hanyu Wang, Huayi Lai. 2214-2225 [doi]
- RoleCDE: Benchmarking and Mitigating Role-Alignment Trade-offs in Role-Playing AgentsHuayi Lai, Shichao Song, Simin Niu, Hanyu Wang, Jiawei Yang, Zhouxing Wang, Zhiqiang Yin, Xun Liang 0001. 2226-2248 [doi]
- PolicyLLM: Towards Excellent Comprehension of Public Policy for Large Language ModelsHan Bao 0003, Penghao Zhang, Yue Huang 0001, Zhengqing Yuan, Yanchi Ru, S. U. Rui, Yujun Zhou 0002, Xiangqi Wang, Kehan Guo, Nitesh V. Chawla, Yanfang Ye 0001, Xiangliang Zhang 0001. 2249-2274 [doi]
- BOOKAGENT: Orchestrating Safety-Aware Visual Narratives via Multi-Agent Cognitive CalibrationBo Gao, Chang Liu, Yuyang Miao, Siyuan Ma, Ser-Nam Lim. 2275-2292 [doi]
- Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build EnvironmentsJunjie Ye 0005, Changhao Jiang, Zhengyin Du, Yufei Xu, Xuesong Yao, Zhiheng Xi, Xiaoran Fan, Qi Zhang, Tao Gui, Xuanjing Huang 0001, Jiecao Chen. 2293-2323 [doi]
- Do Domain-specific Experts exist in MoE-based LLMs?Giang Do, Hung Le 0002, Truyen Tran 0001. 2324-2340 [doi]
- AutoUE: Automated Generation of 3D Games in Unreal Engine via Multi-Agent SystemsLei Yin, Wentao Cheng, Zhida Qin, Tianyu Huang, Yidong Li, Gangyi Ding. 2341-2364 [doi]
- Comprehensive Benchmarking of Long-Form Speech Generation in Diverse ScenariosChanghao Pan, Rui Yang, Han Wang, Zhuan Zhou, Xuming He, Wenxiang Guo, Ziyue Jiang 0001, Ruiqi Li, Yu Zhang 0126, Chenyuhao Wen, Ke Lei, Xiang Yin 0006, Jingyu Lu 0001, Zhiyuan Zhu, Zhou Zhao 0001. 2365-2400 [doi]
- CAST: Achieving Stable LLM-based Text Analysis for Data AnalyticsJinxiang Xie, Zihao Li, Wei He, Rui Ding 0001, Shi Han, Dongmei Zhang 0001. 2401-2420 [doi]
- WavAlign: Enhancing Intelligence and Expressiveness in Spoken Dialogue Models via Adaptive Hybrid Post-TrainingYifu Chen, Shengpeng Ji, Qian Chen 0003, Tianle Liang, Yangzhuo Li, Ziqing Wang, Wen Wang 0001, Jingyu Lu 0001, Haoxiao Wang, Xueyi Pu, Fan Zhuo, Zhou Zhao 0001. 2421-2444 [doi]
- OmniCompliance-100K: A Multi-Domain, Rule-Grounded, Real-World Safety Compliance DatasetWenbin Hu 0001, Huihao Jing, Haochen Shi, Changxuan Fan, Haoran Li 0003, Yangqiu Song. 2445-2463 [doi]
- AutoMonitor-Bench: Evaluating the Reliability of LLM-Based Misbehavior MonitorShu Yang, Jingyu Hu 0002, Tong Li, Hanqi Yan, Wenxuan Wang 0001, Di Wang 0015. 2464-2483 [doi]
- Adaptive and Representative Multi-Interest Modeling for Recommendation with Large Language ModelZiyan Wang, Yingpeng Du, Tianjun Wei, Haoyan Chua, Jieyi Bi, Jie Zhang, Zhu Sun 0001. 2484-2496 [doi]
- MathMixup: Boosting LLM Mathematical Reasoning with Difficulty-Controllable Data Synthesis and Curriculum LearningXuchen Li 0001, Jing Chen 0060, Xuzhao Li, Hao Liang 0017, Xiaohuan Zhou, Taifeng Wang, Wentao Zhang 0001. 2497-2513 [doi]
- The Model Agreed, But Didn't Learn: Diagnosing Surface Compliance in Large Language ModelsXiaojie Gu, Ziying Huang, Weicong Hong, Jian Xie, Renze Lou, Kai Zhang 0033. 2514-2529 [doi]
- AWARE: Agentic Knowledge Warehousing for Contextual IntelligenceHongjin Qian, Siqi Bao, Zhao Cao, Zheng Liu. 2530-2540 [doi]
- Alignment Tuning for Large Language Models: A Data-Centric Lens on Alignment Data PipelinesHwanjun Song. 2541-2561 [doi]
- Purging the Gray Zone: Latent-Geometric Denoising for Precise Knowledge Boundary AwarenessHao An, Yibin Lou, Jiayi Guo, Yang Xu. 2562-2576 [doi]
- Temporal Token Matters: Investigating and Interpreting the Consistency of Temporal Ordering in Large Language ModelsZhen Yang, Xinyue Zhang, Ping Jian, Chengzhi Li, Zhongbin Guo, Jiaping Feng, Wenpeng Lu. 2577-2596 [doi]
- Towards LLM Agents for Earth ObservationChia-Hsiang Kao, Wenting Zhao, Cheryl Lam, Aarush Umap, Shreelekha Revankar, Samuel Speas, Snehal Bhagat, Rajeev Datta, Cheng Perng Phoo, Utkarsh Mall, Carl Vondrick, Kavita Bala, Bharath Hariharan. 2597-2611 [doi]
- Jamendo-MT-QA: A Benchmark for Multi-Track Comparative Music Question AnsweringJunyoung Koh, Jaeyun Lee, Soo Yong Kim, Gyu Hyeong Choi, Jung-In Koh, Jordan Phillips, Yeonjin Lee, Min Song. 2612-2631 [doi]
- Chinese Live-Streaming E-Commerce Morph Resolution: Datasets and MethodsJipeng Qiang, Jiahao Zhu 0008, Yi Zhu 0006, Chaowei Zhang 0001. 2632-2645 [doi]
- MemoBrain: Executive Memory as an Agentic Brain for ReasoningHongjin Qian, Zhao Cao, Zheng Liu. 2646-2662 [doi]
- Exploring the Capability Boundaries of LLMs in Mastering of Chinese Chouxiang LanguageTian Lan Dianqing Lin, Jiang Li Jiali Zhu, Xu Liu Wei Chen, Xiangdong Su Aruukhan, Guanglai Gao Hongxu Hou. 2663-2687 [doi]
- RECOR: Reasoning-focused Multi-turn Conversational Retrieval BenchmarkMohammed Ali, Abdelrahman Abdallah, Amit Agarwal, Hitesh Laxmichand Patel, Adam Jatowt. 2688-2723 [doi]
- Data Selection for Multi-turn Dialogue Instruction TuningBo Li, Shikun Zhang, Wei Ye 0004. 2724-2739 [doi]
- AgentGC: Evolutionary Learning-based Lossless Compression for Genomics Data with LLM-driven Multiple AgentHui Sun 0002, Yanfeng Ding, Huidong Ma, Chang Xu 0008, Keyan Jin, Lizheng Zu, Cheng Zhong, Xiaoguang Liu 0001, Gang Wang 0001, Wentong Cai 0001. 2740-2757 [doi]
- Think Outside the Policy: In-Context Steered Policy OptimizationHsiu-Yuan Huang, Chenming Tang, Weijie Liu, Clive Bai, Saiyong Yang, Yunfang Wu. 2758-2776 [doi]
- Where CoT Reasoning Commits: Entropy Traces Identify Interpretable Attention HeadsTianhe Zhang, Yonghong Deng, Ping Jian, Zhen Yang, Boyang Wang, Xinyue Zhang. 2777-2795 [doi]
- From Coarse to Fine: Benchmarking and Reward Modeling for Writing-Centric Generation TasksQingYu Ren, Tianjun Pan, Xingzhou Chen, Xuhong Wang. 2796-2810 [doi]
- DentalGPT: Incentivizing Multimodal Reasoning in DentistryZhenyang Cai, Jiaming Zhang, JunJie Zhao, Ziyi Zeng, Yanchao Li, Liang Jingyi, Junying Chen, Yunjin Yang, Jiajun You, Shuzhi Deng, Xieruiqiii, Yuanting Chen, Xiangyi Feng, Jianquan Li, Liangyi Chen, Junwen Wang, Shan Jiang, Benyou Wang. 2811-2829 [doi]
- SARA: Unlocking Multilingual Knowledge in Mixture-of-Experts via Semantically Anchored Routing AlignmentTianyu Dong, Yangyang Liu, Jiang Zhou, Xinwei Wu 0001, Xiaohu Zhao, Hao Wang, Heng Liu, Linlong Xu, Longyue Wang, Weihua Luo, ShaoLin Zhu, Deyi Xiong. 2830-2846 [doi]
- Eliciting Medical Reasoning with Knowledge-enhanced Data Synthesis: A Semi-Supervised Reinforcement Learning ApproachHaolin Li 0001, Shuyang Jiang, Ruipeng Zhang, Jiangchao Yao, Ya Zhang 0002, Yanfeng Wang 0001. 2847-2870 [doi]
- AlphaQT-Bench: Diagnosing the Gap between Financial Code Generation and Quantitative Reasoning in LLMsSichun Luo, Yi Huang 0017, Shichang Meng, Fengyuan Liu, Mukai Li, Qinghua Yao, Zefa Hu, Junlan Feng, Qi Liu. 2871-2886 [doi]
- Fine-tuning with Hierarchical Prompting for Robust Propaganda Classification Across Annotation SchemasLukas Stähelin, Veronika Solopova, Max Upravitelev, David Kaplan, Premtim Sahitaj, Ariana Sahitaj, Charlott Jakob, Sebastian Möller 0001, Vera Schmitt. 2887-2902 [doi]
- ComfyFlow: Benchmarking LLMs for AIGC Workflow GenerationZhenran Xu, Yiyu Wang, Yunxin Li, Muyang Ye, Xue Yang 0008, Kai Chen, Longyue Wang, Weihua Luo, Baotian Hu, Min Zhang 0005. 2903-2916 [doi]
- SEA-Guard: Culturally Grounded Multilingual Safeguard for Southeast AsiaPanuthep Tasawong, Jian Gang Ngui, Alham Fikri Aji, Trevor Cohn, Peerat Limkonchotiwat. 2917-2941 [doi]
- Prompt Injection in Automated Résumé Screening with Large Language Models: Single and Multi-Injection SettingsPreet Baxi, Jiannan Xu, Jane Yi Jiang, Stefanus Jasin. 2942-2953 [doi]
- FuseSearch: Learning Adaptive Parallel Execution for Efficient Code LocalizationKe Xu, Siyang Xiao, Ming Liang, Yichen Yu, Zhixiang Wang, Jingxuan Xu, Dajun Chen, Wei Jiang 0041, Yong Li 0004. 2954-2967 [doi]
- Revisiting Self-Play Preference Optimization: On the Role of Prompt DifficultyYao Xiao, Jung-jae Kim, Roy Ka-Wei Lee, Lidong Bing. 2968-2980 [doi]
- Multi-Agent Comedy Club: Investigating Community Discussion Effects on LLM Humor GenerationShiwei Hong, Lingyao Li, Ethan Z. Rong, Chenxinran Shen, Zhicong Lu. 2981-2998 [doi]
- ComfyUI-R1: Exploring Reasoning Models for Workflow GenerationZhenran Xu, Yiyu Wang, Xue Yang 0008, Longyue Wang, Weihua Luo, Kaifu Zhang, Baotian Hu, Min Zhang 0005. 2999-3013 [doi]
- Hard to Be Heard: Phoneme-Level ASR Analysis of Phonologically Complex, Low-Resource Endangered LanguagesV. S. D. S. Mahesh Akavarapu, Michael Daniel, Gerhard Jäger 0002. 3014-3028 [doi]
- Beyond Surface-Level Pattern Trap: LLM Agents for Faster and Smarter Cross-Architecture Code MigrationWeijia Li, K. E. Gao, Pengfei Chen, Jiajie Li, Xinyu Wang, Yiran Le, Yize Wu, Ling Li. 3029-3042 [doi]
- PairCoder: Pair Programming-Inspired Two-Agent Collaboration for Code GenerationJunhao Chen, Xiang Li, Yibin Xu, Yuehan Cui, Fangsheng Weng, Hao Zhao, Fei Ma 0006, Qi Tian 0001. 3043-3058 [doi]
- OptiVerse: A Comprehensive Benchmark towards Optimization Problem SolvingXinyu Zhang 0021, Boxuan Zhang, Yuchen Wan, Lingling Zhang, Yixing Yao, Bifan Wei, Yaqiang Wu, Jun Liu. 3059-3073 [doi]
- DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language ModelsYakun Zhu, Zhongzhen Huang, Linjie Mu, Yutong Huang, Wei Nie, Jiaji Liu, Shaoting Zhang 0001, Pengfei Liu 0003, Xiaofan Zhang 0002. 3074-3098 [doi]
- AMA: Adaptive Memory via Multi-Agent CollaborationWeiquan Huang, Zixuan Wang, Hehai Lin, Sudong Wang, Bo Xu, Qian Li, Beier Zhu, Linyi Yang, Chengwei Qin. 3099-3120 [doi]
- WESR: A Benchmark and Strong Baseline for Word-level Event-Speech RecognitionChenchen Yang, Kexin Huang, Liwei Fan, Qian Tu, Botian Jiang, Dong Zhang, Linqi Yin, Shimin Li, Zhaoye Fei, Qinyuan Cheng, Xipeng Qiu. 3121-3134 [doi]
- Applicability Condition Extraction for Therapeutic Drug-Disease RelationsGuanting Luo, Noriki Nishida, Yuji Matsumoto 0001, Yuki Arase. 3135-3148 [doi]
- ACR: Adaptive Context Refactoring via Context Refactoring Operators for Multi-Turn DialogueJiawei Shen, Jia Zhu 0003, Hanghui Guo, Weijie Shi, Yue Cui 0001, Qingyu Niu, Guoqing Ma, Jingjiang Liu, Yidan Liang, Yilin Wang, Shimin Di, Jiajie Xu 0001. 3149-3167 [doi]
- ALGOGEN: Tool-Generated Verifiable Traces for Reliable Algorithm VisualizationKunpeng Liao, Yuexiao Ma, Yisheng Lin, Hualin Zeng, Xiawu Zheng, Rongrong Ji. 3168-3189 [doi]
- PivotAttack: Rethinking the Search Trajectory in Hard-Label Text Attacks via Pivot WordsYuzhi Liang, Shiliang Xiao, Jingsong Wei, Qiliang Lin, Xia Li. 3190-3207 [doi]
- MiMIC: Mitigating Visual Modality Collapse in Universal Multimodal Retrieval While Avoiding Semantic MisalignmentJuan Li 0012, Chuanghao Ding, Xujie Zhang, Cam-Tu Nguyen. 3208-3220 [doi]
- Towards Proactive Personalization through Profile Customization for Individual Users in DialoguesXiaotian Zhang, Yuan Wang, Ruizhe Chen, Zeya Wang, Runchen Hou, Zuozhu Liu. 3221-3240 [doi]
- Beyond Stochastic Exploration: What Makes Training Data Valuable for Agentic SearchChuzhan Hao, Wenfeng Feng 0001, Guochao Jiang, Guofeng Quan, Guohua Liu, Yuewei Zhang. 3241-3255 [doi]
- Can LLMs Hear the Dogwhistle?Yifan Liu, Yi Lin, Xinwei Guo, Ziwei Wang, Jiaxin Zhang 0007, Guanhua Chen 0001, Haiyan Wu, Xiangyu Zhao 0001, Xin Yao 0001, Xuetao Wei. 3256-3273 [doi]
- HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language ModelsJizhihui Liu, Guangdao Zhu, Feiyi Du, Niu Lian, Jun Li 0131, Bin Chen 0011, Weili Guan, Yaowei Wang 0001. 3274-3291 [doi]
- MIThinker: A Plug-and-Play Policy-Optimized Thinker For Motivational Interviewing CounselingYizhe Yang, Palakorn Achananuparp, Heyan Huang, Jing Jiang 0001, Ee-Peng Lim. 3292-3328 [doi]
- The Art of (Mis)alignment: How Fine-Tuning Methods Effectively Misalign and Realign LLMs in Post-TrainingRui Zhang 0090, Hongwei Li 0001, Yun Shen, Xinyue Shen 0001, Wenbo Jiang 0001, Guowen Xu, Yang Liu 0003, Michael Backes 0001, Yang Zhang 0016. 3329-3354 [doi]
- ADaPT: Token-Level Decoupling for Efficient Large Reasoning ModelsTingyun Li, Zishang Jiang, Jinyi Han, Xinyi Wang, Sihang Jiang, Han-xia, Zhaoqian Dai, Shuguang Ma, Fei Yu, Jiaqing Liang, Yanghua Xiao. 3355-3369 [doi]
- Talk to Your Slides: High-Efficiency Slide Editing via Language-Driven Structured Data ManipulationKyudan Jung, Hojun Cho, Jooyeol Yun, Soyoung Yang, Jaehyeok Jang, Jaegul Choo. 3370-3399 [doi]
- Verifiable Parameterization of Bayesian Networks from Scientific Literature: Unlocking Unstructured Empirical EvidenceJonas Gottal, Florian Matthes. 3400-3414 [doi]
- PRIME: Ultra-Low-Rank Principal-Residual Model MergingSeung-Ho Lee, Kyungsu Lee, Bazarvaani Zuchi, Jeongmin Ahn, Insuk Seo, Donghyeon Jeon, Inho Kang, Seung-Hoon Na. 3415-3436 [doi]
- Don't Tell the Answer, Truly Guide the Reasoning During RL RolloutsXinyi Wang, Jinyi Han, Zishang Jiang, Tingyun Li, Jiaqing Liang, Sihang Jiang, Zhaoqian Dai, Ma Shuguang, Fei Yu, Yanghua Xiao. 3437-3455 [doi]
- Mask Tokens as Prophet: Fine-Grained Cache Eviction for Efficient dLLM InferenceJianuo Huang, Yaojie Zhang, Yicun Yang, Benhao Huang, Linfeng Zhang 0001. 3456-3479 [doi]
- SPaCe: Unlocking Sample-Efficient Large Language Models Training With Self-Pace Curriculum LearningVan Dai Do, Manh Nguyen, Svetha Venkatesh, Hung Le 0002. 3480-3507 [doi]
- Crossroads of Optimization under Uncertainty: How to Choose the Optimal ModelChengxi She, Zhiqiang Chen, Xingyu Lu, Caihua Chen, Piaoyang Zhao, Xuedong Wang. 3508-3539 [doi]
- Know Thy Enemy: Securing LLMs Against Prompt Injection via Diverse Data Synthesis and Instruction-Level Chain-of-Thought LearningZhiyuan Chang, Mingyang Li 0005, Yuekai Huang, Ziyou Jiang, Xiaojun Jia, Qian Xiong, Junjie Wang 0001, Zhaoyang Li, Qing Wang 0001. 3540-3561 [doi]
- ModularMoE: Fast LLM Customization with Parameter-Sharing Mixture-of-Experts for Low-Resource SettingsJiaxing Liu 0006, Qi Qi 0001, Haifeng Sun 0001, Dunjun Li, Zirui Zhuang, Bo He 0003, Xiang Yang, Cong Liu, Jianxin Liao, Jingyu Wang 0001. 3562-3575 [doi]
- UCGRec: User-Centric Graph Learning for LLM-based Sequential RecommendationHanBeul Kim, CheolWon Na, Suyoung Bae, Yunseok Choi, Jee-Hyong Lee 0001. 3576-3591 [doi]
- HeteroRAG: A Heterogeneous Retrieval-Augmented Generation Framework for Medical Vision Language TasksZhe Chen, Yusheng Liao, Zhiyuan Zhu, Haolin Li, Hongcheng Liu, Yanfeng Wang, Yu Wang 0027. 3592-3613 [doi]
- Subgraph-Guided Executable Logical Form Generation for Knowledge Base Question AnsweringYuhang Tian, Dandan Song, Zhijing Wu 0001, Changzhi Zhou, Jun Yang, Huipeng Ma, Chenhao Li, Luan Zhang, Yading Li, Xudong Li, Shenxi Liu, Jing Jiang. 3614-3635 [doi]
- Towards Reliable Paper Contributions Annotation in the ACL Rolling ReviewJulien Aubert-Béduchaud, Florian Boudin, Akiko Aizawa, Béatrice Daille, Richard Dufour. 3636-3653 [doi]
- Memory Dial: A Training Framework for Controllable Memorization in Language ModelsXiangbo Zhang, Ali Emami. 3654-3673 [doi]
- SEAD: Self-Evolving Agent for Multi-Turn Service DialogueYuqin Dai, Ning Gao, Wei Zhang, Jie Wang, Zichen Luo, Jinpeng Wang, Ruiyuan Wu, Chaozheng Wang. 3674-3684 [doi]
- DataSciBench: An LLM Agent Benchmark for Data ScienceDan Zhang, Sining Zhoubian, Min Cai, Fengzu Li, Lekang Yang, Wei Wang 0074, Tianjiao Dong, Ziniu Hu, Jie Tang 0001, Yisong Yue. 3685-3728 [doi]
- PVPO: Pre-Estimated Value-Based Policy Optimization for Agentic ReasoningWenfeng Feng 0001, Penghong Zhao, Guochao Jiang, Chuzhan Hao, Guohua Liu, Yuewei Zhang. 3729-3748 [doi]
- Momoka-RAG: MCTS-Organized Mapping of Knowledge Associations for Long-Document Retrieval Augmented GenerationWenyu Tao, Xiaofen Xing, Zeliang Li, Xiangmin Xu 0001. 3749-3773 [doi]
- A3: Android Agent Arena for Mobile GUI Agents with Essential-State Procedural EvaluationYuxiang Chai, Shunye Tang, Han Xiao 0010, Weifeng Lin, Hanhao Li, Jiayu Zhang, Liang Liu, Pengxiang Zhao, Guangyi Liu, Guozhi Wang, Shuai Ren, Rongduo Han, Haining Zhang, Siyuan Huang 0004, Hongsheng Li 0001. 3774-3789 [doi]
- Intrinsic Mutual Information as a Modulator for Preference OptimizationPeng Liao, Peijia Zheng, Lingbo Li, Shangsong Liang, Lin Chen. 3790-3808 [doi]
- EVGeoQA: Benchmarking LLMs on Dynamic, Multi-Objective Geo-Spatial ExplorationJianfei Wu, Zhichun Wang, Zhensheng Wang, Zhiyu He. 3809-3821 [doi]
- FinMRAGBench: A Realistic and Complex Benchmark for Multi-Modal RAG in Financial Document AnalysisShouqing Yang, Qi Zhang, Yuhang Yang, Ruikang Xu, Yuwei Hou, Zhulin Jia, Lirong Gao, Haobo Wang 0001, Jinglei Chen, Jiexiang Wang, Sheng Guo, Bo Zheng, Gang Chen 0001. 3822-3867 [doi]
- Apeiron: A Scalable LLM-agentic Framework for Autonomous Full-lifecycle Demand-optimized Application SynthesisJunyan Cheng, Ankit Srivastava, Jessie Zeng, Milenko Drinic, Jack W. Stokes. 3868-3899 [doi]
- Eval-RAR: Evaluation-Driven Retrieval-Augmented Reasoning via Reinforcement LearningHeng Yu, Rui Li, Qi Liu 0003, Wenjun Feng, Junfeng Kang, Yi Zhan. 3900-3912 [doi]
- LUMINA: Long-horizon Understanding for Multi-turn Interactive AgentsAmin Rakhsha, Thomas Hehn 0001, Pietro Mazzaglia, Fabio Valerio Massoli, Arash Behboodi, Tribhuvanesh Orekondy. 3913-3926 [doi]
- Travel on the ICD Tree: Benchmarking Agentic Reasoning for ICD Coding from Chinese Electronic Medical RecordsXinjie Xu, Yongqi Fan, Shuang-shuang Chen, Qi Ye 0004, Weibin Guo, Xinxuan Hu. 3927-3943 [doi]
- RiT: Rubrics-in-Thinking Reinforcement Learning for Improved Reasoning in Large Language ModelsXiaobin Tian, Shuai Yuan, Muyun Ding, Haonan Chen, Xiaoxi Jiang. 3944-3957 [doi]
- From If-Statements to ML Pipelines: Revisiting Bias in Code-GenerationMinh Duc Bui, Xenia Heilmann, Mattia Cerrato, Manuel Mager, Katharina von der Wense. 3958-3972 [doi]
- SEA-SafeguardBench: Culturally Grounded Safety Benchmark for Southeast Asian LanguagesPanuthep Tasawong, Jian Gang Ngui, Alham Fikri Aji, Trevor Cohn, Peerat Limkonchotiwat. 3973-4003 [doi]
- COCOGEC: Counterfactual Generation for Robust Grammatical Error CorrectionQianyu Wang, Xiaoman Wang, Yuanyuan Liang, Xinyuan Li, Yunshi Lan. 4004-4019 [doi]
- DRP: Distilled Reasoning Pruning with Mathematical Skill-aware Step Decomposition for Efficient Large Reasoning ModelsYuxuan Jiang, Dawei Li 0008, Francis Ferraro. 4020-4039 [doi]
- Bridging the Pose-Semantic Gap: A Cascade Framework for Text-Based Person Anomaly SearchZequn Xie, Guijin Luo, Chuxin Wang, Sihang Cai, Tao Jin 0004, Zhou Zhao 0001, Yixuan Tang. 4040-4049 [doi]
- TemplateRL: Structured Template-Guided Reinforcement Learning for LLM ReasoningJinyang Wu, Chonghua Liao, Mingkuan Feng, Shuai Zhang, Zhengqi Wen, Haoran Luo, Ling Yang, Huazhe Xu, Jianhua Tao 0001. 4050-4080 [doi]
- Dual-Reasoner: Bridging Interleaved Atomicity and Streaming Latency via Thinking-while-TalkingYangzhuo Li, Shengpeng Ji, Yifu Chen, Tianle Liang, Haoyu Yang, Junbo Li, Jun Fang, Lin Li, Qingyang Hong. 4081-4105 [doi]
- FBS: Modeling Native Parallel Reading inside a TransformerTongxi Wang. 4106-4137 [doi]
- HqeKV: Towards Hybrid Quantization and Eviction for KV Cache in Long-Context LLM InferenceHe Wang, Yu Gu, Fangfang Li 0002, Zhigang Wang 0001, Zhenghao Liu 0001, Ning Wang 0026, Xiaohua Li 0004, Ge Yu 0001. 4138-4153 [doi]
- Task Matters: Knowledge Requirements Shape LLM Responses to Context-Memory ConflictKaiser Sun, Fan Bai 0006, Mark Dredze. 4154-4176 [doi]
- Adaptive Data Collection for Latin-American Community-sourced Evaluation of Stereotypes (LACES)Guido Ivetta, Pietro Palombini, Sofía Martinelli, Marcos J. Gomez, Maria Emilia Echeveste, Sunipa Dev, Vinodkumar Prabhakaran, Luciana Benotti. 4177-4190 [doi]
- MR-ALIGN: Meta-Reasoning Informed Factuality Alignment for Large Reasoning ModelsXinming Wang, Jian Xu, Bin Yu, Sheng Lian, Yi Chen 0027, Boran Wang, Yingjian Zhu, Hongzhu Yi, Hongming Yang, Han Hu, Cheng-Lin Liu 0001, Xu-Yao Zhang. 4191-4214 [doi]
- Chameleons and Guardians: Unveiling the Divergence in Personality Plasticity and Cognitive Resistance across LLMsJiaxin Wu, Jie Zhao, Xinrong Huang, Cuihong Zhang, Xiuzhu Wu. 4215-4238 [doi]
- Entropy Scheduling in Reinforcement Learning for Large Language ModelsXingjin Wang, Howe Tissue, Lu Wang, Linjing Li, Daniel Dajun Zeng. 4239-4251 [doi]
- TopoDIM: One-shot Topology Generation of Diverse Interaction Modes for Multi-Agent SystemsRui Sun, Jie Ding, Chenghua Gong, Tianjun Gu, Yihang Jiang 0002, Juyuan Zhang, Liming Pan, Linyuan Lü. 4252-4269 [doi]
- AVA: Attentive VLM Agent for Mastering StarCraft IIWeiyu Ma, Yuqian Fu, Zecheng Zhang, Bernard Ghanem, Guohao Li 0001. 4270-4290 [doi]
- Structure-Aware Quantized Retrieval for Long-Document Question AnsweringHui Huang, Julien Velcin, Yacine Kessaci. 4291-4304 [doi]
- GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal ReasoningYi Chen 0019, Yuying Ge, Rui Wang 0092, Yixiao Ge, Junhao Cheng, Ying Shan, Xihui Liu. 4305-4320 [doi]
- Silencing the Guardrails: Inference-Time Jailbreaking via Dynamic Contextual Representation AblationWenpeng Xing, Moran Fang, Guangtai Wang, Changting Lin, Meng Han. 4321-4334 [doi]
- Diffusion with Truncated Blocks: Fast and High-Quality Text Generation using Truncated Block GenerationYuyan Zhou, Weiyu Chen, James T. Kwok. 4335-4348 [doi]
- GigaCheck: Detecting LLM-generated Content via Object-Centric Span LocalizationIrina Tolstykh, Aleksandra Tsybina, Sergey Yakubson, Aleksandr Gordeev, Vladimir Dokholyan, Maksim Kuprashevich. 4349-4364 [doi]
- Chain-in-Tree: Back to Sequential Reasoning in LLM Tree SearchXinzhe Li. 4365-4392 [doi]
- Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning OptimizationXingjian Diao, Zheyuan Liu 0010, Chunhui Zhang, Weiyi Wu, Keyi Kong, Lin Shi, Kaize Ding, Soroush Vosoughi, Jiang Gui. 4393-4410 [doi]
- CSMCIR: CoT-Enhanced Symmetric Alignment with Memory Bank for Composed Image RetrievalZhipeng Qian, Zihan Liang 0001, Yufei Ma 0011, Ben Chen 0004, Huangyu Dai, Yiwei Ma, Jiayi Ji, Chenyi Lei, Han Li 0005, Xiaoshuai Sun. 4411-4424 [doi]
- RepoDistill: Distilling Repository Knowledge through Compression-Aware Budget Allocation and Policy OptimizationXin Yin, Zixiang Ding, Yiang Zhang, Qiang Wang, Rui Wang 0015, Chao Ni 0001, Zhe Cui. 4425-4443 [doi]
- Finding RELIEF: Shaping Reasoning Behavior without Reasoning Supervision via Belief EngineeringChak Tou Leong, Dingwei Chen, Heming Xia, Qingyu Yin, Sunbowen Lee, Jian Wang 0054, Wenjie Li 0002. 4444-4467 [doi]
- Bridging SFT and RL: Dynamic Policy Optimization for Robust ReasoningTaojie Zhu, Dongyang Xu, Ding Zou, Sen Zhao, Qiaobo Hao, Zhiguo Yang, Yonghong He. 4468-4484 [doi]
- FrontCoder: Scaling Visual Fidelity in Front-End Code GenerationJun Feng, Jian Yang, Wei Zhang, Jing Wang, Keyi Chen, Xiaokun Yang, Weicheng Gu, Yihang Lou, Yan Bai, Xianglong Liu 0001. 4485-4505 [doi]
- Bridging Cognition and Affect: Emotion-Aware Opinion Summarization using LLMsArnav Attri, Anuj Attri. 4506-4565 [doi]
- The Double Bind: Revisiting Preprinting and Peer Review Two Years After the Removal of the ACL Anonymity PeriodA Pranav 0001, Shane Storks, Anne Lauscher. 4566-4584 [doi]
- TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment BottlenecksYuanze Hu, Xinyu Wang, Zhichao Yang 0018, Gen Li, Ye Qiu, Zhaoxin Fan, Yifan Sun, Wenjun Wu, Jin Dong, Xiaotie Deng. 4585-4597 [doi]
- Heterogeneity in Formal Linguistic Competence of Language Models: Is Data the Real Bottleneck?H. S. V. N. S. Kowndinya Renduchintala, Sumit Bhatia. 4598-4608 [doi]
- Real Men are Tough: Evaluating Gender Bias and Sensitivity to Masculinity Norms in LLMsElisa Leonardelli, Camilla Casula, Boglárka Nyúl, Sara Tonelli. 4609-4626 [doi]
- RISER: Orchestrating Latent Reasoning Skills for Adaptive Activation SteeringWencheng Ye, Xiaoyang Yuan, Yi Bin, Hengyu Jin, Liang Peng, Pengpeng Zeng, Heng Tao Shen. 4627-4644 [doi]
- ReCoT-NER: Enhancing Zero-Shot Named Entity Recognition through Chain-of-Thought Prompting and Recall-Oriented Loss OptimizationDabin Fu, Fanghong Zhang. 4645-4656 [doi]
- SyncThink: A Training-Free Strategy to Align Inference Termination with Reasoning SaturationGengyang Li, Wang Cai, Yifeng Gao, Yunfang Wu. 4657-4672 [doi]
- Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy OptimizationYu Li, Sizhe Tang, Tian Lan 0001. 4673-4686 [doi]
- FlashMem: Distilling Intrinsic Latent Memory via Computation ReuseYubo Hou, Zhisheng Chen, Tao Wan, Zengchang Qin. 4687-4705 [doi]
- QueueEDIT: Structural Self-Correction for Sequential Model Editing in LLMsTaolin Zhang, Haidong Kang, Dongyang Li, Qizhou Chen, Xiaofeng He, Chengyu Wang, Richang Hong. 4706-4719 [doi]
- CAGenMol: Condition-Aware Diffusion Language Model for Goal-Directed Molecular GenerationYanting Li, Zhuoyang Jiang, Enyan Dai, Lei Wang, Wen-Cai Ye, Li Liu. 4720-4738 [doi]
- MAC-Reasoner: A Multi-Agent Collaborative Framework for Enhancing Logical Reasoning in Large Language ModelsYehua Lin, Liping Zheng, Yin Chen. 4739-4762 [doi]
- Once Correct, Still Wrong: Counterfactual Hallucination in Multilingual Vision-Language ModelsBasel Mousi, Fahim Dalvi, Shammur Absar Chowdhury, Firoj Alam, Nadir Durrani. 4763-4788 [doi]
- DIFFA-2: A Practical Diffusion Large Language Model for General Audio UnderstandingJiaming Zhou 0001, Xuxin Cheng, Shiwan Zhao, Yuhang Jia, Cao Liu, Ke Zeng, Xunliang Cai, Yong Qin. 4789-4805 [doi]
- Beyond Marginal Distributions: A Framework to Evaluate the Representativeness of Demographic-Aligned LLMsTristan Williams, Franziska Weeber, Sebastian Padó, Alan Akbik. 4806-4826 [doi]
- CORES: Code-Oriented Reasoning for Complex Text-to-SQL and Generalizable TableQAMeng Zhang, Ruochun Jin, Yuanxi Peng, Wenjing Yang, Haotian Wang, Liting Sun, Kun Hu, Silin Yang, Zhang Ke-di. 4827-4847 [doi]
- Do Not Guess, Verify: Logic-Guided Adaptive Reasoning for Multimodal Misinformation DetectionKun Huang, Rui Qiu, Xiaoming Li 0006, Salah Uddin. 4848-4861 [doi]
- Hi-ZFO: Hierarchical Zeroth- and First-Order LLM Fine-Tuning via Importance-Guided Tensor SelectionFeihu Jin, Ying Tan 0002. 4862-4876 [doi]
- MCP-Guard: A Multi-Stage Defense-in-Depth Framework for Securing Model Context Protocol in Agentic AIWenpeng Xing, Zhonghao Qi, Yupeng Qin, Yilin Li, Caini Chang, Jiahui Yu, Changting Lin, Zhenzhen Xie, Meng Han. 4877-4889 [doi]
- Half-S: Halving the Scale for Near-Lossless 4-Bit LLM TrainingJinyang Du, Ruihao Gong, Linghan Ai, Zining Wang, Yunke Peng, Yao Wang, Lei Yan 0059, Xuefei Wang, Yaoyuan Wang, Jinyang Guo, Dahua Lin, Xianglong Liu. 4890-4903 [doi]
- F-Actor: Controllable Conversational Behavior in Full-Duplex ModelsMaike Züfle, Ondrej Klejch, Nicholas Sanders, Jan Niehues, Alexandra Birch, Tsz Kin Lam. 4904-4921 [doi]
- APEX: Learning Adaptive Priorities for Multi-Objective Alignment in Vision-Language GenerationDongliang Chen, Xinlin Zhuang, Junjie Xu, Luojian Xie, Zehui Wang, Jiaxi Zhuang, Haolin Yang, Liang Dou, Xiao He, Xingjiao Wu, Ying Qian. 4922-4939 [doi]
- DART: Mitigating Harm Drift in Difference-Aware LLMs via Distill-Audit-Repair TrainingZiwen Pan, Zihan Liang 0002, Jad Kabbara, Ali Emami. 4940-4980 [doi]
- Experience-Driven Reflective Co-Evolution of Prompts and Heuristics for Autonomous Algorithm DesignYihong Liu, Junyi Li 0001, Hongyu Lu, Xin Zhao, Ji-Rong Wen. 4981-4995 [doi]
- Information Representation Fairness in Long-Document Embeddings: The Peculiar Interaction of Positional and Language BiasElias Schuhmacher, Andrianos Michail, Juri Opitz, Rico Sennrich, Simon Clematide. 4996-5028 [doi]
- RA-RRG: Multimodal Retrieval-Augmented Radiology Report Generation with Key Phrase ExtractionJonggwon Park, Byungmu Yoon, Soobum Kim, Kyoyun Choi. 5029-5048 [doi]
- Context-Value-Action Architecture for Value-Driven Large Language Model AgentsTianze Zhang, Sirui Sun, Yuhang Xie, Xin Zhang, Zhiqiang Wu, Guojie Song. 5049-5073 [doi]
- Uncovering Strategic Egoism Behaviors in Large Language ModelsYaoyuan Zhang, Zonghao Ying, Aishan Liu, Jian Yang 0003, Tianlin Li, Yaodong Yang 0001, Xianglong Liu 0001. 5074-5087 [doi]
- EMA: An Episodic Memory Agent for Efficient and Selective MemoryHongyi Lan, Jiaqi Song, Zhengjia Zhong, Hui Li 0057, Hong Liu 0009, Xianming Lin, Rongrong Ji. 5088-5102 [doi]
- ChildTalk: A Multi-Dialect Chinese Child Speech Corpus with Full-Length Child-Caregiver Conversations for Speech RecognitionJiaming Zhou, Yujie Guo, Shiwan Zhao, Yao Lu, Jianye Wang, Haoqin Sun, Hui Wang 0075, Yong Qin. 5103-5116 [doi]
- SrDetection: A Self-Referential Framework for Data Leakage Detection in Code Large Language ModelsShuaimin Li, Liyang Fan, Zeyang Li, Zhuoyue Wan, Yufang Lin, Shiwen Ni, Feiteng Fang, Hamid Alinejad-Rokny, Yuanfeng Song, Kun Jing, Chen Jason Zhang, Min Yang 0007. 5117-5129 [doi]
- Memo-SQL: Structured Decomposition and Experience-Driven Self-Correction for Training-Free NL2SQLZerui Yang, Weichuan Wang, Yanwei Xu 0004, Linqi Song, Yudai Matsuda, Wei Han 0004, Bo Bai 0001. 5130-5148 [doi]
- Do We Always Need Query-Level Workflows? Rethinking Agentic Workflow Generation for Multi-Agent SystemsZixu Wang, Bingbing Xu 0001, Yige Yuan, Huawei Shen, Xueqi Cheng. 5149-5165 [doi]
- How Chain-of-Thought Works? Tracing Information Flow from Decoding, Projection, and ActivationHao Yang, Qinghua Zhao, Lei Li, Lingyi Meng, Mengda Yu. 5166-5199 [doi]
- A Survey of Retentive NetworkHaiqi Yang, Zhiyuan Li, Yi Chang, Yuan Wu. 5200-5216 [doi]
- RAG-KT: Cross-platform Explainable Knowledge Tracing with Multi-view Fusion Retrieval GenerationZhiyi Duan, Hongyu Yuan, Rui Liu 0008. 5217-5232 [doi]
- Conformal Event Prediction with Temporal Knowledge GraphCheng Hu, Cong Cao 0001, Fangfang Yuan, Diandian Guo, Pin Xu, Yu Liu, Yanbing Liu 0007. 5233-5248 [doi]
- Infinite Babble: Inflating 3D Vision-Language Model Inference Overhead via Adversarial Geometric PerturbationShuoyang Sun, Jiaxin Hong, Yv Zhang, Kuofeng Gao, Hao Fang 0011, Fan Mo, Bin Chen, Shu-Tao Xia. 5249-5267 [doi]
- Uncertainty-Calibrated Elastic Alignment for Multimodal Sentiment Analysis with Missing ModalitiesKang He 0005, Yuzhe Ding 0001, Rao Fu, Yukang Feng, Kaipeng Zhang, Yiming Liu, Fei Li 0021, Chong Teng, Donghong Ji. 5268-5288 [doi]
- On the Representation Geometry of LoRA Model MergingChenyang Lu, Jiaru Li, Jinman Zhao, Xinran Chen, Yining Wang, Renyi Cai, Yuchen Li 0007, Chao He. 5289-5304 [doi]
- MCLE-Mol: Empowering LLM with Molecular Comprehension and Low-Cost Continual Evolution for Interpretable Property PredictionZhili Pu, Lantian Zhang, Hao Duan, Zhixing Zhang, Keyun Zhu, Yongqi Fan, Ruihui Hou, Tong Ruan, Yun Tang 0001. 5305-5333 [doi]
- MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language ModelsZhang He, Wenqian Cui, Haoning Xu, Xiao-hui Li, Lei Zhu, Haoli Bai, Shaohua Ma, Irwin King. 5334-5351 [doi]
- Generating Effective CoT Traces for Mitigating Causal HallucinationYiheng Zhao, Jun Yan. 5352-5362 [doi]
- SAE-FiRE: Enhancing Earnings Surprise Predictions Through Sparse Autoencoder Feature SelectionHuopu Zhang, Yanguang Liu, Miao Zhang, Zirui He, Mengnan Du. 5363-5382 [doi]
- From Implicit Graph Encoding to Explicit Evidence: A Training-Free LLM Framework for Temporal Knowledge Graph ReasoningGuo Tang, Ke Cheng 0003, Huiming Fan, Heng Chang, Wenxiang Zheng, Xianhao Ou, Junjia Xiang, Ming Liu 0004, Yujun Zhou, Li Lanyu, Bing Qin 0001. 5383-5405 [doi]
- LLM-Driven Multi-Perspective Location Completion for Next Location PredictionPengxiang Lan, Enneng Yang, Yuliang Liang, Jianzhe Zhao, Linying Jiang, Guibing Guo. 5406-5428 [doi]
- WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question AnsweringYingjian Zhu, Xinming Wang, Kun Ding 0001, Ying Wang, Bin Fan 0001, Shiming Xiang. 5429-5449 [doi]
- Understanding Conflicts in Multi-Objective Alignment through Reward ConsistencyZhihao Xu, Yongqi Tong, Xin Zhang, Jun Zhou, Xiting Wang. 5450-5472 [doi]
- MetaMem: Evolving Meta-Memory for Knowledge Utilization through Self-Reflective Symbolic OptimizationHaidong Xin, Xinze Li, Zhenghao Liu 0001, Yukun Yan, Shuo Wang 0013, Cheng Yang, Yu Gu, Ge Yu 0001, Maosong Sun 0001. 5473-5492 [doi]
- GeoLAN: Geometric Learning of Latent Explanatory Directions in Large Language ModelsTianyu Bell Pan, Damon L. Woodard. 5493-5521 [doi]
- SepSeq: A Training-Free Framework for Long Numerical Sequence Processing in LLMsJie Sun 0030, Yu Liu 0071, Lu Han, Qiwen Deng, Xiang Shu, Yang Xiao, Lintao Ma, Xingyu Lu, Jun Zhou, Pengfei Liu, Jiancan Wu, Xiang Wang. 5522-5537 [doi]
- Ghost in the Shell: Synonym-Aware Logit Shaping Fingerprint for Copyright Protection of Large Vision-Language ModelsXiaofan Zheng, Xinghao Wang, Xiaojun Wan 0001. 5538-5555 [doi]
- Look Twice before You Leap: A Rational Framework for Localized Adversarial Text AnonymizationDonghang Duan, Xu Zheng, Yuefeng He, Chong Mu, Leyi Cai, Lizong Zhang. 5556-5573 [doi]
- K-MetBench: A Multi-Dimensional Benchmark for Fine-Grained Evaluation of Expert Reasoning, Locality, and Multimodality in MeteorologySoyeon Kim, Cheongwoong Kang, Myeongjin Lee, Eun-Chul Chang, Lee Jaedeok, Jaesik Choi. 5574-5612 [doi]
- V-GameGym: Visual Game Generation for Code Large Language ModelsWei Zhang, Jian Yang, Renshuai Tao, Linzheng Chai, Shuyue Guo, Jiajun Wu, Xiaoming Chen, Ganqu Cui, Ning Ding 0002, Xander Xu, H. U. Wei, Bowen Zhou 0002. 5613-5641 [doi]
- UCoder: Unsupervised Code Generation by Internal Probing of Large Language ModelsJiajun Wu, Jian Yang, Wei Zhang, Linzheng Chai, Yuchi Ma, Ensheng Shi, Yuqing Ma, Zhoujun Li 0001, Xianglong Liu 0001. 5642-5655 [doi]
- Deciphering Cultural Representations in Large Language Models via Sparse AutoencodersChenye Zou, Difan Jiao, Lijie Hu. 5656-5677 [doi]
- Fin-Bias: Comprehensive Evaluation for LLM Decision-Making under human bias in Finance DomainXiaoyu Hu, Jinman Zhao. 5678-5694 [doi]
- Duplicate-Aware Controlled Code Generation: Enhancing Copyright Protection with Targeted Reordering Beam Search in LLMsJunbo Fu, Guoshuai Zhao, Linkang Yang, Yunqi Mi, Xueming Qian. 5695-5707 [doi]
- Graph-Based Chain-of-Thought Pruning for Reducing Redundant Reflections in Reasoning LLMsHongyuan Yuan, Xinran He, Run Shao, Bolei He, Xianwei Xue, MengKe Chen, Qiutong Pan, Haiwei Wang, Haifeng Li. 5708-5723 [doi]
- Too Good to be Bad: On the Failure of LLMs to Role-Play VillainsZihao Yi, Qingxuan Jiang, Ruotian Ma, Xingyu Chen, Qu Yang, Mengru Wang, Fanghua Ye 0001, Ying Shen, Zhaopeng Tu, Xiaolong Li, Liefeng Bo. 5724-5734 [doi]
- AudioPrivacy: Parallel Audio Dataset for Speaker Profiling with Diverse Audio Types and Rich AttributesJiabei He, Yanzhe Zhang, Jiaming Zhou, Hui Wang, Haoqin Sun, Yong Qin. 5735-5748 [doi]
- Federated LoRA Fine-Tuning with Pipelined Error-Mitigated Aggregation and Matrix-Wise FreezingHaoran Wang, Xiong Wang, Yuqing Li, Jing Chen, Junyi Zhang, Nan Yan, Kun He, Wei Wang. 5749-5762 [doi]
- RTCFake: Speech Deepfake Detection in Real-Time CommunicationJun Xue 0001, Zhuolin Yi, Yihuan Huang, Yanzhen Ren, Yujie Chen 0006, Cunhang Fan, Zicheng Su, Yongcheng Zhang, Bo Cai. 5763-5775 [doi]
- Progress Ratio Embeddings: An Impatience Signal for Robust Length Control in Neural Text GenerationIvanhoé Botcazou, Tassadit Amghar, Sylvain Lamprier, Frédéric Saubion. 5776-5789 [doi]
- LeakDojo: Decoding the Leakage Threats of RAG SystemsMaosen Zhang, Jianshuo Dong, Boting Lu, Wenyue Li, Xiaoping Zhang, Tianwei Zhang 0004, Han Qiu 0001. 5790-5811 [doi]
- CodeWiki: Evaluating AI's Ability to Generate Holistic Documentation for Large-Scale CodebasesAnh Nguyen Hoang, Minh Le-Anh, Bach Le, Nghi D. Q. Bui. 5812-5827 [doi]
- ARISE: An Adaptive Resolution-Aware Metric for Test-Time Scaling Evaluation in Large Reasoning ModelsZhangyue Yin, Qiushi Sun, Zhiyuan Zeng 0004, Zhiyuan Yu, Qipeng Guo, Xuanjing Huang 0001, Xipeng Qiu. 5828-5848 [doi]
- Breaking the Static Graph: Context-Aware Traversal for Graph-Based RAGKwun Hang Lau, Fangyuan Zhang, Boyu Ruan, Yingli Zhou, Qintian Guo, Ruiyuan Zhang, Xiaofang Zhou 0001. 5849-5863 [doi]
- POP: Prefill-Only Pruning for Efficient Large Model InferenceJunhui He, Zhihui Fu, Jun Wang, Qingan Li. 5864-5877 [doi]
- Guardian-as-an-Advisor: Advancing Next-Generation Guardian Models for Trustworthy LLMsYue Huang 0001, Haomin Zhuang, Jiayi Ye, Han Bao 0005, Yanbo Wang, Hang Hua, Siyuan Wu 0001, Pin-Yu Chen, Xiangliang Zhang 0001. 5878-5900 [doi]
- StructBreak: Structural Cognitive Overload-Induced Safety Failures in MLLMsYang Luo, Xinran Liu, Tiantian Ji, Zhiyi Yin, Lingyun Peng, Shuyu Li. 5901-5923 [doi]
- Role-Sensitive Neurons: A Neuron-Level Gain Control Mechanism for Confidence SteeringPeiwen Huang, Chih-Hao Hsu, Tzu-Hung Huang, Shou-de Lin. 5924-5944 [doi]
- StreamingEval: A Unified Evaluation Framework towards Realistic Streaming Video UnderstandingGuowei Tang, Tianwen Qian, Huanran Zheng, Yifei Wang, Xiaoling Wang 0004. 5945-5960 [doi]
- CogGen: A Cognitively Inspired Recursive Framework for Deep Research Report GenerationKuo Tian, Pengfei Sun, Zhen Wu 0002, Junran Ding, Xinyu Dai. 5961-5988 [doi]
- Debate to Align: Reliable Entity Alignment through Two-Stage Multi-Agent DebateCunda Wang, Ziying Ma, Po Hu 0001, Weihua Wang 0006, Feilong Bao. 5989-6010 [doi]
- Exploring Multilingual Pre-trained Language Model for Aspect-based Sentiment AnalysisYe Wang, Ruijun Jiang, Zhongqing Wang, Guodong Zhou 0001. 6011-6023 [doi]
- Mid-Think: Training-Free Intermediate-Budget Reasoning via Token-Level TriggersVan Yang, Shouren Wang, Debargha Ganguly, Xinpeng Li, Chaoda Song, Vikash Singh, Vipin Chaudhary, Xiaotian Han. 6024-6038 [doi]
- SSR-Zero: Simple Self-Rewarding Reinforcement Learning for Machine TranslationWenjie Yang, Mao Zheng, MingYang Song, Zheng Li, Sitong Wang. 6039-6052 [doi]
- HisDoc-OCR: Restoring Visual Grounding in MLLMs for Chinese Historical Document OCRJiahuan Cao, Yongxin Shi, Zeyu Shan, Zhengyang Lu, Lianwen Jin. 6053-6066 [doi]
- One LLM Does Not Simulate All Students: Ability-Aware Student Simulation via Cognitive Diagnosis Guided LLM AssignmentHuixing Que, Qi Liu, Weibo Gao, Zhenya Huang. 6067-6084 [doi]
- Interactive Learning for LLM ReasoningHehai Lin, Shilei Cao 0005, Sudong Wang, Haotian Wu, Minzhi Li, Linyi Yang, Juepeng Zheng, Chengwei Qin. 6085-6108 [doi]
- Style Amnesia: Investigating Speaking Style Degradation and Mitigation in Multi-Turn Spoken Language ModelsYu-Xiang Lin, Cheng-Han Chiang, Hung-yi Lee. 6109-6131 [doi]
- NeuroSym-Cal: Bridging the Reasoning-Execution Gap in Code Generation via Hierarchical CalibrationPeiyang Liu, Yining Wang, Youru Li, Long Li, Zhi Cai, Wei Ye. 6132-6143 [doi]
- GOBench: Stage-Wise Diagnostics and the Visual Paradox in Multimodal Graph OptimizationYinghao Chen, Wantong Xie, Shuli Zeng, Sijia Zhang, Xiaotian Pan, Feng Wu 0001, Xiangyang Li 0001. 6144-6167 [doi]
- Sparse Growing Transformer: Training-Time Sparse Depth Allocation via Progressive Attention LoopingYao Chen 0009, Yilong Chen, Yinqi Yang, Junyuan Shang, Zhenyu Zhang 0006, Zefeng Zhang 0001, Shuaiyi Nie, Shuohuan Wang, Yu Sun, Hua Wu, Haifeng Wang, Tingwen Liu. 6168-6193 [doi]
- Computational Narrative Understanding for Expressive Text-to-SpeechGaspard Michel, Elena V. Epure, Christophe Cerisara. 6194-6215 [doi]
- DataSage: Multi-agent Collaboration for Insight Discovery with External Knowledge Retrieval, Multi-role Debating, and Multi-path ReasoningXiaochuan Liu, Yuanfeng Song, Xiaoming Yin, Xing Chen. 6216-6250 [doi]
- Eliminating Out-of-Domain Recommendations in LLM-based Recommender Systems: A Unified ViewHao Liao, Jiwei Zhang, Jianxun Lian, Wensheng Lu, Mingqi Wu, Shuo Wang, Yong Zhang, Yitian Huang, Mingyang Zhou, Rui Mao. 6251-6271 [doi]
- Evian: Towards Explainable Visual Instruction-tuning Data AuditingZimu Jia, Mingjie Xu, Andrew Estornell, Jiaheng Wei. 6272-6291 [doi]
- Iterative Self-Correction for Text-Driven Person Re-Identification with Large Vision-Language ModelsGuijin Luo, Zequn Xie, Sihang Cai, Chuxin Wang, Zhou Zhao 0001, Yixuan Tang. 6292-6301 [doi]
- Breaking Contextual Inertia: Reinforcement Learning with Single-Turn Anchors for Stable Multi-Turn InteractionXingwu Chen, Zhanqiu Zhang, Steven Y. Guo, Difan Zou. 6302-6318 [doi]
- Label Words as Local Task Vectors in In-Context LearningBowen Zheng, Ming Ma 0014, Zhongqiao Lin, Tianming Yang. 6319-6332 [doi]
- CoGR-MoE: Concept-Guided Expert Routing with Consistent Selection and Flexible Reasoning for Visual Question AnsweringXiyin Zeng, Yi Lu, Hao Wang. 6333-6350 [doi]
- Which Pieces Does Unigram Tokenization Really Need?Sander Land, Yuval Pinter. 6351-6360 [doi]
- Step Potential Advantage Estimation: Harnessing Intermediate Confidence and Correctness for Efficient Mathematical ReasoningFei Wu, Zhenrong Zhang, Qikai Chang, Jianshu Zhang 0001, Quan Liu, Jun Du 0002. 6361-6379 [doi]
- When depth is redundant: Efficient transformer-based speech anti-spoofingHoan My Tran, Damien Lolive, Aghilas Sini, Arnaud Delhay, Pierre-Francois Marteau, David Guennec. 6380-6397 [doi]
- GCoT-Decoding: Unlocking Deep Reasoning Paths for Universal Question AnsweringGuanran Luo, Wentao Qiu, ZhongQuan Jian, Meihong Wang, Qingqiang Wu 0001. 6398-6414 [doi]
- PerMemSafe: Benchmarking Implicit Personalized Safety of Long Horizon Self-Evolving AgentsHengyu An, Minxi Li, Naen Xu, Chunyi Zhou 0001, Xiaogang Xu 0002, Tianyu Du, Jinbao Li, Shouling Ji. 6415-6433 [doi]
- TagRAG: Tag-guided Hierarchical Knowledge Graph Retrieval-Augmented GenerationWenbiao Tao, Xinyuan Li, Yunshi Lan, Weining Qian. 6434-6456 [doi]
- Danger Depends on the Mind: A Theory-of-Mind Grounded Dataset and Model for Context-Dependent Dangerous SpeechYuanchen Shi, Longyin Zhang, Guodong Zhou 0001, Fang Kong 0001. 6457-6478 [doi]
- One Token Is Enough: Improving Diffusion Language Models with a Sink TokenZihou Zhang, Zheyong Xie, Li Zhong, Haifeng Liu, Shaosheng Cao. 6479-6490 [doi]
- Thunder-KoNUBench: A Corpus-Aligned Benchmark for Korean Negation UnderstandingSungmok Jung, Yeonkyoung So, Joonhak Lee, Sangho Kim, Yelim Ahn, Jaejin Lee. 6491-6518 [doi]
- Progra: Progress-Aware Reinforcement Learning for Multi-Turn Function CallingHuacan Chai, Zijie Cao, Maolin Ran, Yingxuan Yang, Jianghao Lin, Xin Peng, Hairui Wang, Renjie Ding, Ziyu Wan, Muning Wen, Weiwen Liu, Weinan Zhang 0001, Fei Huang, Ying Wen 0001. 6519-6535 [doi]
- Towards Modern Topic Models: A Survey of Taxonomies and Paradigm Shifts from Algorithm-Centric to LLM-Centered Topic AnalysisXuan Xu, Zhongliang Yang, Haolun Li 0005, Rui Tian, Beilin Chu, Jia Song, Yu Li, Shaolin Tan, Linna Zhou. 6536-6561 [doi]
- Beyond Templates: Dynamic Adaptation of Reasoning Demonstrations via Feasibility-Aware ExplorationYong Wu, Weihang Pan, Ke Li, Chen Binhui, Ping Li, Binbin Lin. 6562-6577 [doi]
- CFlowPsyD: An Analysis-Enhanced Dataset for Asynchronous Psychological Counseling through Self-Optimizing Multi-Agent FrameworkDonghao Li, Yifan Deng, Jinta Weng, Xingsheng Zhang, Chenxu Niu, Jingyuan Tian, Heyan Huang, Yue Hu 0002. 6578-6602 [doi]
- The Thin Line Between Comprehension and Persuasion in LLMsAdrian de Wynter, Tangming Yuan. 6603-6631 [doi]
- Evaluating Machine Translation Datasets for Low-Web Data Languages: A Gendered LensHellina Hailu Nigatu, Bethelhem Yemane Mamo, Bontu Fufa Balcha, Debora Taye Tesfaye, Elbethel Daniel Zewdie, Ikram Behiru Nesiru, Jitu Ewnetu Hailu, Senait Mengesha Yayo. 6632-6655 [doi]
- Select2Reason: Efficient Instruction-Tuning Data Selection for Long-CoT ReasoningCehao Yang, Xueyuan Lin, Xiaojun Wu, Chengjin Xu, Xuhui Jiang, Honghao Liu, Hui Xiong 0001, Jian Guo 0016. 6656-6671 [doi]
- Curriculum Learning based Hierarchical Scoring and Analysis Framework for Question Answering Task EvaluationQiong Wu, Tan Yue, Jianxin Liang, Zhen Li, Kai He, Shuai Zhao, Dongyan Zhao 0001. 6672-6699 [doi]
- TrigReason: Trigger-Based Collaboration between Small and Large Reasoning ModelsYi Zhao, Yajuan Peng, Cam-Tu Nguyen, Zuchao Li, Xiaoliang Wang, Xiaoming Fu 0001, Hai Zhao 0001. 6700-6718 [doi]
- TURTLEAI: Benchmarking Multimodal Models for Visual Programming in Turtle GraphicsChao Wen, Jacqueline Staub, Adish Singla. 6719-6756 [doi]
- Calibrated Progressive Distillation: Co-Designing Curriculum and Target Mixing for Knowledge Distillation of Large Language ModelsMengxiang Zhang, Lingyuan Liu. 6757-6776 [doi]
- Faithful-First Reasoning, Planning, and Acting for Multimodal LLMsJunxian Li, Xinyue Xu, Sai Ma, Di Zhang, Sichao Li. 6777-6793 [doi]
- SEAD: A Surrogate-free Label-only Membership Inference Attack against Pre-trained LLMs with Semantic-Aware DensityBiao Yi, Jiahao Li, Yiming Li, Yu He, Baolei Zhang, Zheli Liu, Dacheng Tao. 6794-6813 [doi]
- Faithfulness-Aware Uncertainty Quantification for Fact-Checking the Output of Retrieval-Augmented GenerationEkaterina Fadeeva, Aleksandr Rubashevskii, Dzianis Piatrashyn, Roman Vashurin, Shehzaad Dhuliawala, Artem Shelmanov, Timothy Baldwin, Preslav Nakov, Mrinmaya Sachan, Maxim Panov. 6814-6836 [doi]
- AGGC: Adaptive Group Gradient Clipping for Stabilizing Large Language Model TrainingZhiyuan Li, Yuan Wu, Yi Chang. 6837-6851 [doi]
- MADRA: Multi-Agent Debate for Risk-Aware Embodied PlanningJunjian Wang, Lidan Zhao, Xi Sheryl Zhang. 6852-6876 [doi]
- Navigating Large-Scale Document Collections: MuDABench for Multi-Document Analytical QAZhanli Li, Yixuan Cao 0001, Lvzhou Luo, Ping Luo 0001. 6877-6898 [doi]
- CORBA: Contagious Recursive Blocking Attacks on Multi-Agent Systems Based on Large Language ModelsZhenhong Zhou, Zherui Li, Jie Zhang, Yuanhe Zhang, Kun Wang, Yang Liu, Qing Guo. 6899-6908 [doi]
- Afrispeech Semantics: Evaluating Audio-Semantic Reasoning in Spoken Language Models Across Domains and AccentsChibuzor Okocha, Christan Grant. 6909-6928 [doi]
- MoPrune: Scene-Guided Motion-Aware Token Pruning for Efficient Video Large Language ModelsWenhao Hong, Ziyang Wang, Yixin Zhang, Zilei Wang. 6929-6941 [doi]
- SCMAPR: Self-Correcting Multi-Agent Prompt Refinement for Complex-Scenario Text-to-Video GenerationChengyi Yang, Pengzhen Li, Jiayin Qi, Aimin Zhou, Ji Wu, Ji Liu. 6942-6973 [doi]
- LoReFact: Bridging the Logic Gap in Fact-CheckingQiming Xie, Wenjie Zheng, Xiangqing Shen, Rui Xia. 6974-6996 [doi]
- ODTQA-FoRe: An Open-Domain Tabular Question Answering Dataset for Future Data Forecasting and ReasoningZhensheng Wang, Xiaole Liu, Wenmian Yang, Kun Zhou, Yiquan Zhang, Weijia Jia 0001. 6997-7022 [doi]
- Rectified Sparse Attention for Efficient Long-Sequence GenerationYutao Sun, Tianzhu Ye, Li Dong, Yuqing Xia, Jian Chen, Yizhao Gao 0002, Shijie Cao, Jianyong Wang 0001, Furu Wei. 7023-7034 [doi]
- Knowing-but-Doing: Diagnosing and Defending Role-Play-Driven LLMs Jailbreaks via Moral DisengagementHaiming Qin, Jianxun Lian, Qimin Zhong, Mingyang Zhou 0001, Hao Liao, Naipeng Chao. 7035-7051 [doi]
- Generative-to-Discriminative Test-Time Adaptation via Manifold-Aware Diffusion and Bayesian DistillationBoyun Zhang, Zequn Xie, Fangming Feng, Zihan Zhang, Yongbo He, Chuxin Wang, Sihang Cai, Tao Jin 0004, Qifei Zhang 0001. 7052-7062 [doi]
- Evaluating Memory Capability in Continuous Lifelog ScenarioJianjie Zheng, Zhichen Liu, Zhanyu Shen, Jingxiang Qu, Guanhua Chen, Yile Wang, Yang Xu, Yang Liu, Sijie Cheng. 7063-7089 [doi]
- GoT-R1: Internalizing Graph-of-Thought via Structural Reinforcement for High-Density ReasoningZuchao Li, Qiwei Li 0002, Yao Yao, Hai Zhao 0001, Lefei Zhang, Bo Du 0001. 7090-7104 [doi]
- Hey, That's My Data! Token-Only Dataset Inference in Large Language ModelsChen Xiong, Zihao Wang, Rui Zhu, Tsung-Yi Ho, Pin-Yu Chen, Jingwei Xiong, Haixu Tang. 7105-7120 [doi]
- ToxiTrace: Gradient-Aligned Training for Explainable Chinese Toxicity DetectionBoyang Li, Hongzhe Shou, Yuanyuan Liang, Jingbin Zhang, Fang Zhou. 7121-7138 [doi]
- Three Minds, One Legend: Jailbreak Large Reasoning Model with Adaptive Stacked CiphersViet Anh Nguyen, Shiqian Zhao, Gia Dao, Runyi Hu, Yi Xie, Xiaobao Wu, Anh Tuan Luu. 7139-7159 [doi]
- From Imitation to Discrimination: Progressive Curriculum Learning for Robust Web NavigationPeng Chuang, Wei Zhang, Renshuai Tao, Xinhao Zhang, Jian Yang. 7160-7177 [doi]
- Parallelism and Generation Order in Masked Diffusion Language Models: Limits Today, Potential TomorrowYangyang Zhong, Yanmei Gu, Zhengqing Zang, Xiaomeng Li, Yuqi Ding, Xibei Jia, Yuting Shen, Zhenzhong Lan, Liwang Zhu, Weiping Liu, Junlin Zhou, Haisheng Liu, Zhong Xin Yu, Pengxin Luo, Donglian Qi, Yunfeng Yan, Junbo Zhao 0001. 7178-7218 [doi]
- Understanding New-Knowledge-Induced Factual Hallucinations in LLMs: Analysis and InterpretationRenfei Dang, Peng Hu, Zhejian Lai, Changjiang Gao, Min Zhang, Shujian Huang. 7219-7246 [doi]
- Attribution-Based Analysis and Optimization of Modular Agentic WorkflowsYingxuan Yang, Bo Huang, Siyuan Qi, Chao Feng, Haoyi Hu, Yuxuan Zhu, Jinbo Hu, Haoran Zhao, Ziyi He, Xiao Liu, Zongyu Wang, Muning Wen, Lin Qiu, Xuezhi Cao, Xunliang Cai, Yong Yu 0001, Weinan Zhang 0001. 7247-7264 [doi]
- Synthetic Eggs in Many Baskets: The Impact of Synthetic Data Diversity on LLM Fine-TuningMax Schaffelder, Albert Gatt. 7265-7293 [doi]
- SolidCoder: Bridging the Mental-Reality Gap in LLM Code Generation through Concrete ExecutionWoojin Lee, Jin-Xia Huang. 7294-7316 [doi]
- EgoMemory: Memory-Augmented Personalized Retrieval for Long-Context Egocentric VideoYuanmin Tang, Jue Zhang, Xiaoting Qin, Jing Yu 0007, Meikang Qiu, Gaopeng Gou, Gang Xiong 0001, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang 0001, Qi Wu 0001. 7317-7349 [doi]
- PERM: Psychology-grounded Empathetic Reward Modeling for Large Language ModelsChengbing Wang, Wuqiang Zheng, Yang Zhang, Fengbin Zhu, Junyi Cheng, Yi Xie, Wenjie Wang, Fuli Feng. 7350-7373 [doi]
- Remedy-R: Generative Reasoning for Machine Translation Evaluation without Error AnnotationsShaomu Tan, Ryosuke Mitani, Ritvik Choudhary, Qiyu Wu, Toshiyuki Sekiya, Christof Monz. 7374-7398 [doi]
- VizoMem: A Visual-Textual Memory Framework for Efficient Long-Horizon ReasoningWeijie Liang, Yuanfeng Song, Xing Chen, Caleb Chen Cao, Sirui Han, Yike Guo. 7399-7422 [doi]
- More Images, More Problems? A Controlled Analysis of VLM Failure ModesAnurag Das, Adrian Bulat, Alberto Baldrati, Ioannis Maniadis Metaxas, Bernt Schiele, Georgios Tzimiropoulos, Brais Martínez. 7423-7442 [doi]
- EOP-LLM: Energy Oriented Pruning for Large Language ModelsGuan Huang, Tao Shu. 7443-7464 [doi]
- Sentipolis: Emotion-Aware Agents for Social SimulationsChiyuan Fu, Lyuhao Chen, Yunze Xiao, Weihao Xuan, Carlos Busso, Mona T. Diab. 7465-7494 [doi]
- Bidirectional Semantic Enhancement for Schema Routing Across Large-Scale DatabasesYuyang Wu, Xiaoliang Wang, Cam-Tu Nguyen. 7495-7509 [doi]
- DeepPlanner: Scaling Planning Capability for Deep Research Agents via Advantage ShapingWei Fan, Wenlin Yao, Zheng Li, Feng Yao, Xin Liu, Liang Qiu, Qingyu Yin, Yangqiu Song, Bing Yin. 7510-7525 [doi]
- SupChain-Bench: Benchmarking Large Language Models for Real-World Supply Chain ManagementShengyue Guan, Yihao Liu, Lang Cao. 7526-7550 [doi]
- How Hypocritical Is Your LLM judge? Listener-Speaker Asymmetries in the Pragmatic Competence of Large Language ModelsJudith Sieker, Sina Zarrieß. 7551-7565 [doi]
- CoopQ: Cooperative Game Inspired Layerwise Mixed Precision Quantization for LLMsJunchen Zhao, Ali Derakhshan, Jayden Kana Hyman, Junhao Dong 0004, Sangeetha Abdu Jyothi, Ian G. Harris. 7566-7578 [doi]
- Breaking Language Preference in Multilingual RAG via Language-Controllable Retrieval and Language-Agnostic ReasoningWenshuai Huo, Xiaocheng Feng, Baohang Li, Chengpeng Fu, Yichong Huang, Hui Wang 0030, Bing Qin. 7579-7589 [doi]
- From Scoring to Explanations: Evaluating SHAP and LLM Rationales for Rubric-based Teaching Quality AssessmentIvo Bueno, Babette Bühler, Philipp Stark, Tim Fütterer, Ulrich Trautwein, Dorottya Demszky, Heather Hill, Enkelejda Kasneci. 7590-7606 [doi]
- LycheeCluster: Efficient Long-Context Inference with Structure-Aware Chunking and Hierarchical KV IndexingDongfang Li 0002, Zixuan Liu, Gang Lin, Baotian Hu, Min Zhang. 7607-7623 [doi]
- HiRAS: A Hierarchical Multi-Agent Framework for Paper-to-Code Generation and ExecutionHanhua Hong, Yizhi Li, Jiaoyan Chen, Sophia Ananiadou, Xiaoli Li, Jung-jae Kim, Chenghua Lin 0002. 7624-7652 [doi]
- RoadMapper: A Multi-Agent System for Roadmap Generation of Solving Complex Research ProblemsJiacheng Liu, Zichen Tang, Zhongjun Yang, Xinyi Hu, Xueyuan Lin, Linwei Jia, Ruofei Bai, Rongjin Li, Shiyao Peng, Haocheng Gao, Haihong E. 7653-7676 [doi]
- On Temperature-Constrained Non-Deterministic Machine Translation: Potential and EvaluationWeichuan Wang, Mingyang Liu, Chen Ma 0001, Linqi Song. 7677-7701 [doi]
- ExaGPT: Example-Based Machine-Generated Text Detection for Human InterpretabilityRyuto Koike, Masahiro Kaneko, Ayana Niwa, Preslav Nakov, Naoaki Okazaki. 7702-7715 [doi]
- Zipage: Maintain High Request Concurrency for LLM Reasoning through Compressed PagedAttentionMengqi Liao, Lu Wang 0029, Chaoyun Zhang, Bo Qiao 0001, Si-qin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang 0001, Huaiyu Wan. 7716-7737 [doi]
- The Overlooked Role of Graded Relevance Thresholds in Multilingual Dense RetrievalTomer Wullach, Ori Shapira, Amir David Nissan Cohen. 7738-7750 [doi]
- Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and ReasoningCong Wan, Ying He, Zhongzhan Huang, Hefeng Wu. 7751-7767 [doi]
- PsyScore: A Psychometrically-Aware Framework for Trait-Adaptive Essay Scoring and ZPD-Scaffolded FeedbackWei Xia, Jin Wu, Haoran Shi, Xiangyu Wang, Chanjin Zheng. 7768-7786 [doi]
- FinMaster: A Holistic Benchmark for Full-Pipeline Financial Management with Large Language ModelsJunzhe Jiang 0002, Chang Yang, Aixin Cui, Sihan Jin, Yujing Zhang, Yilin Xiao 0002, Ruiyu Wang, Bo Li 0037, Xiao Huang 0001, Danny Dongning Sun, Xinrun Wang. 7787-7844 [doi]
- PersonaForge: Psychology-Grounded Dual-Process Architecture for Personality-Consistent Role-Playing AgentsJizhou Tong, Sirui Zou. 7845-7874 [doi]
- Graph Explorer: Training Faithful KG Agents with Visibility-Grounded SupervisionYifeng Chen, Sicheng Wan, Tianyi Zhang, Xuezhou Zhang. 7875-7890 [doi]
- Robust Uncertainty Quantification for Self-Evolving Large Language Models via Continual Domain PretrainingXiaofan Zhou, Lu Cheng 0001. 7891-7908 [doi]
- Exploring Graph Learning Tasks with Pure LLMs: A Comprehensive Benchmark and InvestigationYuxiang Wang, Xinnan Dai, Wenqi Fan, Yao Ma 0001. 7909-7942 [doi]
- Beyond Rejection Sampling: Trajectory Fusion for Scaling Mathematical ReasoningJie Deng, Hanshuang Tong, Jun Li, Shining Liang, Ning Wu, Hongzhi Li, Yutao Xie. 7943-7959 [doi]
- ReasonRec: A Reasoning-Augmented Multimodal Agent for Unified RecommendationYihua Zhang, Mingfu Liang, Jiyan Yang, Rong Jin 0001, Wen-Yen Chen, Yiping Han, Huayu Li, Buyun Zhang, Liang Luo, Luke Simon, Sijia Liu 0001, Tianlong Chen 0001, Xi Liu. 7960-7980 [doi]
- Does Chain-of-Thought Reasoning Help Mobile GUI Agents? An Empirical StudyLi Zhang 0133, Longxi Gao, Mengwei Xu 0001. 7981-7996 [doi]
- Asymmetric Relational-Geometry Driven Universal Adversarial Perturbations for Vision-Language ModelsJiaxin Ye, Weihai Li, Ying Wang, Simeng Qin, Zhitao Zeng, Zikai Xu. 7997-8014 [doi]
- PaperScope: A Multi-Modal Multi-Document Benchmark for Agentic Deep Research Across Massive Scientific PapersLei Xiong, Huaying Yuan, Zheng Liu, Zhao Cao, Zhicheng Dou. 8015-8040 [doi]
- When Personalization Misleads: Understanding and Mitigating Hallucinations in Personalized LLMsZhongxiang Sun, Yi Zhan, Chenglei Shen, Weijie Yu 0003, Xiao Zhang 0034, Ming He, Jun Xu 0001. 8041-8060 [doi]
- Law in Silico: Simulating Legal Society with LLM-Based AgentsYiding Wang, Yuxuan Chen, Fanxu Meng 0003, Xifan Chen, Xiaolei Yang, Muhan Zhang. 8061-8104 [doi]
- MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn DialoguesYaning Pan, Qianqian Xie, Guohui Zhang, Zekun Moore Wang, Yongqian Wen, Yuanxing Zhang, Haoxuan Hu, Zhiyu Pan, Yibing Huang, Zhidong Gan, Yonghong Lin, An Ping, Shihao Li, Yanghai Wang, Tianhao Peng, Jiaheng Liu. 8105-8126 [doi]
- Query-Aware Graph Attention for Precise Subgraph Retrieval in Knowledge-Augmented ReasoningYuanye Xu, Linyi Guo, Yue Zhang, Fu Ning. 8127-8148 [doi]
- LIBERTy: A Causal Framework for Benchmarking Concept-Based Explanations of LLMs with Structural CounterfactualsGilat Toker, Nitay Calderon, Ohad Amosy, Roi Reichart. 8149-8186 [doi]
- Contract-Coding: Towards Repo-Level Generation via Structured Symbolic ParadigmYi Lin, Lujin Zhao, Yijie Shi. 8187-8206 [doi]
- Adaptive Text Anonymization: Learning Privacy-Utility Trade-offs via Prompt OptimizationGabriel Loiseau, Damien Sileo, Damien Riquet, Maxime Meyer, Marc Tommasi. 8207-8229 [doi]
- SWE-QA: Can Language Models Answer Repository-level Code Questions?Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu 0002. 8230-8245 [doi]
- Efficient PRM Training Data Synthesis via Formal VerificationRyo Kamoi, Yusen Zhang 0001, Nan Zhang, Sarkar Snigdha Sarathi Das, Ranran Haoran Zhang, Wenpeng Yin 0001, Rui Zhang 0037. 8246-8265 [doi]
- Revealing the Attention Floating Mechanism in Masked Diffusion ModelsXin Dai, Pengcheng Huang 0004, Zhenghao Liu 0001, Shuo Wang, Yukun Yan, Chaojun Xiao, Yu Gu 0002, Ge Yu 0001, Maosong Sun 0001. 8266-8286 [doi]
- Balancing Knowledge Breadth and Task Depth for Effective Domain Adaptation Fine-TuningMu Zhang, Yuxiang Chu, Guangya Yu, Yongqi Fan, Weiyan Zhang, Hang Hu, Tong Ruan, JingPing Liu. 8287-8304 [doi]
- Explain the Flag: Contextualizing Hate Speech Beyond CensorshipJason Liartis, Eirini Kaldeli, Lambrini Gyftokosta, Eleftherios Chelioudakis, Orfeas Menis-Mastromichalakis. 8305-8325 [doi]
- EnvScaler: Scaling Tool-Interactive Environments for LLM Agent via Programmatic SynthesisXiaoshuai Song, Haofei Chang, Guanting Dong 0001, Yutao Zhu 0001, Ji-Rong Wen, Zhicheng Dou. 8326-8357 [doi]
- Iterative Knowledge Graph Refinement and Integration for Medical Question AnsweringHaochen Zou, Yongli Wang 0002. 8358-8374 [doi]
- Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic ToolchainsYuqi Xiong, Chunyi Peng, Zhipeng Xu, Zhenghao Liu, Zulong Chen, Yukun Yan, Shuo Wang, Yu Gu 0002, Ge Yu 0001. 8375-8399 [doi]
- Lost in Stories: Consistency Bugs in Long Story Generation by LLMsJunjie Li, Xinrui Guo, Yuhao Wu, Roy Ka-Wei Lee, Hongzhi Li, Yutao Xie. 8400-8428 [doi]
- Chinese Court Simulation with LLM-Based Agents SystemKaiyuan Zhang, Jiaqi Li, Yueyue Wu, Haitao Li, Cheng Luo, Shaokun Zou, Yujia Zhou 0002, Weihang Su, Yiqun Liu, Qingyao Ai. 8429-8454 [doi]
- SPASM: Stable Persona-driven Agent Simulation for Multi-turn Dialogue GenerationHan Luo, Guy Laban. 8455-8475 [doi]
- Telling Speculative Stories to Help Humans Imagine the Harms of Healthcare AIXingmeng Zhao, Tongnian Wang, Daniel Schumacher, Veronica Rammouz, Anthony Rios. 8476-8516 [doi]
- Masking or Mitigating? Deconstructing the Impact of Query Rewriting on Retriever Biases in RAGAgam Goyal, Koyel Mukherjee 0001, Apoorv Saxena, Anirudh Phukan, Eshwar Chandrasekharan, Hari Sundaram. 8517-8530 [doi]
- Unifying Inference-Time Planning Language GenerationPrabhu Prakash Kagitha, Bo Sun, Ishan Desai, Andrew Zhu, Cassie Huang, Manling Li, Ziyang Li, Li Zhang. 8531-8574 [doi]
- EmoRes: Toward Adaptive Psychological Support via User-Agnostic Benchmark and Topic-Mining AgentZhengwei Zou, Xuanming Jiang, Baoyi An 0001, Dingyu Nie, Zhengxing Fang, Qingyu Liu, Xueming Qian, Guoshuai Zhao, Zhongyu Yang. 8575-8586 [doi]
- Budget-Aware Anytime Reasoning with LLM-Synthesized Preference DataXuanming Zhang, Shwan Ashrafi, Aziza Mirsaidova, Amir Rezaeian, Miguel Ballesteros, Lydia B. Chilton, Zhou Yu 0001, Dan Roth 0001. 8587-8599 [doi]
- Mitigating Cultural Bias in LLMs via Multi-Agent Cultural DebateQian Tan, Lei Jiang, Yuting Zeng, Shuoyang Ding, XiaoHua Xu. 8600-8612 [doi]
- ToolRM: Towards Agentic Tool-Use Reward ModelingRenhao Li, Jianhong Tu, Yang Su, Yantao Liu, Fei Huang 0005, Hamid Alinejad-Rokny, Derek F. Wong, Junyang Lin, Min Yang. 8613-8640 [doi]
- MDocRAG-RL: Empowering Multi-Modal Document RAG via Complex Visual Reasoning with Reinforcement LearningZhongyu Wang. 8641-8651 [doi]
- MARS: Unleashing the Power of Speculative Decoding via Margin-Aware VerificationJingwei Song, Xinyu Wang, Hanbin Wang, Xiaoxuan Lei, Tianyu Shi 0003, Shixin Han, Eric Yang, Xiao-Wen Chang, Lynn Ai. 8652-8663 [doi]
- AI, Take the Wheel: What Drives Delegation and Trust in Human-Computer Cooperative Question Answering?Maharshi Gor, Yoo yeon Sung, Yu Hou, Eve Fleisig, Zhu Irene Ying, Tianyi Zhou 0001, Jordan Lee Boyd-Graber. 8664-8689 [doi]
- Self-Reinforcing Controllable Synthesis of Rare Relational Data via Bayesian CalibrationChongsheng Zhang, Hao Wang, Zelong Yu, Esteban Garces Arias, Julian Rodemann, Zhanshuo Zhang, Qilong Li, Gaojuan Fan, Krikamol Muandet, Christian Heumann. 8690-8711 [doi]
- WaveDetect: Robust Framework for Machine-Generated Text Detection via Wavelet TransformZhichen Liu, Kaitong Qin, Linhan He, Yang Xu. 8712-8727 [doi]
- AHEAD: Attention Head Energy-Aware Dynamics for Hallucination Mitigation in MLLMsJiale Chang, Ying Li, Siliang Tang, Yueting Zhuang. 8728-8739 [doi]
- TopoSHIELD: Reshaping the Flow of Malice via Spatio-Temporal Risk-Aware Topological Evolution in Multi-Agent SystemsRuiyang Huang, Chenxi Wang, Tinghe Zhang, Fengrui Liu, Jiayan Sun, Haocheng Wang, Yifan Wu. 8740-8768 [doi]
- Diagnosing and Mitigating Sycophancy and Skepticism in LLM Causal JudgmentEdward Y. Chang. 8769-8789 [doi]
- SuperWriter: Reflection-Driven Long-Form Generation with Large Language ModelsYuhao Wu, Yushi Bai, Zhiqiang Hu, Juanzi Li, Roy Ka-Wei Lee. 8790-8812 [doi]
- ProxyPrompt: Securing System Prompts against Prompt Extraction AttacksZhixiong Zhuang, Maria-Irina Nicolae, Hui-Po Wang, Mario Fritz. 8813-8845 [doi]
- Cogito: A Cognitive Agentic Framework Driven by Dynamic Graph of Thoughts for Financial Report GenerationLifan Chen, Wei Ding, Jingwen Yang, Xiuze Zhou, Jingan Chen, Fan Lin. 8846-8860 [doi]
- From Coarse to Fine: A Multi-Granularity Multimodal Framework for Teacher Sentiment AnalysisZhiyi Duan, Xiangren Wang, Jiangshan Guan, Bing Jia, Qianli Xing 0002. 8861-8876 [doi]
- PBEBench: A Multi-Step Programming by Examples Reasoning Benchmark inspired by Historical LinguisticsAtharva Naik, Prakam, Yash Mathur, Darsh Agrawal, Manav Nitin Kapadnis, Yuwei An, Clayton Marr, Carolyn P. Rosé, David R. Mortensen. 8877-8918 [doi]
- T2I-ReasonBench: Benchmarking Reasoning-Informed Text-to-Image GenerationKaiyue Sun 0001, Rongyao Fang, Chengqi Duan, Xian Liu, Aoxue Li, Xihui Liu. 8919-8944 [doi]
- CGBridge: Bridging Code Graphs and Large Language Models for Better Structure-Aware Code UnderstandingZeqi Chen, Zhaoyang Chu, Yi Gui, Feng Guo, Yao Wan 0001, Chuan Shi. 8945-8966 [doi]
- Candidate-Aware Retrieval and Reranking for Multiple-Choice Question Answering: Arabic as a Case StudyYassine Bouziane, Youness Moukafih, Mounir Ghogho. 8967-8977 [doi]
- Logical Structure as Knowledge: Enhancing LLM Reasoning via Structured Logical Knowledge Density EstimationZhen Bi, Zhenlin Hu, Xueshu Chen, Mingyang Chen 0002, Cheng Deng, Yida Xue, Zhen Wang 0008, Qing Shen 0005, Ningyu Zhang 0001, Jungang Lou. 8978-8999 [doi]
- ACSE: An Ancient Character Semantic-Aware Embedding for Large Language ModelsZhihan Zhou 0003, Daqian Shi, Lida Shi, Rui Song 0008, Peiqiang Qiu, Xiaolei Diao, Hao Xu 0012. 9000-9012 [doi]
- Reasoning as Gradient: Scaling MLE Agents Beyond Tree SearchYifei Zhang, Xu Yang, Xiao Yang, Bowen Xian, Qizheng Li, Shikai Fang, Jingyuan Li, Jian Wang, Minrui Xu, Yuge Zhang, Weiqing Liu, Jiang Bian. 9013-9038 [doi]
- Speak No Evil, Just Prompt: Low-resource Multilingual Toxic Speech Detection with Audio Language ModelMingzi Zuo, Lei Zhang 0024, Hailiang Sun, Shengzhi Huo, Changyu Dong, Xin Wang, Bo Wang, Hao Liu. 9039-9053 [doi]
- EmotionTalk: An Interactive Chinese Multimodal Emotion Dataset With Rich AnnotationsHaoqin Sun, Jinghua Zhao 0004, Xuechen Wang, Shiwan Zhao, Jiaming Zhou, Hui Wang, Xi Yang, Yequan Wang, Yonghua Lin. 9054-9071 [doi]
- What Prompts Don't Say: Understanding and Managing Underspecification in LLM PromptsChenyang Yang 0002, Yike Shi, Qianou Ma, Michael Xieyang Liu, Christian Kästner, Tongshuang Wu. 9072-9101 [doi]
- AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech ModelingJiacheng Shi, Hongfei Du, XinYuan Song, Y. Alicia Hong, Yanfu Zhang, Ashley Gao. 9102-9124 [doi]
- Agentic Conversational Search with Contextualized Reasoning via Reinforcement LearningFengran Mo, Yifan Gao 0001, Sha Li, Hansi Zeng, Xin Liu, Zhaoxuan Tan, Xian Li, Jianshu Chen, Dakuo Wang, Meng Jiang 0001. 9125-9138 [doi]
- Do Multimodal RAG Systems Leak Data? A Comprehensive Evaluation of Membership Inference and Image Caption Retrieval AttacksAli Al-Lawati, Suhang Wang. 9139-9154 [doi]
- PED: Route-Decoupled Diagnostics for Persona Consistency in Spoken AgentsWeihao Liu, Junrui Wei, Zhao Zhang, Ju Zhang 0001. 9155-9168 [doi]
- Interpretable Semantic Gradients in SSD: A PCA Sweep Approach and a Case Study on AI DiscourseHubert Plisiecki, Maria Leniarska, Jan Piotrowski, Marcin Zajenkowski. 9169-9177 [doi]
- Self-Sum: Teaching an Agent to Decide Itself When and What to SummarizeHongru Wang 0003, Rui Wang, Jushi Kai, Boyang Xue, Yongqi Li, Shijue Huang, Xiaoteng Ma, Jeff Z. Pan, Amos Storkey 0001. 9178-9192 [doi]
- GreekMMLU: A Native-Sourced Multitask Benchmark for Evaluating Language Models in GreekYang Zhang, Mersin Konomi, Christos Xypolopoulos, Konstantinos Divriotis, Konstantinos Skianis, Giannis Nikolentzos, Giorgos Stamou, Guokan Shang, Michalis Vazirgiannis. 9193-9217 [doi]
- User-Assistant Bias in LLMsXu Pan, Jingxuan Fan, Zidi Xiong, Ely Hahami, Jorin Overwiening, Ziqian Xie. 9218-9241 [doi]
- ICLAD: In-Context Learning with Comparison-Guidance for Audio Deepfake DetectionBenjamin Shiue-Hal Chou, Yi Zhu, Surya Koppisetti. 9242-9256 [doi]
- ReStyle-TTS: Relative and Continuous Style Control for Zero-Shot Speech SynthesisHaitao Li, Chunxiang Jin, Chenglin Li, Wenhao Guan, Zhengxing Huang, Xie Chen 0001. 9257-9269 [doi]
- Who Gets Which Message? Auditing Demographic Bias in LLM-Generated Targeted TextTunazzina Islam. 9270-9297 [doi]
- FACTS: Table Summarization via Offline Template Generation with Agentic WorkflowsYe Yuan, Mohammad Amin Shabani, Siqi Liu. 9298-9315 [doi]
- How Language Models Conflate Logical Validity with Plausibility: A Representational Analysis of Content EffectsLeonardo Bertolazzi, Sandro Pezzelle, Raffaella Bernardi. 9316-9347 [doi]
- LLMs Deceive Unintentionally: Emergent Misalignment in Dishonesty from Misaligned Samples to Biased Human-AI InteractionsXuhao Hu, Peng Wang 0095, Xiaoya Lu, Dongrui Liu, Xuanjing Huang 0001, Jing Shao. 9348-9372 [doi]
- AlphaQuanter: An End-to-End Tool-Augmented Agentic Reinforcement Learning Framework for Stock TradingZheye Deng, Weixiang Yan, Changlong Yu, Jiashu Wang. 9373-9394 [doi]
- Distribution Shift Alignment Helps LLMs Simulate Survey Response DistributionsJi Huang, Mengfei Li, Shuai Shao. 9395-9409 [doi]
- PhysPRM: A Generative Process Reward Model with Fine-grained Diagnosis for Physics Problem SolvingYuxuan Dong, Xinyu Zhang, Lingling Zhang, Han Lai, Pengyu Li, Bifan Wei, Yaqiang Wu, Jun Liu. 9410-9427 [doi]
- The Mark Fades: Adaptive Evolutionary Paraphrase-based Attack against LLM WatermarksYusheng Zhao, Jian Zhao, Tianle Zhang, Feng Wei, Xuelong Li 0001. 9428-9445 [doi]
- CoRE: A Fine-Grained Code Reasoning Benchmark Beyond Output PredictionJun Gao, Yun Peng, Qian Qiao, Changhai Zhou, Yuhua Zhou, Shiyang Zhang, Shichao Weng, Zhenchang Xing, Xiaoxue Ren. 9446-9459 [doi]
- Empowering Reliable Visual-Centric Instruction Following in MLLMsWeilei He, Feng Ju, Zhiyuan Fan, Rui Min, Minhao Cheng. 9460-9482 [doi]
- TT-SI: Self-Improving LLM Agents with Test-Time TrainingEmre Can Acikgoz, Cheng Qian 0008, Heng Ji 0001, Dilek Hakkani-Tür, Gokhan Tur. 9483-9508 [doi]
- Conflicts Make Large Reasoning Models Vulnerable to AttacksHonghao Liu, Chengjin Xu, Xuhui Jiang, Cehao Yang, Shengming Yin, Zhengwu Ma, Lionel Ni, Jian Guo. 9509-9531 [doi]
- Linear Script Representations in Speech Foundation Models Enable Zero-Shot TransliterationRyan Soh-Eun Shim, KwangHee Choi, Kalvin Chang, Ming-Hao Hsu, Florian Eichin, Zhizheng Wu 0001, Alane Suhr, Michael A. Hedderich, David Harwath, David R. Mortensen, Barbara Plank. 9532-9544 [doi]
- NSL-MT: Linguistically Informed Negative Samples for Efficient Machine Translation in African Low-Resource LanguagesMamadou K. Keita, Christopher M. Homan, Huy Le. 9545-9560 [doi]
- EduMARS: Can Vision-Language Models Grade Like Teachers? Benchmarking Multimodal, Rubric-Based Assessment on Chinese K-12 AnswersXuan Zhao, Jiashun Chen, Wanting Xu, Huiyuan Yan, Chaowei Fang, Xing Wei. 9561-9583 [doi]
- MMR-GRPO: Accelerating GRPO-Style Training through Diversity-Aware Reward ReweightingKangda Wei, Ruihong Huang. 9584-9605 [doi]
- StoryMI: Steerable Multi-Agent Therapeutic Dialogue GenerationQingyu Meng, Min Chen, Dingming Liu, Yifan Mo, Yue Su, Xin Sun, Koen V. Hindriks, Jiahuan Pei. 9606-9623 [doi]
- Disambiguation-Centric Finetuning Makes Enterprise Tool-Calling LLMs More Realistic and Less RiskyAshutosh Hathidara, Julien Yu, Sebastian Schreiber 0001. 9624-9652 [doi]
- ToolGate: Contract-Grounded and Verified Tool Execution for LLMsYanming Liu, Xinyue Peng, Jiannan Cao, Xinyi Wang, Songhang Deng, Jintao Chen 0001, Jianwei Yin, Xuhong Zhang 0002. 9653-9684 [doi]
- PersonaArena: Dynamic Simulation for Evaluating and Enhancing Persona-Level Role-Playing in Large Language ModelsWenlong Shi, Jianxun Lian, Mingqi Wu, Haiming Qin, Mingyang Zhou, Xing Xie 0001, Naipeng Chao, Hao Liao. 9685-9719 [doi]
- Poller: Are LLMs Suitable for Evaluating Poetry Understanding Task?Shanshan Wang 0009, Derek F. Wong, Jingming Yao, Lidia S. Chao. 9720-9735 [doi]
- No-Worse Context-Aware Decoding: Preventing Neutral Regression in Context-Conditioned GenerationYufei Tao 0004, Ameeta Agrawal. 9736-9751 [doi]
- Prompting Test-Time Scaling Is A Strong LLM Reasoning Data AugmentationSondos Mahmoud Bsharat, Zhiqiang Shen. 9752-9776 [doi]
- GRASS: Gradient-based Adaptive Layer-wise Importance Sampling for Memory-efficient Large Language Model Fine-tuningKaiyuan Tian, Linbo Qiao, Yu Tang, Gongqingjian Jiang, Baihui Liu, Yifu Gao, Xialin Su, Dongsheng Li 0001. 9777-9790 [doi]
- ltzGLUE: Luxembourgish General Language Understanding EvaluationAlistair Plum, Felicia Körner, Anne-Marie Lutgen, Laura Bernardy, Fred Philippy, Emilia Milano, Nils Rehlinger, Cedric Lothritz, Tharindu Ranasinghe, Barbara Plank, Christoph Purschke. 9791-9807 [doi]
- AdapThink: Adaptive Thinking Preferences for Reasoning Language ModelsWenyue Xu, Xu Wan 0001, Wei Wang, Wenqi Huang, Wotao Yin, Shengjie Zhao, Mingyang Sun. 9808-9825 [doi]
- Improving the Throughput of Diffusion-based Large Language Models via a Training-Free Confidence-Aware CalibrationJucheng Shen, Gaurav Sarkar, Yeonju Ro, Sharath Nittur Sridhar, Zhangyang Wang, Aditya Akella, Souvik Kundu 0009. 9826-9837 [doi]
- Same Claim, Different Judgment: Benchmarking Scenario-Induced Bias in Multilingual Financial Misinformation DetectionZhiwei Liu, Yupeng Cao, Yuechen Jiang, Mohsinul Kabir, Polydoros Giannouris, Chen Xu, Ziyang Xu, Tianlei Zhu, Md. Tariquzzaman, Triantafillos Papadopoulos, Yan Wang 0015, Lingfei Qian, Xueqing Peng, Zhuohan Xie, Ye Yuan, Saeed Almheiri, Abdulrazzaq Alnajjar, Mingbin Chen, Harry Stuart, Paul Thompson 0002, Prayag Tiwari, Alejandro Lopez-Lira, Xue Liu, Jimin Huang, Sophia Ananiadou. 9838-9864 [doi]
- MASS-RAG: Multi-Agent Synthesis Retrieval-Augmented GenerationXingchen Xiao, Heyan Huang, Runheng Liu, Jincheng Xie. 9865-9883 [doi]
- Bayesian Active Learning with Gaussian Processes Guided by LLM Relevance Scoring for Dense Passage RetrievalJunyoung Kim, Anton Korikov, Jiazhou Liang, Justin Cui, Yifan Simon Liu, Qianfeng Wen, Mark Zhao, Scott Sanner. 9884-9898 [doi]
- Reasoning-Based Refinement of Unsupervised Text Clusters with LLMsTunazzina Islam. 9899-9917 [doi]
- Self-Evolving Multi-Agent Systems via Textual BackpropagationXiaowen Ma, Yunpu Ma, Chenyang Lin, Sikuan Yan, Jinhe Bi, Zixuan Cao, Yijun Tian 0001, Volker Tresp, Hinrich Schütze. 9918-9951 [doi]
- Confidence over Time: Confidence Calibration with Temporal Logic for Large Language Model ReasoningZhenjiang Mao, Anirudhh Venkat, Artem Bisliouk, Sindhura Kumbakonam Subramanian, Akshat Kothiyal, Saithej Singhu, Ivan Ruchkin. 9952-9976 [doi]
- Automated Profile Inference with Language Model AgentsYuntao Du 0002, Zitao Li, Bolin Ding, Yaliang Li, Hanshen Xiao, Jingren Zhou 0001, Ninghui Li 0001. 9977-10000 [doi]
- When Debiasing Backfires: Counterintuitive Side Effects of Preprocessing-Based Stereotype MitigationYahan Zheng, John J. Guerrerio, Soroush Vosoughi, Weicheng Ma. 10001-10021 [doi]
- Scaling Laws for Code: Every Programming Language MattersJian Yang, Shuyue Guo, Linzheng Chai, Wei Zhang, Aishan Liu, Chuan-Hao, Zhoujun Li 0001, Xin Zhao, Xianglong Liu 0001, Weifeng Lv, Bryan Dai. 10022-10032 [doi]
- Beyond the Singular: Revealing the Value of Multiple Generations in Benchmark EvaluationWenbo Zhang, Hengrui Cai, Wenyu Chen. 10033-10043 [doi]
- Safety Is Not Universal: The Selective Safety Trap in LLM AlignmentIago Alves Brito, Walcy Santos Rezende Rios, Julia Soares Dollis, Diogo Fernandes Costa Silva, Arlindo Rodrigues Galvão Filho. 10044-10065 [doi]
- LLM Prompt Duel Optimizer: Efficient Label-Free Prompt OptimizationYuanchen Wu, Saurabh Verma, Justin Lee, Fangzhou Xiong, Poppy Zhang, Amel Awadelkarim, Xu Chen, Yubai Yuan, Shawndra Hill. 10066-10089 [doi]
- FrameNet-Cultures: A Benchmark for Evaluating LLMs via Cross-Cultural Frame SemanticsNeda Jamshidi, Anders Søgaard, Monica Bianchini. 10090-10131 [doi]
- Meta-Tool: Efficient Few-Shot Tool Adaptation for Small Language ModelsSachin Kumar. 10132-10147 [doi]
- Toward A Digital Twin of U.S. CongressHayden S. Helm, Tianyi Chen, Harvey McGuinness, Paige Lee, Brandon Duderstadt, Carey E. Priebe. 10148-10160 [doi]
- OjaKV: Context-Aware Online Low-Rank KV Cache CompressionYuxuan Zhu 0004, David H. Yang, Mohammad Mohammadi Amiri, Keerthiram Murugesan, Tejaswini Pedapati, Pin-Yu Chen. 10161-10178 [doi]
- AURORA: Neuro-Symbolic Continual Indexing for Evolving RAG SystemsManoj Saravanan, Rohit Kumar Salla, Ramya Manasa Amancherla. 10179-10195 [doi]
- Decide less, communicate more: On the construct validity of end-to-end fact-checking in medicineSebastian Antony Joseph, Lily Chen, Barry Wei, Michael Mackert, Iain James Marshall, Paul Pu Liang, Ramez Kouzy, Byron C. Wallace, Junyi Jessy Li. 10196-10221 [doi]
- K-GIP: Diagnosing Logical Fractures in Large Vision-Language Models via Verification Scene Graphs and Sequential PruningYujun Hu, Xiaoyu Zhou, Changbo Wang, Gaoqi He. 10222-10236 [doi]
- From Static Inference to Dynamic Interaction: A Survey of Streaming Large Language ModelsJunlong Tong, Zilong Wang, Yujie Ren, Peiran Yin, Hao Wu, Wei Zhang, Xiaoyu Shen 0001. 10237-10263 [doi]
- How Adversarial Environments Mislead Agentic AI?Zhonghao Zhan, Huichi Zhou, Zhenhao Li, Peiyuan Jing, Krinos Li, Hamed Haddadi 0001. 10264-10280 [doi]
- GALA: Geometric Data Selection with Strategic Prospecting for Large Language Model Self-trainingZhongwei Xie, Ruihao Liao, Zimo Wang, Chong Chen, Xian-Sheng Hua 0001, Xiao Luo 0001. 10281-10293 [doi]
- PII-VisBench: Evaluating Personally Identifiable Information Safety in Vision Language Models Along a Continuum of VisibilityG. M. Shahariar, Zabir Al Nazi, Md. Olid Hasan Bhuiyan, Zhouxing Shi. 10294-10316 [doi]
- Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language ModelsHengyuan Zhang, Zhihao Zhang 0002, Ercong Nie, Mingyang Wang 0003, Zunhai Su, Yiwei Wang, Qianli Wang, Shuzhou Yuan, Xufeng Duan, Qibo Xue, Zeping Yu, Chenming Shang, Xiao Liang, Jing Xiong, Hui Shen 0008, Chaofan Tao, Zhengwu Liu, Senjie Jin, Zhiheng Xi, DongDong Zhang, Sophia Ananiadou, Tao Gui, Ruobing Xie, Hayden Kwok-Hay So, Hinrich Schütze, Xuanjing Huang 0001, Qi Zhang 0001, Ngai Wong 0001. 10317-10362 [doi]
- MTRAG-UN: A Benchmark for Open Challenges in Multi-Turn RAG ConversationsSara Rosenthal, Yannis Katsis, Vraj Shah, Lihong He 0001, Lucian Popa 0001, Marina Danilevsky. 10363-10369 [doi]
- Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation CuesZory Zhang, Pinyuan Feng, Bingyang Wang, Tianwei Zhao, Suyang Yu, Qingying Gao, Hokin Deng, Ziqiao Ma 0001, Yijiang Li, Dezhi Luo. 10370-10389 [doi]
- RepoShapley: Shapley-Enhanced Context Filtering for Repository-Level Code CompletionYu Huo, Kun Zeng, Siyu Zhang, Yuquan Lu, Cheng Yang, Yifu Guo, Xiaoying Tang. 10390-10412 [doi]
- Red-Teaming NSFW Image Classifiers as Text-to-Image SafeguardsTinghao Xie, Yueqi Xie, Alireza Zareian, Shuming Hu, Felix Juefei-Xu, Xiaowen Lin, Ankit Jain, Prateek Mittal, Li Chen. 10413-10441 [doi]
- Model-Agnostic Meta Learning for Class Imbalance AdaptationHanshu Rao, Guangzeng Han, Xiaolei Huang 0002. 10442-10456 [doi]
- PAPERMIND: Benchmarking Agentic Reasoning and Critique over Scientific Papers in Multimodal LLMsYanjun Zhao, Tianxin Wei, Jiaru Zou, Xuying Ning, Yuanchen Bei, Lingjie Chen, Simmi Rana, Wendy H. Yang, Hanghang Tong, Jingrui He. 10457-10474 [doi]
- From Scenes to Elements: Multi-Granularity Evidence Retrieval for Verifiable Multimodal RAGGuanhua Chen 0006, Chuyue Huang, Yutong Yao, Shudong Liu 0004, Xueqing Song, Lidia S. Chao, Derek F. Wong. 10475-10491 [doi]
- Region-R1: Reinforcing Query-Side Region Cropping for Multi-Modal Re-RankingChan-Wei Hu, Zhengzhong Tu. 10492-10505 [doi]
- A Reward-Guided Dual-Phase Framework for Adaptive Inference-Time ReasoningYingqian Cui, Zhenwei Dai, Pengfei He, Bing He 0002, Hui Liu 0033, Zhan Shi, Xianfeng Tang, Jingying Zeng, Suhang Wang, Yue Xing 0002, Jiliang Tang, Benoit Dumoulin. 10506-10531 [doi]
- LVLM-Aware Multimodal Retrieval for RAG-Based Medical Diagnosis with General-Purpose ModelsNir Mazor, Tom Hope. 10532-10553 [doi]
- Detecting Proxy Gaming in RL and LLM Alignment via Evaluator Stress TestsSanjeda Akter, Ibne Farabi Shihab, Anuj Sharma 0001. 10554-10583 [doi]
- Do Language Models Think Consistently? A Study of Value Preferences Across Varying Response LengthsInderjeet Jayakumar Nair, Lu Wang. 10584-10613 [doi]
- LEDGER: Scaling Agentic Document Editing with Dependency-aware Graph RetrievalHang Wang, Utkarsh Garg, Reza Davari, Huitian Jiao, Hao Cheng, Baolin Peng, Si-Qing Chen, Tao Ge 0001. 10614-10644 [doi]
- NSF-CoT: Neuro-Symbolic Formal Verification of Chain-of-Thought Faithfulness in Contextual Question AnsweringVishal Pramanik, Maisha Maliha, Nathaniel D. Bastian, Alvaro Velasquez, Susmit Jha, Sumit Kumar Jha 0001. 10645-10663 [doi]
- Learning Flexible Large Multimodal Models with Arbitrary Modality CombinationsXinyu Zhao, Kangqi Ni, Jie Peng 0002, Ang Li, Tianlong Chen 0001. 10664-10678 [doi]
- 1,729 vs. 1729: The Effect of Scripts and Formats on LLM NumeracyVarshini Reddy, Craig W. Schmidt, Seth Ebner, Adam Wiemerslage, Yuval Pinter, Chris Tanner. 10679-10696 [doi]
- SimpleOCR: Rendering Visual Questions to Teach MLLMs to ReadYibo Peng, Peng Xia 0005, Ding Zhong, Kaide Zeng, Siwei Han, Yiyang Zhou, Jiaqi Liu, Ruiyi Zhang, Huaxiu Yao. 10697-10710 [doi]
- Beyond Facts- Benchmarking Distributional Reading Comprehension in Large Language ModelsPei-Fu Guo, Ya-An Tsai, Chun-Chia Hsu, Kai-Xin Chen, Yun-Da Tsai, Kai-Wei Chang 0001, Nanyun Peng 0001, Mi-Yen Yeh, Shou-de Lin. 10711-10728 [doi]
- Preference Learning Unlocks LLMs' Psycho-Counseling SkillsMian Zhang, Shaun M. Eack, Zhiyu Chen 0004. 10729-10750 [doi]
- Large Language Models Can Help Mitigate Barren Plateaus in Quantum Neural NetworksJun Zhuang 0004, Chaowen Guan. 10751-10767 [doi]
- Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise WorkflowsHaoyu Dong, Pengkun Zhang, Yan Gao, Xuanyu Dong, Yilin Cheng, Mingzhe Lu, Adina Yakefu, Shuxin Zheng. 10768-10794 [doi]
- Exploiting Tree Structure for Credit Assignment in Reinforcement Learning with Large Language ModelsHieu Tran, Zonghai Yao, Hong Yu 0001. 10795-10810 [doi]
- Demystify the Role of Memory in Machine Learning Engineering AgentsXinyu Zhao, Junpeng Wang 0001, Yuzhong Che 0004n, Menghai Pan, Chin-Chia Michael Yeh, Jiarui Sun 0001, Yan Zheng 0001, Mahashweta Das, Tianlong Chen. 10811-10826 [doi]
- Characterizing Web Search in The Age of Generative AIElisabeth Kirsten, Jost Große Perdekamp, Qinyuan Wu, Mihir Upadhyay, Krishna P. Gummadi, Muhammad Bilal Zafar. 10827-10848 [doi]
- HypEHR: Hyperbolic Modeling of Electronic Health Records for Efficient Question AnsweringYuyu Liu, Sarang Rajendra Patil, Mengjia Xu, Tengfei Ma. 10849-10862 [doi]
- What Users Leave Unsaid: Under-Specified Queries Limit Vision-Language ModelsDasol Choi, Guijin Son, Hanwool Lee, MinHyuk Kim, Hyunwoo Ko, Teabin Lim, Eungyeol Ahn, Jungwhan Kim, Seunghyeok Hong, Youngsook Song. 10863-10886 [doi]
- Selective Steering: Norm-Preserving Control Through Discriminative Layer SelectionQuy-Anh Dang, Chris Ngo. 10887-10910 [doi]
- From Bytes to Subwords: Challenges of Input Representations in NLPRob van der Goot. 10911-10919 [doi]
- The Learnability of Model-Theoretic Interpretation Functions in Artificial Neural NetworksAdrian Brasoveanu 0001, Jakub Dotlacil. 10920-10949 [doi]
- A Mechanistic Perspective and Difficulty Metric for UnlearningJiali Cheng, Ziheng Chen 0002, Chirag Agarwal, Hadi Amiri. 10950-10964 [doi]
- UCS: Estimating Unseen Coverage for Improved In-Context LearningJiayi Xin, Xiang Li, Evan Qiang, Weiqing He, Tianqi Shang, Weijie J. Su, Qi Long. 10965-10981 [doi]
- Talent or Luck? Evaluating Attribution Bias in Large Language ModelsChahat Raj, Mahika Banerjee, Jinhao Pan, Aylin Caliskan, Antonios Anastasopoulos, Ziwei Zhu 0001. 10982-11014 [doi]
- Uncertainty Quantification of Large Language Models through Multiple Uncertainty SourcesTiejin Chen, Xiaoou Liu, Longchao Da, Jia Chen 0002, Evangelos E. Papalexakis, Hua Wei 0001. 11015-11029 [doi]
- Dual Hierarchical Dialogue Policy Learning for Legal Inquisitive Conversational AgentsXubo Lin, Zezhi Deng, Shihao Wang, Grace Hui Yang, Yang Deng. 11030-11047 [doi]
- [b] = [d] - [t] + [p]: Self-supervised Speech Models Discover Phonological Vector ArithmeticKwangHee Choi, Eunjung Yeo, Cheol Jun Cho, David Harwath, David R. Mortensen. 11048-11069 [doi]
- Waking Up Blind: Cold-Start Optimization of Supervision-Free Agentic Trajectories for Grounded Visual PerceptionAshutosh Bajpai, Tamal Majumder, Akshay Uttama Nambi, Tanmoy Chakraborty 0002. 11070-11093 [doi]
- Spatial-RAG: Spatial Retrieval Augmented Generation for Real-World Geospatial Reasoning QuestionsDazhou Yu, Riyang Bao, Ruiyu Ning, Jinghong Peng, Gengchen Mai, Liang Zhao 0002. 11094-11112 [doi]
- Program Structure-aware Language Models: Targeted Software Testing beyond Textual SemanticsKhang Tran, Khoa Nguyen, Cristian Borcea, Hai Phan. 11113-11126 [doi]
- Reasoning for Hierarchical Text Classification: The Case of PatentsLekang Jiang, Wenjun Sun, Stefan Goetz. 11127-11142 [doi]
- From Shijing to English and German: Resources and Evaluation for LLM Translation of Early Chinese PoetryYing Jiao, Meng Sun. 11143-11162 [doi]
- One Mask to Rule Them All: On Hidden Facts after Editing and How to Find ThemAli Kholmovaia, Paul Youssef, Nandi Schoots, Christin Seifert. 11163-11181 [doi]
- Analysing the Safety Pitfalls of Steering VectorsYuxiao Li, Alina Fastowski, Efstratios Zaradoukas, Bardh Prenkaj, Gjergji Kasneci. 11182-11204 [doi]
- Compartmentalised Agentic Reasoning for Clinical NLIMaël Jullien, André Freitas, Marco Valentino, Lei Xu. 11205-11233 [doi]
- RAG or Learning? Understanding the Limits of LLM Adaptation under Continuous Knowledge Drift in the Real WorldHanbing Liu, Lang Cao, Yang Li. 11234-11252 [doi]
- Content Fuzzing for Escaping Information Cocoons on Digital Social MediaYifeng He, Ziye Tang, Hao Chen. 11253-11271 [doi]
- KnowledgeBerg: Evaluating Systematic Knowledge Coverage and Compositional Reasoning in Large Language ModelsXiao Zhang 0052, Qianru Meng, Yongjian Chen, Yumeng Wang, Johan Bos. 11272-11286 [doi]
- Hybrid Self-evolving Structured Memory for Computer-Use AgentsSibo Zhu, Wenyi Wu, Kun Zhou 0002, Stephen Wang, Biwei Huang. 11287-11304 [doi]
- Characterizing Selective Refusal Bias in Large Language ModelsAdel Khorramrouz, Sharon Levy. 11305-11326 [doi]
- Infusing Theory of Mind into Socially Intelligent LLM AgentsEunJeong Hwang, Yuwei Yin, Giuseppe Carenini, Peter West, Vered Shwartz. 11327-11360 [doi]
- Do BabyLMs Wanna Learn Wanna Contraction? On the Learnability without Language-Specific BiasKangsan Noh, Sanghoun Song. 11361-11372 [doi]
- OpenGenAlign: A Preference Dataset and Benchmark for Trustworthy Reward Modeling in Open-Ended, Long-Context GenerationHanning Zhang, Juntong Song, Juno Zhu, Yuanhao Wu, Tong Zhang, Cheng Niu. 11373-11392 [doi]
- Understanding LLMs' summarization capabilities: an analysis of biomedical abstract and lay summary generationBatuhan Nursal, Cassie S. Mitchell. 11393-11417 [doi]
- FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text GenerationLiqiang Jing, Viet Dac Lai, Seunghyun Yoon 0002, Trung Bui, Xinya Du. 11418-11456 [doi]
- RLHS: Mitigating Misalignment in RLHF with Hindsight SimulationKaiqu Liang, Haimin Hu, Ryan Liu 0001, Thomas L. Griffiths 0001, Jaime Fernández Fisac. 11457-11483 [doi]
- Propaganda Signals in LLMs: Perspectival Divergence and Narrative Framing in the Russia-Ukraine WarOfir Shabat, Ido Guy, Kira Radinsky. 11484-11501 [doi]
- DELTA: Dynamic Layer-Aware Token Attention for Efficient Long-Context ReasoningHossein Entezari Zarch, Lei Gao, Chaoyi Jiang, Murali Annavaram. 11502-11518 [doi]
- LANTERN in the Event Stream: Training-Free Temporal Knowledge Graph Forecasting by Balancing Inertia and ShiftsChengyuan Jin, Ao Chang, Daojian Zeng, Wenhao Teng, Xiangwen Liao, Kang Liu 0001, Jun Zhao 0001, Yubo Chen 0001. 11519-11533 [doi]
- Large Language Models for IT Automation Tasks: Are We There Yet?Md. Mahadi Hassan, John Salvador, Akond Ashfaque Ur Rahman, Santu Karmaker. 11534-11573 [doi]
- Follow the Path: Reasoning over Knowledge Graph Paths to Improve Large Language Model FactualityMike Zhang, Johannes Bjerva, Russa Biswas. 11574-11590 [doi]
- Time-RA: Towards Time Series Reasoning for Anomaly Diagnosis with LLM FeedbackYiyuan Yang, Zichuan Liu, Lei Song, Kai Ying, Stephen Wang, Joshua Thomas Bamford, Svitlana Vyetrenko, Jiang Bian, Qingsong Wen. 11591-11616 [doi]
- Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity IdentificationQian Ma, Qiong Wu 0008, Zhengyi Zhou, Yao Ma 0001. 11617-11635 [doi]
- Non-invasive electromyographic speech neuroprosthesis: a geometric perspectiveHarshavardhana T. Gowda, Lee M. Miller. 11636-11650 [doi]
- Context Attribution with Multi-Armed Bandit OptimizationDeng Pan, Keerthiram Murugesan, Ting Hua, Nuno Moniz, Nitesh V. Chawla. 11651-11662 [doi]
- Peering Behind the Shield: Guardrail Identification in Large Language ModelsZiqing Yang 0002, Yixin Wu 0001, Rui Wen 0002, Michael Backes 0001, Yang Zhang. 11663-11676 [doi]
- WildSci: Advancing Scientific Reasoning from In-the-Wild LiteratureTengxiao Liu, Deepak Nathani, Zekun Li 0001, Kevin Yang, William Yang Wang. 11677-11695 [doi]
- WebDART: Dynamic Decomposition and Re-planning for Complex Web TasksJingbo Yang, Bairu Hou, Wei Wei 0019, Shiyu Chang, Yujia Bao. 11696-11715 [doi]
- Like a Therapist, But Not: Reddit Narratives of AI in Mental Health ContextsElham Aghakhani, Rezvaneh Rezapour. 11716-11736 [doi]
- VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and ExtrapolationPuyuan Peng, Zhisheng Zheng, Shang-wen Li 0001, Abdelrahman Mohamed, David Harwath. 11737-11754 [doi]
- Evaluating Implicit Biases in LLM Reasoning through Logic Grid PuzzlesFatima Jahara, Mark Dredze, Sharon Levy. 11755-11780 [doi]
- InferPilot: Autonomous Inference Attacks Against ML Services With LLM-Based AgentsYixin Wu, Rui Wen 0002, Chi Cui, Michael Backes 0001, Yang Zhang 0016. 11781-11801 [doi]
- MedErrBench: A Fine-Grained Multilingual Benchmark for Medical Error Detection and Correction with Clinical Expert AnnotationsCongbo Ma, Yichun Zhang, Yousef Al-Jazzazi, Ahamed Foisal, Laasya Sharma, Yousra Sadqi, Khaled Saleh, Jihad Mallat, Farah E. Shamout. 11802-11827 [doi]
- MetaScale: Test-Time Scaling with Evolving Meta-ThoughtsQin Liu 0010, Wenxuan Zhou 0002, Nan Xu 0014, James Y. Huang, Fei Wang, Sheng Zhang 0012, Hoifung Poon, Muhao Chen 0001. 11828-11842 [doi]
- Arab Voices: Mapping Standard and Dialectal Arabic Speech TechnologyPeter Sullivan, AbdelRahim A. Elmadany, Alcides Alcoba Inciarte, Muhammad Abdul-Mageed. 11843-11878 [doi]
- CoDA: Restoring Contextual Dominance via Copy-Encouraged Attention Intervention for Mitigating RAG HallucinationsJinwei Shi, Qizhuo Xie, Qianzi Hou, Zhipeng Wang, Wanting Su, Jianhua Zhao, Tao Zheng 0005, Tieke He. 11879-11892 [doi]
- CausalDetox: Causal Head Selection and Intervention for Language Model DetoxificationYian Wang, Yuen Chen, Agam Goyal, Hari Sundaram. 11893-11914 [doi]
- Commonsense Knowledge with Negation: A Resource to Enhance Negation UnderstandingZijie Wang, MohammadHossein Rezaei, Farzana Rashid, Eduardo Blanco 0002. 11915-11934 [doi]
- P-QuASAR: A Unified Probabilistic Framework for Holistic Patent Quality Assessment and RefinementXinyuan Song 0002, Ziyi Ni, Fred Yang, Bo Zhang, Yijin Wang, Jane Zhang. 11935-11951 [doi]
- From Heard to Lived Opinions: Simulating Opinion Dynamics with Grounded LLM Agents in Economic EnvironmentsRyuji Hashimoto, Masahiro Kaneko, Ryosuke Takata, Takehiro Takayanagi, Kiyoshi Izumi. 11952-11964 [doi]
- HiSA: Hierarchical State Abstraction for Scalable GUI AgentsWeiming Li, Hye-Young Paik, Yulei Sui. 11965-11985 [doi]
- SecureWebArena: A Holistic Security Evaluation Benchmark for LVLM-based Web AgentsZonghao Ying, Yangguang Shao, Jianle Gan, Gan Xu, Wenxin Zhang 0005, Quanchen Zou, Junzheng Shi, Zhenfei Yin, Mingchuan Zhang, Aishan Liu, Xianglong Liu 0001. 11986-11998 [doi]
- The Mechanics of Interference: Defusing Distractors in RAG via Sparse Autoencoder InterventionsChristian Giannetti, Giovanni Trappolini, Nicola Tonellotto, Fabrizio Silvestri, Pietro Lio. 11999-12007 [doi]
- Grounding Agent Memory in Contextual IntentRuozhen Yang, Yucheng Jiang, Yueqi Jiang, Priyanka Kargupta, Yunyi Zhang 0001, Jiawei Han 0001. 12008-12042 [doi]
- Persona-Assigned Large Language Models Exhibit Human-Like Motivated ReasoningSaloni Dash, Amélie Reymond, Emma S. Spiro, Aylin Caliskan. 12043-12069 [doi]
- Generalizable LLM Learning of Graph Synthetic Data with Post-training AlignmentYizhuo Zhang 0001, Heng Wang 0008, Shangbin Feng, Zhaoxuan Tan, Xinyun Liu, Yulia Tsvetkov. 12070-12091 [doi]
- Distilling the Essence: Efficient Reasoning Distillation via Sequence TruncationWei-Rui Chen, Vignesh Kothapalli, Ata Fatahi Baarzi, Hejian Sang, Shao Tang, Qingquan Song, Zhipeng Wang, Muhammad Abdul-Mageed. 12092-12122 [doi]
- Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language ModelsHanqi Yan, Xiangxiang Cui, Lu Yin, Jindong Gu, Paul Pu Liang, Yulan He 0001, Yifei Wang. 12123-12138 [doi]
- Data Swarms: Optimizable Generation of Synthetic Evaluation DataShangbin Feng, Yike Wang 0002, Weijia Shi, Yulia Tsvetkov. 12139-12157 [doi]
- Concept rather than Document: Context Compression via AMR-based Conceptual EntropyKaize Shi, Xueyao Sun, Xiaohui Tao 0001, Lin Li 0001, Qika Lin, Guandong Xu. 12158-12173 [doi]
- Can LLMs Understand the Impact of Trauma? Costs and Benefits of LLMs Coding the Interviews of Firearm Violence SurvivorsJessica H. Zhu, Shayla Stringfield, Vahe Zaprosyan, Michael Wagner, Michel Cukier, Joseph Richardson Jr.. 12174-12192 [doi]
- "I Don't Know What to Say": A Fact-Filling Questionnaire Method to Help Non-Experts Talk to LegalAI AssistantYuting Huang, Yiquan Wu 0001, Meitong Guo, Ang Li 0049, Xiaozhong Liu 0001, Keting Yin, Fei Wu 0001, Kun Kuang 0001. 12193-12210 [doi]
- BnMMLU: Measuring Massive Multitask Language Understanding in BengaliSaman Sarker Joy, Swakkhar Shatabda. 12211-12230 [doi]
- Diagnosing LLMs via Information Spectrum Analysis: Tail Behavior and the Effects of Side InformationYuuki Tachioka. 12231-12253 [doi]
- Scaling Collaborative Effort with AgentsShannon Zejiang Shen, Valerie Chen, Ken Gu, Alexis Ross, Zixian Ma, Jillian Ross, Alex Gu, Chenglei Si, Wayne Chi, Andi Peng, Jocelyn J. Shen, Ameet Talwalkar, Tongshuang Wu, David A. Sontag. 12254-12271 [doi]
- CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective CriticYaocheng Zhang, Haohuan Huang, Zijun Song, Zijie Zhao, Qichao Zhang, Yuanheng Zhu, Dongbin Zhao. 12272-12290 [doi]
- Double-Edged Sword or Sharp Tool? Designing and Evaluating Triadic LLM-Teacher Collaboration for K-12 Writing at ScaleCanran Wang, Yuwen Yang, Zhen Wang, Ming Ma, Ding Yu, Chentai Wang, Keman Huang, Xiaoyong Du 0001. 12291-12312 [doi]
- IntroLM: Introspective Language Models via Prefilling-Time Self-EvaluationHossein Hosseini Kasnavieh, Gholamreza Haffari, Christopher Leckie, Adel Nadjaran Toosi. 12313-12326 [doi]
- A Herd of Language Models Makes a Better Zero-shot Annotator for Clinical Named Entity RecognitionSeiji Shimizu, Shoko Wakamiya, Eiji Aramaki. 12327-12344 [doi]
- P2P: A Poison-to-Poison Remedy for Reliable Backdoor Defense in LLMsShuai Zhao 0007, Xinyi Wu, Shiqian Zhao, Xiaobao Wu, Zhongliang Guo 0001, Yanhao Jia, Anh Tuan Luu. 12345-12360 [doi]
- Learning Temporally-Aware Sample Weights for Preference OptimizationMengyang Li 0001, Xudong Zhou, Pinlong Zhao. 12361-12377 [doi]
- ToolPRMBench: Evaluating and Advancing Process Reward Models for Tool-using AgentsDawei Li 0008, Yuguang Yao, Zhen Tan 0001, Huan Liu 0001, Ruocheng Guo. 12378-12391 [doi]
- Adapt to Thrive! Adaptive Power-Mean Policy Optimization for Improved LLM ReasoningYiming Huang 0001, Zhenbo Shi, Shuzheng Gao, Cuiyun Gao 0001, Peiyi Han, Chuanyi Liu. 12392-12419 [doi]
- LEAF: Towards Lightweight Explainable Hateful Video Detection via Self-Grounding CoT Guided Stage-Wise DistillationJian Lang, Rongpei Hong, Meihui Zhong, Kaiju Li, Ting Zhong, Qiang Gao 0003, Fan Zhou 0002. 12420-12438 [doi]
- DemMA: Dementia Multi-Turn Dialogue Agent with Expert-Guided Reasoning and Action SimulationYutong Song, Jiang Wu, Kazi Shaharair Sharif, Pengfei Zhang, Wenjun Huang, Honghui Xu, Nikil D. Dutt, Amir M. Rahmani. 12439-12470 [doi]
- SplitThenMerge: Token-Level Skill-Compositional Sparse Mixture-of-Experts for Complex Domain-Specific TasksYuting Huang, Jiawen Zhang 0005, Yiquan Wu 0001, Yinghao Hu 0001, Fei Wu, Kun Kuang 0001. 12471-12483 [doi]
- Causal-Audit: Explicit and Auditable Graph-based Reasoning via Target-Aware Causal Chain ConstructionSu-Lan, Xuefei Yin, Yanming Zhu 0001, Alan Wee-Chung Liew. 12484-12500 [doi]
- RADS: Reinforcement Learning-Based Sample Selection Improves Transfer Learning in Low-resource and Imbalanced Clinical SettingsWei Han, David Martinez Iraola, Anna Khanina, Lawrence Cavedon, Karin Verspoor. 12501-12516 [doi]
- Watch Out Your Industrial Copilots: Stealthy Backdoor Attack Against LLM-Based PLC Code GenerationXinyuan An, Xiaoxia Liu, Dongxia Wang 0002, Zhanhang Xiong, Wenhai Wang. 12517-12536 [doi]
- Balancing Classification and Calibration Performance in Decision-Making LLMs via Calibration Aware Reinforcement LearningDuygu Nur Yaldiz, Evangelia Spiliopoulou, Zheng Qi, Siddharth Varia, Srikanth Doss, Nikolaos Pappas 0004. 12537-12553 [doi]
- Redefining Machine Simultaneous Interpretation: From Incremental Translation to Human-Like StrategiesQianen Zhang, Zeyu Yang, Satoshi Nakamura. 12554-12577 [doi]
- ChunQiuTR: Time-Keyed Temporal Retrieval in Classical Chinese AnnalsYihao Wang, Zijian He, Jie Ren, Keze Wang. 12578-12601 [doi]
- OFFSIDE: Benchmarking Unlearning Misinformation in Multimodal Large Language ModelsHao Zheng, Zirui Pang, Ling Li, Zhijie Deng, Yuhan Pu, Zhaowei Zhu, Xiaobo Xia, Jiaheng Wei. 12602-12620 [doi]
- PedagogyBench: A Cognitive-Driven Benchmark for Multimodal Instructional Video UnderstandingXiaokang Jin, Jia Zhu 0003, Jingjiang Liu, YaBing Shi, Jueqi Guan, Hao Chen, Pasquale De Meo. 12621-12647 [doi]
- FeedEval: Pedagogically Aligned Evaluation of LLM-Generated Essay FeedbackSeongYeub Chu, Jongwoo Kim, Mun Yong Yi. 12648-12674 [doi]
- Probing Multimodal Large Language Models on Cognitive Biases in Chinese Short-Video MisinformationJen-tse Huang 0001, Chang Chen, Shiyang Lai, Wenxuan Wang 0001, Michelle R. Kaufman, Mark Dredze. 12675-12696 [doi]
- Emotion-Cause Pair Extraction in Conversations via Semantic Decoupling and AlignmentTianxiang Ma, Weijie Feng, Xinyu Wang, Zhiyong Cheng 0008. 12697-12711 [doi]
- Failure makes the agent stronger: Enhancing Accuracy through Structured Reflection for Reliable Tool InteractionsJunhao Su, Yuanliang Wan, Junwei Yang, Hengyu Shi, Tianyang Han, Yurui Qiu, Junfeng Luo. 12712-12734 [doi]
- Feedback to Reasoning: LLM-Assisted Molecular Optimization with Domain Feedback and Historical ReasoningWenhan Gao, Xiran Fan, Chin-Chia Michael Yeh, Jiarui Sun 0001, Yuzhong Chen 0004, Menghai Pan, Mahashweta Das, Yi Liu. 12735-12754 [doi]
- Iterative Formalization and Planning in Partially Observable EnvironmentsLiancheng Gong, Wang Bill Zhu, Jesse Thomason, Li Zhang. 12755-12783 [doi]
- StructKV: Preserving the Structural Skeleton for Scalable Long-Context InferenceZhirui Chen, Peiyang Liu, Ling Shao 0003. 12784-12797 [doi]
- Correct, Concise and Complete: Multi-stage Training For Adaptive ReasoningNathanaël Carraz Rakotonirina, Ren Pang, Neha Anna John, Michael Bohlke-Schneider, Momchil Hardalov. 12798-12810 [doi]
- At Your Own PACE: A Causal Framework for Evaluating EQ in LLMsLei Lyu, Shengling Wang 0001, Ke Chao, Yichao Wei. 12811-12826 [doi]
- Identifying Collective Intelligence Factor in LLM Agent Groups for Generalizable Multi-Agent System DesignZhilun Zhou, Zihan Liu, Jiahe Liu, Yihan Wang, Qingyu Shao, Fengli Xu, Depeng Jin, Yong Li. 12827-12842 [doi]
- Rethinking Parameter Sharing for LLM Fine-Tuning with Multiple LoRAsHao Ban, Kaiyi Ji. 12843-12863 [doi]
- Shorten After You're Right: Lazy Length Penalties for Reasoning RLDanlong Yuan, Tian Xie, Shaohan Huang, Huishuai Zhang, Zhuocheng Gong, Chong Luo, Furu Wei, Dongyan Zhao 0001. 12864-12877 [doi]
- MedDCR: Learning to Design Agentic Workflows for Medical CodingJiyang Zheng, Islam Nassar, Thanh Vu, Xu Zhong, Yang Lin, Tongliang Liu, Long Duong, Yuan-Fang Li. 12878-12893 [doi]
- TokenPenalty: Alleviating Attention Sinks and Positional Decay in LVLMsXiaofeng Zhang 0006, Yuanchao Zhu, Qiyan Zhao, Xiaosong Yuan, Jiawei Cao, Xuhang Chen 0002. 12894-12906 [doi]
- Beyond Screenshots: Evaluating VLMs' Understanding of UI AnimationsChen Liang, Xirui Jiang, Naihao Deng, Eytan Adar, Anhong Guo. 12907-12927 [doi]
- MemWeaver: Weaving Hybrid Memories for Traceable Long-Horizon Agentic ReasoningJuexiang Ye, Xue Li 0011, Xinyu Yang, Chengkai Huang, Lanshun Nie, Lina Yao, Dechen Zhan. 12928-12956 [doi]
- From Mimesis to Metamorphosis: Evolving VLM Judges via In-Context Comparing and Knowledge InternalizationJuntuo Wang, Yuming Qiao, Yifan Yang, Lunxi Yuan, Liang Luo, Dan Meng 0001. 12957-12971 [doi]
- Generative Text-to-Image Retrieval via Hierarchical Identifiers and Semantic InternalizationJie Huang, Junjie Wang, Xin Liao, Ziyou Jiang, Wenshuo Wang, Shoubin Li, Qing Wang. 12972-12986 [doi]
- Bridging Reasoning and Action: Hybrid LLM-RL Framework for Efficient Cross-Domain Task-Oriented DialogueYangyang Zhao, Linfan Dai, Li Cai, Bowen Xing, Libo Qin 0001. 12987-13003 [doi]
- JudgeAgent: Beyond Static Benchmarks for Knowledge-Driven and Dynamic LLM EvaluationZhichao Shi 0001, Xuhui Jiang, Chengjin Xu, Cangli Yao, Shengjie Ma, Yinghan Shen, Zixuan Li 0001, Jian Guo 0016, Yuanzhuo Wang. 13004-13030 [doi]
- Retrieve Only Relevant Tables Whether Few or Many: Adaptive Table Retrieval MethodTaehee Kim, Seungbin Yang, Jihwan Kim, Jaegul Choo. 13031-13054 [doi]
- Code-Switching Information Retrieval: Benchmarks, Analysis, and the Limits of Current RetrieversQingcheng Zeng, Yuheng Lu, Zeqi Zhou, Heli Qi, Puxuan Yu, Fuheng Zhao, Hitomi Yanaka, Weihao Xuan, Naoto Yokoya. 13055-13071 [doi]
- WebUncertainty: Dual-Level Uncertainty Driven Planning and Reasoning For Autonomous Web AgentLingFeng Zhang, Yongan Sun, Jinpeng Hu, Hui Ma, Ying Yang, Kuien Liu, Zenglin Shi, Meng Wang 0001. 13072-13082 [doi]
- Multi-Faceted Self-Consistent Preference Alignment for Query Rewriting in Conversational SearchZhiyu Cao, Peifeng Li 0001, Qiaoming Zhu. 13083-13100 [doi]
- CogNet-KG: Empowering Tutoring Dialogues with a Cognitively-Structured Knowledge Graph for STEM LearningDing Yu, Yu Lu, Tengju Li, Shasha Xiong, Shengquan Yu. 13101-13121 [doi]
- From 128K to 4M: Efficient Training of Ultra-Long Context Large Language ModelsChejian Xu, Wei Ping, Peng Xu 0008, Zihan Liu 0001, Boxin Wang, Mohammad Shoeybi, Bo Li 0026, Bryan Catanzaro. 13122-13133 [doi]
- A Few Bad Apples Spoil the Bunch: Preventing Global Entropy Collapse Driven by a Small Set of Tokens in LLM ReasoningJaeeun Jang, Hansle Lee, Sangmin Kim. 13134-13154 [doi]
- Efficient Training for Cross-lingual Speech Language ModelsYan Zhou, Qingkai Fang, Yun Hong, Yang Feng 0004. 13155-13167 [doi]
- Empirical Analysis of Task Mixture Effects in Small-scale Instruction Tuning: A Statistical ApproachJeesu Jung, Sangkeun Jung. 13168-13186 [doi]
- ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task DecompositionYujie Liu, Zonglin Yang 0001, Tong Xie, Jinjie Ni, Ben Gao, Yuqiang Li, Shixiang Tang, Wanli Ouyang, Erik Cambria, Dongzhan Zhou. 13187-13207 [doi]
- GraphLoRA: Structure-Aware Low-Rank Adaptation for Large Language Model RecommendationLin Mu 0001, Guoji Wang, Li Ni 0001, Lei Sang 0001, Zhize Wu, Peiquan Jin, Yiwen Zhang 0001. 13208-13218 [doi]
- Spotlight and Shadow: Attention-Guided Dual-Anchor Introspective Decoding for MLLM Hallucination MitigationYebo Wu, Han Jin, Zhijiang Guo, Li Li 0064. 13219-13233 [doi]
- StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video UnderstandingJunxi Wang 0001, Te Sun, Jiayi Zhu, Junxian Li, Haowen Xu, Zichen Wen, Xuming Hu, Zhiyu Li, Linfeng Zhang. 13234-13251 [doi]
- Reflective RAG: Self-Evaluation Driven Strategy Optimization in Agentic Retrieval-Augmented GenerationHaiyan Wu, Chenchen Wang, Chaoqun Sun, Chengxiong Lu, Yanhong Chen, Zhiqiang Zhang 0010, Xiaoqing Feng. 13252-13267 [doi]
- Meta-Reasoner: Dynamic Guidance for Optimized Inference-time Reasoning in Large Language ModelsYuan Sui, Yufei He, Tri Cao, Sophia Simeng Han, Yulin Chen, Bryan Hooi. 13268-13286 [doi]
- Polynomial Expansion Rank Adaptation: Enhancing Low-Rank Fine-Tuning with High-Order InteractionsWenhao Zhang, Lin Mu 0001, Li Ni 0001, Peiquan Jin, Yiwen Zhang 0001. 13287-13303 [doi]
- Efficient Test-Time Scaling via Temporal Reasoning AggregationJiakun Li, Xingwei He 0008, Kefan Li, Hongzheng Chai, Hongyue Yu, Yuan Yuan. 13304-13318 [doi]
- A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging TrendsYihao Ding, Siwen Luo, Yue Dai, Yanbei Jiang, Zechuan Li, Qiang Sun 0006, Geoffrey Martin, Wei Liu 0006, Yifan Peng 0002. 13319-13340 [doi]
- Detecting Sensitive Personal Information in Japanese Pre-Training Corpora for Large Language ModelsRei Minamoto, Yusuke Oda, Daisuke Kawahara. 13341-13354 [doi]
- Agentic Episodic ControlXidong Yang, Wenhao Li 0001, Junjie Sheng, Yun Hua, Haosheng Chen, Chuyun Shen, Xiangfeng Wang 0001. 13355-13370 [doi]
- TrajGuard: Streaming Hidden-state Trajectory Detection for Decoding-time Jailbreak DefenseCheng Liu, Xiaolei Liu, Xingyu Li, Bangzhou Xin, Kangyi Ding. 13371-13388 [doi]
- DeepPrune: Parallel Scaling without Inter-trace RedundancyShangqing Tu, Yaxuan Li, Yushi Bai, Lei Hou 0001, Juanzi Li. 13389-13403 [doi]
- Contrastive Decoding Mitigates Score Range Bias in LLM-as-a-JudgeYoshinari Fujinuma. 13404-13418 [doi]
- ContextCheck: Sentence-Level Faithfulness Verification with Context-Aware DisambiguationYueqin Yin, Yaxi Li, Xin Liu, Xun Wang, Kaiqiang Song, Simin Ma, Shujian Liu, Sathish Reddy Indurthi, Haoyun Deng 0002, Pengcheng He, Mingyuan Zhou, Song Wang. 13419-13468 [doi]
- Less Noise, More Voice: Reinforcement Learning for Reasoning via Instruction PurificationYiju Guo, Tianyi Hu, Zexu Sun, Yankai Lin 0001. 13469-13482 [doi]
- MAST: A Multi-View Alignment Strategy for Optimal Transport-Based Contrastive Clustering of Short TextZijian Zheng 0001, Yonghe Lu. 13483-13500 [doi]
- AICA-Bench: Holistically Examining the Capabilities of VLMs in Affective Image Content AnalysisDong She, Xianrong Yao, Liqun Chen, Jinghe Yu, Yang Gao 0025, Zhanpeng Jin. 13501-13528 [doi]
- You Only Need One Single Token to Refine Safety AlignmentWenqian Yu 0001, Shuo Chen, Zhijiang Li, Zhipeng Wang, Jindong Gu. 13529-13545 [doi]
- CrisPrune: Combining Contextual Relevance and Intrinsic Saliency for Efficient Visual Token Pruning in MLLMsZiniu Liu, Shuheng Zhou 0001, Mingqing Liu 0002, Hao Deng 0002, Huijia Zhu. 13546-13564 [doi]
- Beyond Topology: Generative Node Importance Estimation via Structure-Guided Semantic ReasoningKuofei Fang, Siyan Wu, Yu Guo, Bin Wu. 13565-13584 [doi]
- AGTAO: Robust and Stabilized LLM Unlearning via Adversarial Gating Training with Adaptive OrthogonalityPengyu Li, Lingling Zhang, Zhitao Gao 0003, Yanrui Wu, Yuxuan Dong, Huan Liu 0012, Bifan Wei, Jun Liu 0002. 13585-13600 [doi]
- LLMs Meet Isolation Kernel: Lightweight, Learning-free Binary Embeddings for Fast RetrievalZhibo Zhang 0010, Yang Xu, Kai Ming Ting, Cam-Tu Nguyen. 13601-13623 [doi]
- BOLT: Benchmarking Open-World Learning for Text ClassificationChuan Qin 0002, Xi Chen 0073, Jinpeng Li, Hengshu Zhu. 13624-13658 [doi]
- MobileBench-OL: A Comprehensive Chinese Benchmark for Evaluating Mobile GUI Agents in Real-World EnvironmentQinzhuo Wu, Zhizhuo Yang, Hanhao Li, Pengzhi Gao, Wei Liu 0302, Jian Luan 0001. 13659-13693 [doi]
- CondenseFlow: Scalable Latent Space Collaboration via Semantic Compression for Multi-Agent SystemsXiaoyu Chen, Fengge Wu, Junsuo Zhao, Yun Fan. 13694-13712 [doi]
- MAXS: Meta-Adaptive Exploration with LLM AgentsJian Zhang 0087, Zhiyuan Wang, Zhangqi Wang, Yu He, Haoran Luo 0001, Li Yuan, Lingling Zhang 0005, Rui Mao 0010, Qika Lin, Jun Liu 0002. 13713-13731 [doi]
- Leveraging Human and Machine Preferences for Zero-shot Detection of AI-Generated TextLei Jiang, Desheng Wu, Xiaolong Zheng 0001, Cuicui Luo. 13732-13750 [doi]
- MelTrim: Coarse-to-Fine Data Pruning for Speech ClassificationShaobo Wang 0001, Tianle Niu, Xuan Ouyang, Xintong Li, Zhengkun Ge, Yue Min, Xiaoqian Liu, Hankun Wang, Linfeng Zhang 0001. 13751-13765 [doi]
- MINED: Probing and Updating with Multimodal Time-Sensitive Knowledge for Large Multimodal ModelsKailin Jiang, Ning Jiang, Yuntao Du 0001, Yuchen Ren, Yuchen Li, YiFan Gao, Jinhe Bi, Yunpu Ma, Bin Li, Lei Liu, Qing Li 0003. 13766-13795 [doi]
- Beyond Output Confidence: Epistemic-Aware Hallucination Detection with Answer-Level SignalsJieran Li, Xiuyuan Hu, Yang Zhao, Dongbiao Sun, Hao Zhang. 13796-13806 [doi]
- PerfCoder: Large Language Models for Interpretable Code Performance OptimizationJiuding Yang, Shengyao Lu, Hongxuan Liu, Shayan Shirahmad Gale Bagi, Zahra Fazel, Tomasz Czajkowski, Di Niu. 13807-13823 [doi]
- MIPIC: Matryoshka Representation Learning via Self-Distilled Intra-Relational and Progressive Information ChainingPhung Gia Huy, Hai An Vu, Minh-Phuc Truong, Thang Duc Tran, Linh Ngo Van 0001, Thanh Hong Nguyen, Trung Le 0001. 13824-13838 [doi]
- Discovering the Gems in Early Layers: Accelerating Long-Context LLMs with 1000x Input Token ReductionZhenmei Shi, Yifei Ming, Xuan-Phi Nguyen, Yingyu Liang, Shafiq Joty. 13839-13857 [doi]
- Self-Reflection Improves Safety of Large Reasoning ModelsQiang Huang, Wei Zhai, Feng Huang, Dejing Dou. 13858-13874 [doi]
- WildGraphBench: Benchmarking GraphRAG with Wild-Source CorporaPengyu Wang, Benfeng Xu, Licheng Zhang 0002, Shaohan Wang, Mingxuan Du, Chiwei Zhu, Zhendong Mao 0001. 13875-13890 [doi]
- CRPS: Curriculum Replay via Progressive Suffixes from Successful Trajectories for Long-Horizon LLM AgentsZijing Zhang, Xiajie Yang. 13891-13904 [doi]
- D-Artemis: A Deliberative Cognitive Framework for Mobile GUI Multi-AgentsHongze Mi, Yibo Feng, Wenjie Lu, Yuqi Wang, Jinyuan Li, Song Cao, He Cui, Tengfei Tian, Xuelin Zhang, Haotian Luo, Di Sun 0001, Jun Fang, Hua Chai, Naiqiang Tan, Gang Pan 0002. 13905-13931 [doi]
- Temporal Flattening in LLM-Generated Text: Comparing Human and LLM Writing TrajectoriesZhanwei Cao, YeoJin Go, Yifan Hu, Shanu Sushmita. 13932-13956 [doi]
- Beyond Superficial Tests: Adversarial Refinement for Reliable Property-Based TestingXiao Li, Runlin Liu, Zhe Zhang, Xiang Gao 0012, Hailong Sun 0001. 13957-13974 [doi]
- FAITH: Factuality Alignment through Integrating Trustworthiness and HonestnessXiaoning Dong, Chengyan Wu, Yajie Wen, Yu Chen, Yun Xue, Zhang Jing, Wei Xu, Bolei Ma. 13975-13994 [doi]
- DRA-GRPO: Your GRPO Needs to Know Diverse Reasoning Paths for Mathematical ReasoningXiwen Chen, Wenhui Zhu, Peijie Qiu, Xuanzhao Dong, Hao Wang 0176, Haiyu Wu, Huayu Li, Aris Sotiras, Yalin Wang 0001, Abolfazl Razi. 13995-14019 [doi]
- Web Fraud Attacks Against LLM-Driven Multi-Agent SystemsDezhang Kong, Hujin Peng, Yilun Zhang, Lele Zhao, Zhenhua Xu 0004, Shi Lin, Changting Lin, Meng Han. 14020-14034 [doi]
- From Query to Logic: Ontology-Driven Multi-Hop Reasoning in LLMsHaonan Bian, Yutao Qi, Rui Yang, Yuanxi Che, Jiaqian Wang, Heming Xia, Ranran Zhen. 14035-14051 [doi]
- AudioStealer: Extracting Audio Prompts via Shapley Value-Guided Query SearchYingbin Jin, Xingjian Du, Hanjun Luo, Zihao Wang, Haibo Hu, Xiaofeng Wang 0001, Xinfeng Li. 14052-14067 [doi]
- FaithLens: Detecting and Explaining Faithfulness HallucinationShuzheng Si, Qingyi Wang, Haozhe Zhao, Yuzhuo Bai, Guanqiao Chen, Kangyang Luo, Gang Chen 0039, Fanchao Qi, Minjia Zhang, Baobao Chang, Maosong Sun 0001. 14068-14099 [doi]
- Escaping the Sisyphus Dilemma: Experience Replay for Robust Text-to-Optimization ModelingWantong Xie, Yinghao Chen, Yixiang Hu, Feng Wu 0001, Jieyang Xu, Sijia Zhang, Xiangyang Li 0001. 14100-14116 [doi]
- Toward Automated Robustness Evaluation of Mathematical ReasoningYutao Hou, Zeguan Xiao, Fei Yu, Yihan Jiang, Shuguang Ma, Zhaoqian Dai, Hailiang Huang, Yun Chen 0007, Guanhua Chen 0001. 14117-14139 [doi]
- Simulating Crisis Cognition: A Computational Framework for Hypothesis Generation in Crisis CommunicationChangsen Yuan, Yanghao Zhou, Chong Feng 0001, Ge Shi 0002. 14140-14148 [doi]
- MedScore: Generalizable Factuality Evaluation of Open-ended Long-form Medical Answers by Domain-adapted Claim Decomposition and VerificationHeyuan Huang, Alexandra DeLucia, Vijay Murari Tiyyala, Mark Dredze. 14149-14180 [doi]
- FinSafetyBench: Evaluating LLM Safety in Real-World Financial ScenariosYutao Hou, Yihan Jiang, Yuhan Xie, Jian Yang 0003, Liwen Zhang, Hailiang Huang, Guanhua Chen 0001, Yun Chen 0007. 14181-14208 [doi]
- Optimizing Native Sparse Attention with Latent Attention and Local Global Alternating StrategiesYuxuan Hu, Jianchao Tan, Jiaqi Zhang, Wen Zan, Pingwei Sun, Yifan Lu, Xunliang Cai, Jing Zhang. 14209-14220 [doi]
- BRIEF-Pro: Universal Context Compression with Short-to-Long Synthesis for Fast and Accurate Multi-Hop ReasoningJia-Chen Gu, Junyi Zhang, Di Wu 0054, Yuankai Li, Kai-Wei Chang 0001, Nanyun Peng 0001. 14221-14241 [doi]
- O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning PruningHaotian Luo, Haiying He, Yibo Wang 0039, Shiwei Liu 0003, Wei Li, Xiaochun Cao, Dacheng Tao, Naiqiang Tan, Li Shen 0008. 14242-14257 [doi]
- One Agent to Serve All: a Lite-Adaptive Stylized AI Assistant for Millions of Multi-Style Official AccountsXingyu Fan, Feifei Li, Wenhui Que, Hailong Li. 14258-14275 [doi]
- SAVOIR: Learning Social Savoir-Faire via Shapley-based Reward AttributionXiachong Feng, Yi Jiang, Xiaocheng Feng, Deyi Yin, Libo Qin 0001, Yangfan Ye, Lei Huang 0021, Weitao Ma, Yuxuan Gu 0004, Chonghan Qin, Bing Qin 0001, Lingpeng Kong. 14276-14290 [doi]
- Language-Coupled Reinforcement Learning for Multilingual Retrieval-Augmented GenerationRui Qi, Fengran Mo, Yufeng Chen 0005, Xue Zhang, Shuo Wang, Hongliang Li, Jinan Xu, Meng Jiang 0001, Jian-Yun Nie, Kaiyu Huang. 14291-14310 [doi]
- Article and Comment Frames Shape the Quality of Online CommentsMatteo Guida, Yulia Otmakhova 0001, Eduard H. Hovy, Lea Frermann. 14311-14326 [doi]
- LAD: Learning Advantage Distribution for ReasoningWendi Li, Sharon Li 0001. 14327-14348 [doi]
- RealMem: Benchmarking LLMs in Real-World Memory-Driven InteractionHaonan Bian, Zhiyuan Yao, Sen Hu 0005, Zishan Xu, Shaolei Zhang, Yifu Guo, Ziliang Yang, Xueran Han, Huacan Wang, Ronghao Chen. 14349-14365 [doi]
- AFMRL: Attribute-Enhanced Fine-Grained Multi-Modal Representation Learning in E-commerceBiao Zhang, Lixin Chen, Bin Zhang, Zongwei Wang 0006, Tong Liu, Bo Zheng. 14366-14379 [doi]
- SAFER: A Controllable Safeguard for LLMs against Backdoor AttacksZirui Hu, Zheng Zhang, Yingjie Wang, Dacheng Tao. 14380-14398 [doi]
- RIFT: Repurposing Negative Samples via Reward-Informed Fine-TuningZehua Liu, Shuqi Liu 0001, Tao Zhong 0004, Mingxuan Yuan. 14399-14415 [doi]
- LEPO: Latent Reasoning Policy Optimization for Large Language ModelsYuyan Zhou, Jiarui Yu, Hande Dong, Zhezheng Hao, Hong Wang, Jianqing Zhang, Qiang Lin. 14416-14427 [doi]
- You Never Know a Person, You Only Know Their Defenses: Detecting Levels of Psychological Defense Mechanisms in Supportive ConversationsHongbin Na, Zimu Wang, Zhaoming Chen, Peilin Zhou, Yining Hua, Grace Ziqi Zhou, Haiyang Zhang 0004, Tao Shen, Wei Wang 0042, John B. Torous, Shaoxiong Ji, Ling Chen 0006. 14428-14448 [doi]
- Beyond Length Scaling: Synergizing Breadth and Depth for Generative Reward ModelsQiyuan Zhang 0001, Yufei Wang 0005, Tianhe Wu, Can Xu 0002, Qingfeng Sun, Kai Zheng 0001, Xue Liu 0001, Chen Ma 0001. 14449-14469 [doi]
- Pushing the Limits of LLM Tool Calling via Experiential Knowledge Integration and ActivationYupu Hao, Zhuoran Jin, Huanxuan Liao, Kang Liu 0001, Jun Zhao 0001. 14470-14497 [doi]
- Efficient Transformer Parameter Reuse via Zero-Token MechanismGuanghao Li 0003, Wenhao Jiang, Li Shen 0008, Ming Tang, Chun Yuan 0003. 14498-14515 [doi]
- x1: Learning to Think Adaptively Across Languages and CulturesYangfan Ye, Xiaocheng Feng, Xiachong Feng, Yichong Huang, Zekun Yuan, Lei Huang 0021, Weitao Ma, Qichen Hong, Yunfei Lu, Dandan Tu, Bing Qin 0001. 14516-14533 [doi]
- Towards Bridging the Reward-Generation Gap in Direct Alignment AlgorithmsZeguan Xiao, Yun Chen, Jian Yang, Guanhua Chen, Ke Tang. 14534-14548 [doi]
- FABLE: Fine-grained Fact Anchoring for Unstructured Model EditingPeng Wang 0028, Biyu Zhou, Xuehai Tang, Jizhong Han, Songlin Hu 0001. 14549-14567 [doi]
- SOP-Maze: Evaluating Large Language Models on Complicated Business Standard Operating ProceduresJiaming Wang, Zhe Tang, Zehao Jin, Hefei Chen, Yilin Jin, Peng Ding, Xiaoyu Li, Xuezhi Cao. 14568-14588 [doi]
- MalURLBench: A Benchmark Evaluating Agents' Vulnerabilities When Processing Web URLsDezhang Kong, Zhuxi Wu, Shiqi Liu, Zhicheng Tan, Kuichen Lu, Minghao Li 0012, Qichen Liu, Shengyu Chu, Zhenhua Xu 0004, Xuan Liu 0006, Meng Han. 14589-14601 [doi]
- Representation-Guided Parameter-Efficient LLM UnlearningZeguan Xiao, Lang Mo, Yun Chen 0007, Lei Yang 0048, Jiehui Zhao, Lili Yang, Guanhua Chen 0001. 14602-14616 [doi]
- LPO: Towards Accurate GUI Agent Interaction via Location Preference OptimizationJiaqi Tang 0005, Yu Xia, Yi-Feng Wu, Yuwei Hu, Yuhui Chen, Qing-Guo Chen, Xiaogang Xu 0002, Xiangyu Wu, Hao Lu 0009, Yanqing Ma, Shiyin Lu, Qifeng Chen 0001. 14617-14628 [doi]
- Mistake Notebook Learning: Batch-Clustered Failures for Training-Free Agent Adaptationxuanbo su, Yingfang Zhang, Hao Luo, Xiaoteng Liu, Leo Huang. 14629-14645 [doi]
- Large-Scale Multimodal Knowledge Graph about Classical Chinese Poetry: Fine-grained Method and Comprehensive EvaluationShuo Wang, Qing Zhu, Yang Xiao, Minglong Lei. 14646-14669 [doi]
- MultiCodeAttack: Iterative Jailbreak Attacking on LLMs with Multi-Code Prompt InjectionWeifeng Sun 0004, Meng Yan 0001, Zhou Yang 0003, Yuchen Chen, Song Sun, David Lo 0001. 14670-14690 [doi]
- SAMem: State-Aware Memory as a Fine-Grained Memory for LLM Agents in Decision-MakingTong Wang, Pei Xu 0003, Shiyue Cao, Likun Yang, Daipeng Li, Jianbin Jiao, Kaiqi Huang. 14691-14710 [doi]
- Learning to Translate by Translating: Stabilizing the Dual Loop via Semantic-Aware Self-EvolutionKui Liu, Mingming Yin, Zuoli Tang, Zihao Li 0005, Chilin Fu, Xiaolu Zhang, Jun Zhou 0011, Lixin Zou, Chenliang Li 0005. 14711-14726 [doi]
- How to Allocate, How to Learn? Dynamic Rollout Allocation and Advantage Modulation for Policy OptimizationYangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi, Chaowen Hu, Lu Pan, Ke Zeng, Xunliang Cai. 14727-14744 [doi]
- Meeseeks: A Feedback-Driven, Iterative Self-Correction Benchmark evaluating LLMs' Instruction Following CapabilityJiaming Wang, Yunke Zhao, Peng Ding, Jun Kuang, Yibin Shen, Zhe Tang, Yilin Jin, Zongyu Wang, Xiaoyu Li, Xuezhi Cao. 14745-14773 [doi]
- HSUGA: LLM-Enhanced Recommendation with Hierarchical Semantic Understanding and Group-Aware AlignmentGuorui Li, Dugang Liu, Lei Li 0042, Xing Tang 0007, Zhong Ming 0001. 14774-14788 [doi]
- AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language ModelsYixu Wang, Xin Wang 0119, Yang Yao, Xinyuan Li, Xibang Yang, Yan Teng 0002, Xingjun Ma, Yingchun Wang 0004. 14789-14808 [doi]
- AlphaEdit+: Model Editing in the Presence of Conflicting and Inconsistent KnowledgeQing Liu, Jianhao Zhang, Ou Wu 0001, Michael K. P. Ng 0001, Yi Du. 14809-14835 [doi]
- Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language ModelsZiyao Tang, Pengkun Jiao, Bin Zhu 0006, Huiyan Qi, Jingjing Chen 0001, Yu-Gang Jiang 0001. 14836-14852 [doi]
- FreeChunker: A Cross-Granularity Chunking FrameworkWenxuan Zhang 0001, Yuan-Hao Jiang, Yang Cao, Yonghe Wu. 14853-14865 [doi]
- Invocation Refiner: A Plug-and-Play Module for Rectifying LLM Tool InvocationsQirui Jiao, Dian Jiao, Nan Du 0001, Ying Shen 0001, Liang Lin. 14866-14898 [doi]
- GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal ReasoningFengyi Wu, Yifei Dong 0002, Yilong Dai, Guangyu Chen, Qifeng Wu, Huiting Huang, Hang Wang, Qi Dai 0001, Alexander G. Hauptmann, Zhi-Qi Cheng. 14899-14920 [doi]
- Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language ModelsYanda Li, Yuhan Liu 0030, Zirui Song, Yunchao Wei, Martin Takác 0001, Salem Lahlou. 14921-14934 [doi]
- When Internalization Fails: Finding Better Targets for Reasoning CompressionMourad Heddaya, Manley Roberts, Rohan Wadhawan, Chenhao Tan. 14935-14946 [doi]
- PatentMind: A Multi-Aspect Reasoning Graph for Patent Similarity EvaluationYongmin Yoo, Qiongkai Xu, Longbing Cao. 14947-14964 [doi]
- MemSearcher: Iterative Memory Integration for Search Agent via End-to-End Reinforcement LearningQianhao Yuan, Jie Lou, Zichao Li, Jiawei Chen 0011, Yaojie Lu 0001, Hongyu Lin, Le Sun 0001, Debing Zhang, Xianpei Han. 14965-14977 [doi]
- CoPA: Benchmarking Personalized Question Answering with Data-Informed Cognitive FactorsHang Su, Zequn Liu, Chen Hu, Xuesong Lu, Yingce Xia, Liu Zhen. 14978-15007 [doi]
- RAP-ID: Mechanistic Prompt Injection Detection via Impostor Behavior AnalysisYuchen Yang, Lei Peng, Yujie He 0005, Yang Yu, Zhongxin Wu, Yanlei Shi. 15008-15019 [doi]
- When Safety Alignment Fails to Generalize: Probing with Language Game JailbreaksZewen Long, Yu Peng, Fangming Dong, Congyi Li, Xingmao Guan, Shu Wu, Kai Chen. 15020-15037 [doi]
- Self-EmoQ: Plutchik-Guided Value-based Planning to Drive Streaming Emotional TTSYue Zhao, Hongyan Li, Yong Chen, Luo Ji. 15038-15055 [doi]
- Scaling is Not All You Need: Clinical-Oriented Reinforcement Learning Makes Parameter-Efficient Clinical ReasoningChi Liu 0003, Yan Shu, Mengzhuo Chen, Hongming Piao, Zhijian Duan, Derek Li, Bryan Dai. 15056-15068 [doi]
- Do We Need Distinct Representations for Every Speech Token? Unveiling and Exploiting Redundancy in Large Speech Language ModelsBajian Xiang, Tingwei Guo, Xuan Chen, Yang Han. 15069-15087 [doi]
- Table-as-Search: Agentic Information Seeking is Table CompletionTian Lan, Felix Henry, Bin Zhu, Qianghuai Jia, Junyang Ren, Qihang Pu, Haijun Li, Longyue Wang, Zhao Xu, Weihua Luo. 15088-15107 [doi]
- Minos: A Multimodal Evaluation Model for Bidirectional Generation Between Image and TextJunzhe Zhang 0004, Huixuan Zhang, Xinyu Hu 0001, Li Lin 0014, Mingqi Gao 0002, Shi Qiu, Xiaojun Wan 0001. 15108-15132 [doi]
- Global Context or Local Detail? Adaptive Visual Grounding for Hallucination MitigationYubo Jiang, Xin Yang, Abudukelimu Wuerkaixi, Zheming Yuan, Xuxin Cheng, Cao Liu, Ke Zeng, Fengying Xie, Zhiguo Jiang 0001, Haopeng Zhang 0001. 15133-15152 [doi]
- FinToolSyn: A forward synthesis Framework for Financial Tool-Use Dialogue Data with Dynamic Tool RetrievalCaishuang Huang, Yang Qiao, Rongyu Zhang, Junjie Ye 0005, Pu Lu, Wenxi Wu, Meng Zhou, Xiku Du, Qi Zhang 0001, Tao Gui, Xuanjing Huang 0001. 15153-15196 [doi]
- From Fake to Real: Mitigating Out-of-Distribution Bias in In-Context Learning via Feedback Supervision from Large Language ModelsRui Song 0008, Yingji Li, Jian Li, Fausto Giunchiglia, Hao Xu 0012. 15197-15213 [doi]
- Revealing and Enhancing Core Visual Regions: Harnessing Internal Attention Dynamics for Hallucination Mitigation in LVLMsGuangtao Lyu, Qi Liu, Chenghao Xu, Jiexi Yan, Muli Yang, Xueting Li, Fen Fang, Cheng Deng 0002. 15214-15230 [doi]
- Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution LensChengshuai Zhao, Zhen Tan 0001, Pingchuan Ma 0012, Dawei Li 0008, Bohan Jiang, Yancheng Wang 0001, Yingzhen Yang, Huan Liu 0001. 15231-15261 [doi]
- WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application EnvironmentsJinchao Li, Yunxin Li, Chenrui Zhao, Zhenran Xu, Baotian Hu, Min Zhang 0005. 15262-15280 [doi]
- EDU-CIRCUIT-HW: Evaluating Multimodal Large Language Models on Real-World University-Level STEM Student Handwritten SolutionsWeiyu Sun, Liangliang Chen, Yongnuo Cai, Huiru Xie, Yi Zeng, Ying Zhang. 15281-15314 [doi]
- What Factors Affect LLMs and RLLMs in Financial Question Answering?Peng Wang 0168, Xuesi Hu, Jiageng Wu, Yuntao Zou, Qiancheng Zhang, Dagang Li 0001. 15315-15327 [doi]
- Superficial Success vs. Internal Breakdown: An Empirical Study of Generalization in Adaptive Multi-Agent SystemsNamyeong So, Seokgyu Jang, Taeuk Kim. 15328-15354 [doi]
- D²-RAG: Dual-Decision Retrieval-Augmented Generation via Multi-Dimensional Uncertainty and Utility-Aware DecodingJinshuo Zhang, Xiaoding Zhou, Weiyu Zhang 0001, Guoqiang Chen, Ying Lian, Xiaoyang Meng, Yonghe Chen, Hongjiao Guan, Jiasheng Si, Wenpeng Lu. 15355-15382 [doi]
- ProFit: Leveraging High-Value Signals in SFT via Probability-Guided Token SelectionTao Liu, Taiqiang Wu, Runming Yang, Shaoning Sun, Junjie Wang, Yujiu Yang 0001. 15383-15401 [doi]
- DisastQA: A Comprehensive Benchmark for Evaluating Question Answering in Disaster ManagementZhitong Chen, Kai Yin, Xiangjue Dong, Chengkai Liu, XiangPeng Li, Bo Li, Junwei Ma, Yiming Xiao 0002, Ali Mostafavi, James Caverlee. 15402-15427 [doi]
- TAGS: A Test-Time Generalist-Specialist Framework with Retrieval-Augmented Reasoning and VerificationJianghao Wu 0007, Feilong Tang, Yulong Li 0002, Ming Hu, Haochen Xue, Shoaib Jameel, ZongYuan Ge, Yutong Xie 0001, Imran Razzak. 15428-15445 [doi]
- How Retrieved Context Shapes Internal Representations in RAGSamuel Yeh, Sharon Li 0001. 15446-15468 [doi]
- TabularMath: Understanding Math Reasoning over Tables with Large Language ModelsShi-Yu Tian, Zhi Zhou 0007, Wei Dong, Kun-Yang Yu, Ming Yang 0044, Zi-Jian Cheng, Lan-Zhe Guo, Yufeng Li 0008. 15469-15498 [doi]
- Seek-and-Solve: Benchmarking MLLMs for Visual Clue-Driven Reasoning in Daily ScenariosXiaomin Li 0001, Tala Wang, Zichen Zhong, Ying Zhang 0021, Zirui Zheng, Takashi Isobe, Dezhuang Li, Huchuan Lu, You He 0002, Xu Jia 0012. 15499-15517 [doi]
- Structured and Abstractive Reasoning on Multi-modal Relational Knowledge ImagesYichi Zhang 0009, Zhuo Chen 0007, Lingbing Guo, Wen Zhang 0015, Huajun Chen. 15518-15540 [doi]
- Code Reffix: A Benchmark for Reflection-Guided Code Repair with Large Language ModelsZaiyuan Di, Jianting Chen, Yunxiao Yang, Xiaoying Gao, Li Yang, Zhihao Wang 0005, Yang Xiang 0006. 15541-15561 [doi]
- ProtoCycle: Reflective Tool-Augmented Planning for Text-Guided Protein DesignYutang Ge, Guojiang Zhao, Sihang Li 0002, Zheng Cheng, Zifeng Zhao, Hanchen Xia, Guolin Ke, Linfeng Zhang 0002, Zhifeng Gao, Yu Guang Wang. 15562-15586 [doi]
- SEC-FinTables: Evaluating Large Language Models for Detecting Logical Inconsistencies on Tabular DataShuyan Ke, Qiong Wu 0012, Hui Li 0057, Liujuan Cao. 15587-15607 [doi]
- QueryLink: Leveraging Query-Memory Alignment for Long-Term Reasoning in LLM AgentsXuxian Hu, Zhu Teng, Wei Zhang 0016, Ming He, Jianping Fan 0007. 15608-15621 [doi]
- AutoPKG: An Automated Framework for Dynamic E-commerce Product-Attribute Knowledge Graph ConstructionPollawat Hongwimol, Haoning Shang, Chutong Wang, Zhichao Wan, Yi Gao, Yuanming Li, Lin Gui, Wenhao Sun, Cheng Yu. 15622-15650 [doi]
- Benchmarking LLMs on Authentic Cases from Medical JournalsWanlong Liu, Junying Chen, Yunjin Yang, Prayag Tiwari, Wenyu Chen 0001, Benyou Wang. 15651-15675 [doi]
- Beyond Quantity: Trajectory Diversity Scaling for Code AgentsGuhong Chen, Chenghao Sun, Cheng Fu 0003, Qiyao Wang, Zhihong Huang, Chaopeng Wei, Guangxu Chen, Feiteng Fang, Ahmadreza Argha, Bing Zhao, Xander Xu, Qi Han, Hamid Alinejad-Rokny, Qiang Qu 0001, Binhua Li, Shiwen Ni, Min Yang 0007, H. U. Wei, Yongbin Li 0001. 15676-15691 [doi]
- Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?Zihan Chen, Yiming Zhang, Hengguang Zhou, Zenghui Ding, Yining Sun, Cho-Jui Hsieh. 15692-15709 [doi]
- CaPEdit: Capability-Preserving Lifelong Knowledge Editing For Language ModelsSong-Li Wu, Zhaocheng Du, Xianquan Wang, Jingyi Wang. 15710-15752 [doi]
- Exploring Layer-wise Information Effectiveness for Post-Training Quantization in Small Language ModelsHe Xiao, Qingyao Yang, Dirui Xie, Wendong Xu, Zunhai Su, Runming Yang, Haobo Liu, Wenyong Zhou, Zhengwu Liu, Ngai Wong 0001. 15753-15764 [doi]
- ELTLM: Evaluation of Longitudinal Temporal Large Multimodal Models in Clinical ScenariosGengyuan Hu, Haoxiang Liu, Chenhong Cao, Shilei Tan, Wei Gong 0001. 15765-15779 [doi]
- Easy Samples Are All You Need: Self-Evolving LLMs via Data-Efficient Reinforcement LearningZhiyin Yu, Bo Zhang 0069, Qibin Hou, Zhonghai Wu, Xiao Luo 0001, Lei Bai 0001. 15780-15795 [doi]
- Collaborative Multi-Agent Scripts Generation for Enhancing Imperfect-Information Reasoning in Murder Mystery GamesKeyang Zhong, Junlin Xie, Hefeng Wu, Haofeng Li, Guanbin Li. 15796-15819 [doi]
- A Picture is Worth a Thousand Words? An Empirical Study of Aggregation Strategies for Visual Financial Document RetrievalHo Hung Lim, Yi Yang. 15820-15829 [doi]
- ToolCPT: Improving Tool Utilization in LLM Agents via Continuous Pre-trainingYifan Yang, Jinghui Lu, Yaping Deng, Ao Yang, Peijie Yu, Tinghao Yu, Feng Zhang. 15830-15856 [doi]
- A Universal Avoidance Method for Diverse Multi-branch GenerationKyeongman Park, Minha Jhang, Kyomin Jung. 15857-15870 [doi]
- CentaurTA: A Self-Improving Human-Agents Collaboration Framework for Thematic AnalysisLei Wang 0270, Min Huang, Eduard C. Dragut. 15871-15884 [doi]
- Balancing Fidelity and Plasticity: Aligning Mixed-Precision Fine-Tuning with Linguistic HierarchiesChanghai Zhou, Shiyang Zhang, Yuhua Zhou, Jun Gao, Qian Qiao, Shichao Weng, Weizhong Zhang, Cheng Jin. 15885-15896 [doi]
- From Script to Stage: Automating Experimental Design for Social Simulations with LLMsYuwei Guo 0007, Zihan Zhao 0002, Xiaowei Liu, Xiangning Yu 0001, Qun Ma, Deyu Zhou 0001, Xiao Xue 0001. 15897-15916 [doi]
- Generative Giants, Retrieval Weaklings: Why do Multimodal Large Language Models Fail at Multimodal Retrieval?Hengyi Feng, Zeang Sheng, Meiyi Qiang, Yang Li, Wentao Zhang. 15917-15933 [doi]
- Learning to Extract Rational Evidence via Reinforcement Learning for Retrieval-Augmented GenerationXinping Zhao, Shouzheng Huang, Yan Zhong, Xinshuo Hu, Meishan Zhang, Baotian Hu, Min Zhang 0005. 15934-15956 [doi]
- Tree-Notebook: A Context-Aware Agent with Tree Search and Entropy-Aware Data Shadow for Interactive Data ScienceJunkun Qiu, Min Huang 0009, Qinghai Miao. 15957-15970 [doi]
- Resource-Limited Joint Multimodal Sentiment Reasoning and Classification via Chain-of-Thought Enhancement and DistillationHaonan Shangguan, Xiaocui Yang, Shi Feng 0001, Daling Wang, Yifei Zhang 0003, Feiliang Ren, Ge Yu 0001. 15971-15986 [doi]
- Agentic-R: Learning to Retrieve for Agentic SearchWenhan Liu, Xinyu Ma 0001, Yutao Zhu 0001, Yuchen Li 0006, Daiting Shi, Dawei Yin 0001, Zhicheng Dou. 15987-16005 [doi]
- JailMeter: An Evidence-Based Evaluation Framework for Jailbreak Attacks on Large Language ModelsQingjia Huang, Jingyu Zhang, Jianguo Wu, Yakai Li, Weijuan Zhang, Yankai Rong, Junyi Yao, Shengzhi Zhang, Xiaoqi Jia. 16006-16029 [doi]
- DataSeer: A Manager-Centric Collaborative Multi-Agent Framework with Multi-Branch Reasoning for Automated Insight DiscoverySuchen Liu, Yuanfeng Song, Jun Gao 0003, Xing Chen. 16030-16058 [doi]
- "Penny Wise, Pixel Foolish": Bypassing Price Constraints in Multimodal Agents via Visual Adversarial PerturbationsJiachen Qian, Zhaolu Kang. 16059-16073 [doi]
- Beyond the Individual: Virtualizing Multi-Disciplinary Reasoning for Clinical Intake via Collaborative AgentsHuangwei Chen, Wu Li, Junhao Jia, Yining Chen, Xiaotao Pang, Yalong Chen, Gonghui Li, Haishuai Wang, Jiajun Bu, Lei Wu. 16074-16101 [doi]
- SWE-Swiss: A Multi-Task Fine-Tuning and RL Recipe for High-Performance Issue ResolutionZhenyu He 0012, Qingping Yang, Wei Shen, Xiaojian Zhong, Kechi Zhang, Chenxin An, Wenlei Shi, Tianle Cai, Di He 0001, Jiaze Chen, Jingjing Xu 0001. 16102-16114 [doi]
- BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based AgentsYunhao Feng, Yige Li, Yutao Wu 0004, Yingshui Tan, Yanming Guo, Yifan Ding, Kun Zhai, Xingjun Ma, Yu-Gang Jiang. 16115-16127 [doi]
- DKME: Rethinking Coupled Knowledge Memory for Lifelong Model Editing of Large Language ModelsGuanyu Zheng, Wang Zhenyu, Tingting He, Xv Wang, Haochang Wang, Yaokai Huang, Tiejun Zhao. 16128-16150 [doi]
- Self-Awareness before Action: Mitigating Logical Inertia via Proactive Cognitive AwarenessFulong Fan, Peilin Liu, Fengzhe Liu, Shuyan Yang, Gang Yan. 16151-16162 [doi]
- MuBench: Assessment of Multilingual Capabilities of Large Language Models Across 61 LanguagesWenhan Han, Yifan Zhang, Zhixun Chen, Binbin Liu, Mykola Pechenizkiy, Meng Fang, Yin Zheng. 16163-16192 [doi]
- PrefRAG: Correcting Semantic Errors in Auto-Formalization for Logical Reasoning with Program Preference RAGYuyin Zhou, Yongmei Liu. 16193-16208 [doi]
- LoopCoder: Scaling Code Intelligence via Looped Language ModelsJian Yang, Wei Zhang 0021, Shuyue Guo, Yizhi Li, Linzheng Chai, Zhengmao Ye, Shukai Liu, Yuyang Song, Jiajun Wu, Che Liu, Tianyu Zheng, Siwei Wu, Leo L, Xudong Ma, Chuan-Hao, Ran Tao, Yan Xing, Jianzhou Wang, MingJie Tang, Aishan Liu, Zhoujun Li 0001, Xianglong Liu 0001, Weifeng Lv, Bryan Dai. 16209-16223 [doi]
- TempTool-R1: Tool-Augmented Reinforcement Learning for Temporal Knowledge Graph Question AnsweringZicheng Huang, Yajuan Tong, Xinhui Tu, Tingting He. 16224-16241 [doi]
- Lightweight Haar Wavelet Subband Pruning for LLMsJiang Li, Pengfei Cao, Chenxi Zhou, Tian Lan, Xiangdong Su, Kang Liu 0001, Jun Zhao 0001, Guanglai Gao. 16242-16259 [doi]
- Prompt-R1: Collaborative Automatic Prompting Framework via End-to-end Reinforcement LearningWenjin Liu, Haoran Luo 0001, Xueyuan Lin, Haoming Liu, Tiesunlong Shen, Jiapu Wang, Rui Mao 0010, Erik Cambria. 16260-16280 [doi]
- ProCeedRL: Process Critic with Explorative Demonstration Reinforcement Learning for LLM Agentic ReasoningJingyue Gao, Yanjiang Guo, XiaoShuai Chen, Jianyu Chen 0002. 16281-16295 [doi]
- Accelerating Prefilling via Decoding-time Contribution SparsityZhiyuan He, Yike Zhang, Chengruidong Zhang, Huiqiang Jiang, Yuqing Yang 0001, Lili Qiu. 16296-16308 [doi]
- SpecBound: Adaptive Bounded Self-Speculation with Layer-wise Confidence CalibrationZhuofan Wen, Yang Feng. 16309-16321 [doi]
- Stable and Explainable Personality Trait Evaluation in Large Language Models with Internal ActivationsXiaoxu Ma, Xiangbo Zhang, Zhenyu Weng. 16322-16340 [doi]
- Learning Continuous Temporal Dynamics on Symplectic Manifolds for Temporal Knowledge Graph EmbeddingJiang Li, Zehua Duo, Tian Lan, Feilong Bao, Guanglai Gao, Xiangdong Su. 16341-16357 [doi]
- mPresenter: An Agentic Framework for Generating Multilingual Presentation Videos from Scientific PapersWenhan Han, Xiao Xiao, Mykola Pechenizkiy, Meng Fang. 16358-16371 [doi]
- Tree-CoT-RT: An Explainable Multi-Path Tree-Guided Chain-of-Thought and Reinforcement Learning Framework for Aspect Sentiment Quad PredictionHao Zhang, Jiahao Wang, Zhenke Duan, Xin Yin, Haichuan Hu, Hualong Chen, Yi Su, Congqing He, Yike Tan, Yu-N Cheah. 16372-16391 [doi]
- PRISM-MCTS: Learning from Reasoning Trajectories with Metacognitive ReflectionSiyuan Cheng 0008, Bozhong Tian, Yanchao Hao, Zheng Wei. 16392-16402 [doi]
- CausalityCheck: A Framework for Evaluating Causal Reasoning in Large Language ModelsJiang Li, Zehua Duo, Guanglai Gao, Xiangdong Su. 16403-16429 [doi]
- OmniDiagram: Advancing Unified Diagram Code Generation via Visual Interrogation RewardHaoyue Yang, Xuanle Zhao, Xuexin Liu, Feibang Jiang, Yao Zhu. 16430-16452 [doi]
- Why Agents Compromise Safety Under PressureHengle Jiang, Ke Tang. 16453-16470 [doi]
- CoMoL: Efficient Mixture of LoRA Experts via Dynamic Core Space MergingJie Cao, Zhenxuan Fan, Zhuonan Wang, Tianwei Lin 0001, Ziyuan Zhao, Rolan Yan, Wenqiao Zhang, Feifei Shao, Hongwei Wang, Jun Xiao 0001, Siliang Tang. 16471-16481 [doi]
- QuCo-RAG: Quantifying Uncertainty from the Pre-training Corpus for Dynamic Retrieval-Augmented GenerationDehai Min, Kailin Zhang, Tongtong Wu, Lu Cheng 0001. 16482-16500 [doi]
- CaM-HG: Causal-Enhanced MoE and Hypergraphs Network for Incomplete Multimodal Emotion Recognition in ConversationsMingjian Yang, Yong Wang, Peng Liu, Wen Yin. 16501-16516 [doi]
- Large-Scale Diverse Synthesis for Mid-TrainingXuemiao Zhang, Chengying Tu, Can Ren, Rongxiang Weng, Hongfei Yan, Jingang Wang, Xunliang Cai. 16517-16539 [doi]
- DiSec: Mitigating Backdoors in Pre-trained Language Models via Disentanglement of Adversarial Weights for Secure Fine-TuningSunanda Das, Qinghua Li. 16540-16559 [doi]
- LUNE: Efficient LLM Unlearning via LoRA Fine-Tuning with Negative ExamplesYezi Liu, Hanning Chen, Wenjun Huang 0001, Yang Ni 0001, Mohsen Imani. 16560-16576 [doi]
- Think Earlier, Not Longer: Prompt Optimization via Reducing Unhealthy ExplorationLing-I Wu, Minyu Chen 0002, Jingyang Li, Xi Chang, Guoqiang Li 0001. 16577-16592 [doi]
- Psychological Counseling Cannot Be Achieved Overnight: Automated Psychological Counseling Through Multi-Session ConversationsBichen Wang, Junzhe Wang, Yixin Sun, Xing Fu, Yanyan Zhao, Bing Qin 0001. 16593-16609 [doi]
- Code over Words: Overcoming Semantic Inertia via Code-Grounded ReasoningManjie Xu, Isabella Yin, Xinyi Tu, Chi Zhang 0017, Yixin Zhu 0001. 16610-16632 [doi]
- Bypassing Neural Evaluations for Fast Audio Editing via Adaptive Trajectory ExtrapolationXiaoqian Liu, Zhengkun Ge, Jianjin Wang, Haoran Zhang, Yuan Ge 0001, Kaiyan Chang 0001, Chen Xu 0008, Tong Xiao 0001, Zhengtao Yu 0001, Linfeng Zhang 0001, Jingbo Zhu. 16633-16647 [doi]
- Agent-GWO: Collaborative Agents for Dynamic Prompt Optimization in Large Language ModelsXudong Wang, Chaoning Zhang, Chenghao Li, Shuxu Chen, Qigan Sun, Jiaquan Zhang, Fachrina Dewi Puspitasari, Tae-Ho Kim, Jiwei Wei, Malu Zhang, Guoqing Wang 0001, Yang Yang 0002, Heng Tao Shen. 16648-16670 [doi]
- Structured Confidence-Guided Online Adaptation for LLM-based Multi-Label ClassificationPengyu Xu, Jingren Hou, Liping Jing, Jian Yu 0001. 16671-16686 [doi]
- SERM: Self-Evolving Relevance Model with Agent-Driven Learning from Massive Query StreamsChenglong Wang 0002, Canjia Li, Xingzhao Zhu, Yifu Huo, Huiyu Wang, Weixiong Lin, Yun Yang, Qiaozhi He, Tianhua Zhou, Changxiaojia, Jingbo Zhu, Tong Xiao 0001. 16687-16706 [doi]
- CLAG: Adaptive Memory Organization via Agent-Driven Clustering for Small Language Model AgentsTaeyun Roh, Wonjune Jang, Junha Jung, Jaewoo Kang. 16707-16726 [doi]
- ClinAlign: Scaling Healthcare Alignment from Clinician PreferenceShiwei Lyu, Xidong Wang, Hao Zhu, Lei Liu, Chaohe Zhang, Jian Wang 0108, Jinjie Gu, Benyou Wang, Yue Shen. 16727-16747 [doi]
- SessionIntentBench: A Multi-task Inter-session Intention-shift Modeling Benchmark for E-commerce Customer Behavior UnderstandingYuqi Yang, Weiqi Wang 0001, Baixuan Xu, Wei Fan 0001, Qing Zong, Chunkit Chan, Zheye Deng, Xin Liu 0039, Yifan Gao 0001, Changlong Yu, Chen Luo 0003, Yang Li 0055, Zheng Li 0018, Qingyu Yin, Bing Yin, Yangqiu Song. 16748-16775 [doi]
- Adapting Where It Matters: Depth-Aware Adaptation for Efficient Multilingual Speech Recognition in Low-Resource LanguagesYang Xiao 0019, Eun-Jung Holden, Ting Dang. 16776-16788 [doi]
- Targeted Exploration via Unified Entropy Control for Reinforcement LearningChen Wang, Lai Wei 0005, Yanzhi Zhang, Chenyang Shao, Zedong Dan, Weiran Huang 0001, Ge Lan, Yue Wang 0039. 16789-16802 [doi]
- Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent EvolutionZouying Cao, Jiaji Deng, Li Yu, Weikang Zhou, Zhaoyang Liu 0003, Bolin Ding, Hai Zhao 0001. 16803-16822 [doi]
- Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile ReasoningXinyan Guan, Jiali Zeng, Chunlei Xin, Yaojie Lu 0001, Hongyu Lin, Xianpei Han, Le Sun 0001, Fandong Meng. 16823-16835 [doi]
- AutoL2S: Auto Long-Short Reasoning for Efficient Large Language ModelsFeng Luo, Yu-Neng Chuang, Guanchu Wang, Hoang Anh Duy Le, Shaochen Zhong, Hongyi Liu, Jiayi Yuan 0001, Yang Sui 0001, Vladimir Braverman, Vipin Chaudhary, Xia Ben Hu. 16836-16858 [doi]
- Doc-PP: Document Policy Preservation Benchmark for Large Vision-Language ModelsHaeun Jang, Hwan Chang, Hwanhee Lee. 16859-16881 [doi]
- RIPRAG: Hack a Black-box Retrieval-Augmented Generation Question-Answering System with Reinforcement LearningMeng Xi 0002, Sihan Lv, Yechen Jin, Guanjie Cheng, Naibo Wang, Ying Li 0001, Jianwei Yin. 16882-16902 [doi]
- CodeMEM: AST-Guided Adaptive Memory for Repository-Level Iterative Code GenerationPeiding Wang, Li Zhang, Fang Liu, Chongyang Tao, Yinghao Zhu. 16903-16917 [doi]
- HalluGuard: Evidence-Grounded Small Reasoning Models to Mitigate Hallucinations in Retrieval-Augmented GenerationLoris Bergeron, Ioana Buhnila, Jérôme François, Radu State. 16918-16932 [doi]
- Capabilities and Evaluation Biases of Large Language Models in Classical Chinese Poetry Generation: A Case Study on Tang PoetryBolei Ma, Yina Yao, Anna-Carolina Haensch. 16933-16957 [doi]
- SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code UnderstandingSongcheng Cai, Zhiheng Lyu, Yuansheng Ni, Xiangchao Chen, Baichuan Zhou, Shenzhe Zhu, Yi Lu, Haozhe Wang 0002, Chi Ruan, Benjamin Schneider, Weixu Zhang, Xiang Li, Andy Zheng, Yuyu Zhang, Ping Nie, Wenhu Chen. 16958-16999 [doi]
- Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric VisionChentao Li, Zirui Gao, Mingze Gao, Yinglian Ren, Jianjiang Feng, Jie Zhou. 17000-17019 [doi]
- Can Post-Training Transform LLMs into Causal Reasoners?Junqi Chen, Sirui Chen, Chaochao Lu. 17020-17038 [doi]
- MoE Adapter for Large Audio Language Models: Sparsity, Disentanglement, and Gradient-Conflict-FreeYishu Lei, Shuwei He, Hu Jing, Dan Zhang, Xianlong Luo, Danxiang Zhu, Shikun Feng, Rui Liu, Jingzhou He, Yu Sun 0004, Hua Wu 0003, Haifeng Wang 0001. 17039-17050 [doi]
- QaRL: Rollout-Aligned Quantization-Aware RL for Fast and Stable Training under Training-Inference MismatchHao Gu, Hao Wang 0097, Jiacheng Liu 0001, Lujun Li 0001, Qiyuan Zhu, Bei Liu, Binxing Xu, Lei Wang, Xintong Yang, Sida Lin, Sirui Han, Yike Guo. 17051-17064 [doi]
- Beyond Static Rules: Automated Discovery of Latent Vulnerabilities in Text-to-SQLHanqing Wang 0003, Yongdong Chi, Jian Yang 0003, Lei Yang 0048, Jiehui Zhao, Yun Chen 0007, Guanhua Chen 0001. 17065-17082 [doi]
- Can We Entrust Justice to AI?: How Persona Traps Contaminate Reasoning in Criminal InvestigationJaewook Lee, Myeong Cheol Kang, Jong-Hun Shin. 17083-17103 [doi]
- Beyond Semantic Similarity: Appraisal-Guided Chain-of-Thought Reasoning and Retrieval for Multimodal Emotional Support ConversationsYuqi Chu, Lizi Liao, Jinggui Liang, Boyang Li, Richang Hong. 17104-17119 [doi]
- When and What to Ask: AskBench and Rubric-Guided RLVR for LLM ClarificationJiale Zhao, Ke Fang, Lu Cheng. 17120-17140 [doi]
- FreezeEmpath: Efficient Training for Empathetic Spoken Chatbots with Frozen LLMsYun Hong, Yan Zhou, Yang Feng 0004. 17141-17157 [doi]
- To Intervene or Not: Guiding Inference-time Alignment with Probabilistic Model BlendingJin Gan, Xin Li 0070, Jun Luo 0001. 17158-17169 [doi]
- FLEXITOKENS: Flexible Tokenization for Evolving Language ModelsAbraham Toluwase Owodunni, Orevaoghene Ahia, Sachin Kumar 0009. 17170-17190 [doi]
- RAG in the Wild: On the (In)effectiveness of LLMs with Mixture-of-Knowledge Retrieval AugmentationRan Xu 0002, Yuchen Zhuang, Yue Yu 0001, Haoyu Wang 0003, Wenqi Shi, Carl Yang 0001. 17191-17206 [doi]
- Chain-of-Procedure: Hierarchical Visual-Language Reasoning for Procedural QAGuanhua Chen 0006, Yutong Yao, Shenghe Sun, Ci-Jun Gao, Shudong Liu 0004, Lidia S. Chao, Feng Wan, Derek F. Wong. 17207-17224 [doi]
- PEGRL: Improving Machine Translation by Post-Editing Guided Reinforcement LearningYunzhi Shen, Hao Zhou 0012, Xin Huang, Xue Han 0018, Junlan Feng, Shujian Huang. 17225-17242 [doi]
- RanLoRA: Residual-aware Nonlinear Low-Rank AdaptationXu Luo, Yongbin Liu, Chunping Ouyang, Ying Yu. 17243-17258 [doi]
- Multi-Hop Knowledge Editing via Critic-Guided Multi-Agent ReasoningXudong Li, Yuhang Tian 0002, Dandan Song 0005, Zhijing Wu 0001, Shuhao Zhang 0001, Jun Yang, Yongyu Huo, Changzhi Zhou, Xinyu Zhang, Chenhao Li, Huipeng Ma, Luan Zhang, Yan Xu, Qian Liu. 17259-17276 [doi]
- Rethinking Post-Unlearning Behavior of Large Vision-Language ModelsMinSung Kim, Nakyeong Yang, Kyomin Jung. 17277-17287 [doi]
- Scattered Hypothesis Generation for Open-Ended Event ForecastingHe Chang, Zhulin Tao, Lifang Yang, Xianglin Huang, Yunshan Ma 0002. 17288-17304 [doi]
- Context-attended Adversarial Reinforcement Learning for Robust Multi-step Retrieval Augmented GenerationYingtao Ren, Xiao Luo, Yu-Cheng Chang, Chin-Teng Lin. 17305-17319 [doi]
- From Pseudo-Balancing to True Specialization: Memory-Aware Routing for Mixture-of-ExpertsPeixuan Hou, Yunbo Hou, Bin Chen, Li He, Jian Xu, Weiping Li, Bo Zheng 0007, Guojie Song. 17320-17337 [doi]
- Learning to Retrieve User History and Generate User Profiles for Personalized Persuasiveness PredictionSejun Park, Yoonah Park, Jongwon Lim, Yohan Jo. 17338-17359 [doi]
- Understanding LLM Reasoning for Abstractive SummarizationHaohan Yuan, Haopeng Zhang. 17360-17386 [doi]
- Feasible is Not Enough: Cost-Aware Optimal Tool-Chain Planning on Multi-Solution Tool GraphsLiangliang Liu 0002, Yanming Li, Yigang Liu, Jialong Han, Rujia Shen, Yi Guan, Yi Lin, Jingchi Jiang. 17387-17403 [doi]
- DOS: Dependency-Oriented Sampler for Masked Diffusion Language ModelsXueyu Zhou, Yangrong Hu, Jian Huang. 17404-17419 [doi]
- BIASEDTALES-ML: A Multilingual Dataset for Analyzing Narrative Attribute Distributions in LLM-Generated StoriesYuxuan Ouyang, Yingfeng Luo, Jingbo Zhu, Tong Xiao 0001. 17420-17436 [doi]
- Rethinking Reasoning: A Survey on Reasoning-based Backdoors in LLMsMan Hu 0001, Xinyi Wu, Zhufeng Suo, Jinbo Feng, Linghui Meng, Yanhao Jia, Anh Tuan Luu, Shuai Zhao 0007. 17437-17456 [doi]
- From Tokens to Steps: Verification-Aware Speculative Decoding for Efficient Multi-Step ReasoningKiran Purohit, Ramasuri Narayanam, Soumyabrata Pal. 17457-17471 [doi]
- SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language ModelsYifu Huo, Chenglong Wang 0002, Ziming Zhu, Shunjie Xing, Peinan Feng, Tongran Liu, Qiaozhi He, Tianhua Zhou, Changxiaojia, Jingbo Zhu, Zhengtao Yu 0001, Tong Xiao 0001. 17472-17489 [doi]
- Memp: Exploring Agent Procedural MemoryRunnan Fang, Yuan Liang, XiaoBin Wang, Jialong Wu 0007, Shuofei Qiao, Pengjun Xie, Fei Huang 0002, Huajun Chen, Ningyu Zhang 0001. 17490-17502 [doi]
- ATLAS: Orchestrating Heterogeneous Models and Tools for Multi-Domain Complex ReasoningJinyang Wu, Guocheng Zhai, Ruihan Jin, Jiahao Yuan, Yuhao Shen, Shuai Zhang 0014, Zhengqi Wen, Jianhua Tao 0001. 17503-17535 [doi]
- SWE-AGILE: A Software Agent Framework for Efficiently Managing Dynamic Reasoning ContextShuquan Lian, Juncheng Liu, Yazhe Chen, Yuhong Chen, Hui Li. 17536-17550 [doi]
- CAR: Empowering Agents with Dynamic Tool Synthesis and Global Trajectory RectificationKai Wang, Xu Wang, Zhiyuan Fu, Yudong Zhang, Yang Wang. 17551-17571 [doi]
- FastDiSS: Few-step Match Many-step Diffusion Language Model on Sequence-to-Sequence GenerationDat Nguyen-Cong, Tung Kieu, Hoang Thanh-Tung. 17572-17592 [doi]
- GCIG: GraphRAG-based Cross-document Instruction Generation for Boosting LLM ReasoningXiaoliang Xu, Huang Yuan, Junmei Wang, Can Xu. 17593-17609 [doi]
- Towards General Agentic Intelligence via Environment ScalingRunnan Fang, Shihao Cai, Baixuan Li, Jialong Wu 0007, Guangyu Li, Wenbiao Yin, Xinyu Wang 0013, XiaoBin Wang, LiangCai Su, Zhen Zhang, Shibin Wu, Zhengwei Tao, Yong Jiang 0005, Pengjun Xie, Ningyu Zhang 0001, Fei Huang 0002, Wentao Zhang 0001, Jingren Zhou 0001. 17610-17621 [doi]
- EAIR: Entity-aware Inference-Time Knowledge Routing for Multi-Hop Knowledge EditingJungyu Lee, Kun-Hui Lee, Gyun Lee, Seung-Hoon Na. 17622-17645 [doi]
- Preventing Safety Drift in Large Language Models via Coupled Weight and Activation ConstraintsSongping Peng, Zhiheng Zhang, Daojian Zeng, Lincheng Jiang, Xieping Gao. 17646-17662 [doi]
- GAPO: Robust Advantage Estimation for Real-World Code LLMsJianqing Zhang, Zhezheng Hao, Wei Xia, Hande Dong, Hong Wang, Chenxing Wei, Yuyan Zhou, Yubin Qi, Qiang Lin, Jian Cao. 17663-17673 [doi]
- What's Missing in Screen-to-Action? Towards a UI-in-the-Loop Paradigm for Multimodal GUI ReasoningSongze Li, Xiaoke Guo, Tianqi Liu, Biao Yi, Zhaoyan Gong, Zhiqiang Liu, Huajun Chen, Wen Zhang. 17674-17690 [doi]
- When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math ReasoningRuotao Xu, Yixin Ji, Yu Luo, Jinpeng Li, Dong Li, Peifeng Li, Juntao Li 0005, Min Zhang 0005. 17691-17706 [doi]
- V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language ModelsXiangxi Zheng, Linjie Li, Zhengyuan Yang, Ping Yu, Alex Jinpeng Wang, Rui Yan, Yuan Yao, Lijuan Wang. 17707-17758 [doi]
- Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow OptimizationHuimin Xu, Shuai Zhao 0007, Xiaobao Wu, Anh Tuan Luu. 17759-17771 [doi]
- Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment TaxZeli Su, Ziyin Zhang, Zhou Liu, Xuexian Song, Zhankai Xu, Longfei Zheng, Xiaolu Zhang, Rong Fu, Guixian Xu, Wentao Zhang. 17772-17786 [doi]
- MEIC-DT: Memory-Efficient Incremental Clustering for Long-Text Coreference Resolution with Dual-Threshold ConstraintsKangyang Luo, Shuzheng Si, Yuzhuo Bai, Cheng Gao, Zhitong Wang, Cheng Huang, Yingli Shen, Yufeng Han, Wenhao Li 0003, Cunliang Kong, Maosong Sun 0001. 17787-17804 [doi]
- Lost in Diffusion: Uncovering Hallucination Patterns and Failure Modes in Diffusion Large Language ModelsZhengnan Guo 0001, Fei Tan. 17805-17818 [doi]
- FARSS: Fisher-Optimized Adaptive Low-Rank and Singular-Vector Selection for Knowledge-Preserving Fine-TuningRenxing Chen, Ziwei Xiang, Peisong Wang, Hongjian Fang, Meng Li, Fanhu Zeng, Yanan Zhu, Peipei Yang, Xu-Yao Zhang, Jian Cheng 0001. 17819-17837 [doi]
- Align Documents to Questions: Question-Oriented Document Rewriting for Retrieval-Augmented GenerationJiaang Li 0001, Zhendong Mao 0001, Quan Wang 0002, Yuning Wan, Yongdong Zhang 0001. 17838-17849 [doi]
- GlimpRouter: Efficient Collaborative Inference by Glimpsing One Token of ThoughtsWenhao Zeng, Xuteng Zhang, Yuling Shi, Chao Hu, Yuting Chen 0001, Beijun Shen, Xiaodong Gu 0002. 17850-17864 [doi]
- Plug-and-Play Data Module for Code RL: Adaptive Ambiguity ReplayJianqing Zhang, Wei Xia, Zhezheng Hao, Hong Wang, Hande Dong, Qiang Lin, Yang Liu, Jian Cao, Qiang Yang. 17865-17875 [doi]
- Can AI Revise Research Papers with Human Review Feedback? An Empirical Study and BenchmarkZihan Luo 0001, Hong Huang 0001, Jianxun Lian, Yu Chang, Xing Xie 0001, Hai Jin 0001. 17876-17893 [doi]
- Dunhuang-Bench: How Well Do MLLMs Understand Cultural Heritage?Junyi Yuan, Jian Zhang, Tianxiu Yu, Yanlin Zhou, Xiaobo Jin, Qiufeng Wang, Fangyu Wu 0001. 17894-17910 [doi]
- Multi-Docker-Eval: A 'Shovel of the Gold Rush' Benchmark on Automatic Environment Building for Software EngineeringKelin Fu, Tianyu Liu 0001, Zeyu Shang, Yingwei Ma, Jiaheng Liu, Jian Yang 0037, Kaigui Bian. 17911-17927 [doi]
- Not All Modalities at Once: Dynamic Dropout and Bidirectional Fusion for Robust Multi-modal Knowledge Graph CompletionJiashun Peng, Fu Zhang 0001, Hongzhi Chen, Jingwei Cheng, Yingsong Ning, Xiaoke Wang. 17928-17940 [doi]
- If Only My CGM Could Speak: A Privacy-Preserving Agent for Question Answering over Continuous Glucose DataYanjun Cui, Ali Emami, Temiloluwa Prioleau, Nikhil Singh 0013. 17941-17958 [doi]
- E-ABSA20K: A Dataset and Propose-and-Verify for Aspect-Based Sentiment Analysis in Long E-commerce ReviewsTong Sun, Mingyang Ma, Cheng Yu. 17959-17973 [doi]
- ECHA: Jailbreaking LVLMs via the Mismatch between Implicit Semantic Reconstruction and Explicit Safety AlignmentChenxing Xu, Junyong Jiang, Zehu Zhang, Lu Dong 0002. 17974-17990 [doi]
- Thinking with Map: Reinforced Parallel Map-Augmented Agent for GeolocalizationYuxiang Ji, Yong Wang, Ziyu Ma, Yiming Hu, Hailang Huang, Xuecai Hu, Guanhua Chen, Liaoni Wu, Xiangxiang Chu. 17991-18004 [doi]
- Revisiting Entropy Regularization: Adaptive Coefficient Unlocks Its Potential for LLM Reinforcement LearningXiaoyun Zhang, Xiaojian Yuan, Di Huang, Wang You, Chen Hu, Jingqing Ruan, Kejiang Chen, Xing Hu. 18005-18020 [doi]
- SLIP: Soft Label Mechanism and Key-Extraction-Guided CoT-based Defense Against Instruction Backdoor in APIsZhengxian Wu, Juan Wen, Wanli Peng, Haowei Chang, Yinghan Zhou, Yiming Xue. 18021-18042 [doi]
- U-Fold: Dynamic Intent-Aware Context Folding for User-Centric AgentsJin Su, Runnan Fang, Yeqiu Li, XiaoBin Wang, Shihao Cai, Pengjun Xie, Ningyu Zhang 0001, Fajie Yuan. 18043-18057 [doi]
- AdaTooler-V: Adaptive Tool-Use for Images and VideosChaoyang Wang, Kaituo Feng, Dongyang Chen, Zhongyu Wang, Zhixun Li, Sicheng Gao, Meng Meng, Xu Zhou, Manyuan Zhang, Yuzhang Shang, Xiangyu Yue 0001. 18058-18072 [doi]
- Exposing Privacy Risks in Graph Retrieval-Augmented GenerationJiale Liu, Jiahao Zhang, Suhang Wang. 18073-18093 [doi]
- BalanceSFT: Improving LLM Function Calling with Balanced Training Signals and Data HardnessBingguang Hao, Zengzhuang Xu, Maolin Wang 0001, Yuntao Wen, Yicheng Chen 0001, Cunyin Peng, Long Chen 0016, Xiangyu Zhao 0001, Jinjie Gu, Chenyi Zhuang, Ji Zhang. 18094-18112 [doi]
- How Robust Are Large Language Models for Clinical Numeracy? An Empirical Study on Numerical Reasoning Abilities in Clinical ContextsMinh-Vuong Nguyen, Fatemeh Shiri, Zhuang Li, Karin Verspoor. 18113-18129 [doi]
- Safety-Aware Dialogue System for Postoperative Oral Cancer Care with Structured Clarification and a Clinically Curated DatasetTzu-chi Liu, Hui Ying Yang, Shiow-Ching Shun, Yu-Chi Chen, Lu-Yen Anny Chen, Yong-Sheng Chen. 18130-18142 [doi]
- FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language ModelingGuixian Xu, Yide Liang, Zeli Su, Xuexian Song, Ziyin Zhang, Yushuang Dong, Ting Zhang, Xu Han. 18143-18159 [doi]
- DeepMed: Building a Medical DeepResearch Agent via Multi-hop Med-Search Data and Turn-Controlled Agentic Training & InferenceZihan Wang, Hao Wang, Shi Feng 0001, Xiaocui Yang, Daling Wang, Yiqun Zhang, Jinghao Lin, Xiaozhong Ji, Haihua Yang. 18160-18178 [doi]
- Softpick: No Attention Sink, No Massive Activations with Rectified SoftmaxZayd Muhammad Kawakibi Zuhri, Erland Hilman Fuadi, Alham Fikri Aji. 18179-18213 [doi]
- UniCM: A Unified Consistency Model For Efficient Multimodal Generation and UnderstandingChenkai Xu, Xu Wang, Zhenyi Liao, Yishun Li, Tianqi Hou, Zhijie Deng. 18214-18233 [doi]
- Can Multi-agent Help Disambiguation in Multi-domain Translation?Zhibo Man, Shaoyang Xu, Yujie Zhang, Yi Feng, Yuanmeng Chen, Yufeng Chen 0005, Jinan Xu, Wenxuan Zhang. 18234-18244 [doi]
- Agent-Dice: Disentangling Knowledge Updates via Geometric Consensus for Agent Continual LearningZheng Wu, Xingyu Lou, Xinbei Ma, Yansi Li, Weiwen Liu, Weinan Zhang 0001, Jun Wang, Zhuosheng Zhang 0001. 18245-18262 [doi]
- Automatic Slide Updating with User-Defined Dynamic Templates and Natural Language InstructionsKun Zhou, Jiakai He, Wenmian Yang, Zhensheng Wang, Yiquan Zhang, Weijia Jia 0001. 18263-18297 [doi]
- PretrainRL: Alleviating Factuality Hallucination of Large Language Models at the BeginningLangming Liu, Kangtao Lv, Haibin Chen, Weidong Zhang, Yejing Wang, Shilei Liu, Xin Tong, Yujin Yuan, Yongwei Wang, Wenbo Su, Bo Zheng 0007. 18298-18310 [doi]
- OMHBench: Benchmarking Balanced and Grounded Omni-Modal Multi-Hop ReasoningSeunghee Kim, Ingyu Bang, Seokgyu Jang, Changhyeon Kim, Sanghwan Bae, Jihun Choi, Richeng Xuan, Taeuk Kim. 18311-18334 [doi]
- Beyond Uniform SVD: Dual-Level Optimization across Columns and Modules for LLM CompressionLin Xv, Xian Gao, Ting Liu, Yuzhuo Fu. 18335-18349 [doi]
- RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic ScenariosYibo Zhang, Kaiwen Luo, Liang Lin 0004, Shilinlu Yan, Jin Wang, Yaoqi Guo, Yitian Chen 0003, Yalan Qin, Zhenhong Zhou, Kun Wang 0056, Li Sun 0008. 18350-18374 [doi]
- MedLayBench-V: A Large-Scale Benchmark for Expert-Lay Semantic Alignment in Medical Vision Language ModelsHan Jang, Junhyeok Lee, Heeseong Eum, Kyu Sung Choi. 18375-18394 [doi]
- Divergent Thinking: Escape the Homogeneity Trap in Generative Commonsense ReasoningYiheng Tao, Kaiwen Cheng, Zhiwei Nie, Chang Liu, Jie Chen 0001. 18395-18410 [doi]
- SafeSteer: A Decoding-level Defense Mechanism for Multimodal Large Language ModelsXinyi Zeng, Xue Yang, Jingyuan Zhang, Huanqian Yan, Xiang Chen, Kaiwen Wei, Hankun Kang, Yu Tian. 18411-18422 [doi]
- SEMA-RAG: A Self-Evolving Multi-Agent Retrieval-Augmented Generation Framework for Medical ReasoningYongfeng Huang, Ruiying Chen, James Cheng. 18423-18442 [doi]
- On the Step Length Confounding in LLM Reasoning Data SelectionBing Wang 0018, Rui Miao, Chen Shen 0003, Shaotian Yan, Kaiyuan Liu, Ximing Li 0002, Xiaosong Yuan, Sinan Fan, Jun Zhang, Jieping Ye. 18443-18457 [doi]
- SLIM: Stealthy Low-Coverage Black-Box Watermarking via Latent-Space Confusion ZonesHengyu Wu, Yang Cao. 18458-18473 [doi]
- SQL-ASTRA: Alleviating Sparse Feedback in Agentic SQL via Column-Set Matching and Trajectory AggregationLong Li, Zhijian Zhou, Jiangxuan Long 0001, Peiyang Liu, Weidi Xu, Zhe Wang 0001, Shirui Pan, Chao Qu. 18474-18491 [doi]
- Rotation Control Unlearning: Quantifying and Controlling Continuous Unlearning for LLM with The Cognitive Rotation SpaceXiang Zhang, Kun Wei, Xu Yang 0019, Jiahua Li, Su Yan, Cheng Deng 0002. 18492-18510 [doi]
- SpecEdit: A Spectral Approach for Multi-Round Knowledge EditingJunxian Liu, Zikun Deng, Xin Wu 0003, Dazhen Deng, Yi Cai 0001. 18511-18524 [doi]
- SAGE: Sign-Adaptive Gradient for Memory-Efficient LLM OptimizationWooin Lee, Hyun-Tae Kim. 18525-18537 [doi]
- DP³: Differentially Private Prompt Perturbation for Multi-turn LLM InferenceLele Zheng, Chao Zhang, Feiyang Yuan, Ke Cheng 0001, Tao Zhang 0029, Anxiao Song, Yulong Shen 0001. 18538-18552 [doi]
- RAMP: Risk-Aware Multi-Turn Planning for Jailbreak Red-TeamingYize Liu, Yunyun Hou, Aina Sui. 18553-18564 [doi]
- LexGenius: An Expert-Level Benchmark for Large Language Models in Legal General IntelligenceWenjin Liu, Haoran Luo 0001, Xin Feng, Xiang Ji, Lijuan Zhou, Rui Mao 0010, Jiapu Wang, Shirui Pan, Erik Cambria. 18565-18585 [doi]
- From Attenuation to Attention: Variational Information Flow Manipulation for Fine-Grained Visual PerceptionJilong Zhu, Yang Feng. 18586-18597 [doi]
- VulAgent: Hypothesis-Validation Driven Multi-Agent Architecture for Vulnerability DetectionZiliang Wang, Ge Li 0001, Jia Li 0012, Hao Zhu, Zhi Jin 0001. 18598-18616 [doi]
- From Attack Surfaces to Actual Operations: A Survey of Modern LLM JailbreaksRuikang Zhou, Changsheng Sun, Mark Huasong Meng. 18617-18643 [doi]
- ARC: Active and Reflection-driven Context Management for Long-Horizon Information Seeking AgentsYilun Yao, Shan Huang, Elsie Dai, Zhewen Tan, Zhenyu Duan, Shousheng Jia, Yanbing Jiang, Tong Yang 0003. 18644-18659 [doi]
- ToolDNA: Autonomous Evolution of Tool Metadata for Robust Dialogue AgentsQiuyuan Ai, Cong Wang, Jiaqi Zhang, Zengxin Han, Jie Song 0002. 18660-18678 [doi]
- ExpertIVS: Sociological Expert Driven Individual Value Simulation in Large Language ModelsZhen Wang, Yuqi Ren, Yuehan Cui, Hongxiang Wang, Jianxiang Peng, Zhaoxia Zhang, Bingkun Zhu, Tongxuan Zhang, Dezhi Tong, Deyi Xiong. 18679-18699 [doi]
- Be Your Own Red Teamer: Safety Alignment via Self-Play and Reflective Experience ReplayHao Wang 0003, Yanting Wang, Hao Li 0031, Rui Li 0094, Lei Sha. 18700-18716 [doi]
- RetentiveKV: State-Space Memory for Uncertainty-Aware Multimodal KV Cache EvictionSihao Liu, Yufan Xiong, Zhonghua Jiang 0006, Zhaode Wang, Chengfei Lv, Shengyu Zhang 0001. 18717-18727 [doi]
- RCBSF: A Multi-Agent Framework for Automated Contract Revision via Stackelberg GameShijia Xu, Yu Wang, Xiaolong Jia, Zhou Wu, Kai Liu, April Xiaowen Dong. 18728-18756 [doi]
- RAVR: Reference-Answer-guided Variational Reasoning for Large Language ModelsTianqianjin Lin, Xi Zhao, Xingyao Zhang 0003, Rujiao Long, Yi Xu, Zhuoren Jiang, Wenbo Su, Bo Zheng 0007. 18757-18775 [doi]
- Data-Centric Continual Pre-training for 500+ Languages: A New Bilingual Translation Corpus and Multilingual ModelsShaoxiong Ji, Zihao Li, Jaakko Paavola, Hengyu Luo, Jörg Tiedemann. 18776-18807 [doi]
- Failures are Treasures: Constructing a Pedagogical Bridge for Agentic Strategy DistillationJiaxin Guo, Hao Sun, Wenhao Zhang, Chunyu Yang, Yan Zhang. 18808-18823 [doi]
- Privacy-Preserving Reasoning with Knowledge-Distilled Parametric Retrieval Augmented GenerationJinwen Chen 0001, Hainan Zhang 0001, Liang Pang 0001, Yongxin Tong, Haibo Zhou, Wei Lin, Zhiming Zheng 0001. 18824-18838 [doi]
- Beyond Sentence-level Labels: Integrating Conversational Context and Personal Experience for Natural Emotional ExpressionHaiyang Sun 0004, Chenyang Le, Wei Wang 0010, Leying Zhang, Chuang Li, Bing Han 0008, Chenda Li, Mengxiao Bi, Yanmin Qian. 18839-18854 [doi]
- Structure-Aware Zero-Shot Relational Learning for Knowledge Graphs without External KnowledgeKuan Xu, Baoxin Zhang, Shuyue Fan, Ming Chen, Zhipeng Ke, Jian Yu 0001, Xuezhong Zhou. 18855-18869 [doi]
- Continual Safety Alignment via Gradient-Based Sample SelectionThong Bach, Dung Nguyen 0001, Thao Minh Le, Truyen Tran 0001. 18870-18887 [doi]
- ClinicalMC: A Benchmark for Multi-Course Clinical Decision-Making with Large Language ModelsRuihui Hou, Siyi Zhu, Ziyue Huai, Guangya Yu, Yongqi Fan, Chunming Wang, Tong Ruan. 18888-18915 [doi]
- Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation FrameworkJiaqi Weng, Han Zheng, Hanyu Zhang, Ej Zhou, Qinqin He, Jialing Tao, Hui Xue 0001, Zhixuan Chu, Xiting Wang. 18916-18935 [doi]
- Graph-Assisted Large Language Models: A Perspective on Mitigating Intrinsic LimitationsHaitong Luo, Fali Wang, Weiyao Zhang, Xianren Zhang, Zhiwei Zhang 0028, Tianxiang Zhao 0001, Minhua Lin, Jiahao Zhang, Hui Liu, Xianfeng Tang, Qi He 0002, Suhang Wang, Xuying Meng, Yujun Zhang 0001. 18936-18955 [doi]
- GUITester: Enabling GUI Agents for Exploratory Defect DiscoveryYifei Gao, Jiang Wu, Xiaoyi Chen, Yifan Yang, Zhe Cui, Tianyi Ma, Jiaming Zhang, Jitao Sang. 18956-18978 [doi]
- BiCSRouter: Bi-Level Cross-System Routing for Utility-Aware LLM InferenceKeyu Mao, Eiki Murata, Ukyo Honda. 18979-18993 [doi]
- FAER: Benchmarking VLMs for Failure-Aware Embodied ReasoningHao Song, Kaifeng Liu, Yuanxing Liu 0001, Xiang Tian, Xuesong Wang, Chen Yifan, Weinan Zhang 0003, Ting Liu 0001. 18994-19016 [doi]
- Reverse Constitutional AI: A Framework for Controllable Toxic Data Generation via Probability-Clamped RLAIFYuan Fang, Yiming Luo, Aimin Zhou, Fei Tan. 19017-19039 [doi]
- ToolGrad: Efficient Tool-use Dataset Generation with Textual "Gradients"Zhongyi Zhou, Kohei Uehara, Haoyu Zhang, Jingtao Zhou, Lin Gu 0003, Ruofei Du, Zheng Xu 0002, Tatsuya Harada. 19040-19056 [doi]
- Unlocking Exploration in RLVR: Uncertainty-aware Advantage Shaping for Deeper ReasoningCan Xie, Ruotong Pan, Xiangyu Wu, Yunfei Zhang, Jiayi Fu, Tingting Gao, Guorui Zhou. 19057-19076 [doi]
- GlossaGen: Making Academic Translation Smarter with GlossingZixiao Wang, Duzhen Zhang, Juntian Zhang, Yuhan Liu, Guoming Li, Haolun Wu, Le Song, Xiuying Chen. 19077-19095 [doi]
- DeCoVec: Building Decoding Space based Task Vector for Large Language Models via In-Context LearningFeiyang Li, Yile Wang. 19096-19111 [doi]
- Hebbian-Guided Bi-Directional Rank Adaptation for Parameter-Efficient Fine-TuningXing Zhao, Liu Yang 0010, Xi-Le Zhao, Yueqi Yang, Tianqi Jiang. 19112-19128 [doi]
- StruNRAG: Evaluation of OCR-Induced Structural Noise on RAG RobustnessMengna Gao, Dapeng Yin, Shuyue Zhu, Bingxuan Hou, Zhanpeng Ni, Junli Wang 0001. 19129-19148 [doi]
- Memory as Action: Autonomous Context Curation for Long-Horizon Agentic TasksYuxiang Zhang, Jiangming Shu, Ye Ma, Xueyuan Lin, Shangxi Wu, Jitao Sang. 19149-19164 [doi]
- Experience is the Teacher: Reusing Atomic Thoughts from LLMs to Improve Medical DialogueGuangya Yu, Hui Luo, Qi Ye 0004, Ruihui Hou, Weiyan Zhang, Mingxi Shang, Xuanwu Li, Chunming Wang, Tong Ruan. 19165-19184 [doi]
- Beyond Static Personas: Situational Personality Steering for Large Language ModelsZesheng Wei, Mengxiang Li, Zilei Wang, Yang Deng 0002. 19185-19210 [doi]
- Born Pragmatic, Trained to Hallucinate? Quantifying the Origins of Contextual Bias in LLMs via the PaCE BenchmarkZiming Li, Yu Tian, Tian Lan, Jiang Li, Zehua Duo, Guanglai Gao, Xiangdong Su. 19211-19235 [doi]
- Domain-Specific Data Generation Framework for RAG AdaptationChris Xing Tian, Weihao Xie, Zhen Chen, Hui Liu 0036, Zhengyuan Yi, Haoliang Li, Shiqi Wang 0001, Siwei Ma 0001. 19236-19250 [doi]
- Tracing Mathematical Proficiency Through Problem-Solving ProcessesJungyang Park, Suho Kang, Jaewoo Park 0003, Jaehong Kim, Jaewoo Shin 0003, Seonjoon Park, Youngjae Yu. 19251-19269 [doi]
- Decision Biases and Intent-Irony Decoupling in Large Language ModelsKewei Guo, Lingyun Sun, Manhao Guan. 19270-19287 [doi]
- Anonpsy: A Graph-Based Framework for Structure-Preserving De-identification of Psychiatric NarrativesKyungho Lim, Byung-Hoon Kim. 19288-19311 [doi]
- HearSay Benchmark: Do Audio LLMs Leak What They Hear?Jin Wang, Kaiwen Luo, Liang Lin 0004, Weiliu Wang, Yitian Chen 0003, Moayad Aloqaily, Xuehai Tang, Zhenhong Zhou, Kun Wang 0056, Li Sun 0008, Qingsong Wen. 19312-19331 [doi]
- LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video UnderstandingZhaoyang Han, Qihan Lin, Hao Liang 0017, Bowen Chen, Zhou Liu, Wentao Zhang 0001. 19332-19358 [doi]
- Fixing Semantic Blind Spots in Anchor Tokens of dMLLMsRuixuan Xu, Jiexi Xu, Qiyan Zhao, Xiaofeng Zhang. 19359-19374 [doi]
- Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMsLinhao Zhang, Yuhan Song, Aiwei Liu, Chuhan Wu, Sijun Zhang, Wei Jia, Yuan Liu, Houfeng Wang, Zhou Xiao. 19375-19390 [doi]
- From Style to Story: A Curriculum Learning Approach for Imitative Novel GenerationXueran Han, Yuhan Liu 0023, Mingzhe Li 0001, Wei Liu 0005, Sen Hu, Rui Yan 0001, Zhiqiang Xu 0003, Xiuying Chen. 19391-19408 [doi]
- ArkRepoBench: A Repository-Level Code Completion Benchmark for HarmonyOS DevelopmentYanlin Wang 0001, Bowen Zhang, Yanli Wang 0001, Daya Guo, Terry Yue Zhuo, Jiachi Chen, Mingwei Liu 0002, Xingong Zhang, Zibin Zheng. 19409-19429 [doi]
- e5-omni: Explicit Cross-modal Alignment for Omni-modal EmbeddingsHaonan Chen 0005, Sicheng Gao, Radu Timofte, Tetsuya Sakai, Zhicheng Dou. 19430-19443 [doi]
- Large Language Models Are Still Misled by Simple Bias EnsemblesZhouhao Sun, Zhiyuan Kan, Xiao Ding, Li Du, Bibo Cai, Yang Zhao 0023, Bing Qin 0001, Ting Liu 0001. 19444-19455 [doi]
- Text-to-TrajVis: Enabling Trajectory Data Visualizations from Natural Language QuestionsTian Bai 0002, Huiyan Ying, Kailong Suo, Victor Junqiu Wei, Tao Fan 0002, Yuanfeng Song. 19456-19475 [doi]
- MemTR: Enhancing Tool-Calling Reliability via Uncertainty-Triggered FFN-Space RetracingHongtao Duan 0003, Lu Jiang, Minying Zhang, Xiaobing Zhu, Tianpeng Bu, Hao Jiang, Xinyu Wei, Lulu Hu. 19476-19493 [doi]
- More Than Sum of Its Parts: Deciphering Intent Shifts in Multimodal Hate Speech DetectionRunze Sun, Yu Zheng 0015, Zexuan Xiong, Zhongjin Qu, Lei Chen 0069, Jie Zhou 0001, Jiwen Lu. 19494-19514 [doi]
- Specialization without Sparsity: Efficient and Expressive Split-Path Experts for LLM Fine-TuningGanghao Liu, Qin Zhou 0002, Zhe Wang 0002, Xuehan Lu, Haihua Huang, Yunfei Tong, Heng Tian. 19515-19527 [doi]
- Pardon? Evaluating Conversational Repair in Large Audio-Language ModelsShuanghong Huang, Jinlei Xu, Youchao Zhou, Yanghao Zhou, Xuan Zhao, Chong Feng, Wenxuan Zhang. 19528-19541 [doi]
- ToxReason: A Benchmark for Mechanistic Chemical Toxicity Reasoning via Adverse Outcome PathwayJueon Park, Wonjune Jang, Chanhwi Kim, Yein Park, Jaewoo Kang. 19542-19564 [doi]
- CVRH: Cross-modal Variational Role Hypergraph Network via Semantic Enhancement for Multi-modal Event Argument ExtractionBangze Pan, Yang Li 0074, Ruili Pu, Suge Wang, Jian Liao 0005, Jianxing Zheng, Xiaoli Li 0001, Deyu Li 0001. 19565-19575 [doi]
- DiffCL: Difference-Aware Contrastive Learning for Automatic Answer Grading with Multi-Level Semantic ModelingLei Chen 0088, Boyu Gao 0003, Zitao Liu 0001, Tingjie Wan, Weiqi Luo 0002. 19576-19589 [doi]
- GaLa: Hypergraph-Guided Visual Language Models for Procedural PlanningKun Wang, Yiming Li, Mingcheng Qu, Aqiang Zhang, Guang Yang, Tonghua Su. 19590-19603 [doi]
- TwinVoice: A Multi-dimensional Benchmark Towards Digital Twins via LLM Persona SimulationBangde Du, Minghao Guo, Songming He, Ziyi Ye, Xi Zhu, Weihang Su, Shuqi Zhu, Yujia Zhou 0002, Yongfeng Zhang 0003, Qingyao Ai, Yiqun Liu 0001. 19604-19628 [doi]
- CE-RM: A Pointwise Generative Reward Model Optimized via Two-Stage Rollout and Unified CriteriaXinyu Hu 0001, Yancheng He, Weixun Wang, Tao Feng, Li Lin 0014, Jiashun Liu, Wenbo Su, Bo Zheng 0007, Xiaojun Wan 0001. 19629-19642 [doi]
- Hard to Read, Easy to Jailbreak: How Visual Degradation Bypasses MLLM Safety AlignmentZhixue Song, Boyan Han, Yiwei Wang 0001, Chi Zhang 0007. 19643-19658 [doi]
- Unleashing the Native Recommendation Potential: LLM-Based Generative Recommendation via Structured Term IdentifiersZhiyang Zhang, Junda She, Kuo Cai, Bo Chen 0023, Shiyao Wang 0001, Xinchen Luo, Qiang Luo 0004, Ruiming Tang, Han Li 0005, Kun Gai, Guorui Zhou. 19659-19673 [doi]
- Abstain-R1: Calibrated Abstention and Post-Refusal Clarification via Verifiable RLHaotian Zhai, Jingcheng Liang, Dongyeop Kang. 19674-19695 [doi]
- Learning Through Dialogue: Engagement and Efficacy Matter More Than ExplanationsShaz Furniturewala, Gerard Christopher Yeo, Kokil Jaidka. 19696-19711 [doi]
- CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional CodebookZeyu Chen, Jie Li, Kai Han. 19712-19738 [doi]
- MASS: Deep Research for Social Sciences with Memory-Augmented Social SimulationYongrui Liu, Deyi Xiong. 19739-19758 [doi]
- LS-Guard: Adaptive Safety Guardrails Tailored to Individual LLMsJinggui Liang, Lizi Liao. 19759-19772 [doi]
- Rethinking LLM Watermark Detection in Black-Box Settings: A Non-Intrusive Third-Party FrameworkZhuoshang Wang, Yubing Ren, Yanan Cao 0001, Fang Fang 0009, Xiaoxue Li, Li Guo 0001. 19773-19790 [doi]
- Deputy: Accelerating Large Language Model Inference with Dynamic Low-Rank SubstitutionYuhua Zhou, Shichao Weng, Changhai Zhou, Yuhan Wu, Qian Qiao, Jun Gao, Fei Yang, Aimin Pan. 19791-19810 [doi]
- SGG-R^ 3: From Next-Token Prediction to End-to-End Unbiased Scene Graph GenerationJiaye Feng, Qixiang Yin, Yuankun Liu, Tong Mo, Weiping Li. 19811-19830 [doi]
- Preserving Fairness and Safety in Quantized LLMs Through Critical Weight ProtectionMuhammad Alif Al Hakim, Alfan Farizki Wicaksono, Fajri Koto. 19831-19855 [doi]
- X-Router: Decoupling Knowledge and Reasoning for Cost-Effective LLM InferenceZixuan Wang, Yinze Ding, Zihan Wang, Jinyu Guo, Zhenhong Zhou, Junhao Dong 0001, Chaomeng Chen. 19856-19874 [doi]
- SPD-Faith Bench: Diagnosing and Improving Faithfulness in Chain-of-Thought for Multimodal Large Language ModelsWeijiang Lv, Yaoxuan Feng, Xiaobo Xia, Jiayu Wang, Yan Jing, Wenchao Chen, Bo Chen. 19875-19927 [doi]
- HIPO: A Hierarchical Prompt Optimization Framework with Task Awareness and Fine-Grained DebuggingLu Qi, Lei Chai, Hongrui Yu, Binhang Qi, Hailong Sun 0001. 19928-19947 [doi]
- MAPLE: A Meta-learning Framework for Cross-Prompt Essay ScoringSalam Albatarni, May Bashendy, Sohaila Eltanbouly, Tamer Elsayed. 19948-19961 [doi]
- RACER: Retrieval-Augmented Contextual Rapid Speculative DecodingZihong Zhang, Zuchao Li, Lefei Zhang, Ping Wang 0028, Hai Zhao 0001. 19962-19988 [doi]
- PEC-Home: Interpretation of Progressively Elliptical Commands in Smart HomesYingyu Shan, Zeming Liu, Silin Li, Boao Qian, Jiashu Yao, Yuhang Guo 0001, Haifeng Wang 0001. 19989-20006 [doi]
- Towards IP Intelligence: Benchmarking Large Language Models on Intellectual Property Knowledge and PracticeQiyao Wang, Guhong Chen, Hongbo Wang, Huaren Liu, Minghui Zhu, Zhifei Qin, Linwei Li, Yilin Yue, Shiqiang Wang, Jiayan Li, Yihang Wu, Ziqiang Liu, Longze Chen, Run Luo, Liyang Fan, Jiaming Li 0004, Lei Zhang 0201, Kan Xu, Hamid Alinejad-Rokny, Chengming Li 0004, Shiwen Ni, Yuan Lin, Min Yang 0007. 20007-20052 [doi]
- EchoMLLM: Incentivizing Echocardiographic Video Understanding with Keyframe Grounding and Report GenerationHeyu Huang, Wanran Sun, Chi Chen 0005, Bo Chen, Zonghao Guo, Yuhua Li 0003, Ruixuan Li 0001, Kunlun He, Maosong Sun 0001. 20053-20071 [doi]
- HAUNTATTACK: When Attack Follows Reasoning as a ShadowJingyuan Ma, Rui Li, Zheng Li, Junfeng Liu, Heming Xia, Lei Sha, Zhifang Sui. 20072-20091 [doi]
- Rethinking Multiple-Choice Questions for RLVR: Unlocking Potential via Distractor DesignXu Guo 0004, Qiming Ge, Jian Tong, Kedi Chen, Jin Zhang, Xiaogui Yang, Xuan Gao, Haijun Lv, Zhihui Lu 0002, Yicheng Zou, Qipeng Guo. 20092-20113 [doi]
- S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech TranslationYu Pan 0008, Xiongfei Wu, Yuguang Yang 0005, Jixun Yao, Maxime Cordy, Lei Ma 0003, Jianjun Zhao 0001. 20114-20124 [doi]
- G-LoRA: Global-Local Decoupled Low-Rank AdaptationJiahao Xiong, Yihong Huang, Yihe Liu, Xianming Hu, Hongbo Zhao, Kai Zhang. 20125-20141 [doi]
- Making MLLMs Blind: Adversarial Smuggling Attacks in MLLM Content ModerationZhiheng Li, Zongyang Ma, Yuntong Pan, Ziqi Zhang, Xiaolei Lv, Bo Li 0114, Jun Gao, Jianing Zhang, Chunfeng Yuan, Bing Li 0001, Weiming Hu 0004. 20142-20161 [doi]
- LatentRefusal: Latent-Signal Refusal for Unanswerable Text-to-SQL QueriesXuancheng Ren, Shijing Hu 0001, Zhihui Lu 0002, Jiangqi Huang, Qiang Duan 0002. 20162-20179 [doi]
- Where meaning lives: Layer-wise accessibility of psycholinguistic features in encoder and decoder language modelsTaisiia Tikhomirova, Dirk U. Wulff. 20180-20205 [doi]
- DynamicFocalPO: Adaptive Focusing Strategy for Preference OptimizationShu Zhou, Junan Chen, Rui Ling, Xin Wang, Tao Fan, Hao Wang. 20206-20221 [doi]
- Graph-GRPO: Stabilizing Multi-Agent Topology Learning via Group Relative Policy OptimizationYueyang Cang, Xiaoteng Zhang, Erlu Zhao, Zehua Ji, Yuhang Liu, Yuchen He, Zhiyuan Ning, Chen Yijun, Wenge Que, Li Shi. 20222-20231 [doi]
- ReMedi: Reasoner for Medical Clinical PredictionYushi Cao, Yiming Chen 0010, Hongchao Jiang, Hung-yi Lee, Robby T. Tan. 20232-20241 [doi]
- JX4MEI: Multimodal Semantically-Enhanced LLM for Joint Multimodal Emotion-Intent Explanation and ClassificationYijie Huang, Xiaocui Yang, Shi Feng 0001, Daling Wang, Yifei Zhang 0003, Ning Yuan, Zhuoyue Jia, Wen Zhang. 20242-20261 [doi]
- Breaking the "Provable Security": Detecting Finite-Precision Artifacts in LLM-based Steganography via Low-Probability VanishingWenzhao Cao, Yaofei Wang, Donghui Hu. 20262-20274 [doi]
- FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought ReasoningYuxi Sun 0011, Aoqi Zuo, Haotian Xie, Wei Gao 0001, Mingming Gong, Jing Ma 0004. 20275-20293 [doi]
- DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-TuningChao Huang 0033, Zeliang Zhang 0001, Jiang Liu 0014, Ximeng Sun, Jialian Wu, Xiaodong Yu, Ze Wang 0008, Chenliang Xu, Emad Barsoum, Zicheng Liu 0001. 20294-20309 [doi]
- Mitigating Hallucinations in VLMs: Enhancing Visual Attention via Head-Wise PerturbationZhenghua Wang, Yixin Wu 0005, Feiran Zhang, Qi Qian, Changze Lv, Xuanjing Huang 0001, Xiaoqing Zheng. 20310-20321 [doi]
- Modeling Multi-Dimensional Cognitive States in Large Language Models under Cognitive CrowdingLin Zhong, Siyu Zhu, Zizhen Yuan, Jinhao Cui, Xinyang Zhao, Lingzhi Wang 0001, Hao Chen 0002, Qing Liao 0001. 20322-20350 [doi]
- EmoMM: Benchmarking and Steering MLLM for Multimodal Emotion Recognition under Conflict and MissingnessYueru Sun, Yimeng Zhang, Haoyu Gu, Nuo Chen, Dong She, Xianrong Yao, Yang Gao 0025, Zhanpeng Jin. 20351-20371 [doi]
- Veri-R1: Toward Precise and Faithful Claim Verification via Online Reinforcement LearningQi He, Cheng Qian 0008, Xiusi Chen, Bingxiang He, Yi R. Fung 0001, Heng Ji 0001. 20372-20391 [doi]
- MimicLM: Zero-Shot Voice Imitation through Autoregressive Modeling of Pseudo-Parallel Speech CorporaTao Feng, Yuxiang Wang, Yuancheng Wang, Xueyao Zhang, Dekun Chen, Chaoren Wang, Xun Guan, Zhizheng Wu 0001. 20392-20405 [doi]
- Fine-Grained Data Ordering Improves Fine-Tuning for Large Language ModelsXiaomeng Hu, Yixuan Tang, Haoze Li, Hao Chen, Qi Zhang, Zhanming Shen, Yiming Zhang, Haobo Wang, Junbo Zhao. 20406-20418 [doi]
- LifeSim: Long-Horizon User Life Simulator for Personalized Assistant EvaluationFeiyu Duan, Xuanjing Huang 0001, Zhongyu Wei. 20419-20463 [doi]
- Interactive Semantic Parsing with Reinforcement Learning for Knowledge Graph ReasoningYurun Song, Xiangqing Shen, Jianfei Yu, Rui Xia. 20464-20484 [doi]
- CLewR: Curriculum Learning with Restarts for Machine Translation Preference LearningAlexandra Dragomir, Florin Brad, Radu-Tudor Ionescu. 20485-20496 [doi]
- Targeting the Needle, Ignoring the Haystack: Anchoring Crucial Cues for Evolving Scam Call Detection via an LLM-Assisted ClassifierTong Wu, Qinliang Su, Jianxing Yu, Bo Liang, Minhua Huang 0002. 20497-20513 [doi]
- Distributional Alignment for Large Language Models under Domain ShiftViet-Thanh Pham, Lizhen Qu, Zhuang Li 0001, Gholamreza Haffari. 20514-20528 [doi]
- Traces in the Brain: Neural Evidence for Syntactic Movement in English and ChineseYuhan Huang, Zhengwu Ma, Yuqi Jin, Beth Chan, Zheng Shen, Jackie Yan-Ki Lai, John T. Hale, Jixing Li. 20529-20543 [doi]
- LinguaGame: A Linguistically Grounded Game-Theoretic Paradigm for Multi-Agent Dialogue GenerationYuxiao Ye, Yiming Zhang, Yiran Rex Ma, Huiyuan Xie, Huining Zhu, Zhiyuan Liu. 20544-20558 [doi]
- A Dual-View Analysis of Multiple Languages in Colonial NewspapersZhan Su 0002, Xiaoya Chen, Fengran Mo, Ida L. Vos, Prayag Tiwari, Yazhou Zhang 0001, Qian Zheng, Natalia da Silva Perez. 20559-20573 [doi]
- CARE-CR: Context-Aware Routing and Expert Fusion for Multi-Preference Cognitive RestructuringHongzhi Qi, Liangcheng Wang, Yijing Yu, Jianqiang Li 0002, Bing Xiang Yang, Qing Zhao 0005. 20574-20588 [doi]
- EvoCoT: Overcoming the Exploration Bottleneck in Reinforcement Learning for LLMsHuanyu Liu 0001, Jia Li 0012, Yihong Dong, Chang Yu, Taozhi Chen, Lecheng Wang, Yongding Tao, Bin Gu 0006, Ge Li 0001. 20589-20603 [doi]
- Context as a Tool: Context Management for Long-Horizon SWE-AgentsShukai Liu, Bo Jiang 0002, Jian Yang 0003, Yizhi Li, Jinyang Guo 0002, Xianglong Liu 0001, Bryan Dai. 20604-20617 [doi]
- Beyond Static Profiles: Capturing the Fluidity of User Preferences in Diverse ScenariosChunyang Gao, Yi Huang 0017, Jingyu Yao, Xiaoting Wu, Junlan Feng. 20618-20634 [doi]
- Mitigating Coordinate Prediction Bias from Positional Encoding FailuresXingjian Tao, Yiwei Wang 0001, Yujun Cai, Yihong Luo, Kai Han 0003, Jing Tang 0004. 20635-20650 [doi]
- PerDucer: Keyphrase-Driven Personalization Inducer for Summarization from User HistoriesParthiv Chatterjee, Asish Joel Batha, Sourish Dasgupta, Tanmoy Chakraborty 0002. 20651-20677 [doi]
- Beyond A Fixed Seal: Adaptive Stealing Watermark in Large Language ModelsShuhao Zhang 0011, Yuli Chen 0001, Jiale Han 0001, Bo Cheng 0001, Jiabao Ma. 20678-20695 [doi]
- UniGeM: Unifying Data Selection and Mixing via Geometric Exploration and MiningChanghao Wang, Yunfei Yu, Xinhao Yao, Jiaolong Yang, Lu Yu 0006, Junpeng Fang, Riccardo Cantoro, Chaobo Li, Qing Cui, Jun Zhou 0011. 20696-20714 [doi]
- Don't Just Listen, Try Planning: Graph-based Retrieval-Generation Agent for Long-form Audio Meeting UnderstandingQuanwei Tang, Dong Zhang 0013, Shoushan Li, Guodong Zhou 0001. 20715-20742 [doi]
- FLASH: Focused Layer Attention Sink HijackingSiyuan Deng, Yerong Li, Fanhua Shang, Hongying Liu 0001. 20743-20761 [doi]
- SPIDE: Serial and Parallel Intertwined Speculative DecodingWenru Xu, Peixuan Xu, Ziqi Yang, Ming Hu, Zihui Wang, Jianzhong Qi 0001, Rongshan Yu, Xiaoliang Fan, Cheng Wang 0003. 20762-20779 [doi]
- MdEval: Massively Multilingual Code DebuggingShukai Liu, Linzheng Chai, Jian Yang 0030, Jiajun Shi, He Zhu, Liran Wang, Ke Jin, Wei Zhang, Hualei Zhu, Shuyue Guo, Tao Sun 0016, Jiaheng Liu, Yunlong Duan, Yu Hao, Liqun Yang, Guanglin Niu, Ge Zhang 0009, Zhoujun Li 0001. 20780-20797 [doi]
- Breaking Consensus Bias: Unsupervised Reinforcement Learning for Machine TranslationShuting Jiang, Ran Song 0002, Siqi Zhang, Yuxin Huang 0004, Shengxiang Gao, Zhengtao Yu 0001. 20798-20812 [doi]
- Reasoning-Aware AIGC Detection via Alignment and ReinforcementZhao Wang, Max Xiong, Jianxun Lian, Zhicheng Dou. 20813-20829 [doi]
- Beyond Modality Collapse: Taming Guided Modality Entropy for Omni-modal Emotion ReasoningXian Zhao, Rui Hu 0011, Yuxiang Zhang, Delai Qiu, Yining Wang, Shengping Liu, Jian Yu 0001, Jitao Sang 0001. 20830-20845 [doi]
- ID10M-JAM: Stress-Testing Idiom Identification Under Challenging ContextKai Golan Hashiloni, Lior Livyatan, Ofri Hefetz, Alon Mannor, Bar-Cohen, Kfir Bar. 20846-20864 [doi]
- MENTOR: Mitigating Identity Drift in Dynamic Role-Playing via Dual-Chain Structured MemoryZhuoning Zhu, Xingyu Gao 0001, Hailong Shi. 20865-20882 [doi]
- Beyond Benchmarks: A Capability-Based Maturity Model for Systematic AI Integration in HospitalsRui Li, Xiaofen Wu, Mingqian Liu, Xiaoxia Song, Xiangjun Xu, Jiacheng Qiao, Boqin Zhuang, Xu Chen. 20883-20895 [doi]
- DiffuSpec: Unlocking Diffusion Language Models for Speculative DecodingGuanghao Li 0003, Zhihui Fu, Min Fang, Qibin Zhao, Ming Tang, Chun Yuan 0003, Jun Wang 0001. 20896-20910 [doi]
- TENP: Trapezoidal Expert Neuron Pruning For Mixture-of-ExpertsJiangyang He, ShaoLin Zhu, Deyi Xiong. 20911-20925 [doi]
- FlowRAG: Synergizing Explicit Reasoning via Frequency-Aware Multi-Granularity Graph FlowBihao Zhan, Zongsheng Cao, Jie Zhou 0015, Bo Zhang 0069, Liang He 0001. 20926-20936 [doi]
- OntoGuard: Enforcing Action Admissibility for LLM Agents in Complex Interactive EnvironmentsPengxiang Liu, Tao Ren 0001, Wei Xiong, Tingrui Yang, Junjie Wang 0001, Jun Hu 0015. 20937-20952 [doi]
- Self-Correcting RAG: Enhancing Faithfulness via MMKP Context Selection and NLI-Guided MCTSShijia Xu, Zhou Wu, Xiaolong Jia, Yu Wang, Kai Liu, April Xiaowen Dong. 20953-20976 [doi]
- DiffER: Diffusion Entity-Relation Modeling for Reversal Curse in Diffusion Large Language ModelsShaokai He, Kaiwen Wei, Xinyi Zeng, Xiang Chen, Xue Yang, Zhenyang Li, Jiang Zhong, Yu Tian. 20977-20987 [doi]
- Layer-aware Dual-directional Modulation for Low-resource Machine TranslationSiqi Zhang, Ran Song 0002, Shuting Jiang, Yuxin Huang 0004, Zhengtao Yu 0001. 20988-21000 [doi]
- MATCHA: Matching Text via Contrastive Semantic AlignmentSiran Li, Ece Sena Etoglu, Carsten Eickhoff, Seyed Ali Bahrainian. 21001-21018 [doi]
- PlaM: Training-Free Plateau-Guided Model Merging for Better Visual Grounding in MLLMsZijing Wang, Yongkang Liu 0002, Mingyang Wang 0003, Ercong Nie, Deyuan Chen, Zhengjie Zhao, Shi Feng 0001, Daling Wang, Xiaocui Yang, Yifei Zhang 0003, Hinrich Schütze. 21019-21035 [doi]
- Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and ProspectsJun Zhang 0069, Yicheng Ji, Feiyang Ren, Yihang Li, Bowen Zeng, Zonghao Chen, Ke Chen 0005, Lidan Shou, Gang Chen 0001, Huan Li 0003. 21036-21066 [doi]
- Adaptive Zooming via Relevance-Informed Positional Resource Allocation for Training-free LLM Context ExtensionHongbo Zhao, Huibin Wang, Bin Tang, Xianming Hu, Yihong Huang, Yijun Shen, Nuoyi Chen, Ping Li, Kai Zhang. 21067-21083 [doi]
- Mitigating Position Bias in Transformers via Layer-Specific Positional Embedding ScalingZhenghua Wang, Yiran Ding, Changze Lv, Yixin Wu, Tianlong Li, Zhibo Xu, Muling Wu, Tianyuan Shi, Shizheng Li, Qi Qian, Xuanjing Huang, Xiaoqing Zheng. 21084-21098 [doi]
- Semantic-pragmatic Annotations in the Prague Dependency TreebankMarie Mikulová, Eva Hajicová, Jirí Mírovský, Anna Nedoluzhko, Michal Novák 0001, Pavlína Synková, Jan Stepánek, Barbora Stepánková, Jan Hajic 0001. 21099-21110 [doi]
- Penetrating Linguistic Disguises: A Slang-aware Label-Aligned Framework for Fine-Grained Toxicity Extraction in Chinese Hate Speech DetectionWei Liu, Xiaoliang Chen 0003, Duoqian Miao 0001, Xu Gu 0001, Xianyong Li, Yajun Du. 21111-21123 [doi]
- LightMoE: Task-Aware Expert Availability Management for Memory-Efficient MoE-LLM InferencePuhan Luo, Yunhao Yao, Junyang Wang 0004, Junyang Zhang 0001, Xiangyang Li 0001. 21124-21134 [doi]
- SelfBudgeter: Adaptive Token Allocation for Efficient LLM ReasoningZheng Li, Qingxiu Dong, Jingyuan Ma, Di Zhang, Kai Jia, Zhifang Sui. 21135-21156 [doi]
- Streaming Hallucination Detection in Long Chain-of-Thought ReasoningHaolang Lu, Minghui Pan, Ripeng Li, Guoshun Nan, Jialin Zhuang, Zijie Zhao, Zhongxiang Sun, Kun Wang, Yang Liu. 21157-21183 [doi]
- Training-Free Adaptive Speculative Decoding via Linguistic PriorsJingyi Wang, Jiaqi Huang, Zunnan Xu, Jun Zhou, Kehong Yuan, Xiang Qian. 21184-21194 [doi]
- Knowledge-Infused Multi-Bit Watermarking for RAG Knowledge BasesKe Yang, Shuguang Yuan 0003, Jing Yu 0007, Chi Chen 0001. 21195-21218 [doi]
- ClimAgent: LLM as Agents for Autonomous Open-ended Climate Science AnalysisHao Wang 0073, Jindong Han, Wei Fan 0010, Hao Liu 0026. 21219-21241 [doi]
- CogBench: Benchmarking Cognitive Alignment of Large Language Models in Educational Question AnsweringTong Lu 0005, Zhichun Wang, Yuanhao Sun, Yaoyu Zhou, Mingrui Li, Yiming Guan, Zhiyong Bai. 21242-21256 [doi]
- CARL: Constraint-Aware Reinforcement Learning for Planning with LLMsQiuyi Qi, Jinjian Zhang, Mutian Bao, Tian Liang, Guocong Li, Dongnan Liu, Wei Zhou, Jie Liu, Ming Kong, Linjian Mo, Feng Zhang, Qiang Zhu. 21257-21281 [doi]
- ChildEval: WHEN LARGE LANGUAGE MODELS MEET CHILDREN'S PERSONALITIESYanyan Luo, Xue Han 0018, Chunxu Zhao, Ruiqiao Bai, Yaxing Zhang, Qian Hu, Lijun Mei, Junlan Feng. 21282-21304 [doi]
- Belief in Authority: Impact of Authority in Multi-Agent Evaluation FrameworkJunhyuk Choi, Jeongyoun Kwon, Heeju Kim, Haeun Cho, Hayeong Jung, Sehee Min, Bugeun Kim. 21305-21319 [doi]
- ToMELP: A Theory-of-Mind Benchmark for Route-Controlled Persuasion under the Elaboration Likelihood ModelRuirui Wang, Haoran Zhang, Tian Lan, Zehua Duo, Jiang Li, Guanglai Gao, Xiangdong Su. 21320-21338 [doi]
- StateX: Enhancing RNN Recall via Post-training State ExpansionXingyu Shen, Yingfa Chen, Zhen Leng Thai, Xu Han 0007, Zhiyuan Liu 0001, Maosong Sun 0001. 21339-21353 [doi]
- TOXIFRENCH: Benchmarking and Enhancing Language Models via CoT Fine-Tuning for French Toxicity DetectionAxel Delaval, Shujian Yang, Haicheng Wang, Han Qiu 0001, Jialiang Lu. 21354-21375 [doi]
- Memory-Guided Hard Data Augmentation for Multimodal Named Entity RecognitionXinyu Liu, Kai Fu, Yinghan Shi, Quanyou Chu, Ming Du 0002, Hongya Wang, Xiaojun Meng, Jiansheng Wei, Yanghua Xiao, Bo Xu 0023. 21376-21391 [doi]
- DUET: Joint Exploration of User-Item Profiles in Recommendation SystemYue Chen 0014, Yifei Sun, Lu Wang 0029, Fangkai Yang, Pu Zhao 0004, Minjie Hong, Yifei Dong, Minghua He, Nan Hu, Jianjin Zhang, Zhiwei Dai, Yuefeng Zhan, Weihao Han, Hao Sun 0015, Qingwei Lin, Weiwei Deng, Feng Sun 0008, Qi Zhang 0066, Saravan Rajmohan, Dongmei Zhang 0001. 21392-21406 [doi]
- ATAAT: Adaptive Threat-Aware Adversarial Tuning Framework against Backdoor Attacks on Vision-Language-Action ModelsKewei Chen, Yayu Long, Shuai Li 0002, Mingsheng Shang 0001. 21407-21422 [doi]
- CoTrust: Privacy-Preserving Collaboration Between Large and Small Language Models in Trusted Execution EnvironmentsZhenya Ma, Tingyi Wang, Yongheng Deng, Ziqing Qiao, Yinggui Wang, Tao Wei, Lei Wang, Ju Ren 0001. 21423-21440 [doi]
- FAQ: Mitigating Quantization Error via Regenerating Calibration Data with Family-Aware QuantizationHaiyang Xiao 0001, Weiqing Li, Jinyue Guo, Guochao Jiang, Guohua Liu, Yuewei Zhang. 21441-21460 [doi]
- HACHIMI: Scalable and Controllable Student Persona Generation via Orchestrated AgentsYilin Jiang, Fei Tan, Xuanyu Yin, Jing Leng, Aimin Zhou. 21461-21506 [doi]
- D-QRELO: Training- and Data-Free Delta Compression for Large Language Models via Quantization and Residual Low-Rank ApproximationJunlin Li, Shuangyong Song, Guodong Du 0002, Ngai Wong 0001, Xuebo Liu 0002, Yongxiang Li, Min Zhang 0005, Jing Li 0034, Xuelong Li 0001. 21507-21518 [doi]
- Beyond Static Toolsets: Self-Evolving LLM Tool Agents via Continual Documentation AdaptationBin Wu 0025, Edgar Meij, Emine Yilmaz. 21519-21539 [doi]
- ZoFia: Zero-Shot Fake News Detection with Entity-Guided Retrieval and Multi-LLM InteractionLvhua Wu, Xuefeng Jiang, Sheng Sun, Yan Lei, Tian Wen, Yuwei Wang 0003, Min Liu 0001. 21540-21556 [doi]
- SenseJudge: Human-Centric Preference-Driven Judgment FrameworkRui Li, Junfeng Liu, Xiangwen Kong, Zhifang Sui. 21557-21574 [doi]
- Reliability-Aware Adaptive Self-Consistency for Efficient Sampling in LLM ReasoningJunseok Kim, Nakyeong Yang, Kyungmin Min, Kyomin Jung. 21575-21590 [doi]
- CLaS-Bench: A Cross-Lingual Alignment and Steering BenchmarkDaniil Gurgurov, Yusser Al Ghussin, Tanja Baeumel, Cheng-Ting Chou, Patrick Schramowski, Marius Mosbach, Josef van Genabith, Simon Ostermann 0002. 21591-21628 [doi]
- From Prediction to Intervention: Personalized Meal-Level Glucose Regulation via an LLM AgentMingyu Huang, Weiqing Min, Ying Jin, Yilin Wang 0012, Shuqiang Jiang. 21629-21645 [doi]
- PsyPath: Psychologically-guided Self-Exploration for Personality DetectionZheng Li, Hongxin Ding, Chenyu Zhang, Weimin Xiong, Dawei Zhu, Sujian Li. 21646-21664 [doi]
- CCTVBench: Contrastive Consistency Traffic VideoQA Benchmark for Multimodal LLMsXingcheng Zhou, Hao Guo, Rui Song 0007, Walter Zimmer, Mingyu Liu, André Schamschurko, Hu Cao, Alois Knoll. 21665-21684 [doi]
- PROGRAM: Programmatic Retrieval Optimization with Generative Reasoning and Augmented Multi-queriesGun Il Kim, Jungkyu Shin, Jong Wook Kim, Beakcheol Jang. 21685-21699 [doi]
- TiMem: Temporal-Hierarchical Memory Consolidation for Long-Horizon Conversational AgentsKai Li, Xuanqing Yu, Ziyi Ni, Yi Zeng, Yao Xu, Zheqing Zhang, Xin Li, Jitao Sang, Xiaogang Duan, Xuelei Wang, Chengbao Liu, Jie Tan. 21700-21720 [doi]
- GraphDx: A Cost-Aware Knowledge-Enhanced Multi-Agent Framework for Sequential DiagnosisShaoting Tan, Ning Liu 0014, Yuntao Du 0001, Shuyue Wei, Wu Shuai, Qian Li 0043, Yanyu Xu 0001, Wei Zhang 0056, Lizhen Cui 0001, Haitao Yuan 0002. 21721-21736 [doi]
- ProUIE: A Macro-to-Micro Progressive Learning Method for LLM-based Universal Information ExtractionWenda Liu, Zhigang Song, Shuai Nie 0001, Guangyao Liu, Lisung Chen, Binyu Yang, Yaran Chen, Peng Zhou, Hongzhen Wang, Yuchen Liu, Wenyue Hu, Jiaming Xu, Runyu Shi, Ying Huang. 21737-21750 [doi]
- MAVIS: Multi-Agent Video Retrieval via Structured Video UnderstandingJie Zhang, Qilang Ye, Hao Zhou 0014, Haochen Liang, Fei Luo 0003. 21751-21764 [doi]
- ThinkBrake: Efficient Reasoning via Log-Probability Margin Guided DecodingSangjun Song, Minjae Oh, Seungkyu Lee, Sungmin Jo, Yohan Jo. 21765-21790 [doi]
- MSIA: Adaptive Medical Multimodal Multi-turn Semantic JailbreakZhiheng Han, Yao Zhang, Jun Wang 0023, Zhenglu Yang. 21791-21806 [doi]
- Why These Documents? Explainable Generative Retrieval with Hierarchical Category PathsSangam Lee, Ryang Heo, SeongKu Kang, Susik Yoon, Jinyoung Yeo, Dongha Lee 0003. 21807-21824 [doi]
- ETHICA-MT: Introducing a Framework and Dataset for Studying Ethical Orientations in LLM-based Machine TranslationOmri Asscher, Arif Ahmad, Ananya Agrawal, Monojit Choudhury. 21825-21845 [doi]
- ArgBench: Benchmarking LLMs on Computational Argumentation TasksYamen Ajjour, Carlotta Quensel, Nedim Lipka, Henning Wachsmuth. 21846-21874 [doi]
- Generics are not quantificational: A new path from language models to semantic theoryGustavo Cilleruelo Calderón, Mahrad Almotahari, Emily Allaway, Barry Haddow, Alexandra Birch. 21875-21892 [doi]
- Beyond Neural Incompatibility: Cross-Scale Knowledge Transfer in Large Language Models through Latent Semantic AlignmentJian Gu 0001, Aldeida Aleti, Chunyang Chen 0001, Hongyu Zhang. 21893-21905 [doi]
- CURaTE: Continual Unlearning in Real Time with Ensured Preservation of LLM KnowledgeSeyun Bae, Seokhan Lee, Eunho Yang. 21906-21930 [doi]
- Decoupling the Effect of Chain-of-Thought Reasoning: A Human Label Variation PerspectiveBeiduo Chen, Tiancheng Hu, Caiqi Zhang, Robert Litschko, Anna Korhonen, Barbara Plank. 21931-21951 [doi]
- CTRL: Control-Based Time Series Forecasting with LLM-Guided Residual LearningMinkyoung Kim, Daeun Ji, Yohan Lee, Beomsoo Kim, Beakcheol Jang. 21952-21968 [doi]
- INDOTABVQA: A Benchmark for Cross-Lingual Table Understanding in Bahasa Indonesia DocumentsSomraj Gautam, Anathapindika Dravichi, Gaurav Harit. 21969-21981 [doi]
- Cross-Cultural Transfer of Emoji Semantics and Sentiment in Financial Social MediaAhmed Mahrous, Roberto Di Pietro. 21982-21999 [doi]
- EXPO-SQL: Execution-based Clause-level Policy Optimization for Text-to-SQLJaehoon Lee, CheolWon Na, Suyoung Bae, Jin-Seop Lee, Jihyung Lee, Yunseok Choi, Jee-Hyong Lee 0001. 22000-22019 [doi]
- Synapse: Empowering LLM Agents with Episodic-Semantic Memory via Spreading ActivationHanqi Jiang, Junhao Chen, Yi Pan 0001, Ling Chen 0005, Weihang You, Yifan Zhou, Ruidong Zhang, Yohannes Abate, Tianming Liu 0001. 22020-22036 [doi]
- Similarity-Distance-Magnitude ActivationsAllen Schmaltz. 22037-22057 [doi]
- SDAR: A Synergistic Diffusion-AutoRegression Paradigm for Scalable Sequence GenerationShuang Cheng, Yihan Bian, Dawei Liu, Yuhua Jiang, Yihao Liu 0008, Linfeng Zhang 0001, Qian Yao, Zhongbo Tian, Wenhai Wang, Qipeng Guo, Kai Chen 0026, Biqing Qi, Bowen Zhou 0002. 22058-22075 [doi]
- Comparing Human and Large Language Model Interpretation of Implicit InformationAntonio De Santis, Tommaso Bonetti, Andrea Tocchetti, Marco Brambilla 0001. 22076-22095 [doi]
- Simplify-Pro: A Two-level and Progressive LLM-based Framework for Auto Long Text SimplificationPeng Zhou, Guangxin Li, Xiaoying Huang, Yiming Tang. 22096-22122 [doi]
- Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language ModelsRagib Amin Nihal, Rui Wen, Kazuhiro Nakadai, Jun Sakuma. 22123-22174 [doi]
- Data-Efficient Adaptation to Contextual Shifts in LLM-based Conversational RecommendationHyeongjun Yang, Donghyun Kim, Seokju Hwang, Midan Shim, Kyuhwan Yeom, Kaehyun Um, Kyong-Ho Lee. 22175-22191 [doi]
- PsychEval: A Multi-Session and Multi-Therapy Benchmark for High-Realism AI Psychological CounselorQianjun Pan, Junyi Wang, Jie Zhou 0015, Yutao Yang, Junsong Li, Kaiyin Xu, Yougen Zhou, Yihan Li, Jingyuan Zhao, Qin Chen 0001, Ningning Zhou, Kai Chen 0026, Liang He 0001. 22192-22212 [doi]
- GrandGuard: Taxonomy, Benchmark, and Safeguards for Elderly-Chatbot Interaction SafetyChangxuan Fan, Xi Yang, Yueyuan Zheng, Bin Zhou, Yuanping Wang, Wenbin Hu 0001, Huihao Jing, Ki Sen Hung, Dazhao Du, Haoran Li 0003, Janet Hui-wen Hsiao, Yangqiu Song. 22213-22248 [doi]
- SciExplore: Evaluating Autonomous Agents from Scientific Navigation to Information IntegrationYinhao Tang, Youqing Fang, Yanan Sun 0005, Wenran Liu, Weiming Zhang, Bin Liu, Kuikun Liu, Wenwei Zhang, Kai Chen 0026. 22249-22273 [doi]
- When Models Outthink Their Safety: Unveiling and Mitigating Self-Jailbreak in Large Reasoning ModelsYingzhi Mao, Chunkang Zhang, Junxiang Wang, Xinyan Guan, Boxi Cao, Yaojie Lu 0001, Hongyu Lin, Xianpei Han, Le Sun 0001. 22274-22302 [doi]
- NASH: Numerically Aware Scoring Heuristic for Robust Semantic SimilarityYu-Shiang Huang, Yun-Yu Lee, Tzu-Hsin Chou, Che Lin, Chuan-Ju Wang. 22303-22317 [doi]
- Beyond Query Bias: Candidate-Aware Iterative Refinement for Zero-Shot Composed Image RetrievalNan Sun, Jing Tang 0006, Lei Sun 0009, Rui Chen 0016, Yuxing Lu, Xiangxiang Chu, Hefei Ling, Yujun Cai. 22318-22329 [doi]
- Large Reasoning Models Are (Not Yet) Multilingual Latent ReasonersYihong Liu 0001, Raoyuan Zhao, Hinrich Schütze, Michael A. Hedderich. 22330-22358 [doi]
- Towards Scalable Lightweight GUI Agents via Multi-role OrchestrationZiwei Wang, Junjie Zheng, Leyang Yang, Sheng Zhou 0004, Xiaoxuan Tang, Zhouhua Fang, Zhiwei Liu, Dajun Chen, Yong Li 0004, Jiajun Bu. 22359-22388 [doi]
- Memory Matters More: Event-Centric Memory as a Logic Map for Agent Searching and ReasoningYuyang Hu, Jiongnan Liu 0001, Jiejun Tan, Yutao Zhu 0001, Zhicheng Dou. 22389-22407 [doi]
- Format-Adapter: Improving Reasoning Capability of LLMs by Adapting Suitable FormatDingzirui Wang, Xuanliang Zhang, Rongyu Cao, Longxu Dou, Xianzhen Luo, Yingwei Ma, Qingfu Zhu, Binhua Li, Fei Huang 0002, Yongbin Li 0001. 22408-22427 [doi]
- Behavior-Aware Item Modeling via Dynamic Procedural Solution Representations for Knowledge TracingJun Seo, Sangwon Ryu, Heejin Do, Hyounghun Kim, Gary Lee 0001. 22428-22443 [doi]
- Tracing the Light of Thought: A Probabilistic Self- and Cross-Consistency Verification Mechanism Improving Mathematical Reasoning in LLMsXiaoyang Liu, Dawei Wang, Tian Li, Huizhi Liang 0001, Gary Ushaw, Richard Davison 0001. 22444-22459 [doi]
- E2E-GMNER: End-to-End Generative Grounded Multimodal Named Entity RecognitionMeng Zhang, Jinzhong Ning, Xiaolong Wu, Hongfei Lin, Yijia Zhang. 22460-22469 [doi]
- Think Less, Know More: State-Aware Reasoning Compression with Knowledge Guidance for Efficient ReasoningYi Sui, Chaozhuo Li, Dawei Song 0001. 22470-22491 [doi]
- Muse: Towards Reproducible Long-Form Song Generation with Fine-Grained Style ControlChanghao Jiang, Jiahao Chen, Zhenghao Xiang, ZhiXiong Yang, Hanchen Wang 0010, Jiabao Zhuang, Xinmeng Che, Jiajun Sun, Hui Li, Yifei Cao, Shihan Dou, Ming Zhang 0030, Junjie Ye 0005, Tao Ji, Tao Gui, Qi Zhang 0001, Xuanjing Huang 0001. 22492-22512 [doi]
- Distilling LLM Reasoning into Dense Encoders: Bridging the Accuracy-Efficiency Gap in RecommendationDonghee Han 0001, Daeyoung Roh, A Young Kim, Hwanjun Song, Mun Yong Yi. 22513-22531 [doi]
- Decoding the Multimodal Mind: Generalizable Brain-to-Text Translation via Multimodal Alignment and Adaptive RoutingChunyu Ye, Yunhao Zhang, Jingyuan Sun, Chong Li, Yang Zhao, Shaonan Wang. 22532-22546 [doi]
- Which bird does not have wings: Negative-constrained KGQA with Schema-guided Semantic Matching and Self-directed RefinementMidan Shim, Seokju Hwang, Kaehyun Um, Kyong-Ho Lee. 22547-22561 [doi]
- A Self-Evolving LLM Agent Framework for Role-Based Norm Compliance in HealthcareHaijie Ruan, Xiaowu Jiang, Zhanpeng Li, Wei Jia, Xuanwu Xu, Xiao-Fen Shan, Shujie Chen, Xindong Ye. 22562-22577 [doi]
- M3TQA: Massively Multilingual Multitask Table Question AnsweringDaixin Shu, Jian Yang, Zhenhe Wu, Xianjie Wu, Xianfu Cheng, Xiangyuan Guan, Yanghai Wang, Pengfei Wu, Tingyang Yang, Hualei Zhu, Wei Zhang, Ge Zhang 0009, Jiaheng Liu, Zhoujun Li 0001. 22578-22602 [doi]
- ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document ReconstructionZichun Guo, Yuling Shi, Wenhao Zeng, Chao Hu, Haotian Lin 0012, Terry Yue Zhuo, Jiawei Chen, Xiaodong Gu 0002, Wenping Ma. 22603-22615 [doi]
- TELL-TALE: Task Efficient LLMs with Task Aware Layer EliminationOmar Naim, Krish Sharma, Niyar R. Barman, Nicholas Asher. 22616-22638 [doi]
- Reason-KE++: Aligning the Process, Not Just the Outcome, for Faithful LLM Knowledge EditingYuchen Wu, Liang Ding 0006, Li Shen 0008, Dacheng Tao. 22639-22655 [doi]
- RACC: Regret-Aware Confidence Calibration for Consistent Masked Discrete Diffusion DecodingQinglin Zeng, Jusheng Zhang, Jing Yang, Ningyuan Liu, Keze Wang. 22656-22672 [doi]
- The Impact of Off-Policy Training Data on Probe GeneralisationAdrians Skapars, Nathalie Maria Kirch, Samuel Dower, Ekdeep Singh Lubana, Dmitrii Krasheninnikov. 22673-22729 [doi]
- GR1: Reinforcement-Enhanced LLM for Geoscience ReasoningYule Xie, Jiaxin Ding 0001, Cheng Deng 0001, ShiQing Gao, JunRan Zhang, Sibo Zhang, Zeyuan Wang, Ke Wu, Xin Ding, Luoyi Fu, Meng Jin 0002, Xinbing Wang. 22730-22743 [doi]
- FOCUS: A Fine-Grained Customer-Oriented Sentiment Dialogue Summarization Dataset for Chinese Customer ServiceQian Chen 0023, Mengqiang Hu, Xin Guo. 22744-22764 [doi]
- ABC-Bench: Benchmarking Agentic Backend Coding in Real-World DevelopmentJie Yang, Honglin Guo, Li Ji, Jiazheng Zhou, Rui Zheng, Zhikai Lei, Shuo Zhang 0022, Zhiheng Xi, Shichun Liu, Yuxin Wang 0005, Bo Wang 0084, Yining Zheng, Tao Gui, Xipeng Qiu. 22765-22787 [doi]
- LiveCANNBench: Benchmark SWE AI Coding for Ascend CANNSijie Wang, Kai Zhao 0010, Wee-Peng Tay, Shuo Zhang, Chengwen Liu, Quanjiang Guo, Junhao Ren, Xin Li, Heng Lian 0003, Jingdi Lei, Rui She 0001, Huacan Wang, Ronghao Chen. 22788-22803 [doi]
- When Models Decide and When They Bind: A Two-Stage Computation for Multiple-Choice Question AnsweringHugh Mee Wong, Rick Nouwen, Albert Gatt. 22804-22821 [doi]
- Who Watches the Watchmen? Humans Disagree With Translation Metrics on Unseen DomainsFinn Schmidt, Jan Philip Wahle, Terry Ruas, Bela Gipp. 22822-22841 [doi]
- Stress-Testing Emotional Support Models: Moving from Homogeneous to Diverse Help SeekersChaewon Heo, Cheyon Jin, Yohan Jo. 22842-22869 [doi]
- Progressive Planning and Reinforced Reasoning: Large Language Model-Guided Multi-hop Question Answering over Knowledge GraphXiang Li, Runhai Jiao, Ruifan Li, Dongnan Wu, Ruojiao Qiao, Lei Liu. 22870-22884 [doi]
- AED-RAG: Continuous Multi-Granular Context Fusion for Retrieval-Augmented Generation via Adaptive Ensemble DecodingJunzhe Zhou, Fulin Lin, Tairan Cheng, Shaowen Chen, Hongwei Wang. 22885-22899 [doi]
- Neural Chain-of-Thought Search: Searching the Optimal Reasoning Path to Enhance Large Language ModelsGuoming Ling, Zhongzhan Huang, Yupei Lin, Junxin Li, ShanShan Zhong, Hefeng Wu, Liang Lin 0004. 22900-22933 [doi]
- GOAT: A Training Framework for Goal-Oriented Agent with ToolsHyunji Min, Sangwon Jung, Junyoung Sung, Dosung Lee, Leekyeung Han, Paul Hongsuck Seo. 22934-22963 [doi]
- LLMs as ASP Programmers: Self-Correction Enables Task-Agnostic Nonmonotonic ReasoningAdam Ishay, Joohyung Lee 0002. 22964-22993 [doi]
- DRIV-EX: Counterfactual Explanations for Driving LLMsAmaia Cardiel, Eloi Zablocki, Elias Ramzi, Éric Gaussier. 22994-23017 [doi]
- ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming UnderstandingTian Xueyun, Wei Li 0176, Bingbing Xu 0001, Heng Dong, Yuanzhuo Wang, Huawei Shen. 23018-23039 [doi]
- Towards Provably Secure Generative AI: Reliable Consensus SamplingYu Cui, Hang Fu, Sicheng Pan, Zhuoyu Sun, YiFei Liu, Yuhong Nie, Bo Ran, Baohan Huang, Xufeng Zhang, Haibin Zhang, Cong Zuo 0001, Licheng Wang 0004. 23040-23055 [doi]
- Pause or Fabricate? Training Language Models for Grounded ReasoningYiwen Qiu, Linjuan Wu, Yizhou Liu, Yuchen Yan, Jin Ma, Xu Tan 0003, Yao Hu, Daoxin Zhang, Wenqi Zhang 0001, Weiming Lu 0001, Jun Xiao 0001, Yongliang Shen 0001. 23056-23077 [doi]
- AgentV-RL: Scaling Reward Modeling with Agentic VerifierJiazheng Zhang, Ziche Fu, Zhiheng Xi, Wenqing Jing, Mingxu Chai, Wei He 0024, Guoqiang Zhang, Chenghao Fan, Chenxin An, Wenxiang Chen, Zhicheng Liu, Haojie Pan, Dingwei Zhu, Tao Gui, Qi Zhang 0001, Xuanjing Huang 0001. 23078-23100 [doi]
- DiTReducio: A Training-Free Acceleration for DiT-Based TTS via Progressive CalibrationYanru Huo, Ziyue Jiang 0001, Zuoli Tang, Qingyang Hong, Zhou Zhao 0001. 23101-23116 [doi]
- DcLM: Output Length Control of Large Language Models via Dynamic Length MarkersZhe Chen, Jiaao Yu, Honglin Li. 23117-23131 [doi]
- LongMP-Bench: A Benchmark for Multimodal Persona Understanding in Long-Term DialoguesZhuoqun Li, Zhaopei Huang, Wenxuan Wang 0001, Qin Jin. 23132-23160 [doi]
- TOOLCAD: Exploring Tool-Using Large Language Models in Text-to-CAD Generation with Reinforcement LearningXing Wu Yifei Gong, Tukang Wenda Liu. 23161-23188 [doi]
- Beyond Overlap Metrics: Rewarding Reasoning and Preferences for Faithful Multi-Role Dialogue SummarizationXiaoyong Mei, Tingting Zuo, Da Chen, Guangyu Hu, Xiangyu Wen, Chao Duan, Mingyan Zhang, Fudan Zheng. 23189-23203 [doi]
- From Signal Degradation to Computation Collapse: Uncovering the Two Failure Modes of LLM QuantizationChenxi Zhou, Pengfei Cao, Jiang Li, Bohan Yu, Jinyu Ye, Jun Zhao 0001, Kang Liu 0001. 23204-23222 [doi]
- Establishing a Scale for Kullback-Leibler Divergence in Language Models Across Various SettingsRyo Kishino, Yusuke Takase, Momose Oyama, Hiroaki Yamagiwa, Hidetoshi Shimodaira. 23223-23248 [doi]
- Simple Role Assignment is Extraordinarily Effective for Safety AlignmentZhou Ziheng, Jiakun Ding, Zhaowei Zhang 0001, Ruosen Gao, Ying Nian Wu, Demetri Terzopoulos, Yipeng Kang, Fangwei Zhong, Junqi Wang. 23249-23267 [doi]
- Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language ModelsChenxi Zhou, Pengfei Cao, Jiang Li, Bohan Yu, Jinyu Ye, Jun Zhao 0001, Kang Liu 0001. 23268-23285 [doi]
- MemPO: Self-Memory Policy Optimization for Long-Horizon AgentsRuoran Li, Xinghua Zhang 0001, Haiyang Yu 0003, Shitong Duan, Xiang Li, Wenxin Xiang, Chonghua Liao, Xudong Guo, Yongbin Li 0001, Jinli Suo. 23286-23301 [doi]
- Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal UncertaintyChao Xue, Yao Wang, Mengqiao Liu, Di Liang, Xingsheng Han, Peiyang Liu, Xianjie Wu, Chenyao Lu, Lei Jiang, Yu Lu, Haibo Shi, Shuang Liang, Minlong Peng, Flora D. Salim. 23302-23319 [doi]
- Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution ReconstructionXu Shen 0002, Qi Zhang, Song Wang 0013, Zhen Tan 0001, Xinyu Zhao, Laura Yao, Vaishnav Tadiparthi, Hossein Nourkhiz Mahjoub, Ehsan Moradi-Pari, Kwonjoon Lee, Tianlong Chen 0001. 23320-23337 [doi]
- DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing AttackHao Li 0156, Yubing Ren, Yanan Cao 0001, Yingjie Li, Fang Fang 0009, Shi Wang 0002, Li Guo 0001. 23338-23361 [doi]
- PeerCheck: Enhancing LLM-Generated Academic Reviews Towards Human-Level QualityZeyuan Chen 0002, Ziqing Yang 0002, Yihan Ma 0001, Michael Backes 0001, Yang Zhang 0016. 23362-23386 [doi]
- MorphoBench: A Benchmark with Difficulty Adaptive to Model ReasoningXukai Wang, Xuanbo Liu, Mingrui Chen 0001, Haitian Zhong, Xuanlin Yang, Bohan Zeng, Jinbo Hu, Hao Liang 0017, Junbo Niu, Xuchen Li 0001, Ruitao Wu, Ruichuan An, Yang Shi 0009, Liu Liu, Qiang Liu 0006, Zhouchen Lin, Xu-Yao Zhang, Wentao Zhang 0001, Bin Dong. 23387-23411 [doi]
- Privacy Risks of Intermediate Representations: Attribute Inference in Distributed LLM InferenceYang Lyu, Jin Cao, Yang Xiao, Zhe Sun, Ben Niu, FengHua Li, Hui Li. 23412-23426 [doi]
- ReCon: Active Defense against Large Vision-Language Model Jailbreaks via Reverse Safety Concept InjectionZheng He, Yiwei Wang 0001, Hongxing Wang, Yujun Cai. 23427-23441 [doi]
- Verifying the Subjective: Structured Multilingual Rewards for Low-Resource AlignmentJiu Sha, Mengxiao Zhu 0004. 23442-23474 [doi]
- Memory-Driven Role-Playing: Evaluation and Enhancement of Persona Knowledge Utilization in LLMsKai Wang, Haoyang You, Yang Zhang, Zhongjie Wang. 23475-23510 [doi]
- Scripts Through Time: A Survey of the Evolving Role of Transliteration in NLPThanmay Jayakumar, Deepon Halder, Raj Dabre. 23511-23524 [doi]
- Health-ORSC-Bench: A Benchmark for Measuring Over-Refusal and Safety Completion in Health ContextZhihao Zhang, Liting Huang, Guanghao Wu, Preslav Nakov, Heng Ji 0001, Usman Naseem. 23525-23547 [doi]
- LLM Inductive Reasoning Through Multi-Agent Enhanced Monte Carlo Tree SearchXiang Li 0001, Yucheng Zhou 0001, Xiangzhi Wei, Zesheng Shi, Haiyuan Wan, Yifan Gong 0010, Fangming Liu, Jing Li 0034. 23548-23562 [doi]
- UniCreative: Unifying Long-form Logic and Short-form Sparkle via Reference-Free Reinforcement LearningXiaolong Wei, Zerun Zhu, Simin Niu, Xingyu Zhang, Peiying Yu, Changxuan Xiao, Yuchen Li, Jicheng Yang, Zhejun Zhao, Chong Meng, Long Xia, Daiting Shi. 23563-23583 [doi]
- FFN Lens: How Transformers Divide Labor for Multilingual TasksJiatong Li, Hailong Cao, Yang Liu. 23584-23598 [doi]
- Seeing Beyond Words: MatVQA for Challenging Visual-Scientific Reasoning in Materials ScienceSifan Wu 0003, Huan Zhang 0001, Yizhan Li, Farshid Effaty, Hongyuan Mei, Amirreza Ataei, Bang Liu 0003. 23599-23614 [doi]
- RLShield: Dynamic Jailbreak Detection for LLMs via Reinforced Adaptive LearningZhao Tong, Pengfei Yang, Yimeng Gu, Haichao Shi, Qiang Liu, Xingcheng Xu, Shu Wu, Xiao-Yu Zhang. 23615-23630 [doi]
- MEDSYN: Benchmarking Multi-EviDence SYNthesis in Complex Clinical Cases for Multimodal Large Language ModelsBoqi Chen, Xudong Liu, Jiachuan Peng, Marianne Frey-Marti, Kyle Lam, Bang Zheng, Lin Li 0070, Jianing Qiu. 23631-23655 [doi]
- Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt EngineeringAnas Mohamed, Azal Ahmad Khan, Xinran Wang, Ahmad Faraz Khan 0001, Shuwen Ge, Saman Bahzad Khan, Ayaan Ahmad, Ali Anwar 0001. 23656-23674 [doi]
- BNLP: A Text Annotation Platform for Quality Control of LLM-Generated AnnotationsXinhao Zhuang, Qiongyu Tian, Yalin Chen, Tianle Xin, Yongyong Fu, Yunchao Ling, Guoqing Zhang. 23675-23684 [doi]
- ElasticFlow: One-Step Physics-Consistent Policy with Elastic Time Horizons for Language-Guided ManipulationKewei Chen, Yayu Long, Shuai Li 0002, Mingsheng Shang 0001. 23685-23701 [doi]
- AdaptiveK: Complexity-Driven Sparse Autoencoders for Interpretable Language Model RepresentationsYifei Yao, Hanrong Zhang, Mengnan Du. 23702-23728 [doi]
- Experience-Driven Multi-Agent Optimization for Black-Box Jailbreak Attacks on Large Language ModelsZhaoyang Han, Yihe Liu, Kai Zhang, Ping Li. 23729-23747 [doi]
- CMIG: Conceptual Metaphor Theory-Inspired Framework for Metaphorical Image GenerationQingbao Huang, Cheng Yang, Jiawei Yao, Zhiyue Liu, Yi Cai 0001, Xingmao Zhang. 23748-23761 [doi]
- Position: From Noise to Signal to Selbstzweck - Reframing Human Label Variation in the Era of Post-training in NLPShanshan Xu, T. Y. S. S. Santosh, Barbara Plank. 23762-23772 [doi]
- Rethinking Assessments of Prompt Injection AttacksChi Cui, Yixin Wu 0001, Michael Backes 0001, Yang Zhang 0016. 23773-23799 [doi]
- SegDRE: A Salient Entity Guided Approach to Document-Level Relation ExtractionXing Yang, Chengxiang Tan. 23800-23812 [doi]
- Live-Aid: A Large-Scale Dialogue Dataset and Benchmark for Interleaved Multi-party Interactions in Live StreamingYiming Lei 0001, Yize Fan, Zeming Liu, Jiaji Dong, Hui Qiu, Haitao Leng, Qingjie Liu 0001, Kehai Chen, Tingting Gao, Yunhong Wang 0001. 23813-23850 [doi]
- Semi-Supervised Diseased Detection from Speech Dialogues with Multi-Level Data ModelingXingyuan Li, Mengyue Wu. 23851-23862 [doi]
- From Isolated Scoring to Collaborative Ranking: A Comparison-Native Framework for LLM-Based Paper EvaluationPujun Zheng, Jiacheng Yao, Jinquan Zheng, Chenyang Gu, Guoxiu He, Jiawei Liu 0002, Yong Huang 0008, Tianrui Guo, Wei Lu 0019. 23863-23883 [doi]
- UnAC: Adaptive Visual Prompting with Abstraction and Stepwise Checking for Complex Multimodal ReasoningYifan Wang, Yun Fu 0001. 23884-23893 [doi]
- AnalystBench: Benchmarking professional long-form report generation with web-mined multimodal tasksChau Minh Pham, Zichao Wang 0001, Puneet Mathur, Alexa Siu, Akriti Jain 0001, Aparna Garimella, Ananya B. Sai, Nedim Lipka, Mohit Iyyer, Varun Manjunatha. 23894-23926 [doi]
- BizCompass: Benchmarking the Reasoning Capabilities of LLMs in Business Knowledge and ApplicationsJianing Hao, Yuhe Wu, Yuanjian Xu, Shichang Meng, Shuai Yuan, Wei Zeng, Zixuan Wang, Guang Zhang. 23927-23966 [doi]
- When More Thinking Hurts: Overthinking in LLM Test-Time Compute ScalingShu Zhou, Rui Ling, Junan Chen, Xin Wang, Tao Fan, Hao Wang. 23967-23977 [doi]
- Learning from Failures: Error Notebook-guided Secure Code GenerationXinyu Zhong, Peng Lan, Zhifang Liao. 23978-23990 [doi]
- Evaluating Reasoning Models for Queries with PresuppositionsRose Sathyanathan, Kinshuk Vasisht, Danish Pruthi. 23991-24006 [doi]
- GRE Score: Generative Risk Evaluation for Large Language ModelsZaitang Li, Pin-Yu Chen, Tsung-Yi Ho. 24007-24033 [doi]
- MSVBench: Towards Human-Level Evaluation of Multi-Shot Video GenerationHaoyuan Shi, Yunxin Li, Nanhao Deng, Zhenran Xu, Xinyu Chen 0003, Longyue Wang, Baotian Hu, Min Zhang 0005. 24034-24058 [doi]
- M-TRACE: Detecting and Mitigating Time-Anchor Drift via Step-wise Conflict Checking in Temporal ReasoningDanyu Huang, Jiayuan Jiang, Yao Zhang, Jun Wang 0023, Huijia Li, Zhenglu Yang. 24059-24077 [doi]
- Faithful Persona Steering under Incongruity via Dual-Stream RefinementYu-An Chu, Jen-Ren Pong, Chia-Yao Yeh, Meng-Fen Chiang. 24078-24095 [doi]
- ChemVLR: Prioritizing Reasoning in Perception for Chemical Vision-Language UnderstandingXuanle Zhao, Xinyuan Cai, Xiang Cheng, Xiuyi Chen, Bo Xu 0002. 24096-24115 [doi]
- SDC-LoRA: Singular-Subspace Drift Controlled LoRA to Mitigate Knowledge ForgettingGeyuan Zhang, Xiaofei Zhou, Shihao Liu, Jingyuan Tian, Jizheng Ma. 24116-24132 [doi]
- Regret-Now: A Physics-Inspired Regret Framework for Temporal Knowledge Graph Question Answering with LLMsDanyu Huang, Yao Zhang, Jun Wang 0023, Zhenglu Yang. 24133-24157 [doi]
- Low-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable RewardGuanhua Huang, Tingqiang Xu, Mingze Wang, Qi Yi, Xue Gong, Siheng Li, Ruibin Xiong, Kejiao Li 0001, Yuhao Jiang, Bo Zhou. 24158-24188 [doi]
- Preserving Language Capabilities in Vision-Language Models via Representation RegulationZixuan Chen, Juncheng Tao, Ziqian Zeng. 24189-24205 [doi]
- Me-Agent: A Personalized Mobile Agent with Two-Level User Habit Learning for Enhanced InteractionShuoxin Wang, Chang Liu, Gowen Loo, Lifan Zheng, Kaiwen Wei, Huanqian Yan, Xinyi Zeng, Jingyuan Zhang, Yu Tian. 24206-24222 [doi]
- Dynamic PMI-Guided Contrastive Decoding Reduces Hallucination in Large Language Models: A Unified Framework of Fine-Grained Input TransformationsDongsheng Chen, Yingqi Zhu, Xingyue Zhang, Wenqing Zhou, Lei Li 0009. 24223-24235 [doi]
- LSEG: A Fine-tuning Free Method for NL2FOL via Logic-Structure and Entropy Guided Inference ControllingYuwei Huang, Shi Wang, Kangli Zi, Tianyu Luo, Jiang Zhixiao, Ruiheng Wang, Yufei Wang. 24236-24245 [doi]
- Compact Example-Based Explanations for Language ModelsLoris Schoenegger, Benjamin Roth 0001. 24246-24265 [doi]
- MedCPI: A Construct-Personalize-Integrate Framework for KG-enhanced Clinical PredictionHang Wang, Hang Dong, Lu Liu. 24266-24282 [doi]
- Across Programming Language Silos: A Study on Cross-Lingual Retrieval-Augmented Code GenerationQiming Zhu, Jialun Cao, Xuanang Chen, WeiLi Zhang, Yaojie Lu 0001, Hongyu Lin, Xianpei Han, Le Sun 0001, Shing-Chi Cheung. 24283-24296 [doi]
- ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error DetectionYibo Yan, Shen Wang 0005, Jiahao Huo, Hang Li 0007, Boyan Li, Jiamin Su, Xiong Gao, Yifan Zhang 0004, Tianlong Xu, Zhendong Chu, Aoxiao Zhong, Kun Wang 0042, Hui Xiong 0001, Philip S. Yu, Xuming Hu, Qingsong Wen. 24297-24334 [doi]
- Disentangling Continued Pre-Training: Attention-Driven Routing and Semantic Hub Preservation in Language AdaptationKhanh-Tung Tran, Vinh-Khanh Tran, Barry O'Sullivan, Hoang D. Nguyen. 24335-24357 [doi]
- Do You Get the Hint? Benchmarking LLMs on the Board Game ConceptIne Gevers, Walter Daelemans. 24358-24371 [doi]
- Topic-Based Watermarks for Large Language ModelsAlexander Nemecek, Yuzhou Jiang, Erman Ayday. 24372-24402 [doi]
- SParK-Eval: Evaluating Structure-Aware Knowledge Acquisition in LLMs for Domain Adaptation to Industrial RecordsEkant Muljibhai Amin, Yuta Koreeda, Yasuhiro Sogawa. 24403-24418 [doi]
- SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement LearningJichao Wang, Liuyang Bian, Yufeng Zhou, Han Xiao 0010, Yue Pan, Guozhi Wang, Hao Wang 0251, Zhaoxiong Wang, Yafei Wen, Xiaoxin Chen 0001, Shuai Ren 0002, Lingfang Zeng. 24419-24432 [doi]
- Kumatigi: Quality-Driven Data Augmentation for Low-Resource Machine TranslationCheick Tidiani Cissé. 24433-24446 [doi]
- CAMO: An Agentic Framework for Automated Causal Discovery from Micro Behaviors to Macro Emergence in LLM Agent SimulationsXiangning Yu 0001, Yuwei Guo 0007, Yuqi Hou 0001, Xiao Xue 0001, Qun Ma. 24447-24479 [doi]
- MoLAN: A Unified Modality-Aware Noise Dynamic Editing Framework for Multimodal Sentiment AnalysisXingle Xu, Yongkang Liu 0002, Dexian Cai, Shi Feng 0001, Xiaocui Yang, Daling Wang, Yifei Zhang 0003. 24480-24495 [doi]
- C2PO: Diagnosing and Disentangling Bias Shortcuts in LLMsXuan Feng 0002, Bo An 0001, Tianlong Gu, Liang Chang 0003, Fengrui Hao, Peipeng Yu, Shuai Zhao. 24496-24515 [doi]
- Deconstruct, Diagnose, and Deliberate: A Protocol-Adaptive Role-Specific Multi-Agent Framework for Fake News DetectionZhigan Zhang, Jie Sui. 24516-24534 [doi]
- Position: Multimodal Large Language Models Can Significantly Advance Scientific ReasoningYibo Yan, Shen Wang 0005, Jiahao Huo, Jingheng Ye, Zhendong Chu, Xuming Hu, Philip S. Yu, Carla P. Gomes, Bart Selman, Qingsong Wen. 24535-24574 [doi]
- E³-TIR: Enhanced Experience Exploitation for Tool-Integrated ReasoningWeiyang Guo, Zesheng Shi, Liye Zhao, Jiayuan Ma, Zeen Zhu, Junxian He, Min Zhang 0005, Jing Li. 24575-24596 [doi]
- EVA: Evolving Semantic Adversaries for Red-Teaming GUI Agents Against Environmental Injection AttacksYijie Lu, Manman Zhao, Tianjie Ju, Zihe Yan, Xinbei Ma, Yuan Guo, Daizong Ding, Gongshen Liu, Zhuosheng Zhang 0001. 24597-24615 [doi]
- NEAT: Neuron-Based Early Exit for Large Reasoning ModelsKang Liu, Yongkang Liu, Xiaocui Yang, Peidong Wang, Wen Zhang, Shi Feng 0001, Yifei Zhang 0003, Daling Wang. 24616-24627 [doi]
- From "Thinking" to "Justifying": Aligning High-Stakes Explainability with Professional Communication StandardsChen Qian, Yimeng Wang, Yu Chen 0022, Lingfei Wu 0001, Andreas Stathopoulos. 24628-24637 [doi]
- EHRAG: Bridging Semantic Gaps in Lightweight GraphRAG via Hybrid Hypergraph Construction and RetrievalYifan Song 0006, Xingjian Tao, Zhicheng Yang, Yihong Luo, Jing Tang 0004. 24638-24652 [doi]
- PURE: Post-hoc Unlocking and REfinement for Discrete Diffusion DecodingYangryeol Park, Kunhui Lee, Hanback Choi, Cheoneum Park, Donghyeon Jeon, Inho Kang, Seung-Hoon Na. 24653-24667 [doi]
- OSCR-Attack: One-Shot Character Level Attacks through Self-Optimizing Continuous RelaxationLingyi Kong, Zhuo Liu, Zhanghao Hu, Qilong Qiu, Yutao Yang, Jingjing Xue, Zheng Wang 0037, Lin Gui 0003, Feiping Nie 0001. 24668-24683 [doi]
- MTEB-NL and E5-NL: Embedding Benchmark and Models for DutchNikolay Banar, Ehsan Lotfi 0002, Jens Van Nooten, Cristina Arhiliuc, Marija Kliocaite, Walter Daelemans. 24684-24709 [doi]
- Perceptual Hallucination in Vision-Language Models: Definition, Analysis and VerificationTaewook Hwang 0003, Inbum Heo, Sung-Jun Lee, Sangkeun Jung. 24710-24725 [doi]
- RATION: Entropy-Driven Task-Adaptive Visual Attention Allocation Framework for Multimodal ReasoningXingle Xu, Fanheng Kong, Dexian Cai, Shi Feng 0001, Xiaocui Yang, Daling Wang, Yifei Zhang 0003. 24726-24744 [doi]
- Multimodal In-context Learning for ASR of Low-resource LanguagesZhaolin Li, Jan Niehues. 24745-24760 [doi]
- a1: Steep Test-time Scaling Law via Environment Augmented GenerationLingrui Mei, Shenghua Liu, Yiwei Wang 0001, Baolong Bi, Yuyao Ge, Jun Wan, Yurong Wu, Xueqi Cheng. 24761-24786 [doi]
- Look and Think: Efficient Multimodal Reasoning via Modality-Decoupled CompressionXidi Cai, Junhao Zheng, Jingye Li, Boyuan Li, Shaowei Zhang, Qianli Ma 0001. 24787-24806 [doi]
- Topology-Enhanced Alignment for Large Language Models: Trajectory Topology Loss and Topological Preference OptimizationYurui Pan, Ke Xu, Bo Peng. 24807-24821 [doi]
- Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided VerificationYuxuan Wan, Tianqing Fang, Zaitang Li, Yintong Huo, Wenxuan Wang 0001, Haitao Mi, Dong Yu 0001, Michael R. Lyu. 24822-24835 [doi]
- FinCARDS: Card-Based Analyst Reranking for Financial Document Question AnsweringYixi Zhou, Fan Zhang, Y. U. Chen, Haipeng Zhang, Preslav Nakov, Zhuohan Xie. 24836-24852 [doi]
- A Unified Feature Mixture Framework for Joint Speech and Singing Deepfake DetectionAastha Sharma, Guangjing Wang. 24853-24863 [doi]
- From Atomic to Complex tasks: Cross-Tasking Improves Zero-Shot Argument Generation and RetrievalLynda Tamine, Ahmed Rayane Kebir, Merveille Dona Codjo, Enzo Pasquies, José G. Moreno 0001. 24864-24882 [doi]
- Sculpting the Vector Space: Towards Efficient Multi-Vector Visual Document Retrieval via Prune-then-Merge FrameworkYibo Yan, Mingdong Ou, Yi Cao, Xin Zou 0001, Jiahao Huo, Shuliang Liu, James T. Kwok, Xuming Hu. 24883-24925 [doi]
- ThinkLinker: From Low-Rank Interaction to Knowledge-Aware Verification for Multimodal Entity LinkingYingyao Ma, Yuanyuan Zhou, Congyu Zhang, Yi Yuan, Jiasong Wu, Lotfi Senhadji, Huazhong Shu. 24926-24942 [doi]
- Logit Arithmetic Elicits Long Reasoning Capabilities Without TrainingYunxiang Zhang, Muhammad Khalifa, LeChen Zhang, Xin Liu, Ayoung Lee, Xinliang Frederick Zhang, Farima Fatahi Bayat, Lu Wang 0008. 24943-24959 [doi]
- Evolving Agentic Workflow Driven by Human-Agent CollaborationYuxin Liu 0007, Jinxuan Zhang, Yuezhang Peng, Hefeng Zhou, Xiangfeng Wang 0001, Jiong Lou, Chentao Wu, Jie Li 0002, Jingjing Qu, Chaochao Lu. 24960-24969 [doi]
- HintPilot: LLM-based Compiler Hint Synthesis for Code OptimizationHanyun Jiang, Peisen Yao, Kaiyue Li, Tingting Lin, Chengpeng Wang 0001, Kui Ren 0001. 24970-24986 [doi]
- What Makes an LLM a Good Optimizer? A Trajectory Analysis of LLM-Guided Evolutionary SearchXinhao Zhang, Xi Chen, François Portet, Maxime Peyrard. 24987-25011 [doi]
- Token-level Inference-Time Alignment for Vision-Language ModelsKejia Chen 0007, Junjun Zheng, Jiawen Zhang 0005, Manxi Lin, Xiao Pan, Jiacong Hu, Jian Lou 0001, Zunlei Feng, Mingli Song. 25012-25029 [doi]
- STELLA: A Multimodal LLM for Protein Functional Annotation via Unified Sequence-Structure EncodingHongwang Xiao, Wenjun Lin, Xi Chen, Hui Wang, Kai Chen, Jiashan Li, Yuancheng Sun, Sicheng Dai, Boya Wu, Qiwei Ye. 25030-25049 [doi]
- RealFin: How Well Do LLMs Reason About Finance When Users Leave Things Unsaid?Yuyang Dai, Yan Lin, Zhuohan Xie, Yuxia Wang 0003. 25050-25080 [doi]
- Preference Optimization for Review Question Generation Improves Writing QualityKarun Sharma, Vidushee Vats, Shengzhi Li, Yuxiang Wang, Zhongtian Sun, Prayag Tiwari. 25081-25104 [doi]
- Your LLM Agent Can Leak Your Data: Data Exfiltration via Backdoored Tool UseWuyang Zhang, Shichao Pei. 25105-25129 [doi]
- EvoHyper: Evolving Hypergraph Topologies for Unified Collaboration in Multi-Agent CommunicationHeng Zhang, Yihao Zhong, Lubin Gan, Zhihe Chen, Jiajun Wu, Yuling Shi, Xiaodong Gu, Hao Zhang, Haochen You, Jin Huang 0007. 25130-25143 [doi]
- Think Before you Write: QA-Guided Reasoning for Character Descriptions in BooksArgyrios Papoudakis, Mirella Lapata, Frank Keller. 25144-25164 [doi]
- GroupRank: A Groupwise Paradigm for Effective and Efficient Passage Reranking with LLMsMeixiu Long, Duolin Sun, Dan Yang 0004, YiHan Jiao, Lei Liu, Jiahai Wang, Binbin Hu, Yue Shen, Jie Feng, ZheHao Tan, Junjie Wang, Lianzhen Zhong, Jian Wang 0108, Peng Wei, Jinjie Gu. 25165-25186 [doi]
- Mirage: A Diagnostic Framework for Evaluating the Realism of Synthetic Contact Center Dialogue GenerationRishikesh Devanathan, Varun Nathan, Ayush Kumar. 25187-25227 [doi]
- BloomEval: A Bloom's Cognitive Taxonomy-Based Benchmark for Evaluating LRMs via Cognitive Hierarchy TraceZhiyi Duan, Lei Gao, Jiangshan Guan, Qi Wang 0078, Rui Liu 0008. 25228-25248 [doi]
- CAIR: Causal Adaptive Information-based Reinforcement Learning for Multimodal Emotion ReasoningFengyu Zhang, Bin Liu 0041, Jianhua Tao 0001, Zhuofan Wen 0001, Shun Chen, Hailiang Yao, Zhengqi Wen. 25249-25264 [doi]
- A Multi-View Media Profiling Suite: Resources, Evaluation, and AnalysisMuhammad Arslan Manzoor, Dilshod Azizov, Daniil Orel, Umer Siddique, Zain Muhammad Mujahid, Yufang Hou 0001, Preslav Nakov. 25265-25286 [doi]
- Mechanistic Interpretability of Text-to-Image Diffusion Models via Cross-Attention InterventionsMaisha Maliha, Dean F. Hougen. 25287-25299 [doi]
- Revisiting Entropy in Reinforcement Learning for Large Reasoning ModelsRenren Jin, Pengzhi Gao, Yuqi Ren, Zhuowen Han, Tongxuan Zhang, Wuwei Huang, Wei Liu 0302, Jian Luan 0001, Deyi Xiong. 25300-25322 [doi]
- How Large Language Models Balance Internal Knowledge with User and Document AssertionsShuowei Li, Haoxin Li, Wenda Chu, Yi Fang. 25323-25346 [doi]
- ComicVQA: A Benchmark for Visual Reasoning in Multimodal LLMsEsther Gan, Hannah Brown, David Herel, Kenji Kawaguchi, Min-Yen Kan, Michael Qizhe Shieh. 25347-25370 [doi]
- AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware EvaluationWentao Shi 0002, Yu Wang 0089, Yuyang Zhao, Yuxin Chen, Fuli Feng, Xueyuan Hao, Xi Su, Qi Gu, Hui Su, Xunliang Cai, Xiangnan He 0001. 25371-25413 [doi]
- Can LLMs Estimate Student Struggles? Human-AI Difficulty Alignment with Proficiency Simulation for Item Difficulty PredictionMing Li 0010, Han Chen, Yunze Xiao, Jian Chen 0043, Hong Jiao, Tianyi Zhou 0001. 25414-25441 [doi]
- Transition-Matrix Regularization for Next Dialogue Act Prediction in Counselling ConversationsEric Rudolph, Philipp Steigerwald, Jens Albrecht. 25442-25457 [doi]
- ClimateCause: Complex and Implicit Causal Structures in Climate ReportsLiesbeth Allein, Nataly Pineda-Castañeda, Andrea Rocci, Marie-Francine Moens. 25458-25488 [doi]
- Reference-Free Evaluation of TaxonomiesPascal Wullschleger, Majid Zarharan, Donnacha Daly, Marc Pouly, Jennifer Foster. 25489-25507 [doi]
- CSI: An Investigative Multi-Agent Framework for Explainable Short Video Fake News DetectionYuxin Wang, Yang Yang, Huaiwen Zhang. 25508-25528 [doi]
- Dial HEALTHDIAL for Advice: A Multilingual and Multi-Parallel Spoken Dialogue Dataset for Knowledge-Grounded Information SeekingSongbo Hu, Yinhong Liu, Ej Zhou, Evgeniia Razumovskaia, XiaoBin Wang, Alexander Fraser 0001, Ivan Vulic, Anna Korhonen. 25529-25552 [doi]
- Fast and Effective On-Policy Distillation from Reasoning PrefixesDongxu Zhang, Zhichao Yang 0001, Sepehr Janghorbani, Jun Han, Andrew Ressler II, Qian Qian, Gregory D. Lyng, Sanjit Singh Batra, Robert E. Tillman. 25553-25569 [doi]
- MaRF: Leveraging Representation-Level Fusion of Formula Semantics for Mathematical Information RetrievalSuyuan Wang, Hongbo Zheng, Nickvash Kani. 25570-25585 [doi]
- From Documents to Segments: A Contextual Reformulation for Topic AssignmentHoonsang Yoon, Takyoung Kim, WonKee Lee, Ilmin Cho, Dilek Hakkani-Tür, Stanley Jungkyu Choi. 25586-25624 [doi]
- Can LLMs Compress (and Decompress)? Evaluating Code Understanding and Execution via InvertibilityNickil Maveli, Antonio Vergari, Shay B. Cohen. 25625-25660 [doi]
- Confidence Estimation for LLMs in Multi-turn InteractionsCaiqi Zhang, Ruihan Yang, Xiaochen Zhu, Chengzu Li, Tiancheng Hu, Yijiang River Dong, Deqing Yang, Nigel Collier. 25661-25676 [doi]
- Beyond Black-Box Labels: Interpretable Criteria for Diagnosing Subjective NLP TasksNisrine Rair, Alban Goupil, Valeriu Vrabie, Emmanuel Chochoy. 25677-25706 [doi]
- AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal ReasoningMengzhao Jia, Zhihan Zhang 0001, Ignacio Cases, Zheyuan Liu 0010, Meng Jiang 0001, Peng Qi. 25707-25724 [doi]
- HER: Human-like Reasoning and Reinforcement Learning for LLM Role-playingChengyu Du, Xintao Wang 0001, Aili Chen, Weiyuan Li, Rui Xu 0026, Junteng Liu, Zishan Huang, Rong Tian, Zijun Sun, Yuhao Li, Liheng Feng, Deming Ding, Pengyu Zhao, Yanghua Xiao. 25725-25762 [doi]
- Do Generalisation Results Generalise?Matteo Boglioni, Andrea Sgobbi, Gabriel Tavernini, Francesco Rita, Marius Mosbach, Tiago Pimentel. 25763-25783 [doi]
- Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language ModelsGaurav Srivastava 0012, Aafiya Shamshad Hussain, Sriram Srinivasan, Xuan Wang 0008. 25784-25826 [doi]
- PV-SQL: Synergizing Database Probing and Rule-based Verification for Text-to-SQL AgentsYuan Tian, Tianyi Zhang. 25827-25845 [doi]
- Anatomy of Unlearning: The Dual Impact of Fact Salience and Model Fine-TuningAnna Borisiuk, Andrey V. Savchenko, Alexander Panchenko, Elena Tutubalina. 25846-25859 [doi]
- What Do Neural Speech Models Know About Phonology? Evidence from Structured Phoneme ConfusionsEli Stafford, Aimée Lahaussois, Guillaume Wisniewski. 25860-25873 [doi]
- Rerank Before You Reason: Analyzing Reranking Tradeoffs through Effective Token Cost in Deep Search AgentsSahel Sharifymoghaddam, Jimmy Lin. 25874-25886 [doi]
- Position: LLM Watermarking Should Align Stakeholders' Incentives for Practical AdoptionYepeng Liu, Xuandong Zhao, Dawn Song, Gregory W. Wornell, Yuheng Bu. 25887-25903 [doi]
- Learning to Refine: Self-Refinement of Parallel Reasoning in LLMsQibin Wang, Pu Zhao 0004, Shaohan Huang, Fangkai Yang, Lu Wang 0029, Furu Wei, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang 0001. 25904-25921 [doi]
- AUDITA: A New Dataset to Audit Humans vs. AI Skill at Audio QATasnim Kabir, Dmytro Kurdydyk, Aadi Palnitkar, Liam Dorn, Ahmed Haj Ahmed, Jordan Lee Boyd-Graber. 25922-25951 [doi]
- NeoAraBERT: A Modern Foundation Model for Arabic Embeddings with Diacritics-Aware Tokenization and POS-Targeted MaskingChadi Abou Chakra, Hadi Khaled Hamoud, Osama Rakan Al Mraikhat, Qusai Abu Obaida, Mohamad Ballout, Fadi Zaraket. 25952-25968 [doi]
- Steering Away from Refusal: A Black-box Jailbreak Method Based on First-Token DistributionShuangjie Fu, Du Su, Xin Chen, Fei Sun 0002, Huawei Shen, Xueqi Cheng. 25969-25979 [doi]
- Mina: A Multilingual LLM-Powered Legal Assistant Agent for Empowering Access to Justice in BangladeshAzmine Toushik Wasi, Wahid Faisal, Mst Rafia Islam, Md. Rizwan Parvez. 25980-26028 [doi]
- Zero-Shot Context-Aware ASR for Diverse Arabic VarietiesBashar Talafha, Amin Abu Alhassan, Muhammad Abdul-Mageed. 26029-26044 [doi]
- The Sonar Moment: An Audio Geo-Localization Benchmark for Audio-Language ModelsRuixing Zhang, Zihan Liu, Leilei Sun, Tongyu Zhu, Weifeng Lv. 26045-26065 [doi]
- Towards Understanding the Robustness of Sparse AutoencodersAhson Saiyed, Sabrina Sadiekh, Chirag Agarwal. 26066-26086 [doi]
- Beyond Local vs. External: A Game-Theoretic Framework for Trustworthy Knowledge AcquisitionRujing Yao, Yufei Shi, Yang Wu, Ang Li 0049, Zhuoren Jiang, Xiaofeng Wang 0006, Haixu Tang, Xiaozhong Liu 0001. 26087-26099 [doi]
- False Sense of Security: Why Probing-based Malicious Input Detection Fails to GeneralizeCheng Wang, Zeming Wei, Qin Liu 0010, Wenxuan Zhou 0002, Muhao Chen 0001. 26100-26113 [doi]
- Do Transformers Grok Succinct Algorithms? Mechanistic Evidence for Counting CircuitsYizheng Zhao. 26114-26130 [doi]
- How Value Induction Reshapes LLM BehaviorArnav Arora, Natalie Schluter, Katherine Metcalf, Maartje ter Hoeve. 26131-26152 [doi]
- Stable Evidence, Unstable Decisions: An Empirical Analysis of Model Decision Stability in Vision-Language ModelsAli Khoramfar, Mohammad Javad Dousti, Alireza Mohamadian, Heshaam Faili. 26153-26166 [doi]
- PlanRAG-Audio: Planning and Retrieval Augmented Generation for Long-form Audio UnderstandingMasao Someki, Chien-Yu Huang, Siddhant Arora, Samuele Cornell, Markus Müller, Nathan Susanj, Rupak Vignesh Swaminathan, Grant P. Strimel, Jing Liu, Shinji Watanabe 0001. 26167-26183 [doi]
- VecCISC: Improving Confidence-Informed Self-Consistency with Reasoning Trace Clustering and Candidate Answer SelectionJames Petullo, Sonny George, Dylan Cashman, Nianwen Xue. 26184-26200 [doi]
- Incentivizing In-depth Reasoning over Long Contexts with Process Advantage ShapingMiao Peng, Weizhou Shen, Nuo Chen 0001, Chenliang Li 0003, Ming Yan 0008, Jia Li 0009. 26201-26228 [doi]
- Dissecting Clinical Reasoning in Natural Language Inference for Large Language ModelsMaël Jullien, André Freitas, Marco Valentino, Leonardo Ranaldi. 26229-26250 [doi]
- LLM-Codec: Neural Audio Codec Meets Language Model ObjectivesHo-Lam Chung, Yiming Chen 0010, Hung-yi Lee. 26251-26265 [doi]
- Who is the richest club in the championship? Detecting and Rewriting Underspecified Questions Improve QA PerformanceYunchong Huang, Gianni Barlacchi, Sandro Pezzelle. 26266-26281 [doi]
- Beyond Chunks and Graphs: Retrieval-Augmented Generation through Triplet-Driven ThinkingShengbo Gong, Xianfeng Tang, Qi He 0002, Carl Yang 0001, Wei Jin 0009. 26282-26308 [doi]
- Where Reasoning Breaks: Logic-Aware Path Selection by Controlling Logical Connectives in LLMs Reasoning ChainsSeunghyun Park, Yuanyuan Lei 0001. 26309-26324 [doi]
- Reheat Nachos for Dinner? Evaluating AI Support for Cross-Cultural Communication of NeologismsDayeon Ki, Yu Hou, Rachel Rudinger, Hal Daumé III, Marine Carpuat, Fumeng Yang. 26325-26362 [doi]
- Learning Dynamic Representations and Policies from Multimodal Clinical Time-Series with Informative MissingnessZihan Liang 0002, Ziwen Pan, Ruoxuan Xiong. 26363-26392 [doi]
- Quantize What Counts: More for Keys, Less for ValuesMohsen Hariri, Alan Luo, Weicong Chen, Tianyi Zhang 0011, Qifan Wang 0001, Xiaotian Han, Vipin Chaudhary. 26393-26420 [doi]
- PersonaAgent: Bridging Memory and Action for Personalized LLM AgentsWeizhi Zhang 0001, Xinyang Zhang 0002, Chenwei Zhang, Liangwei Yang, Jingbo Shang, Zhepei Wei, Henry Peng Zou, Zijie Huang 0002, Zhengyang Wang, Yifan Gao 0001, Xiaoman Pan, Lian Xiong, Jingguo Liu, Philip S. Yu, Xian Li. 26421-26439 [doi]
- Beyond Fixed Psychological Personas: State Beats Trait, but Language Models are State-BlindTamunotonye Harry, Ivoline C. Ngong, Chima Nweke, Yuanyuan Feng, Joseph P. Near. 26440-26468 [doi]
- From RAG to Agentic RAG for Faithful Islamic Question AnsweringGagan Bhatia, Hamdy Mubarak, Mustafa Jarrar, George K. Mikros, Fadi Zaraket, Mahmoud Alhirthani, Mutaz Al-Khatib, Logan Cochrane, Kareem Darwish, Rashid Yahiaoui, Firoj Alam. 26469-26488 [doi]
- Losses that Cook: Topological Optimal Transport for Structured Recipe GenerationMattia Ottoborgo, Daniele Rege Cambrin, Paolo Garza. 26489-26500 [doi]
- Concept Tokens: Learning Behavioral Embeddings Through Concept DefinitionsIgnacio Sastre, Aiala Rosá. 26501-26518 [doi]
- Beyond Monolithic Rewards: Hybrid Multi-Aspect Reward OptimizationRadha Gulhane, Sathish Reddy Indurthi. 26519-26533 [doi]
- VAUQ: Vision-Aware Uncertainty Quantification for LVLM Self-EvaluationSeongheon Park, Changdae Oh, Hyeong Kyu Choi, Sean Du, Sharon Li 0001. 26534-26550 [doi]
- Will it Merge? On The Causes of Model MergeabilityAdir Rahamim, Asaf Yehudai, Boaz Carmeli, Leshem Choshen, Yosi Mass, Yonatan Belinkov. 26551-26570 [doi]
- Carefully Considering Culture: Analyzing LLM Alignment in Single- and Multi-Cultural Settings using Cultural Consensus TheoryKrishna Pothugunta, John P. Lalor. 26571-26582 [doi]
- Parallel-SFT: Improving Zero-Shot Cross-Programming-Language Transfer for Code RLZhaofeng Wu, Shiqi Wang 0032, Boya Peng, Anuj Kumar Goyal, Melanie Kambadur, Sebastian Ruder, Yoon Kim, Chloe Bi. 26583-26598 [doi]
- Distorted or Fabricated? A Survey on Hallucination in Video LLMsYiyang Huang 0001, Yitian Zhang, Yizhou Wang 0006, Mingyuan Zhang, Liang Shi 0001, Huimin Zeng, Yun Fu 0001. 26599-26611 [doi]
- Generative Floor Plan Design with LLMs via Reinforcement Learning with Verifiable RewardsLuis Lara, Aristides Milios, Zhi Hao Luo, Aditya Sharma, Ge Ya Luo, Christopher Beckham, Florian Golemo, Christopher Pal. 26612-26627 [doi]
- Creating Grammar Teaching Material for Endangered Languages with Hybrid Grammar InductionSebastien Christian. 26628-26643 [doi]
- OpenExempt: A Diagnostic Benchmark for Legal Reasoning and a Framework for Creating Custom Benchmarks on DemandSergio Servantez, Sarah B. Lawsky, Rajiv Jain, Daniel W. Linna Jr., Kristian J. Hammond. 26644-26669 [doi]
- Context-Conditioned Masked LoRA: Dynamic Rank Routing for Compute-Efficient Parameter-Efficient Fine-TuningRifat Rafiuddin, Rafae Abdullah. 26670-26689 [doi]
- A Survey on Evaluation of LLM-based AgentsAsaf Yehudai, Lilach Eden, Alan Li, Guy Uziel, Yilun Zhao 0001, Roy Bar-Haim, Arman Cohan, Michal Shmueli-Scheuer. 26690-26714 [doi]
- ProToM: Promoting Prosocial Behaviour via Theory of Mind-Informed FeedbackMatteo Bortoletto, Yichao Zhou, Lance Ying, Tianmin Shu, Andreas Bulling. 26715-26734 [doi]
- JudgeMeNot: Personalizing Large Language Models to Emulate Judicial Reasoning in HebrewItay Razumenko, Arnon Sturm, Nir Grinberg. 26735-26753 [doi]
- Stabilizing Efficient Reasoning with Step-Level Advantage SelectionHan Wang, Xiaodong Yu, Jialian Wu, Jiang Liu, Ximeng Sun, Mohit Bansal, Zicheng Liu. 26754-26765 [doi]
- RePrompT: Recurrent Prompt Tuning for Integrating Structured EHR Encoders with Large Language ModelsArya Hadizadeh Moghaddam, Drew Ross, Mohsen Nayebi Kerdabadi, Dongjie Wang, Zijun Yao 0001. 26766-26778 [doi]
- CLARO: Controlled Attribute-Driven Reasoning Optimization for Efficient Chain-of-ThoughtOded Schlesinger, Young-Kyung Kim, J. Matías Di Martino, Guillermo Sapiro. 26779-26799 [doi]
- Hidden States as Early Signals: Step-level Trace Evaluation and Pruning for Efficient Test-Time ScalingZhixiang Liang, Beichen Huang, Zheng Wang, Minjia Zhang. 26800-26813 [doi]
- From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized AgentsMd Nayem Uddin, Kumar Shubham, Eduardo Blanco 0002, Chitta Baral, Gengyu Wang. 26814-26841 [doi]
- Towards Inference-time Scaling for Continuous Space ReasoningMinghan Wang, Thuy-Trang Vu, Ehsan Shareghi, Gholamreza Haffari. 26842-26856 [doi]
- SynthFix: Adaptive Neuro-Symbolic Code Vulnerability RepairYifan Zhang, Jieyu Li, Kexin Pei, Yu Huang, Kevin Leach. 26857-26870 [doi]
- Imperfectly Cooperative Human-AI Interactions: Comparing the Impacts of Human and AI Attributes in Simulated and User StudiesMyke C. Cohen, Mingqian Zheng, Neel Bhandari, Hsien-Te Kao, Xuhui Zhou, Daniel Nguyen, Laura Cassani, Maarten Sap, Svitlana Volkova. 26871-26901 [doi]
- CheMM-R1: Enhancing Chemical Structure Recognition and Elucidation with Reasoning Multimodal Large Language ModelsLiting Huang, Zhihao Zhang, Shoujin Wang. 26902-26921 [doi]
- Agree, Disagree, Explain: Decomposing Human Label Variation in NLI through the Lens of ExplanationsPingjun Hong, Beiduo Chen, Siyao Peng, Marie-Catherine de Marneffe, Benjamin Roth 0001, Barbara Plank. 26922-26934 [doi]
- DeepSpecs: Expert-Level Question Answering in 5GAman Ganapathy Manvattira, Yifei Xu, Ziyue Dang, Songwu Lu. 26935-26953 [doi]
- On-Policy Self-Distillation for Efficient Diffusion Language Models with Early-Stage CalibrationHuaisheng Zhu, Mingyu Liu, Junze Liu, Zhen Ge, Tian Wang, Jiri Gesi, Dakuo Wang, Weiqi Zhang, Houyu Zhang, Yufan Guo, Xian Li, Bing Yin, Sujay Sanghavi. 26954-26965 [doi]
- Arctic-Text2SQL-R1: Simple Rewards, Strong Reasoning in Text-to-SQLZhewei Yao, Guoheng Sun, Lukasz Borchmann, Zheyu Shen, Minghang Deng, Bohan Zhai, Hao Zhang, Ang Li, Yuxiong He. 26966-26995 [doi]
- Do Emotions Influence Moral Judgment in Large Language Models?Mohammad Saim, Tianyu Jiang 0001. 26996-27013 [doi]
- RShield: A User-level Traceable Backdoor Watermark for LLMs in Embedding-as-a-ServiceLingyun Xiang, Yufan Zhong, Chengfu Ou, Zhihua Xia, Chunfang Yang, Daojian Zeng, Zhangjie Fu. 27014-27028 [doi]
- The Adaptive Interrogator: Detecting Trojan LLMs in Multi-Agent Systems via Evolved Conversational StrategiesRana Muhammad Shahroz Khan, Ruichen Zhang 0004, Zhen Tan 0001, Charles Fleming, Tianlong Chen 0001. 27029-27044 [doi]
- SmartAD: Capacity-Aligned Agent Distillation for Small Language ModelsGuokai Tang, Feng Zhao 0003. 27045-27057 [doi]
- TRM-Planner: Offline Target Planning and Distillation for Tiny Recursive ModelsEuijin Baek, Housam Khalifa Bashier Babiker, Mi-Young Kim, Randy Goebel. 27058-27070 [doi]
- MAPLE: Multi-Aspect Panels of LLM Evaluators for Open-Ended QuestionsMichinori Jinji, Kyohei Atarashi, Koh Takeuchi 0001, Hisashi Kashima. 27071-27088 [doi]
- MARCH: Evaluating the Intersection of Ambiguity Interpretation and Multi-hop InferenceJeonghyun Park, Ingeol Baek, Seunghyun Yoon 0002, Haeun Jang, Aparna Garimella, Akriti Jain 0001, Nedim Lipka, Hwanhee Lee. 27089-27115 [doi]
- Enhancing Multilingual RAG Systems with Debiased Language Preference-Guided Query FusionJeonghyun Park, Byeongjeong Kim, Seojin Hwang, Hwanhee Lee. 27116-27136 [doi]
- MT-OSC: Path for LLMs that Get Lost in Multi-Turn ConversationJyotika Singh, Fang Tu, Miguel Ballesteros, Weiyi Sun, Sandip Ghoshal, Michelle Yuan, Yassine Benajiba, Sujith Ravi, Dan Roth 0001. 27137-27160 [doi]
- Soft Head Selection for Injecting ICL-Derived Task EmbeddingsJungwon Park, Jimyeong Kim, Changin Choi, Wonjong Rhee. 27161-27214 [doi]
- CORAL: Adaptive Retrieval Loop for Culturally-Aligned Multilingual RAGNayeon Lee, Jiwoo Song, Byeongcheol Kang. 27215-27237 [doi]
- Safety Guardrails of Large Language Models Are Vulnerable to Value-Driven Adversarial PromptingXiaohao Luo, Ying Wei, Zhijun Li. 27238-27255 [doi]
- Fair RAG: End-to-End Fairness Across Retrieval and GenerationFarsheed Haque, Zhe Fu 0002, Ramit Aditya, Depeng Xu 0001, Xi Niu. 27256-27270 [doi]
- ManCC: A Task-Anchored Benchmark for Manchu-Classical Chinese Cross-Lingual ModelingMeiqi Wang, Xiaoxin Sun, Dongjie Wang, Ruixin Yu, Xiantao Heng, Shuo Wang, Zhen Huang, Peng Zhao, Suhua Wang, Minghao Yin. 27271-27292 [doi]
- Dynamic Graph Navigation via Triplet Chains for Structure-Aware Retrieval-Augmented GenerationFeng Zhao, Yufei Wu, Xianggan Liu, Ruilin Zhao. 27293-27303 [doi]
- Style over Story: Measuring LLM Narrative Preferences via Structured SelectionDonghoon Jung, Jiwoo Choi, Songeun Chae, Seohyon Jung. 27304-27331 [doi]
- Visual Interference in Speech Evaluation: Cultural Asymmetry and Cross-Modal Bias in MLLMsKyusik Kim 0001, Hyunwoo Yoo, Jaehoon Choi, Gail Rosen, Bongwon Suh. 27332-27358 [doi]
- DraDDP: A Multimodal Multi-Party Dialogue Discourse Parsing DatasetShannan Liu, Peifeng Li 0001, Yaxin Fan, Qiaoming Zhu. 27359-27373 [doi]
- Table-R1: Region-based Reinforcement Learning for Table UnderstandingZhenhe Wu, Jian Yang 0003, Zhongjiang He, Changzai Pan, Jiaheng Liu, Xianjie Wu, Yu Zhao 0007, Shuangyong Song, Yongxiang Li, Zhoujun Li 0001, Xuelong Li 0001. 27374-27391 [doi]
- ARM2: Adaptive Reasoning Model with Vision Understanding and Executable CodeJian Xie, Zhendong Chu, Aoxiao Zhong, Kai Zhang 0033, Mingzhe Han, Xing Fan, Jialie Shen 0001, Qingsong Wen. 27392-27405 [doi]
- A Framework of Reflective Agents with Adaptive Collaboration for Attributed Summary GenerationYu Chen, Peng Chen, Ziwei Zheng, Bang Wang 0001. 27406-27425 [doi]
- VLURes: Benchmarking Long-Text Grounding and Cross-Lingual Robustness in Vision Language ModelsJesse Atuhurra, Iqra Ali, Tomoya Iwakura, Hidetaka Kamigaito, Tatsuya Hiraoka. 27426-27481 [doi]
- Trustworthy and Explainable Causal Representation Learning in TransformersYang Liu, Yinghao Zhang, Lin Liu 0003, Jiuyong Li, Debo Cheng, Zaiwen Feng. 27482-27501 [doi]
- Affectron: Emotional Speech Synthesis with Affective and Contextually Aligned Nonverbal VocalizationsDeok-Hyeon Cho, Hyung-Seok Oh, Seung-bin Kim, Seong-Whan Lee. 27502-27525 [doi]
- Reasoning-Guided Exploration for Online DPOZetian Hu, Shunyu Liu 0001, Ting-En Lin, Fei Huang 0002, Yongbin Li 0001, Dacheng Tao. 27526-27542 [doi]
- CAPA: Contribution-Aware Pruning and FFN Approximation for Efficient Large Vision-Language ModelsSamyak Jha, Junho Kim. 27543-27558 [doi]
- Strong Reasoning Isn't Enough: Evaluating Evidence Elicitation in Interactive DiagnosisZhuohan Long, Zhongyu Wei. 27559-27575 [doi]
- IF-GEO: Conflict-Aware Instruction Fusion for Multi-Query Generative Engine OptimizationHeyang Zhou, Jiajia Chen, Xiaolu Chen, Jie Bao, Zhen Chen, Yong Liao. 27576-27590 [doi]
- Investigating Human and LLMs' Decisions in Unverifiable Environments: A Case Study with GitHub Activity OverviewZheng Jiang, Wei Wang 0053, Gaowei Zhang, Yang Feng 0003, Yi Wang 0013. 27591-27618 [doi]
- PlotGen-Bench: Evaluating VLMs on Generating Visualization Code from Diverse Plots across Multiple LibrariesYi Zhao 0029, Zhen Yang 0034, Shuaiqi Duan, Wenmeng Yu, Zhe Su, Jibing Gong, Jie Tang 0001. 27619-27650 [doi]
- Chronos: Learning Temporal Dynamics of Reasoning Chains for Test-Time ScalingKai Zhang, Jiayi Liao, Chengpeng Li, Ziyuan Xie, Sihang Li, Xiang Wang. 27651-27664 [doi]
- V-RoLoRA: RLVR-Driven MoE Routing for Steerable Pluralistic AlignmentJing Wang, Yaomin Wu, Yinglin Wang, Yitong Yang. 27665-27682 [doi]
- ParaCook: On Time-Efficient Planning for Multi-Agent SystemsShiQi Zhang, Xinbei Ma, Yunqing Xu, Zouying Cao, Pengrui Lu, Haobo Yuan, Tiancheng Shen, Zhuosheng Zhang 0001, Hai Zhao 0001, Ming-Hsuan Yang 0001. 27683-27701 [doi]
- Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and BenchmarksNobin Sarwar, Shubhashis Roy Dipta, Zheyuan Liu, Vaidehi Patil. 27702-27730 [doi]
- From Interpretability to Performance: Optimizing Retrieval Heads for Long-Context Language ModelsYoumi Ma, Naoaki Okazaki. 27731-27747 [doi]
- Bridging the Temporal Gap in Multimodal LLMs: Deeply Stacking Temporal Tokens for Audio-Visual Speech RecognitionLiyong Wang, Junliang Xing, Tianyu Hu, Jianfei Jiang 0006, Jihuai Zhao, Huimin Ma 0001. 27748-27759 [doi]
- MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language ModelsSuhyun Lee, Palakorn Achananuparp, Neemesh Yadav, Ee-Peng Lim, Yang Deng 0002. 27760-27793 [doi]
- Enabling Stroke-Level Structural Analysis of Hieroglyphic Scripts without Language-Specific PriorsFuwen Luo, Zihao Wan, Ziyue Wang 0002, Yaluo Liu, Pau Tong Lin Xu, Xuanjia Qiao, Xiaolong Wang 0014, Peng Li 0030, Yang Liu 0005. 27794-27810 [doi]
- CODEPROMPTZIP: Code-specific Prompt Compression for Retrieval-Augmented Generation in Coding Tasks with LMsPengfei He, Shaowei Wang 0002, Tse-Hsun Chen. 27811-27825 [doi]
- Detecting Hallucinations in Retrieval-Augmented Generation via Semantic-level Internal Reasoning GraphJianpeng Hu, Yanzeng Li, Jialun Zhong, Lei Zou 0001, Wenfa Qi. 27826-27841 [doi]
- MeasHalu: Mitigation of Scientific Measurement Hallucinations for Large Language Models with Enhanced ReasoningRuijun Huang, Zhiqiao Kang, Yuxuan Zhu, Junxiong Li, Jiahao Zhao, Minghuan Tan, Feng Jiang, Min Yang 0007. 27842-27859 [doi]
- CRAFTQA: A Code-Driven Adaptive Framework for Complex Structured Data ReasoningChengtao Gan, Zhiqiang Liu, Long Jin, Yushan Zhu, Lei Liang, Wen Zhang. 27860-27876 [doi]
- EMTIR-GRPO: Efficient Multi-Tool Augmented Large Language Models via Reinforcement LearningShixin Jiang, Zhihao Zhu, Jiafeng Liang, Yang Wu 0010, Ming Liu 0004, Bing Qin 0001. 27877-27894 [doi]
- Multi-Persona Thinking for Bias Mitigation in Large Language ModelsYuxing Chen, Guoqing Luo, Zijun Wu 0002, Lili Mou. 27895-27909 [doi]
- LCO: LLM-based Constraint Optimization for Safer Agentic LLMs in Real-world TasksJiayong Wan, Jiawei Chen, Zhaoxia Yin, Shuyuan Liu, Hang Su 0006. 27910-27934 [doi]
- MedKInstruct: A Multimodal Knowledge Graph Based Framework for Multi-Hop and Hard-Negative Instruction Data Synthesis in MedVQAYinan Wu, Jihang Jin, Xuhao Bao, Weiyan Zhang, Hanjing Yan, Tong Ruan, Chunming Wang. 27935-27947 [doi]
- GeometryZero: Advancing Geometry Solving via Group Contrastive Policy OptimizationYikun Wang 0001, Yibin Wang, Dianyi Wang, Zimian Peng, Qipeng Guo, Dacheng Tao, Jiaqi Wang. 27948-27963 [doi]
- CollabCoder: Plan-Code Co-Evolution via Collaborative Decision-Making for Efficient Code GenerationDuy-Tung Doan, Quang Huy Phung, Dzung Nguyen, Khac-Hoai Nam Bui. 27964-27985 [doi]
- Beyond the Safety Tax: Mitigating Unsafe Text-to-Image Generation via External Safety RectificationXiangtao Meng, Yingkai Dong, Ning Yu 0006, Li Wang 0120, Zheng Li 0023, Shanqing Guo. 27986-27998 [doi]
- WenetSpeech-Wu: Datasets, Benchmarks, and Models for a Unified Chinese Wu Dialect Speech Processing EcosystemChengyou Wang, Mingchen Shao, Jingbin Hu, Zeyu Zhu, Hongfei Xue, Bingshen Mu, Xin Xu, Xingyi Duan, Binbin Zhang, Pengcheng Zhu 0004, Chuang Ding, Xiaojun Zhang, Hui Bu, Lei Xie 0001. 27999-28011 [doi]
- ReaGeo: Reasoning-Enhanced End-to-End Geocoding with LLMsJian Cui, Zhiyuan Ren, Desheng Weng, Yongqi Zhao, Gong Wenbin, Yu Lei, Zhenning Dong. 28012-28023 [doi]
- EviReport: From Reasoned Outlines to Evidence Tracked Long-Form ReportsZihan Liu, Jianhui Li, Zexin Wang, Fei Sun 0001, Jingjing Li, Zheyuan Li, Ke Xiang, Hang Cui 0004, Houhua Gong, Changhua Pei, Gaogang Xie. 28024-28048 [doi]
- Preference Estimation via Opponent Modeling in Multi-Agent NegotiationYuta Konishi, Kento Yamamoto, Eisuke Sonomoto, Rikuho Takeda, Ryo Furukawa, Yusuke Muraki, Takafumi Shimizu, Kazuma Fukumura, Yuya Kanemoto, Takayuki Ito 0001, Shiyao Ding. 28049-28058 [doi]
- AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement LearningJingbo Sun, Wenyue Chong, Songjun Tu, Qichao Zhang, Yaocheng Zhang, Jiajun Chai, Xiaohan Wang, Wei Lin, Guojun Yin, Dongbin Zhao. 28059-28079 [doi]
- Beneficial Reasoning Behaviors in Agentic Search and Effective Training Methods to Obtain ThemJiahe Jin, Abhijay Sai Paladugu, Chenyan Xiong. 28080-28097 [doi]
- Beyond Prompt: Fine-grained Simulation of Cognitively Impaired Standardized Patients via Stochastic SteeringWeikang Zhang, Zimo Zhu, Zhichuan Yang, Chen Huang 0006, Wenqiang Lei, See-Kiong Ng. 28098-28131 [doi]
- Where Did It Go Wrong? Capability-Oriented Failure Attribution for Vision-and-Language Navigation AgentsJianming Chen, Yawen Wang, Junjie Wang 0001, Xiaofei Xie, Shoubin Li, Qing Wang 0001, Fanjiang Xu. 28132-28150 [doi]
- MultiFileTest: A Multi-File-Level LLM Unit Test Generation Benchmark and Impact of Error Fixing MechanismsYibo Wang 0001, Congying Xia, Wenting Zhao 0006, Jiangshu Du, ChunYu Miao, Zhongfen Deng, Philip S. Yu, Chen Xing. 28151-28172 [doi]
- SAMoRA: Semantic-Aware Mixture of LoRA Experts for Task-Adaptive LearningBoyan Shi, Wei Chen 0105, Shuyuan Zhao 0001, Junfeng Shen, Shengnan Guo 0001, Shaojiang Wang, Huaiyu Wan. 28173-28188 [doi]
- DualAlign: Generating Clinically Grounded Synthetic DataRumeng Li, Xun Wang, Hong Yu. 28189-28208 [doi]
- Breaking the Evaluation Paradox: Evaluating High-Entropy Search with Computationally Irreducible ConstraintsJuntao Wu, Wei Wen, Xianting Huang, Shuai Pang, Ruizhi Qiao, Xing Sun 0001, Ke Wang 0068. 28209-28218 [doi]
- CoT-Edit: Reinforcement Learning of Chain-of-Thought Reasoning for Code Edit SuggestionWuya Chen, Yihao Yang, Yue Lin. 28219-28234 [doi]
- MemORAI: Memory Organization and Retrieval via Adaptive Graph Intelligence for LLM Conversational AgentsHung Pham Van, Nguyen Manh Hieu, Khang Pham Tran Tuan, Nam Le Hai, Linh Ngo Van 0001, Nguyen Thi Ngoc Diep, Trung Le 0001. 28235-28253 [doi]
- MDC-Bench: A Multidisciplinary Causal Benchmark Based on Causal Structures for Evaluating Large Language ModelsPeng Wang, Yuxiong Yan, Xiao Ding, Kai Xiong 0002, Bibo Cai, Chao Peng, Yutai Hou, Dandan Tu, Bing Qin 0001, Ting Liu 0001. 28254-28297 [doi]
- MathAgent: Adversarial Evolution of Constraint Graphs for Mathematical Reasoning Data SynthesisZixiong Yu, Jun Rao, Guhan Chen, Songtao Tian, Bohan Li 0010, Jiansheng Wei, Min Zhang 0005, Xiaojun Meng. 28298-28321 [doi]
- Neural Induction of Finite-State TransducersMichael Ginn, Alexis Palmer, Mans Hulden. 28322-28336 [doi]
- Dynamic Sampling that Adapts: Self-Aware Iterative Data Persistent Optimization for Mathematical ReasoningJun Rao, Xuebo Liu 0002, Hexuan Deng, Zepeng Lin, Zixiong Yu, Jiansheng Wei, Xiaojun Meng, Min Zhang 0005. 28337-28350 [doi]
- Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMsXiaozhe Li, XinYu Fang, Shengyuan Ding, Yang Li 0189, Linyang Li, Haodong Duan, Qingwen Liu 0001, Kai Chen 0026. 28351-28368 [doi]
- Datasets for Scientific Literature Understanding: A SurveyYuanzhe Zhang, Xun Zhao, Maodi Hu, Xi Sun, Donghuan Song, Zhixiong Zhang 0002. 28369-28389 [doi]
- ODASim: Ordered, Distinctive and Absolute Semantic Similarity for Code Explanation EvaluationPrince Kumar, Vitobha Munigala, Jaydeep Sen, Ashish R. Mittal, Vishwajeet Kumar, Srikanth G. Tamilselvam. 28390-28403 [doi]
- Almieyar-Oryx-BloomBench: A Bilingual Multimodal Benchmark for Cognitively Informed Evaluation of Vision-Language ModelsMohammad Mahdi Abootorabi, Omid Ghahroodi, Anas Madkoor, Marzia Nouri, Doratossadat Dastgheib, Ehsaneddin Asgari. 28404-28436 [doi]
- OPT-BENCH: Evaluating the Iterative Self-Optimization of LLM Agents in Large-Scale Search SpacesXiaozhe Li, Jixuan Chen, XinYu Fang, Shengyuan Ding, Haodong Duan, Qingwen Liu 0001, Kai Chen 0026. 28437-28452 [doi]
- VocabTailor: Dynamic Vocabulary Selection for Downstream Tasks in Small Language ModelsHanling Zhang, Yayu Zhou, Tongcheng Fang, Zhihang Yuan, Guohao Dai 0001, Wanli Ouyang, Yu Wang 0002. 28453-28471 [doi]
- Feedback Adaptation for Retrieval-Augmented GenerationJihwan Bang, Seunghan Yang, Kyuhong Shim, Simyung Chang, Juntae Lee, Sungha Choi. 28472-28485 [doi]
- From Implicit to Explicit: Token-Efficient Logical Supervision for Mathematical Reasoning in LLMsShaojie Wang, Liang Zhang. 28486-28500 [doi]
- When Backdoors Go Beyond Triggers: Semantic Drift in Diffusion Models Under Encoder AttacksShenyang Chen, Liuwan Zhu. 28501-28517 [doi]
- Reducing Peak Memory Usage for Modern Multimodal Large Language Model PipelinesJunwan Kim, Hyunkyung Bae. 28518-28526 [doi]
- MAKI: Multi-layer Aligned Knowledge Injection for Structure-aware Knowledge Graph Completion with Large Language ModelsZhiwen Xie, Xin Wang, Guangyou Zhou, Derek F. Wong. 28527-28539 [doi]
- From Domains to Instances: Dual-Granularity Data Synthesis for LLM UnlearningXiaoyu Xu, Minxin Du, Zitong Li, Zi Liang, Zhibiao Guo, Shiyu Zhang, Peizhao Hu, Qingqing Ye 0001, Haibo Hu 0001. 28540-28556 [doi]
- ERRV: Eliciting Efficient Reasoning through Reasoning Vectors for Policy Optimization in Large Language ModelsZhuowen Han, Lei Yang, Renren Jin, Dan Shi 0001, Chenxi Sun, Deyi Xiong. 28557-28570 [doi]
- LLM-induced Rationales for More Compact Explainable Style Classification ModelsAhmad Aljanaideh, Saeb Ganideh. 28571-28577 [doi]
- MDTeamGPT: Mitigating Context Collapse and Enabling Self-Evolution in Medical Multi-Agent ReasoningKai Chen 0026, Xinfeng Li, Tianpei Yang, Hewei Wang 0001, Guang Yang 0066, Jing Huo, Yang Gao 0001. 28578-28606 [doi]
- TSPO: Breaking the Double Homogenization Dilemma in Multi-turn Search Policy OptimizationShichao Ma, Zhiyuan Ma, Ming Yang, Xiaofan Li 0008, Xing Wu, Jintao Du, Yu Cheng 0005, Weiqiang Wang 0002, Qiliang Liu, Zhengyang Zhou, Yang Wang. 28607-28623 [doi]
- Towards semantic reliable clinical QA: Query pipeline optimization for cancer patient question answering systemsMaolin He, Rena Wei Gao, Mike Conway, Brian E. Chapman. 28624-28637 [doi]
- LayerNorm Induces Recency Bias in Transformer DecodersJunu Kim, Xiao Liu 0029, Zhenghao Lin, Lei Ji 0001, Yeyun Gong, Edward Choi 0003. 28638-28652 [doi]
- Scaling Performance and Low-Resource Annotation with Many-Shot In-Context Learning for Named Entity RecognitionQi Zhang, Fangping Lan, Cornelia Caragea, Longin Jan Latecki, Eduard C. Dragut. 28653-28673 [doi]
- PhageBench: Can LLMs Understand Raw Bacteriophage Genomes?Yusen Hou, Weicai Long, Haitao Hu, Houcheng Su, Junning Feng 0001, Yanlin Zhang. 28674-28698 [doi]
- POLAR: A Benchmark for Multilingual, Multicultural, and Multi-Event Online PolarizationUsman Naseem, Robert Geislinger, Juan Ren, Sarah Kohail, Rudy Alexandro Garrido Veliz, P. Sam Sahil, Yiran Zhang, Idris Abdulmumin, Marco Antonio Stranisci, Özge Alaçam, Cengiz Acartürk, Aisha Jabr, Saba Anwar, Abinew Ali Ayele, Simona Frenda, Alessandra Teresa Cignarella, Elena Tutubalina, Oleg Rogov, Aung Kyaw Htet, Xintong Wang 0001, Surendrabikram Thapa, Kritesh Rauniyar, Tanmoy Chakraborty 0002, MD Arfeen Zeeshan, Dheeraj Kodati, Satya Keerthi, Sahar Moradizeyveh, Firoj Alam, Md. Arid Hasan, Syed Ishtiaque Ahmed, Ye Kyaw Thu, Shantipriya Parida, Ihsan Ayyub Qazi, Lilian Diana Awuor Wanzare, Nelson Odhiambo Onyango, Clemencia Siro, Jane Wanjiru Kimani, Ibrahim Said Ahmad, Adem Chanie Ali, Martin Semmann, Chris Biemann, Shamsuddeen Hassan Muhammad, Seid Muhie Yimam. 28699-28720 [doi]
- VANE: Guiding High-Value Exploration in RLVR via Outcome-Process Novelty ShapingXu He, JiaLiang Guo, Fucheng Xiong, Haodong Zhao, Xingyang Li, Ke Zeng, Xunliang Cai. 28721-28739 [doi]
- Exploring Coding Spot: Understanding Parametric Contributions to LLM Coding PerformanceDongjun Kim, MinHyuk Kim, Yongchan Chun, Chanjun Park, HeuiSeok Lim. 28740-28746 [doi]
- FedGUI: Benchmarking Federated GUI Agents across Heterogeneous Platforms, Devices, and Operating SystemsWenhao Wang 0002, Haoting Shi, Mengying Yuan, Yiquan Lin, Panrong Tong, Hanzhang Zhou, Guangyi Liu, Pengxiang Zhao, Yue Wang, Siheng Chen. 28747-28767 [doi]
- Towards Proactive Information Probing: Customer Service Chatbots Harvesting Value from ConversationChen Huang 0006, Zitan Jiang, Changyi Zou, Wenqiang Lei, See-Kiong Ng. 28768-28792 [doi]
- Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge ReasoningHaiyang Yu 0004, Yuchuan Wu, Fan Shi, Jinghui Lu, Ke Niu 0004, Xiaodong Ge, Minghan Zhuo, Jingqun Tang, Bin Li 0015. 28793-28812 [doi]
- DaMo: Data Mixing Optimizer in Fine-tuning Multimodal LLMs for Mobile Phone AgentsKai Shi, Jun Yang, Ni Yang, Binqiang Pan, Qingsong Xie, Chao Zhang, Zhenyu Yang, Tianhuang Su, Haonan Lu. 28813-28830 [doi]
- From Outcome to Process: Optimizing MoE Load Balancing with MCTSWenjun Ke 0002, Hengyuan Xu, Ziyu Shang, Yao He, Jiahao Wang, Zijie Xu 0003, Peng Wang 0004, Yuhang Lou, Jiajun Liu 0005. 28831-28848 [doi]
- Learning Optimal Message Representations for Agentic CommunicationShashwat Gupta, Anson Bastos, Mayukh Das, Supriyo Ghosh, Nagarajan Natarajan, Chetan Bansal, Saravan Rajmohan. 28849-28879 [doi]
- CARO: Chain-of-Analogy Reasoning Optimization for Robust Content ModerationBingzhe Wu, Haotian Lu 0011, Yuchen Mou. 28880-28892 [doi]
- N-GRPO: Embedding-Level Neighbor Mixing for Enhanced Policy OptimizationXukun Zhu, Hang Yu 0002, Peng Di, Linchao Zhu. 28893-28908 [doi]
- GFT: From Imitation to Reward Fine-Tuning with Unbiased Group Advantages and Dynamic Coefficient RectificationWangjie Gan, Miao Pan, Linbo Xi, Wenqi Zhang, Jintao Chen 0001, Jianwei Yin, Xuhong Zhang 0002. 28909-28922 [doi]
- SciImpact: A Multi-Dimensional, Multi-Field Benchmark for Scientific Impact PredictionHangxiao Zhu, Yuyu Zhang, Ping Nie, Yu Zhang 0044. 28923-28936 [doi]
- When Helpers Become Hazards: A Benchmark for Analyzing Multimodal LLM-Powered Safety in Daily LifeXinyue Lou, Jinan Xu, Jingyi Yin, Xiaolong Wang, Zhaolu Kang, Liaoyouwei, Yixuan Wang, Xiangyu Shi, Fengran Mo, S. U. Yao, Kaiyu Huang. 28937-28963 [doi]
- MM-ShiftKV: Decode-Aware Prefill-Stage KV Selection for Multimodal Large Language ModelsJinsong Shu, Chenyang Wu, Zhongle Xie, Baokun Wang, Lidan Shou. 28964-28982 [doi]
- Measuring What Matters Beyond Text: Evaluating Multimodal Summaries by Quality, Alignment, and DiversityAbid Ali 0005, Diego Mollá, Usman Naseem. 28983-28996 [doi]
- MonCulture-Eval: A Hierarchical Benchmark for Evaluating Mongolian Cultural Capabilities of Large Language Models across Scripts and RegionsQuulgan Minggad, Zinan Xiao, Yuan Sun 0010. 28997-29014 [doi]
- Less is More: Knowledge-Aware Compression for Long Legal Judgment PredictionFanghao Lou, Qiqi Wang 0005, Guanyu Chen, Senbo Zhang, Kaiqi Zhao 0001, Qian Liu 0012, Huijia Li. 29015-29031 [doi]
- Towards Visually Grounded Multimodal Summarization via Cross-Modal Transformer and Gated AttentionAbid Ali 0005, Diego Mollá, Usman Naseem. 29032-29047 [doi]
- Fairness Evaluation and Inference Level Mitigation in LLMsAfrozah Nadeem, Mark Dras, Usman Naseem. 29048-29065 [doi]
- SCOPE: Preserving Modality-Specific Cues to Mitigate Modality Laziness in Multimodal LearningJingfan Yang, Rui Zhang, Liang Hong, Ke Yuan. 29066-29078 [doi]
- Embedding-based In-Context Prompt Training for Enhancing LLMs as Text EncodersAiliang Lin, Zhuoyun Li, Keyu Mao, Kotaro Funakoshi, Manabu Okumura. 29079-29095 [doi]
- Creating ConLangs to Probe the Metalinguistic Grammatical Knowledge of LLMsChihiro Taguchi, Richard Sproat. 29096-29148 [doi]
- ReasonIF: Large Reasoning Models Fail to Follow Instructions During ReasoningYongchan Kwon, Shang Zhu, Federico Bianchi 0001, Kaitlyn Zhou, James Zou 0001. 29149-29164 [doi]
- An LLM-Embedding Semantic Adaptation Network for Post-level Semantic Drift EvaluationNing Chen, Mingyu Kang, Jie Li, Linyuan Lü. 29165-29176 [doi]
- CEAID: Benchmark of Multilingual Machine-Generated Text Detection Methods for Central European LanguagesDominik Macko, Jakub Kopál. 29177-29190 [doi]
- Distilling the Essence, Discarding the Dross: Improving Fairness in Multimodal Large Language Models via Historical Reflection-Guided Prompt OptimizationJuncheng Hu 0002, Jiming Yu, Rui Song 0008, Kedi Lyu, Yingji Li, Zheli Liu. 29191-29211 [doi]
- Tree-of-Evidence: Efficient "System 2" Search for Faithful Multimodal GroundingMicky C. Nnamdi, Benoit Louis Marteau, Yishan Zhong, J. Ben Tamo, May Dongmei Wang. 29212-29227 [doi]
- Jailbreaking Large Language Models with Morality AttacksYing Su, Mingen Zheng, Weili Diao, Haoran Li 0003. 29228-29254 [doi]
- ExpSeek: Self-Triggered Experience Seeking for Web AgentsWenyuan Zhang 0002, Xinghua Zhang 0001, Haiyang Yu 0003, Shuaiyi Nie, Bingli Wu, Juwei Yue, Tingwen Liu, Yongbin Li 0001. 29255-29283 [doi]
- Do Personality Traits Interfere? Geometric Limitations of Steering in Large Language ModelsPranav Bhandari, Usman Naseem, Mehwish Nasim. 29284-29293 [doi]
- AHA: Aligning Large Audio-Language Models for Reasoning Hallucinations via Counterfactual Hard NegativesYanxi Chen 0002, Wenhui Zhu, Xiwen Chen, Zhipeng Wang, Xin Li 0201, Peijie Qiu, Hao Wang 0176, Xuanzhao Dong, Yujian Xiong, Anderson Schneider, Yuriy Nevmyvaka, Yalin Wang 0001. 29294-29306 [doi]
- Web Sitemap Knowledge Can Enhance Autonomous BrowsingYuyao Zhang 0003, Hongyu Lu, Jiajie Jin, Hongjin Qian, Shiyu Li, Zhao Yang 0006, Yutao Zhu 0001, Ji-Rong Wen, Zhicheng Dou. 29307-29321 [doi]
- Coarse-to-Fine Multimodal Information Selection for Video Speaking Style Recognition with Large Language ModelsBeibei Zhang 0005, Yanan Lu, Fen Lin 0002, Tongwei Ren. 29322-29337 [doi]
- Large Language Models Require Curated Context for Reliable Political Fact-Checking - Even with Reasoning and Web SearchMatthew R. DeVerna, Kai-Cheng Yang, Harry Yaojun Yan, Filippo Menczer. 29338-29360 [doi]
- IREASONER: Trajectory-Aware Intrinsic Reasoning Supervision for Self-Evolving Large Multimodal ModelsMeghana Sunil, Manikandarajan Venmathimaran, Muthu Subash Kavitha. 29361-29372 [doi]
- CLaRE-ty Amid Chaos: Quantifying Representational Entanglement to Predict Ripple Effects in LLM EditingManit Baser, Alperen Yildiz, Dinil Mon Divakaran, Mohan Gurusamy. 29373-29405 [doi]
- STAR-Teaming: A Strategy-Response Multiplex Network Approach to Automated LLM Red TeamingMinjae Jung, Yongtaek Lim, Chaeyun Kim, Junghwan Kim, Kihyun Kim, Minwoo Kim. 29406-29435 [doi]
- Critic Rule Induction: Improving Temporal Knowledge Graph Forecasting with Generator-Critic Language ModelsYingsong Ning, Fu Zhang 0001, Jingwei Cheng, Jiashun Peng, Xiaoke Wang. 29436-29448 [doi]
- Context-Agent: Dynamic Discourse Trees for Non-Linear DialogueJunan Hu, Shudan Guo, Wenqi Liu, Jianhua Yin 0001, Yinwei Wei. 29449-29462 [doi]
- Can LLMs Really Judge? A Progressive Argumentation-Mining Framework for Distinguishing Understanding from AggregationFuyu Wang, Jiangtong Li, Kun Zhu 0036, Changjun Jiang 0002. 29463-29482 [doi]
- SMART: Semantic Header Flattening and Pseudo-Code-Style Reasoning for LLM-based Complex Table Question AnsweringYongshuo Zhang, Jixiong Chen, Kaihe Xu, Wei Wei 0002, Shihao Zou. 29483-29499 [doi]
- ConMA : Confidence-Guided Kernel Sampling with Multi-Stage Aggregation for LLM ReasoningYinuo Wang, Qingjie Li, Wenyao Cui, Qiuchi Li, Huaping Zhang. 29500-29518 [doi]
- Human-Centered Supervision for Sentiment Analysis in Telugu: A Systematic Inquiry Beyond AccuracyVallabhaneni Raj Kumar, Ashwin S, Supriya Manna, Niladri Sett, Cheedella V. S. N. M. S. Hema Harshitha, Kurakula Harshitha, Basina Deepakraj, Anand Kumar Sharma, Tanuj Sarkar, Samanthapudi Shakeer, Bondada Navaneeth Krishna. 29519-29537 [doi]
- Evidence-Aligned Entity Verification for Hallucination Detection in Retrieval-Augmented GenerationRunsong Jia, Zhen Fang 0001, Mengjia Wu, Jie Lu 0001, Yi Zhang 0095. 29538-29554 [doi]
- From Personal to Collective: On the Role of Local and Global Knowledge in LLM PersonalizationZehong Wang, Junlin Wu, Zhaoxuan Tan, Bolian Li, Xianrui Zhong, Zheli Liu, Qingkai Zeng 0001. 29555-29569 [doi]
- ProMediate: A Simulation Testbed for Evaluating Proactive Mediation in Multi-Party NegotiationZiyi Liu, Bahareh Sarrafzadeh, Pei Zhou, Longqi Yang 0001, Jieyu Zhao 0001, Ashish Sharma 0004. 29570-29598 [doi]
- InteracSPARQL : An Interactive System for SPARQL Query Refinement Using Natural Language ExplanationsXiangru Jian, Zhengyuan Dong, M. Tamer Özsu. 29599-29624 [doi]
- Are Large Language Models Reliable Reviewers? A Benchmark for Error Detection in Financial DocumentsYing He 0010, Zhouhong Gu, Zhecheng Hu, Yubo Zhou, Hao Shen, Jiaqing Liang, Zhaoqian Dai, Ma Shuguang, Fei Yu, Yanghua Xiao, Zhixu Li. 29625-29643 [doi]
- Training-Free Test-Time Contrastive Learning for Large Language ModelsKaiwen Zheng, Kai Zhou, Jinwu Hu, Te Gu, Mingkai Peng, Fei Liu 0006. 29644-29676 [doi]
- To Diff or Not to Diff? Structure-Aware and Adaptive Output Formats for Efficient LLM-based Code EditingWei Cheng, Yongchang Cao, Chen Shen, Binhua Li, Jue Chen, Yongbin Li, Wei Hu. 29677-29694 [doi]
- CogEmp: A Cognitive Empathy-Oriented Dialogue System for Structured Psychological CounselingYiguo Deng, Xia Lei, Yuan Zhang, Long Ye. 29695-29712 [doi]
- LiveLongBench: Tackling Long-Context Understanding for Spoken Texts from Live StreamsYongxuan Wu, Runyu Chen, Peiyu Liu, Hongjin Qian. 29713-29732 [doi]
- CPC-GRPO: Answer-Free Reinforcement Learning with Cross-Prompt Consensus RewardsGyunyeop Kim, Sangwoo Kang 0002. 29733-29748 [doi]
- MASH: Evading Black-Box AI-Generated Text Detectors via Style HumanizationYongtong Gu, Songze Li, Xia Hu. 29749-29769 [doi]
- MM-Doc-R1: Training Agents for Long Document Visual Question Answering through Multi-turn Reinforcement LearningJiahang Lin, Kai Hu, Binghai Wang, Yuhao Zhou 0005, Zhiheng Xi, Honglin Guo, Shichun Liu, Junzhe Wang 0001, Shihan Dou, Enyu Zhou, Hang Yan 0001, Zhenhua Han, Tao Gui, Qi Zhang 0001, Xuanjing Huang 0001. 29770-29783 [doi]
- Multimodal Chemical Structure-Text Coreference in Intellectual Property via Rule-guided Reinforcement LearningHanmeng Zhong, Wentao Wu, Linqing Chen, Peng Zhou. 29784-29796 [doi]
- TheraAgent: Self-Improving Therapeutic Agent for Precise and Comprehensive Treatment PlanningJunkai Li, Yunghwei Lai, Tianyi Zhu, Zheng Long Lee, Weizhi Ma, Yang Liu. 29797-29819 [doi]
- LearnAct: Few-Shot Mobile GUI Agent with a Unified Demonstration BenchmarkGuangyi Liu, Pengxiang Zhao, Liang Liu, Zhiming Chen, Yuxiang Chai, Yaozhen Liang, Wenhao Wang, Siheng Chen, Zhengxi Lu, Shuai Ren, Hao Wang, Shibo He, Yong Liu, Wenchao Meng. 29820-29843 [doi]
- From Local Perspective to Global Reasoning: A Neuro-Symbolic Framework for Zero-Shot Relation ExtractionKailun Lyu, Fu Zhang, Zehan Li, Jingwei Cheng. 29844-29856 [doi]
- DiFRa: A Unified Framework for Harmonizing Semantic Diversity and Factual Consistency in Question-Answer GenerationZhenqin Li, Shengyong Ding, Shuangyin Li. 29857-29875 [doi]
- Geoparsing: Diagram Parsing for Plane and Solid Geometry with a Unified Formal LanguagePeijie Wang, Ming-Liang Zhang, Jun Cao, Chao Deng, Dekang Ran, Pi Bu, Hongda Sun 0005, Xuan Zhang, Yingyao Wang, Jun Song, Bo Zheng 0007, Fei Yin, Cheng-Lin Liu. 29876-29903 [doi]
- Beyond Memorization: Testing LLM Reasoning on Unseen Theory of Computation TasksShlok Shelat, Jay Raval, Souvik Roy, Manas Gaur. 29904-29934 [doi]
- Beyond Dialogue Time: Temporal Semantic Memory for Personalized LLM AgentsMiao Su, Yucan Guo, Zhongni Hou, Long Bai 0002, Zixuan Li 0001, Yufei Zhang, Guojun Yin, Wei Lin, Xiaolong Jin 0001, Jiafeng Guo, Xueqi Cheng. 29935-29951 [doi]
- LongCLI-Bench: A Preliminary Benchmark and Study for Long-horizon Agentic Programming in Command-Line InterfacesYukang Feng, Jianwen Sun, Zelai Yang, Jiaxin Ai, Chuanhao Li 0001, Zizhen Li, Fanrui Zhang, Kang He, Rui Ma, Jifan Lin, Jie Sun 0030, Yang Xiao, Sizhuo Zhou, Wenxiao Wu, Yiming Liu, Pengfei Liu 0003, Shenglin Zhang, Kaipeng Zhang. 29952-29963 [doi]
- Cognitive-Uncertainty Guided Knowledge Distillation for Accurate Classification of Student MisconceptionsQirui Liu, Hao Chen, Weijie Shi, Jiajie Xu 0001, Jia Zhu 0003. 29964-29980 [doi]
- Beyond Black-Box Interventions: Latent Probing for Faithful Retrieval-Augmented GenerationLinfeng Gao, Qinggang Zhang, Baolong Bi, Bo Zeng, Zheng Yuan, Zerui Chen, Zhimin Wei, Shenghua Liu, Linlong Xu, Longyue Wang, Weihua Luo, Jinsong Su. 29981-30000 [doi]
- FalconCopilot: Empowering LLMs Towards Integrated Human-Machine Systems for Aviation AutonomyJingyuan Yan, Qingchen Liu, Qichao Ma 0001, Jiahu Qin. 30001-30026 [doi]
- Accelerating Training of Autoregressive Video Generation Models via Local Optimization with Representation ContinuityYucheng Zhou 0001, Jianbing Shen. 30027-30041 [doi]
- RouteRAG: Efficient Retrieval-Augmented Generation from Text and Graph via Reinforcement LearningYucan Guo, Miao Su, Saiping Guan, Zihao Sun, Xiaolong Jin 0001, Jiafeng Guo, Xueqi Cheng. 30042-30059 [doi]
- HORIZON: A Benchmark for In-the-wild User Behaviour ModelingArnav Goel, Pranjal A. Chitale, Bhawna Paliwal, Bishal Santra, Amit Sharma 0007. 30060-30078 [doi]
- Two-Stage Parameter Alignment for Multi-LoRA Merging in Large Language ModelsZijian Li 0020, Xiachong Feng, Weitao Ma, Yichong Huang, Xiaocheng Feng, Bing Qin 0001. 30079-30093 [doi]
- The Agent's First Day: Benchmarking Learning, Exploration, and Scheduling in the Workplace ScenariosDaocheng Fu, Jianbiao Mei, Rong Wu, Xuemeng Yang, Xu Jia 0012, Ding Wang, Pinlong Cai, Yong Liu 0007, Licheng Wen, Botian Shi. 30094-30109 [doi]
- PrefIx: Understand and Adapt to User Preference in Human-Agent InteractionJialin Li, Zhenhao Chen, Hanjun Luo, Hanan Salam. 30110-30149 [doi]
- How Do Answer Tokens Read Reasoning Traces? Self-Reading Patterns in Thinking LLMs for Quantitative ReasoningHaoyang Chen 0001, Yi Liu, Jianzhi Shao, Tao Zhang, Chengfu Huo, Wei Hu. 30150-30166 [doi]
- MENTOR: Efficient Autoregressive Image Generation with Balanced Multimodal ControlHaozhe Zhao, Zefan Cai, Shuzheng Si, Liang Chen 0024, Jiuxiang Gu, Wen Xiao, Minjia Zhang, Junjie Hu 0001. 30167-30193 [doi]
- Better and Worse with Scale: How Contextual Entrainment Diverges with Model SizeDikshant Kukreja, Kshitij Sah, Gautam Gupta, Avinash Anand, Rajiv Ratn Shah, Zhengkui Wang, Aik Beng Ng, Erik Cambria. 30194-30209 [doi]
- LLM-Guided Semantic Bootstrapping for Interpretable Text Classification with Tsetlin MachinesJiechao Gao, Rohan Kumar Yadav, Yuangang Li 0002, Yuandong Pan, Jie Wang, Ying Liu, Michael D. Lepech. 30210-30222 [doi]
- Evaluating the Impact of Reviewer Guideline Design on LLM-Based Automated Peer ReviewHaowen Li, Yoichi Ishibashi, Masafumi Oyamada. 30223-30240 [doi]
- MI-CXR: A Benchmark for Longitudinal Reasoning over Multi-Interval Chest X-raysSunghwan Steve Cho, Yunseok Han, Jaeyoung Do. 30241-30273 [doi]
- Relevance to Utility: Process-Supervised Rewrite for RAGJaeyoung Kim, Jongho Kim, Seung-won Hwang, Seoho Song, Young-In Song. 30274-30293 [doi]
- On the Cultural Anachronism and Temporal Reasoning in Vision Language ModelsMukul Ranjan, Prince Jha, Khushboo Kumari, Zhiqiang Shen. 30294-30310 [doi]
- GLA: Grounding Large Language Models in Molecular Hierarchy for Chemical UnderstandingYingxu Li, Jingjie Zeng, Zekun Wang, Hongfei Lin, Liang Yang 0003. 30311-30323 [doi]
- NeuRAG: End-to-End Neural Knowledge Augmentation via Hyper-NeuronsLiwei Zheng, Xuemin Liu, Jie Liu. 30324-30343 [doi]
- DEAR: Distributional Error-Aware Reliability for Robust Multimodal Sentiment Analysis with Missing ModalitiesShihao Zou, Wei Wei 0002, Yongshuo Zhang. 30344-30361 [doi]
- OpenPhone: Mobile Agentic Foundation ModelsYangqin Jiang, Chao Huang 0001. 30362-30380 [doi]
- Fast Retrieval and Slow Reasoning for Explainable Multimodal Sentiment AnalysisAoqiang Zhu, Min Hu, Yan Xing 0002. 30381-30391 [doi]
- Exploration-Exploitation Reshaping towards Efficient Reasoning for Large Language ModelsYufeng Shi, Weilin Luo, Yuxiang Zhang, Zongmeng Zhang, Haoyang Liu, Yubing Wang, Bin Wang, Wengang Zhou 0001, Houqiang Li. 30392-30407 [doi]
- COMPEL: Compensated Mixture-of-Experts Pruning with Expert-Layer distributionSeohee Yoon, Yong Suk Choi. 30408-30423 [doi]
- Towards Self-Evolving Agents: Enabling Autonomy through Interactive Experience RefinementCheng Yang, Xuemeng Yang, Licheng Wen, Daocheng Fu, Jianbiao Mei, Rong Wu, Pinlong Cai, Yufan Shen, Nianchen Deng, Xu Jia 0012, Botian Shi, Yu Qiao 0001, Haifeng Li. 30424-30451 [doi]
- Good Reasoning Makes Good Demonstrations: Implicit Reasoning Quality Supervision via In-Context Reinforcement LearningTiehua Mei, Minxuan Lv, Leiyu Pan, Zhenpeng Su, Hongru Hou, Hengrui Chen, Ao Xu, Deqing Yang. 30452-30469 [doi]
- Design First, Code Later: Aesthetically Pleasing Template-Free Slides GenerationZhiyao Cui, Chenxu Wang, Shuyue Hu, Yiqun Zhang, Wenqi Shao, Qiaosheng Zhang 0002, Zhen Wang 0004. 30470-30490 [doi]
- Benchmarking the Fine-Grained Discriminability in Image-Text Retrieval via Controlled Contrastive DifferencesZhen Wang 0062, Xi Zhou 0007, Yating Yang, Bo Ma 0004, Lei Wang 0065, Rui Dong 0002, Azmat Anwar, Siru Miao. 30491-30503 [doi]
- Learning on Imbalanced Noisy Data via Debiased Sample Selection and LLM-Driven AnnotationBo Yuan 0017, Yulin Chen, Yin Zhang. 30504-30542 [doi]
- Beyond Task-Level Context: Class-Conditional Context Vectors for Implicit In-Context LearningJianxin Zhang, Yilu Hu, Teng Liu, Pei Guo, Juntao Li 0005. 30543-30566 [doi]
- DPN-LE: Dual Personality Neuron Localization and Editing for Large Language ModelsLifan Zheng, Xue Yang, Jiawei Chen, Chenyan Wu, Jingyuan Zhang, Fanheng Kong, Xinyi Zeng, Xiang Chen, Yu Tian. 30567-30591 [doi]
- Reasoning in a Combinatorial and Constrained World: Benchmarking LLMs on Natural-Language Combinatorial OptimizationXia Jiang, Jing Chen, Cong Zhang, Jie Gao 0010, Chengpeng Hu, Chenhao Zhang, Yaoxin Wu, Yingqian Zhang 0001. 30592-30648 [doi]
- DARL: Encouraging Diverse Answers for General Reasoning without VerifiersChongxuan Huang, Lei Lin, Xiaodong Shi, Wenping Hu, Ruiming Tang. 30649-30665 [doi]
- Clustered Self-Assessment: A Simple yet Effective Method for Uncertainty Quantification in Large Language ModelsQi Cao, Takeshi Kojima, Andrew Gambardella, Helinyi Peng, Yutaka Matsuo, Yusuke Iwasawa. 30666-30680 [doi]
- STEP: Success-Rate-Aware Trajectory-Efficient Policy OptimizationYuhan Chen 0001, Yuxuan Liu 0009, Long Zhang, Pengzhi Gao, Jian Luan 0001, Wei Liu 0302. 30681-30692 [doi]
- AscendKernelGen: LLM-Driven Kernel Generation for NPUsXinzi Cao, Jianyang Zhai, Pengfei Li, Zhiheng Hu, Cen Yan, Bingxu Mu, Guanghuan Fang, Bin She, Jiayu Li, Yihan Su, Dongyang Tao, Feidiao Yang, Chang-Dong Wang 0001, Yutong Lu, Weicheng Xue, Bin Zhou, Yonghong Tian 0001. 30693-30718 [doi]
- Learning to Evolve: A Self-Improving Framework for Multi-Agent Systems via Textual Parameter Graph OptimizationShan He, Runze Wang, Zhuoyun Du, Huiyu Bai, Zouying Cao, Yu Cheng, Bo Zheng. 30719-30732 [doi]
- Learning How to Remember: A Meta-Cognitive Management Method for Structured and Transferable Agent MemorySirui Liang, Pengfei Cao, Jian Zhao, Wenhao Teng, Xiangwen Liao, Jun Zhao 0001, Kang Liu 0001. 30733-30753 [doi]
- LoRE: Enhancing Search Relevance with Progressive Chain-of-Thought and Preference AlignmentChenji Lu, Zhuo Chen, Hui Zhao, Zhiyuan Zeng, Gang Zhao, Junjie Ren, Haoran Li, Songyan Liu, Pengjie Wang 0002, Chuan Yu 0002, Jian Xu 0015, Bo Zheng 0007. 30754-30768 [doi]
- Multilingual Refusal Alignment for Safer Large Language ModelsAleksandra Krasnodebska, Wojciech Kusa, Aldo Lipani. 30769-30790 [doi]
- View-R1: Asymmetric Policy Optimization for Difficulty-Aware Multimodal Reinforcement LearningMinjie Hong, Zirun Guo, Jiabao Zhang, Zehan Wang 0001, Ziang Zhang, Tao Jin 0004, Zhou Zhao 0001. 30791-30803 [doi]
- PseudoGD: Enhancing Spatial Reasoning in Vision-Language Models through Pseudo Geometric Knowledge DistillationGwanghee Lee, Yeeun Choi, Kyoung-Son Jhang. 30804-30814 [doi]
- DMSD: Dual-Modal Semantic Disentanglement for Compositional Zero-Shot LearningPan Yang, Jing Yang, Ruan Xiao Li, Yuling Chen, Yuankai Wu, Quan Zhou, Xu Wang. 30815-30826 [doi]
- ReFreeKV: Towards Threshold-Free KV Cache CompressionXuanfan Ni, Liyan Xu, Chenyang Lyu, Longyue Wang, Mo Yu, Lemao Liu, Fandong Meng, Jie Zhou 0016, Piji Li. 30827-30841 [doi]
- Safety Sidecar: Reflection-Driven Runtime Control for Safer AgentsBin Wang, Jiazheng Quan, Xingrui Yu, Hansen Hu, Yu Hao, Anjun Gao, Zhenglin Wan, Hui Li 0022, Ivor W. Tsang. 30842-30856 [doi]
- MCGA: A Multi-task Classical Chinese Literary Genre Audio CorpusYexing Du, Kaiyuan Liu, Bihe Zhang, Youcheng Pan, Bo Yang 0006, Liangyu Huo, Xiyuan Zhang, Jian Xie, Daojing He, Yang Xiang, Ming Liu 0004, Bing Qin 0001. 30857-30866 [doi]
- VET: Verifiable Execution Tracing for Reliable Text-to-SQL GenerationDongyu Wang, Jingyu Li, Lan Zhang, Ganggang Yu, Liang Huang. 30867-30883 [doi]
- PACE: Prefix-Protected and Difficulty-Aware Compression for Efficient ReasoningRuixiang Feng, Yuntao Wen, Silin Zhou, Ke Shi, Yifan Wang 0023, Ran Le, Zhenwei An, Zongchao Chen, Chen Yang 0032, Guangyue Peng, Yiming Jia, Dongsheng Wang, Tao Zhang 0070, Lisi Chen 0001, Yang Song 0021, Shen Gao, Shuo Shang. 30884-30903 [doi]
- CreativeBench: Benchmarking and Enhancing Machine Creativity via Self-Evolving ChallengesZihan Wang, Lam Nguyen, Zhengyang Zhao, Mengyue Yang, Chengwei Qin, Yujiu Yang 0001, Linyi Yang. 30904-30937 [doi]
- Machine Behavior in Relational Moral Dilemmas: Moral Rightness, Predicted Human Behavior, and Model DecisionsJiseon Kim, Jea Kwon, Luiz Felipe Vecchietti, Wenchao Dong, Jaehong Kim, Meeyoung Cha. 30938-30955 [doi]
- Prompting the Unknown: Understanding Response Uncertainty in Large Language ModelsZe-yu Zhang, Arun Verma, Finale Doshi-Velez, Bryan Kian Hsiang Low. 30956-30984 [doi]
- Explainable Quantum Program Repair with Verifiable Proof TracesTingting Li 0004, Ziming Zhao 0008, Zhaoxuan Li, Jiongchi Yu, Xiaofei Yue, Jianwei Yin. 30985-30995 [doi]
- MA²P: A Meta-Cognitive Autonomous Intelligent Agents Framework for Complex PersuasionDingyi Zhang, Ziqing Zhuang, Linhai Zhang, Ziyang Gao, Deyu Zhou. 30996-31017 [doi]
- Synergizing Semantic Anchors and Ordinal Smoothed Cross-Entropy for Speech Fluency ClassificationMulati Kahaer, Sirajahmat Ruzmamat, Xudong Pang, Subinuer Maimaitituerxun, Zaokere Kadeer, Abudurexiti Reheman, Wenwen Lu, Panpan Zheng, Aishan Wumaier. 31018-31029 [doi]
- PAC-BENCH: Evaluating Multi-Agent Collaboration under Privacy ConstraintsMinJun Park, Donghyun Kim, Hyeonjong Ju, Seungwon Lim, Dongwook Choi, Taeyoon Kwon, Minju Kim, Jinyoung Yeo. 31030-31056 [doi]
- SciText2Eq: Assessing LLMs for Explainable Equation Generation for Scientific CreativityYifan Mo, Xiao Fu, Yue Su, Qingyu Meng, Koen V. Hindriks, Qingzhi Liu, Jiahuan Pei. 31057-31069 [doi]
- Reward Yourself: Efficient Self Rewards for Trustworthy SamplingMingjie Li 0007, Wai Man Si, Michael Backes 0001, Yang Zhang 0016. 31070-31086 [doi]
- Analyze Like a Venture Capitalist: Information-Gain and Knowledge Enhanced Graph Reasoning for Startup Success PredictionHaoyu Pei, Zhongyang Liu, Xiangyi Xiao, Xiaocong Du, Suting Hong, Kunpeng Zhang 0001, Haipeng Zhang 0004. 31087-31108 [doi]
- Read the Room, Read the Image: Understanding Indirect Speech Acts in Multimodal Visual ContextsJaehee Kim, Ji Hoon Chung, Seoyoon Park, Unsol Kim, Kyungwon Park, JiHak Kim, Yi-jun Chen, Hansaem Kim. 31109-31124 [doi]
- Break Through the Compression Bottleneck: From Theory to PracticeXiusheng Huang, Lu Wang 0029, Yequan Wang, Jun Zhao 0001, Kang Liu 0001. 31125-31142 [doi]
- Cognitive Analysis Graph-Guided Multi-Turn Safety Enhancement for Large Language ModelsLanxue Zhang, Yuqiang Xie, Fang Fang 0009, Yubing Ren, Xuebin Wang, Yanan Cao 0001. 31143-31160 [doi]
- Entropy Ratio Clipping as a Soft Global Constraint for Stable Reinforcement LearningZhenpeng Su, Leiyu Pan, Minxuan Lv, Tiehua Mei, Zijia Lin, Yuntao Li, Wenping Hu, Ruiming Tang, Kun Gai, Guorui Zhou. 31161-31171 [doi]
- BCL: Bayesian In-Context Learning Framework for Information ExtractionHaoliang Liu, Chengkun Cai, Xu Zhao, Han Zhu, Shizhou Huang, Xinglin Zhang, Tao Chen 0030, Jenq-Neng Hwang, Huaping Zhang, Lei Li 0050. 31172-31189 [doi]
- G-HiRel: Enhancing the Adaption to Knowledge Updating for Large Language Model ReasoningYudai Pan, Jiajie Hong, Tianzhe Zhao, Lingyun Song, Lingling Zhang 0005, Yixin Chen, Xuequn Shang 0001. 31190-31207 [doi]
- WoW-Bench: Evaluating Fine-Grained Acoustic Perception in Audio-Language Models via Marine Mammal VocalizationsJaeyeon Kim, Heeseung Yun, Tony Woo, Chao-Han Huck Yang, Gunhee Kim. 31208-31229 [doi]
- AdaMARP: An Adaptive Multi-Agent Interaction Framework for General Immersive Role-PlayingZhenhua Xu, Dongsheng Chen, Shuo Wang, Jian Li 0062, Chengjie Wang 0001, Meng Han, Yabiao Wang. 31230-31283 [doi]
- Train in Vain: Functionality-Preserving Poisoning to Prevent Unauthorized Use of Code DatasetsYuan Xiao 0003, Jiaming Wang, Yuchen Chen, Wei Song, Jun Sun 0001, ShiQing Ma, Yanzhou Mu, Juan Zhai, Chunrong Fang, Jin Song Dong, Zhenyu Chen 0001. 31284-31303 [doi]
- Revisiting the Uniform Information Density Hypothesis in LLM ReasoningMinju Gwak, Guijin Son, Jaehyung Kim. 31304-31333 [doi]
- pQuant: Towards Effective Low-Bit Language Models via Decoupled Linear Quantization-Aware TrainingWenzheng Zhang, Bingzheng Liu. 31334-31351 [doi]
- Incomplete Prompt Jailbreaks in Large Language ModelsYeonjea Kim, Bumjin Park, Jaesik Choi. 31352-31368 [doi]
- The Best of Both Worlds: Combining Parallel and Sequential Inference Scaling via Aggregation Fine-TuningYafu Li, Zhilin Wang, Tingchen Fu, Ganqu Cui, Sen Yang 0005, Yu Cheng 0001. 31369-31389 [doi]
- A.S.E: A Repository-Level Benchmark for Evaluating Security in AI-Generated CodeKeke Lian, Wang Bin, Lei Zhang 0006, Libo Chen, Junjie Wang 0007, Ziming Zhao 0008, Yujiu Yang 0001, Miaoqian Lin, Haotong Duan, Haoran Zhao, Shuang Liao, Mingda Guo, Jiazheng Quan, YiLu Zhong, Chenhao He, Zichuan Chen 0002, Jie Wu 0001, Haoling Li, Zhaoxuan Li, Jiongchi Yu, Hui Li 0029, Dong Zhang. 31390-31405 [doi]
- Large Language Models Are Overconfident in Their Own ResponsesMario Sanz-Guerrero, Manuel Mager, Katharina von der Wense. 31406-31418 [doi]
- Structured Dialogue Refinement: Building Retrieval-Augmented Question Answering on Goal-Oriented DialoguesBin Wu, Sawan Kumar, Prasetya Ajie Utama, Mohamed Yahya. 31419-31432 [doi]
- Thought-Action Graph Reasoning: Faithful and Efficient Reasoning of Large Language Models via Reusing Past ExperienceZhixiao Qi, Feng Huang, Yunqi Zhang, Shijie Zhang, Qingqing Sun, Yongfeng Huang 0001, Minghu Jiang, Shuai Chen, Tianyi Zhang. 31433-31449 [doi]
- XLSR-MamBo: Scaling the Hybrid Mamba-Attention Backbone for Audio Deepfake DetectionKwok-Ho Ng, Tingting Song, Yongdong Wu, Zhihua Xia. 31450-31462 [doi]
- Anchored Cyclic Generation: A Novel Paradigm for Long-Sequence Symbolic Music GenerationBoyu Cao, Lekai Qian, Dehan Li, Haoyu Gu, Mingda Xu, Qi Liu 0005. 31463-31476 [doi]
- TRUST: Towards Robust Social Bot Detection via Uncertainty-Guided Pseudo-Labeling and Graph Structure PurificationRuixuan Xu, Mengting Hu, Zhunheng Wang, Ming Jiang, Rui Ying, Zhen Zhang 0048, Hang Gao 0003, Shuaipeng Liu, Renhong Cheng. 31477-31491 [doi]
- XGUARD: A Graded Benchmark for Evaluating Safety Failures of Large Language Models on Extremist ContentVadivel Abishethvarman, Bhavik Chandna, Pratik Jalan, Usman Naseem. 31492-31510 [doi]
- PiCSAR: Probabilistic Confidence Selection and Ranking for Reasoning ChainsJoshua Ong Jun Leang, Zheng Zhao 0005, Aryo Pradipta Gema, Sohee Yang, Wai-Chung Kwan, Xuanli He, Wenda Li, Pasquale Minervini, Eleonora Giunchiglia, Shay B. Cohen. 31511-31544 [doi]
- DeepPresenter: Environment-Grounded Reflection for Agentic Presentation GenerationHao Zheng, Guozhao Mo, Xinru Yan, Qianhao Yuan, Wenkai Zhang, Xuanang Chen, Yaojie Lu 0001, Hongyu Lin, Xianpei Han, Le Sun 0001. 31545-31558 [doi]
- An Iterative Utility Judgment Framework Inspired by Philosophical Relevance via LLMsHengran Zhang, Keping Bi, Jiafeng Guo, Xueqi Cheng. 31559-31578 [doi]
- FormulaReasoning: A Dataset for Formula-Based Numerical ReasoningXiao Li 0043, Bolin Zhu, Kaiwen Shi, Sichen Liu 0004, Yin Zhu, Yiwei Liu 0004, Gong Cheng 0001. 31579-31601 [doi]
- CORD: Bridging the Audio-Text Reasoning Gap via Weighted On-policy Cross-modal DistillationHu Jing, Danxiang Zhu, Xianlong Luo, Dan Zhang, Shuwei He, Yishu Lei, Shikun Feng, Hai-Tao Zheng, Jingzhou He, Yu Sun 0004, Hua Wu 0003, Haifeng Wang 0001. 31602-31612 [doi]
- PlanE: Meta Planning of Data, Tuning, and Inference for Extractive-based LLMsJiacheng Wang, Weiyan Zhang, Guangya Yu. 31613-31635 [doi]
- Generalizable Prompt Tuning for Audio-Language Models via Semantic ExpansionJaehyuk Jang, Wonjun Lee 0006, Kangwook Ko, Changick Kim. 31636-31654 [doi]
- Leveraging Label Semantics and Entity Description Generation for LLM-based Fine-grained Entity TypingYingying Ma, Hongliang Dai, Xia Zhang, Piji Li. 31655-31667 [doi]
- Trident: Self-Supervised Preference Alignment via Triplet RegularizationYingnan Guo, Kejia Chen, Xiaofeng Zhang, Zifei Wu, Yu Zhang 0018. 31668-31683 [doi]
- Why Do Multilingual Reasoning Gaps Emerge in Reasoning Language Models?Deokhyung Kang, Seonjeong Hwang, Daehui Kim, Hyounghun Kim, Gary Lee. 31684-31716 [doi]
- EvoMemKG: An Evolvable Memory Agent for Multi-hop Knowledge Graph ReasoningShiyu Tian, Shuyue Xing, Zhuoxin Han, Caixia Yuan, Xiaojie Wang 0006. 31717-31740 [doi]
- Scaling Laws or Threshold Effects: Exploring the Optimal Vocabulary Size for Balancing Performance and Efficiency in Low-Resource LanguagesAo Han, Andong Chen 0001, Yuan Sun 0010, Xiaobing Zhao. 31741-31758 [doi]
- RouterHGC: Optimized Router for LLM-based Multi-Agent Systems via Heterogeneous Graph Contrastive LearningYitao Xiao, Shaoyong Guo 0001, Guoming Yang, Qingnan Wang, Yinlin Ren, Xuesong Qiu 0001, Qi Feng 0004. 31759-31789 [doi]
- Grouped Adaptive Weight Sharing (GAWS): An Inference-Efficient Adaptation Method for Large Language ModelsEman Alsuradi, Junhyun Lee, Kyeng-Hun Lee, Hyeonmok Ko, Fahed Jubair. 31790-31806 [doi]
- Lending Eyesight to Language Models: Modeling and Probing Human scanpath through Transformer DecoderJunlin Li, David Robert Reich, Yu-Yin Hsu. 31807-31819 [doi]
- Timesteps of Mamba Align with Human Reading TimesYuji Yamamoto, Shinnosuke Isono, Yoshinobu Kawahara, Sho Yokoi. 31820-31832 [doi]
- Astra: Activation-Space Tail-Eigenvector Low-Rank Adaptation of Large Language ModelsKainan Liu, Yong Zhang 0058, Ning Cheng 0001, Yun Zhu, Yanmeng Wang, Shaojun Wang, Jing Xiao 0006. 31833-31854 [doi]
- AROMA: Augmented Reasoning Over a Multimodal Architecture for Virtual Cell Genetic Perturbation ModelingZhenyu Wang, Geyan Ye, Wei Liu 0005, Man Tat Alexander Ng. 31855-31881 [doi]
- Exploring Two-Phase Continual Instruction Fine-tuning for Multilingual Adaptation in Large Language ModelsDivyanshu Aggarwal, Sankarshan Damle, Navin Goyal, Satya Lokam, Sunayana Sitaram. 31882-31904 [doi]
- SCALER: Synthetic Scalable Adaptive Learning Environment for ReasoningCaijun Xu, Changyi Xiao, Zhongyuan Peng, Xinrun Wang, Yixin Cao 0002. 31905-31923 [doi]
- Probing Social Identity Bias in Chinese LLMs with Gendered Pronouns and Social GroupsGeng Liu, Li Feng, Junjie Mu, Mengxiao Zhu 0001, Francesco Pierri 0002. 31924-31941 [doi]
- AutoVecCoder: Teaching LLMs to Generate Explicitly Vectorized CodeShangzhan Li, Xinyu Yin, Xuanyu Jin, Ye He, Yuxin Zhou, Yuxuan Li, Xu Han 0007, Wanxiang Che, Qi Shi 0002, Ting Liu 0001, Maosong Sun 0001. 31942-31959 [doi]
- CompassLLM: A Multi-Agent Approach toward Geo-Spatial Reasoning for Popular Path QueryMd. Nazmul Islam Ananto, Shamit Fatin, Mohammed Eunus Ali, Md. Rizwan Parvez. 31960-31976 [doi]
- Free-MAD: Consensus-Free Multi-Agent DebateYu Cui, Hang Fu, Haibin Zhang, Licheng Wang 0004, Cong Zuo 0001. 31977-31997 [doi]
- Dialectical Structured Reasoning for Explainable Multimodal Fake News DetectionRuichao Yang, Yufan Bian, Wei Gao 0001, Bowen Zhang 0011, Jing Ma 0004, Hongzhan Lin 0001, Ziyang Luo, Xiaobin Zhu 0001, XuCheng Yin. 31998-32013 [doi]
- Unlocking Human-Like Visible Logic: How Logic Diagrams Boost Logic Reasoning in Large Language Models?Xin Wu 0003, Yuqi Bu, Mengchen Zhao, Qingbao Huang, Yi Cai 0001. 32014-32031 [doi]
- Let Retrievers Think Before Action: Thought-Augmented Embedding for Dense RetrievalRuiran Yan, Wen Xiong, Ze Liu, Chaozhuo Li, Hao Liao, Defu Lian, Zheng Liu 0011. 32032-32052 [doi]
- TravelBehaviorQA: A Benchmark Dataset for Behavioral Interpretation of GPS TrajectoriesDongyang Zhen, Niping Duan, Huan Zhou, Qingbin Cui. 32053-32071 [doi]
- SpiralThinker: Latent Reasoning through an Iterative Process with Text-Latent InterleavingShengmin Piao, Sanghyun Park 0001. 32072-32088 [doi]
- Verifier-Free RL for LLMs via Intrinsic Gradient-Norm RewardXuexiang Wen, Hang Yu 0002, Linchao Zhu, Gaoang Wang. 32089-32102 [doi]
- NovBench: Evaluating Large Language Models on Academic Paper Novelty AssessmentWenqing Wu, Yi Zhao, Yuzhuo Wang, Siyou Li, Juexi Shao, Yunfei Long, Chengzhi Zhang. 32103-32133 [doi]
- LaMPE: Length-aware Multi-grained Positional Encoding for Adaptive Long-context Scaling Without TrainingSikui Zhang, Guangze Gao, Ziyun Gan, Chunfeng Yuan, Zefeng Lin, Houwen Peng, Bing Li, Weiming Hu. 32134-32149 [doi]
- Can Small Vision-Language Models Perform Sign Language Translation?Anal Roy Chowdhury, Debarshi Kumar Sanyal. 32150-32166 [doi]
- FastKV: Decoupling of Context Reduction and KV Cache Compression for Prefill-Decoding AccelerationDongwon Jo, Jiwon Song, Yulhwa Kim, Jae-Joon Kim. 32167-32186 [doi]
- Beyond Outcome Verification: Verifiable Process Reward Models for Structured ReasoningMassimiliano Pronesti, Anya Belz, Yufang Hou 0001. 32187-32202 [doi]
- Auto-Stega: An Agent-Driven System for Lifelong Strategy Evolution in LLM-Based Text SteganographyJiuan Zhou, Yu Cheng 0013, Yuan Xie 0006, Zhaoxia Yin. 32203-32220 [doi]
- Detecting AI-Generated Video: A Vision-Language Dual-View SurveyDylan Xinming Hou, Juntian Zhang, Xu Gu, Yichen Wu, Nils Lukas, Gus Xia, Xiuying Chen, Yuhan Liu 0030. 32221-32255 [doi]
- UnIte: Uncertainty-based Iterative Document Sampling for Domain Adaptation in Information RetrievalJongyoon Kim, Minseong Hwang, Seung-won Hwang. 32256-32272 [doi]
- Improving LLM Code Reasoning via Semantic Equivalence Self-Play with Formal VerificationPoon Tsz Nok, Antonio Valerio Miceli Barone. 32273-32292 [doi]
- Towards Identification and Intervention of Safety-Critical Parameters in Large Language ModelsWeiwei Qi 0001, Zefeng Wu, Tianhang Zheng, Zikang Zhang, Xiaojun Jia, Zhan Qin, Kui Ren 0001. 32293-32312 [doi]
- OPINE: A Prior-calibrated Scoring Framework for LLM-based Multi-label Scientific Opinion ClassificationMengting Zhang, Gaofeng Pan, Zhixiong Zhang, Yang Li, Guangyin Zhang. 32313-32333 [doi]
- Vocab Diet: Reshaping the Vocabulary of LLMs via Vector ArithmeticYuval Reif, Guy Kaplan, Roy Schwartz 0001. 32334-32352 [doi]
- RecMem: Recurrence-based Memory Consolidation for Efficient and Effective Long-Running LLM AgentsZijie Dai, Shiyuan Deng, Sheng Guan, Yizhou Tian, Xin Yao, Xiao Yan 0002, James Cheng. 32353-32376 [doi]
- Let the Comments Speak: A Multi-Agent Framework based on Large Language Model for Comment-Guided Code RefactoringZixuan Wang, Wutong Yu, Deyu Zhou. 32377-32393 [doi]
- AdapTime: Enabling Adaptive Temporal Reasoning in Large Language ModelsYimin Deng, Yejing Wang, Zhenxi Lin, Zichuan Fu, Guoshuai Zhao, Derong Xu, Yefeng Zheng 0001, Xiangyu Zhao 0001, Xian Wu 0001, Li Zhu 0003, Xueming Qian. 32394-32409 [doi]
- Hierarchical Representation Alignment Learning of Diffusion Transformers for Neural Audio CodecSang-Hoon Lee, Ha-Yeong Choi. 32410-32426 [doi]
- CoV: Chain-of-View Prompting for Spatial ReasoningHaoyu Zhao, Akide Liu, Zeyu Zhang 0006, Weijie Wang, Feng Chen, Ruihan Zhu, Gholamreza Haffari, Bohan Zhuang. 32427-32440 [doi]
- A Graph Talks, But Who's Listening? Rethinking Evaluations for Graph-Language ModelsSoham Petkar, Hari Aakash K, Anirudh Vempati, Akshit Sinha, Ponnurangam Kumaraguru, Chirag Agarwal. 32441-32462 [doi]
- Rejection-to-Acceptance Transition: Model Editing-Based Jailbreak Backdoor Injection Not Limited to Few Output TokensShiji Yang, Min Cai, Hao Xiong, Congyao Mei, Haodong Zou, Shicheng Tan, Jie Chen 0025, Fulan Qian, Shu Zhao 0005. 32463-32477 [doi]
- Causal Evidence Extraction and Triangulation in Crisis Reports using Large Language Models: A ReliefWeb-based StudyYuanJun Zhang, Mourad Oussalah 0002. 32478-32491 [doi]
- Sounding vs. Being an Expert: Disentangling Authority, Register and Cultural Impact in Sycophantic LLMsGabriele Maraia, Fabio Massimo Zanzotto, Leonardo Ranaldi. 32492-32508 [doi]
- Datamart-Agent: LLM-Driven Game-Theoretic Agent for Data Marketplace ModelingPangjing Wu, Peter Q. Chen, Xiaodong Li 0007, Wenqi Fan, Qing Li 0001. 32509-32531 [doi]
- Multi-Drafter Speculative Decoding with Alignment FeedbackTaehyeon Kim 0001, Hojung Jung, Se-Young Yun. 32532-32573 [doi]
- Probabilistic Depression Detection from Textual Time SeriesFabian Schmidt, Seyedehmoniba Ravan, Vladimir Vlassov. 32574-32589 [doi]
- Distilling Examples into Task Instructions: Enhanced In-Context Learning for Real-World B2B ConversationsGuy Rotman, Adi Kopilov, Danit Berger Zalmanson, Omri Allouche. 32590-32613 [doi]
- Multilingual Tokenization through the Lens of Indian Languages: Challenges and InsightsMaharaj Brahma, N. J. Karthika, Rajat Verma, Nagasai Saketh Naidu, Rohit Saluja, Maunendra Sankar Desarkar, Ganesh Ramakrishnan. 32614-32632 [doi]
- TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal ModelsHao Zhang, Mengsi Lyu, Chenrui He, Yulong Ao, Yonghua Lin. 32633-32650 [doi]
- TTVS: Boosting Self-Exploring Reinforcement Learning via Test-time Variational SynthesisSikai Bai, Haoxi Li, Jie Zhang, Yongjiang Liu, Song Guo 0001. 32651-32665 [doi]
- Parallel Context-of-Experts Decoding for Retrieval Augmented GenerationGiulio Corallo, Paolo Papotti. 32666-32676 [doi]
- LLaTiSA: Towards Difficulty-Stratified Time Series Reasoning from Visual Perception to SemanticsYueyang Ding, Haopeng Zhang 0011, Rui Dai, Yi Wang 0074, Tianyu Zong, Kaikui Liu, Xiangxiang Chu. 32677-32717 [doi]
- NeedleChain: Measuring Intact Context Comprehension Capability of Large Language ModelsHyeonseok Moon, HeuiSeok Lim. 32718-32730 [doi]
- From Scores to Preferences: Redefining Evaluation Paradigm for Speech Quality Reward ModelingYifei Cao, Changhao Jiang, Jiabao Zhuang, Jiajun Sun, Ming Zhang 0030, Zhiheng Xi, Hui Li, Shihan Dou, Yuran Wang, Yunke Zhang, Tao Ji, Tao Gui, Qi Zhang 0001, Xuanjing Huang 0001. 32731-32749 [doi]
- FIND: Toward Multimodal Financial Reasoning and Question Answering for Indic LanguagesSarmistha Das 0001, Vaibhav Vishal, Syed Ibrahim Ahmad, Sriparna Saha 0001, Manish Gupta 0001. 32750-32770 [doi]
- Think Smart, Not Hard: Difficulty Adaptive Reasoning for Large Audio Language ModelsZhichao Sheng, Shilin Zhou 0002, Chen Gong 0004, Zhenghua Li. 32771-32790 [doi]
- Can Large Language Models Infer Human Actions and Motives? Evaluation in Social Prediction and Inspection GamesKaleen Shrestha, Abhinav Gupta, Harish Dukkipati, Zhonghao Shi, Maja J. Mataric. 32791-32803 [doi]
- Self-Consistency from Only Two Samples: CoT-PoT Ensembling for Efficient LLM ReasoningRaman Saparkhan, Majd Hawasly, Md. Rizwan Parvez, Mohammad Raza. 32804-32839 [doi]
- ZoomRAG: Hierarchical Random-walk Zooming across Multi-scale Information Graphs for Fast and Accurate RAGXianming Hu, Jingyang Chen, Bin Tang, Yihe Liu, Yihong Huang, Hongbo Zhao, Nuoyi Chen, Jie Zhang 0012, Ping Li 0024, Kai Zhang 0001. 32840-32859 [doi]
- Training Language Models to Use Prolog as a ToolNiklas Mellgren, Peter Schneider-Kamp, Lukas Galke Poech. 32860-32880 [doi]
- Frame of Reference: Addressing the Challenges of Common Ground Representation in Situational DialogsBiswesh Mohapatra, Théo Charlot, Giovanni Duca, Mayank Palan, Laurent Romary, Justine Cassell. 32881-32903 [doi]
- MultiDx: A Multi-Source Knowledge Integration Framework towards Diagnostic ReasoningYimin Deng, Zhenxi Lin, Yejing Wang, Guoshuai Zhao, Pengyue Jia, Zichuan Fu, Derong Xu, Yefeng Zheng 0001, Xiangyu Zhao 0001, Li Zhu 0003, Xian Wu 0001, Xueming Qian. 32904-32921 [doi]
- Training Verifier to Assessing Complex Real-World Tool-Use TrajectoriesLinzhuang Sun, Mingyang Chen 0002, Hao Liang 0017, Tianpeng Li, Yijie Zhou, Chenzheng Zhu, Tianyu Guo 0001, Huanyao Zhang, Jingxuan Wei, Bihui Yu, Fan Yang 0132, Wentao Zhang 0001. 32922-32936 [doi]
- HyperAdaLoRA: Accelerating LoRA Rank Allocation During Training via Hypernetworks without Sacrificing PerformanceHao Zhang, Zhenjia Li, YiFan Gao, Xi Xiao, Heng Zhang, Shuyang Zhang, Xiaoxincc, Bo Huang, Yuhang Wu, Tianyang Wang, Hao Xu. 32937-32949 [doi]
- ConSensus: Multi-Agent Collaboration for Multimodal SensingHyungjun Yoon, Mohammad Malekzadeh, Sung-Ju Lee, Fahim Kawsar, Lorena Qendro. 32950-32969 [doi]
- Beyond High-Entropy Exploration: Correctness-Aware Low-Entropy Segment-Based Advantage Shaping for Reasoning LLMsXinzhu Chen, Xuesheng Li, Zhongxiang Sun, Weijie Yu 0003. 32970-32984 [doi]
- GraphMind: LLMs as Dynamic Knowledge Builders for Sequential Decision-MakingSunguk Shin 0001, Hayeong Lee, JunHo Seo 0001, Jinho Lee, Myunsoo Kim, Minsuk Chang, Byung-Jun Lee 0001. 32985-33007 [doi]
- EET: Experience-Driven Early Termination for Cost-Efficient Software Engineering AgentsYaoqi Guo, Ying Xiao, Jie M. Zhang, Mark Harman, Yiling Lou, Yang Liu 0003, Zhenpeng Chen 0001. 33008-33024 [doi]
- Fundamental Reasoning Paradigms Induce Out-of-Domain Generalization in Language ModelsMingzi Cao, Xingwei Tan, Mahmud Elahi Akhter, Marco Valentino, Maria Liakata, Xi Wang, Nikolaos Aletras. 33025-33046 [doi]
- Rethinking Text-to-SQL: Dynamic Multi-turn SQL Interaction for Real-world Database ExplorationLinzhuang Sun, Tianyu Guo 0001, Hao Liang 0017, Ruitong Liu, Yuying Li 0006, Qifeng Cai, Jingxuan Wei, Yuchen Wu, Bihui Yu, Xiangxiang Zhang, Wentao Zhang 0001, Bin Cui 0001. 33047-33069 [doi]
- LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token SpeculationTianyu Liu, Qitan Lv, Hao Li, Xing Gao, Xiao Sun, Xiaoyan Sun. 33070-33092 [doi]
- Answering Cross-Dimensional Geometric Visual Questions by Multi-constraint Spatial ReasoningDongling Li, Qi Chen, Jianxing Yu, Hanjiang Lai, Yanghui Rao, Wenqing Chen, Jian Yin 0001. 33093-33111 [doi]
- SudokuFill: A Multi-Agent Progressive Filling Framework for Document-Level Scientific Information ExtractionYang Li 0278, Yajiao Wang, Yu Zhang, Yuanzhe Zhang, Maodi Hu, Mengting Zhang, Xi Sun, Hua Yue, Zhixiong Zhang 0002. 33112-33138 [doi]
- Emergent Relational Order in LLM Agent Societies: From Collective Affect to Authority StratificationZhiyuan Ji, Xinyu Chen, Ziqi Dai, Shiyun Tang, Chunyu Wei, Yueguo Chen. 33139-33175 [doi]
- VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational AgentsJiliang Hu 0001, Wenfu Wang, Zuchao Li, Chenxing Li, Yiyang Zhao, Hanzhao Li, Liqiang Zhang, Meng Yu 0003, Dong Yu 0001. 33176-33200 [doi]
- LLM-FK: Multi-Agent LLM Reasoning for Foreign Key Detection in Large-Scale Complex DatabasesZijian Tang, Ying Zhang, Sibo Cai, Ruoxuan Wang. 33201-33228 [doi]
- When Meaning Travels: A Granular Lens on Hybrid-MoE's Role in Idiomatic Understanding for Language ModelsSarmistha Das 0001, Vaibhav Vishal, Shreyas Guha, Amaan Ali, Kitsuchart Pasupa, Sriparna Saha 0001. 33229-33245 [doi]
- IntentCoding: Amplifying User Intent in Code GenerationZheng Fang, Yihong Dong, Lili Mou, Dongming Jin, Zhi Jin 0001, Ge Li 0001. 33246-33261 [doi]
- UbuntuGuard: A Culturally-Grounded Policy Benchmark for Equitable AI Safety in African LanguagesTassallah Abdullahi, Macton Mgonzo, Mardiyyah Oduwole, Paul Okewunmi, Abraham Toluwase Owodunni, Ritambhara Singh, Carsten Eickhoff. 33262-33276 [doi]
- microCLIP: Unsupervised CLIP Adaptation via Coarse-Fine Token Fusion for Fine-Grained Image ClassificationSathira Silva, Eman Ali, Chetan Arora 0001, Muhammad Haris Khan. 33277-33294 [doi]
- Prompting Across Time: Evaluating LLMs on Historical and Contemporary Offensive LanguageSanne Hoeken, Sophie Jasmin Spliethoff, Silke Schwandt, Özge Alaçam, Sina Zarrieß. 33295-33314 [doi]
- LDEDE: LRP-Driven Efficient Detection and Editing Framework for LLM Privacy NeuronsZhengyuan Zhao, Lifeng Cao, Haodong Sun, Haotian Shi, Xuehui Du, Aodi Liu, Lanjie Niu, Xiaocheng Yang. 33315-33329 [doi]
- Chimera: Compositional Jailbreak Attacks on LLMs via Judgment-Driven Search over Heterogeneous StrategiesLeo Hyun Park, Juwon Cho, Gyuhwan Kim, YoonDong Yeo, Taekyoung Kwon 0002. 33330-33355 [doi]
- Bias Dynamics in BabyLMs: Towards a Compute-Efficient Sandbox for Democratising Pre-Training DebiasingFilip Trhlík, Andrew Caines, Paula Buttery. 33356-33377 [doi]
- PuzzleClone: A DSL-Powered Framework for Synthesizing Verifiable DataKai Xiong, Yanwei Huang, Rongjunchen Zhang, Kun Chen, Haipang Wu, Yingcai Wu. 33378-33404 [doi]
- Automated Knowledge Component Generation and Interpretable Knowledge Tracing in Coding ProblemsZhangqi Duan, Nigel Fernandez, Arun Balajiee Lekshmi Narayanan, Mohammad Hassany, Rafaella Sampaio de Alencar, Peter Brusilovsky, Bita Akram, Andrew Lan. 33405-33423 [doi]
- Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for ClassificationElena Merdjanovska, Omar Zaidan, Andreas Rücklé. 33424-33435 [doi]
- MATA: Multi-Agent Framework for Reliable and Flexible Table Question AnsweringSieun Hyeon, Jusang Oh, Sunghwan Steve Cho, Jaeyoung Do. 33436-33476 [doi]
- Hallucination Detection in Long-Form Text Generated by LLMs: A Benchmark and a Hyper-Relational Knowledge Graph ApproachZituo Li, Guangzhou Chen, Jianbin Sun, Qi Song, Kewei Yang 0001. 33477-33494 [doi]
- Can Intelligent Agents Revolutionize Scale Generation?Chenghao Jia, Zhitao Yuan, Zhaokang Zong, Yifei Yin, Zhe Chen, Man Lan, Shengjun Wu. 33495-33522 [doi]
- On Finding Inconsistencies in DocumentsCharles Lovering, Seth Ebner, Brandon Smock, Michael Krumdick, Muhammad Saad Rabbani, Ahmed Muhammad, Varshini Reddy, Chris Tanner. 33523-33564 [doi]
- Towards Preference Following in Tool Calling Language AgentsZhi-Yuan Chen, Siyu Lu, Qianlong Xie, Xingxing Wang, Yankai Lin 0001. 33565-33581 [doi]
- ReSQL: Self-Improving Framework for Reasoning-Aware Text-to-SQL Dataset GenerationMinJun Park, Yongju Seong, Myoseop Sim, Kyungkoo Min, Stanley Jungkyu Choi. 33582-33602 [doi]
- Identifying and typifying demographic unfairness in phoneme-level embeddings of self-supervised speech recognition modelsFelix Herron, Solange Rossato, Alexandre Allauzen, François Portet. 33603-33620 [doi]
- MolSafeEval: A Benchmark for Uncovering Safety Risks in AI-Generated MoleculesTong Xu 0001, Xinzhe Cao, Zhihui Zhu, Keyan Ding, Huajun Chen. 33621-33648 [doi]
- Dynamic Tool Dependency Retrieval for Lightweight Function CallingBhrij Patel, Davide Belli, Amir Jalalirad, Maximilian Arnold, Aleksandr Ermolov, Bence Major. 33649-33672 [doi]
- Audit Me If You Can: Query-Efficient Active Fairness Auditing of Black-Box LLMsDavid Hartmann, Lena Pohlmann, Lelia Hanslik, Noah Gießing, Bettina Berendt, Pieter Delobelle. 33673-33698 [doi]
- Mending the Holes: Mitigating Reward Hacking in Reinforcement Learning for Multilingual TranslationYifeng Liu, Siqi Ouyang, Yatish Hosmane Revanasiddappa, Lei Li. 33699-33723 [doi]
- MedCoach: Enhancing Medical Reasoning in LLMs via Knowledge Graph-Augmented Chain-of-Thought DistillationChuan Li, Ye Lyu, Chengyu Wang 0001, Mingyuan Fan 0003, Cen Chen 0001. 33724-33743 [doi]
- Pru-CoT: Towards Efficient Reasoning Distillation via Pruning Chain-of-ThoughtHan Liu 0008, Shuotian Ma, Hui Li, Xiaotong Zhang 0003, Fenglong Ma, Hong Yu 0005. 33744-33756 [doi]
- Curriculum-RLAIF: Curriculum Alignment with Reinforcement Learning from AI FeedbackJiaye Lin, Mengdi Li 0006, Xufeng Zhao 0002, Wenhao Lu, Peilin Zhao, Stefan Wermter, Di Wang 0015. 33757-33777 [doi]
- Query-Focused Individual Simulation with Progressive Persona CompletionWeiwen Su, Naoki Yoshinaga 0001, Masashi Toyoda. 33778-33792 [doi]
- VIDA: A Visual Intent-driven Design Assistant for Proactive Multimodal ClarificationYanshan Liu, Hongbo Zhang, Zhen Sun 0001, Jiaheng Wei, Kaishun Wu. 33793-33804 [doi]
- DeepSynth-Eval: Objectively Evaluating Information Consolidation in Deep Survey WritingHongzhi Zhang, Yuanze Hu, Tinghai Zhang, Jia Fu, Tao Wang 0014, Junwei Jing, Zhaoxin Fan, Wei Bi, Ruiming Tang, Han Li 0005, Guorui Zhou, Kun Gai. 33805-33822 [doi]
- A Scalable Entity-Based Framework for Auditing Bias in Large Language ModelsAkram Elbouanani, Aboubacar Tuo, Adrian Popescu 0001. 33823-33852 [doi]
- HiGMem: A Hierarchical and LLM-Guided Memory System for Long-Term Conversational AgentsShuqi Cao, Jingyi He, Fei Tan. 33853-33862 [doi]
- Self-Guided Plan Extraction for Instruction-Following Tasks with Goal-Conditional Reinforcement LearningZoya Volovikova, Nikita Sorokin, Dmitriy Lukashevskiy, Aleksandr Panov 0001, Alexey Skrynnik. 33863-33882 [doi]
- Adaptive Prompt Optimization for Open-Ended Tasks: Uncertainty Preference as a Secondary SignalShuyang Zhang, Zhixuan Liu, Zhichen Dong, Hao Zhang, Chaochao Lu, Chao Yang. 33883-33891 [doi]
- DPLoRA: A Dual-Pruning Framework based on ILP Optimization and Progressive Pruning for Parameter-Efficient LoRA Fine-TuningChangjun Park, Sejong Yoon, Jaekwang Kim 0001. 33892-33908 [doi]
- Demystifying Multi-Agent Debate: The Role of Confidence and DiversityXiaochen Zhu, Caiqi Zhang, Yizhou Chi, Tom Stafford 0002, Nigel Collier, Andreas Vlachos 0001. 33909-33930 [doi]
- RoleConflictBench: A Benchmark of Role Conflict Scenarios for Evaluating LLMs' Contextual SensitivityJisu Shin 0001, Hoyun Song, Juhyun Oh, Changgeon Ko, Eunsu Kim, Chani Jung, Alice Oh. 33931-33964 [doi]
- RbtAct: Rebuttal as Supervision for Actionable Review Feedback GenerationSihong Wu, Yiling Ma, Yilun Zhao 0001, Tiansheng Hu, Owen Jiang, Manasi Patwardhan 0001, Arman Cohan. 33965-33992 [doi]
- Is Grokking Worthwhile? Functional Analysis and Transferability of Generalization Circuits in TransformersKaiyu He, Mian Zhang, Peilin Wu, Xinya Du, Zhiyu Chen 0002. 33993-34001 [doi]
- When 20 Agents Fail to Sort: The Distributed Sorting Benchmark for Scalable Multi-Agent SystemsXin Yang, Junhao Wang, Bintao Tang, Xuxin Cheng, Cao Liu, Ke Zeng, Wenyuan Jiang. 34002-34021 [doi]
- RIGOURATE: Quantifying Scientific Exaggeration with Evidence-Aligned Claim EvaluationJoseph James, Chenghao Xiao, Yucheng Li 0001, Nafise Sadat Moosavi, Chenghua Lin 0002. 34022-34043 [doi]
- Glance-or-Gaze: Incentivizing LMMs to Adaptively Focus Search via Reinforcement LearningHongbo Bai, Yujin Zhou, Yile Wu, Chi-Min Chan, Pengcheng Wen, Kunhao Pan, Sirui Han, Yike Guo. 34044-34062 [doi]
- Before Forgetting, Learn to Remember: Revisiting Foundational Learning Failures in LVLM Unlearning BenchmarksJunehyoung Kwon, Mihyeon Kim, Eunju Lee, Jungmin Yun, Byeonggeuk Lim, Youngbin Kim. 34063-34079 [doi]
- Investigating Links between Illicit Massage Businesses through Natural Language Processing and Graph Machine LearningVasuki Garg, Osman Y. Özaltin, Maria E. Mayorga, Sherrie Caltagirone. 34080-34096 [doi]
- TopoRAG: Graph-based RAG via Topology-aware Approximate Nearest Neighbor SearchTianhao Wu, Siqiang Luo. 34097-34108 [doi]
- Self-Explaining Hate Speech Detection with Moral RationalesFrancielle Vargas, Jackson Trager, Diego Alves, Matteo Guida, Surendrabikram Thapa, Berk Atil, Daryna Dementieva, Andrew Smart, Ameeta Agrawal. 34109-34131 [doi]
- Principled Detection of Hallucinations in Large Language Models via Multiple TestingJiawei Li, Akshayaa Magesh, Venugopal V. Veeravalli. 34132-34145 [doi]
- What Do Vision-Language Models Encode for Personalized Image Aesthetics Assessment?Koki Ryu, Hitomi Yanaka. 34146-34167 [doi]
- A Diversity Diet for a Healthier Model: A Case Study of French ModernBERTLouis Estève, Christophe Servan, Thomas Lavergne, Agata Savary. 34168-34181 [doi]
- Is Your Language Model Ready for Monetization Decisions?Jialu Gao, Hua Li, Tracy Ortman, Yeyun Gong, Jian Jiao 0007. 34182-34200 [doi]
- Activation Reward Models for Few-Shot Model AlignmentTianning Chai, Chancharik Mitra, Brandon Huang, Gautam Rajendrakumar Gare, Zhiqiu Lin, Assaf Arbelle, Leonid Karlinsky, Rogério Feris, Trevor Darrell, Deva Ramanan, Roei Herzig. 34201-34217 [doi]
- Cross-lingual Matryoshka Representation Learning across Speech and TextYaya Sy, Dioula Doucouré, Christophe Cerisara, Irina Illina. 34218-34228 [doi]
- TRACE: Two-Phase RL for Causal Graph Exploration and Deeper Psychological Intervention in Dynamic Counseling ScenariosShilin Tang, Zunyi Yin, Xuefeng Liang, Guanghui Shi, Song Tong, Guangyu Chen. 34229-34260 [doi]
- LLM Multi-Agent Systems for Long Triple Set Data-to-Text GenerationChinonso Cynthia Osuji, Simon Mille, Mark Andrade, Jane Adkins, Ornait O'Connell, Elaine Uí Dhonnchadha, Bláithín Heffernan, Fírinne Nic an tSaoir, Anya Belz, Thiago Castro Ferreira, Brian Davis 0001. 34261-34275 [doi]
- Biomed-Enriched: Data-Efficient Biomedical Pretraining via Paragraph-Level AnnotationRian Touchent, Nathan Godey, Éric Villemonte de la Clergerie. 34276-34287 [doi]
- Identifying the Achilles' Heel: An Iterative Method for Uncovering Factual Errors in Large Language ModelsWenxuan Wang 0001, Yuk-Kit Chan, Zixuan Ling, Juluan Shi, Youliang Yuan, Jen-tse Huang 0001, Yifei Zhang, Wenxiang Jiao, Zhaopeng Tu, Michael R. Lyu. 34288-34309 [doi]
- Probing the Plasticity and Correlation of LLM Value Systems: LLM Value Rankings are Not StableZhenheng Tang, Qihua Pan, Jingya Shen, Xiang Liu 0001, Qian Wang 0022, Bo Li 0001, Xiaowen Chu 0001. 34310-34345 [doi]
- FAMA: Failure-Aware Meta-Agentic Framework for Open-Source LLMs in Interactive Tool Use EnvironmentsAmir Saeidi, Venkatesh Mishra, Souradeep Mukhopadhyay, Gaowen Liu, Ali Payani, Jayanth Srinivasa, Chitta Baral. 34346-34367 [doi]
- Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning ModelsHoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei. 34368-34398 [doi]
- ActorMind: Emulating Human Actor Reasoning for Speech Role-PlayingXi Chen, Wei Xue 0002, Yike Guo. 34399-34413 [doi]
- Neuronal Insights into LLM Attacks: Targeted Neuron Tuning for Precise and Robust Vulnerability PatchingDan Shi 0001, Renren Jin, Zhuowen Han, Yuqi Ren, Xinwei Wu 0001, Zhigen Li, Deyi Xiong. 34414-34435 [doi]
- Ro-SLM: Onboard Small Language Models for Robot Task Planning and Operation Code GenerationWenhao Wang, Yanyan Li, Long Jiao, Jiawei Yuan. 34436-34460 [doi]
- Just Use XML: Revisiting Joint Translation and Label ProjectionThennal D. K, Chris Biemann, Hans Ole Hatzel. 34461-34478 [doi]
- CaTS-Bench: Can Language Models Describe Time Series?Luca Zhou, Pratham Yashwante, Marshall Fisher, Alessio Sampieri, Zihao Zhou, Fabio Galasso, Rose Yu. 34479-34519 [doi]
- How do Visual Attributes Influence Web Agents? A Comprehensive Evaluation of User Interface Design FactorsKuai Yu, Naicheng Yu, Han Wang, Rui Yang, Huan Zhang. 34520-34536 [doi]
- Scaling Unverifiable Rewards: A Case Study on Visual InsightsShuyu Gan, James Mooney, Pan Hao, Renxiang Wang, Mingyi Hong 0001, Qianwen Wang, Dongyeop Kang. 34537-34569 [doi]
- SilentDrift: Exploiting Action Chunking for Stealthy Backdoor Attacks on Vision-Language-Action ModelsBingxin Xu, Yuzhang Shang, Binghui Wang, Emilio Ferrara. 34570-34582 [doi]
- X-ray Made Simple: Lay Radiology Report Generation and Robust EvaluationKun Zhao 0007, Chenghao Xiao, Sixing Yan, Haoteng Tang, William K. Cheung, Noura Al Moubayed, Liang Zhan, Chenghua Lin 0002. 34583-34598 [doi]
- Not All Citations Are Equal: Entropy-Guided Citation Selection for Noise-Resistant Medical LLMMinyu Gao, Hanlin Xiao, Ruoyu Wang, Shuai Yang, Yexuan Zhang, Xin Wu, Xingyu Liu. 34599-34615 [doi]
- Decomposing Unitization and Typing for Efficient and Consistent Span-Bound Concept AnnotationNupoor Gandhi, Michael Bada, Emma Strubell. 34616-34631 [doi]
- InsightEval: An Expert-Curated Benchmark for Assessing Insight Discovery in LLM-Driven Data AgentsZhenghao Zhu, Yuanfeng Song, Xing Chen, Chengzhong Liu, Yakun Cui, Caleb Chen Cao, Sirui Han, Yike Guo. 34632-34656 [doi]
- ArrowGEV: Grounding Events in Video via Learning the Arrow of TimeFangxu Yu, Ziyao Lu, Liqiang Niu, Fandong Meng, Jie Zhou 0016. 34657-34671 [doi]
- Multi-lingual Functional Evaluation for Large Language ModelsVictor Ojewale, Inioluwa Deborah Raji, Suresh Venkatasubramanian. 34672-34691 [doi]
- Why LoRA Fails to Forget: Regularized Low-Rank Adaptation Against Backdoors in Language ModelsHoang-Chau Luong, Lingwei Chen. 34692-34705 [doi]
- BoundRL: Efficient Token-level Structured Text Segmentation through Reinforced Boundary GenerationHaoyuan Li, Zhengyuan Shen, Sullam Jeoung, Yueyan Chen, Jiayu Li, Qi Zhu 0008, Shuai Wang, Vassilis N. Ioannidis, Huzefa Rangwala. 34706-34726 [doi]
- AOT*: Efficient Synthesis Planning via LLM-Empowered AND-OR Tree SearchXiaozhuang Song, Xuanhao Pan, Xinjian Zhao, Hangting Ye, Shufei Zhang, Jian Tang, Tianshu Yu 0001. 34727-34758 [doi]
- AutoSUIT Bench - Automated Security UnIt Test Benchmark for LLM CodingSamuel Osebe, Fan Yang 0155, Junyi Li 0002, Yue Gu, Yongxin Wang, Satyapriya Krishna, Kai-Wei Chang 0001, Aram Galstyan, Rahul Gupta 0001, Weitong Ruan. 34759-34783 [doi]
- AnchorMem: Anchored Facts with Associative Contexts for Building Memory in Large Language ModelsZhanyu Shen, Sijie Cheng, Zhicheng Guo, Weiqin Wang, Yile Wang, Hui Huang 0004. 34784-34798 [doi]
- Filling in the Mechanisms: How do LMs Learn Filler-Gap Dependencies under Developmental Constraints?Atrey Desai, Sathvik Nair. 34799-34815 [doi]
- PictoEduca: Building a Dataset for Spanish Text-to-Pictogram GenerationAlfonso Manuel Paredes Umeres, Marco Antonio Sobrevilla Cabezudo. 34816-34828 [doi]
- HCFD: A Benchmark for Audio Deepfake Detection in HealthcareMohd Mujtaba Akhtar, Girish, Muskaan Singh. 34829-34843 [doi]
- Linear Semantic Segmentation for Low-Resource Spoken DialectsKirill Chirkunov, Younes Samih, Abed Alhakim Freihat, Hanan Aldarmaki. 34844-34861 [doi]
- Thinking Like a Botanist: Challenging Multimodal Language Models with Intent Driven Chain-of-InquirySyed Nazmus Sakib, Nafiul Haque, Shahrear Bin Amin, Hasan Muhammad Abdullah, Md. Mehedi Hasan, Mohammad Zabed Hossain, Shifat E. Arman. 34862-34892 [doi]
- Analysing Differences in Persuasive Language in LLM-Generated Text: Uncovering Stereotypical Gender PatternsAmalie Brogaard Pauli, Maria Barrett, Max Müller-Eberstein, Isabelle Augenstein, Ira Assent. 34893-34918 [doi]
- Robust In-Context Selection via Online Learned Position-Corrected AttentionDeeksha Koul, Gaurav Kumar, Yash Sabale, Sunita Sarawagi. 34919-34930 [doi]
- Comprehensiveness Metrics for Automatic Evaluation of Factual Recall in Text GenerationAdam Dejl, James Barry, Alessandra Pascale, Javier Carnerero-Cano. 34931-34966 [doi]
- TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural ComplexityZheyuan Yang, Liqiang Shang, Junjie Chen, Xun Yang, Chenglong Xu, Bo Yuan, Chenyuan Jiao, Yaoru Sun, Yilun Zhao 0001. 34967-34985 [doi]
- Lost in Translation: Do LVLM Judges Generalize Across Languages?Md. Tahmid Rahman Laskar, Mohammed Saidul Islam, Mir Tafseer Nayeem, Amran Bhuiyan, Mizanur Rahman, Shafiq Joty, Enamul Hoque, Jimmy Huang 0001. 34986-35002 [doi]
- Making Revisions Understandable: A Survey of Edit Intentions, Methods, and ApplicationsFangping Lan, Qi Zhang, Eduard C. Dragut. 35003-35019 [doi]
- GSM-Noise: Exploring and Enhancing Large Language Models' Reasoning under Noisy InputsZhengxin Zhang, Chengyu Huang, Xufu Liu, Dan Zhao, Jinyan Su, Claire Cardie. 35020-35045 [doi]
- VALUE ALIGNMENT TAX: Measuring Value Trade-offs in LLM AlignmentJiajun Chen, Hua Shen. 35046-35069 [doi]
- Confidence-Aware Ranker Ensembles for Robust In-Context Knowledge EditingTejal Nair, Mahmud Wasif Nafee, Maiqi Jiang, Ashley Gao, Haipeng Chen 0001, Yanfu Zhang. 35070-35080 [doi]
- EMSDialog: Synthetic Multi-person Emergency Medical Service Dialogue Generation from Electronic Patient Care Reports via Multi-LLM AgentsXueren Ge, Sahil Murtaza, Anthony Cortez, Homa Alemzadeh. 35081-35110 [doi]
- Better LLM Reasoning via Dual-PlayZhengxin Zhang, Chengyu Huang, Aochong Oliver Li, Claire Cardie. 35111-35139 [doi]
- CobwebTM: Probabilistic Concept Formation for Lifelong and Hierarchical Topic ModelingKarthik Singaravadivelan, Anant Gupta, Zekun Wang, Christopher J. MacLellan. 35140-35155 [doi]
- Adaptive Test-Time Compute Allocation with Evolving In-Context DemonstrationsBowen Zuo, Dongruo Zhou, Yinglun Zhu. 35156-35173 [doi]
- CCD: Mitigating Hallucinations in Radiology MLLMs via Clinical Contrastive DecodingXi Zhang 0025, Zaiqiao Meng, Jake Lever, Edmond S. L. Ho. 35174-35200 [doi]
- Can Large Language Models Adequately Perform Symbolic Reasoning Over Time Series?Zewen Liu 0005, Juntong Ni, Xianfeng Tang, Max S. Y. Lau, Qi He 0002, Wenpeng Yin 0001, Wei Jin 0009. 35201-35226 [doi]
- Reading Between the Lines: The One-Sided Conversation ProblemVictoria Ebert, Rishabh Singh, Tuochao Chen, Noah A. Smith, Shyamnath Gollakota. 35227-35260 [doi]
- Fico: Evaluating Vision-Language Models under Visual Fidelity and Compression at ScaleJianhong Tu, Nicholas Crispino, Kyle Montgomery, Chenguang Wang 0001, Dawn Song. 35261-35277 [doi]
- SycoBench-600: Measuring Sycophancy and Correction Selectivity in LLM AssistantsDebu Sinha. 35278-35284 [doi]
- Calibrating Model-Based Evaluation Metrics for SummarizationHongye Liu, Dhanajit Brahma, Ricardo Henao. 35285-35315 [doi]
- SafeMERGE: Preserving Safety Alignment in Fine-Tuned Large Language Models via Selective Layer-Wise Model MergingAladin Djuhera, Swanand Ravindra Kadhe, Farhan Ahmed, Syed Zawad, Holger Boche. 35316-35335 [doi]
- Learning to Control Summaries with Score RankingHongye Liu, Liang Ding, Ricardo Henao. 35336-35359 [doi]
- Raw Pointer Rewriting with LLMs for Translating C to Safer RustYifei Gao, Chengpeng Wang 0001, Pengxiang Huang, Xuwei Liu, Mingwei Zheng, Xiangyu Zhang 0001. 35360-35373 [doi]
- Beyond Single Plots: A Benchmark for Question Answering on Multi-ChartsAzher Ahmed Efat, Seok Hwan Song, Wallapak Tavanapong. 35374-35411 [doi]
- Assessing Y-Axis Influence: Bias in Multimodal Language Models on Chart-to-Table TranslationSeok Hwan Song, Azher Ahmed Efat, Wallapak Tavanapong. 35412-35430 [doi]
- FLOP-Efficient Training: Early Stopping Based on Test-Time Compute AwarenessHossam Amer, Maryam Dialameh, Hossein Rajabzadeh, Walid Ahmed, Weiwei Zhang, Yang Liu. 35431-35449 [doi]
- Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM ReasoningHaolin Liu, Dian Yu 0001, Sidi Lu, Yujun Zhou 0002, Rui Liu, Zhenwen Liang, Haitao Mi, Chen-Yu Wei, Dong Yu 0001. 35450-35477 [doi]
- POSTCONDBENCH: Benchmarking Correctness and Completeness in Formal Postcondition InferenceGehao Zhang, Juan Zhai. 35478-35507 [doi]
- Who's Asking? Simulating Role-Based Questions for Conversational AI EvaluationNavreet Kaur 0002, Hoda Ayad, Hayoung Jung, Shravika Mittal, Munmun De Choudhury, Tanu Mitra. 35508-35541 [doi]
- CircuitSynth: Reliable Synthetic Data GenerationZehua Cheng, Wei Dai 0015, Jiahao Sun, Thomas Lukasiewicz. 35542-35552 [doi]
- MedRedFlag: Investigating how LLMs Redirect Misconceptions in Real-World Health CommunicationSraavya Sambara, Yuan Pu, Ayman Ali, Vishala Mishra, Lionel Wong, Monica Agrawal. 35553-35578 [doi]
- Can VLMs Predict Future States? Bootstrapping World Models from Inverse DynamicsYifu Qiu, Yftah Ziser, Anna Korhonen, Shay B. Cohen, Edoardo M. Ponti. 35579-35600 [doi]
- PL-MTEB: Polish Massive Text Embedding BenchmarkRafal Poswiata, Slawomir Dadas, Michal Wiktor Perelkiewicz. 35601-35619 [doi]
- RubRIX: Rubric-Driven Risk Mitigation in Caregiver-AI InteractionsDrishti Goel, Jeongah Lee, Qiuyue Joy Zhong, Violeta J. Rodriguez, Daniel S. Brown, Ravi Karkar, Dong Whi Yoo, Koustuv Saha. 35620-35638 [doi]
- Spectral Gravity Formant Estimation for Phonetic SegmentationMichael S. Yantosca, Albert M. K. Cheng. 35639-35652 [doi]
- Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio UnderstandingJieyi Wang, Yazhe Niu, Dexuan Xu, Zhongyu Wei. 35653-35671 [doi]
- DeFrame: Debiasing Large Language Models Against Framing EffectsKahee Lim, Soyeon Kim 0001, Steven Euijong Whang. 35672-35707 [doi]
- Idea First, Code Later: Disentangling Problem Solving from Code Generation in Evaluating LLMs for Competitive ProgrammingSama Hadhoud, Alaa Elsetohy, Frederikus Hudi, Jan Christian Blaise Cruz, Steven Halim, Alham Fikri Aji. 35708-35747 [doi]
- LLMs in the Real World: Evaluating "AI" in Emergency ContextsSara Court, Lara Downing, Micha Elsner. 35748-35760 [doi]
- A Survey of Toxicity Mitigation Strategies for Multilingual Language ModelsSoham Dan, Himanshu Beniwal, Thomas Hartvigsen. 35761-35774 [doi]
- LLM-KT: Enhancing Large Language Models with Knowledge Tracing via Multi-Level Plug-and-Play AlignmentZiwei Wang, Jie Zhou 0015, Qin Chen 0001, Bo Jiang 0016, Qingchun Bai, Liang Dou, Liang He 0001. 35775-35792 [doi]
- Fast-Decoding Diffusion Language Models via Progress-Aware Confidence SchedulesAmr Mohamed 0005, Yang Zhang, Michalis Vazirgiannis, Guokan Shang. 35793-35807 [doi]
- When Cultures Meet: Multicultural Text-to-Image GenerationParth Bhalerao, Oana Ignat, Brian Trinh, Mounika Yalamarty. 35808-35828 [doi]
- Aligning with Your Own Voice: Self-Corrected Preference Learning for Hallucination Mitigation in LVLMsByeonggeuk Lim, Jungmin Yun, Junehyoung Kwon, Kyeonghyun Kim, Youngbin Kim. 35829-35849 [doi]
- VocalRep: Structure-Aware Vocal Representations for Multimodal GenerationDa Shen, Zhenqiang Weng, Tianyu Liu, Gongyu Chen, Runhua Shi, Jiahui Chen, Chaofan Ding, Wei-Qiang Zhang, Zihao Chen. 35850-35865 [doi]
- RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World RepositoriesYanlin Wang 0001, Ziyao Zhang 0004, Chong Wang 0013, Xinyi Xu, Mingwei Liu 0002, Yong Wang 0002, Jiachi Chen, Zibin Zheng. 35866-35883 [doi]
- InfiAgent: An Infinite-Horizon Framework for General-Purpose Autonomous AgentsChenglin Yu, Yuchen Wang, Songmiao Wang, Hongxia Yang, Li Ming. 35884-35894 [doi]
- Efficient and Effective Internal Memory Retrieval for LLM-Based Healthcare PredictionMingchen Li, Jiatan Huang, Zonghai Yao, Hong Yu 0001. 35895-35906 [doi]
- GAVEL: Evidence-Contract Debate with Mechanized Scrutiny for Provenance-Grounded Fact-CheckingRuoyu Xu, Gaoxiang Li, Victor S. Sheng. 35907-35920 [doi]
- EMPATH: An Ensemble Method for Automatic Fine-Grained Turn-Level Dialogue Empathy Evaluation with a Novel Emotional Distance MetricDongning Rao, Zhihua Liang, Zhihua Jiang. 35921-35942 [doi]
- Q2EI: Query-to-Entity Inference for Semantic Condensation in Domain-Specific RetrievalYixuan Sun, Zhenqin Xu, Hanfeng Zhai, Zishu Yu, Xiaohui Peng 0002. 35943-35958 [doi]
- TVWorld: Foundations for Remote-Control TV AgentsZhantao Ma, Quanfeng Lu, Shuai Zhong, Dahai Yu 0001, Ping Luo 0002, Michael Ng 0001. 35959-35984 [doi]
- RiTeK: A Dataset for Large Language Models Complex Reasoning over Textual Knowledge Graphs in MedicineJiatan Huang, Mingchen Li, Zonghai Yao, Dawei Li, Yuxin Zhang, Zhichao Yang 0001, Yongkang Xiao, Feiyun Ouyang, Xiaohan Li, Shuo Han, Hong Yu 0001. 35985-36001 [doi]
- PRA-RAG: Provably Robust Aggregation in Retrieval-Augmented Generation against Retrieval CorruptionXue Tan, Yi Zheng, Chang Huo, Yunruo Zhang, Yu Liu, Hao Luan, Zhuyang Yu, Jun Dai 0001, Xiaoyan Sun 0003, Ping Chen 0003. 36002-36017 [doi]
- Evaluating Perspectival Biases in Cross-Modal RetrievalTeerapol Saengsukhiran, Peerawat Chomphooyod, Narabodee Rodjananant, Chompakorn Chaksangchaichot, Patawee Prakrankamanant, Witthawin Sripheanpol, Pak Lovichit, Sarana Nutanong, Ekapol Chuangsuwanich. 36018-36049 [doi]
- Beyond Static Synthetic Noise: Assessing the Robustness of Large Language Models to Natural Context Variation in the Real WorldYulong Wu, Viktor Schlegel, Riza Batista-Navarro. 36050-36070 [doi]
- Measuring Watermarking under Jailbreaking: ASR Inflation and Goal-Compliance MismatchSungwoo Han, Sangjun Moon, Jingun Kwon, Hidetaka Kamigaito, Manabu Okumura. 36071-36083 [doi]
- Inventive Problem Solving with LLMs: A Benchmark for TRIZ ReasoningZhu Wang, Brian Uzzi. 36084-36101 [doi]
- Do LLM Agents Really Mimic Humans? Diagnosing and Aligning Microeconomic Behaviors in Macro-ABMsGuangya Liu, Cheng Wang, Jiangtong Li, Huafei Wu, Changjun Jiang. 36102-36122 [doi]
- Explanation Quality Assessment as Ranking with Listwise RewardsThomas Bailleux, Tanmoy Mukherjee, Emmanuel Lonca, Pierre Marquis, Zied Bouraoui. 36123-36135 [doi]
- ViLegalLM: Language Models for Vietnamese Legal TextTruong-Phuc Nguyen, Quy-Nhan Nguyen, Minh-Tien Nguyen. 36136-36150 [doi]
- From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language ModelsQidong Wang, Junjie Hu, Ming Jiang. 36151-36175 [doi]
- Syntax as a Rosetta Stone: Universal Dependencies for In-Context Coptic TranslationAbhishek Purushothama, Emma Thronson, Alexia Guo, Amir Zeldes. 36176-36195 [doi]
- AI Agents for the Science of Science: A Survey of Tasks, Architectures, Evaluations, and ChallengesYixuan Liu, Yicheng Zhang. 36196-36211 [doi]
- A2O: LLM-based Agentic Learning of Action-to-Object Features for Video Action RecognitionTaiki Sekii, Fumiaki Sato. 36212-36228 [doi]
- PrinciplismQA: A Philosophy-Grounded Approach to Assessing LLM-Human Clinical Medical Ethics AlignmentChang Hong, Minghao Wu, Qingying Xiao, YuChi Wang, Xiang Wan, Guangjun Yu, Benyou Wang, Yan Hu. 36229-36245 [doi]
- Take Out Your Calculators: Estimating the Real Difficulty of Question Items with LLM Student SimulationsChristabel Acquaye, Yi-Ting Huang, Marine Carpuat, Rachel Rudinger. 36246-36267 [doi]
- SAFER: Advancing Safety Alignment via Efficient Ex-Ante ReasoningKehua Feng, Keyan Ding, Yuhao Wang 0006, Menghan Li, Fanjunduo Wei, Xinda Wang 0005, Huajun Chen. 36268-36289 [doi]
- Speculative Verification: Exploiting Information Gain for Speculative DecodingSungkyun Kim, Jaemin Kim, Dogyeong Yun, Jiho Shin, Junyeol Lee, Jiwon Seo 0002. 36290-36307 [doi]
- EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem SolvingXiyuan Zhou, Xinlei Wang, Yirui He, Ruixi Zou, Yang Wu, Yuheng Cheng, Yulu Xie, Wenxuan Liu, Huan Zhao 0004, Yan Xu 0005, Jinjin Gu, Junhua Zhao 0001. 36308-36334 [doi]
- LLM-Based Human-Agent Collaboration and Interaction Systems: A SurveyHenry Peng Zou, Wei-Chieh Huang, Yaozu Wu, Jizhou Guo, Yankai Chen 0001, ChunYu Miao, Hoang H. Nguyen 0001, Yue Zhou, Weizhi Zhang 0001, Liancheng Fang, Hanrong Zhang, Fangxin Wang 0003, Pengfei Zhang, Langzhou He, Yangning Li, Dongyuan Li, Renhe Jiang, Philip S. Yu. 36335-36364 [doi]
- Thinking Twice Makes Large Language Models Safer and More HelpfulYutao Mou, Yuxiao Luo, Shikun Zhang, Wei Ye 0004. 36365-36389 [doi]
- AEQ-Bench: Measuring Empathy of Omni-Modal Large ModelsXuan Luo, Lewei Yao, Lanqing Hong, Kai Chen, Dehua Tao, Daxin Tan, Yukun Deng, Ruifeng Xu 0001, Jing Li 0049. 36390-36407 [doi]
- BAPO: Boundary-Aware Policy Optimization for Reliable Agentic SearchShiyu Liu, Yongjing Yin, Jianhao Yan, Yunbo Tang, Qinggang Zhang, Bei Li, Xin Chen, Jingang Wang, Xunliang Cai, Jinsong Su. 36408-36426 [doi]
- GRASP: Graph-Reasoning Aided Survey Planning for High-Fidelity Related Work GenerationHaoming Li, Jessica Ouyang 0001. 36427-36449 [doi]
- Benchmarking Agentic Newswriting via Journalistic WorkflowsYen-Che Chien, Kuang-Da Wang, Wei-Yao Wang, Wen-Chih Peng. 36450-36463 [doi]
- Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized RefinementDaeun Lee 0001, Jaehong Yoon, Jaemin Cho 0001, Mohit Bansal. 36464-36489 [doi]
- Switching Heads and Softening Tokens: Turnkey Solutions to Visually Grounded Document QAXiming Wen, Wenbo Li, Sudipta Paul, Yashas Malur Saidutta, Kalpa Gunaratna, Srinivas Chappidi. 36490-36503 [doi]
- HTMuon: Improving Muon via Heavy-Tailed Spectral CorrectionTianyu Pang, Yujie Fang, Zihang Liu, Shenyang Deng, Lei Hsiung, Shuhua Yu, Yaoqing Yang 0002. 36504-36535 [doi]
- Can Large Language Models Effectively Support Decision-Making in Sudden Emergencies?Mengna Zhu, Jibing Wu, Lihua Liu 0002, Yuran Gong, Yang Hao, Yachao Fu, Mao Wang, Lei Hou 0001, Juanzi Li. 36536-36558 [doi]
- J-Shuwa: A Large-Scale Web-Collected Japanese Sign Language-Japanese Parallel CorpusJunwen Mo, MinhDuc Vo, Noriki Nishida, Shin'ichi Satoh 0001, Hideki Nakayama. 36559-36574 [doi]
- Hallucinations as Orthogonal Noise: Inference-Time Manifold Alignment via Dynamic Contextual OrthogonalizationMingkuan Zhao, Wentao Hu, Tianchen Huang, Yuheng Min, Suquan Chen, Yide Gao, Yanbo Zhai, Shuangyong Song, Xuelong Li 0001. 36575-36586 [doi]
- ConvX: A Lightweight Converter to Bridge Indexed Dense Representations and Large Language Models for Retrieval-Augmented GenerationBonggeun Choi, Keunha Kim, Junho Han, Youngjoong Ko. 36587-36599 [doi]
- Resonant Context Anchoring: Decoupling Attention Routing and Signal Gain at Inference TimeMingkuan Zhao, Yide Gao, Wentao Hu, Suquan Chen, Tianchen Huang, Zhenhua An, Zetao Chang, Xiayu Sun, Yuheng Min. 36600-36611 [doi]
- S2H-DPO: Hardness-Aware Preference Optimization for Vision-Language ModelsNitish Shukla, Surgan Jandial, Arun Ross. 36612-36623 [doi]
- Dr. Assistant: Enhancing Clinical Diagnostic Inquiry via Structured Diagnostic Reasoning Data and Reinforcement LearningYue Guo, Fanfu Wang, Jianwei Lv, Xincheng Shi, Yuchen Li, Youya Wang, Yunsheng Zeng, Yujing Liu, Yunhao Qiao, Gen Li, Junfeng Wang, Bo Yuan. 36624-36658 [doi]
- FigSIM: A Dataset for Fine-grained Suicide Severity and Figurative Language in Suicide MemesLiuliu Chen, Elise R. Carrotte, Brian E. Chapman, Jo Robinson, Mike Conway. 36659-36675 [doi]
- Activation Steering for Chain-of-Thought CompressionSeyedarmin Azizi, Erfan Baghaei Potraghloo, Souvik Kundu 0002, Massoud Pedram. 36676-36687 [doi]
- Decomposed Prompting Does Not Fix Knowledge Gaps, But Helps Models Say "I Don't Know"Dhruv Madhwal, Lyuxin David Zhang, Dan Roth 0001, Tomer Wolfson, Vivek Gupta 0001. 36688-36710 [doi]
- VisTW: Benchmarking Vision-Language Models for Taiwanese Mandarin in TaiwanZhi Rui Tam, Yung-Yu Shih, Yen-Wei Lee, Ya-Ting Pai, Wen-Yu Chang, Yun-Nung Chen. 36711-36756 [doi]
- PsyChain: A Collaborative Chain-of-Agents Framework for Generating Personalized and Professional Counseling DialoguesYi Feng, Zijie Yang, Chen Zhang, Wenxuan Zhang, Dongming Zhang, Liping Jing, Jian Yu 0001. 36757-36791 [doi]
- Breaking the Autoregressive Chain: Hyper-Parallel Decoding for Efficient LLM-Based Attribute Value ExtractionTheodore Glavas, Nikhita Vedula, Dushyanta Dhyani, Yilun Zhu 0003, Shervin Malmasi. 36792-36808 [doi]
- On the Editability of Delta Parameters in Post-Trained ModelsQiaoyu Tang, Le Yu, Bowen Yu 0002, Hongyu Lin, Keming Lu, Yaojie Lu 0001, Xianpei Han, Le Sun 0001. 36809-36824 [doi]
- Reasoning with Memory: Adaptive Information Management for Retrieval-Augmented GenerationHieu Man, Ro-ee Tal, Abhishek Kumar, Jaejin Cho, Benjamin Hsu. 36825-36841 [doi]
- LiCoMemory: Lightweight and Cognitive Agentic Memory for Efficient Long-Term ReasoningZhengjun Huang, Zhoujin Tian, Qintian Guo, Fangyuan Zhang 0001, Yingli Zhou, Di Jiang, Zeying Xie, Xiaofang Zhou 0001. 36842-36858 [doi]
- Multimodal Item Scoring for Natural Language Recommendation via Gaussian Process Regression with LLM Relevance JudgmentsYifan Simon Liu, Qianfeng Wen, Jiazhou Liang, Mark Zhao, Justin Cui, Anton Korikov, Armin Toroghi, Junyoung Kim, Scott Sanner. 36859-36876 [doi]
- Dialectic-Med: Mitigating Diagnostic Hallucinations via Counterfactual Adversarial Multi-Agent DebateZhixiang Lu, Jionglong Su. 36877-36894 [doi]
- EPIR: Capturing Promoting and Inhibiting Relationships between EventsBowen Dong 0004, Wenjun Wang 0002, Xueli Liu, Quanlin Qiu. 36895-36910 [doi]
- EULoInf: Efficient Hessian-Free Entropy Based Uncertainty-Aware Data Influence ApproximationRunxin Cai, Jingtan Wang 0001, Bryan Kian Hsiang Low. 36911-36928 [doi]
- CodeRise: Bootstrapping LLMs for Ultra Low-Resource Programming Languages via Progressive Self-Refinement CurriculumTengfei Wen, Xuanang Chen, Ben He 0001, Xiaoliang Cong, Le Sun 0001. 36929-36942 [doi]
- What Tokens Truly Matter? The Logit Conflation Problem in LLM SamplingPinlong Zhao, Huijun Tang, Pengfei Jiao, Mengyang Li 0001. 36943-36961 [doi]
- Bears, all bears, and some bears. Language Constraints on Language Models' Inductive InferencesSriram Padmanabhan, Siyuan Song, Kanishka Misra. 36962-36978 [doi]
- B-APO: Bias-Targeted Adversarial Preference Optimization for Debiasing Multimodal Large Language ModelsPinlong Zhao, Zike Ding, Zengshu Ye, Zhou Zhaoting. 36979-36999 [doi]
- On the Fallacy of Global Token Perplexity in Spoken Language Model EvaluationChan-Jan Hsu, Liang-Hsuan Tseng, Yi-Cheng Lin, Yen-Chun Kuo, Ju-Chieh Chou, Kai-Wei Chang 0001, Hung-yi Lee, Carlos Busso. 37000-37020 [doi]
- Modeling and Solving Stable Matching under Probabilistic Preferences with Large Language ModelsYuqi Kong, Shiyu Liu, Jiaxu Li, Hongtao Liu 0007, Qi Qi 0003, Weiran Shen. 37021-37033 [doi]
- XQ-MEval: A Dataset with Cross-lingual Parallel Quality for Benchmarking Translation MetricsJingxuan Liu, Zhi Qu 0001, Jin Tei, Hidetaka Kamigaito, Lemao Liu, Taro Watanabe. 37034-37052 [doi]
- Faithfulness vs. Safety: Evaluating LLM Behavior Under Counterfactual Medical EvidenceKaijie Mo, Siddhartha Venkatayogi, Chantal Shaib, Ramez Kouzy, Wei Xu 0004, Byron C. Wallace, Junyi Jessy Li. 37053-37081 [doi]
- Your LLM Agents are Temporally Blind: The Misalignment Between Tool Use Decisions and Human Time PerceptionYize Cheng, Arshia Soltani Moakhar, Chenrui Fan, Parsa Hosseini, Kazem Faghih, Zahra Sodagar, Wenxiao Wang 0002, Soheil Feizi. 37082-37104 [doi]
- How Do LLMs "Trust" Unknown Knowledge? An Unknown Knowledge Based Jailbreak AttackYixiao Huang 0009, Lan Zhang, Chaoran Wang. 37105-37124 [doi]
- ToolSafe: Enhancing Tool Invocation Safety of LLM-based agents via Proactive Step-level Guardrail and FeedbackYutao Mou, Zhangchi Xue, Lijun Li, Peiyang Liu, Shikun Zhang, Wei Ye, Jing Shao. 37125-37153 [doi]
- A Survey of Large Models in SportsYichen Xu 0003, Jianzhe Ma, Chuhan Wang, Zhonghao Cao, Liangyu Chen 0008, Wenxuan Wang 0001, Qin Jin. 37154-37189 [doi]
- SafetyALFRED: Evaluating Safety-Conscious Planning of Vision Language ModelsJosue Torres-Fonseca, Naihao Deng, Yinpei Dai, Shane Storks, Yichi Zhang 0001, Rada Mihalcea, Casey Kennington, Joyce Chai. 37190-37211 [doi]
- Towards Unified Multimodal Large Language Models: A surveyXu Ma 0005, Yitian Zhang, Yun Fu 0001. 37212-37230 [doi]
- µsicalnote Something Just Like TRuST µsicalnote *: Toxicity Recognition of Span and TargetBerk Atil, Namrata Sureddy, Rebecca J. Passonneau. 37231-37251 [doi]
- Synergizing Stylometrics with Semantics: Dual-Path Framework for LLM Detection and AttributionXingyu Lu 0002, Yumeng Ma, Xiang Zhou, Shengli Gan, Guiying Deng, Yang Wen, Yanbing Liu 0004. 37252-37265 [doi]
- Enhancing Multilingual Reasoning via Steerable Model MergingZhuoran Li 0001, Rui Xu, Jian Yang, Junnan Liu, Zhijun Chen, Qianren Mao, Hongcheng Guo, Jiaheng Liu, Likang Xiao, Ming Li, Xiaojie Wang. 37266-37277 [doi]
- Adaptive Backtracking for Privacy Protection in Large Language ModelsZhihao Yao 0008, Yuxuan Gu 0004, Xiachong Feng, Weitao Ma, Bo Li, Xiaocheng Feng, Bing Qin 0001. 37278-37298 [doi]
- SemPA: Improving Sentence Embeddings of Large Language Models through Semantic Preference AlignmentZiyang Chen, Zhenxuan Huang, Yile Wang, Weiqin Wang, Lu Yin, Hui Huang. 37299-37312 [doi]
- Interpretability from the Ground Up: Stakeholder-Centric Design of Automated Scoring in Educational AssessmentsYunsung Kim, Michael Hardy, Joseph Tey, Candace Thille, Christopher Piech. 37313-37328 [doi]
- DANCE: Diversity-attended Dynamic Caching with Asymmetric Quantization for Test-time Adaptation of Vision-Language ModelsShunge Zou, Changhu Wang, Wei Ju 0001, Ziyue Qiao, Xiao Luo 0001. 37329-37343 [doi]
- How to Set the Learning Rate for Large-Scale Pre-training?Yunhua Zhou, Shuhao Xing, Junhao Huang, Xipeng Qiu, Qipeng Guo. 37344-37361 [doi]
- Evaluating Large Vision Language Models on Bangla Medical Visual Question AnsweringRafid Ahmed, Intesar Tahmid, Mir Sazzat Hossain, Tasnimul Hossain Tomal, Md Mahir Jawad, Anam Borhan Uddin, Md Fahim, Md Farhad Alam Bhuiyan. 37362-37378 [doi]
- SIV-Bench: A Video Benchmark for Social Interaction Understanding and ReasoningFanqi Kong, Weiqin Zu, Xinyu Chen, Yaodong Yang 0001, Song Chun Zhu, Xue Feng. 37379-37403 [doi]
- No One Fits All: From Fixed Prompting to Learned Routing in Multilingual LLMsWei-Chi Wu, Sheng-Lun Wei, Hen-Hsen Huang, Hsin-Hsi Chen. 37404-37423 [doi]
- Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math ReasoningYongcan Yu, Lingxiao He, Jian Liang 0001, Kuangpu Guo, Meng Wang 0001, Qianlong Xie, Xingxing Wang, Ran He 0001. 37424-37436 [doi]
- Steering LLM Thinking with Budget GuidanceJunyan Li, Wenshuo Zhao, Yang Zhang 0001, Chuang Gan 0001. 37437-37451 [doi]
- Distilling Long-CoT Reasoning through Collaborative Step-wise Multi-Teacher DecodingTaewon Yun, Jisu Shin 0001, Jeonghwan Choi, Seunghwan Bang 0002, Hwanjun Song. 37452-37468 [doi]
- Adversarial Yet Cooperative: Multi-Perspective Reasoning in Retrieved-Augmented Language ModelsCan Xu 0005, Lingyong Yan, Jiayi Wu 0001, Haosen Wang, Shuaiqiang Wang, Yuchen Li 0006, Jizhou Huang, Dawei Yin 0001, Xiang Li 0067. 37469-37480 [doi]
- PyraMathBench: Evaluating and Improving Mathematical Capability in Large Language ModelsZetian Ouyang, Linlin Wang, Gerard de Melo, Liang He 0001. 37481-37511 [doi]
- D2PCM: A Multi-Turn Dialogue Dataset with Personalized Contextual MemoryZhe Yang, Yi Huang 0017, Yaqin Chen, Chunyang Gao, Jingyu Yao, Junlan Feng. 37512-37529 [doi]
- MTP-RL: Acceleration of Reinforcement Learning Rollouts with Policy-Aligned Multi-Token PredictionKe Wang 0001, Aohan Zeng, Zhengxiao Du, Yuxuan Hu, Bohan Zhang, Xinyi Wang, Jie Tang 0001, Jing Zhang 0001. 37530-37542 [doi]
- ReflexiCoder: Teaching Large Language Models to Self-Reflect on Generated Code and Self-Correct It via Reinforcement LearningJuyong Jiang, Jiasi Shen 0001, Sunghun Kim 0001, Kang Min Yoo, Jeonghoon Kim, Sungju Kim. 37543-37562 [doi]
- TRAC: Token-level Reward Assignment for Coherent Abstractive SummarizationXuanqi Chen, Ziying Rong, Xinfeng Liao, Lianxi Wang 0001, Ying Gao, Shengyi Jiang. 37563-37578 [doi]
- Planning Beyond Text: Graph-based Reasoning for Complex Narrative GenerationHanwen Gu, Chao Guo 0006, Junle Wang, Wenda Xie, Yisheng Lv. 37579-37610 [doi]
- Enrich, Aggregate, and Generate: Three-stage Biomedical Data-to-Text Generation Using Large Language Models in Low-resource ScenariosYupian Lin, Guangya Yu, Yuang Bian, Cheng Yuan, Hui Luo, Tong Ruan. 37611-37622 [doi]
- HiCoLoRA: Addressing Context-Prompt Misalignment via Hierarchical Collaborative LoRA for Zero-Shot DSTShuyu Zhang, Yifan Wei, Xinru Wang, Yanmin Zhu, Yangfan He, Yixuan Weng, Yujie Liu, Bin Li 0083. 37623-37648 [doi]
- From Conversation to Evaluation: Benchmarking LLMs on Development Knowledge via SimpleDevQAJing Zhang 0170, Lianghong Guo, Yanlin Wang 0001, Terry Yue Zhuo, Yong Wang 0002, Mingwei Liu 0002, Jiachi Chen, Ensheng Shi, Yuchi Ma, Hongyu Zhang 0002, Zibin Zheng. 37649-37663 [doi]
- LLEOT: A Privacy-Enhancing Offsite Tuning Framework via Loss Landscape ElevationJin Zhong 0001, Jinglin Liang 0001, Tongtong Yang, Zijian Xie, Shuangping Huang, Hanlin Gu. 37664-37683 [doi]
- Beyond Compromise: Pareto-Lenient Consensus for Efficient Multi-Preference LLM AlignmentRenxuan Tan, Rongpeng Li, Zhifeng Zhao, Honggang Zhang 0001. 37684-37705 [doi]
- HSS-Synth: Humanities and Social Sciences Data Synthesis for LLMsRu Peng, Tianyu Zhao, Xijun Gu, Zhiting Fan, Haokai Xu, Jinyang Zhang, Yawen Zeng, Yihong Zhuang, Kexin Yang 0002, Junyang Lin, Dayiheng Liu, Junbo Zhao 0002. 37706-37732 [doi]
- LLMRouterBench: A Massive Benchmark and Unified Framework for LLM RoutingHao Li 0069, Yiqun Zhang, Zhaoyan Guo, Chenxu Wang, Shengji Tang, Qiaosheng Zhang 0002, Yang Chen, Biqing Qi, Peng Ye 0006, Lei Bai 0001, Zhen Wang 0004, Shuyue Hu. 37733-37754 [doi]
- CEMT: Controllable Element-Oriented Machine Translation via Structured Linguistic ReasoningLingling Shi, Haoyu Jin, Ruiyu Fang, Shuangyong Song, Jinsong Su, Yongxiang Li, Xuelong Li 0001. 37755-37781 [doi]
- Orchestrating Tokens and Sequences: Dynamic Hybrid Policy Optimization for RLVRZijun Min, Bingshuai Liu, Ante Wang, Long Zhang, Anxiang Zeng, Haibo Zhang, Jinsong Su. 37782-37795 [doi]
- Seeing Isn't Believing: Mitigating Belief Inertia via Active Intervention in Embodied AgentsHanlin Wang, Chak Tou Leong, Jian Wang 0054, Wenjie Li 0002. 37796-37815 [doi]
- AlgBench: To What Extent Do Large Reasoning Models Understand Algorithms?Henan Sun, Kaichi Yu, Yuyao Wang, Bowen Liu, Xunkai Li, Rong-Hua Li 0001, Nuo Chen, Jia Li. 37816-37838 [doi]
- A Learnable Skill Combination Strategy for Multi-task Learning in Natural Language UnderstandingZhe Yang, Yi Huang 0017, Yaqin Chen, Mengfei Guo, Xiaoting Wu, Junlan Feng. 37839-37845 [doi]
- CoopValue: Revealing LLM Value Preferences Through Multi-Agent CooperationZee Hen Tang, Mi-Yen Yeh. 37846-37885 [doi]
- QUARTZ: Quantile-Aware Routing and Queueing for TTFT SLOs in LLM ServingZhiPeng Liu, Yifan Zheng, Fanqi Kong, Ziming Zhao 0008. 37886-37896 [doi]
- MPTc-Bench: Measuring Cross-market Generative Ability of Vision-Language Models via Movie Poster TranscreationYouyuan Lin, Yuan Li, Yahan Yu, Fei Cheng 0002, Shin'ya Nishida, Chenhui Chu. 37897-37913 [doi]
- Counterfactual Fairness Evaluation of LLM-Based Contact Center Agent Quality Assurance SystemKawin Mayilvaghanan, Siddhant Gupta, Ayush Kumar. 37914-37952 [doi]
- Masked Text-to-Audio Flow-Matching and Reward Feedback OptimizationRongjie Huang 0001, Dongchao Yang, Wenxiang Guo, Huadai Liu, Xize Cheng, Zehan Wang 0001, Zhou Zhao 0001, Xixin Wu, Helen M. Meng. 37953-37966 [doi]
- Orthogonal Representation Editing: Decoupling Semantic Entanglement in Batch Knowledge Editing of LLMsWenhao Yu, Zhicong Lu, Bo Lv, Fangyin Ma, Kaiwen Wei, Shihao Yang, Nayu Liu. 37967-37979 [doi]
- Debiasing LLMs by Masking Unfairness-Driving Attention HeadsTingxu Han, Wei Song, Ziqi Ding, Ziming Li, Chunrong Fang, Yuekang Li, Dongfang Liu, Zhenyu Chen 0001, Zhenting Wang. 37980-37992 [doi]
- Single-Agent Generation Surpasses Multi-Agent Systems in Semantic DiversityCui Encheng, Shaowen Peng, Kazuhiro Ito, Jinsha Xu, Shohei Hisada, Shoko Wakamiya, Eiji Aramaki. 37993-38008 [doi]
- Med-SRAF: A Multi-Agent Framework for Medical Reasoning via Semantic Routing and Agentic FusionXiao Li, Zhuo Chen, Jun Xia 0001, Hongxin Xiang, Chao Wang, Wenjie Du 0003, Yang Wang 0015. 38009-38029 [doi]
- R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement LearningQingfei Zhao, Ruobing Wang, Dingling Xu, Daren Zha, Bowen Ma, Zhichun Wang, Shijie Jia 0001, Limin Liu, Xin Wang. 38030-38046 [doi]
- Decoupled Reasoning with Implicit Fact Tokens (DRIFT): A Dual-Model Framework for Efficient Long-Context InferenceWenxuan Xie, Xuhong Wang. 38047-38067 [doi]
- AnchorAlign: A Novel Anchor Alignment-enhanced Generative Method for Joint Named Entity Recognition and Relation ExtractionXiaolong Weng, Yuanyun Zhou, Boyu Qiu, Zehua Wang, Ying Xiong, Buzhou Tang. 38068-38081 [doi]
- Why Can Distillation Work with Limited Resources? A Systematic StudyXiao Hu, Xingyu Lu, Liyuan Mao, Yifan Zhang 0004, Tianke Zhang, Bin Wen, Fan Yang 0094, Tingting Gao, Guorui Zhou. 38082-38100 [doi]
- Autoregressive Semantic Visual Reconstruction Helps VLMs Understand BetterDianyi Wang, Wei Song, Yikun Wang, Siyuan Wang, Kaicheng Yu, Zhongyu Wei, Jiaqi Wang. 38101-38115 [doi]
- MSCode: Advancing Human Motion-Language Understanding via Modality-Shared CodebookHaoyu Shi, Huaiwen Zhang. 38116-38132 [doi]
- RAG over Tables: Hierarchical Memory Index, Multi-Stage Retrieval, and BenchmarkingJiaru Zou, Dongqi Fu, Sirui Chen, Xinrui He, Zihao Li 0006, Yada Zhu, Jiawei Han 0001, Jingrui He. 38133-38152 [doi]
- CoTEvol: Self-Evolving Chain-of-Thoughts for Data Synthesis in Mathematical ReasoningZhuo Wang, Zhuo Zhang 0007, Yafu Li, Yu Cheng 0001, Lizhen Qu, Zenglin Xu. 38153-38173 [doi]
- Feedback Is The Key for Automated Survey GenerationTianyi Xu, Zhe Zhao 0008, Tianshuo Wei, Yiqun Kou, Liuliu Han, Ye Wei. 38174-38195 [doi]
- Sentient Agent as a Judge: Evaluating Higher-Order Social Cognition in Large Language ModelsBang Zhang, Ruotian Ma, Qingxuan Jiang, Peisong Wang, Jiaqi Chen, Zheng Xie, Xingyu Chen, Yue Wang 0039, Fanghua Ye 0004, Jian Li, Yifan Yang, Zhaopeng Tu, Xiaolong Li. 38196-38224 [doi]
- Alignment Data Map for Efficient Preference Data Selection and DiagnosisSeohyeong Lee, Eunwon Kim, Hwaran Lee, Buru Chang. 38225-38241 [doi]
- Fine-Grained Detection of Context-Grounded Hallucinations Using LLMsYehonatan Peisakhovsky, Zorik Gekhman, Yosi Mass, Liat Ein-Dor, Roi Reichart. 38242-38266 [doi]
- When Reviews Disagree: Fine-Grained Contradiction Analysis in Scientific Peer ReviewsSandeep Kumar 0009, Yash Kamdar, Abid Hossain, Bharti Kumari, Tanik Saikh, Asif Ekbal. 38267-38290 [doi]
- One Script Instead of Hundreds? On Pretraining Romanized Encoder Language ModelsBenedikt Ebing, Lennart Keller, Goran Glavas. 38291-38307 [doi]
- Relaxing the Constraints: A Dual-Importance Projection Mechanism for Lifelong Model EditingZhenghai Chen, Senbin Xu, Jiaxi Tan, Xinhua Wu, Yan Zhang 0109, Xiawu Zheng, Shengchuan Zhang, Ke Li 0015, Sicheng Zhao, Liujuan Cao, Rongrong Ji. 38308-38333 [doi]
- Not all ANIMALs are equal: metaphorical framing through source domains and semantic framesYulia Otmakhova 0001, Matteo Guida, Lea Frermann. 38334-38355 [doi]
- DualFact+: A Multimodal Fact Verification Framework for Procedural Video CaptioningCennet Oguz, Yasser Hamidullah, Josef van Genabith, Simon Ostermann 0002. 38356-38371 [doi]
- From Scaffolding to Assimilation: Progressive Structural Internalization for Format-Constrained Creative Text GenerationWenhao Li 0003, Yuwei Yang, Xiaoqing Wu, Yufeng Han, Cunliang Kong, Yuzhuo Bai, Xin Cong, Maosong Sun 0001. 38372-38389 [doi]
- Hierarchical Visual Agent: Managing Contexts in Joint Image-Text Space for Advanced Chart ReasoningQihua Dong, Ruozhen He, Junwen Chen, Yizhou Wang 0006, Xu Ma 0005, Songyao Jiang, Yun Fu 0001. 38390-38401 [doi]
- Semantic-Space Exploration and Exploitation in RLVR for LLM ReasoningFanding Huang, Guanbo Huang, Xiao Fan, Yi He, Xiao Liang, Xiao Chen, Qinting Jiang, Faisal Nadeem Khan, Jingyan Jiang, Zhi Wang. 38402-38449 [doi]
- Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache OptimizationJiantong Jiang, Peiyu Yang, Rui Zhang, Feng Liu. 38450-38476 [doi]
- A Counterfactual Explanation Framework for Retrieval ModelsBhavik Chandna, Procheta Sen. 38477-38490 [doi]
- Teaching Language Models to Forecast Research Success Through Comparative Idea EvaluationSrujan P. Mule, Aniketh Garikaparthi, Manasi Patwardhan 0001. 38491-38529 [doi]
- Social Welfare Function Leaderboard: On the Emergence of LLM Agents as the Welfare DictatorZhengliang Shi, Ruotian Ma, Jen-tse Huang 0001, Xinbei Ma, Xingyu Chen, Mengru Wang, Qu Yang, Yue Wang 0039, Fanghua Ye 0004, Ziyang Chen, Shanyi Wang, Cixing Li, Wenxuan Wang 0001, Zhaopeng Tu, Xiaolong Li, Zhaochun Ren, Liefeng Bo. 38530-38551 [doi]
- From Individual Excellence to Collective Sustainability: Seeking Strategic Equilibrium in Proactive Multi-Agent TeamsTong Zhang 0005, Yang Wu, Yufei Shi, Rujing Yao, Zhuoren Jiang, Xiaozhong Liu 0001. 38552-38565 [doi]
- Lost in the Prompt Order: Revealing the Limitations of Causal Attention in Language ModelsHyunjong Ok, Jaeho Lee 0001. 38566-38587 [doi]
- SR-RAG: Verifiable Multi-Hop Reasoning via On-the-fly Symbolic Graph ConstructionZehua Wang, Zhaojin Zhang, Boyu Qiu, Xiaolong Weng, Ying Xiong, Buzhou Tang, Min Zhang. 38588-38606 [doi]
- KnowDR-REC: Auditing Knowledge-Conditioned Visual Grounding in Referring Expression ComprehensionGuanghao Jin, Jingpei Wu, Tianpei Guo, Yiyi Niu, Weidong Zhou, Linyi Yang, Guoyang Liu. 38607-38629 [doi]
- Agent for Numerical Data Retrieval and Understanding by Code Generation and Multimodal ReasoningFlorian Baud, Feda AlMuhisen, Dorian Midou. 38630-38653 [doi]
- Cause-CSD: A Challenge Multimodal Conversational Stance Cause Detection Dataset and Effective MethodFuqiang Niu, Bowen Zhang 0005, Junting Zhu, Qing Liao, Genan Dai, Hu Huang 0009. 38654-38666 [doi]
- The Sparse Frontier: Sparse Attention Trade-offs in Transformer LLMsPiotr Nawrot, Jianing Li, Renjie Huang, Sebastian Ruder, Kelly Marchisio, Edoardo M. Ponti. 38667-38701 [doi]
- Uncertainty-Aware Contrastive Sentence Embedding With Local Context Representation for Text ClassificationHan Liu 0002, Jiaqing Zhan, Zhichao Chen, Qin Zhang 0011. 38702-38716 [doi]
- ZipVoice-Dialog: Non-Autoregressive Spoken Dialogue Generation with Flow MatchingHan Zhu 0004, Wei Kang 0006, Liyong Guo, Zengwei Yao, Fangjun Kuang, Weiji Zhuang, Zhaoqing Li, Zhifeng Han, Dong Zhang, Xin Zhang 0155, Xingchen Song, Lingxuan Ye, Long Lin, Daniel Povey. 38717-38729 [doi]
- All Prompts Are Created Equal? Evaluating Robustness of LLM Judges Against Non-Adversarial Prompt VariationsSavita Bhat, Vasudeva Varma. 38730-38745 [doi]
- Thinking Traps in Long Chain-of-Thought: A Measurable Study and Trap-Aware Adaptive RestartKang Chen, Fan Yu, Junjie Nian, Sihan Zhao, Zhuoka Feng, Zijun Yao 0002, Heng Wang, Minshen Yu, Yixin Cao 0002. 38746-38760 [doi]
- Instruction-Guided Poetry Generation in Arabic and Its DialectsAbdelrahman Boda Sadallah, Kareem Ashraf Elozeiri, Mervat Abassy, Rania Elbadry, Mohamed Anwar, Abed Alhakim Freihat, Preslav Nakov, Fajri Koto. 38761-38780 [doi]
- Agentic Verification for Ambiguous Query DisambiguationYoungwon Lee 0003, Seung-won Hwang, Ruofan Wu, Feng Yan 0001, Danmei Xu, Moutasem Akkad, Zhewei Yao, Yuxiong He. 38781-38796 [doi]
- DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language ModelsHao Yang, Jin Wang 0008, Xuejie Zhang 0002. 38797-38818 [doi]
- From Tasks to Teams: A Risk-First Evaluation Framework for Multi-Agent LLM Systems in FinanceZichen Chen, Jianda Chen, Jiaao Chen, Misha Sra. 38819-38857 [doi]
- Parametric Knowledge is Not All You Need: Toward Honest Large Language Models via Retrieval of Pretraining DataChristopher Adrian Kusuma, Muhammad Reza Qorib, Hwee Tou Ng. 38858-38871 [doi]
- TIME: Temporally Intelligent Meta-reasoning Engine for Context-Triggered Explicit ReasoningSusmit Das. 38872-38906 [doi]
- Omni-R1: Towards the Unified Generative Paradigm for Multimodal ReasoningDongjie Cheng, Yongqi Li 0001, Zhixin Ma 0001, Hongru Cai, Yupeng Hu 0003, Wenjie Wang 0007, Liqiang Nie, Wenjie Li 0002. 38907-38924 [doi]
- Time-for-Accuracy: Formalizing Chain-of-Thought as an Expansion of Logical DepthYue Wang 0029, Zhi Zhang, Wang Xi, Chengjie Sun, Lili Shan, Bingquan Liu. 38925-38941 [doi]
- DiffCoT: Diffusion-styled Chain-of-Thought Reasoning in LLMsShidong Cao, Hongzhan Lin 0001, Yuxuan Gu 0004, Ziyang Luo, Jing Ma 0004. 38942-38957 [doi]
- System-Mediated Attention Imbalances Make Vision-Language Models Say YesTsan Tsai Chan, Varsha Suresh, Anisha Saha, Michael Hahn 0001, Vera Demberg. 38958-38979 [doi]
- SCURank: Ranking Multiple Candidate Summaries with Summary Content Units for Enhanced SummarizationBo-Jyun Wang, Ying-Jia Lin, Hung-Yu Kao. 38980-38997 [doi]
- Valid Necessary: Diagnosing Latent Inefficiency in Chain-of-ThoughtDaeYeop Lee, Hwanjo Yu. 38998-39014 [doi]
- CausalGaze: Unveiling Hallucinations via Counterfactual Graph Intervention in Large Language ModelsLinggang Kong, Lei Wu, YunLong Zhang, Xiaofeng Zhong, Zhen Wang 0084, YongJie Wang, Yao Pan. 39015-39028 [doi]
- Improved Policy Optimization for Mixture-of-Experts Models: Importance Sampling and Rewarding from an Expert-Centric PerspectiveYining Qian, Jinpeng Li, Fei Mi, Lifeng Shang, Xiang Zhang. 39029-39038 [doi]
- From What Is Said to Why It Is Framed: Intent-Aware News Video UnderstandingXiangzheng Kong, Minnan Luo, Wenya Wang, Jiaying Wu, Zhi Zeng 0001, Guang Dai. 39039-39050 [doi]
- H-MAS: Hierarchical Multi-Agent Scheduling for Multi-Tenant LLM ServingYuhan Liu 0014, Cong Xu 0001, Qi Jia 0004, Yihua Wang, Feiyu Chen 0005, Liang Jin, Lu Liu 0009, Yaqian Zhao, Yuting Ding, Xiang Li 0064. 39051-39071 [doi]
- EvoMD-LLM: Learning the Language of Species Evolution in Reactive Molecular DynamicsZhichen Tang, Zhengzheng Dang, Yulin Chen, Jixin Wu, Haiwen Li, Yanming Wang. 39072-39088 [doi]
- Do Image-Text Metrics Respect Semantic Invariances?Amit Agarwal, Hitesh Laxmichand Patel, Meizhu Liu, Jyotika Singh, Karan Dua, Hansa Meghwani, Matthew Rowe 0001, Michael Avendi, Yassi Abbasi, Tao Sheng, Sujith Ravi, Dan Roth 0001. 39089-39116 [doi]
- Reasoning in the Dark: Interleaved Vision-Text Reasoning in Latent SpaceChao Chen, Zhixin Ma 0001, Yongqi Li 0001, Yupeng Hu 0003, Yinwei Wei, Wenjie Li 0002, Liqiang Nie. 39117-39129 [doi]
- Hail to the Thief: Exploring Attacks and Defenses in Decentralised GRPONikolay Blagoev, Oguzhan Ersoy, Lydia Y. Chen. 39130-39148 [doi]
- SocraticKG: Knowledge Graph Construction via QA-Driven Fact ExtractionSanghyeok Choi, Woosang Jeon, Kyuseok Yang, TaeHyeong Kim. 39149-39169 [doi]
- GROLE: Instance-Level Group Relative Optimization for LoRA Experts in Incremental LearningYongyi Liao, Wencan Lai, Jun Fang, Jinjin Guo, Xiaohui Zhang, Zhiyuan Liu 0001, Chao Liu, Pengzhang Liu, Qixia Jiang. 39170-39182 [doi]
- SEARCH-R: Structured Entity-Aware Retrieval with Chain-of-Reasoning Navigator for Multi-hop Question AnsweringYuqing Fu, Yimin Deng, Wanyu Wang, Yuhao Wang 0006, Yejing Wang, Hongshi Liu, Yiqi Wang 0001, Xiao Han 0004, Maolin Wang 0001, Guoshuai Zhao, Yi Chang 0001, Xiangyu Zhao 0001. 39183-39196 [doi]
- Why Did Apple Fall: Evaluating Curiosity in Large Language ModelsHaoyu Wang, Sihang Jiang, Yuyan Chen, Yitong Wang, Xiaojun Meng, Jiansheng Wei, Yanghua Xiao. 39197-39215 [doi]
- Gaperon: A Peppered English-French Generative Language Model SuiteNathan Godey, Wissam Antoun, Rian Touchent, Rachel Bawden, Éric Villemonte de la Clergerie, Benoît Sagot, Djamé Seddah. 39216-39257 [doi]
- Rhombus: Incentivizing Coordination in Parallel Thinking through Reinforcement LearningZiyuan Nan, Qi Yi, Di Huang, Yutong Wu, Guanhua Huang, Xue Gong, Kejiao Li 0001, Yuhao Jiang, Chenchen Zhang, Zenan Xu, Xing Hu 0001, Bo Zhou. 39258-39270 [doi]
- FLARE: Task-Agnostic Embedding Model Evaluation via Normalizing FlowsJingzhou Jiang, Yixuan Tang 0001, Yi Yang 0042, Kar Yan Tam. 39271-39294 [doi]
- RCTEA: Richness-guided Co-training for Temporal Entity AlignmentJiayun Li, Wen-hua, Shiqi Fan, Fengmei Jin, Haiyang Jiang 0017, Xue Li 0001. 39295-39310 [doi]
- SQLAgent: Learning to Explore Before Generating as a Data EngineerWenjia Jiang, Yiwei Wang 0001, Boyan Han, Joey Tianyi Zhou, Chi Zhang 0007. 39311-39331 [doi]
- Reasoning Up the Instruction Ladder for Controllable Language ModelsZishuo Zheng, Vidhisha Balachandran, Chan Young Park, Faeze Brahman, Sachin Kumar 0009. 39332-39354 [doi]
- CRISP: Compressing Redundancy in Chain-of-Thought via Intrinsic Saliency PruningYangsong Lan, Hongliang Dai, Piji Li. 39355-39373 [doi]
- CascadeFix: Multi-Location Program Repair via Cascading Planning and GenerationHuan Zhang, Li Kuang, Yang Yang, Yilei Fang, Yingjie Xia. 39374-39385 [doi]
- DGPO: Beyond Pairwise Preferences with Directional Consistent Groupwise OptimizationMengyi Deng, Zhiwei Li, Xin Li, Tingyu Zhu, Yulan Yuan, Zhijiang Guo, Wei Wang. 39386-39401 [doi]
- Emergence and Localisation of Semantic Role Circuits in LLMsNura Aljaafari, Danilo S. Carvalho, André Freitas. 39402-39433 [doi]
- Thinking Economically: A Hierarchical Framework for Adaptive-Complexity Reasoning in LLMsYubo Gao 0001, Haotian Wu 0005, Hong Chen, Junquan Huang, Yibo Yan, Jungang Li, Zihao Dongfang, Sicheng Tao, Puay Siew Tan, Jie Zhang 0073, Xuming Hu. 39434-39444 [doi]
- Characterizing the Robustness of Black-Box LLM Planners Under Perturbed Observations with Adaptive Stress TestingNeeloy Chakraborty, John Pohovey, Melkior Ornik, Katherine Rose Driggs-Campbell. 39445-39475 [doi]
- ProMCP: Profiling Token Flows and Latency Costs in Model Context Protocol-Based LLM AgentsSumera Anjum, Weijian Zheng, Rajkumar Kettimuthu, Heng Fan 0001, Yunhe Feng. 39476-39487 [doi]
- Reducing Hallucinations in LLMs via Factuality-Aware Preference LearningSindhuja Chaduvula, Ahmed Y. Radwan, Azib Farooq, Yani Ioannou, Shaina Raza. 39488-39504 [doi]
- POLARIS: A Gödel Agent Framework for Small Language Models through Experience-Abstracted Policy RepairAditya Namdev Kakade, Vivek Srivastava, Shirish S. Karande. 39505-39537 [doi]
- PhaseMI: A Motivational Interviewing Dataset for Enhancing Phase Progression in LLM-based CounselingJina Kim, Myeongho Jeon, SooHyun Cho, Chae-Gyun Lim, Jongmin Lim, Haewon Min, Eunho Yang. 39538-39570 [doi]
- PsychEthicsBench: Evaluating Large Language Models Against Australian Mental Health EthicsYaling Shen, Stephanie Fong, Yiwen Jiang, Zimu Wang, Feilong Tang, Qingyang Xu, Xiangyu Zhao, Zhongxing Xu, Jiahe Liu, Jinpeng Hu, Dominic Dwyer, ZongYuan Ge. 39571-39589 [doi]
- DynamixSFT: Dynamic Mixture Optimization of Instruction Tuning CollectionsHaebin Shin, Lei Ji 0001, Xiao Liu 0029, Zhiwei Yu, Hyunwoo Yoo, Qi Chen 0009, Yeyun Gong. 39590-39603 [doi]
- BMAM: Brain-inspired Multi-Agent Memory FrameworkYang Li, Jiaxiang Liu, Yusong Wang 0003, Yujie Wu, Mingkun Xu. 39604-39626 [doi]
- Verified Critical Step Optimization for LLM AgentsMukai Li, Qingcheng Zeng, Tianqing Fang, Zhenwen Liang, Linfeng Song, Qi Liu, Haitao Mi, Dong Yu. 39627-39639 [doi]
- Nash-Pruned CredMAS: Dynamic Panel Pruning for VLM-MAS using Nash-based Selection and Doubly-Robust CreditsYijia Fan, Mingyu Liu, Jing Yang, Jian Wang 0100, Keze Wang, Jusheng Zhang. 39640-39650 [doi]
- SWE-Mutation: Can LLMs Generate Reliable Test Suites in Software Engineering?Yuxuan Sun, Yuze Zhao, Yufeng Wang, Yao Du, Zhiyuan Ma 0006, Jinbo Wang, Mengdi Zhang 0002, Kai Zhang 0038, Zhenya Huang. 39651-39674 [doi]
- STaD: Scaffolded Task Design for Identifying Compositional Skill Gaps in LLMsSungeun An, Swanand Ravindra Kadhe, Shailja Thakur, Chad DeLuca, Hima Patel. 39675-39705 [doi]
- PseudoSeer: a Search Engine for PseudocodeLevent Toksoz, Mukund Srinath, Gang Tan, C. Lee Giles. 39706-39716 [doi]
- Beyond Polarity: Continuous Affect-Enhanced Multimodal Aspect-Based Sentiment ClassificationLing-ang Meng, Tianyu Zhao, Dawei Song 0001, Jingxu Cao, Youhui Zuo. 39717-39727 [doi]
- Topology Matters: Measuring Memory Leakage in Multi-Agent LLMsJinbo Liu, Defu Cao, Yifei Wei, Tianyao Su, Yuan Liang, Yushun Dong, Yan Liu 0002, Yue Zhao 0016, Xiyang Hu. 39728-39746 [doi]
- Beyond 'Aha!': Toward Systematic Meta-Abilities Alignment in Large Reasoning ModelsZhiyuan Hu, Yibo Wang, Hanze Dong, Yuhui Xu, Amrita Saha, Caiming Xiong, Bryan Hooi, Junnan Li 0001. 39747-39764 [doi]
- Rewarding the Rare: Uniqueness-Aware RL for Creative Problem Solving in LLMsZhiyuan Hu, Yucheng Wang, Yufei He, Jiaying Wu, Yilun Zhao 0001, See-Kiong Ng, Cynthia Breazeal, Anh Tuan Luu, Hae Won Park 0001, Bryan Hooi. 39765-39790 [doi]
- Empathy Applicability Modeling for General Health QueriesShan Randhawa, Agha Ali Raza, Kentaro Toyama, Julie Hui, Mustafa Naseem. 39791-39818 [doi]
- Worldwide LiveVQA: Real-Time Visual Knowledge Seeking and Updating Across LanguagesXuanao Huang, Xingjia Liu, Zetong Zhou, Yuyang Peng, Yao Wan 0001, Dongping Chen. 39819-39894 [doi]
- HCRE: LLM-based Hierarchical Classification for Cross-Document Relation Extraction with a Prediction-then-Verification StrategyGuoqi Ma, Liang Zhang, Hongyao Tu, Hao Fu, Hui Li, Yujie Lin, Longyue Wang, Weihua Luo, Jinsong Su. 39895-39913 [doi]
- VLMGuard-R1: Proactive Safety Alignment for VLMs via Reasoning-Driven Prompt OptimizationMenglan Chen, Xianghe Pang, Jingjing Dong, Wenhao Wang 0002, Yaxin Du, Siheng Chen. 39914-39932 [doi]
- TinyAttack: Exploring Stylistic Vulnerabilities in Large Language ModelsMamta Mamta, Bogdan Grecu, Oana Cocarascu. 39933-39962 [doi]
- Human-Agent Collaborative Paper-to-Page CraftingQianli Ma 0008, Siyu Wang, Yilin Chen, Yinhao Tang, Yixiang Yang, Chang Guo, Bingjie Gao, Zhening Xing, Yanan Sun 0005, Zhipeng Zhang. 39963-39999 [doi]
- Skill Weaving: Efficient LLM Improvement via Modular SkillpacksZhuo Li, Guodong Du 0002, Zesheng Shi, Weiyang Guo, Weijun Yao, Yuan Zhou, Jiabo Zhang, Jing Li 0034. 40000-40023 [doi]
- Controlling What You Share: Assessing Language Model Adherence to Privacy PreferencesGuillem Ramírez, Alexandra Birch, Ivan Titov 0001. 40024-40049 [doi]
- GerAV: Towards New Heights in German Authorship Verification using Fine-Tuned LLMs on a New BenchmarkLotta Kiefer, Christoph Leiter, Sotaro Takeshita, Elena Schmidt, Steffen Eger. 40050-40069 [doi]
- LipoAgent: Coordinating Fine-Tuned LLM Agents for Safer Lipid DesignLeshu Li, An Lu, Haiyu Wang, Zhibin Feng, Conghui Duan, Qing Bao, Zongmin Zhao, Sai Qian Zhang. 40070-40081 [doi]
- PsychePass: Calibrating LLM Therapeutic Competence via Trajectory-Anchored TournamentsZhuang Chen 0002, Dazhen Wan, Zhangkai Zheng, Guanqun Bi, Xiyao Xiao, Binghang Li, Minlie Huang. 40082-40098 [doi]
- Generalization or Memorization? Multi-Agent vs. Baseline LLMs and AutoML Models for Tabular ClassificationAida sanatizadeh, Sorouralsadat Fatemi, Reza Mousavi, Ahmed Abbasi. 40099-40132 [doi]
- GanitLLM: Difficulty-Aware Bengali Mathematical Reasoning through Curriculum-GRPOShubhashis Roy Dipta, Khairul Mahbub, Nadia Najjar. 40133-40148 [doi]
- Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric ReasoningLongteng Guo, Yifan Wang, Pengkang Huo, Tailai Chen, Yuze Wu, Jing Liu 0001, Xinxin Zhu. 40149-40192 [doi]
- Multimodal Dual-Path Decoding for Medical Report GenerationJinghan Sun, Dong Wei 0004, Zhihong Zhu, Yuyang Xue, Steven McDonagh 0001, Xian Wu 0001. 40193-40204 [doi]
- PanoramaRAG: Enabling Consistent Global Topic Awareness in Graph-Based RAGDing Deng, Xiang Li, Yaqing Zhang, Meng Li, Xiting Wang. 40205-40217 [doi]
- Universally Empowering Zeroth-Order Optimization via Adaptive Layer-wise SamplingFei Wang 0032, Li Shen 0008, Liang Ding 0006, Chao Xue 0003, Ye Liu 0014, Changxing Ding. 40218-40239 [doi]
- Speculative Decoding with a Speculative VocabularyMiles Williams, Young D. Kwon, Rui Li 0052, Alexandros Kouris, Stylianos I. Venieris. 40240-40254 [doi]
- Entropy-Aware Reshaping of Reinforcement Signals for Multi-Answer ReasoningZhi Li, Huidan Xu, Zhen Hu, Yali Du 0001, Ying Liu. 40255-40268 [doi]
- TripTide: A Benchmark for Adaptive Travel Planning under DisruptionsPriyanshu Karmakar, Soumyabrata Chaudhuri, Shubhojit Mallick, Manish Gupta, Abhik Jana, Shreya Ghosh 0002. 40269-40292 [doi]
- Rational Synthesizers or Heuristic Followers? Analyzing LLMs in RAG-based Question-AnsweringAtharv Naphade. 40293-40311 [doi]
- IDEA: An Interpretable and Editable Decision-Making Framework for LLMs via Verbal-to-Numeric CalibrationYanji He, Yuxin Jiang, Yiwen Wu, Bo Huang 0017, Jiaheng Wei, Wei Wang 0011. 40312-40332 [doi]
- An Answer is just the Start: Related Insight Generation for Open-Ended Document-Grounded QASaransh Sharma, Pritika Ramu, Aparna Garimella, Koyel Mukherjee 0001. 40333-40355 [doi]
- Behavioral Consistency Validation for LLM Agents: An Analysis of Trading-Style Switching through Stock-Market SimulationZeping Li, Guancheng Wan, Keyang Chen, Yu Chen, Yiwen Zhao, Philip Torr 0001, Guangnan Ye, Zhenfei Yin, Hongfeng Chai. 40356-40370 [doi]
- NITI: Neural Plan Concretization for Incremental Execution, Bridging and Trigger Inference from Underspecified Human PoliciesAyan Banerjee, Shomrik Barua Banerjee, Sandeep Gupta. 40371-40384 [doi]
- Automatic Combination of Sample Selection Strategies for Few-Shot LearningBranislav Pecher, Ivan Srba, Mária Bieliková, Joaquin Vanschoren. 40385-40416 [doi]
- LearnAlign: Data Selection for LLM Reinforcement Learning with Improved Gradient AlignmentShipeng Li, Zhiqin Yang, Shikun Li, Xiaobo Xia, Hengyu Liu 0007, Xinghua Zhang 0001, Gaode Chen, Dong Fang, Ying Tai, Zhe Peng. 40417-40434 [doi]
- Auditing LLM Responses to Harmful Stereotypes Targeting Mental Health GroupsArka Dutta 0001, Rijul Magu, Sean Kim, Seohee Yoon, Munmun De Choudhury, Ashiqur R. KhudaBukhsh. 40435-40452 [doi]
- ROSCO-Omni: Multimodal LLM-Based Communication Understanding for Non- and Minimally-Speaking Autistic IndividualsSiddhant Bikram Shah, Kristina T. Johnson. 40453-40469 [doi]
- LQM: Linguistically Motivated Multidimensional Quality Metrics for Machine TranslationSamar Mohamed Magdy, Fakhraddin Alwajih, Abdellah El Mekki, Wesam El-Sayed, Muhammad Abdul-Mageed. 40470-40493 [doi]
- Many-Shot Scaling of In-Context Learning with Self-Generated DemonstrationsZhengyao Gu, Henry Peng Zou, Yankai Chen 0001, Aiwei Liu, Weizhi Zhang 0001, Philip S. Yu. 40494-40508 [doi]
- Small Data, Big Noise: Adversarial Training for Robust ParameterEfficient Fine-TuningEitan Cohen, Idan Simai, Uri Shaham 0001. 40509-40532 [doi]
- LLMs as Lab Engineers: A Benchmark for Analytical Method Lifecycle ManagementXiaoyi Chen, Mahsa Monshizadeh, Chaoqi Zhang, Jianjun Lang, Yang Wu, Genevieve Mortensen, Xiaozhong Liu 0001, Haixu Tang. 40533-40553 [doi]
- Too Fast, Too Shallow - LLMs, Including Reasoning LLMs, Are Unreliable Constitutional ReasonersReto Gubelmann, Peter Hongler. 40554-40572 [doi]
- JTPRO: A Joint Tool-Prompt Reflective Optimization Framework for Language AgentsSandip Ghoshal, Anshul Mittal, Jyotika Singh, Miguel Ballesteros, Weiyi Sun, Fang Tu, Shailender Singh, Yassine Benajiba, Fahad Shah, Sujeeth Bharadwaj, Sujith Ravi, Dan Roth 0001. 40573-40595 [doi]
- CANDICE: Agentic Causal Disentanglement with Class Conditional Knowledge Integration for Long Tailed Domain GeneralizationMidhat Urooj, Ayan Banerjee 0001, Sandeep K. S. Gupta. 40596-40624 [doi]
- AdaptEvolve: Improving Efficiency of Evolutionary AI Agents through Adaptive Model SelectionPretam Ray, Pratik Prabhanjan Brahma, Zicheng Liu 0001, Emad Barsoum. 40625-40633 [doi]
- OmniCode: A Benchmark for Evaluating Software Development AgentsAtharv Sonwane, Eng-Shen Tu, Wei-Chung Lu, Claas Beger, Carter Larsen, Debjit Dhar, Simon Alford, Rachel Chen, Ronit Pattanayak, Tuan Anh Dang, Guohao Chen, Gloria Geng, Kevin Ellis, Saikat Dutta 0001. 40634-40661 [doi]
- Supplement Generation Training for Enhancing Agentic Task PerformanceYoung-Min Cho, Daniele Bonadiman, Divya Bhargavi, Tamer Alkhouli, Salvatore Romeo, Dongwei Jiang, Khushbu Pahwa, Yubin Ge, Etsuko Ishii, Monica Sunkara, Yi Zhang 0001. 40662-40675 [doi]
- Automatic Paper Analysis and Categorisation for Systematic Reviews with Combined Reasoning-Augmented SFT and DAPO RLMichela Lorandi, Anya Belz, Simon Mille, Craig Thomson. 40676-40699 [doi]
- MotifAgent: Learning Molecular Assembly through Multi-Agent Collaboration for Chemical Language UnderstandingJinjia Feng, Wenda Wang 0004, Zhewei Wei. 40700-40739 [doi]
- Policy-Guided Stepwise Action Planning for Controllable LLM ReasoningJianpeng Zhou, Qisheng Hu, Jiahai Wang, Wenya Wang 0001. 40740-40765 [doi]
- Multiplication in Multimodal LLMs: Computation with Text, Image, and Audio InputsSamuel Gideon Balter, Ethan Jerzak, Connor Thomas Jerzak. 40766-40780 [doi]
- Modeling Human Perspectives with Socio-Demographic RepresentationsLeixin Zhang, Çagri Çöltekin. 40781-40794 [doi]
- Weight Tying Biases Token Embeddings Towards the Output SpaceAntonio Lopardo, Avyukth Harish, Catherine Arnett, Akshat Gupta. 40795-40810 [doi]
- Structured Uncertainty guided Clarification for LLM AgentsManan Suri, Puneet Mathur, Nedim Lipka, Franck Dernoncourt, Ryan A. Rossi, Dinesh Manocha. 40811-40838 [doi]
- LRBench and Judge-R1: Principled Evaluation and Training of LLM-Based Judges for Long-Context ReasoningXinyi Zhao, Haoqi Hu, Ziyu Wang, Jinfeng Xiao. 40839-40861 [doi]
- Beyond Reproduction: A Paired-Task Framework for Assessing LLM Comprehension and Creativity in Literary TranslationRan Zhang 0013, Steffen Eger, Arda Tezcan, Wei Zhao, Simone Paolo Ponzetto, Lieve Macken. 40862-40884 [doi]
- Mechanistic Interpretability of Large-Scale Counting in LLMs through a System-2 StrategyHosein Hasani, Mohammadali Banayeeanzade, Ali Nafisi, Sadegh Mohammadian, Fatemeh Askari, Mobin Bagherian, Amirmohammad Izadi, Mahdieh Soleymani Baghshah. 40885-40901 [doi]
- CodeScout: Contextual Problem Statement Enhancement for Software AgentsManan Suri, Xiangci Li, Mehdi Shojaie, Songyang Han, Chao-Chun Hsu, Shweta Garg 0001, Aniket Anand Deshmukh, Varun Kumar. 40902-40931 [doi]
- Evaluating Scene-based In-Situ Item Labeling for Immersive Conversational RecommendationJiazhou Liang, Yifan Simon Liu, David Guo, Yilun Jiang, Minqi Sun, Scott Sanner. 40932-40953 [doi]
- StanceAttack: Adversarial Attack for Stance DetectionChenye Zhao, Cornelia Caragea. 40954-40971 [doi]
- MEAV: Model Editing with Alignment Vectors for inference time LLM alignment in single and multidomain preference spectrumSadat Shahriar, Zheng Qi, Nikolaos Pappas 0004, Srikanth Doss, Kishaloy Halder, Monica Sunkara, Manuel Mager, Yassine Benajiba. 40972-40985 [doi]
- BioVLM: Routing Prompts, Not Parameters, for Cross-Modality Generalization in Biomedical VLMsMainak Singha, Tanisha Gupta, Ankit Jha, Muhammad Haris Khan, Sayantani Ghosh, Biplab Banerjee. 40986-41005 [doi]
- SCALE: Upscaled Continual Learning of Large Language ModelsJin Woo Lee, Junhwa Choi, Bongkyu Hwang, Jinho Choo, Bogun Kim, JeongSeon Yi, Joonseok Lee, Dongyoung Jung, Jaeseon Park, Kyoungwon Park, Suk Hoon Jung. 41006-41020 [doi]
- Words that make SENSE: Sensorimotor Norms in Learned Lexical Token RepresentationsAbhinav Gupta, Toben H. Mintz, Jesse Thomason. 41021-41029 [doi]
- Interpreting Style Representations via Style-Eliciting PromptsJunghwan Kim, David Jurgens. 41030-41048 [doi]
- Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI FeedbackSiddhant Arora, Jinchuan Tian, Jiatong Shi, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe 0001. 41049-41066 [doi]
- Conceptual Hierarchies within LLMsTiago Almeida, Zining Zhu 0005, Yue Ning 0001. 41067-41079 [doi]
- Conjecture and Inquiry: Quantifying Software Performance Requirements via Interactive Retrieval-Augmented Preference ElicitationShihai Wang, Tao Chen. 41080-41098 [doi]
- Measuring Large Language Models' Adversarial Behavior in Social Deduction GamesMarissa Zhao Li, Esha Shivakumar, Peiran Wang, Ying Li 0095, Yuan Tian 0001. 41099-41115 [doi]
- ChangJuan: A Comprehensive Benchmark for Book-Length Chinese Story EvaluationDingyi Yang, Mingshuo Wang, Qin Jin. 41116-41134 [doi]
- Progressive Re-ranking for Multimodal Retrieval-Augmented Generation via Curriculum LearningZhu Min, Yanchao Hao, Jian Liu, Shizhu He, Xi Chen 0003. 41135-41147 [doi]
- Confidence-Weighted Token Set Cover for Early Hypothesis Pruning in Self-ConsistencyMd. Arafat Sultan, Ramón Fernandez Astudillo. 41148-41155 [doi]
- MMTabReal: Real-World Benchmark for Multimodal Table UnderstandingPrasham Yatinkumar Titiya, Jainil Trivedi, Chitta Baral, Vivek Gupta 0001. 41156-41176 [doi]
- Inject to Heal: Alleviating hallucination in LVLMs via Context Embedding InjectionMehrdad Fazli, Bowen Wei, Ziwei Zhu 0001. 41177-41193 [doi]
- Colorful Talks with Graphs: Human-Interpretable Graph Encodings for Large Language ModelsAngelo Zangari, Peyman Baghershahi, Sourav Medya. 41194-41215 [doi]
- SAM-NER: Semantic Archetype Mediation for Zero-Shot Named Entity RecognitionRuichu Cai, Juntao Gan, Miao Mai, Zhifeng Hao, Boyan Xu. 41216-41231 [doi]
- DRPG (Decompose, Retrieve, Plan, Generate): An Agentic Framework for Academic RebuttalPeixuan Han, Yingjie Yu, Jingjun Xu, Jiaxuan You. 41232-41249 [doi]
- BiasGRPO: Stabilizing Bias Mitigation in High-Variance Reward Landscapes via Group-Relative Policy OptimizationSaket Reddy, Ke Yang 0003, ChengXiang Zhai. 41250-41267 [doi]
- MaskTab: Scalable Masked Tabular Pretraining with Scaling Laws and Distillation for Industrial ClassificationBo Zheng 0007, Yudong Chen, Zihua Xiong, Shuai Fang, Peidong He, Yang Yang 0009, Sheng Guo 0005. 41268-41280 [doi]
- Enhancing Zero-Shot Time Series Forecasting in Off-the-Shelf LLMs via Noise Injection PromptingXingyou Yin, Ceyao Zhang, Min Hu, Kai Chen. 41281-41308 [doi]
- Text Embedding as Treatment: A Meta Causal Approach for Robust Sentiment ClassificationFengxiang Cheng, Chuan Zhou 0013, Xiang Li, Haoxuan Li 0001, Wen-Li Wang, Jinkun Chen, Mingming Gong, Kun Zhang 0001. 41309-41320 [doi]
- CliniCAST: Benchmarking Acoustic Grounding and Text Dominance in Medical TriageKyusik Kim 0001, Hyunwoo Yoo, Jaehoon Choi, Kitae Kim, Gail Rosen, Bongwon Suh. 41321-41343 [doi]
- Whose Voice, Whose Avatar? Gender Matching Bias in Multimodal AI TeammatesKyusik Kim 0001, Jaehoon Choi, Hyunwoo Yoo, Bongwon Suh. 41344-41367 [doi]
- WebAnchor: Anchoring Agent Planning to Stabilize Long-Horizon Web ReasoningXinmiao Yu, Liwen Zhang, Xiaocheng Feng, Pengjun Xie, Jingren Zhou 0001, Bing Qin 0001, Yong Jiang 0005. 41368-41380 [doi]
- Context-Driven and Reference-Guided Data Augmentation for Subtitle TranslationHitoshi Ito, Naoto Shirai, Kazutaka Kinugawa, Hideya Mino, Rei Endo, Yoshihiko Kawai. 41381-41394 [doi]
- Real or Robotic? Assessing Whether LLMs Accurately Simulate Qualities of Human Responses in Human-LLM DialogueJonathan Ivey, Shivani Kumar, Jiayu Liu, Hua Shen 0005, Sushrita Rakshit, Rohan Raju, Haotian Zhang, Aparna Ananthasubramaniam, Junghwan Kim, Bowen Yi 0001, Dustin Wright 0001, Abraham Israeli, Anders Giovanni Møller, LeChen Zhang, David Jurgens. 41395-41432 [doi]
- Can Small LLMs Learn a Robust Theory of Mind via RLVR? Investigating Generalization through the False-Belief TaskSneheel Sarangi, Hanan Salam. 41433-41448 [doi]
- Rolling Out Data Quality Overnight, without losing the plot: A Multi-Agent System for Speech Data Quality ManagementRishabh Kumar, Abhinav Painuli, Chriss Philip Saji, Devesh Soni, Amrith Krishna, Ganesh Ramakrishnan. 41449-41492 [doi]
- Schema-Guided Response Generation using Multi-Frame Dialogue State for Motivational Interviewing SystemsJie Zeng, Yukiko I. Nakano. 41493-41524 [doi]
- From Passive Metric to Active Signal: The Evolving Role of Uncertainty Quantification in Large Language ModelsJiaxin Zhang 0005, Wendi Cui, Zhuohang Li, Lifu Huang, Bradley A. Malin, Caiming Xiong, Chien-Sheng Wu. 41525-41544 [doi]
- Value-Action Alignment in Large Language Models under Privacy-Prosocial ConflictGuanyu Chen, Chenxiao Yu, Xiyang Hu. 41545-41564 [doi]
- See or Say Graphs: Agent-Driven Scalable Graph Understanding with Vision-Language ModelsShuo Han, Yukun Cao, Zezhong Ding 0001, Zengyi Gao, S. Kevin Zhou, Xike Xie. 41565-41589 [doi]
- Recovered in Translation: Efficient Pipeline for Automated Translation of Benchmarks and DatasetsHanna Yukhymenko, Anton Alexandrov, Martin T. Vechev. 41590-41609 [doi]
- MorphBPE: Morphology-Aware Tokenization for Efficient LLM TrainingEhsaneddin Asgari, Yassine El Kheir, MohammadAli SadraeiJavaheri, Ali Nazari. 41610-41621 [doi]
- From Storage to Experience: A Survey on the Evolution of LLM Agent Memory MechanismsJinghao Luo, Yuchen Tian, Chuxue Cao, Ziyang Luo, Hongzhan Lin 0001, Kaixin Li, Chuyi Kong, Ruichao Yang, Jing Ma 0004. 41622-41652 [doi]
- LLMs are Brittle to Simple Code Transformations: Introducing CETBench - A Benchmark for Code-Equivalence CheckingNeeva Oza, Ishaan Govil, Parul Gupta, Dinesh Khandelwal, Dinesh Garg, Parag Singla. 41653-41685 [doi]
- Enhancing Factuality through Consensus and Consistency in Summarization Using Minimum Bayes Risk DecodingRiza Setiawan Soetedjo, Yusuke Sakai 0010, Hidetaka Kamigaito, Jingun Kwon, Manabu Okumura, Taro Watanabe. 41686-41713 [doi]
- Moneyball with LLMs: Analyzing Tabular Summarization in Sports NarrativesRitam Upadhyay, Naman Ahuja, Rishabh Baral, Aparna Garimella, Vivek Gupta 0001. 41714-41739 [doi]
- A Computational Method for Measuring Open Codes in Qualitative AnalysisJohn Chen, Alexandros Nikolaos Lotsos, Sihan Cheng, Lexie Zhao, Yanjia Zhang, Jessica Hullman, Bruce Sherin, Uri Wilensky, Michael S. Horn. 41740-41758 [doi]
- Vulnerability of LLMs' Stated Belief? LLMs Belief Resistance Check Through Strategic Persuasive Conversation InterventionsFan Huang, Haewoon Kwak, Jisun An. 41759-41794 [doi]
- Choose Your Lens: Multi-Perspective Value Alignment of Chain-of-Thought ReasoningGejian Zhao, Hanzhou Wu, Xinpeng Zhang 0001. 41795-41808 [doi]
- Beyond Evidence: Belief-Chain Conditioning for Persuasive Misinformation Debunking ExplanationYi-Li Hsu, Li-Wun Chang, Chun-Yu Hsu, Jane Wei-Kuan Shih, Aiping Xiong, Lun-Wei Ku. 41809-41836 [doi]
- CoTJudger: A Graph-Driven Framework for Automatic Evaluation of Chain-of-Thought Efficiency and Redundancy in LRMsSiyi Li, Jiajun Shi, Shiwen Ni, Ge Zhang 0009, Shuaimin Li, Shijian Wang, Zhoufutu Wen, Yizhi Li, Hamid Alinejad-Rokny, Jiaheng Liu, Min Yang 0007, Wenhao Huang 0001. 41837-41863 [doi]
- The Inner Monologue of Language Models: When Reasoning Traces Reveal More Than They HidePratham Singla, Shivank Garg, Ayush Singh, Ishan Garg, Ketan Suhaas Saichandran. 41864-41889 [doi]
- Do VLMs Have a Moral Backbone? A Study on the Fragile Morality of Vision-Language ModelsZhining Liu 0002, Tianyi Wang, Xiao Lin 0016, Penghao Ouyang, Gaotang Li, Ze Yang, Hui Liu 0033, Sumit Keswani, Vishwa Pardeshi, Huijun Zhao, Wei Fan 0001, Hanghang Tong. 41890-41909 [doi]
- ENPMR-Bench: Benchmarking Proactive Memory Retrieval for Emotional Support AgentsXing Fu, Yulin Hu, Mengtong Ji, Haozhen Li, Yixin Sun, Weixiang Zhao, Yanyan Zhao, Bing Qin 0001. 41910-41933 [doi]
- Grounded Concreteness: Human-Like Concreteness Sensitivity in Vision-Language ModelsAryan Roy, Zekun Wang, Christopher J. MacLellan. 41934-41950 [doi]
- PROPER Agents: Proactivity Driven Personalized Agents for Advancing Knowledge Gap NavigationKirandeep Kaur, Vinayak Gupta, Aditya Gupta, Chirag Shah 0001. 41951-41975 [doi]
- PO-KGQA: Preference Optimization for Low-Resource Complex Knowledge Graph Question AnsweringPrerna Agarwal, Ayushman Kumar singh, Srikanta Bedathur. 41976-41997 [doi]
- Beyond Prompt Engineering: A Systematic Analysis of Prompt Lexical Sensitivity and Its Impacts on QualityQipeng Xie, Zi Liang, Jiafei Wu, Yufei Chen, Weizheng Wang 0001, Wenao Ma, Zhong Ming 0001, Haiqin Yang, Kaishun Wu. 41998-42012 [doi]
- DUSK: Do Not Unlearn Shared KnowledgeWonje Jeung, Sangyeon Yoon, Hyesoo Hong, Soeun Kim, Seungju Han 0002, Youngjae Yu, Albert No. 42013-42031 [doi]
- Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual EmbeddingsAakriti Agrawal, Gouthaman KV, Rohith Aralikatti, Gauri Jagatap, Jiaxin Yuan, Sarvesh Baskar, Vijay Kamarshi, Andrea Fanelli, Furong Huang. 42032-42048 [doi]
- Prior Beliefs Prejudice LLM-as-Judge: Evidence from Persuasion EvaluationPardis Sadat Zahraei, Xiaoning Wang, Nimet Beyza Bozdag, Gokhan Tur, Dilek Hakkani-Tür. 42049-42082 [doi]
- Direct Token Optimization: A Self-Contained Approach to Large Language Model UnlearningHong-Kyu Lee, Ruixuan Liu, Li Xiong 0001. 42083-42100 [doi]
- EntroBench: Evaluating LLM Watermarking Under Multi-Entropy Scenarios and Practical User OperationsPengyuan Qin, Linnan Tu, Yuhan Ke, Hefei Ling. 42101-42118 [doi]
- Beyond Single-Shot: Multi-step Tool Retrieval via Query PlanningWei Fang, James R. Glass. 42119-42144 [doi]
- On Safety Risks in Experience-Driven Self-Evolving AgentsWeixiang Zhao, Yichen Zhang, Yingshuo Wang, Yang Deng 0002, Yanyan Zhao, Xuda Zhi, Yongbo Huang, Hao He, Wanxiang Che, Bing Qin 0001, Ting Liu 0001. 42145-42169 [doi]
- LLM Program Optimization via Retrieval Augmented SearchSagnik Anupam, Alexander Shypula, Osbert Bastani. 42170-42186 [doi]
- EnsemW2S: Enhancing Weak-to-Strong Generalization with Large Language Model EnsemblesAakriti Agrawal, Mucong Ding, Chenghao Deng, Zora Che, Arjun Rajaram, Anirudh Satheesh, Bang An 0001, C. Bayan Bruss, John Langford 0001, Furong Huang. 42187-42216 [doi]
- Stable On-Policy Distillation through Adaptive Target ReformulationIjun Jang, Je Won Yeom, Juan Yeo, Hyunggyu Lim, Taesup Kim. 42217-42227 [doi]
- A Syntactic and Semantic Probe into Language Evolution based on Large Language ModelsHao Pang, Changcheng Li, Yingxue Liu. 42228-42250 [doi]
- Assessing the Effect of Context in Multi-domain Acceptability JudgmentEunike Andriani Kardinata, Yusuke Sakai 0010, Taro Watanabe. 42251-42266 [doi]
- Lost in Decomposition: Analyzing and Mitigating the Limitations of Long Context Methods via Context DependencyJiayuan Guo, Yueyang Su, Yuyao Ge, Saiping Guan, Lei Yu 0012, Jiafeng Guo, Xueqi Cheng. 42267-42285 [doi]
- Tandem: Riding Together with Large and Small Language Models for Efficient ReasoningZichuan Fu, Xian Wu 0001, Guojing Li, Yejing Wang, Yijun Chen, Zihao Zhao, Yixuan Luo, Hanyu Yan, Yefeng Zheng 0001, Xiangyu Zhao 0001. 42286-42302 [doi]
- PROBE: PROcess-Based BEnchmark for Hallucination DetectionYu Zhang, Peter Belcak, Shizhe Diao, Yonggan Fu, Shaona Ghosh, Morteza Mardani, Eileen Margaret Peters Long, Bei Yu, Pavlo Molchanov 0001. 42303-42320 [doi]
- Prompt Optimization for Relation Extraction using Reinforcement LearningYing Liu, Dong Shuai, Cui Zibo, Tengqi Ye, Gang Wu. 42321-42334 [doi]
- PolyAudio: Advancing Multi-Audio Reasoning in Large Audio Language Models with Interleaved Multi-Audio ContextsSonal Kumar, Sreyan Ghosh, Yueqian Lin, S. Sakshi, Ashish Seth, Yiran Chen 0001, Ramani Duraiswami, Dinesh Manocha. 42335-42353 [doi]
- Scaling Evaluation-Time Compute with Reasoning Models as EvaluatorsSeungone Kim, Ian Wu, Jinu Lee 0001, Xiang Yue, Seongyun Lee, Minkyeong Moon, Carolin Lawrence, Kiril Gashteovski, Julia Hockenmaier, Graham Neubig, Sean Welleck. 42354-42384 [doi]
- Beyond Memorization: Extending Reasoning Depth with Recurrence, Memory and Test-Time Compute ScalingIvan Rodkin, Daniil Orel, Konstantin Smirnov, Arman Bolatov, Bilal Elbouardi, Besher Hassan, Yuri Kuratov, Aydar Bulatov, Preslav Nakov, Timothy Baldwin, Artem Shelmanov, Mikhail Burtsev 0001. 42385-42404 [doi]
- Navigating the Alignment-Calibration Trade-off: A Pareto-Superior Frontier via Model MergingTiancheng Hu, Benjamin Minixhofer, Nigel Collier. 42405-42422 [doi]
- From Representation to Choice: Tracing Decision Emergence Across Languages in LLMsDivyanshu Bhatt, Abhinav Joshi, Ujjaval Patel, Ashutosh Modi. 42423-42442 [doi]
- Unlocking the Edge deployment and ondevice acceleration of multi-LoRA enabled one-for-all foundational LLMSravanth Kodavanti, Sowmya Vajrala, Srinivas Soumitri Miriyala, Utsav Tiwari, Uttam Kumar, Utkarsh Kumar Mahawar, Achal Pratap Singh, Arya D, Narendra Mutyala, Vikram Nelvoy Rajendiran, Sharan Kumar Allur, Euntaik Lee, DoHyoung Kim, Hyeonsu Lee, Gyusung Cho, JungBae Kim. 42443-42455 [doi]
- SynthRL: Scaling Visual Reasoning with Verifiable Data SynthesisZijian Wu 0003, Jinjie Ni, Xiangyan Liu, Zichen Liu, Hang Yan 0012, Michael Qizhe Shieh. 42456-42476 [doi]
- From Fragments to Facts: A Curriculum-Driven DPO Approach for Generating Hindi News Veracity ExplanationsPulkit Bansal, Raghvendra Kumar 0003, Shakti Singh, Adam Jatowt, Sriparna Saha 0001. 42477-42497 [doi]
- Joint Optimization of Training Data and Policy in RLHFZhuohao Yu 0001, Jiali Zeng, Weizheng Gu, Mengyuan Sun, Yidong Wang 0003, Fandong Meng, Jie Zhou 0016, Shikun Zhang, Wei Ye 0004. 42498-42514 [doi]
- Simul-COMET: A Quality Metric for Simultaneous Interpretation in Distant Language Pair Considering Word Order DifferenceKosuke Doi, Mana Makinae, Yusuke Sakai 0010, Hidetaka Kamigaito, Taro Watanabe. 42515-42533 [doi]
- Risk-Controlled Event-Driven Cascading Updates for Knowledge Graph Consistency RestorationBo Ni, Qinwen Ge, Haowei Fu, Ryan A. Rossi, Xiaorui Liu, JieJun Xu, Tyler Derr. 42534-42548 [doi]
- ContractEval: A Benchmark for Evaluating Contract-Satisfying Assertions in Code GenerationSoohan Lim, Joonghyuk Hahn, Hyunwoo Park, Sang-Ki Ko, Yo-Sub Han. 42549-42566 [doi]
- ToM-Synth: Scaling Robust Theory of Mind in LLMs via 6, 912 Structured Social UnitsGuiyang Hou, Xiang Huang, Shangke Lyu, Yuchuan Wu, Weiyao Luo, Xinyu Mei, Yongliang Shen 0001, Weiming Lu 0001, Yongbin Li 0001. 42567-42582 [doi]
- Budget-Aware Routing for Long Clinical TextKhizar Qureshi, Geoffrey Martin, Yifan Peng 0002. 42583-42598 [doi]
- Multi-LLM Collaborative Search for Complex Problem SolvingSen Yang 0005, Yafu Li, Wai Lam, Yu Cheng 0001. 42599-42614 [doi]
- SceneLM: 3D-Aware Language Models for Editable 3D Scene SynthesisXingbo Yao, Xiaoyu Chen, Doudou Zhang, Mingzhi Sheng, Boyuan Cao, Ying-Cong Chen, Hui Xiong 0001. 42615-42624 [doi]
- Leveraging Pretrained Language Models as Energy Functions for Glauber Dynamics Text DiffusionTarun Kathuria, Sachin Kumar. 42625-42643 [doi]
- Uncovering Currency Bias and Syntax Gap in Text Embedding ModelsSaurav Sudevan, Harsh Pal, Yatin Katyal, Sahil Manchanda. 42644-42702 [doi]
- C-ReD: A Comprehensive Chinese Benchmark for AI-Generated Text Detection Derived from Real-World PromptsChenxi Qing, Junxi Wu, Zheng Liu, Yixiang Qiu, Hongyao Yu, Bin Chen 0011, Hao Wu, Shu-Tao Xia. 42703-42733 [doi]
- Seer Self-Consistency: Advance Budget Estimation for Adaptive Test-Time ScalingShiyu Ji, Yixuan Wang, Yijun Liu, Qingfu Zhu, Wanxiang Che. 42734-42747 [doi]
- Context-Fidelity Boosting: Enhancing Faithful Generation through Watermark-Inspired DecodingWeixu Zhang, Fanghua Ye, Qiang Gao, Jian Li, Haolun Wu, Yuxing Tian, Sijing Duan, Nan Du, Xiaolong Li. 42748-42759 [doi]
- CaRVE: Critiquing and Refining Visual Elaborations for Figurative Language IllustrationsManishit Kundu, Tejomay Kishor Padole, Sumit Shekhar, Biplab Banerjee, Pushpak Bhattacharyya. 42760-42777 [doi]
- Defending LLMs against Jailbreak Attacks via Template-Based ICL with a Defensive SuffixRuiyang Ni, Changlong Li, Shuaibiao Han, Zhiyu Yi, Perley Xu, Wenjie Ruan. 42778-42797 [doi]
- From Fallback to Frontline: When Can LLMs be Superior Annotators of Human Perspectives?Hasan Amin, Harry Yizhou Tian, Xiaoni Duan, Chien-Ju Ho, Rajiv Khanna, Ming Yin 0001. 42798-42830 [doi]
- Does Theory of Mind Improvement Really Benefit Human-AI Interactions? Empirical Findings from Interactive EvaluationsNanxu Gong, Zixin Chen, Haotian Li 0001, Zishu Zhao, Jianxun Lian, Huamin Qu, Yanjie Fu, Xing Xie 0001. 42831-42860 [doi]
- SERE: Structural Example Retrieval for Enhancing LLMs in Event Causality IdentificationZhifeng Hao, Zhongjie Chen, Junhao Lu, Shengyin Yu, Guimin Hu, Keli Zhang, Ruichu Cai, Boyan Xu. 42861-42886 [doi]
- Emotion Trajectory-aware Retrieval for Markov-driven Emotion Anticipation in LLM-based Emotional Support ConversationHongyan Wu, Zhiliang Tian, Zhen Huang, Tengyue Hu, Linbo Qiao, Yifu Gao, Feng Liu, Dongsheng Li. 42887-42905 [doi]
- High-Throughput and Memory-Efficient Zeroth-Order Fine-tuning LLMs with Distributed Parallel ComputingLiangyu Wang, Huanyi Xie, Di Wang 0015. 42906-42923 [doi]
- AutoAgent: A Fully-Automated and Zero-Code Framework for LLM AgentsJiabin Tang, Tianyu Fan, Chao Huang 0001. 42924-42974 [doi]
- DR-HM: Distill-then-Reinforce Training with Cognition-Aware Data Synthesis for Harmful Meme DetectionZihan Cheng, Jianxiang Ma, Xiaocui Yang, Peidong Wang, Wen Zhang, Shi Feng 0001, Daling Wang, Yifei Zhang 0003, Mingfu Zhang. 42975-42993 [doi]
- Long Story Short: Disentangling Compositionality and Long-Caption Understanding in Contrastive VLMsIsrafel Salazar, Desmond Elliott, Yova Kementchedjhieva. 42994-43008 [doi]
- Model in Distress: Sentiment Analysis on French Synthetic Social MediaPierre-Carl Langlais, Pavel Chizhov, Yannick Detrois, Carlos Rosas Hinostroza, Ivan P. Yamshchikov, Bastien Perroy. 43009-43021 [doi]
- Working Memory Constraints Scaffold Learning in Transformers under Data ScarcityPranava Madhyastha, Dagmar Adamcova. 43022-43038 [doi]
- Internalizing Multi-Agent Reasoning for Accurate and Efficient LLM-based RecommendationYang Wu, Haoze Wang, Qian Li, Jun Zhang, Huan Yu, Jie Jiang. 43039-43060 [doi]
- Do Language Models Use Logophoric Cues? Evidence from Mandarin Chinese Long-Distance ReflexiveYunfang Dong. 43061-43072 [doi]
- FineState-Bench: Benchmarking State-Conditioned Grounding for Fine-grained GUI State SettingFengxian Ji, Jingpu Yang, Zirui Song, Yuanxi Wang, Zhexuan Cui, Yuke Li, Qian Jiang, Xiuying Chen. 43073-43088 [doi]
- Dictionary Guided Sparse Logit Editing for Reliable Jailbreak AttacksShuaibiao Han, Ruiyang Ni, Zhiyu Yi, Changlong Li, Perley Xu, Wenjie Ruan. 43089-43107 [doi]
- Chain-of-Relations: Faithful and Efficient LLM Reasoning over Knowledge Graphs via Relation-Centric ExplorationChenhui Liu, Jianpeng Zhou, Jiahai Wang. 43108-43119 [doi]
- MedQPA-Gen: Medical Question Proposing and Answering for Report GenerationWeijie Liang, Xiyue Zhu, Ruike Zhu, Chenhao Li, Cheng Tang, Zhiyu Liu, Zhihua Gong, Shirui Luo, Yudu Li, Volodymyr V. Kindratenko. 43120-43132 [doi]
- Faster MoE LLM Inference for Extremely Large ModelsHaoqi Yang 0001, Luohe Shi, Qiwei Li 0002, Zuchao Li, Ping Wang 0028, Hao Huang, Hai Zhao 0001. 43133-43151 [doi]
- Localized Cultural Knowledge is Conserved and Controllable in Large Language ModelsVeniamin Veselovsky, Berke Argin, Benedikt Stroebl, Chris Wendler, Robert West 0001, James Evans, Thomas L. Griffiths 0001, Arvind Narayanan. 43152-43178 [doi]
- The Confidence Paradox: Unveiling the Latent Discriminative Power of Diffusion Large Language Models in Mathematical ReasoningYansi Li, Gongshen Liu, Zhuosheng Zhang 0001. 43179-43196 [doi]
- Efficient Hallucination Detection in Automatic Code GenerationGeorgii Andriushchenko, Roman Garaev, Lyudmila Rvanova, Artem Shelmanov, Vladimir V. Ivanov. 43197-43220 [doi]
- DuET: Dual Execution for Test Output Prediction with Generated Code and PseudocodeHojae Han, Jaejin Kim, Seung-won Hwang, Yu-Jin Kim, Moontae Lee. 43221-43243 [doi]
- Attention Sinks in Diffusion Language ModelsMaximo Eduardo Rulli, Simone Petruzzi, Edoardo Michielon, Fabrizio Silvestri, Simone Scardapane, Alessio Devoto. 43244-43256 [doi]
- R³-SQL: Ranking Reward and Resampling for Text-to-SQLHojae Han, Yeonseok Jeong, Seung-won Hwang, Zhewei Yao, Yuxiong He. 43257-43275 [doi]
- Detecting Hallucinations in SpeechLLMs at Inference Time Using Attention MapsJonas Waldendorf, Bashar Awwad Shiekh Hasan, Evgenii Tsymbalov. 43276-43289 [doi]
- Leveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language ModelsGabeen Kim, Kyeongpil Kang. 43290-43304 [doi]
- From Experience to Skill: Multi-Agent Generative Engine Optimization via Reusable Strategy LearningBeining Wu, Fuyou Mao, Jiong Lin, Cheng Yang, Jiaxuan Lu, Yifu Guo, Siyu Zhang, Yifan Wu, Ying Huang, Fu Li. 43305-43315 [doi]
- CodeRM-NT: Reward Model for Code RL without Unit TestsXiao Xia, Dan Zhang, Tianrui Sun. 43316-43333 [doi]
- Fin-STAR: Structure-as-Semantics to Resolve Implicitness in Financial RetrievalYu Zou, Yan Chen, Lida He, Qi Zhou, Xiaorui Zhou, Aixi Zhong, Yi Wang, Wei Li, Qingyu Wang, Jiatao Li, Wei Gong, Jialei Zeng, Jingmei Zhao, Ke Jiang, Qing Li. 43334-43347 [doi]
- When Rules Learn: A Self-Evolving Agent for Legal Case RetrievalMingxu Tao, Jiawei Hu, Xian Zhou, Wenpeng Hu, Jiajun Cheng, Yunbo Cao, Zhunchen Luo, Guotong Geng. 43348-43365 [doi]
- SpecExtend: A Drop-in Enhancement for Speculative Decoding of Long SequencesJungyoub Cha, Hyunjong Kim, Sungzoon Cho. 43366-43377 [doi]
- Task-Related In-Context LearningWenqiang Wang, Peng Chen, Yan Xiao 0002, Yangshijie Zhang, Xiaoyue Lu, Jianjie Huang, Xiaochun Cao. 43378-43400 [doi]
- Concise Math Reasoning via Difficulty-Aware DistillationYifan Wu, Jingze Shi, Bingheng Wu, Jiayi Zhang 0017, Xiaotian Lin, Yizhang Zhu, Zhaoyang Yu 0004, Bang Liu 0003, Chenglin Wu 0001, Nan Tang 0001, Yuyu Luo. 43401-43427 [doi]
- Corpora Generation for Urdu Grammatical Error CorrectionSyed Ahad, Burhanuddin Aliasghar Ezzi, Muhammad Arsalan Hussain, Sandesh Kumar, Abdul-Samad. 43428-43444 [doi]
- Rethinking Retrieval-Augmented Generation as a Cooperative Decision-Making ProblemLichang Song, Ting Long, Yi Chang. 43445-43456 [doi]
- More Agents Improve Math Problem Solving but Adversarial Robustness Gap PersistsKhashayar Alavi, Zhastay Yeltay, Lucie Flek, Akbar Karimi 0001. 43457-43475 [doi]
- Indic-CodecFake meets SATYAM: Towards Detecting Neural Audio Codec Synthesized Speech Deepfakes in Indic LanguagesGirish, Mohd Mujtaba Akhtar, Orchid Chetia Phukan, Arun Balaji Buduru. 43476-43489 [doi]
- Tracing Relational Knowledge Recall in Large Language ModelsNicholas Popovic, Michael Färber 0001. 43490-43509 [doi]
- LR-DWM: Efficient Watermarking for Diffusion Language ModelsOfek Raban, Gal Chechik, Ethan Fetaya. 43510-43517 [doi]
- Beyond Unimodal Shortcuts: MLLMs as Cross-Modal Reasoners for Grounded Named Entity RecognitionJinlong Ma, Yu Zhang 0193, Xuefeng Bai 0001, Kehai Chen, Yuwei Wang, Zeming Liu, Jun Yu 0002, Min Zhang 0005. 43518-43539 [doi]
- BubbleRAG: Interactive Cognitive Offloading with Thought Bubble in Retrieval-Augmented GenerationFuda Ye, Jiachuan Wang, Yongqi Zhang, Lei Chen 0002, Shuangyin Li. 43540-43558 [doi]