Abstract is missing.
- Frontfatter [doi]
- OctoTools: A Multi-Agent Framework with Extensible Tools for Complex ReasoningPan Lu, Bowen Chen, Sheng Liu, Rahul Thapa, Joseph Boen, James Zou 0001. 1-86 [doi]
- No Reader Left Behind: Multi-Agent Summaries Everyone Can UnderstandJimin Jung, Myoungjin Kim, Jaehyung Seo, HeuiSeok Lim. 87-116 [doi]
- Discover and Prove: An Open-source Agentic Framework for Hard Mode Automated Theorem Proving in Lean 4Chengwu Liu 0001, Yichun Yin, Ye Yuan 0016, Jiaxuan Xie, Botao Li, Siqi Li, Jianhao Shen, Yan Xu, Lifeng Shang, Ming Zhang 0004. 117-133 [doi]
- Your Inference Request Will Become a Black Box: Confidential Inference for Cloud-based Large Language ModelsChung-ju Huang, Huiqiang Zhao, Yuanpeng He, Lijian Li 0003, Wenpin Jiao, Zhi Jin 0001, Peixuan Chen, Leye Wang. 134-154 [doi]
- Rhetorical Questions in LLM Representations: A Linear Probing StudyLouie Hong Yao, Vishesh Anand, Yuan Zhuang, Tianyu Jiang 0001. 155-172 [doi]
- Dual-Axis Generative Reward Model Toward Semantic and Turn-taking Robustness in Interactive Spoken Dialogue ModelsYifu Chen, Shengpeng Ji, Zhengqing Liu, Qian Chen 0003, Wen Wang 0001, Ziqing Wang, Yangzhuo Li, Tianle Liang, Zhou Zhao 0001. 173-208 [doi]
- Different types of syntactic agreement recruit the same units within large language modelsDaria Kryvosheieva, Andrea Gregor de Varda, Evelina Fedorenko, Greta Tuckute. 209-227 [doi]
- Empowering Tabular Data Preparation with Language Models: Why and How?Mengshi Chen, Yuxiang Sun, Tengchao Li, Jianwei Wang 0003, Kai Wang 0037, Xuemin Lin 0001, Ying Zhang 0001, Wenjie Zhang 0001. 228-246 [doi]
- Learning Diverse Responses with Prefix-Conditioned Supervised Fine-TuningZhiyuan Fan, Guanqiao Chen, Yanyi Huang, Mingkuan Zhao, Dadi Guo, Yi R. Fung 0001. 247-276 [doi]
- EASE: Entity-Aware Sub-table Generation for Real-world Multi-table QAMyunghoon Kang, Dahyun Jung, Suhyune Son, Seonmin Koo, Changwoo Chun, Daniel Rim, Haeyoung Kwon, Yuna Hur, HeuiSeok Lim. 277-302 [doi]
- Benchmarking LLM's Capability in Reasoning over Conflicting Web ReferencesYizhen Yuan, Rui Kong, Dongze Li, Yuanchun Li 0003, Yunxin Liu 0001. 303-322 [doi]
- Parallel Universes, Parallel Languages: A Comprehensive Study on LLM-based Multilingual Counterfactual Example GenerationQianli Wang, Van Bach Nguyen, Yihong Liu 0001, Fedor Splitt, Nils Feldhus, Christin Seifert, Hinrich Schütze, Sebastian Möller 0001, Vera Schmitt. 323-346 [doi]
- CLEAR: Cross-Lingual Enhancement in Retrieval via Reverse-trainingSeungyoon Lee, MinHyuk Kim, Seongtae Hong, Youngjoon Jang 0002, Dongsuk Oh, HeuiSeok Lim. 347-362 [doi]
- Aligning Language Models with Real-time Knowledge EditingChenming Tang, Yutong Yang, Kexue Wang, Yunfang Wu. 363-378 [doi]
- PosterForest: Hierarchical Multi-Agent Collaboration for Scientific Poster GenerationJiho Choi, Seojeong Park, Seongjong Song, Hyunjung Shim. 379-401 [doi]
- SLR: Automated Synthesis for Scalable Logical ReasoningLukas Helff, Ahmad Omar, Felix Friedrich, Antonia Wüst, Hikaru Shindo, Rupert Mitchell, Tim Woydt, Patrick Schramowski, Wolfgang Stammer, Kristian Kersting. 402-426 [doi]
- Can Continual Pretraining Bridge the Performance Gap between General-purpose and Specialized Language Models in the Medical Domain?Niclas Doll, Jasper Schulze Buschhoff, Shalaka Satheesh, Hammam Abdelwahab, Héctor Allende-Cid, Katrin Klug. 427-444 [doi]
- MINTQA: A Multi-Hop Question Answering Benchmark for Evaluating LLMs on New and Long-tail KnowledgeJie He 0004, Nan Hu 0004, Wanqiu Long, Jiaoyan Chen 0001, Jeff Z. Pan. 445-479 [doi]
- Sense and Sensitivity: Examining the Influence of Semantic Recall on Long Context Code UnderstandingAdam Storek, Mukur Gupta, Samira Hajizadeh, Prashast Srivastava, Suman Jana. 480-498 [doi]
- SenseRel: A Sense-Level Benchmark for Denotational and Connotational Meaning RelationsPierluigi Cassotti, Naomi Baes, Stefano De Pascale, Jáder Martins Camboim de Sá, Francesco Periti, Nick Haslam, Dirk Geeraerts, Nina Tahmasebi. 499-515 [doi]
- WebSTAR: Scalable Data Synthesis for Computer Use Agents with Step-Level FilteringYifei He, Pranit Chawla, Yaser Souri, Subhojit Som, Xia Song. 516-533 [doi]
- PR-XAI: PageRank-Based Feature Attribution for TransformersBehrooz Azarkhalili, Linyi Li, Maxwell W. Libbrecht. 534-554 [doi]
- CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language ModelsShengli Zhou, Xiangchen Wang, Guanhua Chen, Feng Zheng. 555-567 [doi]
- MauBERT: Universal Phonetic Inductive Biases for Few-Shot Acoustic Units DiscoveryAngelo Ortiz Tandazo, Manel Khentout, Youssef Benchekroun, Thomas Hueber, Emmanuel Dupoux. 568-585 [doi]
- Your Reasoning Model Knows What Counts: Self-Guided Chain-of-Thought Pruning for Efficient ReasoningZi-Ao Ma, Xian-Ling Mao, Tian Lan 0003, Chen Xu, Zhijing Wu 0001. 586-605 [doi]
- ImReasoner: Improving Memory-based Language Models for Reasoning-in-a-Haystack TasksChing Yun Ko, Payel Das, Sihui Dai, Georgios Kollias, Subhajit Chaudhury, Aurélie C. Lozano, Pin-Yu Chen. 606-622 [doi]
- How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following BehaviorZidi Xiong, Yuping Lin, Wenya Xie, Pengfei He, Zirui Liu 0001, Jiliang Tang, Himabindu Lakkaraju, Zhen Xiang. 623-645 [doi]
- SACTOR: LLM-Driven Correct and Idiomatic C to Rust Translation with Static Analysis and FFI-Based VerificationTianyang Zhou, Ziyi Zhang, Haowen Lin, Somesh Jha, Mihai Christodorescu, Kirill Levchenko, Varun Chandrasekaran. 646-673 [doi]
- IntrAgent: An LLM Agent for Content-Grounded Information Retrieval through Literature ReviewFengbo Ma, Zixin Rao, Xiaoting Li, ZheTao Chen, Hongyue Sun, Yiping Zhao, Xianyan Chen, Zhen Xiang. 674-715 [doi]
- Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM SafetyCan Jin, Rui Wu, Tong Che, Qixin Zhang 0001, Hongwu Peng, Jiahui Zhao, Zhenting Wang, Wenqi Wei, Ligong Han, Zhao Zhang, Yuan Cao, Ruixiang Tang, Dimitris N. Metaxas. 716-749 [doi]
- Hybrid Autoregressive-Diffusion Model for Real-Time Sign Language ProductionMaoxiao Ye, Xinfeng Ye, Sathiamoorthy Manoharan. 750-763 [doi]
- Augur: Modeling Covariate Causal Associations in Time Series via Large Language ModelsZhiqing Cui, Binwu Wang, Qingxiang Liu 0004, Yeqiang Wang, Zhengyang Zhou, Yuxuan Liang 0002, Yang Wang 0015. 764-787 [doi]
- AgentRouter: A Knowledge-Graph-Guided LLM Router for Collaborative Multi-Agent Question AnsweringZheyuan Zhang, Kaiwen Shi, Zhengqing Yuan, Zehong Wang, Tianyi Ma, Keerthiram Murugesan, Vincent Galassi, Chuxu Zhang, Yanfang Ye 0001. 788-809 [doi]
- MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal EmbeddingsHaonan Chen 0005, Hong Liu, Yuping Luo, Liang Wang 0046, Nan Yang 0002, Furu Wei, Zhicheng Dou. 810-823 [doi]
- ReEx-SQL: Reasoning with Execution-Aware Reinforcement Learning for Text-to-SQLYaxun Dai, Wenxuan Xie, Xialie Zhuang, Tianyu Yang 0003, Ziyi Liu 0005, Haiqin Yang, Yiying Yang, Yuhang Zhao, Pingfu Chao, Wenhao Jiang. 824-847 [doi]
- DecIF: Improving Instruction-Following through DecompositionTingfeng Hui, Pengyu Zhu, Bowen Ping, Ling Tang, Guanting Dong 0001, Yaqi Zhang, Sen Su. 848-867 [doi]
- NavA³: Understanding Any Instruction, Navigating Anywhere, Finding AnythingLingFeng Zhang, Xiaoshuai Hao, Yingbo Tang, Haoxiang Fu, Xinyu Zheng, Pengwei Wang 0005, Zhongyuan Wang 0006, Wenbo Ding 0001, Shanghang Zhang. 868-878 [doi]
- FastV-RAG: Towards Fast and Fine-Grained Video QA with Retrieval-Augmented GenerationGen Li, Peiyu Liu. 879-889 [doi]
- Efficient Provably Secure Linguistic Steganography via Range CodingRuiyi Yan, Yugo Murawaki. 890-907 [doi]
- Uni-MMMU: A Massive Multi-discipline Multimodal Unified BenchmarkKai Zou, Ziqi Huang, Yuhao Dong, Shulin Tian, Dian Zheng, Hongbo Liu, Jingwen He, Bin Liu 0016, Yu Qiao 0001, Ziwei Liu 0002. 908-924 [doi]
- MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic SearchSheng Zhang 0028, Junyi Li 0001, Yingyi Zhang 0001, Pengyue Jia, Yichao Wang 0002, Xiaowei Qian, Wenlin Zhang 0001, Maolin Wang 0001, Yong Liu 0020, Xiangyu Zhao 0001. 925-943 [doi]
- CAPC-CG: A Large-Scale, Expert-Directed LLM-Annotated Corpus of Adaptive Policy Communication in ChinaBolun Sun, Charles Chang, Yuen Yuen Ang, Ruotong Mu, Yuchen Xu, Zhengxin Zhang, Pingxu Hao. 944-966 [doi]
- MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical ProblemsShuhang Chen, Hangjie Yuan, Yunqiu Xu, Pengwei Liu, Tao Feng 0014, Jun Cen, Zeying Huang, Yi Yang. 967-992 [doi]
- Anchored Sliding Window: Toward Robust and Imperceptible Linguistic SteganographyRuiyi Yan, Shiao Meng, Yugo Murawaki. 993-1012 [doi]
- What Makes Good Instruction-Tuning Data? An In-Context Learning PerspectiveGuangzeng Han, Xiaolei Huang 0002. 1013-1027 [doi]
- RoBSA: RoPE-based Blockwise Sparse Multi-head Latent AttentionXinyu Shi, Kairong Luo, Zhen Zheng, Wenguang Chen. 1028-1044 [doi]
- XtraGPT: Context-Aware and Controllable Academic Paper Revision via Human-AI CollaborationNuo Chen 0002, Andre Huikai Lin, Jiaying Wu, Junyi Hou, Zining Zhang 0001, Qian Wang 0002, Xidong Wang, Bingsheng He. 1045-1074 [doi]
- Learn to Relax with Large Language Models: Solving Constraint Optimization Problems via Bidirectional CoevolutionBeidan Liu, Zhengqiu Zhu, Chen Gao 0001, Tianle Pu, Yong Zhao, Wei Qi, Quanjun Yin. 1075-1094 [doi]
- A Game-Theoretica Negotiation Framework for Cross-Cultural ConsensusGuoxi Zhang, Jiawei Chen, Tianzhuo Yang, Jiaming Ji, Yaodong Yang 0001, Juntao Dai. 1095-1134 [doi]
- Focusing Condition: Inference-Time Self-Contrastive Steering Elicits Better Conditional Text Embeddings in LLMsZifeng Cheng, Lingyun Qian, Zhiwei Jiang 0001, Cong Wang 0034, Yafeng Yin 0002, Fei Shen, Ao Zhou, Qing Gu 0001. 1135-1147 [doi]
- Exploring Attention Attractors in Large Language ModelsZiheng Wang, Zihao Yue, Wenxuan Wang 0001, Qin Jin. 1148-1160 [doi]
- Identifying the Periodicity of Information in Natural LanguageYulin Ou, Yu Wang 0294, Yang Xu 0024, Hendrik Buschmeier. 1161-1175 [doi]
- EmoHarbor: Evaluating Personalized Emotional Support by Simulating the User's Internal WorldJing Ye, Lu Xiang, Yaping Zhang, Chengqing Zong. 1176-1202 [doi]
- ReasonEmbed: Enhanced Text Embeddings for Reasoning-Intensive Document RetrievalJianlyu Chen, Junwei Lan, Chaofan Li, Defu Lian, Zheng Liu 0011. 1203-1221 [doi]
- SPAGBias: Uncovering and Tracing Structured Spatial Gender Bias in Large Language ModelsBinxian Su, Haoye Lou, Shucheng Zhu, Weikang Wang 0003, Ying Liu, Dong Yu, Pengyuan Liu 0003. 1222-1251 [doi]
- VALU: A Benchmark for Video Anomaly Temporal Localization and Understanding at Multiple Semantic LevelsYixiao He, Menghao Zhang 0004, Haifeng Sun 0001, Jing Wang, Kangheng Lin, Jinghan Wang, Chenye Xu, Pengfei Ren 0001, Qi Qi 0001, Jingyu Wang. 1252-1296 [doi]
- CoreGaze: Core Subgraph-Driven Visual Gaze Diffusion for Training-Free Referring Multimodal Large Language ModelsXiaoyang Yi, Jing Chen 0074, Yuru Bao, Jian Zhang 0089. 1297-1315 [doi]
- RespiraMFM: A Multimodal Foundation Model with Contrastive Audio-Language Alignment for Respiratory Disease IdentificationShakhrul Iman Siam, TianTian Feng, Jiankun Zhang, Shrikanth Narayanan, Mi Zhang 0002. 1316-1330 [doi]
- Beyond Detection: Evaluating Fallacy Awareness of LLMs in Interactive ScenariosConghui Niu, Ningxin Wu, Ziran Zhao, Dong Yu 0003, Chen Kang, Pengyuan Liu 0001. 1331-1352 [doi]
- Crosscoding Through Time: Tracking Emergence & Consolidation Of Linguistic Representations Throughout LLM PretrainingDeniz Bayazit, Aaron Mueller, Antoine Bosselut. 1353-1377 [doi]
- Is EEG-to-Text Feasible in Real-World Scenarios? An In-Depth Analysis Using a Neuropsychology-Inspired BenchmarkZihan Zhang, Yu Bao, Xiao Ding, Tianyi Jiang, Kai Xiong 0002. 1378-1393 [doi]
- ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion ModelingYuxuan Jiang, Zehua Chen 0005, Zeqian Ju, Yusheng Dai, Weibei Dou, Jun Zhu 0001. 1394-1413 [doi]
- PrefixNLI: Detecting Factual Inconsistencies as Soon as They AriseSapir Harary, Eran Hirsch, Aviv Slobodkin, David Wan, Mohit Bansal, Ido Dagan. 1414-1433 [doi]
- RAM-SD: Retrieval-Augmented Multi-agent framework for Sarcasm DetectionZiyang Zhou, Ziqi Liu, Yan Wang, Yiming Lin, Yangbin Chen. 1434-1448 [doi]
- On the Emergence and Test-Time Use of Structural Information in Large Language ModelsMichelle Chao Chen, Moritz Miller, Bernhard Schölkopf, Siyuan Guo 0003. 1449-1465 [doi]
- SAGE: A Search-AuGmented Evaluation of Large Language Models on Free-Form QASher Badshah, Ali Emami, Hassan Sajjad 0001. 1466-1491 [doi]
- J4R: Learning to Judge with Equivalent Initial State Group Relative Policy OptimizationAustin Xu, Yilun Zhou, Xuan-Phi Nguyen, Caiming Xiong, Shafiq Joty. 1492-1511 [doi]
- A Functionality-Grounded Benchmark for Evaluating Web Agents in E-commerce DomainsXianren Zhang, Shreyas Prasad, Di Wang, Qiuhai Zeng, Suhang Wang, Wenbo Yan, Mat Hans. 1512-1528 [doi]
- Reinforcement Learning for Self-Improving Agent with Skill LibraryJiongxiao Wang, Qiaojing Yan, Yawei Wang, Yijun Tian 0001, Soumya Smruti Mishra, Zhichao Xu 0001, Megha Gandhi, Panpan Xu, Lin Lee Cheong. 1529-1550 [doi]
- CachePrune: Teaching LLMs What Not to Follow via KV-Cache EditingRui Wang 0088, Junda Wu, Yu Xia 0007, Tong Yu 0001, Ruiyi Zhang 0002, Ryan A. Rossi, Subrata Mitra, Lina Yao 0001, Julian J. McAuley. 1551-1570 [doi]
- Flip-Flop Consistency: Unsupervised Training for Robustness to Prompt Perturbations in LLMsParsa Hejabi, Elnaz Rahmati, Alireza Salkhordeh Ziabari, Morteza Dehghani. 1571-1587 [doi]
- Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt InjectionZedian Shao, Hongbin Liu 0005, Yuepeng Hu, Neil Zhenqiang Gong. 1588-1604 [doi]
- Logic Matters in Lightweight Hallucination Classification for RAG SystemNingyuan Yang, Kaizhu Huang. 1605-1617 [doi]
- Harnessing Negative Signals: Reinforcement Distillation from Teacher Data for LLM ReasoningShuyao Xu, Cheng Peng, Jiangxuan Long 0002, Weidi Xu, Wei Chu, Yuan Qi. 1618-1639 [doi]
- Grammar Search for Multi-Agent SystemsMayank Singh, Vikas Yadav, Shiva Krishna Reddy Malay, Shravan Nayak, Sai Rajeswar, Sathwik Tejaswi Madhusudhan, Eduardo Blanco 0002. 1640-1655 [doi]
- ZoomR: Memory Efficient Reasoning through Multi-Granularity Key Value RetrievalDavid H. Yang, Yuxuan Zhu 0004, Mohammad Mohammadi Amiri, Keerthiram Murugesan, Tejaswini Pedapati, Subhajit Chaudhury, Pin-Yu Chen. 1656-1669 [doi]
- Explicit Trait Inference for Multi-Agent CoordinationSuhaib Abdurahman, Etsuko Ishii, Katerina Margatina, Divya Bhargavi, Monica Sunkara, Yi Zhang 0001. 1670-1704 [doi]
- SFTMix: Elevating Language Model Instruction Tuning with Mixup RecipeYuxin Xiao, Shujian Zhang, Marzyeh Ghassemi, Wenxuan Zhou 0005. 1705-1718 [doi]
- Psychological Steering in LLMs: An Evaluation of Effectiveness and TrustworthinessAmin Banayeeanzade, Ala N. Tak, Fatemeh Bahrani, Anahita Bolourani, Leonardo Blas, Emilio Ferrara, Jonathan Gratch, Sai Praneeth Karimireddy. 1719-1771 [doi]
- Hierarchical Policy Optimization for Simultaneous Translation of Unbounded SpeechSiqi Ouyang, Shuoyang Ding, Oleksii Hrinchuk, Vitaly Lavrukhin, Brian Yan, Boris Ginsburg, Lei Li 0005. 1772-1787 [doi]
- Act as you think: Reinforcing Consistent Reasoning in Medical Visual Question AnsweringSongtao Jiang, Yuan Wang, Ruizhe Chen, Yan Zhang 0004, Ruilin Luo, Bohan Lei, Yeying Jin, Sibo Song, Zhibo Yang, Jimeng Sun 0001, Jian Wu 0001, Zuozhu Liu. 1788-1805 [doi]
- CRISP: Persistent Concept Unlearning via Sparse AutoencodersTomer Ashuach, Dana Arad, Aaron Mueller, Martin Tutek, Yonatan Belinkov. 1806-1825 [doi]
- LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and VerificationPenghui Yang 0001, Cunxiao Du, Fengzhuo Zhang, Haonan Wang, Tianyu Pang, Chao Du, Bo An 0001. 1826-1844 [doi]
- Using Perspectival Words Is Harder Than Vocabulary Words for Humans - and Even More So for Multimodal Language ModelsDota Tianai Dong, Yifan Luo, Po-Ya Angela Wang, Asli Özyürek, Paula Rubio-Fernández. 1845-1870 [doi]
- CHIMERA: A Knowledge Base of Scientific Idea Recombinations for Research Analysis and IdeationNoy Sternlicht, Tom Hope. 1871-1905 [doi]
- Towards Robust Real-World Spreadsheet Understanding with Multi-Agent Multi-Format ReasoningHouxing Ren, Mingjie Zhan, Zimu Lu, Ke Wang 0036, Yunqiao Yang 0002, Haotian Hou, Hongsheng Li 0001. 1906-1933 [doi]
- GATE: Graph-based Adaptive Tool Evolution Across Diverse TasksJianwen Luo, Yiming Huang, Jinxiang Meng, Fangyu Lei, Shizhu He, Xiao Liu, Shanshan Jiang 0001, Bin Dong 0003, Jun Zhao 0001, Kang Liu 0001. 1934-1961 [doi]
- Erasing Without Remembering: Implicit Knowledge Forgetting in Large Language ModelsHuazheng Wang, Yongcheng Jing, Haifeng Sun 0001, Yingjie Wang, Jingyu Wang, Jianxin Liao, Dacheng Tao. 1962-1994 [doi]
- Mitigating Hallucinations in Large Vision-Language Models without Performance DegradationXingyu Zhu, Junfeng Fang, Shuo Wang 0008, Beier Zhu, Zhicai Wang, Yonghui Yang 0001, Xiangnan He 0001. 1995-2009 [doi]
- APB-V: Accelerating Long-Video Understanding via Sequence-Parallelism-aware Approximate AttentionYuxiang Huang 0001, Mingye Li, Xu Han 0007, Chaojun Xiao, Weilin Zhao, Ao Sun, Ziqi Yuan, Hao Zhou 0012, Fandong Meng, Zhiyuan Liu 0001. 2010-2025 [doi]
- AraVQA: Building a New Arabic Factoid Visual Question Answering Dataset from WikipediaSultan Alrowili, Younes Samih, Abed Alhakim Freihat, Mathan Kumar Eswaran. 2026-2042 [doi]
- What is a protest anyway? Codebook conceptualization is still a first-order concern in LLM-era classificationAndrew Halterman, Katherine A. Keith. 2043-2059 [doi]
- When Misinformation Speaks and Converses: Rethinking Fact-Checking in Audio PlatformsChaewan Chun, Delvin Ce Zhang, Dongwon Lee 0001. 2060-2075 [doi]
- Contextual Relevance and Adaptive Sampling for LLM-Based Document RerankingJerry Huang, Siddarth Madala, Cheng Niu, Julia Hockenmaier, Tong Zhang 0001. 2076-2089 [doi]
- Quantifying Aleatoric Uncertainty of In-Context Learning for Robust Measure of LLM Prediction ConfidenceJinseok Chung, MinKyoung Song, Hyunji Jung, Namhoon Lee. 2090-2108 [doi]
- SATQuest: A Verifier for Logical Reasoning Evaluation and Reinforcement Fine-Tuning of LLMsYanxiao Zhao, Yaqian Li, Zihao Bo, Rinyoichi Takezoe, Haojia Hui, Mo Guang, Lei Ren, Xiaolin Qin, Kaiwen Long. 2109-2131 [doi]
- Not All Directions Matter: Towards Structured and Task-Aware Low-Rank Model AdaptationXi Xiao, Chenrui Ma, Yunbei Zhang, Chen Liu 0020, Zhuxuanzi Wang, Yanshu Li, Lin Zhao, Guosheng Hu, Tianyang Wang 0004, Hao Xu. 2132-2154 [doi]
- ReContraster: Making Your Posters Stand Out with Regional ContrastPeixuan Zhang, Zijian Jia, Ziqi Cai, Shuchen Weng, Si Li 0001, Boxin Shi. 2155-2171 [doi]
- Mechanistic Interpretability Should Prioritize Feature Consistency in Sparse AutoencodersXiangchen Song, Aashiq Muhamed, Yujia Zheng 0001, Lingjing Kong, Zeyu Tang 0002, Mona T. Diab, Virginia Smith, Kun Zhang 0001. 2172-2210 [doi]
- EquivPruner: Boosting Efficiency and Quality in LLM-Based Search via Action PruningJiawei Liu, Qisi Chen, Jianshu Zhang, Quan Liu, Defu Lian. 2211-2226 [doi]
- From Data-Centric to Sample-Centric: Enhancing LLM Reasoning via Progressive OptimizationXinjie Chen, Minpeng Liao, Guoxin Chen, Chengxi Li 0014, Biao Fu, Kai Fan 0002, Xinggao Liu. 2227-2242 [doi]
- CARES: Context-Aware Resolution Selector for VLMsMoshe Kimhi, Nimrod Shabtay, Raja Giryes, Chaim Baskin, Eli Schwartz. 2243-2256 [doi]
- ChatR1: Reinforcement Learning for Conversational Reasoning and Retrieval Augmented Question AnsweringSimon Lupart, Mohammad Aliannejadi, Evangelos Kanoulas. 2257-2274 [doi]
- Think in Sentences: Explicit Sentence Boundaries Enhance Language Model's CapabilitiesZhichen Liu, Yongyuan Li, Yang Xu. 2275-2288 [doi]
- MORPHOGEN: A Multilingual Benchmark for Evaluating Gender-Aware Morphological GenerationMehul Agarwal, Aditya Aggarwal, Arnav Goel, Medha Hira, Anubha Gupta. 2289-2313 [doi]
- TeRA: Vector-based Random Tensor Network for High-Rank Adaptation of Large Language ModelsYuxuan Gu 0005, Wuyang Zhou, Giorgos Iacovides, Danilo P. Mandic. 2314-2329 [doi]
- GenDis: Generative-Discriminative Dual-View Co-Training for Generalized Category DiscoveryXi Chen 0073, Chuan Qin 0002, Jinpeng Li, Shasha Hu, Chao Wang 0086, Hengshu Zhu, Hui Xiong 0001. 2330-2351 [doi]
- CodeHacker: Automated Test Case Generation for Detecting Vulnerabilities in Competitive Programming SolutionsJingwei Shi, Xinxiang Yin, Jing Huang, Shengyu Tao, Jinman Zhao. 2352-2382 [doi]
- Identifying Bias in Machine-generated Text DetectionKevin Stowe, Svetlana Afanaseva, Rodolfo Raimundo, Yitao Sun, Kailash Patil. 2383-2395 [doi]
- DE-CLIP: Few-Shot Anomaly Detection via Difference-Guided Embedding EditingYage Zhang, Yukun Jiang 0001, Michael Backes 0001, Yang Zhang 0016. 2396-2407 [doi]
- Culinary Crossroads: A RAG Framework for Enhancing Diversity in Cross-Cultural Recipe AdaptationTianyi Hu, Andrea Morales-Garzón, Jingyi Zheng, Maria Maistro, Daniel Hershcovich. 2408-2423 [doi]
- Mixture-of-Minds: Multi-Agent Reinforcement Learning for Table UnderstandingYuhang Zhou, Mingrui Zhang, Ke Li, Mingyi Wang, Qiao Liu, Qifei Wang, Jiayi Liu, Fei Liu, Serena Li, Weiwei Li 0006, Mingze Gao, Abhishek Kumar, Xiangjun Fan, Zhuokai Zhao, Lizhu Zhang. 2424-2439 [doi]
- MMCLIP: Cross-Modal Attention Masked Modelling for Medical Language-Image Pre-TrainingBiao Wu 0006, Yutong Xie 0001, Zeyu Zhang 0006, Vu Minh Hieu Phan, Qi Chen 0014, Ling Chen 0006, Qi Wu 0001. 2440-2455 [doi]
- MMSearch-R1: Incentivizing LMMs to SearchJinming Wu, Zihao Deng, Wei Li 0119, Yiding Liu, Bo You, Bo Li 0080, Zejun Ma 0001, Ziwei Liu 0002. 2456-2487 [doi]
- Toward Secure Tuning: Mitigating Security Risks from Instruction Fine-TuningYanrui Du, Fenglei Fan, Sendong Zhao, Jiawei Cao, Ming Ma, Danyang Zhao, Shuren Qi, Ting Liu 0001, Bing Qin 0001. 2488-2506 [doi]
- SDE-SQL: Enhancing Text-to-SQL Generation in Large Language Models via Self-Driven Exploration with SQL ProbesWenxuan Xie, Yaxun Dai, Wenhao Jiang. 2507-2525 [doi]
- Splits! Flexible Sociocultural Linguistic Investigation at ScaleEylon Caplan, Tania Chakraborty, Dan Goldwasser. 2526-2550 [doi]
- Thinking beyond the anthropomorphic paradigm benefits LLM researchLujain Ibrahim, Myra Cheng. 2551-2563 [doi]
- Coordinating Search-Informed Reasoning and Reasoning-Guided Search in Claim VerificationQisheng Hu, Quanyu Long, Wenya Wang 0001. 2564-2585 [doi]
- Breaking the Generator Barrier: Disentangled Representation for Generalizable AI-Text DetectionXiao Pu 0002, Zepeng Cheng, Lin Yuan 0002, Yu Wu 0001, Xiuli Bi. 2586-2598 [doi]
- PUPPET: Neural-Symbolic Standardized Patients for Mental HealthChen Xu, Yu Ji, Zhenyu Lv, Yang Yi 0017, Yizhe Yang, Luyao Ji, Chaoyi Chen, Xianyang Wang, Tian Lan 0003, Zhihua Wang, Juan Wang, Xunde Dong, Fuze Tian, Qunxi Dong, Bin Hu 0001. 2599-2634 [doi]
- LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?Jingyuan Wang 0001, Yankai Chen 0001, Zhonghang Li 0004, Chao Huang 0001. 2635-2663 [doi]
- OneRec-Think: In-Text Reasoning for Generative RecommendationZhanyu Liu, Shiyao Wang 0001, Xingmei Wang 0001, Rongzhou Zhang, Jiaxin Deng, Honghui Bao, Jinghao Zhang, Wuchao Li, Penggei Zheng, Xiangyu Wu, Yifei Hu, Qigen Hu, Xinchen Luo, Lejian Ren, Zixing Zhang 0008, Qianqian Wang, Kuo Cai, Yunfan Wu 0001, Hongtao Cheng, Zexuan Cheng, Lu Ren, Huanjie Wang, Yi Su, Ruiming Tang, Kun Gai, Guorui Zhou. 2664-2681 [doi]
- AwarenessBench: Assessing Cognitive Capabilities of Language ModelsXiaojian Li, Rongwu Xu, Tianyun Zhang, Yue Wang, Shuo Chen, Qiner Lyu, Briana Zhang, Peiran Yang, Kyle Xue Chen, Haoyuan Shi, Yu Wang, Wei Xu. 2682-2741 [doi]
- Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations ReasoningRui Pu, Chaozhuo Li, Rui Ha, Litian Zhang, Lirong Qiu, Xi Zhang 0008. 2742-2759 [doi]
- SCAN: Structured Capability Assessment and Navigation for LLMsZongqi Wang, Tianle Gu, Chen Gong, Xin Tian, Siqi Bao, Yujiu Yang 0001. 2760-2799 [doi]
- EMCEE: Improving Multilingual Capability of LLMs via Bridging Knowledge and Reasoning with Extracted Synthetic Multilingual ContextHamin Koo, Jaehyung Kim. 2800-2822 [doi]
- Can LLMs Learn to Map the World from Local Descriptions?Sirui Xia, Aili Chen, Xintao Wang 0001, Tinghui Zhu, Yikai Zhang 0004, Jiangjie Chen, Yanghua Xiao. 2823-2845 [doi]
- LEASH: Adaptive Length Penalty and Reward Shaping for Efficient Large Reasoning ModelYanhao Li, Lu Ma, Jiaran Zhang, Lexiang Tang, Wentao Zhang, Guibo Luo. 2846-2856 [doi]
- ALIGN: Word Association Learning for Cultural Alignment in Large Language ModelsChunhua Liu, Kabir Manandhar Shrestha, Sukai Huang. 2857-2879 [doi]
- RealTalk-CN: A Realistic Chinese Speech Task-Oriented Dialogue Benchmark with Cross-Modal AnalysisEnzhi Wang, Jiaming Zhou 0001, Yuhang Jia, Aobo Kong, Qicheng Li, Yong Qin. 2880-2897 [doi]
- HOPE: Hybrid Optimized Parallel Encoding with Supervised and Unsupervised Semantic Fusion for Depression Symptom DetectionTu-Phuong Mai, Minh-Ha H. Le, Duc-Luong Tran, Phuong-Anh Chu, Duy-Cat Can, Hoang-Quynh Le. 2898-2911 [doi]
- Bias Fitting to Mitigate Length Bias of Reward Model in RLHFKangwen Zhao, Jianfeng Cai 0008, Jinhua Zhu 0001, Ruopei Sun, Dongyun Xue, Wengang Zhou 0001, Li Li 0040, Houqiang Li. 2912-2927 [doi]
- Rethinking Sample Polarity in Reinforcement Learning with Verifiable RewardsXinyu Tang 0004, Yuliang Zhan, Zhixun Li, Xin Zhao 0018, Zhenduo Zhang, Zujie Wen, Zhiqiang Zhang 0012, Jun Zhou 0011. 2928-2954 [doi]
- Beyond Examples: Towards Automated Thought-level In-Context Reasoning for Large Language ModelsJinyang Wu, Mingkuan Feng, Shuai Zhang 0014, Feihu Che, Zhengqi Wen, Chonghua Liao, Ling Yang, Haoran Luo, Zheng Lian 0004, Jianhua Tao 0001. 2955-2995 [doi]
- Two-Stage Regularization-Based Structured Pruning for LLMsMingkuan Feng, Jinyang Wu, Siyuan Liu, Shuai Zhang 0014, Hongjian Fang, Ruihan Jin, Feihu Che, Pengpeng Shao, Zhengqi Wen, Jianhua Tao 0001. 2996-3012 [doi]
- K-Merge: Online Continual Merging of Adapters for On-device Large Language ModelsDonald Shenaj, Ondrej Bohdal, Taha Ceritli, Mete Ozay, Pietro Zanuttigh, Umberto Michieli. 3013-3029 [doi]
- SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream QuantizationWenxi Chen, Ruiqi Yan, Yushen Chen, Zhikang Niu, Ziyang Ma 0001, Xiquan Li, Yuzhe Liang, Wenhan Lin, Shunshun Yin, Ming Tao, Xinsheng Wang, Xie Chen 0001. 3030-3048 [doi]
- CriticLean: Critic-Guided Reinforcement Learning for Mathematical FormalizationZhongyuan Peng, Yifan Yao, Kaijing Ma, Shuyue Guo, Yizhe Li, Yichi Zhang 0010, Chenchen Zhang, Yifan Zhang, Zhouliang Yu, Luming Li, Minghao Liu 0003, Yihang Xia, Jiawei Shen, Yuchen Wu, Yixin Cao 0002, Zhaoxiang Zhang 0001, Wenhao Huang 0001, Jiaheng Liu, Ge Zhang 0009. 3049-3088 [doi]
- TRACE: Evaluating Execution Efficiency of LLM-Based Code TranslationZhihao Gong, Zeyu Sun 0004, Dong Huang 0005, Qingyuan Liang, Jie M. Zhang, Dan Hao 0001. 3089-3117 [doi]
- One Tokenizer To Rule Them All: Emergent Language Plasticity via Multilingual TokenizersDiana Abagyan, Alejandro Salamanca, Andrés Felipe Cruz-Salinas, Kris Cao, Hangyu Lin, Acyr Locatelli, Marzieh Fadaee, Ahmet Üstün, Sara Hooker. 3118-3136 [doi]
- It's Not What You Say, It's How You Say It: Evaluating LLM Responses to Expressions of BeliefKevin Du, Clara Kümpel, Michelle Wastl, Alex Warstadt. 3137-3151 [doi]
- CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference OptimizationJunyi Li, Yongqiang Chen, Ningning Ding. 3152-3170 [doi]
- DIA-HARM: Dialectal Disparities in Harmful Content Detection Across 50 English DialectsJason S. Lucas, Matt Murtagh-White, Ali Al-Lawati, Uchendu Uchendu, Adaku Uchendu, Dongwon Lee 0001. 3171-3214 [doi]
- Towards Scalable Lifelong Knowledge Editing with Selective Knowledge SuppressionDahyun Jung, Jaewook Lee 0008, HeuiSeok Lim. 3215-3231 [doi]
- Optimizing Length Compression in Large Reasoning ModelsZhengxiang Cheng, Dongping Chen, Mingyang Fu, Tianyi Zhou 0001. 3232-3250 [doi]
- Bridging Language and Items for Retrieval and Recommendation: Benchmarking LLMs as Semantic EncodersYupeng Hou, Jiacheng Li 0003, Xiangjun Fu, Zhankui He, An Yan 0003, Xiusi Chen, Julian J. McAuley. 3251-3265 [doi]
- Evolutionary Guided Decoding: Iterative Value Refinement for LLMsZhenhua Liu, Lijun Li, Ruizhe Chen, YuXian Jiang, Tong Zhu 0002, Zhaochen Su, Wenliang Chen, Jing Shao. 3266-3283 [doi]
- CRAFT: Training-Free Cascaded Retrieval for Tabular QAAdarsh Singh, Kushal Raj Bhandari, Jianxi Gao, Soham Dan, Vivek Gupta. 3284-3298 [doi]
- Evaluating Legal Reasoning Traces with Legal Issue Tree RubricsJinu Lee 0001, Kyoung-woon On, Sophia Simeng Han, Arman Cohan, Julia Hockenmaier. 3299-3322 [doi]
- KG-MuLQA: A Framework for KG-based Multi-Level QA Extraction and Long-Context LLM EvaluationNikita Tatarinov, Vidhyakshaya Kannan, Haricharana Srinivasa, Arnav Raj, Harpreet Singh Anand, Varun Singh, Aditya Luthra, Ravij Lade, Agam Shah, Sudheer Chava. 3323-3359 [doi]
- COMPASS: Enhancing Agent Long-Horizon Reasoning with Evolving ContextGuangya Wan, Mingyang Ling 0001, Xiaoqi Ren, Rujun Han, Sheng Li 0001, Zizhao Zhang. 3360-3380 [doi]
- BracketRank: Large Language Model Document Ranking via Reasoning-based Competitive EliminationAbdelrahman Abdallah, Mohammed Ali, Bhawna Piryani, Adam Jatowt. 3381-3397 [doi]
- Multi-component Causal Tracing in Large Language ModelsZirui Yan, Dennis Wei, Dmitriy A. Katz, Prasanna Sattigeri, Ali Tajer. 3398-3418 [doi]
- Sparse Feature Coactivation Reveals Causal Semantic Modules in Large Language ModelsRuixuan Deng, Xiaoyang Hu, Miles Gilberti, Shane Storks, Aman Taxali, Mike Angstadt, Chandra Sekhar Sripada, Joyce Chai. 3419-3451 [doi]
- TensorLens: End-to-End Transformer Analysis via High-Order Attention TensorsIdo Andrew Atad, Itamar Zimerman, Shahar Katz, Lior Wolf. 3452-3468 [doi]
- Inferring Events from Time Series using Language ModelsMingtian Tan, Mike A. Merrill, Zachary Gottesman, Tim Althoff, David Evans, Thomas Hartvigsen. 3469-3490 [doi]
- OASIS: Online Sample Selection for Continual Instruction TuningMinJae Lee, Minhyuk Seo, Tingyu Qu, Tinne Tuytelaars, Jonghyun Choi. 3491-3515 [doi]
- Make Mechanistic Interpretability Auditable: A Call to Develop Guidelines via Continuous Collaborative ReviewingMichael Lan, Narmeen Fatimah Oozeer, Chaithanya Bandi, Philip Quirke, Austin Meek, Fazl Barez, Amir Abdullah. 3516-3540 [doi]
- Mitigating Context Interference for Reliable and Efficient Search AgentsBoyang Xue, Bin Wu 0025, Shuofei Qiao, Sheng Wang, Rui Wang 0092, Yiming Du, Hongru Wang 0003, Jeff Z. Pan, Emine Yilmaz, Kam-Fai Wong, Aldo Lipani. 3541-3558 [doi]
- Chunks as Arms: Multi-Armed Bandit-Guided Sampling for Long-Context LLM Preference OptimizationShaohua Duan, Pengcheng Huang 0004, Xinze Li, Zhenghao Liu 0001, Xiaoyuan Yi, Yukun Yan, Shuo Wang 0013, Yu Gu 0002, Ge Yu 0001, Maosong Sun 0001. 3559-3575 [doi]
- Long Context Modeling with Ranked Memory-Augmented RetrievalGhadir Alselwi, Hao Xue 0001, Shoaib Jameel, Basem Suleiman, Flora D. Salim, Imran Razzak. 3576-3590 [doi]
- A Comprehensive Survey of Process Reward Models: Data Generation, Model Construction, and UsageCongmin Zheng, Jiachen Zhu 0001, Zhuoying Ou, Yuxiang Chen, Kangning Zhang, Rong Shan, Zeyu Zheng, Mengyue Yang, Jianghao Lin, Yong Yu 0001, Weinan Zhang 0001. 3591-3607 [doi]
- CODERL+: Improving Code Generation via Reinforcement with Execution Semantics AlignmentXue Jiang, Yihong Dong, Mengyang Liu, Hongyi Deng, Tian Wang, Yongding Tao, Zhi Jin 0001, Wenpin Jiao, Ge Li 0001. 3608-3622 [doi]
- Saber: Efficient Sampling with Adaptive Acceleration and Backtracking Enhanced Remasking for Diffusion Language Model in Code GenerationYihong Dong, Zhaoyu Ma, Xue Jiang, Zhiyuan Fan, Jiaru Qian, Yongmin Li, Jianha Xiao, Zhi Jin, Ge Li. 3623-3642 [doi]
- Debiased Orthogonal Boundary-Driven Efficient Noise MitigationHao Li, Jiayang Gu, Jingkuan Song, An Zhang 0003, Lianli Gao. 3643-3662 [doi]
- Collaborative Chain-of-Agents for Parametric-Retrieved Knowledge SynergyYi Jiang, Sendong Zhao, Jianbo Li, Haochun Wang, Lizhe Zhang, Yan Liu, Bing Qin 0001. 3663-3680 [doi]
- APPSI-139: A Parallel Corpus of English Application Privacy Policy Summarization and InterpretationPengyun Zhu, Qiheng Sun, Long Wen, Yanbo Wang, Yang Cao 0011, Junxu Liu, Deyi Xiong, Jinfei Liu, Zhibo Wang 0001, Kui Ren 0001. 3681-3706 [doi]
- Compressing then Matching: An Efficient Pre-training Paradigm for Multimodal EmbeddingDa Li 0003, Yuxiao Luo, Keping Bi, Jiafeng Guo, Wei Yuan, Biao Yang, Yan Wang, Fan Yang 0094, Tingting Gao, Guorui Zhou. 3707-3718 [doi]
- LLM-XTM: Enhancing Cross-Lingual Topic Models with Large Language ModelsMinh Chu Xuan, Tien-Phat Nguyen, Linh Ngo Van 0001, Dinh Viet Sang, Nguyen Thi Ngoc Diep, Trung Le 0001. 3719-3737 [doi]
- Open Your Model's Eyes: Video and Context-Aware Multimodal Backchannel PredictionMin-jae Kim, Jun-Yeong Moon, Mujeen Sung, Gyeong-Moon Park. 3738-3755 [doi]
- Bringing Real-World Relations into Video Generation with Graph-Structured KnowledgeJoonhyung Park, Jaeyun Song, Sihwan Park 0001, Eunho Yang. 3756-3771 [doi]
- FC-TTS: Style and Timbre Control in Zero-Shot Text-to-Speech with Disentangled Speech RepresentationsYoonhyung Lee, Hyunsin Park, Jinhwan Park, JinKyu Lee. 3772-3791 [doi]
- SAGE: Sparse Adaptive Guidance for Dependency-Aware Tabular Data GenerationShuo Yang, Zheyu Zhang 0007, Bardh Prenkaj, Gjergji Kasneci. 3792-3807 [doi]
- Mask-to-Correct⁺: Leveraging Retriever Diversity for Masking-guided Faithful Fact CorrectionPayel Santra, Lavisha Sharma, Madhusudan Ghosh, Partha Basuchowdhuri. 3808-3825 [doi]
- Native Hybrid Attention for Efficient Sequence ModelingJusen Du, Jiaxi Hu, Zhang Tao, Weigao Sun, Yu Cheng 0001. 3826-3842 [doi]
- UniversalRAG: Retrieval-Augmented Generation over Corpora of Diverse Modalities and GranularitiesWoongyeong Yeo, Kangsan Kim, Soyeong Jeong, Jinheon Baek, Sung Ju Hwang. 3843-3871 [doi]
- Crossing the Reward Bridge: Expanding Reinforcement Learning with Verifiable Rewards Across Diverse DomainsYi Su 0006, Dian Yu 0001, Linfeng Song, Juntao Li 0005, Haitao Mi, Zhaopeng Tu, Min Zhang 0005, Dong Yu 0001. 3872-3892 [doi]
- From ID to LLM: Rethinking Representation Learning for RecommendationSong-Li Wu, Zhaocheng Du, Weinan Gan, Jingyi Wang, Xianquan Wang. 3893-3905 [doi]
- DMHM: Density-aware Manifold Learning and Hybrid Mahalanobis Energy for LLMs-generated Text DetectionTianle Liu, Zhiliang Tian, Zhen Huang 0006, Tianlun Liu, Jingyuan Huang, Zhaoning Zhang 0001, Chengcheng Shao, Dongsheng Li 0001. 3906-3929 [doi]
- Dynamic Emotion and Personality Profiling for Multimodal Deception DetectionLi Zheng, Yanyi Luo, Hao Fei 0001, Yuzhe Ding, Yujie Huang, Fei Li, Chong Teng, Donghong Ji. 3930-3940 [doi]
- Can We Predict Before Executing Machine Learning Agents?Jingsheng Zheng, Jintian Zhang, Yujie Luo, Yuren Mao, Yunjun Gao, Lun Du, Huajun Chen, Ningyu Zhang 0001. 3941-3974 [doi]
- IMPACT: Importance-Aware Activation Space ReconstructionMd Mokarram Chowdhury, Daniel Agyei Asante, Ernie Chang, Yang Li. 3975-3992 [doi]
- SOS-LoRA: Static Orthogonal-Subspace Low-Rank Adaptation with Fixed Multi-Scale ScalingYupeng Chang, Yuan Wu 0002, Yi Chang 0001. 3993-4005 [doi]
- SDiaReward: Modeling and Benchmarking Spoken Dialogue Rewards with Modality and ColloquialnessJingyu Lu 0001, Yuhan Wang, Fan Zhuo, Xize Cheng, Changhao Pan, Xueyi Pu, Yifu Chen, Chenyuhao Wen, Tianle Liang, Zhou Zhao 0001. 4006-4028 [doi]
- Looking at Radiology Report Generation through a Causal Lens: A SurveySatyam Kumar, Kaustubh Shivshankar Shejole, Pushpak Bhattacharyya. 4029-4057 [doi]
- CTTA-T: Continual Test-Time Adaptation for Text Understanding via Teacher-Student with a Domain-aware and Generalized TeacherTianlun Liu, Zhiliang Tian, Zhen Huang, Xingzhi Zhou 0002, Wanlong Yu, Tianle Liu, Feng Liu, Dongsheng Li. 4058-4078 [doi]
- Adam's Law: Textual Frequency Law on Large Language ModelsHongyuan Lu, Zixuan Li, Zefan Zhang, Bowen Cao, Wai Lam. 4079-4105 [doi]
- Disco-RAG: Discourse-Aware Retrieval-Augmented GenerationDongqi Liu, Hang Ding, Qiming Feng, Xurong Xie, Zhucun Xue, Chengjie Wang 0001, Jian Li 0062, Jiangning Zhang, Yabiao Wang. 4106-4136 [doi]
- Stable Language Guidance for Vision-Language-Action ModelsZhihao Zhan, Yuhao Chen, Jiaying Zhou, Qinhan Lyu, Hao Liu, Keze Wang, Liang Lin 0004, Guangrun Wang. 4137-4159 [doi]
- Controlling Multimodal Conversational Agents with Coverage-Enhanced Latent ActionsYongqi Li 0002, Hao Lang, Tieyun Qian, Yongbin Li 0001. 4160-4180 [doi]
- Guaranteeing Knowledge Integration with Joint Decoding for Retrieval-Augmented GenerationZhengyi Zhao 0001, Shubo Zhang, Zezhong Wang 0004, Yuxi Zhang, Huimin Wang, Yutian Zhao, Yefeng Zheng 0001, Binyang Li, Kam-Fai Wong, Xian Wu 0001. 4181-4205 [doi]
- Are Emotion and Rhetoric Neurons in LLM? Neuron Recognition and Adaptive Masking for Emotion-Rhetoric Prediction SteeringLi Zheng, Xin Zhang, Shuyi He, Fei Li 0021, Chong Teng, Jiang-Ming Yang, Donghong Ji, Zhuang Li 0001. 4206-4216 [doi]
- Towards Fine-Grained and Multi-Granular Contrastive Language-Speech Pre-trainingYifan Yang 0005, Bing Han 0008, Hui Wang 0075, Wei Wang 0010, Ziyang Ma 0001, Long Zhou, Zengrui Jin, Guanrou Yang, Tianrui Wang, Xu Tan 0003, Xie Chen 0001. 4217-4235 [doi]
- Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression MethodsChenfei Liao, Wensong Wang, Zichen Wen, Xu Zheng 0002, Yiyu Wang, Haocong He, Yuanhuiyi Lyu, Lutao Jiang, Xin Zou 0001, Yuqian Fu, Bin Ren 0005, Linfeng Zhang 0001, Xuming Hu. 4236-4253 [doi]
- Retrieval as Generation: A Unified Framework with Self-Triggered Information PlanningBo Li, Mingda Wang, Gexiang Fang, Shikun Zhang, Wei Ye. 4254-4274 [doi]
- Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMsShei Pern Chua, Zhen Leng Thai, Kai Jun Teh, Xiao Li, Qibing Ren, Xiaolin Hu. 4275-4310 [doi]
- EventWeave: A Dynamic Framework for Capturing Core and Supporting Events in Dialogue SystemsZhengyi Zhao 0001, Shubo Zhang, Yiming Du, Bin Liang 0004, Baojun Wang, Zhongyang Li, Binyang Li, Kam-Fai Wong. 4311-4339 [doi]
- Deliberative Searcher: Improving LLM Reliability via Reinforcement Learning with ConstraintsZhenyun Yin, Shujie Wang, Xuhong Wang, Xingjun Ma, Yingchun Wang 0004. 4340-4354 [doi]
- Thermometer of Thoughts: Enhancing LLM's Exploration via Attention Temperature ModulationZhiyuan Yu, Shijian Xiao, Cam-Tu Nguyen, Zhangyue Yin, Lekai Xing, Wenzhong Li, Sanglu Lu. 4355-4368 [doi]
- CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code GenerationSizhe Wang, Zhengren Wang, Dongsheng Ma, Yongan Yu, Rui Ling, Zhiyu Li, Feiyu Xiong, Wentao Zhang. 4369-4402 [doi]
- REFLEX: Self-Refining Explainable Fact-Checking via Verdict-Anchored Style ControlChuyi Kong, Wei Gao 0001, Jing Ma 0004, Hongzhan Lin 0001, Yuxi Sun 0011. 4403-4431 [doi]
- Illusions of Confidence? Diagnosing LLM Truthfulness via Neighborhood ConsistencyHaoming Xu, Ningyuan Zhao, Yunzhi Yao, Weihong Xu, Hongru Wang 0003, Xinle Deng, Shumin Deng, Jeff Z. Pan, Huajun Chen, Ningyu Zhang 0001. 4432-4457 [doi]
- Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document UnderstandingSensen Gao, Shanshan Zhao, Xu Jiang, Lunhao Duan, Yong Xien Chng, Qing-Guo Chen, Weihua Luo, Kaifu Zhang, Jia-Wang Bian, Mingming Gong. 4458-4489 [doi]
- Beyond Literal Mapping: Benchmarking and Improving Non-Literal Translation EvaluationYanzhi Tian, Cunxiang Wang, Zeming Liu, Heyan Huang, Wenbo Yu, Dawei Song, Jie Tang 0001, Yuhang Guo 0001. 4490-4524 [doi]
- G²RPO-A: Guided Group Relative Policy Optimization with Adaptive GuidanceYongxin Guo 0001, Wenbo Deng, Zhenglin Cheng, Xiaoying Tang 0002. 4525-4539 [doi]
- Efficient Low-Resource Language Adaptation via Multi-Source Dynamic Logit FusionChen Zhang, Jiuheng Lin, Zhiyuan Liao, Yansong Feng 0002. 4540-4557 [doi]
- Open Schrödinger's Closed Box: Identifying Retrieval Augmented Generation in API-Accessible Large Language Model ServicesYukun Jiang 0001, Xinyue Shen 0001, Michael Backes 0001, Zheng Li 0023, Yang Zhang 0016. 4558-4580 [doi]
- AFT-Tab: Adversarial Fine-Tuning for Tabular Data Synthesis with Long Text ColumnsYuhao Zhang, Liang Yan, Shaoming Duan, Xinyu Zha, Jinhang Su, Peiyi Han, Chuanyi Liu. 4581-4594 [doi]
- Revisiting a Pain in the Neck: A Semantic Reasoning Benchmark for Language ModelsYang Liu, Hongming Li, Melissa Xiaohui Qin, Chao Huang, Qiankun Liu. 4595-4618 [doi]
- Timely Machine: Awareness of Time Makes Test-Time Scaling AgenticYichuan Ma, Linyang Li, Yongkang Chen, Peiji Li, Xiaozhe Li, Qipeng Guo, Dahua Lin, Kai Chen 0026. 4619-4636 [doi]
- Multi-Granularity Semantic Revision for Large Language Model DistillationXiaoyu Liu 0006, Yun Zhang, Wei Li 0002, Simiao Li, Xudong Huang, Hanting Chen, Yehui Tang 0001, Jie Hu 0021, Zhiwei Xiong, Yunhe Wang 0001. 4637-4658 [doi]
- RADO: Reasoning Audit-Driven Optimization for Rigorous Reasoning in High-Stakes DomainsZhijie Tan, Xu Chu 0001, Guanyu Wang 0002, Ziyu Li, Weiping Li 0002, Tong Mo. 4659-4683 [doi]
- Instruction Data Selection via Answer DivergenceBo Li, Mingda Wang, Shikun Zhang, Wei Ye. 4684-4702 [doi]
- Interpretable Safety Alignment via SAE-Constructed Low-Rank Subspace AdaptationDianyun Wang, Qingsen Ma, Yuhu Shang, Zhifeng Lu, Zhenbo Xu, Lechen Ning, Huijia Wu, Zhaofeng He 0001. 4703-4721 [doi]
- D²Plan: Dual-Agent Dynamic Global Planning for Complex Retrieval-Augmented ReasoningKangcheng Luo, Tinglang Wu, Yansong Feng 0002. 4722-4754 [doi]
- Instructions are all you need: Self-supervised Reinforcement Learning for Instruction FollowingQingYu Ren, Qianyu He, Powei Chang, Jie Zeng 0003, Zeye Sun, Fei Yu, Jiaqing Liang, Yanghua Xiao. 4755-4776 [doi]
- Analytical FFN-to-MoE Restructuring via Activation Pattern AnalysisZehua Pei, Hui-Ling Zhen, Lancheng Zou, Xianzhi Yu, Wulong Liu, Sinno Jialin Pan, Mingxuan Yuan, Bei Yu 0001. 4777-4789 [doi]
- Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage OptimizationXu Chu, Guanyu Wang, Zhijie Tan, Xinrong Chen, Ziyu Li, Tong Mo, Weiping Li. 4790-4805 [doi]
- Revitalizing Black-Box Interpretability: Actionable Interpretability for LLMs via Proxy ModelsJunhao Liu, Haonan Yu, Zhenyu Yan, Xin Zhang. 4806-4844 [doi]
- MedMCP-Calc: Benchmarking LLMs for Realistic Medical Calculator Scenarios via MCP IntegrationYakun Zhu, Yutong Huang, Shengqian Qin, Zhongzhen Huang, Shaoting Zhang 0001, Xiaofan Zhang 0002. 4845-4873 [doi]
- Uncovering Temporal Framing in the NewsTarek Mahmoud, Veronika Solopova, Premtim Sahitaj, Ariana Sahitaj, Max Upravitelev, Mervat Abassy, Hana Fatima Shaikh, Neda Foroutan, Vera Schmitt, Preslav Nakov. 4874-4902 [doi]
- Simple-VGC: Enhancing Visual Grounding in Multimodal Reasoning via Adaptive Tool CompositionYe Wang, Qianglong Chen, Siyuan Wang, Zejun Li, Shijie Guo, Zhirui Zhang, Zhongyu Wei. 4903-4929 [doi]
- Enhancing Lexical Relation Mining with Structured Sememe KnowledgeHansi Wang, Qiliang Liang, Yue Wang, Yang Liu. 4930-4947 [doi]
- Look Less, Reason More: Rollout-Guided Adaptive Pixel-Space ReasoningXuchen Li 0001, Xuzhao Li, Jiahui Gao, Renjie Pi, Shiyu Hu, Wentao Zhang 0001. 4948-4967 [doi]
- Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language ModelsXin Cheng 0002, Wangding Zeng, Damai Dai, Qinyu Chen, Bingxuan Wang, Zhenda Xie, Kezhao Huang, Xingkai Yu, Zhewen Hao, Han Zhang, Yukun Li, Huishuai Zhang, Dongyan Zhao 0001, Wenfeng Liang. 4968-4990 [doi]
- PII-Bench: Evaluating Query-Aware Privacy Protection SystemsHao Shen, Zhouhong Gu, Haokai Hong, Weili Han, Hongfeng Chai. 4991-5026 [doi]
- GenProve: Learning to Generate Text with Fine-Grained ProvenanceJingxuan Wei, Xingyue Wang, Yanghaoyu Liao, Jie Dong, Yuchen Liu, Caijun Jia, Bihui Yu, Junnan Zhu. 5027-5048 [doi]
- Rethinking Meeting Effectiveness: A Benchmark and Framework for Temporal Fine-grained Automatic Meeting Effectiveness EvaluationYihang Li, Chenhui Chu. 5049-5066 [doi]
- AgentOCR: Reimagining Agent History via Optical Self-CompressionLang Feng 0002, Fuchao Yang, Feng Chen, Xin Cheng 0007, Haiyang Xu 0001, Zhenglin Wan, Ming Yan 0008, Bo An 0001. 5067-5086 [doi]
- MCP-Flow: Facilitating LLM Agents to Master Real-World, Diverse and Scaling MCP ToolsWenhao Wang 0002, Peizhi Niu, Zhao Xu, Zhaoyu Chen, Jian Du, Yaxin Du, Xianghe Pang, Keduan Huang, Yanfeng Wang, Qiang Yan, Siheng Chen. 5087-5116 [doi]
- Everyone is unique: Towards Behaviorally Heterogeneous Negotiation Dialogue Systems for Debt CollectionYuhang Yang, Kai Tang, Chao Ye 0002, Haobo Wang 0001, Qiqi Luo, Jin Guang Zheng, Zhixin Zhang. 5117-5151 [doi]
- Beyond the Crowd: LLM-Augmented Community Notes for Governing Health MisinformationJiaying Wu, Zihang Fu, Haonan Wang, Fanxiao Li, Jiafeng Guo, Preslav Nakov, Min-Yen Kan. 5152-5171 [doi]
- BaseCal: Unsupervised Confidence Calibration via Base Model SignalsHexiang Tan, Wanli Yang, Junwei Zhang, Xin Chen, Rui Tang, Du Su, Jingang Wang, Yuanzhuo Wang, Fei Sun 0001, Xueqi Cheng. 5172-5187 [doi]
- Beyond the Final Actor: Modeling the Dual Roles of Creator and Editor for Fine-Grained LLM-Generated Text DetectionYang Li 0196, Qiang Sheng 0001, Zhengjia Wang 0001, YeHan Yang, Danding Wang, Juan Cao 0001. 5188-5203 [doi]
- PILOT: Planning via Internalized Latent Optimization Trajectories for Large Language ModelsHaoyu Zheng, Yun Zhu 0007, Yuqian Yuan, Bo Yuan, Wenqiao Zhang, Siliang Tang, Jun Xiao 0001. 5204-5222 [doi]
- Miner: Mining Intrinsic Mastery for Data-Efficient RL in Large Reasoning ModelsShuyang Jiang, Yuhao Wang, Ya Zhang 0002, Yanfeng Wang 0001, Yu Wang 0027. 5223-5246 [doi]
- CEDAR: A Chinese Evaluation Dataset for Computational ArgumentationTian Lan, Jiang Li 0013, Rong Yan, Feilong Bao, Weihua Wang, Guanglai Gao, Xiangdong Su. 5247-5269 [doi]
- MSEarth: A Multimodal Benchmark for Earth Science Phenomenon Discovery with MLLMsXiangyu Zhao, Wanghan Xu, Bo Liu, Yuhao Zhou 0005, Fenghua Ling, Ben Fei, Xiaoyu Yue, Lei Bai 0001, Wenlong Zhang, Xiao-Ming Wu. 5270-5301 [doi]
- Reasoning Structure Matters for Safety Alignment of Reasoning ModelsYeonjun In, Wonjoong Kim, Sangwu Park, Chanyoung Park 0001. 5302-5318 [doi]
- Investigating the Representation of Backchannels and Fillers in Fine-tuned Language ModelsYu Wang 0294, Leyi Lao, Langchu Huang, Gabriel Skantze, Yang Xu, Hendrik Buschmeier. 5319-5348 [doi]
- Retrievals Can Be Detrimental: Unveiling the Backdoor Vulnerability of Retrieval-Augmented Diffusion ModelsHao Fang 0011, Xiaohang Sui, Hongyao Yu, Kuofeng Gao, Jiawei Kong 0001, Sijin Yu, Bin Chen, Shu-Tao Xia. 5349-5367 [doi]
- A Theoretically Grounded Approach to Summarizing Conversation Dynamics for Forecasting the Derailment of Online ConversationsYingxue Fu 0001, Anaïs Ollagnier. 5368-5384 [doi]
- DPDV: Dual-Pathway and Dual-View Representation Learning for Bridging Information Asymmetry in Text-Video RetrievalZequn Xie, Xin Liu, Fangming Feng, Boyun Zhang, Tao Jin 0004. 5385-5394 [doi]
- Who Wrote This Line? Evaluating the Detection of LLM-Generated Classical Chinese PoetryJiang Li, Tian Lan, Shanshan Wang 0009, Zdongxing, Dianqing Lin, Guanglai Gao, Derek F. Wong, Xiangdong Su. 5395-5413 [doi]
- Representation Interventions Enable Lifelong Knowledge Memory Control in LLMsXuyuan Liu, Shengyu Chen, Xinshuai Dong, Yanchi Liu, Xujiang Zhao, Haoyu Wang 0003, Yujun Yan, Haifeng Chen, Zhengzhang Chen. 5414-5436 [doi]
- SLoRA: Balancing Plasticity and Forgetting in Large Language Models for Continual LearningLina Yang, Yusheng Liao, Yanfeng Wang 0001, Yu Wang 0027. 5437-5454 [doi]
- G-Cap: A Game Character Caption GeneratorYang Yang, Feng Hu, Haiming Zhang, X. U. Cheng, Gui Zheng, Liang Yao, Wenqi Ren. 5455-5473 [doi]
- Common to Whom? Regional Cultural Commonsense and LLM Bias in IndiaSangmitra Madhusudan, Trush Shashank More, Steph Buongiorno, Renata Dividino, Jad Kabbara, Ali Emami. 5474-5519 [doi]
- The Stackelberg Speaker: Optimizing Persuasive Communication in Social Deduction GamesZhang Zheng, Deheng Ye, Peilin Zhao, Hao Wang. 5520-5544 [doi]
- GuideDog: A Real-World Egocentric Multimodal Dataset for Blind and Low-Vision Accessibility-Aware GuidanceJunhyeok Kim 0002, Jaewoo Park 0003, Junhee Park, Sangeyl Lee, Jiwan Chung, Jisung Kim, Ji Hoon Joung, Youngjae Yu. 5545-5574 [doi]
- LogicPoison: Logical Attacks on Graph Retrieval-Augmented GenerationYilin Xiao, Jin Chen, Qinggang Zhang, Yujing Zhang, Chuang Zhou, Longhao Yang, Lingfei Ren, Xin Yang, Xiao Huang. 5575-5591 [doi]
- Par-ITA: Benchmarking Seq2Seq and LLMs on a Human-Supervised Parallel Corpus for Italian Hyperpartisan NeutralizationMichele Joshua Maggini, Søren Fomsgaard, Michele Maestroni, Gaël Dias, Pablo Gamallo 0001. 5592-5615 [doi]
- Incentivizing Parametric Knowledge via Reinforcement Learning with Verifiable Rewards for Cross-Cultural Entity TranslationJiang Zhou, Xiaohu Zhao, Xinwei Wu 0001, Tianyu Dong, Hao Wang, Yangyang Liu, Heng Liu, Linlong Xu, Longyue Wang, Weihua Luo, Deyi Xiong. 5616-5638 [doi]
- Writing-RL: Advancing Long-form Writing via Adaptive Curriculum Reinforcement LearningXuanyu Lei, Chenliang Li 0003, Yuning Wu 0001, Kaiming Liu, Weizhou Shen, Peng Li 0030, Ming Yan 0008, Fei Huang 0002, Ya-Qin Zhang, Yang Liu 0005. 5639-5661 [doi]
- Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral InspectionMinghui Jia, Qichao Zhang, Ali Luo, Linjing Li, Shuo Ye, Hailing Lu, Wen Hou, Dongbin Zhao. 5662-5681 [doi]
- ROSE: An Intent-Centered Evaluation Metric for NL2SQLWenqi Pei, Shizheng Hou, Boyan Li 0001, Chen Han, ZhiChao Shi, Yuyu Luo. 5682-5709 [doi]
- Compete to Complete: Co-opetition Adversarial Learning for Retrieval-Augmented GenerationXin Liu, Yu-An Liu 0028, Ruqing Zhang 0001, Yixing Fan, Lixin Su, Jiafeng Guo, Xueqi Cheng. 5710-5725 [doi]
- Demystifying Uncertainty in LLMs: Active Calibration between Concepts and Human EvaluationsPengqi Li, Lizhong Ding 0003, Zhehao Zhou, Chunhui Zhang, Jiarun Fu, Hao Li, Ye Yuan, Guoren Wang. 5726-5759 [doi]
- LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector AlignmentHaonan Zhang 0007, Dongxia Wang 0002, Yi Liu, Kexin Chen, Wenhai Wang. 5760-5776 [doi]
- TiKMiX: Efficient Semi-Dynamic Data Mixture via Data Influence for LLM Pre-trainingYifan Wang, Binbin Liu, Fengze Liu, Yuanfan Guo, Jiyao Deng, Xuecheng Wu, Weidong Zhou, Xiaohuan Zhou, Taifeng Wang. 5777-5793 [doi]
- Revisit What You See: Revealing Visual Semantics in Vision Tokens to Guide LVLM DecodingBeomsik Cho, Jaehyung Kim. 5794-5824 [doi]
- FlexGuard: Continuous Risk Scoring for Strictness-Adaptive LLM Content ModerationZhihao Ding, Jinming Li, Ze Lu, Jieming Shi. 5825-5851 [doi]
- Modeling Human-Like Cognition for Stance Detection: Integrating Intuitive Judgment and Analytical ReasoningZhaodan Zhang, Jin Zhang, Jiafeng Guo, Xueqi Cheng. 5852-5867 [doi]
- FinSight: Towards Real-World Financial Deep ResearchJiajie Jin, Yuyao Zhang 0003, Yimeng Xu, Hongjin Qian, Yutao Zhu 0001, Zhicheng Dou. 5868-5894 [doi]
- Dual-Cluster Memory Agent: Resolving Multi-Paradigm Ambiguity in Optimization Problem SolvingXinyu Zhang 0021, Yuchen Wan, Boxuan Zhang, Zesheng Yang, Lingling Zhang 0005, Bifan Wei, Jun Liu 0002. 5895-5908 [doi]
- AfriqueLLM: How Data Mixing and Model Architecture Impact Continued Pre-training for African LanguagesHao Yu, Tianyi Xu, Michael A. Hedderich, Wassim Hamidouche, Syed Waqas Zamir, David Ifeoluwa Adelani. 5909-5928 [doi]
- What Does LLM Refinement Actually Improve? A Systematic Study on Document-Level Literary TranslationShaomu Tan, Dawei Zhu, Ke Tran, Michael J. Denkowski, Sony Trenous, Leonardo F. R. Ribeiro, Bill Byrne, Felix Hieber. 5929-5957 [doi]
- OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic CodingDeming Ding, Shichun Liu, Enhui Yang, Jiahang Lin, Ziying Chen, Shihan Dou, Honglin Guo, Weiyu Cheng, Pengyu Zhao, Chengjun Xiao, Qunhong Zeng, Qi Zhang, Xuanjing Huang 0001, Qidi Xu, Tao Gui. 5958-5978 [doi]
- Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative MontageJinwei Hu 0001, Xinmiao Huang, Youcheng Sun, Yi Dong 0002, Xiaowei Huang 0001. 5979-5996 [doi]
- EXCEEDS: Extracting Complex Events via Nugget-based Grid Modeling in Scientific DomainYi-Fan Lu, Xian-Ling Mao, Bo Wang, Xiao Liu, Heyan Huang. 5997-6022 [doi]
- Heterogeneous Adaptive Policy Optimization: Tailoring Optimization to Every Token's NatureZheng Liu, Mengjie Liu, Siwei Wen, Mengzhang Cai, Bin Cui 0001, Conghui He, Wentao Zhang 0001. 6023-6045 [doi]
- Mirroring Users: Towards Building Preference-aligned User Simulator with User Feedback in RecommendationTianjun Wei, Huizhong Guo 0001, Yingpeng Du, Zhu Sun 0001, Huang Chen, Dongxia Wang 0002, Jie Zhang 0002. 6046-6071 [doi]
- Editing the Moving World: Model Editing for Video LLMsQian Zhang, Xinye Li 0001, Xiaokai Wu, Junhao Xu, Zhanyue Qin, Qingbin Liu, Junxian Cai, Xi Chen, Bolin Zhang, Zhiying Tu, Dianhui Chu, Xiaoyan Yu, Dianbo Sui. 6072-6091 [doi]
- Bridging the Sensory Gap: Visual Injection for Taxonomy CompletionYuhang Niu, Hongyuan Xu, Ciyi Liu, Bofan Wei, Jiaqi Ye, Yanlong Wen, Xiaojie Yuan. 6092-6107 [doi]
- OCP: Outlier-Centric Probing for Dynamic Structured Pruning of LLMsYang Ji, Ying Sun. 6108-6124 [doi]
- Structured Episodic Event MemoryZhengxuan Lu, Dongfang Li 0002, Yukun Shi, Beilun Wang, Longyue Wang, Baotian Hu. 6125-6141 [doi]
- MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented EnvironmentsQuyu Kong, Xu Zhang, Zhenyu Yang, Nolan Gao, Chen Liu, Panrong Tong, Chenglin Cai, Hanzhang Zhou, Jianan Zhang, Liangyu Chen 0008, Zhidan Liu 0006, Steven Hoi, Yue Wang 0039. 6142-6167 [doi]
- Measuring Human Contribution in AI-Assisted Content GenerationYueqi Xie, Tao Qi, Jingwei Yi, Xiyuan Yang, Ryan Whalen, Junming Huang 0001, Qian Ding, Yu Xie, Xing Xie 0001, Fangzhao Wu. 6168-6190 [doi]
- AutoTaskEval: Towards Domain-Specific and Fine-Grained Evaluation for LLMsQingqing Lyu, Linjuan Wu, Yongliang Shen 0001, Hengwei Liu, Hao Li, Shengpei Jiang, Yin Zhang, Weiming Lu 0001. 6191-6223 [doi]
- ACE-Router: Generalizing History-Aware Routing from MCP Tools to the Agent WebZhiyuan Yao, Zishan Xu, Yifu Guo, Zhiguang Han, Cheng Yang, Shuo Zhang, Weinan Zhang 0001, Xingshan Zeng, Weiwen Liu. 6224-6240 [doi]
- CiteGuard: Faithful Citation Attribution for LLMs via Retrieval-Augmented ValidationYee Man Choi, Xuehang Guo, Yi R. Fung 0001, Qingyun Wang 0005. 6241-6257 [doi]
- From Insight to Action: A Novel Framework for Interpretability-Guided Data Selection in Large Language ModelsLing Shi 0004, Xinwei Wu, Xiaohu Zhao, Hao Wang, Heng Liu, Yangyang Liu, Linlong Xu, Longyue Wang, Deyi Xiong, Weihua Luo. 6258-6272 [doi]
- Unlocking the Potential of Diffusion Language Models through Template InfillingJunhoo Lee, Seungyeon Kim, Nojun Kwak. 6273-6287 [doi]
- UniSpec: Training-Free Speculative Decoding for Robust LLM Acceleration Across Languages and HardwareTruong Dinh Do, Nguyen-Khang Le, Le Minh Nguyen. 6288-6310 [doi]
- Logical Consistency as a Bridge: Improving LLM Hallucination Detection via Label Constraint Modeling between Responses and Self-JudgmentsHao Mi 0001, Qiang Sheng 0001, Shaofei Wang 0004, Beizhe Hu, Yifan Sun, Zhengjia Wang 0001, Hengqi Zeng, Yang Li 0196, Danding Wang, Juan Cao 0001. 6311-6330 [doi]
- UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual DocumentsYifan Ji, Zhipeng Xu, Zhenghao Liu, Zulong Chen, Qian Zhang, Zhibo Yang, Junyang Lin, Yu Gu 0002, Ge Yu 0001, Maosong Sun 0001. 6331-6352 [doi]
- FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based AgentsChiwei Zhu, Benfeng Xu, Mingxuan Du, Shaohan Wang, Xiaorui Wang, Zhendong Mao 0001, Yongdong Zhang 0001. 6353-6373 [doi]
- Annotating Dimensions of Social Perception in Text: A Sentence-Level Dataset of Warmth and CompetenceMutaz Ayesh, Saif M. Mohammad, Nedjma Ousidhoum. 6374-6412 [doi]
- SCOUT: Selective Coupling via Optimal Unbalanced Transport for Interpretable Text ClassificationJunhao Jia, Hanwen Zheng, Yueyi Wu, Huangwei Chen, Haishuai Wang, Jiajun Bu, Lei Wu. 6413-6431 [doi]
- LLMs Enable Bag-of-Texts Representations for Short-Text ClusteringI-Fan Lin 0001, Faegheh Hasibi, Suzan Verberne. 6432-6447 [doi]
- TriEx: A Game-based Tri-View Framework for Explaining Internal Reasoning in Multi-Agent LLMsZiyi Wang, Chen Zhang, Wenjun Peng, Qi Wu, Xinyu Wang. 6448-6479 [doi]
- What's Left Unsaid? Detecting and Correcting Misleading Omissions in Multimodal News PreviewsFanxiao Li, Jiaying Wu, Tingchao Fu, Dayang Li, Herun Wan, Wei Zhou, Min-Yen Kan. 6480-6502 [doi]
- ContextLens: Modeling Imperfect Privacy and Safety Context for Legal ComplianceHaoran Li 0003, Yulin Chen, Huihao Jing, Wenbin Hu 0001, Tsz Ho Li, Chanhou Lou, Hong Ting Tsang, Sirui Han, Yangqiu Song. 6503-6518 [doi]
- StealthGraph: Exposing Domain-Specific Risks in LLMs through Knowledge-Graph-Guided Harmful Prompt GenerationHuawei Zheng, Xinqi Jiang, Sen Yang, Shouling Ji, Yingcai Wu, Dazhen Deng. 6519-6539 [doi]
- Efficient Multi-Agent System Training with Data Influence-Oriented Tree SearchWentao Shi 0002, Zichun Yu, Fuli Feng, Xiangnan He 0001, Chenyan Xiong. 6540-6558 [doi]
- Integrating Data Validation with Large Language Models for Regulation-Guided Tabular Anomaly DetectionHaoliang Huang, Zihuang Cai, Zhuo Tang, Yifan Liu, Chen Tian, Kenli Li 0001, Changjian Chen. 6559-6581 [doi]
- Efficient Self-Evaluation for Diffusion Language Models via Sequence RegenerationLinhao Zhong 0001, Linyu Wu, Wen Wang 0015, Yuling Xi, Chenchen Jing, Jiaheng Zhang, Hao Chen 0041, Chunhua Shen. 6582-6602 [doi]
- DeReA: Improving Idiom Translation with Detect-Retrieve-Arbitrate ReasoningRongqing Jiang, Xuebo Liu 0002, Shengxin Liu, Yutong Wang, Min Zhang 0042, Shimin Tao, Daimeng Wei. 6603-6621 [doi]
- Faithful Serum: Mitigating the Faithfulness Gap in Textual Explanations of LLM Decisions via Attribution GuidanceBar Alon, Itamar Zimerman, Lior Wolf. 6622-6645 [doi]
- Visually-Guided Policy Optimization for Multimodal ReasoningZengbin Wang, Feng Xiong, Liang Lin, Xuecai Hu, Yong Wang, Yanlin Wang, Man Zhang, Xiangxiang Chu. 6646-6664 [doi]
- Don't Be Misled by Style: A Style-Adaptive Reranker for Capturing Effective Knowledge in Retrieval-Augmented GenerationRuwen Zhang, Bo Liu 0004, Zhang Sheng Xiang, Yida Chen, Hantao Zhao, Ding Ding 0002, Jiahui Jin, Jiuxin Cao. 6665-6681 [doi]
- Text2Tabular - Reconstructing Tabular Research Data from Scientific PublicationsJonas Gottal, Florian Matthes. 6682-6697 [doi]
- From "Aha Moments" to Controllable Thinking: Toward Meta-Cognitive Reasoning in LRMs via Decoupled Reasoning and ControlRui Ha, Rui Pu, Chaozhuo Li, Li Sun 0008, Sen Su. 6698-6710 [doi]
- Calibrating Inference Time Alignment with Sequence-level Risk AccumulationShanwen Tan, Ziyang Dong, Wei Ju 0001, Yiwei Fu, Hao Wu, Kun Wang 0056, Yifan Wang 0014, Ziyue Qiao. 6711-6735 [doi]
- Diff4TST: Masked Diffusion Language Model for Text Style TransferXinchen Ma, Gaole He, Yunshi Lan, Weining Qian. 6736-6748 [doi]
- In-depth Research Impact Summarization through Fine-Grained Temporal Citation AnalysisHiba Arnaout, Noy Sternlicht, Tom Hope, Iryna Gurevych. 6749-6789 [doi]
- QuantileMark: A Message-Symmetric Multi-bit Watermark for LLMsJunlin Zhu, Baizhou Huang, Xiaojun Wan 0001. 6790-6806 [doi]
- Standard-to-Dialect Transfer Trends Differ across Text and Speech: A Case Study on Intent and Topic Classification in German DialectsVerena Blaschke, Miriam Winkler, Barbara Plank. 6807-6829 [doi]
- Don't Click That: Teaching Web Agents to Resist Deceptive InterfacesYilin Zhang, Yingkai Hua, Chunyu Wei, Xin Wang, Yueguo Chen. 6830-6852 [doi]
- Empirical Analysis of Decoding Biases in Masked Diffusion ModelsPengcheng Huang 0004, Tianming Liu, Zhenghao Liu, Yukun Yan, Shuo Wang, Tong Xiao 0001, Zulong Chen, Maosong Sun. 6853-6876 [doi]
- LAFaCT: Attribution-based Localization and Focused Sequential Analysis of Fact-Critical Tokens for Hallucination DetectionXin Wang, Jiahao Li 0004, Licheng Zhang, Zhendong Mao 0001. 6877-6896 [doi]
- DPC: Training-Free Text-to-SQL Candidate Selection via Dual-Paradigm ConsistencyBoyan Li 0001, Ou Ocean Kun Hei, Yue Yu, Yuyu Luo. 6897-6913 [doi]
- Metaphor Reasoning is Meta-reasoningQianyu He, Junting Lu, Yikai Zhang 0004, Siyu Yuan, Xiaojun Meng, Jiansheng Wei, Jiaqing Liang, Yanghua Xiao. 6914-6935 [doi]
- Beyond Hard Masks: Progressive Token Evolution for Diffusion Language ModelsLinhao Zhong 0001, Linyu Wu, Bozhen Fang, Tianjian Feng, Chenchen Jing, Wen Wang 0015, Jiaheng Zhang, Hao Chen 0041, Chunhua Shen. 6936-6959 [doi]
- MAS-Bench: A Unified Benchmark for Shortcut-Augmented Hybrid Mobile GUI AgentsPengxiang Zhao, Guangyi Liu, Yaozhen Liang, Weiqing He, Zhengxi Lu, Wenhao Wang, Yuehao Huang, Yuxiang Chai, Zhaolu Kang, Yaxuan Guo, Hao Wang, Kexin Zhang, Liang Liu, Yong Liu. 6960-6985 [doi]
- HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of WritingAndrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Lin Fan, Irene Zhou, Zikang Wang, Xiaotao Gu, Jie Tang 0001, Hongning Wang, Minlie Huang. 6986-7034 [doi]
- Hierarchical Reinforcement Learning with Augmented Step-Level Transitions for LLM AgentsShuai Zhen, Yanhua Yu, Ruopei Guo, Nan Cheng, Yang Deng 0002. 7035-7053 [doi]
- Two Streams, One Sarcasm: Orthogonal Expert Tuning for Holistic Multimodal Sarcasm UnderstandingDiandian Guo, Cong Cao 0001, Fangfang Yuan, Pin Xu, Cheng Hu, Zhicheng Zhang, Yu Liu, Yanbing Liu 0007. 7054-7072 [doi]
- SeLaR: Selective Latent Reasoning in Large Language ModelsRenyu Fu, Guibo Luo. 7073-7087 [doi]
- STRIDE-ED: A Strategy-Grounded Stepwise Reasoning Framework for Empathetic Dialogue SystemsHongru Ji, Yuyin Fan, Meng Zhao 0004, Xianghua Li, Lianwei Wu, Chao Gao 0001. 7088-7102 [doi]
- GRAPHIA: Harnessing Social Graph Data to Enhance LLM-Based Social SimulationJiarui Ji, Zehua Zhang, Zhewei Wei, Bin Tong, Guan Wang, Bo Zheng. 7103-7128 [doi]
- SharedRequest: Privacy-Preserving Model-Agnostic Inference for Large Language ModelsPeihua Mai, Xuanrong Gao, Youlong Ding, XiangLong Du, Wei Liu, Yan Pang. 7129-7150 [doi]
- Efficient Learned Data Compression via Dual-Stream Feature DecouplingHuidong Ma, Xinyan Shi, Hui Sun 0002, Xiaofei Yue, Xiaoguang Liu 0001, Gang Wang, Wentong Cai 0001. 7151-7164 [doi]
- Planning-Guided Tutoring with Assessment-Driven Memory for Pedagogical LLM TutorsZechen Li, Qiannan Zhu, Mei Wang, Jia Li, Hua Huang. 7165-7188 [doi]
- MixKVQ: Query-Aware Mixed-Precision KV Cache Quantization for Long-Context ReasoningTao Zhang 0019, Ziqian Zeng, Hao Peng, Huiping Zhuang, Cen Chen 0002. 7189-7204 [doi]
- When KV Cache Reuse Fails in Multi-Agent Systems: Cross-Candidate Interaction is Crucial for LLM JudgesSichu Liang, Zhenglin Wang, Jiajia Chu, Pengfei Xia, Hui Zang, Deyu Zhou. 7205-7230 [doi]
- Reducing Token Redundancy in LVLMs: A Systematic Review of Token Pruning MethodsHanzhang Yuan, Mengxuan Hu, Wenhao Zhang, Tianlong Wang, Zhongliang Zhou, Jiasen Lu, Sheng Li. 7231-7251 [doi]
- STEM: Structure-Tracing Evidence Mining for Knowledge Graphs-Driven Retrieval-Augmented GenerationPeng Yu, En Xu, Bin Chen, Haibiao Chen, Yinfei Xu. 7252-7285 [doi]
- Evo-Attacker: Memory-Augmented Reinforcement Learning for Long-Horizon Tool Attacks on LLM-MASBingyu Yan, Xiaoming Zhang, Jinyu Hou, Chaozhuo Li, Ziyi Zhou 0003, Yiming Hei, Litian Zhang. 7286-7300 [doi]
- Beyond Timestamps: Bridging Forward and Backward Reasoning in Temporal Numerical and Relational UnderstandingXinying Qian, Ying Zhang 0015, Xuhui Sui, Yu Zhao, Baohang Zhou, Jeff Z. Pan. 7301-7321 [doi]
- Reasoning Over Space: Enabling Geographic Reasoning for LLM-Based Generative Next POI RecommendationDongyi Lv, Qiuyu Ding, Heng-Da Xu, Zhaoxu Sun, Zhi Wang, Feng Xiong, Mu Xu. 7322-7336 [doi]
- ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior CalibrationYifei Chen 0001, Guanting Dong 0001, Zhicheng Dou. 7337-7359 [doi]
- Spectral Disentanglement: Rank-Aware Task Adaptation for Rehearsal-free Continual Learning in LLMsHuanxuan Liao, Shizhu He, Yupu Hao, Yequan Wang, Wenhao Teng, Xiangwen Liao, Jun Zhao 0001, Kang Liu 0001. 7360-7376 [doi]
- DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable ConstraintsYinger Zhang, Shutong Jiang, Renhao Li, Jianhong Tu, Yang Su, Lianghao Deng, Xudong Guo, Chenxu Lv, Junyang Lin. 7377-7407 [doi]
- Arg-LLaDA: Argument Summarization via Large Language Diffusion Models and Sufficiency-Aware RefinementHao Li 0074, Yizheng Sun, Viktor Schlegel, Kailai Yang, Riza Batista-Navarro, Goran Nenadic. 7408-7421 [doi]
- AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World ContextsKeyu Li, Junhao Shi, Yang Xiao, Mohan Jiang, Jie Sun 0030, Yunze Wu, Dayuan Fu, Shijie Xia, Xiaojie Cai, Tianze Xu, Weiye Si, Wenjie Li, Dequan Wang, Pengfei Liu. 7422-7440 [doi]
- All Languages Matter: Understanding and Mitigating Language Bias in Multilingual RAGDan Wang, Guozhao Mo, Yafei Shi, Cheng Zhang, Bo Zheng 0007, Boxi Cao, Xuanang Chen, Yaojie Lu 0001, Hongyu Lin, Ben He 0001, Xianpei Han, Le Sun 0001. 7441-7455 [doi]
- Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated ReasoningQisheng Su, Shiting Huang, Zhen Fang, Ziyan Chen, Zehui Chen, Feng Zhao 0004. 7456-7477 [doi]
- Safety-Utility Conflicts Are Not Global: Surgical Alignment via Head-Level DiagnosisWang Cai, Yilin Wen 0007, Jinchang Hou, Du Su, Guoqiu Wang, Zhonghou Lv, Chenfu Bao, Yunfang Wu. 7478-7496 [doi]
- VideoPro: Adaptive Program Reasoning for Long Video UnderstandingChenglin Li, Feng Han, Yikun Wang 0001, Ruilin Li, Shuai Dong, Haowen Hou, Haitao Li, Qianglong Chen, Feng Tao, Jingqi Tong, Yin Zhang, Jiaqi Wang. 7497-7513 [doi]
- Parity-Aware Byte-Pair Encoding: Improving Cross-lingual Fairness in TokenizationNegar Foroutan, Clara Meister, Debjit Paul, Joel Niklaus, Sina Ahmadi, Antoine Bosselut, Rico Sennrich. 7514-7538 [doi]
- Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language ModelsNianyi Lin, Jiajie Zhang, Lei Hou 0001, Juanzi Li. 7539-7550 [doi]
- ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from ScratchZheng Liu, Honglin Lin, Xiaoyang Wang 0007, Xin Gao 0001, Yu Li 0006, Mengzhang Cai, Yun Zhu 0007, Zhanping Zhong, Qizhi Pei, Zhuoshi Pan, Xiaoran Shang, Conghui He, Bin Cui 0001, Wentao Zhang 0001, Lijun Wu 0003. 7551-7577 [doi]
- NeoAMT: Neologism-Aware Agentic Machine Translation with Reinforcement LearningZhongtao Miao, Kaiyan Zhao, Masaaki Nagata, Yoshimasa Tsuruoka. 7578-7601 [doi]
- arXiv2Table: Toward Realistic Benchmarking and Evaluation for LLM-Based Literature-Review Table GenerationWeiqi Wang 0001, Jiefu Ou, Yangqiu Song, Benjamin Van Durme, Daniel Khashabi. 7602-7624 [doi]
- Responsible Evaluation of AI for Mental HealthHiba Arnaout, Anmol Goel, H. Andrew Schwartz, Steffen Eberhardt, Dana Atzil-Slonim, Gavin Doherty, Brian Schwartz, Wolfgang Lutz 0001, Tim Althoff, Munmun De Choudhury, Hamidreza Jamalabadi, Raj Sanjay Shah, Flor Miriam Plaza del Arco, Dirk Hovy, Maria Liakata, Iryna Gurevych. 7625-7660 [doi]
- JPU: Bridging Jailbreak Defense and Unlearning via On-Policy Path RectificationXi Wang, Songlei Jian, Shasha Li, Xiaopeng Li, Zhaoye Li, bin Ji, Baosheng Wang, Jie Yu. 7661-7674 [doi]
- SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality EvaluationHui Wang, Jinghua Zhao 0004, Yifan Yang 0005, Shujie Liu 0001, Junyang Chen, Yanzhe Zhang, Shiwan Zhao, Jinyu Li 0001, Jiaming Zhou 0001, Haoqin Sun, Yan Lu 0001, Yong Qin. 7675-7700 [doi]
- LePREC: Reasoning as Classification over Structured Factors for Assessing Relevance of Legal IssuesFanyu Wang, Xiaoxi Kang, Paul Burgess, Aashish Srivastava, Chetan Arora 0002, Adnan Trakic, Lay-Ki Soon, Md Khalid Hossain, Lizhen Qu. 7701-7736 [doi]
- S2O: Early Stopping for Sparse Attention via Online PermutationYu Zhang, Songwei Liu, Chenqian Yan, Sheng Lin, Beichen Ning, Fangmin Chen, Xing Wang. 7737-7751 [doi]
- DART: Disambiguation-Aware Reasoning for Video-guided Machine TranslationBoyu Guan, Chuang Han, Yang Zhao 0007, Chengqing Zong. 7752-7772 [doi]
- HCSpec: Two-Tier Horizontal Cascade Speculative Decoding for High-Efficiency Large Language Model InferenceYizhou Zhang, Siming Chen, Hao Ye, Erhu Feng. 7773-7783 [doi]
- Revisiting the Reliability of Language Models in Instruction-FollowingJianshuo Dong, Yutong Zhang, Liu Yan, Zhenyu Zhong, Tao Wei 0002, Chao Zhang 0008, Han Qiu 0001. 7784-7812 [doi]
- EfficientLLM: Unified Pruning-Aware Pretraining for Auto-Designed Compact Language ModelsXingrun Xing, Zheng Liu, Shitao Xiao, Boyan Gao, Yiming Liang, Haokun Lin, Xianlin Zeng, Guoqi Li 0002, Jiajun Zhang. 7813-7830 [doi]
- SPPO: Sequence-Level PPO for Long-Horizon Reasoning TasksTianyi Wang, Yixia Li, Long Li, Yibiao Chen, Shaohan Huang, Yun Chen 0007, Peng Li 0030, Yang Liu 0005, Guanhua Chen 0001. 7831-7853 [doi]
- Enhancing the Transferability of Jailbreak Attacks on Large Language Models via Exploiting Reparameterization InvarianceAo Wang, Xinghao Yang, Yongshun Gong, Wei Liu 0007, Bao-Di Liu, Weifeng Liu 0001. 7854-7865 [doi]
- GIFT: Guided Fine-Tuning and Transfer for Enhancing Instruction-Tuned Language ModelsZhiwen Ruan, Yichao Du, Jianjie Zheng, Longyue Wang, Yun Chen 0007, Peng Li 0030, Jinsong Su, Yang Liu 0005, Guanhua Chen 0001. 7866-7878 [doi]
- AMATA: Adaptive Multi-Agent Trajectory Alignment for Knowledge-Intensive Question AnsweringTaolin Zhang 0001, Dongyang Li, Chen Chen, Qizhou Chen, Jiuheng Wan, Xiaofeng He, Chengyu Wang 0001, Richang Hong. 7879-7900 [doi]
- ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language ModelsJincheng Liu, Sijun He, Jingjing Wu, Xiangsen Wang, Yang Chen, Zhaoqi Kuang, Siqi Bao, Yuan Yao. 7901-7954 [doi]
- From Completion to Editing: Unlocking Context-Aware Code Infilling via Search-and-Replace Instruction TuningJiajun Zhang, Zeyu Cui, Jiaxi Yang 0004, Lei Zhang 0201, Yuheng Jing, Zeyao Ma, Tianyi Bai, Zilei Wang, Qiang Liu 0006, Liang Wang 0001, Binyuan Hui, Junyang Lin. 7955-7984 [doi]
- What Makes an Ideal Quote? Recommending "Unexpected yet Rational" Quotations via NoveltyPowei Chang, Jin Xiao, Guanglei Yue, Qianyu He, Yanghua Xiao, Deqing Yang, Jiaqing Liang. 7985-8017 [doi]
- Do Not Step Into the Same River Twice: Learning to Reason from Trial and ErrorChenming Tang, Hsiu-Yuan Huang, Weijie Liu, Clive Bai, Saiyong Yang, Yunfang Wu. 8018-8032 [doi]
- iTAG: Inverse Design for Natural Text Generation with Accurate Causal Graph AnnotationsWenshuo Wang, Boyu Cao, Nan Zhuang, Wei Li. 8033-8063 [doi]
- Dynamic Long Context Reasoning over Compressed Memory via End-to-End Reinforcement LearningZhuoen Chen, Dongfang Li 0002, Meishan Zhang, Baotian Hu, Min Zhang 0005. 8064-8083 [doi]
- From Word to World: Can Large Language Models be Implicit Text-based World Models?Yixia Li, Hongru Wang 0003, Jiahao Qiu, Zhenfei Yin, Dongdong Zhang 0001, Cheng Qian 0008, Zeping Li, Xiaoteng Ma, Guanhua Chen 0001, Heng Ji 0001. 8084-8111 [doi]
- GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language ModelsXiangdong Hu, Yangyang Jiang, Qin Hu 0001, Xiaojun Jia. 8112-8129 [doi]
- Large Language Model-Enhanced Multi-Armed BanditsJiahang Sun, Zhiyong Wang, Runhan Yang, Chenjun Xiao, John C. S. Lui, Zhongxiang Dai. 8130-8145 [doi]
- Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMsWenrui Zhou, Mohamed Hendy, Shu Yang 0010, Qingsong Yang, Zikun Guo, Yuyu Luo, Lijie Hu, Di Wang 0015. 8146-8172 [doi]
- Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous AgentsYiting Shen, Kun Li, Wei Zhou 0019, Songlin Hu 0001. 8173-8190 [doi]
- ARK: Answer-Centric Retriever Tuning via KG-augmented Curriculum LearningJiawei Zhou 0005, Hang Ding, Haiyun Jiang. 8191-8208 [doi]
- On the Emotion Understanding of Synthesized SpeechYuan Ge 0001, Haishu Zhao, Aokai Hao, Junxiang Zhang, Bei Li, Xiaoqian Liu, Chenglong Wang 0002, Jianjin Wang, Bingsen Zhou, Bingyu Liu, Jingbo Zhu, Zhengtao Yu 0001, Tong Xiao 0001. 8209-8223 [doi]
- Taming "Zombie" Agents: A Markov State-Aware Framework for Resilient Multi-Agent EvolutionTaolin Zhang 0001, Pukun Zhao, Qizhou Chen, Jiuheng Wan, Chen Chen, Xiaofeng He, Chengyu Wang 0001, Richang Hong. 8224-8243 [doi]
- A Survey of Large Language Model-Based Search AgentsYunjia Xi, Jianghao Lin, Yongzhao Xiao, Zheli Zhou, Rong Shan, Te Gao, Jiachen Zhu 0001, Weiwen Liu, Yong Yu 0001, Weinan Zhang 0001. 8244-8279 [doi]
- RSDA: Restoring Stale Data Affinity via Dynamic Renovation Strategy for Mitigating Data ScarcityYidan Liang, Jia Zhu 0003, Weijie Shi, Hanghui Guo, Yue Cui 0001, Jiawei Shen, Guoqing Ma, Jingjiang Liu, Qingyu Niu, Yilin Wang, Shimin Di, Jiajie Xu 0001. 8280-8309 [doi]
- The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool HallucinationChenlong Yin, Zeyang Sha, Shiwen Cui, Changhua Meng, Zechao Li. 8310-8328 [doi]
- Protecting multimodal large language models against misleading visualizationsJonathan Tonglet, Tinne Tuytelaars, Marie-Francine Moens, Iryna Gurevych. 8329-8349 [doi]
- Dual Activation-Weight Sparsity: A Training-Free Framework for Efficient Large Language Model CompressionLuoyang Sun, Guangyan Li, Cheng Deng 0001, Haifeng Zhang 0002, Jian Zhao 0006, Yongqiang Tang, Wensheng Zhang 0002, Jun Wang 0012. 8350-8366 [doi]
- Repeated Sequences Reveal Gaps between Large Language Models and Natural LanguageKumiko Tanaka-Ishii. 8367-8382 [doi]
- AgentCoMa: A Compositional Benchmark Mixing Commonsense and Mathematical Reasoning in Real-World ScenariosLisa Alazraki, Lihu Chen, Ana Brassard, Joe Stacey, Hossein A. Rahmani, Marek Rei. 8383-8410 [doi]
- HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video UnderstandingHaowei Zhang, Shudong Yang, JinLan Fu, See-Kiong Ng, Xipeng Qiu. 8411-8430 [doi]
- Reasoning with OmniThought: A Large CoT Dataset with Verbosity and Cognitive Difficulty AnnotationsWenrui Cai 0001, Chengyu Wang, Junbing Yan 0001, Jun Huang 0007, Xiangzhong Fang. 8431-8450 [doi]
- InferenceDynamics: Adaptive LLM Routing through Structured Capability and Knowledge ProfilingHaochen Shi, Tianshi Zheng, Weiqi Wang 0001, Baixuan Xu, Chunyang Li, Chunkit Chan, Tao Fan 0002, Yangqiu Song. 8451-8469 [doi]
- ReportLogic: Evaluating Logical Quality in Deep Research ReportsJujia Zhao, Zhaoxin Huan, Zihan Wang 0002, Xiaolu Zhang, Jun Zhou 0011, Suzan Verberne, Zhaochun Ren. 8470-8502 [doi]
- Detecting RAG Extraction Attack via Dual-Path Runtime Integrity GameYuanbo Xie, Yingjie Zhang, Yulin Li, Shouyou Song, Xiaokun Chen, Zhihan Liu, Liya Su, Tingwen Liu. 8503-8518 [doi]
- Beyond Monolingual Assumptions: A Survey on Code-Switched NLP in the Era of Large Language Models across ModalitiesRajvee Sheth, Samridhi Raj Sinha, Mahavir Patil, Himanshu Beniwal, Mayank Singh 0001. 8519-8566 [doi]
- Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot DoZhuoran Jin, Kejian Zhu, Hongbang Yuan, Yupu Hao, Pengfei Cao, Yubo Chen 0001, Kang Liu 0001, Jun Zhao 0001. 8567-8608 [doi]
- ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMsHaoqian Meng, Yilun Luo, Yafei Zhao, Wenyuan Liu, Peng Zhang, Xindian Ma. 8609-8623 [doi]
- Revisiting Model Interpolation for Efficient ReasoningTaiqiang Wu, Runming Yang, Tao Liu, Jiahao Wang, Ngai Wong 0001. 8624-8638 [doi]
- MirageBackdoor: A Stealthy Attack that Induces Think-Well-Answer-Wrong ReasoningYizhe Zeng, Wei Zhang, Yunpeng Li, Juxin Xiao, Xiao Wang, Yuling Liu. 8639-8659 [doi]
- MulVul: Retrieval-augmented Multi-Agent Code Vulnerability Detection via Cross-Model Prompt EvolutionZihan Wu, Jie Xu 0031, Yun Peng, Chun Yong Chong, Xiaohua Jia. 8660-8673 [doi]
- LiGen: Active Lipid Generation via a Molecular Language ModelYing Zhan 0001, Xiuqi Tang, Yan Zhang 0100, Xiao Tan, Dian Shen, Zhou Yu, Beilun Wang. 8674-8686 [doi]
- Gained in Translation: Privileged Pairwise Judges Enhance Multilingual ReasoningLintang Sutawika, Gokul Swamy, Steven Wu, Graham Neubig. 8687-8705 [doi]
- Ted-Tok: Maintaining an Evolving Vocabulary for Lifelong LearningJiameng Huang, Zhi Zhang, Zhenyu He, Jiacheng Sun, Di He 0001. 8706-8719 [doi]
- When Correct Beliefs Collapse: Epistemic Resilience of LLMs under Clinical PressureBoyu Xiao, Xiuqi Tian, Xuwen Song, Haochun Wang, Guanchun Song, Sendong Zhao, Bing Qin 0001. 8720-8764 [doi]
- Beyond Transcripts: A Renewed Perspective on Audio ChapteringFabian Retkowski, Maike Züfle, Thai Binh Nguyen, Jan Niehues, Alexander Waibel. 8765-8787 [doi]
- SEA-BED: How Do Embedding Models Represent Southeast Asian Languages?Wuttikorn Ponwitayarat, Peerat Limkonchotiwat, Raymond Ng, Jann Railey Montalan, Thura Aung, Jian Gang Ngui, Yosephine Susanto, William-Chandra Tjhi, Panuthep Tasawong, Erik Cambria, Ekapol Chuangsuwanich, Sarana Nutanong. 8788-8822 [doi]
- Is this chart lying to me? Automating the detection of misleading visualizationsJonathan Tonglet, Jan Zimny, Tinne Tuytelaars, Iryna Gurevych. 8823-8844 [doi]
- From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository LevelJia Li, Yuxin Su 0001, Michael R. Lyu. 8845-8869 [doi]
- Privacy Collapse: Benign Fine-Tuning Can Break Contextual Privacy in Language ModelsAnmol Goel, Cornelius Emde, Seong Joon Oh, Sangdoo Yun, Martin Gubri. 8870-8892 [doi]
- Dissecting Failure Dynamics in Large Language Model ReasoningWei Zhu, Jian Zhang, Lixing Yu, Kun Yue, Zhiwen Tang. 8893-8914 [doi]
- QBridge: Bridging Natural Language and SQL via Gold Query Rewriting with Agentic RefinementZhensheng Luo, Sai Wu, Yuan Qiu, Chang Yao 0001, Gang Chen 0002, Xiu Tang. 8915-8933 [doi]
- SCVQ: Sparse-Compensated Vector Quantization for Large Language ModelsZixuan Zhou, Yujun Diao, Zicheng Kong, Dehua Ma, Zhenbo Xu, Pei-Pei Li, Zhaofeng He 0001. 8934-8950 [doi]
- Shanks: Simultaneous Hearing and Thinking for Spoken Language ModelsCheng-Han Chiang, Xiaofei Wang, Linjie Li, Chung-Ching Lin, Kevin Lin, Shujie Liu, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang. 8951-8972 [doi]
- Efficient KL Divergence Estimation via Truncated Top-K Integration for Large Language ModelsXinyuan Wang, Luozhijie Jin, Bo Wang, Yuan Li, Zhangyue Yin, Xipeng Qiu. 8973-8985 [doi]
- Visual Attention Reasoning via Hierarchical Search and Self-VerificationWei Cai, Jian Zhao, Yuchen Yuan, Tianle Zhang, Ming Zhu, Haichuan Tang, Xuelong Li 0001. 8986-8997 [doi]
- VFA: Empowering Multilingual MLLMs via Vision-Free AdaptationYixia Li, Yaqing Shi, Zhiwen Ruan, DongDong Zhang, Lingjie Jiang, Shaohan Huang, Yun Chen, Guanhua Chen, Furu Wei. 8998-9015 [doi]
- LearnerCoMPASS: Intelligent Tutoring System with Dynamic Cognitive Diagnosis and Multi-Model Path PlanningZiji Sheng, Guiyao Tie, Weidong Wang, Pan Zhou 0001, Daizong Liu. 9016-9042 [doi]
- Investigating More Explainable and Partition-Free Compositionality Estimation for LLMs: A Rule-Generation PerspectiveZiyao Xu 0001, Cong Wang, Houfeng Wang. 9043-9060 [doi]
- LVLMs and Humans Ground Differently in Referential CommunicationPeter Zeng, Weiling Li, Amie J. Paige, Zhengxiang Wang, Panagiotis Kaliosis, Dimitris Samaras, Gregory J. Zelinsky, Susan Brennan, Owen Rambow. 9061-9087 [doi]
- Evaluating the Expressive Appropriateness of Speech in Rich ContextsTianrui Wang, Ziyang Ma 0001, Yizhou Peng, Haoyu Wang, Zhikang Niu, Zikang Huang, Yihao Wu, Yi-Wen Chao, Yu Jiang, Yuheng Lu, Guanrou Yang, Xuanchen Li, Hexin Liu, Chunyu Qiang, Cheng Gong, Yifan Yang, Tianchi Liu, Junyu Wang, Nana Hou, Meng Ge, Fuming You, Yang Wei, Zhongqian Sun, Haifeng Hu 009, Xiaobao Wang, Eng Siong Chng, Xie Chen, Longbiao Wang, Jianwu Dang 0001. 9088-9106 [doi]
- UniMoE-Audio: Unified Speech and Music Generation with Dynamic-Capacity Mixture-of-ExpertsZhenyu Liu, Yunxin Li, Xuanyu Zhang, Qixun Teng, Shenyuan Jiang, Xinyu Chen 0003, Haoyuan Shi, Haolan Chen, Fanbo Meng, Mingjun Zhao, Yu Xu, Yancheng He, Baotian Hu, Haizhou Li 0001, Min Zhang 0005. 9107-9119 [doi]
- Are LLMs Reliable Rankers? Rank Manipulation via Two-Stage Token OptimizationTiancheng Xing, Jerry Li, Yixuan Du, Xiyang Hu. 9120-9132 [doi]
- KCVR: Knowledge-Centric Video Reconstruction for Structured Pedagogical Summarization via Dynamic Graph PlanningJingjiang Liu, Jia Zhu 0003, Hanghui Guo, Weijie Shi, Yue Cui 0001, Xiaokang Jin, Yilin Wang, Qingyu Niu, Jiawei Shen, Guoqing Ma, Yidan Liang, Shimin Di, Jiajie Xu 0001. 9133-9160 [doi]
- RepoGenesis: Benchmarking End-to-End Microservice Generation from Readme to RepositoryZhiyuan Peng, Xin Yin, Pu Zhao 0004, Fangkai Yang, Lu Wang, Ran Jia, Xu Chen 0022, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang 0001. 9161-9189 [doi]
- CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban EnvironmentsHaotian Xu, Yue Hu 0016, Zhengqiu Zhu, Chen Gao 0001, Ziyou Wang, Junreng Rao, Wenhao Lu, Weishi Li, Quanjun Yin, Yong Li 0008. 9190-9215 [doi]
- ContrastKV: Robust KV Cache Eviction via Contrastive Signal Fusion for Multi-Query GeneralizationXingchi Chen, Peiyuan Zong, Ziqiang Gao, Qing Li, Yong Jiang, Fa Zhu, Hui Li. 9216-9229 [doi]
- Teach a Reward Model to Correct Itself: Reward Guided Adversarial Failure Discovery for Robust Reward ModelingPankayaraj Pathmanathan, Furong Huang. 9230-9263 [doi]
- Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMsZhenyu Liu, Xuanyu Zhang, Yunxin Li, Qixun Teng, Shenyuan Jiang, Haolan Chen, Mingjun Zhao, Fanbo Meng, Yu Xu, Yancheng He, Baotian Hu, Haizhou Li 0001, Min Zhang 0005. 9264-9280 [doi]
- VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language ModelsHuawei Ji, Yuanhao Sun, Yuan Jin, Cheng Deng 0001, Jiaxin Ding 0001, Luoyi Fu, Xinbing Wang. 9281-9301 [doi]
- CoSToM: Causal-oriented Steering for Intrinsic Theory-of-Mind Alignment in Large Language ModelsMengfan Li 0001, Xuanhua Shi, Yang Deng 0002. 9302-9317 [doi]
- ConlangCrafter: Constructing Languages with a Multi-Hop LLM PipelineMorris Alper, Moran Yanuka, Raja Giryes, Gasper Begus. 9318-9349 [doi]
- XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech CodecsYitian Gong, Luozhijie Jin, Kuangwei Chen, Dong Zhang, Ruifan Deng, Xiaogui Yang, Xin Zhang, Zhaoye Fei, Qinyuan Cheng, Shimin Li, Xipeng Qiu. 9350-9369 [doi]
- Empathy in Diversity: Personalized Depression and Anxiety Therapy via Dialogue State Tracking and Patient-Aware PlanningXinwei Yang, Junyi Fan, Yuqing Liu, Jiaxuan Wang, Jiashuai Zhang, Hongru Liang, Wenqiang Lei, Yao Song. 9370-9416 [doi]
- VAPO: End-to-end Slide-Enhanced Speech Recognition with Omni-modal Large Language ModelsRui Hu 0011, Delai Qiu, Yining Wang, Shengping Liu, Jitao Sang 0001. 9417-9432 [doi]
- "Newspaper Eat" Means "Not Tasty": A Taxonomy and Benchmark for Coded Language in Real-World Chinese Online ReviewsRuyuan Wan, Changye Li 0001, Ting-Hao 'Kenneth' Huang. 9433-9446 [doi]
- Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-trainingKailai Yang, Xiao Liu, Lei Ji 0001, Hao Li 0074, Xiao Liang, Zhiwei Liu, Yeyun Gong, Peng Cheng 0005, Mao Yang 0004. 9447-9473 [doi]
- Experience-driven Multi-turn Reinforcement Learning for GUI AgentsZhengxi Lu, Jiabo Ye, Fei Tang 0005, Yongliang Shen 0001, Haiyang Xu 0001, Ziwei Zheng, Weiming Lu 0001, Ming Yan 0008, Fei Huang 0002, Jun Xiao 0001, Yueting Zhuang. 9474-9496 [doi]
- UMMF: Protecting Copyright of Large Vision-Language Models through Unlearning-based Multimodal Memorization FingerprintXiaofan Zheng, Xinghao Wang, Xiaojun Wan 0001. 9497-9513 [doi]
- Automatic Correction of Writing Anomalies in Hausa TextsAhmad Mustapha Wali, Sergiu Nisioi. 9514-9528 [doi]
- OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic WorkflowsQiushi Sun, Mukai Li, Zhoumianze Liu, Zhihui Xie 0002, Fangzhi Xu, Zhangyue Yin, Kanzhi Cheng, Zehao Li, Zichen Ding 0002, Qi Liu 0049, Zhiyong Wu 0003, Zhuosheng Zhang 0001, Ben Kao, Lingpeng Kong. 9529-9553 [doi]
- PAM: Enhancing General Alignment of Large Reasoning Models through Priority-Aware MetacognitionZhihao Xu, Fuzhen Yang, Liang Lin, Xiting Wang. 9554-9573 [doi]
- One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving FrameworkQi Jia, Ye Shen, Xiujie Song, Kaiwei Zhang, Shibo Wang, Dun Pei, Xiangyang Zhu, Guangtao Zhai. 9574-9590 [doi]
- AGSC: Adaptive Granularity and Semantic Clustering for Uncertainty Quantification in Long-text GenerationGuanran Luo, Wentao Qiu, Wanru Zhao, Wenhan Lv, ZhongQuan Jian, Meihong Wang, Qingqiang Wu 0001. 9591-9605 [doi]
- Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMsYu Li, Xiaoran Shang, Qizhi Pei, Yun Zhu, Xin Gao 0001, Honglin Lin, Zhanping Zhong, Zhuoshi Pan, Zheng Liu, Xiaoyang Wang, Conghui He, Dahua Lin, Feng Zhao 0004, Lijun Wu 0003. 9606-9625 [doi]
- Understanding or Memorizing? A Case Study of German Definite Articles in Language ModelsJonathan Drechsel, Erisa Bytyqi, Steffen Herbold. 9626-9652 [doi]
- Alloc-MoE: Budget-Aware Expert Activation Allocation for Efficient Mixture-of-Experts InferenceBaihui Liu, Kaiyuan Tian, Wei Wang, Zhaoning Zhang 0001, Linbo Qiao, Dongsheng Li 0001. 9653-9667 [doi]
- CodeEvo: Interaction-Driven Synthesis of Code-centric Data through Hybrid and Iterative FeedbackQiushi Sun, Jingyang Gong, Lei Li 0005, Qipeng Guo, Fei Yuan 0006. 9668-9687 [doi]
- Benchmarking and Learning Real-World Customer Service DialogueTianhong Gao, Jundong Shen, Jiapeng Wang, Bei Shi, Ying Ju, Junfeng Yao, Huiyu Yu. 9688-9711 [doi]
- AdaJudge: Adaptive Multi-Perspective Judging for Reward ModelingYongliang Miao, Yangyang Liang, Mengnan Du. 9712-9724 [doi]
- IEvoAgent: Evolving Conversational Agent based on User Implicit FeedbackYichen Cai 0005, Jiayang Li 0003, Junyuan Qiu, Jingya Guo, Weitao You, Changyuan Yang, Lingyun Sun, Pei Chen 0005. 9725-9743 [doi]
- SGPVT: Self-Generated Proximal Visual Tokens for Mitigating Proximal Collateral Damage in MLLM UnlearningJiaqi Li, Zhijing Zhang, Jiahui Geng, Sheng Bi, Chuanyi Zhang, Fan Liu 0003, Guilin Qi. 9744-9763 [doi]
- VIGIL: Defending LLM Agents Against Tool-Stream Injection via Verify-Before-CommitJunda Lin, Zhaomeng Zhou, Zhi Zheng, Shuochen Liu, Tong Xu 0001, Yong Chen, Enhong Chen. 9764-9785 [doi]
- "I See What You Did There": Can Large Vision-Language Models Understand Multimodal Puns?Naen Xu, Jiayi Sheng, Changjiang Li, Chunyi Zhou 0001, Yuyuan Li, Tianyu Du, Jun Wang, Zhihui Fu, Jinbao Li, Shouling Ji. 9786-9805 [doi]
- TRACE: Traversal Retrieval-Augmented Chain of Evidence for Document UnderstandingLiqi He, Zuchao Li, Hao Huang, Ping Wang. 9806-9825 [doi]
- FinKario: Event-Enhanced Automated Construction of Financial Knowledge GraphXiang Li 0169, Penglei Sun, Wanyun Zhou, Zikai Wei, Yongqi Zhang, Xiaowen Chu 0001. 9826-9845 [doi]
- EvoSci: A Bio-Inspired Multi-Agent Framework for the Evolution of Scientific DiscoveryXiaoyu Xiong, Yuqi Ren, Deyi Xiong. 9846-9878 [doi]
- DREAM: Deep Research Evaluation with Agentic MetricsElad Ben-Avraham, Changhao Li, Ron Dorfman, Roy Ganz, Oren Nuriel, Amir Dudai, Aviad Aberdam, Noah Flynn, Elman Mansimov, Aditya Kalyanpur, Ron Litman. 9879-9904 [doi]
- ThinkPersona: Thinking with Persona Graphs for Faithful Individualized Role-PlayingYichen Cai 0005, Pei Chen 0005, Jiayang Li 0003, Jingya Guo, Zejian Li, Changyuan Yang, Lingyun Sun. 9905-9927 [doi]
- Sparrow: Text-Anchored Window Attention with Visual-Semantic Glimpsing for Speculative Decoding in Video LLMsLibo Zhang, Zhaoning Zhang, Wangyang Hong, Dongsheng Li. 9928-9942 [doi]
- SPEAK: Spiking Neurons as an Entropy-Aware Tokenizer for Large Language ModelsMing Chen, Wenyao Li, Chao Liang, Shi Gu, Peng Lin, De Ma, Huajin Tang, Qian Zheng, Gang Pan 0001. 9943-9960 [doi]
- Unlocking Implicit Experience: Synthesizing Tool-Use Trajectories from TextZhihao Xu, Rumei Li, Jiahuan Li, Rongxiang Weng, Jingang Wang, Xunliang Cai, Xiting Wang. 9961-9980 [doi]
- A Layer-wise Analysis of Supervised Fine-TuningQinghua Zhao, Xueling Gong, Xinyu Chen, Zhongfeng Kang, Xinlu Li. 9981-9992 [doi]
- Think in Latent Thoughts: A New Paradigm for Gloss-Free Sign Language TranslationYiyang Jiang, Li Zhang, Xiao-Yong Wei, Li Qing. 9993-10012 [doi]
- CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-TuningBiao Yi, Tiansheng Huang, Baolei Zhang, Tong Li 0011, Lihai Nie, Zheli Liu, Li Shen 0008. 10013-10030 [doi]
- Correct When Paired, Wrong When Split: Decoupling and Editing Modality-Specific Neurons in MLLMsTingchao Fu, Wenkai Wang, Fanxiao Li, Huadong Zhang, Jinhong Zhang, Dayang Li, Yunyun Dong, Renyang Liu 0001, Wei Zhou. 10031-10048 [doi]
- ACIArena: Toward Unified Evaluation for Agent Cascading InjectionHengyu An, Minxi Li, Jinghuai Zhang, Naen Xu, Chunyi Zhou 0001, Changjiang Li, Xiaogang Xu 0002, Tianyu Du, Shouling Ji. 10049-10066 [doi]
- PLAWBENCH: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal PracticeYuzhen Shi, Huanghai Liu, Yiran Hu, Gaojie Song, Xinran Xu, Yubo Ma, Tianyi Tang, Li Zhang, Qingjing Chen, Di Feng, Wenbo Lv, Weiheng Wu, Kexin Yang 0002, Sen Yang, Wei Wang 0225, Rongyao Shi, Yuanyang Qiu, Yuemeng Qi, Jingwen Zhang, Xiaoyu Sui, Yifan Chen, Yi Zhang 0101, an Yang, Bowen Yu 0002, Dayiheng Liu, Junyang Lin, Weixing Shen, Bing Zhao, Charles L. A. Clarke, Hu Wei. 10067-10116 [doi]
- VoxMind: An End-to-End Agentic Spoken Dialogue SystemTianle Liang, Yifu Chen, Shengpeng Ji, Yijun Chen, Zhiyang Jia, Jingyu Lu 0001, Fan Zhuo, Xueyi Pu, Yangzhuo Li, Zhou Zhao 0001. 10117-10139 [doi]
- MT³: A Synergistic Multi-Task RL Framework for Specializing MLLMs in Text Image Machine TranslationZhaopeng Feng, Yupu Liang, Shaosheng Cao, Jiayuan Su, Jiahan Ren, Zhijie Zhou, Wenxuan Huang 0001, Jian Wu 0001, Zuozhu Liu. 10140-10157 [doi]
- Do LLMs Capture Embodied Cognition and Cultural Variation? Cross-Linguistic Evidence from DemonstrativesYu Wang, Emmanuele Chersoni, Chu-Ren Huang. 10158-10174 [doi]
- Feeling Rules in Language Models: Mapping Norms of Emotional Appropriateness Across Roles, Institutions, and IntensityGuangrui Fan, Dandan Liu, Aznul Qalid Md Sabri, Rui Zhang 0082, Lihu Pan 0001. 10175-10193 [doi]
- SGT: Securing Open-Source LLMs Against Malicious Fine-tuning via Safety Guidance TriggerSunguk Shin 0001, Fangzhao Wu, Byung Jun Lee, Meeyoung Cha, Sungwon Park 0001. 10194-10207 [doi]
- Every Token Counts: Generalizing 16M Ultra-Long Context in Large Language ModelsXiang Hu, Zhanchao Zhou, Ruiqi Liang, Zehuan Li, Wei Wu, Jianguo Li. 10208-10220 [doi]
- Self-Reflective Generation at Test TimeJian Mu, Qixin Zhang, Zhiyong Wang, Menglin Yang 0001, Shuang Qiu, Chengwei Qin, Zhongxiang Dai, Yao Shu. 10221-10239 [doi]
- GKnow: Measuring the Entanglement of Gender Bias and Factual GenderLeonor Veloso, Hinrich Schütze. 10240-10260 [doi]
- Reinforcing Agentic Search Via Reward Density OptimizationKun Luo, Hongjin Qian, Zheng Liu, Ziyi Xia, Shitao Xiao, Zhao Cao, Siqi Bao, Jun Zhao, Kang Liu. 10261-10283 [doi]
- Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent CollaborationZijun Liu, Zhennan Wan, Peng Li 0030, Ming Yan 0008, Fei Huang 0002, Yang Liu 0005. 10284-10314 [doi]
- M²PO: Multi-Perspective Multi-Pair Preference Optimization for Machine TranslationHao Wang, Linlong Xu, Heng Liu, Yangyang Liu, Xiaohu Zhao, Bo Zeng, Liangying Shao, Yichen Dong, Xinwei Wu, Jiang Zhou, Tianyu Dong, Xiangxiang Zeng, Longyue Wang, Weihua Luo. 10315-10336 [doi]
- An Exploration of Mamba for Speech Self-Supervised ModelsTzu-Quan Lin, Heng-Cheng Kuo, Tzu-Chieh Wei, Hsi-Chun Cheng, Chun-Wei Chen, Hsien-Fu Hsiao, Yu Tsao 0001, Hung-yi Lee. 10337-10350 [doi]
- Ready Jurist One: Benchmarking Language Agents for Legal Intelligence in Dynamic EnvironmentsZheng Jia, Shengbin Yue, Wei Chen 0088, Siyuan Wang, Yidong Liu, Zejun Li, Yun Song, Zhongyu Wei. 10351-10376 [doi]
- When Morphology Hides in Plain Sight: Breaking the Isolation in Vietnamese and BeyondAnh Trac Duc Dinh, Khang Hoang Nhat Vo, Tai Tien Ta, Vinh Cong Doan, Tho Quan. 10377-10392 [doi]
- FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio PretrainingXiquan Li, Xuenan Xu, Ziyang Ma 0001, Wenxi Chen, Haolin He, Qiuqiang Kong, Xie Chen 0001. 10393-10408 [doi]
- OCR-Memory: Optical Context Retrieval for Long-Horizon Agent MemoryJinze Li 0001, Yang Zhang, Xin Yang, Jiayi Qu, Jinfeng Xu 0003, Shuo Yang 0011, Junhua Ding, Edith Cheuk-Han Ngai. 10409-10420 [doi]
- From Past To Path: Masked History Learning for Next-Item Prediction in Generative RecommendationKaiwen Wei, Kejun He, Xiaomian Kang, Jie Zhang, Ymyang, Li Jin, Zhenyang Li, Jiang Zhong, Richard He Bai, Junnan Zhu. 10421-10441 [doi]
- MuSe: Multi-Stage Graph Reasoning via Vision-Language ModelsGuanyu Wang 0002, Xu Chu 0001, Zhijie Tan, Xinrong Chen, Tong Mo, Weiping Li 0002. 10442-10462 [doi]
- Where and What: Reasoning Dynamic and Implicit Preferences in Situated Conversational RecommendationDongding Lin, Jian Wang 0054, Yongqi Li 0001, Wenjie Li 0002. 10463-10481 [doi]
- When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use BehaviorsChenghao Yang, Yuning Zhang, Zhoufutu Wen, Tao Gong, Jiaheng Liu, Qi Chu 0001, Nenghai Yu. 10482-10502 [doi]
- Mind the (DH) Gap! A Contrast in Risky Choices Between Reasoning and Conversational LLMsLuise Ge, Yongyan Zhang, Yevgeniy Vorobeychik. 10503-10525 [doi]
- Beyond Single-View Detection: A Dual-Space Reasoning Framework for Interpretable Harmful Meme UnderstandingWenqing Hou, Hongkui Tu, Ye Wang 0015, Yue Zhang 0049, Yuying Liu 0001, Dong Zhu, Liqun Gao, Bin Zhou 0004. 10526-10544 [doi]
- From Experts to Bases: Orthogonal Subspace Mixture for Continual Multimodal Instruction TuningPei Chen 0005, Xilai Wang, Qixu Shi, Zejian Li, Lingyun Sun. 10545-10561 [doi]
- Distilling Large Embeddings via Hyperspherical Householder QuantizationYihang Wang, Bin Wu, Yueyang Su, Tianfu Zhang, Yiqi Du, Lei Yu, Jiafeng Guo, Xueqi Cheng. 10562-10576 [doi]
- Masked by Consensus: Disentangling Privileged Knowledge in LLM CorrectnessTomer Ashuach, Shai Gretz, Yoav Katz, Yonatan Belinkov, Liat Ein-Dor. 10577-10596 [doi]
- Unified Thinker: A General Reasoning Core for Image GenerationSashuai Zhou, Qiang Zhou, Jijin Hu, Hanqing Yang 0010, Yue Cao, Junpeng Ma, Yinchao Ma, Jun Song, Tiezheng Ge, Cheng Yu, Bo Zheng 0007, Zhou Zhao 0001. 10597-10613 [doi]
- Visual and Memory-Augmented Soccer Commentary GenerationHaoran Sun, Natthawut Kertkeidkachorn, Kiyoaki Shirai. 10614-10629 [doi]
- InstructDiff: Domain-Adaptive Data Selection via Contrastive Entropy for Efficient LLM Fine-TuningJunyou Su, He Zhu, Xiao Luo, Liyu Zhang, Hong-Yu Zhou, Yun Chen 0007, Peng Li 0030, Yang Liu 0005, Guanhua Chen 0001. 10630-10648 [doi]
- Jakiro: Boosting Speculative Decoding via Decoupled MoEHaiduo Huang, Fuwei Yang, Zhenhua Liu, Pengju Ren. 10649-10668 [doi]
- Beyond Word Boundaries: A Hebrew Coreference Benchmark and an Evaluation Protocol for Morphologically Complex TextRefael Shaked Greenfeld, Reut Tsarfaty. 10669-10683 [doi]
- Reasoning with Ontology Graph: Toward Type-Constrained Knowledge Graph Question AnsweringYongxue Shan, Jie Peng, Zixuan Dong, Fei Hu 0005, Xiaodong Wang 0002. 10684-10697 [doi]
- Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related ImagesQishun Yang, Shu Yang, Lijie Hu, Di Wang. 10698-10718 [doi]
- GRASPrune: Global Gating for Budgeted Structured Pruning of Large Language ModelsZiyang Wang, Jiangfeng Xiao, Chuan Xiao 0001, Ruoxiang Li, Rui Mao 0001, Jianbin Qin. 10719-10736 [doi]
- All That Glisters Is Not Gold: A Benchmark for Reference-Free Counterfactual Financial Misinformation DetectionYuechen Jiang, Zhiwei Liu 0003, Yupeng Cao, Yueru He, Ziyang Xu, Chen Xu, Zhiyang Deng, Prayag Tiwari, Xi Chen, Alejandro Lopez-Lira, Jimin Huang, Junichi Tsujii, Sophia Ananiadou. 10737-10776 [doi]
- Musical Score Understanding Benchmark: Evaluating Large Language Models' Comprehension of Complete Musical ScoresCongren Dai, Yue Yang, Krinos Li, Huichi Zhou, Shijie Liang, Zhang Bo, Enyang Liu, Ge Jin, Hongran An, Haosen Zhang, Peiyuan Jing, Kinhei Lee, Zhenxuan Zhang, Xiaobing Li, Maosong Sun 0001. 10777-10799 [doi]
- EchoVLM: Dynamic Mixture-of-Experts Vision-Language Model for Universal Ultrasound IntelligenceChaoyin She, Ruifang Lu, Lida Chen, Wei Wang 0181, Qinghua Huang. 10800-10822 [doi]
- Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language ModelsVu Tuan Truong, Long Bao Le. 10823-10841 [doi]
- How Do LLMs and VLMs Understand Viewpoint Rotation Without Vision? An Interpretability StudyZhen Yang, Ping Jian, Zhongbin Guo, Zuming Zhang, Chengzhi Li, Yonghong Deng, Xinyue Zhang, Wenpeng Lu. 10842-10864 [doi]
- Sycophants in the Courtroom: Are LLMs Fragile to Juridical Authority and Evolving Legal Standards?Lorenzo Molfetta, Alessio Cocchieri, Luca Ragazzi, Ilaria Bartolini, Marco Patella, Gianluca Moro. 10865-10886 [doi]
- Valid Survey Simulations with Limited Human Data: The Roles of Prompting, Fine-Tuning, and RectificationStefan Krsteski, Giuseppe Russo 0001, Serina Chang, Robert West 0001, Kristina Gligoric. 10887-10906 [doi]
- ODUTQA-MDC: A Task for Open-Domain Underspecified Tabular QA with Multi-turn Dialogue-based ClarificationZhensheng Wang, ZhanTeng Lin, Wenmian Yang, Kun Zhou, Yiquan Zhang, Weijia Jia 0001. 10907-10928 [doi]
- CuBridge: An LLM-Based Framework for Understanding and Reconstructing High-Performance Attention KernelsXing Ma, Yangjie Zhou 0001, Wu Sun, Zihan Liu 0002, Jingwen Leng, Yun Lin 0001, Shixuan Sun, Minyi Guo, Jin Song Dong 0001. 10929-10946 [doi]
- Learning from Contrasts: Synthesizing Reasoning Paths from Diverse Search TrajectoriesPeiyang Liu, Zhirui Chen, Xi Wang, Di Liang, Youru Li, Zhi Cai, Wei Ye. 10947-10969 [doi]
- Defenses Against Prompt Attacks Learn Surface HeuristicsShawn Li, Chenxiao Yu, Zhiyu Ni, Hao Li, Charith Peris, Chaowei Xiao, Yue Zhao. 10970-10987 [doi]
- Memory-Augmented LLM-based Multi-Agent System for Automated Feature Generation on Tabular DataFengxian Dong, Zhi Zheng 0008, Xiao Han, Wei Chen 0156, Jingqing Ruan, Tong Xu 0001, Yong Chen, Enhong Chen. 10988-11007 [doi]
- Learning from the Irrecoverable: Error-Localized Policy Optimization for Tool-Integrated LLM ReasoningQiao Liang, Yuke Zhu, Chao Ge, Lei Yang, Ying Shen, Bo Zheng, Sheng Guo 0005. 11008-11028 [doi]
- Learning from Evolving Training Dynamics: An Entropy-Maximizing Data Curation Strategy for LLM Supervised Post-TrainingMengxiang Zhang, Lingyuan Liu. 11029-11045 [doi]
- Reinforcement Learning on Pre-Training DataSiheng Li, Kejiao Li 0001, Zenan Xu, Guanhua Huang, Kun Li, Haoyuan Wu, Jiajia Wu, Zihao Zheng, Chenchen Zhang, Kun Shi, Xue Gong, Qi Yi, Ruibin Xiong, Tingqiang Xu, Yuhao Jiang, Jianfeng Yan, Yuyuan Zeng, Guanghui Xu, Jinbao Xue, Zhijiang Xu, Zheng Fang, Shuai Li, Qibin Liu, Xiaoxue Li, Zhuoyu Li, Yangyu Tao, Fei Gao, Cheng Jiang, Bochao Wang, Kai Liu 0052, Jianchen Zhu, Wai Lam, Bo Zhou, Di Wang 0052. 11046-11057 [doi]
- Limited Linguistic Diversity in Embodied AI DatasetsSelma Liliane Wanna, Agnes Luhtaru, Jonathan Salfity, Ryan Barron, Juston Moore, Cynthia Matuszek, Mitch Pryor. 11058-11086 [doi]
- Towards Mitigating Modality Bias in Vision-Language Models for Temporal Action LocalizationJiaqi Li 0008, Guangming Wang 0001, Shuntian Zheng, Minzhe Ni, Xiaoman Lu, Guanghui Ye, Yu Guan 0001. 11087-11104 [doi]
- CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace CreditKangyu Wang, Zhiyun Jiang, Haibo Feng, Weijia Zhao, Lin Liu, Jianguo Li, Zhenzhong Lan, Weiyao Lin. 11105-11123 [doi]
- Question Difficulty Estimation for Large Language Models via Answer Plausibility ScoringJamshid Mozafari, Bhawna Piryani, Adam Jatowt. 11124-11151 [doi]
- Vector Calligrapher: Generating Scalable Vector Graphics via Structured Linguistic SupervisionBo Zhou, Xikang Chen, Yan Gong, Yin Zhang 0006. 11152-11168 [doi]
- CoQuIR: A Comprehensive Benchmark for Code Quality-Aware Information RetrievalJiahui Geng, Fengyu Cai, Shaobo Cui 0006, Qing Li 0038, Liangwei Chen, Chenyang Lyu, Haonan Li, Derui Zhu, Alexander Pretschner, Heinz Koeppl, Fakhri Karray. 11169-11185 [doi]
- Sherry: Hardware-Efficient 1.25-Bit Ternary Quantization via Fine-grained SparsificationHong Huang, Decheng Wu, Qiangqiang Hu, Guanghua Yu, Jinhai Yang 0006, Jianchen Zhu, Xue Liu, Dapeng Wu 0001. 11186-11204 [doi]
- DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image InputsWenzhuo Xu, Zhipeng Wei 0001, Zonghao Ying, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Quanchen Zou. 11205-11221 [doi]
- PIAST: Rapid Prompting with In-context Augmentation for Scarce Training dataPawel Batorski, Paul Swoboda. 11222-11242 [doi]
- ProgressLM: Towards Progress Reasoning in Vision-Language ModelsJianshu Zhang, Chengxuan Qian, Haosen Sun, Haoran Lu, Dingcheng Wang, Letian Xue, Han Liu 0001. 11243-11271 [doi]
- Forest Before Trees: Latent Superposition for Efficient Visual ReasoningYubo Wang, Juntian Zhang, Yichen Wu, Yankai Lin, Nils Lukas, Yuhan Liu. 11272-11288 [doi]
- Beyond Pedagogical Principles: Multi-Horizon Preference Optimization for Efficient Socratic TutoringXin Shi, Chao Zhang, Yifan Zhu, Xueqiao Zhang, Yawei Luo. 11289-11306 [doi]
- Protecting Language Models Against Unauthorized Distillation through Trace RewritingXinhang Ma, William Yeoh 0001, Ning Zhang 0017, Yevgeniy Vorobeychik. 11307-11324 [doi]
- The Confidence Dichotomy: Analyzing and Mitigating Miscalibration in Tool-Use AgentsWeihao Xuan, Qingcheng Zeng, Heli Qi, Yunze Xiao, Junjue Wang, Naoto Yokoya. 11325-11349 [doi]
- XOXO: Stealthy Cross-Origin Context Poisoning Attacks against AI Coding AssistantsAdam Storek, Mukur Gupta, Noopur Bhatt, Aditya Gupta, Janie Kim, Prashast Srivastava, Suman Jana. 11350-11373 [doi]
- SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead ReasoningLichao Wang, ZhaoXing Ren, Tianzhuo Yang, Jiaming Ji, Chi Harold Liu, Yaodong Yang 0001, Juntao Dai. 11374-11396 [doi]
- C2: Scalable Rubric-Augmented Reward Modeling from Binary PreferencesAkira Kawabata, Saku Sugawara. 11397-11424 [doi]
- LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion ModelsFengqi Zhu, Rongzhen Wang, Shen Nie, Xiaolu Zhang, Chunwei Wu, Jun Zhou, Yankai Lin, Ji-Rong Wen, Chongxuan Li. 11425-11460 [doi]
- HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM AlignmentYuexiao Liu, Lijun Li, Xingjun Wang, Jing Shao. 11461-11479 [doi]
- Just Pass Twice: Efficient Token Classification with LLMs for Zero-Shot NERAhmed Ewais, Ahmed Hashish, Amr Ali. 11480-11497 [doi]
- Lifting Optimized Binaries to Canonical Compiler IR via Structure-Aware Retrieval and Iterative VerificationXiaoAo Zhu, Jie Ren 0007, Zhiqiang Li 0003, Jie Zheng 0005, Zhanyong Tang, Zheng Wang 0001. 11498-11516 [doi]
- Provably Safe Offline-to-Online RL: Decoupling Learning from Data-Driven Safety EnforcementKaitong Cai, Jusheng Zhang, Keze Wang. 11517-11536 [doi]
- SHAPE: Unifying Safety, Helpfulness and Pedagogy for Educational LLMsSihang Zhao, Kangrui Yu, Youliang Yuan, Pinjia He, Hongyi Wen. 11537-11553 [doi]
- Evolving Sparsity: Leveraging Token Importance Dynamics for Efficient LLM Decoding with Sparse AttentionRuizi Han, Miao Zhang, Ziyue Qiao, Liqiang Nie. 11554-11566 [doi]
- MOA: Multi-Objective Alignment for Role-Playing AgentsChonghua Liao, Ke Wang, Yuchuan Wu, Ruoran Li, Fei Huang 0002, Yongbin Li 0001. 11567-11588 [doi]
- Losing our Tail, Again: (Un)Natural Selection & Multilingual LLMsEva Vanmassenhove. 11589-11600 [doi]
- From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video AgentsNiu Lian, YuTing Wang, Hanshu Yao, Jinpeng Wang 0002, Bin Chen, Yaowei Wang 0001, Min Zhang 0005, Shu-Tao Xia. 11601-11617 [doi]
- Chain-of-Memory: Lightweight Memory Construction with Dynamic Evolution for LLM AgentsXiucheng Xu, Bingbing Xu 0001, Tian Xueyun, Zihe Huang, Rongxin Chen, Yunfan Li, Huawei Shen. 11618-11631 [doi]
- WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation MetricsChenxu Liu, Yingjie Fu, Wei Yang 0013, Ying Zhang 0012, Tao Xie 0001. 11632-11666 [doi]
- Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language ModelsJingwei Ni, Ekaterina Fadeeva, Tianyi Wu, Mubashara Akhtar, Jiaheng Zhang, Elliott Ash, Markus Leippold, Timothy Baldwin, See-Kiong Ng, Artem Shelmanov, Mrinmaya Sachan. 11667-11689 [doi]
- Adaptive Prompt Structure Factorization: A Framework for Self-Discovering and Optimizing Compositional Prompt ProgramsHaoyue Liu, Zhichao Wang, Yongxin Guo 0001, Haoran Shou, Xiaoying Tang 0002. 11690-11714 [doi]
- Cognitive Alpha Mining via LLM-Driven Code-Based EvolutionFengyuan Liu, Yi Huang, Sichun Luo, Yuqi Wang, Yazheng Yang, Xinye Li, Zefa Hu, Junlan Feng, Qi Liu. 11715-11749 [doi]
- Why Do Emotions Change? Appraisal-Guided Reasoning for Emotion-Cause Triplet Extraction in ConversationsQiao Liang, Ying Shen, Yao Liu, Tiantian Chen, Lin Zhang. 11750-11772 [doi]
- KV-Embedding: Training-free Text Embedding via Internal KV Re-routing in Decoder-only LLMsYixuan Tang, Yi Yang. 11773-11794 [doi]
- Fingerprinting LLMs via Prompt InjectionYuepeng Hu, Zhengyuan Jiang, Mengyuan Li, Osama Ahmed, Zhicong Huang, Cheng Hong 0001, Neil Zhenqiang Gong. 11795-11810 [doi]
- Exploring Layer Activation Dynamic of CoT via Knowledge ProbeChuanxin Zhang, Jiajun Liu, Yao He, Wenjun Ke 0002, Peng Wang, Yankun Le, Sirui Liu, Zhaoyu Yang. 11811-11830 [doi]
- From Trust to Compromise: Outcome-Verified LLM Phishing Simulation and Real-Time DefenseTulika Tewari, Nalin Asanka Gamagedara Arachchilage, Jagat Sesh Challa, Dhruv Kumar 0001. 11831-11845 [doi]
- EvoNarrator: Modeling Scientific Evolution for Feasible Hypothesis GenerationXiaoying Le, Pengfei Qian, Yuanzhao Zhai, Xu Zhang, Qian Liu, Dawei Feng, Bo Ding 0001. 11846-11865 [doi]
- DecoCal: Decoding with Calibration in Diffusion Large Language ModelsFan Xu, Huixuan Zhang, Xiaojun Wan 0001. 11866-11880 [doi]
- LiveFact: A Dynamic, Time-Aware Benchmark for LLM-Driven Fake News DetectionCheng Xu 0006, Changhong Jin, Yingjie Niu, Nan Yan, Yuke Mei, Shuhao Guan, Liming Chen 0001, M. Tahar Kechadi. 11881-11910 [doi]
- Beyond "I Don't Know": Evaluating LLM Self-Awareness in Discriminating Data and Model UncertaintyJingyi Ren, Ante Wang, Yunghwei Lai, Xiaolong Wang, Linlu Gong, Weitao Li, Weizhi Ma, Yang Liu 0005. 11911-11929 [doi]
- Unlearners Can Lie: Evaluating and Improving Honesty in LLM UnlearningRenjie Gu, Jiazhen Du, Yihua Zhang, Sijia Liu 0001. 11930-11952 [doi]
- MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite MatchingChangle Qu, Sunhao Dai, Hengyi Cai, Jun Xu 0001, Shuaiqiang Wang, Dawei Yin 0001. 11953-11968 [doi]
- Knowledge is Not Enough: Injecting RL Skills for Continual AdaptationPingzhi Tang, Yiding Wang, Muhan Zhang. 11969-11997 [doi]
- BhashaSutra: A Task-Centric Unified Survey of Indian NLP Datasets, Corpora, and ResourcesRaghvendra Kumar 0003, Devankar Raj, Sriparna Saha 0001. 11998-12064 [doi]
- A Dual-Task Paradigm to Investigate Sentence Comprehension Strategies in Language ModelsRei Emura, Saku Sugawara. 12065-12084 [doi]
- Diffusion-CAM: Faithful Visual Explanations for dMLLMsHaomin Zuo, Yidi Li, Luoxiao Yang, Xiaofeng Zhang. 12085-12101 [doi]
- Beyond Noise: Characterizing Creative Potential in Unverifiable LLM HallucinationsYu Yan, Chunhong Zhang, Haiyu Zhao, Ziyang Zeng, Zihao Liu, Yongkang Wu, Jianzhou Diao, Yijie Chen, Shujie Wang, Zheng Hu 0001. 12102-12124 [doi]
- LLM-SLM Collaborative Framework of Idiomatic Expression GenerationHui Gao, Changhao Song, Peng Zhang, Jing Zhang, Chang Yang, Liuxian Ge. 12125-12145 [doi]
- Focus-dLLM: Accelerating Long-Context Diffusion LLM Inference via Confidence-Guided Context FocusingLingkun Long, Yushi Huang, Shihao Bai, Ruihao Gong, Jun Zhang, Ao Zhou, Jianlei Yang 0001. 12146-12160 [doi]
- Table Question Answering in the Era of Large Language Models: A Comprehensive Survey of Tasks, Methods, and EvaluationWei Zhou, Bolei Ma, Annemarie Friedrich, Mohsen Mesgar. 12161-12189 [doi]
- RouteMoA: Dynamic Routing without Pre-Inference Boosts Efficient Mixture-of-AgentsJize Wang, Han Wu, Zhiyuan You, Yiming Song, Yijun Wang, Zifei Shan, Yining Li, Songyang Zhang 0001, Xinyi Le, Cailian Chen, Xinping Guan, Dacheng Tao. 12190-12208 [doi]
- Patches of Nonlinearity: Instruction Vectors in Large Language ModelsIrina Bigoulaeva, Jonas Rohweder, Subhabrata Dutta, Iryna Gurevych. 12209-12262 [doi]
- Reasoning Gets Harder for LLMs Inside A DialogueIvan Kartác, Mateusz Lango, Ondrej Dusek. 12263-12303 [doi]
- Capability Decomposition for Unified Information Extraction via Hierarchical Mixture-of-ExpertsJing Zhou, Peng Wang 0004, Wenjun Ke 0002, Jiajun Liu 0005, Yao He. 12304-12318 [doi]
- PDR: A Plug-and-Play Positional Decay Framework for LLM Pre-training Data DetectionJinhan Liu, Yibo Yang, Ruiying Lu, Piotr Piekos, Yimeng Chen, Peng Wang, Dandan Guo. 12319-12344 [doi]
- PRISM: Probabilistic Reward Model with Inherent Structural ModelingYuhang Zhou, Yixin Cao 0002, Yuchen Ni, Shihan Dou, Xutian Chen, Ge Zhang, Xiang Liu, Guangnan Ye. 12345-12362 [doi]
- Multilingual Idioms in Sentences and Conversations Across High-, Medium-, and Low-Resource LanguagesSaeed Almheiri, Bilal Elbouardi, Salsabila Zahirah Pranida, Irina Nikishina, Ashwath Rao, Parameswari Krishnamurthy, Muhammad Cendekia Airlangga, Rifo Ahmad Genadi, Nguyen Phan Gia Bao, Amir Hossein Yari, Hawau Olamide Toyin, Nurdaulet Mukhituly, Mena Attia, Besher Hassan, Ahmad Fathan Hidayatullah, Tatsuki Kuribayashi, Haonan Li 0002, Suma Bhat, Fajri Koto. 12363-12389 [doi]
- Author-in-the-Loop Response Generation and Evaluation: Integrating Author Expertise and Intent in Responses to Peer ReviewQian Ruan, Iryna Gurevych. 12390-12418 [doi]
- WeightLoRA: Keep Only Necessary AdaptersAndrey Veprikov, Vladimir Solodkin, Alexander Zyl, Andrey V. Savchenko, Aleksandr Beznosikov. 12419-12437 [doi]
- Reward Modeling for Scientific Writing EvaluationFurkan Sahinuç, Subhabrata Dutta, Iryna Gurevych. 12438-12479 [doi]
- Deriving Character Logic from Storyline as Codified Decision TreesLetian Peng, Kun Zhou 0002, Longfei Yun, Yupeng Hou, Jingbo Shang. 12480-12509 [doi]
- GASim: A Graph-Accelerated Hybrid Framework for Social SimulationXuan Zhou, Yanhui Sun, Hantao Yao, Allen He, Yongdong Zhang 0001, Wu Liu 0005. 12510-12528 [doi]
- Mock Worlds, Real Skills: Building Small Agentic Language Models with Synthetic Tasks, Simulated Environments, and Rubric-Based RewardsYuanjie Lyu, Chengyu Wang 0014, Lei Shen, Jun Huang, Tong Xu 0001. 12529-12545 [doi]
- Investigating Cross-Modal Skill Injection: Scenarios, Methods, and HyperparametersZhiyu Xu, Lean Wang, Yuanxin Liu, Lei Li, Hao Zhou 0012, Fandong Meng, Jie Zhou 0001, Xu Sun 0001. 12546-12563 [doi]
- The Bidirectional Process Reward ModelLingyin Zhang, Jun Gao, Xiaoxue Ren, Ziqiang Cao. 12564-12580 [doi]
- AgentMark: Utility-Preserving Behavioral Watermarking for AgentsKaibo Huang, Jin Tan, Yukun Wei, Wanling Li, Zipei Zhang, Hui Tian, Zhongliang Yang, Linna Zhou. 12581-12603 [doi]
- Generative Gamer: Learning Equilibrium Strategy by LLM-driven Dynamic DeductionYadong Zhang, Xinshu Shen, Yupei Ren, Shangqing Zhao, Man Lan. 12604-12617 [doi]
- Probing for Reading TimesEleftheria Tsipidi, Samuel Kiegeland, Francesco Ignazio Re, Tianyang Xu 0002, Mario Giulianelli, Karolina Stanczak, Ryan Cotterell. 12618-12642 [doi]
- No More Stale Feedback: Co-Evolving Critics for Open-World Agent LearningZhicong Li, Lingjie Jiang, Yulan Hu, Xingchen Zeng, Yixia Li, Xiangwen Zhang, Guanhua Chen, Zheng Pan, Xin Li, Yong Liu. 12643-12660 [doi]
- Continuous Interpretive Steering for Scalar DiversityYe-eun Cho. 12661-12678 [doi]
- A Scalable Multi-LLM Collaboration System with Retrieval-based Selection and Exploration-Exploitation-Driven EnhancementShengji Tang, Jianjian Cao, Weihao Lin 0002, Jiale Hong, Bo Zhang 0069, Shuyue Hu, Lei Bai 0001, Tao Chen 0003, Wanli Ouyang, Peng Ye 0006. 12679-12697 [doi]
- From Form to Logic: Masked Reconstruction and Reasoning Distillation for Short Video Fake News DetectionQingyan Wang, Lianwei Wu, Botao Wang, Kang Wang, Yaxiong Wang. 12698-12711 [doi]
- UR² : Unify RAG and Reasoning through Reinforcement LearningWeitao Li, Boran Xiang, Xiaolong Wang, Jingyi Ren, Ante Wang, Zhinan Gou, Weizhi Ma, Yang Liu. 12712-12751 [doi]
- LLM-as-Scheduler: Agentic Workflow Dynamic SchedulingDawei Xiang, Kexin Chu, Wenyan Xu, Wenhui Zhang, Wei Zhang. 12752-12763 [doi]
- Mathematical Proof as a Litmus Test: Revealing Failure Modes of Advanced Large Reasoning ModelsDadi Guo, Jiayu Liu, Zhiyuan Fan, Zhitao He 0001, Haoran Li, Yuxin Li, Yumeng Wang 0010, Yi R. Fung 0001. 12764-12804 [doi]
- Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement LearningSikuan Yan, Xiufeng Yang, Zuchao Huang, Ercong Nie, Zifeng Ding, Zonggen Li, Xiaowen Ma, Jinhe Bi, Kristian Kersting, Jeff Z. Pan, Hinrich Schütze, Volker Tresp, Yunpu Ma. 12805-12825 [doi]
- CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use AgentsJiayu Liu, Cheng Qian 0008, Zhaochen Su, Qing Zong, Shijue Huang, Bingxiang He, Yi R. Fung 0001. 12826-12858 [doi]
- Decoding Scientific Experimental Images: The SPUR Benchmark for Perception, Understanding, and ReasoningJunpeng Ding, Zichen Tang, Haihong E, Mengyuan Ji, Yang Liu, Haolin Tian, Haiyang Sun, Pengqi Sun, Yang Xu, Yichen Liu, Haocheng Gao, Zijie Xi, Ruomeng Jiang, Peizhi Zhao, Rongjin Li, Yuanze Li, Jiacheng Liu, Zhongjun Yang, Jintong Chen, Siying Lin. 12859-12882 [doi]
- SegTune: Structured and Fine-Grained Control for Song GenerationYuejiao Wang, Zihao Ji, Pengfei Cai, Xu Li, Haorui Zheng, Zewen Song, Zhongliang Liu, Chen Zhang, Pengfei Wan. 12883-12897 [doi]
- Making Large Language Models Efficient Dense RetrieversYibin Lei, Shwai He, Ang Li, Andrew Yates. 12898-12913 [doi]
- Lightweight LLM Agent Memory with Small Language ModelsJiaquan Zhang, Chaoning Zhang, Shuxu Chen, Zhenzhen Huang, Pengcheng Zheng, Zhicheng Wang, Ping Guo, Fan Mo, Sung-Ho Bae, Jie Zou 0001, Jiwei Wei, Yang Yang 0002. 12914-12929 [doi]
- HeteroSpec: Leveraging Contextual Heterogeneity for Efficient Speculative DecodingSiran Liu, Yang Ye, Qianchao Zhu, Zane Cao, Yongchao He. 12930-12947 [doi]
- A Model of the Language ProcessBrandon Duderstadt, Hayden S. Helm. 12948-12959 [doi]
- Rethinking Table Pruning in TableQA: From Sequential Revisions to Gold Trajectory-Supervised Parallel SearchYu Guo, Shenghao Ye, Shuangwu Chen, Zijian Wen, Tao Zhang 0170, Qirui Bai, Dong Jin 0004, Yunpeng Hou, Huasen He, Jian Yang 0014, Xiaobin Tan. 12960-12976 [doi]
- Interleaved Tool-Call Reasoning for Protein Function UnderstandingChuanliu Fan, Zicheng Ma, Huanran Meng, Aijia Zhang, Wenjie Du, Jun Zhang 0069, Ziqiang Cao, Guohong Fu. 12977-12995 [doi]
- Among Us: Language of Conspiracy Theorists on Mainstream RedditFrancesco Corso, Giuseppe Russo 0001, Francesco Pierri 0002, Gianmarco De Francisci Morales. 12996-13017 [doi]
- HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model InferenceBowen Zeng, Feiyang Ren, Jun Zhang 0069, Xiaoling Gu, Ke Chen 0005, Lidan Shou, Huan Li 0003. 13018-13034 [doi]
- Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation AgentsTianyi Ma, Yue Zhang 0004, Zehao Wang, Parisa KordJamshidi. 13035-13065 [doi]
- Bridging Distance and Spectral Positional Encodings via Anchor-Based Diffusion Geometry ApproximationZimo Yan, Zheng Xie, Runfan Duan, Chang Liu, Wumei Du. 13066-13085 [doi]
- A Goal Without a Plan Is Just a Wish: Efficient and Effective Global Planner Training for Long-Horizon Agent TaskShuzheng Si, Haozhe Zhao, Kangyang Luo, Gang Chen 0039, Fanchao Qi, Minjia Zhang, Baobao Chang, Maosong Sun 0001. 13086-13113 [doi]
- Stereotype Bias in a Bilingual Setting: A Culturally Grounded Evaluation in KazakhstanNurkhan Laiyk, Daniil Orel, Ayana Mussabayeva, Maiya Goloburda, Kamila Kuishibekova, Liya Goloburda, Diana Turmakhan, Preslav Nakov, Yuxia Wang 0003, Fajri Koto. 13114-13131 [doi]
- Arguments that Alter Minds: LLM Rationales Sway Human (and LLM) Notions of PlausibilityShramay Palta, Peter Rankel, Sarah Wiegreffe, Rachel Rudinger. 13132-13152 [doi]
- GLARE: Agentic Reasoning for Legal Judgment PredictionXinyu Yang, Chenlong Deng, Zhicheng Dou. 13153-13170 [doi]
- Vista-LLM: Decoupled Query-Guided Visual Token Pruning for Efficient Long-Video Large Language ModelsZhenyu Li, Zuchao Li, Ping Wang 0028, Lefei Zhang, Haojun Ai. 13171-13187 [doi]
- RoboFailRing: Retrieval-Augmented and Language Grounding Failure Detection for VLM-enabled Robotic ManipulationChenduo Ying, Linkang Du, Yuanchao Shu, Peng Cheng 0001. 13188-13202 [doi]
- Scaling Law for Multimodal Large Language Model Supervised Fine-TuningYifan Zhang 0004, Tao Yu, Feng Li, Chaoyou Fu, Yibo Hu 0001, Kun Wang, Qingsong Wen, Zhang Zhang 0001, Liang Wang 0001, Rong Jin 0001. 13203-13228 [doi]
- CrochetBench: Can Vision-Language Models Move from Describing to Doing in Crochet Domain?Peiyu Li, Xiaobao Huang, Ting Hua, Nitesh V. Chawla. 13229-13251 [doi]
- DORA: A Dual-Objective Reinforcement Learning Framework for Effective and Efficient Multimodal Agentic SearchGuangming Qin, Yuhao Deng, Yukun Zhao, Zhenyang Li, Junfeng Wang, Dawei Yin 0001, Ye Yuan, Guoren Wang, Yizhou Yan, Chengliang Chai, Lei Cao. 13252-13272 [doi]
- IUQ: Interrogative Uncertainty Quantification for Long-Form Large Language Model GenerationHaozhi Fan, Jinhao Duan, Kaidi Xu. 13273-13289 [doi]
- CODESTRUCT: Code Agents over Structured Action SpacesMyeongSoo Kim, Chao-Chun Hsu, Dingmin Wang, Shweta Garg 0001, Varun Kumar, Murali Krishna Ramanathan. 13290-13306 [doi]
- Answering the Wrong Question: Reasoning Trace Inversion for Abstention in LLMsAbinitha Gourabathina, Inkit Padhi, Manish Nagireddy, Subhajit Chaudhury, Prasanna Sattigeri. 13307-13324 [doi]
- Beyond Single-shot Writing: Deep Research Agents are Unreliable at Multi-turn Report RevisionBingsen Chen, Boyan Li, Ping Nie, Yuyu Zhang, Xi Ye 0003, Chen Zhao 0013. 13325-13356 [doi]
- FinCall-Surprise: A Large Scale Multi-modal Benchmark for Earning Surprise PredictionDong Shu, Yanguang Liu, Huopu Zhang, Mengnan Du. 13357-13370 [doi]
- ALDEN: Reinforcement Learning for Active Navigation and Evidence Gathering in Long DocumentsTianyu Yang, Terry Ruas, Yijun Tian 0001, Jan Philip Wahle, Daniel Kurzawe, Bela Gipp. 13371-13392 [doi]
- Reinforced Informativeness Optimization for Long-Form Retrieval-Augmented GenerationYuhao Wang 0007, Ruiyang Ren, Yucheng Wang 0006, Xin Zhao 0018, Jing Liu 0022, Hua Wu 0003, Haifeng Wang 0001. 13393-13406 [doi]
- Android Coach: Improve Online Agentic Training Efficiency with Single State Multiple ActionsGuo Gan, Yuxuan Ding, Cong Chen, Yuwei Ren, Yin Huang, Hong Zhou. 13407-13428 [doi]
- Inside Out: Evolving User-Centric Core Memory Trees for Long-Term Personalized Dialogue SystemsJihao Zhao, Ding Chen, Zhaoxin Fan, Kerun Xu, Mengting Hu, Bo Tang, Feiyu Xiong, Zhiyu Li. 13429-13446 [doi]
- FinChart-Bench: Benchmarking Financial Chart Comprehension in Vision-Language ModelsDong Shu, Haoyang Yuan, Yuchen Wang, Yanguang Liu, Huopu Zhang, Mengnan Du. 13447-13466 [doi]
- From Charts to Code: A Hierarchical Benchmark for Multimodal ModelsJiahao Tang, Henry Hengyuan Zhao, Lijian Wu, Zijian Zhang, Yifei Tao, Dongxing Mao, Yang Wan, Jingru Tan, Min Zeng 0004, Min Li 0007, Alex Jinpeng Wang. 13467-13566 [doi]
- Learning While Staying Curious: Entropy-Preserving Supervised Fine-Tuning via Adaptive Self-Distillation for Large Reasoning ModelsHao Wang, Hao Gu, Hongming Piao, Kaixiong Gong, Yuxiao Ye, Xiangyu Yue 0001, Sirui Han, Yike Guo, Dapeng Wu 0001. 13567-13581 [doi]
- Toward Consistent World Models with Multi-Token Prediction and Latent Semantic EnhancementQimin Zhong, Hao Liao, Haiming Qin, Mingyang Zhou 0001, Rui Mao 0001, Wei Chen 0013, Naipeng Chao. 13582-13602 [doi]
- SpiderFlow: Efficient Topology-Aware Scheduling for LLM Training Across Decentralized GPU ClustersZiHan Chang, Shuibing He, Bo Zhou, Sheng Xiao, Siling Yang, Rui Wang 0076, Zhe Pan 0001. 13603-13615 [doi]
- Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided ReasoningJiacheng Hua, Yishu Yin, Yuhang Wu, Tai Wang, Yifei Huang, Miao Liu. 13616-13637 [doi]
- UniCorn: Towards Self-Improving Unified Multimodal Models through Self-Generated SupervisionZhen Fang, Ruiyan Han, Xinyu Sun, Yuchen Ma, Ziheng Wang, Yu Zeng, Zehui Chen, Lin Chen 0026, Wenxuan Huang 0001, Wei-Jie Xu, Yi Cao 0006, Feng Zhao 0004. 13638-13669 [doi]
- Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and BottlenecksYu Wang, Sharon Li 0001. 13670-13685 [doi]
- Current Agents Fail to Leverage World Model as Tool for ForesightCheng Qian 0008, Emre Can Acikgoz, Bingxuan Li, Xiusi Chen, Yuji Zhang 0002, Bingxiang He, Qinyu Luo, Gokhan Tur, Dilek Hakkani-Tür, Yunzhu Li, Heng Ji 0001. 13686-13723 [doi]
- Language Model as Planner and Formalizer under ConstraintsCassie Huang, Stuti Mohan, Ziyi Yang, Stefanie Tellex, Li Zhang. 13724-13756 [doi]
- HeLa-Mem: Hebbian Learning and Associative Memory for LLM AgentsJinchang Zhu, Jindong Li 0002, Cheng Zhang, Jiahong Liu 0001, Menglin Yang 0001. 13757-13769 [doi]
- Locket: Robust Feature-Locking Technique for Language ModelsLipeng He, Vasisht Duddu, N. Asokan. 13770-13784 [doi]
- Can Factual Opinions Be Edited (Manipulated) in Large Language Models?Yuanpu Cao, Ziyi Yin 0003, Fenglong Ma, Jinghui Chen. 13785-13801 [doi]
- Language of Thought Shapes Output Diversity in Large Language ModelsShaoyang Xu, Wenxuan Zhang. 13802-13816 [doi]
- Aligning Backchannel and Dialogue Context Representations via Contrastive LLM Fine-TuningLivia Qian, Gabriel Skantze. 13817-13833 [doi]
- Closing the Spatial Execution Gap in Digital Whiteboards via Verifiable Reinforcement LearningChang Liu, Benjamin Wagley, Zibo Wang, Mehmet E. Belviranli, Bo Wu 0002. 13834-13849 [doi]
- ExecVerify: White-Box RL with Verifiable Stepwise Rewards for Code Execution ReasoningLingxiao Tang, He Ye, Zhaoyang Chu, Muyang Ye, Zhongxin Liu 0002, Xiaoxue Ren, Lingfeng Bao. 13850-13875 [doi]
- Prune as You Generate: Online Rollout Pruning for Faster and Better RLVRHaobo Xu, Sirui Chen, Ruizhong Qiu, Yuchen Yan, Chen Luo 0003, Monica Xiao Cheng, Jingrui He, Hanghang Tong. 13876-13893 [doi]
- Mitigating Legal Hallucinations via Symbolic Constraints and Analogical PrecedentsZixuan Huang, Yanxiang Ma, Luhan Wang, Yunke Wang, Duo Shi, Chang Xu 0002. 13894-13920 [doi]
- How Tokenization Limits Phonological Knowledge Representation in Language Models and How to Improve ThemDisen Liao, Freda Shi. 13921-13938 [doi]
- Illusions of the Gold Standard: A Large-scale Analysis of Human Evaluation Protocols for Long-form Text GenerationKatelyn Xiaoying Mei, Yi-Li Hsu, Minjoon Choi, Zongwan Cao, Chenjun Xu, Bingbing Wen, Su Lin Blodgett, Lucy Lu Wang. 13939-13961 [doi]
- Omni-RewardBench: Toward a Comprehensive Evaluation of Generative Reward Models Across ModalitiesChi-Min Chan, Yujin Zhou, Pengcheng Wen, Boqin Yin, Jiaming Ji, Juntao Dai, Wei Xue 0002, Sirui Han, Yike Guo. 13962-13984 [doi]
- From Answers to Arguments: Toward Trustworthy Clinical Diagnostic Reasoning with Toulmin-Guided Curriculum Goal-Conditioned LearningChen Zhan, Xiaoyu Tan, Gengchen Ma, Yu-Jie Xiong, Xiaoyan Jiang, Xihe Qiu. 13985-14004 [doi]
- Verifiable LLM-Generated Text Detection via Projected Semantic-Structural DistributionsRuochong Xiong, Qien Li, Wangwang Lian, Yulong Wan, Hanlin Xue, Zhouxing Tan, Han Yang, Fengyu Lu, Junfei Liu. 14005-14042 [doi]
- Is Human-Like Text Liked by Humans? Multilingual Human Detection and Preference Against AIYuxia Wang 0003, Rui Xing 0002, Jonibek Mansurov, Giovanni Puccetti 0002, Zhuohan Xie, Minh Ngoc Ta, Jiahui Geng, Jinyan Su, Mervat Abassy, Saadeldine Eletter, Kareem Ashraf Elozeiri, Nurkhan Laiyk, Maiya Goloburda, Tarek Mahmoud, Raj Vardhan Tomar, Alexander Aziz, Ryuto Koike, Masahiro Kaneko, Artem Shelmanov, Ekaterina Artemova, Vladislav Mikhailov, Akim Tsvigun, Alham Fikri Aji, Nizar Habash, Iryna Gurevych, Preslav Nakov. 14043-14076 [doi]
- Powerful Training-Free Membership Inference Against Fine-Tuned Autoregressive Language ModelsDavid Ilic, David Stanojevic, Kostadin Cvejoski. 14077-14093 [doi]
- Communication-Efficient Desire Alignment for Proactive Embodied Human-Agent InteractionYuanfei Wang, Xinju Huang, Fangwei Zhong, Yaodong Yang 0001, Yizhou Wang 0001, Yuanpei Chen, Hao Dong 0003. 14094-14108 [doi]
- When Seeing Overrides Knowing: Disentangling Knowledge Conflicts in Vision-Language ModelsFrancesco Ortu, Zhijing Jin 0001, Diego Doimo, Alberto Cazzaniga. 14109-14130 [doi]
- ICDAGENT: Empowering Agentic Large Language Models for Explainable Medical CodingZiyi Yin 0003, Yuanpu Cao, Ting Wang 0006, Jinghui Chen, Fenglong Ma. 14131-14149 [doi]
- Hyperion: Private Token Sampling with Homomorphic EncryptionLawrence Lim, Jiaming Liu, Vikas Kalagi, Divyakant Agrawal, Amr El Abbadi. 14150-14159 [doi]
- Map of Encoders - Mapping Sentence Encoders using Quantum Relative EntropyGaifan Zhang, Danushka Bollegala. 14160-14208 [doi]
- Mango: Multi-Agent Web Navigation via Global-View OptimizationWeixi Tong, Yifeng Di, Tianyi Zhang. 14209-14223 [doi]
- DPWriter: Reinforcement Learning with Diverse Planning Branching for Creative WritingQian Cao 0001, Yahui Liu, Wei Bi, Yi Zhao, Ruihua Song, Xiting Wang, Ruiming Tang, Guorui Zhou, Han Li 0005. 14224-14250 [doi]
- Iterative Dual-Model Alignment for Story EvaluationBruce Qin, Dan Goldwasser. 14251-14264 [doi]
- Discovery and Reinforcement of Tool-Integrated Reasoning Chains via Rollout TreesKun Li, Zenan Xu, Junan Li, Zengrui Jin, Jinghao Deng, Zexuan Qiu, Bo Zhou. 14265-14283 [doi]
- When Identity Skews Debate: Anonymization for Bias-Reduced Multi-Agent ReasoningHyeong Kyu Choi, Xiaojin (Jerry) Zhu, Sharon Li 0001. 14284-14311 [doi]
- Talking to a Know-It-All GPT or a Second-Guesser Claude? How Repair reveals distinct Multi-Turn Behavior in LLMsClara Lachenmaier, Hannah Bultmann, Sina Zarrieß. 14312-14325 [doi]
- HistLens: Mapping Idea Change across Concepts and CorporaYi Jing, Weiyun Qiu, Yihang Peng, Zhifang Sui. 14326-14351 [doi]
- ReFEree: Reference-Free and Fine-Grained Method for Evaluating Factual Consistency in Real-World Code SummarizationSuyoung Bae, CheolWon Na, Jaehoon Lee, Yumin Lee, Yunseok Choi, Jee-Hyong Lee 0001. 14352-14377 [doi]
- MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean FlowsXiquan Li, Junxi Liu, Yuzhe Liang, Zhikang Niu, Wenxi Chen, Xie Chen 0001. 14378-14393 [doi]
- ModeX: Evaluator-Free Best-of-N Selection for Open-Ended GenerationHyeong Kyu Choi, Sharon Li 0001. 14394-14416 [doi]
- What Makes LLMs Effective Sequential Recommenders? A Study on Preference Intensity and Temporal ContextZhongyu Ouyang, Qianlong Wen, Chunhui Zhang, Yanfang Ye 0001, Soroush Vosoughi. 14417-14434 [doi]
- TeamFusion: Supporting Open-ended Teamwork with Multi-Agent SystemsJiale Liu, Victor S. Bursztyn, Lin Ai, Haoliang Wang, Sunav Choudhary, Saayan Mitra, Qingyun Wu. 14435-14456 [doi]
- FormulaSPIN: Self-Play Fine-Tuning for Natural Language to Spreadsheet Formula GenerationCy Xie. 14457-14471 [doi]
- Stable Signer: Hierarchical Sign Language Generative ModelSen Fang, Yalin Feng, Hongbin Zhong, Yanxin Zhang, Dimitris N. Metaxas. 14472-14483 [doi]
- DisCal: Distribution-Aware Calibration for Mathematical Reasoning Under Character-Level Noisy InputsBo Zhang, Jiawei Zhang, Cong Gao, Bingxu Han, Minghao Hu, Jun Zhang, Yunbo Cao, Zhunchen Luo, Wen Yao, Guotong Geng, Zhong Wang. 14484-14507 [doi]
- SARA: Selective and Adaptive Retrieval-augmented Generation with Context CompressionYiqiao Jin, Kartik Sharma, Vineeth Rakesh, Yingtong Dou, Menghai Pan, Mahashweta Das, Srijan Kumar. 14508-14528 [doi]
- FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial ReasoningZhuohan Xie, Daniil Orel, Rushil Thareja, Dhruv Sahnan, Hachem Madmoun, Fan Zhang, Debopriyo Banerjee, Georgi Nenkov Georgiev, Xueqing Peng, Lingfei Qian, Jimin Huang, Jinyan Su, Aaryamonvikram Singh, Rui Xing 0002, Rania Elbadry, Chen Xu, Haonan Li 0002, Fajri Koto, Ivan Koychev, Tanmoy Chakraborty 0002, Yuxia Wang 0003, Salem Lahlou, Veselin Stoyanov, Sophia Ananiadou, Preslav Nakov. 14529-14553 [doi]
- AI use in American newspapers is widespread, uneven, and rarely disclosedJenna Russell, Marzena Karpinska, Destiny Akinode, James Zhou, Katherine Thai, Bradley Emi, Max Spero, Mohit Iyyer. 14554-14580 [doi]
- For-Value: Efficient Forward-Only Data Valuation for finetuning LLMs and VLMsWenlong Deng, Qi Zeng, Jiaming Zhang, Minghui Chen, Zixin Ding, Christos Thrampoulidis, Boying Gong, Xiaoxiao Li. 14581-14600 [doi]
- The Illusion of Specialization: Unveiling the Domain-Invariant "Standing Committee" in Mixture-of-Experts ModelsYan Wang 0015, Yitao Xu, Nanhan Shen, Jinyan Su, Jimin Huang, Zining Zhu 0005. 14601-14618 [doi]
- Find Your Optimal Teacher: Personalized Data Synthesis via Router-Guided Multi-Teacher DistillationHengyuan Zhang, Shiping Yang, Xiao Liang, Chenming Shang, Yuxuan Jiang, Chaofan Tao, Jing Xiong, Hayden Kwok-Hay So, Ruobing Xie, Angel X. Chang, Ngai Wong 0001. 14619-14637 [doi]
- Single-Pass, Depth-Selective Reading for Multi-Aspect Sentiment AnalysisYan Xia, Zhuangzhuang Pan, Amirrudin Kamsin, Chee Seng Chan. 14638-14656 [doi]
- PARASITE: Conditional System Prompt Poisoning to Hijack LLMsViet Pham, Thai Le. 14657-14676 [doi]
- Generating Literature-Driven Scientific Theories at ScalePeter Jansen 0001, Peter Clark, Doug Downey, Daniel S. Weld. 14677-14698 [doi]
- Controllable Memory Usage: Balancing Anchoring and Innovation in Long-Term Human-Agent InteractionZisu Huang, Muzhao Tian, Xiaohua Wang, Jingwen Xu, Zhengkang Guo, Qi Qian, Kaitao Song, Jiakang Yuan, Changze Lv, Xiaoqing Zheng. 14699-14719 [doi]
- Digitizing Nepal's Written Heritage: A Comprehensive HTR Pipeline for Old Nepali ManuscriptsAnjali Sarawgi, Esteban Garces Arias, Christof Zotter. 14720-14746 [doi]
- XMark: Reliable Multi-Bit Watermarking for LLM-Generated TextsJiahao Xu, Rui Hu 0005, Olivera Kotevska, Zikai Zhang 0003. 14747-14763 [doi]
- Believing without Seeing: Quality Scores for Contextualizing Vision-Language Model ExplanationsKeyu He, Tejas Srinivasan, Brihi Joshi, Xiang Ren 0001, Jesse Thomason, Swabha Swayamdipta. 14764-14789 [doi]
- MONETA: Multimodal Industry Classification through Geographic Information with Multi Agent SystemsArda Yüksel, Gabriel Thiem, Susanne Walter, Patrick Felka, Gabriela Alves Werb, Ivan Habernal. 14790-14814 [doi]
- CASPER in the Machine: Insights into Character Variety in LLM-Generated StoriesAnneliese Brei, Abhisheik Sharma, Nicholas Sanaie, Lu Wang, Snigdha Chaturvedi. 14815-14840 [doi]
- Language Models Struggle to Use Representations Learned In-ContextMichael A. Lepori, Tal Linzen, Ann Yuan, Katja Filippova. 14841-14857 [doi]
- SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document UnderstandingYiqiao Jin, Rachneet Kaur, Zhen Zeng, Sumitra Ganesh, Srijan Kumar. 14858-14881 [doi]
- YIELD: A Large-Scale Dataset and Evaluation Framework for Information Elicitation AgentsVictor de Lima, Grace Hui Yang. 14882-14895 [doi]
- Spatial-Agent: Agentic Geo-spatial Reasoning with Scientific Core ConceptsRiyang Bao, Cheng Yang, Dazhou Yu, Zhexiang Tang, Gengchen Mai, Liang Zhao 0002. 14896-14911 [doi]
- Rethinking Evaluation for LLM Hallucination Detection: A Desiderata, A New RAG-based Benchmark, New InsightsWenbo Chen, Veena Padmanabhan, Tootiya Giyahchi, Elaine Wong, Leman Akoglu. 14912-14931 [doi]
- Min-k Sampling: Decoupling Truncation from Temperature Scaling via Relative Logit DynamicsYuanhao Ding, Meimingwei Li, Esteban Garces Arias, Matthias Aßenmacher, Christian Heumann, Chongsheng Zhang. 14932-14948 [doi]
- Bridging the Memorization-Utilization Gap: Near-Lossless Context Compression via Reinforcement LearningYujan Ting, Xu Tang, Terrence Chen, Weijing Huang. 14949-14972 [doi]
- PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and EngineeringXiangfeng Wang 0005, Hangyu Guo, Yanlin Lai, Mitt Huang, Liang Zhao, Chengyuan Yao, Yinmin Zhang, Qi Han, Xiaoxiao Ren, Chun Yuan 0003, Tong Xu 0001, Zheng Ge, Xiangyu Zhang 0005, Daxin Jiang. 14973-14985 [doi]
- ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM AgentsZechen Li 0006, Baiyu Chen, Hao Xue 0001, Flora D. Salim. 14986-15008 [doi]
- AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMsXuanwen Ding, Chengjun Pan, Zejun Li, Jiwen Zhang, Siyuan Wang, Zhongyu Wei. 15009-15034 [doi]
- Implicit Representations of Grammaticality in Language ModelsYingshan Susan Wang, Linlu Qiu, Zhaofeng Wu, Roger P. Levy, Yoon Kim. 15035-15055 [doi]
- Discovering and Causally Validating Emotion-Sensitive Neurons in Large Audio-Language ModelsXiutian Zhao, Björn W. Schuller, Berrak Sisman. 15056-15071 [doi]
- Uncovering Intervention Opportunities for Suicide Prevention with Language Model AssistantsJaspreet Ranjit, Hyundong Justin Cho, Claire J. Smerdon, Yoonsoo Nam, Myles Phung, Jonathan May, John R. Blosnich, Swabha Swayamdipta. 15072-15092 [doi]
- The Imperfective Paradox in Large Language ModelsBolei Ma, Yusuke Miyao. 15093-15111 [doi]
- MalruleLib: Large-Scale Executable Misconception Reasoning with Step Traces for Modeling Student Thinking in MathematicsXinghe Chen, Naiming Liu, Shashank Sonkar. 15112-15138 [doi]
- How to Improve LLMs' Performance on Specific Languages: A Perspective on LLM-Derived Language SimilarityXinhe Shi, Qingcheng Zeng, Weihao Xuan, Linchao Zhu. 15139-15164 [doi]
- MATCH: Modulating Attention via In-Context Retrieval for Long-Context TransformersLinrui Ma, Chun Hei Lo, Xinyu Wang 0061, Peng Lu 0006, Xihao Yuan, Hanting Chen, Kai Han 0002, Xinghao Chen 0001, Chengjun Zhan, Hanlin Xu, Yichun Yin, Lifeng Shang, Feng Wen, Boxing Chen, Yufei Cui. 15165-15179 [doi]
- Protecting Bystander Privacy via Selective Hearing in Audio LLMsXiao Zhan, Guangzhi Sun, Jose Such, Philip C. Woodland. 15180-15192 [doi]
- LiveCLKTBench: Towards Reliable Evaluation of Cross-Lingual Knowledge Transfer in Multilingual LLMsPei-Fu Guo, Yun-Da Tsai, Chun-Chia Hsu, Kai-Xin Chen, Ya-An Tsai, Kai-Wei Chang 0001, Nanyun Peng 0001, Mi-Yen Yeh, Shou-de Lin. 15193-15208 [doi]
- To Lie or Not to Lie? Investigating The Biased Spread of Global Lies by LLMsZohaib Khan, Mustafa Dogan, Ifeoma Okoh, Pouya Sadeghi, Siddhartha Shrestha, Sergius Justus Chesami Nyah, Mahmoud O. Mokhiamar, Michael J. Ryan, Tarek Naous. 15209-15228 [doi]
- Robertha: Eigenspectrum Regularized Attention for Robust Natural Language UnderstandingAndreia Podasca, Anup Das 0001. 15229-15264 [doi]
- Agentic Rubrics as Contextual Verifiers for SWE AgentsMohit Raghavendra, Anisha Gunjal, Bing Liu, Yunzhong He. 15265-15290 [doi]
- Evaluating the Impact of Verbal Multiword Expressions on Machine TranslationLinfeng Liu, Saptarshi Ghosh, Tianyu Jiang 0001. 15291-15319 [doi]
- MedVerse: Efficient and Reliable Medical Reasoning via DAG-Structured Parallel ExecutionJianwen Chen, Xinyu Yang 0002, Peng Xia 0005, Arian Azarang, Yueh Z. Lee, Gang Li, Hongtu Zhu, Yun Li 0010, Beidi Chen, Huaxiu Yao. 15320-15336 [doi]
- MetFuse: Figurative Fusion between Metonymy and MetaphorSaptarshi Ghosh, Tianyu Jiang 0001. 15337-15350 [doi]
- Adaptive Constraint Propagation: Scaling Structured Inference for Large Language Models via Meta-Reinforcement LearningIbne Farabi Shihab, Sanjeda Akter, Anuj Sharma. 15351-15368 [doi]
- STReasoner: Empowering LLMs for Spatio-Temporal Reasoning in Time Series via Spatial-Aware Reinforcement LearningJuntong Ni, Shiyu Wang 0001, Qi He 0002, Ming Jin 0005, Wei Jin 0009. 15369-15416 [doi]
- When Vision-Language Models Judge Without Seeing: Exposing Informativeness BiasXiaohan Zou, Roshan Sridhar, Mohammadtaher Safarzadeh, Dan Roth 0001. 15417-15448 [doi]
- Hallucination Detection in LLMs with Topological Divergence on Attention GraphsAlexandra Bazarova, Andrei Volodichev, Aleksandr Yugay, Andrey Shulga, Alina Ermilova, Konstantin Polev, Julia Belikova, Rauf Parchiev, Dmitry Simakov, Maxim Savchenko, Andrey V. Savchenko, Serguei Barannikov, Alexey Zaytsev 0002. 15449-15470 [doi]
- Exploring Concreteness Through a Figurative LensSaptarshi Ghosh, Tianyu Jiang 0001. 15471-15490 [doi]
- Mediocrity is the key for LLM as a Judge Anchor SelectionShachar Don-Yehiya, Asaf Yehudai, Leshem Choshen, Omri Abend. 15491-15513 [doi]
- When "Correct" Is Not Safe: Can We Trust Functionally Correct Patches Generated by Code Agents?Yibo Peng, James Song, Lei Li, Xinyu Yang, Mihai Christodorescu, Ravi Mangal, Corina S. Pasareanu, Haizhong Zheng, Beidi Chen. 15514-15546 [doi]
- CoG: Controllable Graph Reasoning via Relational Blueprints and Failure-Aware Refinement over Knowledge GraphsYuanxiang Liu, Songze Li, Xiaoke Guo, Zhaoyan Gong, Qifei Zhang, Huajun Chen, Wen Zhang. 15547-15568 [doi]
- Latent Agents: A Post-Training Procedure for Internalized Multi-Agent DebateJohn Seon Keun Yi, Aaron Mueller, Dokyun Lee. 15569-15602 [doi]
- Act-Adaptive Margin: Dynamically Calibrating Reward Models for Subjective AmbiguityFeiteng Fang, Dingwei Chen, Xiang Huang, Ting-En Lin, Yuchuan Wu, Xiong Liu, Jing Ye, Ziqiang Liu, Haonan Zhang 0003, Liang Zhu, Hamid Alinejad-Rokny, Min Yang 0007, Yongbin Li 0001. 15603-15618 [doi]
- To Think or Not to Think: The Hidden Cost of Meta-Training with Excessive CoT ExamplesVignesh Kothapalli, Ata Fatahi Baarzi, Hamed Firooz, Maziar Sanjabi. 15619-15644 [doi]
- VIGNETTE: Socially Grounded Bias Evaluation for Vision-Language ModelsChahat Raj, Bowen Wei, Aylin Caliskan, Antonios Anastasopoulos, Ziwei Zhu 0001. 15645-15673 [doi]
- BiMind: A Dual-Head Reasoning Model with Attention-Geometry Adapter for Incorrect Information DetectionZhongxing Zhang, Emily K. Vraga, Jisu Huh, Jaideep Srivastava. 15674-15693 [doi]
- Autonomous Knowledge Graph Exploration with Adaptive Breadth-Depth RetrievalJoaquín Polonuer, Lucas Vittor, Iñaki Arango, Ayush Noori, David A. Clifton, Luciano Del Corro, Marinka Zitnik. 15694-15709 [doi]
- Retrieval Heads are DynamicYuping Lin, Zitao Li, Yue Xing 0002, Pengfei He, Yingqian Cui, Yaliang Li, Bolin Ding, Jingren Zhou 0001, Jiliang Tang. 15710-15729 [doi]
- SynthAgent: Adapting Web Agents with Synthetic SupervisionZhaoyang Wang 0004, Yiming Liang, Xuchao Zhang, Qianhui Wu, Siwei Han, Anson Bastos, Rujia Wang, Chetan Bansal, Baolin Peng, Jianfeng Gao 0001, Saravan Rajmohan, Huaxiu Yao. 15730-15752 [doi]
- More Than Meets the Eye: Measuring the Semiotic Gap in Vision-Language Models via Semantic AnchorageWei He. 15753-15767 [doi]
- LLM Agents in Law: Taxonomy, Applications, and ChallengesShuang Liu, Ruijia Zhang, Ruoyun Ma, Yujia Deng, Lanyi Zhu, Jiayu Li, Zelong Li, Zhibin Shen, Mengnan Du. 15768-15792 [doi]
- BenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice BenchmarksNishant Balepur, Bhavya Rajasekaran, Hyunjin Jane Oh, Michael Xie, Atrey Desai, Vipul Gupta, Steven James Moore, Eunsol Choi, Rachel Rudinger, Jordan Lee Boyd-Graber. 15793-15824 [doi]
- Model Internal Sleuthing: Finding Lexical Identity and Inflectional Features in Modern Language ModelsMichael Li, Nishant Subramani. 15825-15864 [doi]
- HAT: Hallucination Annotation for TranslationRajen Chatterjee, Xintong Li, Paisarn Charoenpornsawat, Allen Lee. 15865-15888 [doi]
- DMRetriever: A Family of Models for Improved Text Retrieval in Disaster ManagementKai Yin, Xiangjue Dong, Chengkai Liu, Allen Lin, Lingfeng Shi, Ali Mostafavi, James Caverlee. 15889-15909 [doi]
- Language Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real UsersNishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Eunsol Choi, Jordan Lee Boyd-Graber, Aakanksha Naik. 15910-15944 [doi]
- LAD-RAG: Layout-aware Dynamic RAG for Visually-Rich Document UnderstandingZhivar Sourati, Zheng Wang, Marianne Menglin Liu, Yazhe Hu, Mengqing Guo, Sujeeth Bharadwaj, Kyu J. Han, Tao Sheng, Sujith Ravi, Morteza Dehghani, Dan Roth 0001. 15945-15968 [doi]
- Among Us: Measuring and Mitigating Malicious Contributions in Model Collaboration SystemsZiyuan Yang, Wenxuan Ding 0001, Shangbin Feng, Yulia Tsvetkov. 15969-15988 [doi]
- Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement LearningHanbing Liu, Lang Cao, Yuanyi Ren, Mengyu Zhou, Haoyu Dong 0001, Xiaojun Ma 0001, Shi Han, Dongmei Zhang 0001. 15989-16016 [doi]
- Query-Efficient Agentic Graph Extraction Attacks on GraphRAG SystemsShuhua Yang, Jiahao Zhang, Yilong Wang 0001, Dongwon Lee 0001, Suhang Wang. 16017-16041 [doi]
- Function Words as Statistical Cues for Language LearningXiulin Yang, Heidi R. Getz, Ethan Gotlieb Wilcox. 16042-16058 [doi]
- Evaluating Robustness of Large Language Models Against Multilingual Typographical ErrorsRaoyuan Zhao, Yihong Liu 0001, Lena Altinger, Hinrich Schütze, Michael A. Hedderich. 16059-16078 [doi]
- Listening Like Humans: Semantics-Guided Noise-Robust Multimodal Speech RecognitionYan Fang, Jun Chen 0005, Yian Yao, Shuxin Zhong, Min Sun, Kaishun Wu. 16079-16093 [doi]
- Measuring What Matters!! Assessing Therapeutic Principles in Mental-Health ConversationAbdullah Mazhar, Het Riteshkumar Shah, Aseem Srivastava, Smriti Joshi, Md. Shad Akhtar. 16094-16112 [doi]
- ParaCodex: A Profiling-Guided Autonomous Coding Agent for Reliable Parallel Code Generation and TranslationErel Kaplan, Tomer Bitan, Lian Ghrayeb, Le Chen, Tom Yotam, Niranjan Hasabnis, Gal Oren 0001. 16113-16136 [doi]
- CoLA: A Choice Leakage Attack Framework to Expose Privacy Risks in Subset TrainingQi Li, Cheng-Long Wang 0003, Yinzhi Cao, Di Wang 0015. 16137-16149 [doi]
- MediEval: A Unified Medical Benchmark for Patient-Contextual and Knowledge-Grounded Reasoning in LLMsZhan Qu, Michael Färber 0001. 16150-16164 [doi]
- The Path Not Taken: Duality in Reasoning about Program ExecutionEshgin Hasanov, Md. Mahadi Hassan, Santu Karmaker, Aashish Yadavally. 16165-16180 [doi]
- Accommodation and Epistemic Vigilance: A Pragmatic Account of Why LLMs Fail to Challenge Harmful BeliefsMyra Cheng, Robert D. Hawkins, Dan Jurafsky. 16181-16203 [doi]
- Every Response Counts: Quantifying Uncertainty of LLM-based Multi-Agent Systems through Tensor DecompositionTiejin Chen, Huaiyuan Yao, Jia Chen 0002, Evangelos E. Papalexakis, Hua Wei 0001. 16204-16218 [doi]
- Uncertainty Quantification in LLM Agents: Foundations, Emerging Challenges, and OpportunitiesChangdae Oh, Seongheon Park, To Eun Kim, Jiatong Li, Wendi Li, Samuel Yeh, Sean Du, Hamed Hassani, Paul Bogdan, Dawn Song, Sharon Li 0001. 16219-16250 [doi]
- Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic ConfidenceAmirhosein Ghasemabadi, Keith G. Mills, Baochun Li, Di Niu. 16251-16265 [doi]
- Knowing When Not to Answer: Lightweight KB-Aligned OOD Detection for Safe RAGIlias Triantafyllopoulos, Renyi Qu, Salvatore Giorgi, Brenda Curtis, Lyle H. Ungar, João Sedoc. 16266-16301 [doi]
- Guidelines as Environments: A World Model Approach to Rule FollowingHaiqing Li, Wenliang Zhong, Yinhao Wu, Hehuan Ma, Yuzhi Guo, Thao M. Dang, JunZhou Huang. 16302-16318 [doi]
- Cross-Modal Taxonomic Generalization in (Vision-) Language ModelsTianyang Xu 0002, Marcelo Sandoval-Castañeda, Karen Livescu, Greg Shakhnarovich, Kanishka Misra. 16319-16337 [doi]
- Biomedical Question Answering via Multi-Level Summarization on a Local Knowledge GraphLingxiao Guan, Yuanhao Huang, Jie Liu. 16338-16364 [doi]
- Sigmoid Head for Quality Estimation under Language AmbiguityTu Anh Dinh, Jan Niehues. 16365-16379 [doi]
- RExBench: Can coding agents autonomously implement AI research extensions?Nicholas Edwards, Yukyung Lee, Yujun Audrey Mao, Yulu Qin, Sebastian Schuster 0001, Najoung Kim. 16380-16417 [doi]
- Narrative License and Model Sycophancy in LLM Summaries of Scientific WorkCalvin Isch, Grace Jennings. 16418-16432 [doi]
- AlignUSER: Human-Aligned LLM Agents via World Models for Recommender System EvaluationNicolas Bougie, Gian Maria Marconi, Xiaotong Ye, Narimawa Watanabe. 16433-16451 [doi]
- Domain Generalizable AI Guardrails with Augmented Policy TrainingMinqian Liu, Ioana Baldini, David Rabinowitz, David S. Rosenberg, Sebastian Gehrmann, Mark Dredze. 16452-16469 [doi]
- APEX-MEM: Agentic Semi-Structured Memory with Temporal Reasoning for Long-Term Conversational AIPratyay Banerjee, Masud Moshtaghi, Shivashankar Subramanian, Amita Misra, Ankit Chadha. 16470-16489 [doi]
- emg2speech: synthesizing speech from electromyography using self-supervised speech modelsHarshavardhana T. Gowda, Daniel C. Comstock, Lee M. Miller. 16490-16507 [doi]
- CoAct: Co-Active LLM Preference Learning with Human-AI SynergyRuiyao Xu, Mihir Parmar, Tiankai Yang 0001, Zhengyu Hu, Yue Zhao 0016, Kaize Ding. 16508-16525 [doi]
- Label and Explanation Variation in LLM-Based Annotation: a Case Study in Natural Language InferenceArtur Kulmizev, Erika Lombart, Patrick Watrin, Marie-Catherine de Marneffe. 16526-16543 [doi]
- Text-Attributed Knowledge Graph Enrichment with Large Language Models for Medical Concept RepresentationMohsen Nayebi Kerdabadi, Arya Hadizadeh Moghaddam, Chen Chen, Dongjie Wang, Zijun Yao 0001. 16544-16560 [doi]
- Evolving AgentsLeonardo Ranaldi. 16561-16569 [doi]
- ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World ScenariosAntónio Loison, Quentin Macé, Antoine Edy, Victor Xing, Tom Balough, Gabriel de Souza Pereira Moreira, Bo Liu, Manuel Faysse, Céline Hudelot, Gautier Viaud. 16570-16600 [doi]
- Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning DatasetsLei Hsiung, Tianyu Pang, Yung-Chen Tang, Linyue Song, Tsung-Yi Ho, Pin-Yu Chen, Yaoqing Yang 0002. 16601-16619 [doi]
- TabEmb: Joint Semantic-Structure Embedding for Table AnnotationEhsan Hoseinzade, Ke Wang 0001, Anandharaju Durai Raju. 16620-16631 [doi]
- Text-to-Distribution Prediction with Quantile Tokens and Neighbor ContextYilun Zhu 0003, Yuan Zhuang, Nikhita Vedula, Dushyanta Dhyani, Shaoyuan Xu, Mohsen Bayati, Bryan Wang, Shervin Malmasi. 16632-16648 [doi]
- Check Your Work: Structured Checklist Feedback for Improving Large Language ModelsJonathan Cook 0004, Tim Rocktäschel, Jakob Nicolaus Foerster, Dennis Aumiller, Alex Wang. 16649-16688 [doi]
- LOKA: Conflict-Aware LLM Knowledge Update with Adaptive Knowledge MemoryBinchi Zhang, Zhengzhang Chen, Zaiyi Zheng, Jundong Li, Haifeng Chen. 16689-16715 [doi]
- Student Guides Teacher: Weak-to-Strong Inference via Spectral Orthogonal ExplorationDayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Yang Li, Deguo Xia, Jizhou Huang. 16716-16733 [doi]
- When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing ErrorsYuQing Yang, Qi Zhu 0008, Zhen Han, Boran Han, Zhengyuan Shen, Shuai Wang, Vassilis N. Ioannidis, Huzefa Rangwala. 16734-16752 [doi]
- PubMed Reasoner: Dynamic Reasoning-based Retrieval for Evidence-Grounded Biomedical Question AnsweringYiqing Zhang, Xiaozhong Liu 0001, Fabricio Murai. 16753-16763 [doi]
- Decoupling Task-Solving and Output Formatting in LLM GenerationHaikang Deng, Po-Nien Kung, Nanyun Peng 0001. 16764-16781 [doi]
- GS-Quant: Granular Semantic and Generative Structural Quantization for Knowledge Graph CompletionQizhuo Xie, Yunhui Liu 0002, Yu Xing, Qianzi Hou, Xudong Jin, Tao Zheng 0005, Tieke He. 16782-16797 [doi]
- Mind the Gap in Cultural Alignment: Task-Aware Culture Management for Large Language ModelsBinchi Zhang, Xujiang Zhao, Jundong Li, Haifeng Chen, Zhengzhang Chen. 16798-16813 [doi]
- Analyzing and Internalizing Complex Policy Documents for LLM AgentsJiateng Liu, Zhenhailong Wang, Xiaojiang Huang, Yingjie Li, Xiang Li, Chenlei Guo, Xing Fan, Ruhi Sarikaya, Heng Ji. 16814-16851 [doi]
- In-Context Representation HijackingItay Yona, Amir Sarid, Michael Karasik, Yossi Gandelsman. 16852-16867 [doi]
- Quantifying Metric and Model Agreement in Bias Evaluation of Large Language ModelsArash Asgari, Huan Wu, Amirreza Naziri, Mojtaba Kolahdouzi, Laleh Seyyed-Kalantari. 16868-16933 [doi]
- MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial ApplicationXueqing Peng, Lingfei Qian, Yan Wang 0015, Ruoyu Xiang, Yueru He, Yang Ren, Mingyang Jiang, Vincent Jim Zhang, Yuqing Guo, Jeff Zhao, Huan He, Yi Han, Yun-feng, Yuechen Jiang, Yupeng Cao, Haohang Li, Yangyang Yu, Xiaoyu Wang, Penglei Gao, Shengyuan Lin, Keyi Wang, Shanshan Yang, Yilun Zhao 0001, Zhiwei Liu 0003, Peng Lu 0006, Jerry Huang, Suyuchen Wang, Triantafillos Papadopoulos, Polydoros Giannouris, Efstathia Soufleri, Nuo Chen 0002, Zhiyang Deng, Heming Fu, Yijia Zhao, Mingquan Lin, Meikang Qiu, Kaleb E. Smith, Arman Cohan, Xiao-Yang Liu, Jimin Huang, Guojun Xiong, Alejandro Lopez-Lira, Xi Chen 0003, Junichi Tsujii, Jian-Yun Nie, Sophia Ananiadou, Qianqian Xie. 16934-16963 [doi]
- Bidirectional LMs are Better Knowledge Memorizers? A Benchmark for Real-world Knowledge InjectionYuwei Zhang 0001, Wenhao Yu 0002, Shangbin Feng, Yifan Zhu, Letian Peng, Jayanth Srinivasa, Gaowen Liu, Jingbo Shang. 16964-16980 [doi]
- Mapping the Circumplex of Affect: Geometric Analysis of Emotion Representations via Hyperspherical Contrastive LearningYusuke Yamauchi, Akiko Aizawa. 16981-17004 [doi]
- Do LLMs Really Need 10+ Thoughts for "Find the Time 1000 Days Later"? Towards Structural Understanding of LLM OverthinkingXinliang Frederick Zhang, Anhad Mohananey, Alexandra Chronopoulou, Pinelopi Papalampidi, Somit Gupta, Tsendsuren Munkhdalai, Lu Wang 0008, Shyam Upadhyay. 17005-17030 [doi]
- Anchor: Branch-Point Data Generation for GUI AgentsJinbiao Wei, Yilun Zhao 0001, Kangqi Ni, Arman Cohan. 17031-17047 [doi]
- When One LLM Drools, Multi-LLM Collaboration RulesShangbin Feng, Wenxuan Ding 0001, Alisa Liu, Zifeng Wang 0002, Weijia Shi, Yike Wang 0002, Shannon Zejiang Shen, Xiaochuang Han, Hunter Lang, Chen-Yu Lee, Tomas Pfister, Yejin Choi 0001, Yulia Tsvetkov. 17048-17063 [doi]
- From Query to Counsel: Structured Reasoning with a Multi-Agent Framework and Dataset for Legal ConsultationMingfei Lu, Yi Zhang 0095, Mengjia Wu, Yue Feng. 17064-17078 [doi]
- Putting Captions to the Test: Evaluating Video Caption Quality through Multiple-Choice Question AnsweringZizhen Wang 0001, Bo Feng, Zhengfeng Lai, Shiyu Li, Yang Lu, Meng Cao, Ping Huang, Xiaoming Simon Wang. 17079-17099 [doi]
- Subject-level Inference for Realistic Text Anonymization EvaluationMyeong-Seok Oh, Dong-Yun Kim, Hanseok Oh, Chaean Kang, Joeun Kang, Xiaonan Wang, Hyunjung Park, Young Cheol Jung, Hansaem Kim. 17100-17135 [doi]
- SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual ScenesChuhan Wang, Xintong Li 0001, Jennifer Yuntong Zhang, Junda Wu, Chengkai Huang, Lina Yao 0001, Julian J. McAuley, Jingbo Shang. 17136-17150 [doi]
- Select Before Use: On the Importance of Reference Model Selection in Preference AlignmentMuyang Li, Runze Wu 0001, Xiangyu Zhao 0001, Bo Han 0003, Daoyi Dong, Tongliang Liu. 17151-17171 [doi]
- Lost in Translation, and Found: Detecting and Interpreting Translation EffectsShira Wein, Anna Serbina, Jiyuan Ji, Nathan Wolf, Jason DeGraaff, Prajakta Kini, Maria Leonor Pacheco. 17172-17187 [doi]
- From Isolation to Entanglement: When Do Interpretability Methods Identify and Disentangle Known Concepts?Aaron Mueller, Andrew Lee 0001, Shruti Joshi, Ekdeep Singh Lubana, Dhanya Sridhar, Patrik Reizinger. 17188-17210 [doi]
- Paraphrasing as Zero-shot Translation with Feature-guided Diversity EnhancementZiyue Yan, Hongying Zan, Xinglin Lyu, Hongfei Xu. 17211-17223 [doi]
- VOYAGER: A Training Free Approach for Generating Diverse Datasets using LLMsAvinash Amballa, Yashas Malur Saidutta, Chi-Heng Lin, Vivek Kulkarni, Srinivas Chappidi. 17224-17245 [doi]
- CaseFacts: A Benchmark for Legal Fact-Checking and Precedent RetrievalAkshith Reddy Putta, Jacob Daniel Devasier, Chengkai Li 0001. 17246-17265 [doi]
- SpecAgent: A Speculative Retrieval and Forecasting Agent for Code CompletionGeorge Ma, Anurag Koul, Qi Chen, Yawen Wu, Sachit Kuhar, Yu Yu, Aritra Sengupta, Varun Kumar, Murali Krishna Ramanathan. 17266-17327 [doi]
- From Inheritance to Saturation: Disentangling the Evolution of Visual Redundancy for Architecture-Aware MLLM Inference AccelerationJiaqi Shi, Xulong Zhang 0001, Yuechan Li, Xiaoyang Qu, Jianzong Wang. 17328-17357 [doi]
- Your Reasoning Model is Secretly a Reward Model - Optimization-Free Verification from ExperienceZhenwen Liang, Ruosen Li, Yujun Zhou 0002, Linfeng Song, Dian Yu 0001, Xinya Du, Haitao Mi, Dong Yu 0001. 17358-17372 [doi]
- What Do LLMs Learn First? Asymmetric Learning Dynamics of Input Complexity and Output Ambiguity in Preference AlignmentMengyang Li 0001, Jingwen Wang, Pinlong Zhao. 17373-17388 [doi]
- Multi-Agent-as-Judge: Aligning LLM-Agent-Based Automated Evaluation with Multi-Dimensional Human EvaluationJiaju Chen, Yuxuan Lu 0003, Xiaojie Wang, Huimin Zeng, Jing Huang, Jiri Gesi, Ying Xu, Bingsheng Yao, Dakuo Wang. 17389-17416 [doi]
- OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM AlignmentTianci Liu 0003, Ran Xu 0002, Tony Yu, Ilgee Hong, Carl Yang 0001, Tuo Zhao, Haoyu Wang 0004. 17417-17437 [doi]
- Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language ModelsHaoxiang Sun, Yingqian Min, Zhipeng Chen 0001, Xin Zhao 0018, Ji-Rong Wen. 17438-17457 [doi]
- LENS: LLM-Enabled Narrative Synthesis for Mental Health by Aligning Multimodal Sensing with Language ModelsWenxuan Xu 0001, Arvind Pillai, Subigya Nepal, Amanda C. Collins, Daniel M. Mackin, Michael V. Heinz, Tess Z. Griffin, Nicholas C. Jacobson, Andrew T. Campbell. 17458-17481 [doi]
- FedProxy: Federated Fine-Tuning of LLMs via Proxy SLMs and Heterogeneity-Aware FusionTao Fan 0002, Guoqiang Ma, Yuanfeng Song, Lixin Fan, Kai Chen 0005, Qiang Yang 0001. 17482-17497 [doi]
- DiZiNER: Disagreement-guided Instruction Refinement via Simulating Pilot Annotation for Zero-shot Named Entity RecognitionSiun Kim, Hyung-Jin Yoon. 17498-17519 [doi]
- A Data-Centric Approach to Generalizable Speech Deepfake DetectionWen Huang 0004, Yuchen Mao, Yanmin Qian. 17520-17539 [doi]
- Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMsYiming Huang 0001, Zhenbo Shi, Xin-Cheng Wen, Jichuan Zeng, Cuiyun Gao 0001, Peiyi Han, Chuanyi Liu. 17540-17560 [doi]
- PaperRegister: Boosting Flexible-grained Paper Search via Hierarchical Register IndexingZhuoqun Li, Xuanang Chen, Hongyu Lin, Yaojie Lu 0001, Xianpei Han, Shanshan Jiang 0001, Bin Dong 0003, Le Sun 0001. 17561-17575 [doi]
- ETR: Entropy Trend Reward for Efficient Chain-of-Thought ReasoningXuan Xiong, Huan Liu 0014, Li Gu, Zhixiang Chi, Yue Qiu, Yuanhao Yu, Yang Wang 0003. 17576-17594 [doi]
- All Changes May Have Invariant Principles: Improving Ever-Shifting Harmful Meme Detection via Design Concept ReproductionZiyou Jiang, Mingyang Li 0005, Junjie Wang 0001, Yuekai Huang, Jie Huang, Zhiyuan Chang, Zhaoyang Li, Qing Wang 0001. 17595-17613 [doi]
- Activation-Guided Local Editing for Jailbreaking AttacksJiecong Wang, Haoran Li 0003, Hao Peng 0001, Ziqian Zeng, Zihao Wang 0001, Haohua Du, Zhengtao Yu 0001. 17614-17633 [doi]
- Controlling Distributional Bias in Multi-Round LLM Generation via KL-Optimized Fine-TuningYanbei Jiang, Amr Keleg, Ryandito Diandaru, Jey Han Lau, Lea Frermann, Biaoyan Fang, Fajri Koto. 17634-17649 [doi]
- On the Continued Value of Universal Dependencies in the Era of Large Language ModelsWenxi Li, Jingyu Peng. 17650-17662 [doi]
- Adaptive Text2GQL: Integrating Structural Twig Linking and Evolutionary In-Context LearningFang Niu, Chaokun Wang, Hang Zhang 0032, Songyao Wang. 17663-17680 [doi]
- XToM: Exploring the Multilingual Theory of Mind for Large Language ModelsChunkit Chan, Yauwai Yim, Hongchuan Zeng, Zhiying Zou, Xinyuan Cheng, Zhifan Sun, Zheye Deng, Kawai Chung, Yuzhuo Ao, Yixiang Fan, Cheng Jiayang, Ercong Nie, Ginny Y. Wong, Helmut Schmid, Hinrich Schütze, Simon See, Yangqiu Song. 17681-17716 [doi]
- Cognitive Policy-Driven LLM for Diagnosis and Intervention of Cognitive Distortions in Emotional Support ConversationLin Zhong, Renjin Zhu, Shujuan Ma, Jinhao Cui, Lingzhi Wang 0001, Hao Chen 0002, Qing Liao 0001. 17717-17746 [doi]
- SciFlow-Bench: Evaluating Structure-Aware Scientific Diagram Generation via Inverse ParsingTong Zhang, Honglin Lin, Zhou Liu, Chong Chen 0001, Wentao Zhang 0001. 17747-17765 [doi]
- Immediate Inference: The Missing Foundation in Large Language Model Logical ReasoningSihang Jiang, Zhiyu Lu, Keyi Wang, Jiaqing Liang, Yanghua Xiao, Xiaojun Meng, Jiansheng Wei. 17766-17799 [doi]
- Tracing Logit Trajectories Across Layer Depth: Dataset-Level Explainability for Language ModelsJeesu Jung, Sangkeun Jung. 17800-17823 [doi]
- REZE: Representation Regularization for Domain-adaptive Text Embedding Pre-finetuningSeungmin Lee, Jeonghwan Lee, Hyunkuk Lim, Sejoon Kim, Mingi Sung. 17824-17841 [doi]
- TAMA: Target-Aware Multilingual Abuse Detection by Cascaded Conditional Multi-Task LearningJiyan Liu, Youzheng Liu, Taihang Wang, Yimin Wang 0002, Ye Jiang 0001, Diana Maynard. 17842-17859 [doi]
- Reference Attack: A New Cross-Modal Jailbreaking Attack against Multimodal Large Language ModelsYulong Wang 0001, Yifei Fu, Jiayi Gao. 17860-17881 [doi]
- POWSM: A Phonetic Open Whisper-Style Speech Foundation ModelChin-Jou Li, Kalvin Chang, Shikhar Bharadwaj, Eunjung Yeo, KwangHee Choi, Jian Zhu, David R. Mortensen, Shinji Watanabe 0001. 17882-17899 [doi]
- LCR-RAG: Enhancing Logical Consistency in Retrieval-Augmented Generation via Neuro-symbolic Reinforcement LearningWenxiang Zheng, Guo Tang, Shixin Jiang, Liangyu Huo, Xiyuan Zhang, Jian Xie, Ming Liu 0004. 17900-17916 [doi]
- CIA: Inferring the Communication Topology from LLM-based Multi-Agent SystemsYongxuan Wu, Xixun Lin, He Zhang 0012, Nan Sun, Kun Wang 0056, Chuan Zhou 0001, Shirui Pan, Yanan Cao 0001. 17917-17933 [doi]
- Efficiently Learning To Reason or Not to Reason: Root-token Policy Optimization for Adaptive ThinkingTaehyeon Kim, Hyunsoo Lee, Youngsoo Jang, Moontae Lee. 17934-17949 [doi]
- SAGE: Synergistic Adaptive Gating of Experts for Hateful Video DetectionJie Huang, Xin Liao, Junjie Wang, Mingyang Li, Wenshuo Wang, Ziyou Jiang, Shoubin Li, Qing Wang. 17950-17966 [doi]
- HiKEY: Hierarchical Multimodal Retrieval for Open-Domain Document Question AnsweringJoongmin Shin, Gyuho Shim, Jeongbae Park, Jaehyung Seo, HeuiSeok Lim. 17967-17987 [doi]
- Towards Efficient and Effective Diffusion Language Model Inference via Semantic-Aware Adaptive DenoisingFan Li, Yu Gu 0002, Zhigang Wang 0001, Fangling Leng, Zhenghao Liu 0001, Ge Yu 0001. 17988-18002 [doi]
- AdvancedIF: Rubric-Based Benchmarking and Reinforcement Learning for Advancing LLM Instruction FollowingYun He, Wenzhe Li, Hejia Zhang, Songlin Li, Karishma Mandyam, Sopan Khosla, Yuanhao Xiong, Nanshu Wang, Xiaoliang Peng, Beibin Li, Shengjie Bi, Shishir G. Patil, Qi Qi, Shengyu Feng, Julian Katz-Samuels, Richard Yuanzhe Pang, Sujan Kumar Gonugondla, Hunter Lang, Yue Yu 0009, Yundi Qian, Maryam Fazel-Zarandi, Licheng Yu, Amine Benhalloum, Hany Hassan Awadalla, Manaal Faruqui. 18003-18022 [doi]
- Improving Autoformalization Using Direct Dependency RetrievalShaoqi Wang, Lu Yu, Siwei Lou, Feng Yan, Chunjie Yang 0001, Qing Cui, Jun Zhou. 18023-18040 [doi]
- Long-Chain Reasoning Distillation via Adaptive Prefix AlignmentZhenghao Liu 0001, Zhuoyang Wu, Xinze Li, Yukun Yan, Shuo Wang 0013, Zulong Chen, Yu Gu 0002, Ge Yu 0001, Maosong Sun 0001. 18041-18059 [doi]
- TRN-R1-Zero: Text-rich Network Reasoning via LLMs with Reinforcement Learning OnlyYilun Liu 0005, Ruihong Qiu, Zi Huang. 18060-18072 [doi]
- Threshold Differential Attention for Sink-Free, Ultra-Sparse, and Non-Dispersive Language ModelingXingyue Huang, Xueying Ding, Mingxuan Ju, Yozen Liu, Neil Shah, Tong Zhao 0003. 18073-18092 [doi]
- PRiSM: Benchmarking Phone Realization in Speech ModelsShikhar Bharadwaj, Chin-Jou Li, Yoonjae Kim, KwangHee Choi, Eunjung Yeo, Ryan Soh-Eun Shim, Hanyu Zhou, Brendon Boldt, Karen Rosero, Kalvin Chang, Darsh Agrawal, Keer Xu, Chao-Han Huck Yang, Jian Zhu, Shinji Watanabe 0001, David R. Mortensen. 18093-18112 [doi]
- Your Reasoning Benchmark May Not Test Reasoning: Revealing Perception Bottleneck in Abstract Reasoning BenchmarksXinhe Wang 0001, Jin Huang, Xingjian Zhang 0002, Tianhao Wang, Jiaqi W. Ma. 18113-18124 [doi]
- Model-Based Imaginative Planning for Embodied AgentsJunru Song, Hengzhe Jin, Yucong Huang, Tingsong Jiang, Weien Zhou, Feifei Wang, Yang Yang, Ying Wen, Wen Yao. 18125-18147 [doi]
- Persona-Grounded Safety Evaluation of AI Companions in Multi-Turn ConversationsPrerna Juneja, Lika Lomidze. 18148-18175 [doi]
- Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question AnsweringHuiyao Chen, Yi Yang, Yinghui Li, Meishan Zhang, Baotian Hu, Min Zhang 0005. 18176-18198 [doi]
- Beyond Value Benchmarks: Measuring Value-Structure Alignment in Large Language Models via Symmetric Q-SortsJingting Zheng, Yuqi Ren, Linhao Yu, Yongqi Leng, Deyi Xiong. 18199-18230 [doi]
- Would LLMs be Good Historical Linguists and Chinese Dialect Learners?Yicheng Liu, ShuMin Shi, Youchao Zhou, Xingchen Zhang. 18231-18256 [doi]
- ProActor: Timing-Aware Reinforcement Learning for Proactive Task Scheduling AgentsLei Ding, Bin He, Chenguang Wang, Yang Liu. 18257-18303 [doi]
- Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention HijackingJingru Li, Wei Ren 0002, Tianqing Zhu. 18304-18323 [doi]
- CADMate: Generating CAD Assembly Plan with Geometric Chain-of-Thought and Spatial Physical RewardsJiali Chen, DingBa Fu, Xusen Hei, Yuhang Liu, Yiyang Chen, Jiayuan Xie, Wenqi Fan, Yi Cai 0001. 18324-18348 [doi]
- Semantic-Aware Logical Reasoning via a Semiotic FrameworkYunyao Zhang, Xinglang Zhang, Junxi Sheng, Wenbing Li, Junqing Yu, Yi-Ping Phoebe Chen, Wei Yang 0034, Zikai Song. 18349-18374 [doi]
- Calibration-Aware Policy Optimization for Reasoning LLMsZiqi Wang, Xingzhou Lou, Meiqi Wu, Zhengqi Wen, Junge Zhang. 18375-18390 [doi]
- GBV-SQL: Guided Generation and SQL2Text Back-Translation Validation for Multi-Agent Text2SQLDaojun Chen, Xi Wang, Shenyuan Ren, Qingzhi Ma, Pengpeng Zhao 0001, An Liu 0002. 18391-18406 [doi]
- Branch-and-Browse: Efficient and Controllable Web Exploration with Tree-Structured Reasoning and Action MemoryShiqi He, Yue Cui 0001, Xinyu Ma, Yaliang Li, Bolin Ding, Mosharaf Chowdhury. 18407-18418 [doi]
- Beyond End-to-End: Dynamic Chain Optimization for Private LLM Adaptation on the EdgeYebo Wu, Jingguang Li, Chunlin Tian, Kahou Tam, Zhijiang Guo, Li Li 0064. 18419-18435 [doi]
- TalkLoRA: Communication-Aware Mixture of Low-Rank Adaptation for Large Language ModelsLin Mu 0001, Haiyang Wang, Li Ni 0001, Lei Sang 0001, Zhize Wu, Peiquan Jin, Yiwen Zhang 0001. 18436-18451 [doi]
- TARE: Lightweight Token-Aware Representation Editing for Fine-tuning Transformer-like ModelsYulong Wang, Siyu Zhao. 18452-18471 [doi]
- Soft Orthogonal Low-Rank Adaptation for Knowledge Sharing in Large Language Model Continual LearningYitong Wang, Xue Han 0018, Wenchun Gao, Qian Hu, Jiahui Wang, Ziqing Wang, Lijun Mei, Junlan Feng. 18472-18487 [doi]
- ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question AnsweringRachneet Kaur, Nishan Srishankar, Zhen Zeng, Sumitra Ganesh. 18488-18555 [doi]
- Curing Miracle Steps in LLM Mathematical Reasoning with Rubric RewardsYouliang Yuan, Qiuyang Mang, Jingbang Chen, Hong Wan, Xiaoyuan Liu, Junjielong Xu, Jen-tse Huang 0001, Wenxuan Wang 0001, Wenxiang Jiao, Pinjia He. 18556-18577 [doi]
- Adaptive Planning for Multi-Attribute Controllable Summarization with Monte Carlo Tree SearchSangwon Ryu, Heejin Do, Yunsu Kim 0001, Gary Geunbae Lee, Jungseul Ok. 18578-18595 [doi]
- CPT-Agent: A Cognitive Process Theory-driven Framework for Student Simulation in Writing DevelopmentYuhan Chen, Zizhuo Shen, MiaoMiao Cheng, Xu Han 0007, Jiefu Gong, Shijin Wang 0001, Wei Song 0010. 18596-18616 [doi]
- Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMsWu Li, Yigeng Zhou, Zesheng Shi, Yequan Wang, Min Zhang, Jing Li. 18617-18632 [doi]
- SearchGym: Bootstrapping Real-World Search Agents via Cost-Effective and High-Fidelity Environment SimulationXichen Zhang, Ziyi He, Yinghao Zhu, Sitong Wu, Shaozuo Yu, Meng Chu, Wenhu Zhang, Haoru Tan, Jiaya Jia. 18633-18665 [doi]
- Learning to Select: Query-Aware Adaptive Dimension Selection for Dense RetrievalZhanyu Wu, Richong Zhang, Zhijie Nie. 18666-18677 [doi]
- MeepleLM: A Virtual Playtester Simulating Diverse Subjective ExperiencesZizhen Li, Chuanhao Li 0001, Yibin Wang, Jianwen Sun, Yukang Feng, Jiaxin Ai, Fanrui Zhang, Mingzhu Sun, Yifei Huang, Kaipeng Zhang. 18678-18722 [doi]
- MSMO-ABSA: Multi-Scale and Multi-Objective Optimization for Cross-Lingual Aspect-Based Sentiment AnalysisChengyan Wu, Bolei Ma, Ningyuan Deng, Yanqing He, Yun Xue, Xiaoyong Liu. 18723-18735 [doi]
- FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language ModelsZixuan Weng, Jinghuai Zhang, Kunlin Cai, Ying Li 0095, Peiran Wang, Yuan Tian 0001. 18736-18756 [doi]
- Is the Attention Matrix Really the Key to Self-Attention in Multivariate Long-Term Time Series Forecasting?Xinyu Li, Kexi Chen, Jiajie Shen, Ying Zheng 0004, Hong Lu 0001, Jin Zhao 0001, Xin Wang 0002. 18757-18773 [doi]
- Difficulty-Controllable Cloze Question Distractor GenerationSeokhoon Kang, Yejin Jeon, Seonjeong Hwang, Gary Lee. 18774-18791 [doi]
- ToolPRM: Fine-Grained Inference Scaling of Structured Outputs for Function CallingJianghao Lin, Yuanyuan Shi, Xin Peng, Renjie Ding, Hairui Wang, Yuxuan Peng, Bizhe Bai, Weixi Song, Fengshuo Bai, Huacan Chai, Weinan Zhang 0001, Fei Huang, Ying Wen 0001. 18792-18804 [doi]
- GTA: Generating Long-horizon Tasks for Web Agents at ScaleTenghao Huang, Kung-Hsiang Huang, Prafulla Kumar Choubey, Yilun Zhou, Muhao Chen 0001, Jonathan May, Chien-Sheng Wu. 18805-18820 [doi]
- Closing the Modality Reasoning Gap for Speech Large Language ModelsChaoren Wang, Heng Lu, Xueyao Zhang, Shujie Liu 0001, Yan Lu 0001, Jinyu Li 0001, Zhizheng Wu 0001. 18821-18835 [doi]
- Logical Phase Transitions: Understanding Collapse in LLM Logical ReasoningXinglang Zhang, Yunyao Zhang, Zeliang Chen, Junqing Yu, Wei Yang, Zikai Song. 18836-18860 [doi]
- SpecCache: Speculative KV Cache Reuse for Efficient RAG ServingZijian Wen, Tao Zhang 0170, Shuangwu Chen, Shenghao Ye, Yu Guo, Qirui Chen, Jingxian Shuai, Yunpeng Hou, Huasen He, Jian Yang 0014. 18861-18871 [doi]
- REG: Retrieval via Emotion Similarity for Guiding Empathetic Dialogue GenerationXu Wang, Bo Wang, Yang Xiang, Yihong Tang, Dongming Zhao, Zifei Yu, Yuexian Hou. 18872-18883 [doi]
- TellWhisper: Tell Whisper Who Speaks WhenYifan Hu, Peiji Yang, Zhisheng Wang, Yicheng Zhong, Rui Liu. 18884-18898 [doi]
- Taming System Complexity: Demystifying Software Engineering Agents in Diagnosing Linux Kernel FaultsZhenhao Zhou, Zhuochen Huang, Yike He, Chong Wang 0013, Jiajun Wang, Yijian Wu, Xin Peng 0001, Yiling Lou. 18899-18916 [doi]
- DisCo_Speech: Controllable Zero-Shot Speech Generation with A Disentangled Speech CodecTao Li, Wenshuo Ge, Zhichao Wang, Zihao Cui, Yong Ma, Yingying Gao, Chao Deng 0002, Shilei Zhang, Junlan Feng. 18917-18931 [doi]
- WildReward: Learning Reward Models from In-the-Wild Human InteractionsHao Peng 0015, Yunjia Qi, Xiaozhi Wang, Zijun Yao 0002, Lei Hou 0001, Juanzi Li. 18932-18948 [doi]
- Mitigating Catastrophic Forgetting in Target Language Adaptation of LLMs via Source-Shielded UpdatesAtsuki Yamaguchi, Terufumi Morishita, Aline Villavicencio, Nikolaos Aletras. 18949-18975 [doi]
- SEE: Signal Embedding Energy for Quantifying Noise Interference in Large Audio Language ModelsYuanhe Zhang, Jiayu Tian, Yibo Zhang, Shilinlu Yan, Liang Lin 0004, Zhenhong Zhou, Li Sun 0008, Sen Su. 18976-18995 [doi]
- Know the Known and the Unknown: Reasonable Answer Generation with Knowledge-Informed CitationsYichi Zhang, Zhuo Chen, Lingbing Guo, Jun Xu, Mengshu Sun, Zhizhen Liu, Lei Liang, Wen Zhang, Huajun Chen. 18996-19011 [doi]
- FocalOrder: Focal Preference Optimization for Reading Order DetectionFuyuan Liu, Dianyu Yu, He Ren, Nayu Liu, Xiaomian Kang, Delai Qiu, Fa Zhang, Genpeng Zhen, Shengping Liu, Jiaen Liang, Wei Huang, Yining Wang, Junnan Zhu. 19012-19029 [doi]
- TLSA: LLM-Guided Text-Label Space Alignment with Contrastive Learning for Generalized Category DiscoveryWenxi Xu, Chuan Qin 0002, Xi Chen 0073, Chuyu Fang, Yuanchun Zhou, Hengshu Zhu. 19030-19046 [doi]
- Hierarchical Token Prepending: Enhancing Information Flow in Decoder-based LLM EmbeddingsXueying Ding, Xingyue Huang, Mingxuan Ju, Liam Collins, Yozen Liu, Leman Akoglu, Neil Shah, Tong Zhao. 19047-19066 [doi]
- Suggest-Verify-Revise: A Three-Stage Document-Level Event Causality Identification with Narrative ConsistencyYa Su, Hu Zhang 0003, Dan Qiao, Yujie Wang 0003, Yunxiao Zhao, Yue Fan, Shike Li, Ru Li 0001, Hongye Tan. 19067-19091 [doi]
- StoryCoder: Narrative Reformulation for Structured Reasoning in LLM Code GenerationGeonhui Jang, Dongyoon Han, Youngjoon Yoo. 19092-19112 [doi]
- ODL-TempLLM: Ontology-Guided and Description Logic-Reasoned Temporal Reasoning with LLMsJinshuo Liu, Cheng Bi, Meng Wang 0050, Juan Deng, Donghong Ji, Jeff Z. Pan. 19113-19126 [doi]
- FACTrial: Factorized Clinical Contrastive Training for Scalable Patient-Trial RetrievalXuanren Chen, Chongyang Tao, Tao Shen 0001, Shuai Ma 0001. 19127-19145 [doi]
- Your Students Don't Use LLMs Like You Wish They DidSebastian Kobler, Matthew Clemson, Angela Sun, Jonathan K. Kummerfeld. 19146-19170 [doi]
- Cut Your Losses! Learning to Prune Paths Early for Efficient Parallel ReasoningJiaxi Bi, Tongxu Luo, Wenyu Du, Zhengyang Tang, Benyou Wang. 19171-19189 [doi]
- Discourse Coherence and Response-Guided Context Rewriting for Multi-Party Dialogue GenerationZhiyu Cao, Peifeng Li 0001, Qiaoming Zhu. 19190-19207 [doi]
- EvolvR: Self-Evolving Pairwise Reasoning for Story Evaluation to Enhance GenerationXinda Wang 0006, Zhengxu Hou, Yangshijie Zhang, Bingren Yan, Jialin Liu, Chenzhuo Zhao, Zhibo Yang, Bin-Bin Yang, Feng Xiao. 19208-19241 [doi]
- Double: Breaking the Acceleration Limit via Double Retrieval Speculative ParallelismYuhao Shen, Tianyu Liu, Junyi Shen, Jinyang Wu, Quan Kong, Huan Li, Cong Wang. 19242-19263 [doi]
- BWLA: Breaking the Barrier of W1AX Post-Training Quantization for LLMsZhixiong Zhao, Zukang Xu, Dawei Yang. 19264-19290 [doi]
- Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question AnsweringChangin Choi, Wonseok Lee 0002, Jungmin Ko, Wonjong Rhee. 19291-19315 [doi]
- Dynamics of Cognitive Heterogeneity: Investigating Behavioral Biases in Multi-Stage Supply Chains with LLM-Based SimulationJiuyun Jiang, Yuecheng Hong, Bo Yang, Jin Yang, Guangxin Jiang, Xiaomeng Guo, Guang Xiao. 19316-19333 [doi]
- Triviality Corrected Endogenous RewardXinda Wang 0006, Zhengxu Hou, Yangshijie Zhang, Bingren Yan, Jialin Liu, Chenzhuo Zhao, Zhibo Yang, Bin-Bin Yang, Feng Xiao. 19334-19355 [doi]
- Identity-Robust Language Model Generation via Content Integrity PreservationMiao Zhang 0030, Kelly Chen, Md Mehrab Tanjim, Rumi Chunara. 19356-19370 [doi]
- RFS-Guard: Detecting Reasoning Hallucinations via Cross-Phase Routing Focus in Large Reasoning ModelsZihang Liu 0001, Zhouhua Fang, Hui Liu, Zhiwei Liu, Yong Li, Haishuai Wang. 19371-19385 [doi]
- Causal-ESC: Reliable Policy Learning for Emotional Support Conversation via Causal InferenceXv Wang, Wang Zhenyu, Guanyu Zheng, Rui Zhang. 19386-19401 [doi]
- Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path AnchoringDongxu Zhang, Yiding Sun, Cheng Tan, Wenbiao Yan, Ning Yang 0005, Jihua Zhu, Haijun Zhang 0001. 19402-19415 [doi]
- CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding TasksHongchao Jiang, Yiming Chen 0010, Yushi Cao, Hung-yi Lee, Robby T. Tan. 19416-19448 [doi]
- Towards a Mechanistic Understanding of Large Reasoning Models: A Survey of Training, Inference, and FailuresYi Hu, Jiaqi Gu, Ruxin Wang, Zijun Yao 0002, Hao Peng 0015, Xiaobao Wu, Jianhui Chen, Muhan Zhang, Liangming Pan. 19449-19466 [doi]
- Modeling LLM Unlearning as an Asymmetric Two-Task Learning ProblemZeguan Xiao, Siqing Li, Yong Wang 0032, Xuetao Wei, Jian Yang 0003, Yun Chen 0007, Guanhua Chen 0001. 19467-19477 [doi]
- MVP: Enhancing Video Large Language Models via Self-supervised Masked Video PredictionXiaokun Sun, Zezhong Wu, Zewen Ding, Linli Xu. 19478-19493 [doi]
- Knowledge Poisoning Attacks on Medical Multi-Modal Retrieval-Augmented GenerationPeiru Yang, Haoran Zheng, Tong Ju, Shiting Wang, Wanchun Ni, Jiajun Liu, Shangguang Wang, Yongfeng Huang 0001, Tao Qi. 19494-19513 [doi]
- Maximizing Local Entropy Where It Matters: Prefix-Aware Localized LLM UnlearningNaixin Zhai, Pengyang Shao, Binbin Zheng, Yonghui Yang 0001, Fei Shen, Long Bai 0015, Xun Yang 0001. 19514-19531 [doi]
- When Bigger Isn't Better: A Comprehensive Fairness Evaluation of Political Bias in Multi-News SummarisationNannan Huang, Iffat Maab, Junichi Yamagishi. 19532-19563 [doi]
- Language Acquisition Device in Large Language ModelsMasato Mita, Taiga Someya, Ryo Yoshida, Yohei Oseki. 19564-19577 [doi]
- CAML: A Conflict-Aware Molecular Language Model Merging Framework for Multi-Constraint Molecular GenerationXuanbai Ren, Luoda Tan, Pei Liu 0008, Tengfei Ma 0002, Xiangzheng Fu, Longyue Wang, Yiping Liu, Xiangxiang Zeng. 19578-19594 [doi]
- Stratagem: Learning Transferable Reasoning via Trajectory-Modulated Game Self-PlayXiachong Feng, Deyi Yin, Xiaocheng Feng, Yi Jiang, Libo Qin 0001, Yangfan Ye, Lei Huang 0021, Weitao Ma, Qiming Li, Yuxuan Gu 0004, Bing Qin 0001, Lingpeng Kong. 19595-19614 [doi]
- NOSE: Neural Olfactory-Semantic Embedding with Tri-Modal Orthogonal Contrastive LearningYanyi Su, Hongshuai Wang, Zhifeng Gao, Jun Cheng. 19615-19647 [doi]
- ReFL: Reflective Feedback Learning for Hallucination Detection of Large Language ModelsCunhang Fan, Jun Zhang, Xue Zhang, Shuai Zhang 0014, Zhao Lv, Jianhua Tao 0001, Zhengqi Wen. 19648-19665 [doi]
- Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory ManagementWeitao Ma, Xiaocheng Feng, Lei Huang 0021, Xiachong Feng, Zhanyu Ma, Jun Xu 0001, Jiuchong Gao, Jinghua Hao, Renqing He, Bing Qin 0001. 19666-19684 [doi]
- NaturalSloth: Revisiting Denial-of-Service Attacks on Large Language ModelsYiming Chen 0010, Zexin Li 0001, Xianghu Yue, Robby T. Tan, Haizhou Li 0001. 19685-19702 [doi]
- HiGoE: Hierarchical Graph of Evidence to Enhance Retrieval-Augmented Generation for Long-context SummarizationLong Yuan 0001, Kaiwen Tian, Zi Chen 0003, Bolong Zheng, Chuan Ma 0001. 19703-19724 [doi]
- Region-Grounded Report Generation for 3D Medical Imaging: A Fine-Grained Dataset and Graph-Enhanced FrameworkCong Huy Nguyen, Son Dinh Nguyen, Guanlin Li, Tuan-Dung Nguyen, Aditya Narayan Sankaran, Mai Huy Thong, Thanh Trung Nguyen, Mai Hong Son, Reza Farahbakhsh, Phi-Le Nguyen, Noël Crespi. 19725-19740 [doi]
- UI-Copilot: Advancing Long-Horizon GUI Automation via Tool-Integrated Policy OptimizationZhengxi Lu, Fei Tang 0005, Guangyi Liu, Jin Ma, Kaitao Song, Xu Tan 0003, Wenqi Zhang 0001, Weiming Lu 0001, Jun Xiao 0001, Yueting Zhuang, Yongliang Shen 0001. 19741-19762 [doi]
- STK-Adapter: Incorporating Evolving Graph and Event Chain for Temporal Knowledge Graph ExtrapolationShuyuan Zhao 0001, Wei Chen 0105, Weijie Zhang, Xinrui Hou, Junfeng Shen, Boyan Shi, Shengnan Guo 0001, Youfang Lin, Huaiyu Wan. 19763-19778 [doi]
- Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward ModelingQiyuan Chen 0003, Hongsen Huang, Jiahe Chen, Qian Shao, Jintai Chen, Hongxia Xu, Renjie Hua, Ren Chuan, Jian Wu 0001. 19779-19792 [doi]
- DeepGuard: Secure Code Generation via Multi-Layer Semantic AggregationLi Huang 0006, Zhongxin Liu 0002, Yifan Wu, Tao Yin, Dong Li 0009, Jichao Bi, Nankun Mu, Hongyu Zhang 0002, Meng Yan 0001. 19793-19813 [doi]
- Distillation Traps and Guards: A Calibration Knob for LLM DistillabilityWeixiao Zhan, Yongcheng Jing, Leszek Rutkowski, Dacheng Tao. 19814-19833 [doi]
- DVMap: Fine-Grained Pluralistic Value Alignment via High-Consensus Demographic-Value MappingPengyun Zhu, Yuqi Ren, Zhen Wang, Lei Yang, Deyi Xiong. 19834-19852 [doi]
- HTMR: Hybrid Token Masking Reinforcement Learning with Verifiable Rewards for Event Argument Extraction with Multi-Perspective ReasoningJianwen Luo, Yongkang Jin, Yu Hong 0001, Jianmin Yao 0001. 19853-19873 [doi]
- IS-CoT: Breaking the Long-form Generation Collapse via Interleaved Structural ThinkingZechen Sun, Yuyang Sun, Zecheng Tang, Juntao Li 0005, Wenpeng Hu, Wenliang Chen, Zhunchen Luo, Guotong Geng, Min Zhang 0005. 19874-19887 [doi]
- Seeing the Whole Elephant: A Benchmark for Failure Attribution in LLM-based Multi-Agent SystemsMengzhuo Chen, Junjie Wang 0001, Fangwen Mu, Yawen Wang, Zhe Liu 0025, Huanxiang Feng, Qing Wang 0001. 19888-19905 [doi]
- MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video GenerationYanghao Zhou, Haitian Li, Rexar Lin, Heyan Huang, Jinxing Zhou, Changsen Yuan, Tian Lan 0003, Ziqin Zhou, Yudong Li, Jiajun Xu, Jingyun Liao, Yiming Cheng, XueFeng Chen, Xian-Ling Mao, Yousheng Feng. 19906-19942 [doi]
- Why LLMs Hallucinate on Structured Knowledge: A Mechanistic Analysis of Reasoning over Linearized RepresentationsShanghao Li, Jinda Han, Yibo Wang 0001, Yuanjie Zhu, Zihe Song 0001, Langzhou He, Kenan Kamel A Alghythee, Philip S. Yu. 19943-19956 [doi]
- SubTokenTest: A Practical Benchmark for Real-World Sub-token UnderstandingShuyang Hou, Yi Hu, Muhan Zhang. 19957-19999 [doi]
- Benchmarking and Enabling Efficient Chinese Medical Retrieval via Asymmetric EncodersAngqing Jiang, Jianlyu Chen, Zhe Fang, Yongcan Wang, Xinpeng Li, Keyu Ding, Defu Lian. 20000-20020 [doi]
- Merlin's Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive PromptingHeming Xia, Cunxiao Du, Rui Li 0094, Chak Tou Leong, Yongqi Li 0001, Wenjie Li 0002. 20021-20039 [doi]
- CAKE: Causal-Guided Adaptive Knowledge Editing for LLMsShuxin Liu, Jianhao Zhang. 20040-20070 [doi]
- Preconditioned Test-Time Adaptation for Out-of-Distribution Debiasing in Narrative GenerationHanwen Shen, Ting Ying, Jiajie Lu, Shanshan Wang. 20071-20104 [doi]
- Backdoor Collapse: Eliminating Unknown Threats Via Known Backdoor Aggregation In Language ModelsLiang Lin 0004, Miao Yu, Moayad Aloqaily, Zhenhong Zhou, Kun Wang 0056, Linsey Pang, Prakhar Mehrotra, Qingsong Wen. 20105-20123 [doi]
- Less is More: Improving LLM Reasoning with Minimal Test-Time InterventionZhen Yang, Mingyang Zhang, Feng Chen, Ganggui Ding, Liang Hou, Xin Tao 0001, Ying-Cong Chen. 20124-20137 [doi]
- League of LLMs: A Benchmark-Free Paradigm for Mutual Evaluation of Large Language ModelsQianhong Guo, Wei Xie 0007, Xiaofang Cai, Enze Wang, Shuoyoucheng Ma, Xiaobing Sun, Tian Xia, Kai Chen, Xiaofeng Wang, Baosheng Wang. 20138-20159 [doi]
- RARE: Redundancy-Aware Retrieval Evaluation Framework for High-Similarity CorporaHanjun Cho, Jay Yoon Lee. 20160-20185 [doi]
- Leibniz: Theory-of-Mind Driven Neuro-Symbolic Logical Reasoning via Multi-Agent CollaborationYue Fan, Hu Zhang, Yunxiao Zhao, Guangjun Zhang, Hao Zhan, Ru Li, Hongye Tan, Yuanlong Wang. 20186-20210 [doi]
- The Paradox of Outcome Optimization: A Causal Information-Theoretic Bound on Reasoning Shortcuts in LLMsZihan Chen, Yiming Zhang, Wenxiang Geng, Zenghui Ding, Yining Sun. 20211-20221 [doi]
- SPENCE: A Syntactic Probe for Detecting Contamination in NL2SQL BenchmarksMohammadtaher Safarzadeh, Hitesh Laxmichand Patel, Afshin Oroojlooy, Graham Horwood, Dan Roth 0001. 20222-20239 [doi]
- PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward ModelingAi Jian, Jingqing Ruan, Xing Ma, Dailin Li, Weipeng Zhang, Ke Zeng, Xunliang Cai. 20240-20268 [doi]
- Uncovering Sentiment Analysis Circuit in Large Language ModelShichen Li, Zhouyang Wang, Zhongqing Wang, Peifeng Li 0001. 20269-20289 [doi]
- Think Before Writing: Feature-Level Multi-Objective Optimization for Generative Citation VisibilityZikang Liu, Peilan Xu. 20290-20303 [doi]
- Zero-Shot Multimodal Retrieval with Multi-Scale Contextual RepresentationsSourajit Saha, Tejas Gokhale. 20304-20324 [doi]
- ReEfBench: Quantifying the Reasoning Efficiency of LLMsZhizhang Fu, Yuancheng Gu, Chenkai Hu, Hanmeng Liu, Yue Zhang 0004. 20325-20346 [doi]
- Beyond Ranking: Fine-Grained Diagnostics and Self-Improvement for MLLMsMingze Xu, Zijing Zhao, Qiming Peng, Houwen Peng, Han Hu 0001, Zhanhui Kang, Yuxing Han. 20347-20377 [doi]
- Bridging Internal Consistency and External Alignment: A Causal and Dynamic Interpretability Framework for LLM GenerationShuyao Xiao, Shengling Wang 0001, Ke Chao. 20378-20392 [doi]
- Beyond the Last Frame: Process-aware Evaluation for Generative Video ReasoningYifan Li 0009, Yukai Gu, Yingqian Min, Zikang Liu 0001, Yifan Du 0002, Kun Zhou 0002, Min Yang, Xin Zhao 0018, Minghui Qiu. 20393-20409 [doi]
- THOR: A Theta-Gamma Hierarchical Oscillatory Reasoning Framework for Multi-hop QAZiyang Ling, Ronald X. Xu, Mingzhai Sun. 20410-20437 [doi]
- How Should We Enhance the Safety of Large Reasoning Models: An Empirical StudyZhexin Zhang, Xian Qi Loye, Victor Shea-Jay Huang, Junxiao Yang, Qi Zhu 0011, Shiyao Cui, Fei Mi, Lifeng Shang, Yingkang Wang, Hongning Wang, Minlie Huang. 20438-20457 [doi]
- HSCodeComp: A Realistic and Expert-level Agent Benchmark for Hierarchical Rule ApplicationTian Lan, Yiqian Yang, Qianghuai Jia, Li Zhu, Hui Jiang, Hang Zhu, Weihua Luo, Longyue Wang. 20458-20489 [doi]
- AnchorSeg: Language Grounded Query Banks for Reasoning SegmentationRui Qian 0002, Chuanhang Deng, Qiang Huang, Jian-xiong, Mingxuan Li, Yingbo Zhou, Wei Zhai, Jintao Chen, Dejing Dou. 20490-20505 [doi]
- R⌃3AG: Retriever Routing for Retrieval-Augmented GenerationTong Zhao, Yutao Zhu 0001, Yucheng Tian, Zhicheng Dou. 20506-20522 [doi]
- ClusterRAG: Cluster-Based Collaborative Filtering for Personalized Retrieval-Augmented GenerationGibson Nkhata, Uttamasha Anjally Oyshi, Quan Mai, Susan Gauch. 20523-20539 [doi]
- Toward Robust In-Context Learning: Leveraging Out-of-distribution Proxies for Target Inaccessible Demonstration RetrievalHao Xu 0012, Rite Bo, Fausto Giunchiglia, Yingji Li, Rui Song 0008. 20540-20556 [doi]
- AutoSchemaKG: Autonomous Knowledge Graph Construction through Dynamic Schema Induction from Web-Scale CorporaJiaxin Bai, Wei Fan 0001, Qi Hu, Qing Zong, Chunyang Li, Hong Ting Tsang, Hongyu Luo, Yauwai Yim, Haoyu Huang, Xiao Zhou, Feng Qin, Tianshi Zheng, Xi Peng 0006, Xin Yao, Huiwen Yang, Leijie Wu, J. I Yi, Gong Zhang 0001, Renhai Chen, Yangqiu Song. 20557-20584 [doi]
- Aligned Multi-View Scripts for Universal Chart-to-Code GenerationZhihan Zhang, Lizi Liao. 20585-20611 [doi]
- SpeakerSleuth: Can Large Audio-Language Models Judge Speaker Consistency across Multi-turn Dialogues?Jonggeun Lee, Junseong Pyo, Gyuhyeon Seo, Yohan Jo. 20612-20636 [doi]
- Breaking Block Boundaries: Anchor-based History-stable Decoding for Diffusion Large Language ModelsShun Zou, Yong Wang, Zehui Chen, Lin Chen, Chongyang Tao, Feng Zhao, Xiangxiang Chu. 20637-20658 [doi]
- HiSVD: Principled Low-Rank Approximation of LLMs via Hierarchical Modeling of Information Capacity and Spectral StructureZhuo Chen, Minghao Li, Xiaoqian Ma, Siqi Fan 0001, Xiusheng Huang, Liujie Zhang, Weihang Chen. 20659-20677 [doi]
- Unveiling the Unknown: Open-Set Entity Typing via Two-Stage GenerationHu Chen, Binhan Yang, Wei Shen 0004. 20678-20694 [doi]
- Don't Adapt Small Language Models for Tools; Adapt Tool Schemas to the ModelsJonggeun Lee, Woojung Song, Jongwook Han, Haesung Pyun, Yohan Jo. 20695-20719 [doi]
- Language Reconstruction with Brain Predictive Coding from fMRI DataCongchi Yin, Ziyi Ye, Piji Li. 20720-20743 [doi]
- Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric RewardsJiajie Zhang, Xin Lv, Ling Feng, Lei Hou 0001, Juanzi Li. 20744-20765 [doi]
- Think Natively: Unlocking Multilingual Reasoning with Consistency-Enhanced Reinforcement LearningXue Zhang, Yunlong Liang, Fandong Meng, Songming Zhang 0001, Kaiyu Huang, Yufeng Chen 0005, Jinan Xu, Jie Zhou 0016. 20766-20783 [doi]
- Mem²Evolve: Towards Self-Evolving Agents via Co-Evolutionary Capability Expansion and Experience DistillationZihao Cheng, Zeming Liu, Yingyu Shan, Xinyi Wang, Xiangrong Zhu 0002, Yunpu Ma, Hongru Wang 0003, Yuhang Guo 0001, Wei Lin, Yunhong Wang 0001. 20784-20831 [doi]
- VideoCuRL: Video Curriculum Reinforcement Learning with Orthogonal Difficulty DecompositionHongbo Jin, Kuanwei Lin, Wenhao Zhang, Yichen Jin, Ge Li. 20832-20845 [doi]
- Visual Inception: Compromising Long-term Planning in Agentic Recommenders via Multimodal Memory PoisoningJiachen Qian. 20846-20862 [doi]
- Language on Demand, Knowledge at Core: Composing LLMs with Encoder-Decoder Translation Models for Extensible MultilingualityMengyu Bu, Yang Feng 0004. 20863-20885 [doi]
- GeoArena: Evaluating Open-World Geographic Reasoning in Large Vision-Language ModelsPengyue Jia, Yingyi Zhang 0001, Xiangyu Zhao 0001, Sharon Li 0001. 20886-20901 [doi]
- Fisher-Driven Adaptive Locating for Knowledge Editing in Large Language ModelsChenghao Xu, Jiexi Yan, Guangtao Lyu, Qi Liu, Muli Yang, Cheng Deng 0002. 20902-20913 [doi]
- From AR to Diffusion: Efficiently Adapting Large Language Models with Strictly Causal and Elastic HorizonsXiangyu Ma, Teng Xiao, Zuchao Li, Lefei Zhang. 20914-20927 [doi]
- ExPerT: Personalizing LLM Responses to Users' Domain Expertise via Query-Wise Semantic and Keystroke Behavioral CuesYeji Park, Jiwon Tark, Taesik Gong. 20928-20963 [doi]
- Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI GroundingWenkai Wang, Xiyun Li, Hongcan Guo, Wenhao Yu, Tianqing Fang, Haitao Mi, Dong Yu, Shengyu Zhang 0001. 20964-20984 [doi]
- Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent PurificationJiayu Zhang, Shuo Ye, Qilang Ye, Zihan Song 0009, Jiajian Huang, Zitong Yu. 20985-20995 [doi]
- ChatHLS: Towards Systematic Design Automation and Optimization for High-Level SynthesisRunkai Li, Jia Xiong, Xiuyuan He, Jieru Zhao, Jiaqi Lv, Haowen Fang, Lei Qi 0001, Xi Wang 0009. 20996-21015 [doi]
- Cultural Benchmarking of LLMs in Standard and Dialectal Arabic DialoguesMuhammad Dehan Al Kautsar, Saeed Almheiri, Momina Ahsan, Bilal Elbouardi, Younes Samih, Sarfraz Ahmad, Amr Keleg, Omar El-Herraoui, Kareem Elzeky, Abed Alhakim Freihat, Mohamed Anwar, Zhuohan Xie, Junhong Liang, Mohammad Rustom Al Nasar, Preslav Nakov, Fajri Koto. 21016-21039 [doi]
- ReRec: Reasoning-Augmented LLM-based Recommendation Assistant via Reinforcement Fine-tuningJiani Huang 0001, Shijie Wang 0002, Liang-Bo Ning 0001, Wenqi Fan, Qing Li 0001. 21040-21055 [doi]
- MoA: Heterogeneous Mixture of Adapters for Parameter-Efficient Fine-Tuning of Large Language ModelsJie Cao, Tianwei Lin 0001, Bo Yuan, Rolan Yan, Hongyang He, Wenqiao Zhang, Juncheng Li 0006, Dongping Zhang, Siliang Tang, Yueting Zhuang. 21056-21073 [doi]
- Beyond the Context Window: Scaling Agentic RL via End-to-end Optimized Context CompressionMiao Lu, Weiwei Sun, Weihua Du, Zhan Ling, Xuesong Yao, Kang Liu, Jiecao Chen. 21074-21125 [doi]
- Probing the Safety Robustness of LLMs in Latent SpaceTianle Gu, Kexin Huang, Zongqi Wang, Yixu Wang, Jie Li 0052, Xin Wang 0119, Yang Yao, Yujiu Yang 0001, Yan Teng 0002, Yingchun Wang 0004. 21126-21143 [doi]
- LoopTool: Closing the Data-Training Loop for Robust LLM Tool CallsKangning Zhang, Weiwen Liu, Wenxiang Jiao, Kounianhua Du, Yuan Lu, Weinan Zhang 0001, Yong Yu 0001. 21144-21164 [doi]
- Placing Puzzle Pieces Where They Matter: A Question Augmentation Framework for Reinforcement LearningYangyi Fang, Haolin Shi. 21165-21183 [doi]
- USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language ModelsBaolin Zheng, Guanlin Chen, Qingyang Teng, Hongqiong Zhong, Yingshui Tan, Zhendong Liu, Weixun Wang, Jiaheng Liu, Jian Yang 0037, Huiyun Jing, Jincheng Wei, Wenbo Su, Xiaoyong Zhu, Bo Zheng 0007, Kaifu Zhang. 21184-21211 [doi]
- FlowSearch: Advancing Deep Research with Dynamic Structured Knowledge FlowYusong Hu, Runmin Ma, Yue Fan, Jinxin Shi, Zongsheng Cao, Yuhao Zhou 0005, Jiakang Yuan, Shuaiyu Zhang, Shiyang Feng, Xiangchao Yan, Shufei Zhang, Wenlong Zhang, Lei Bai 0001, Bo Zhang 0069. 21212-21245 [doi]
- LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language ModelsMing Zhang 0030, Yujiong Shen, Jingyi Deng, Yuhui Wang, Huayu Sha, Kexin Tan, Qiyuan Peng, Yue Zhang 0004, Junzhe Wang 0001, Shichun Liu, Yueyuan Huang, Jingqi Tong, Changhao Jiang, Yilong Wu, Zhihao Zhang 0002, Mingqi Wu, Mingxu Chai, Zhiheng Xi, Shihan Dou, Tao Gui, Qi Zhang 0001, Xuanjing Huang 0001. 21246-21273 [doi]
- SAME: Signer-Aware Mixture-of-Experts for Test-Time Adaptation in Sign Language TranslationLujia Yang, Weicai Yan, Yongbo He, Qifei Zhang 0001, Tao Jin 0004, Jinshan Zhang 0001, Meng Xi 0002, Jianwei Yin. 21274-21289 [doi]
- Controllable LLM Reasoning via Sparse Autoencoder-Based SteeringYi Fang 0010, Wenjie Wang 0007, Mingfeng Xue, Boyi Deng, Fengli Xu, Dayiheng Liu, Fuli Feng. 21290-21305 [doi]
- LEDOM: Reverse Language ModelXunjian Yin, Sitao Cheng, Yuxi Xie, Xinyu Hu 0001, Li Lin 0014, Xinyi Wang 0003, Liangming Pan, William Yang Wang, Xiaojun Wan 0001. 21306-21326 [doi]
- AEGIS: A Holistic Benchmark for Evaluating Forensic Analysis of AI-Generated Academic ImagesBo Zhang, Tzu-Yen Ma, Zichen Tang, Junpeng Ding, Zirui Wang, Yizhuo Zhao, Peilin Gao, Zijie Xi, Zixin Ding, Haiyang Sun, Haocheng Gao, Yuan Liu, Liangjia Wang, Yiling Huang, Yujie Wang, Yuyue Zhang, Ronghui Xi, Yuanze Li, Jiacheng Liu, Zhongjun Yang, Haihong E. 21327-21363 [doi]
- The GaoYao Benchmark: A Comprehensive Framework for Evaluating Multilingual and Multicultural Abilities of Large Language ModelsYilun Liu 0001, Chunguang Zhao, Mengyao Piao, Lingqi Miao, Shimin Tao, Minggui He, Chenxin Liu, Li Zhang, Hongxia Ma, Jiaxin Guo, Chen Liu, Liqun Deng, Jiansheng Wei, Xiaojun Meng, Fanyi Du, Daimeng Wei, Yanghua Xiao. 21364-21384 [doi]
- METRO: Towards Strategy Induction from Expert Dialogue Transcripts for Non-collaborative DialoguesHaofu Yang, Jiaji Liu, Chen Huang 0006, Faguo Wu, Wenqiang Lei, See-Kiong Ng. 21385-21416 [doi]
- TamEdit: Trajectory-Aware Meta-Learning for Specificity-Preserving Continual Knowledge EditingShiqiang Tian, Cheng Ding, Qin Chen 0001, Jie Zhou 0015, Liang He 0001. 21417-21439 [doi]
- LexRel: Benchmarking Legal Relation Extraction for Chinese Civil CasesYida Cai, Ranjuexiao Hu, Huiyuan Xie, Chenyang Li, Yun Liu, Yuxiao Ye, Zhenghao Liu, Weixing Shen, Zhiyuan Liu. 21440-21456 [doi]
- Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model AgentsYi Yu, Liuyi Yao, Yuexiang Xie, Qingquan Tan, Jiaqi Feng, Yaliang Li, Libing Wu. 21457-21483 [doi]
- Profiling-Free Mixed-Precision Quantization for MoE LLMs via Fuzzy Rule InterpolationHuachen Qi, Ruiyu Zhuo, Bowen Shi, Xiang Chang, Fei Chao 0001, Changjing Shang, Qiang Shen 0001. 21484-21499 [doi]
- Tailoring Diagnostic Modeling to Individual Learners: Personalized Distractor Generation via MCTS-Guided Reasoning ReconstructionTao Wu, Jingyuan Chen, Wang Lin, Jian Zhan, Mengze Li 0001, Fangzhou Jin, Min Zhang 0068, Kun Kuang 0001, Fei Wu 0001. 21500-21524 [doi]
- MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning EvaluationXiaoyuan Li 0001, Keqin Bao, Yubo Ma, Moxin Li, Wenjie Wang 0007, Rui Men, Yichang Zhang, Fuli Feng, Dayiheng Liu. 21525-21577 [doi]
- Community-Aware Assessment of Social Textual Engagement and Resonance: A Human-Centric Perspective on User-Generated Content EvaluationTianjiao Li, Kai Zhao, Xiang Li, Yang Liu, Huyang Sun. 21578-21600 [doi]
- Query-Aware Knowledge Retrieval via Hyperbolic StructuringChuang Zhou 0002, Junnan Dong, Yilin Xiao 0002, Shengyuan Chen, Su Dong 0002, Di Yin, Xing Sun 0001, Zhaozhuo Xu, Xiao Huang 0001. 21601-21614 [doi]
- EduBench: A Comprehensive Benchmarking Dataset for Evaluating Large Language Models in Diverse Educational ScenariosBin Xu, Yu Bai 0018, Huashan Sun, Yiguan Lin, Siming Liu, Xinyue Liang, Yaolin Li, Zhuangzhi Dong, Jingren Zhang, Yufan Deng, Xinyu Zou, Yang Gao 0016, Heyan Huang. 21615-21645 [doi]
- WebClipper: Efficient Evolution of Web Agents with Graph-based Trajectory PruningJunjie Wang, Zequn Xie, Dan Yang 0004, Jie Feng, Yue Shen, Duolin Sun, Meixiu Long, YiHan Jiao, ZheHao Tan, Jian Wang 0108, Peng Wei, Jinjie Gu. 21646-21666 [doi]
- MMAC: A Multilingual, Multimodal Alignment Framework for Cultural Grounding EvaluationWeihua Zheng, Zhengyuan Liu, Tanmoy Chakraborty 0002, Weiwen Xu, Xiaoxue Gao, Bryan Chen Zhengyu Tan, Bowei Zou, Chang Liu 0071, Yujia Hu, Xing Xie 0001, Xiaoyuan Yi, Jing Yao 0003, Chaojun Wang, Long Li, Rui Liu 0019, Huiyao Liu, Koji Inoue, Ryuichi Sumida, Tatsuya Kawahara, Fan Xu, Lingyu Ye, Wei Tian, Dongjun Kim, Jimin Jung, Jaehyung Seo, Nadya Yuki Wangsajaya, Pham Minh Duc, Ojasva Saxena, Palash Nandi, Xiyan Tao, Wiwik Karlina, Tuan Luong, Keertana Arun Vasan, Roy Ka-Wei Lee, Nancy F. Chen. 21667-21709 [doi]
- Step-GRPO: Internalizing Dynamic Early Exit for Efficient ReasoningBenteng Chen, Weida Wang, Shufei Zhang, Mingbao Lin, Min Zhang 0068. 21710-21724 [doi]
- Gold-Medal-Level Olympiad Geometry Solving with Efficient Heuristic Auxiliary ConstructionsBoyan Duan, Xiao Liang, Shuai Lu, Yaoxiang Wang, Yelong Shen, Kai-Wei Chang 0001, Ying Nian Wu, Mao Yang 0004, Weizhu Chen, Yeyun Gong. 21725-21747 [doi]
- Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive ScoringPeichun Hua, Hao Li, Shanghao Shi, Zhiyuan Yu, Ning Zhang. 21748-21785 [doi]
- The Digital Dunning-Kruger Effect: Decoupling Hallucinations via Geometric Hidden-state Observation for Semantic TruthfulnessYueheng Mao, Min Yu 0001, Gengwang Li, Jianguo Jiang, Gang Li 0009, Meng Zhang 0020, Zhen Xu, Weiqing Huang, Ming Liu 0003. 21786-21800 [doi]
- d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language ModelsLeyi Pan, Shuchang Tao, Yunpeng Zhai, Zheyu Fu, Liancheng Fang, Minghua He, Lingzhe Zhang, Zhaoyang Liu 0003, Bolin Ding, Aiwei Liu, Lijie Wen 0001. 21801-21822 [doi]
- Traffic-R1: Reinforced LLMs Bring Human-Like Reasoning to Traffic Signal Control SystemsXingchen Zou, Yuhao Yang 0002, Zheng Chen, Xixuan Hao, Yiqi Chen, Chao Huang 0001, Yuxuan Liang 0002. 21823-21838 [doi]
- Nirvana: A Specialized Generalist Model With Task-Aware Memory MechanismYuhua Jiang, Shuang Cheng, Yihao Liu 0008, Ermo Hua, Che Jiang, Weigao Sun, Yu Cheng 0001, Feifei Gao, Biqing Qi, Bowen Zhou 0002. 21839-21857 [doi]
- BoYaEval: Evaluating Multimodal Large Language Models on Understanding Ancient Chinese Musical ScoresJiajia Li, Weizhi Xue, Yao Yao, Qiwei Li 0002, Chong Chen, Zuchao Li, Ping Wang 0028, Hai Zhao 0001. 21858-21873 [doi]
- Rectifying the Emotional Flow: Aligning Priors and Dynamic Guidance for High-Arousal Text-to-SpeechFangming Feng, Dongjie Fu, Zequn Xie, Yu Zhang 0126, Yangyang Wu, Zhou Zhao 0001, Tao Jin 0004. 21874-21888 [doi]
- Perplexity-Aware Data Scaling Law: Perplexity Landscapes Predict Performance for Continual Pre-trainingLei Liu, Hao Zhu, Xiaoyan Yang, Yue Shen, Zhixuan Chu, Jian Wang 0108, Jinjie Gu, Kui Ren 0001. 21889-21901 [doi]
- Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation DatasetQian Chen, Xianyin Zhang, Yanzhi Liu, Lifan Guo, Feng Chen, Chi Zhang. 21902-21919 [doi]
- AutoReproduce: Automatic AI Experiment Reproduction with Paper LineageXuanle Zhao, Zilin Sang, Yuxuan Li, Qi Shi 0002, Weilun Zhao, Shuo Wang 0013, Duzhen Zhang, Xu Han 0007, Zhiyuan Liu 0001, Maosong Sun 0001. 21920-21942 [doi]
- How Can Synthetic Data Improve Multilingual Language Model Pretraining? A Data Quality PerspectiveTongyao Zhu, Qian Liu 0033, Chang Ma, Jinghan Zhang 0006, Longxu Dou, Junxian He, Shiqi Chen 0002. 21943-21956 [doi]
- Can Large Language Models Infer Causal Relationships from Real-World Text?Ryan Saklad, Aman Chadha, Oleg V. Pavlov, Raha Moraffah. 21957-21989 [doi]
- Distributional Clarity: The Hidden Driver of RL-Friendliness in Large Language ModelsShaoning Sun, Mingzhu Cai, Huang He, Bingjin Chen, Siqi Bao, Yujiu Yang 0001, Hua Wu 0003, Haifeng Wang 0001. 21990-22006 [doi]
- ReasonRank: Empowering Passage Ranking with Strong Reasoning AbilityWenhan Liu, Xinyu Ma 0001, Weiwei Sun 0001, Yutao Zhu 0001, Yuchen Li 0006, Dawei Yin 0001, Zhicheng Dou. 22007-22031 [doi]
- ATIR: Towards Audio-Text Interleaved Contextual RetrievalTong Zhao, Chenghao Zhang 0001, Yutao Zhu 0001, Zhicheng Dou. 22032-22046 [doi]
- Task-Aware LLM Routing with Multi-Level Task-Profile-Guided Data Synthesis for Cold-Start ScenariosHui Liu 0036, Bin Zou, Kecheng Chen, Jie Liu 0044, Wenya Wang 0001, Haoliang Li. 22047-22076 [doi]
- SelFusion: Self-distillation for Diffusion Language ModelsHyeongsoo Lim, Jinyoung Kim, Eun Seo Seo, Min-Ho Jang, Jiwon Yoon 0002. 22077-22089 [doi]
- Benchmarking Web Agent Safety under E-commerce Deceptive InterfacesZijing Shi, Meng Fang, Ling Chen 0006. 22090-22103 [doi]
- Counteracting the Matthew Effect in Self-Improvement of LVLMs through Head-Tail Re-balancingXin Guo, Zhiheng Xi, Yiwen Ding, Yitao Zhai, Xiaowei Shi, Xunliang Cai, Tao Gui, Qi Zhang 0001, Xuanjing Huang 0001. 22104-22121 [doi]
- MAGIC: Deep Geometric Evolution with Structural Consensus for Temporal Knowledge Graph ReasoningChengao Liu, Yuan Li 0055, Yingze Wang, Jianbin Jiao. 22122-22133 [doi]
- MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE InferenceBo Li, Chuan Wu, ShaoLin Zhu. 22134-22148 [doi]
- Efficient Prior-Guided Reasoning for Robust Retrieval-Augmented Generation under ConflictsXiaowei Yuan, Ziyang Huang 0005, Zhao Yang 0004, Yequan Wang, Jun Zhao 0001, Kang Liu 0001. 22149-22164 [doi]
- Markovian Linguistic-Temporal Bridge: Unlocking the Potential of LLMs for Time Series ForecastingSiming Sun, Kai Zhang 0079, Xuejun Jiang, Wenchao Meng, Qinmin Yang. 22165-22180 [doi]
- Template-assisted Contrastive Learning of Task-oriented Dialogue Sentence EmbeddingsMinsik Oh, Jiwei Li 0001, Guoyin Wang 0002. 22181-22198 [doi]
- MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action AgentsHao Sun 0013, Yu Song 0008, Shiyu Teng, Ziwei Niu, Yen-Wei Chen 0001. 22199-22215 [doi]
- IRIS: Interleaved Reinforcement with Incremental Staged Curriculum for Cross-Lingual Mathematical ReasoningNavya Gupta, Rishitej Reddy Vyalla, Avinash Anand, Chhavi Kirtani, Erik Cambria, Zhengchen Zhang, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah. 22216-22248 [doi]
- FLARE: Fine-Grained Length-Aware Routing for Resource-Efficient Heterogeneous LLM ServingYujia Fu, Heming Zhong, Dan Huang 0001, Yutong Lu. 22249-22266 [doi]
- MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward OptimizationYang Zhao 0023, Hepeng Wang, Xiao Ding, Yangou Ouyang, Bibo Cai, Kai Xiong 0002, Jinglong Gao, Zhouhao Sun, Li Du, Bing Qin 0001, Ting Liu 0001. 22267-22283 [doi]
- Bit-by-Bit: Progressive QAT Strategy with Outlier Channel Splitting for Stable Low-Bit LLMsBinxing Xu, Hao Gu, Lujun Li 0001, Hao Wang 0097, Bei Liu, Jiacheng Liu 0001, Qiyuan Zhu, Xintong Yang, Chao Li 0009, Sirui Han, Yike Guo. 22284-22299 [doi]
- OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using AgentsBowen Yang, Kaiming Jin, Zhenyu Wu, Zhaoyang Liu 0001, Qiushi Sun, Zehao Li, Jingjing Xie, Zhoumianze Liu, Fangzhi Xu, Kanzhi Cheng, Yian Wang 0003, Qingyun Li, Yu Qiao 0001, Zun Wang 0001, Zichen Ding 0002. 22300-22330 [doi]
- Learning from Cognition: Enhancing RL Efficiency for LLM Reasoning via Hierarchical Metacognitive Decomposition and RefinementZexu Sun, Yongcheng Zeng, Erxue Min, Heyang Gao, Bokai Ji, Dugang Liu, Xing Tang 0007, Xiuqiang He 0001, Xu Chen 0017. 22331-22348 [doi]
- BrowseComp-Plus: A Fair and Disentangled Evaluation Benchmark for Deep Search AgentsZijian Chen, Xueguang Ma, Shengyao Zhuang, Ping Nie, Kai Zou, Sahel Sharifymoghaddam, Andrew Liu, Joshua Green, Kshama Patel, Ruoxi Meng, Mingyi Su, Yanxi Li, Haoran Hong, Xinyu Shi, Xuye Liu, Hosna Oyarhoseini, Nandan Thakur, Crystina Zhang, Luyu Gao, Wenhu Chen, Jimmy Lin. 22349-22370 [doi]
- LitVISTA: A Benchmark for Narrative Orchestration in Literary TextMingzhe Lu, Yiwen Wang, Yanbing Liu, Qi You, Chong Liu, Ruize Qin, Haoyu Dong, Wenyu Zhang, Jiarui Zhang, Yue Hu, Yunpeng Li. 22371-22396 [doi]
- RST-Guarder: Enhancing Long-Context Robustness for Safeguards via RST Parsing and Probabilistic InferenceXu Zhang 0077, Xiaojun Wan 0001. 22397-22413 [doi]
- EpiCaR: Knowing What You Don't Know Matters for Better Reasoning in LLMsJe Won Yeom, Jaewon Sok, SeongHyeon Park, JeongJae Park, Taesup Kim. 22414-22443 [doi]
- MoEC: A Memory-Routed Mixture-of-Experts Controller for Adaptive Minecraft ControlHui Wu, Chao Xu, Jianghui Wang, Ziqiong Liu, Dong Li 0025, Yiwei Dai, Emad Barsoum. 22444-22459 [doi]
- MECH: A Cost-Effective Multi-Task Cascade Framework for Classroom Opinion Evolution RecognitionYancui Li, Xiaoyu Zhou, Guoyi Miao, Fang Kong 0001. 22460-22473 [doi]
- Debiasing Reward Models via Causally Motivated Inference-Time InterventionKazutoshi Shinoda, Kosuke Nishida, Kyosuke Nishida. 22474-22489 [doi]
- Steganography Beyond Pixels: Reimagining Image Steganography as Cross-Modal Linguistic CommunicationLijing Ren, Denghui Zhang 0001. 22490-22501 [doi]
- Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier MathShrey Pandit, Austin Xu, Xuan-Phi Nguyen, Yifei Ming, Caiming Xiong, Shafiq Joty. 22502-22517 [doi]
- Agent-based Substructure Counting under Local Differential PrivacyYuting Zhang, Kai Wang 0037, Wei Ni 0001, Ying Zhang 0001, Wenjie Zhang 0001. 22518-22533 [doi]
- NeuReasoner: Towards Explainable, Controllable, and Unified Reasoning via Mixture-of-NeuronsHaonan Dong, Kehan Jiang, Haoran Ye, Wenhao Zhu, Zhaolu Kang, Guojie Song. 22534-22558 [doi]
- Red Teaming Large Reasoning ModelsJiawei Chen, Yang Yang, Chao Yu, Yu Tian, Zhi Cao, Xue Yang, Linghao Li, Hang Su 0006, Zhaoxia Yin. 22559-22591 [doi]
- InsLogicBench: An Argumentation Logic Grounded Benchmark for Complex Insurance Claims AdjudicationJin Liu, Yunpeng Liu, Keyi Wang, Jie Shi 0010, Xiao Xu, Wenkang Huang, Xingzhong Xu, Xin Liang, Yanghua Xiao. 22592-22619 [doi]
- LinkQA: Synthesizing Diverse QA from Multiple Seeds Strongly Linked by Knowledge PointsXuemiao Zhang, Can Ren, Chengying Tu, Rongxiang Weng, Hongfei Yan, Jingang Wang, Xunliang Cai. 22620-22651 [doi]
- Comparative Analysis of the Intrinsic Metrics for Tokenizers and their effect on Downstream Tasks for Hindi and MarathiShagun Dwivedi, Kaushik Gopalan. 22652-22663 [doi]
- Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text RetrievalHaejun Yoo, Yongseop Shin, Insung Lee, Myoung-Wan Koo, Du-Seong Chang. 22664-22680 [doi]
- SPIO: Ensemble and Selective Strategies via LLM-Based Multi-Agent Planning in Automated Data ScienceWonduk Seo, Juhyeon Lee, Yanjun Shao, Qingshan Zhou, Seunghyun Lee, Yi Bu 0001. 22681-22703 [doi]
- Comparing human and language models sentence processing difficulties on complex structuresSamuel Joseph Amouyal, Aya Meltzer-Asscher, Jonathan Berant. 22704-22722 [doi]
- Phun-Bench: Evaluating LLMs on Phonological Understanding in ChineseXing Yue, Yongliang Shen 0001, Weiming Lu 0001. 22723-22768 [doi]
- Causal2Vec: Improving Decoder-only LLMs as Embedding Models through a Contextual TokenAiliang Lin, Zhuoyun Li, Yusong Wang 0003, Kotaro Funakoshi, Manabu Okumura. 22769-22788 [doi]
- Enhancing Multimodal Large Language Models for Ancient Chinese Character Evolution Analysis via Glyph-Driven Fine-TuningRui Song 0008, Lida Shi, Ruihua Qi, Yingji Li, Hao Xu 0012. 22789-22804 [doi]
- See2Refine: Vision-Language Feedback Improves LLM-Based eHMI Action DesignersDing Xia, Xinyue Gui, Mark Colley, Fan Gao, Zhongyi Zhou, Dongyuan Li, Renhe Jiang, Takeo Igarashi. 22805-22822 [doi]
- A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and SolutionsZhiyin Yu, Yuchen Mou, Juncheng Yan, Junyu Luo 0002, Chunchun Chen, Xing Wei, Yunhui Liu 0002, Hongru Sun, Yuxing Zhang, Jun Xu, Yatao Bian, Ming Zhang 0004, Wei Ye, Tieke He, Jie Yang, Guanjie Zheng, Zhonghai Wu, Bo Zhang 0069, Lei Bai 0020, Xiao Luo 0001. 22823-22846 [doi]
- SADA: Bridging In-Context Learning and Fine-Tuning via State-Aligned Distillation AdaptersWenhao Gao, Tianlong Wang, Wei Jia, Linhao Zhang, Aiwei Liu, Miao Fan, Xiao Zhou 0004. 22847-22862 [doi]
- Anti-Length Shift: Dynamic Outlier Truncation for Training Efficient Reasoning ModelsWei Wu 0045, Liyi Chen 0001, Congxi Xiao, Tianfu Wang 0002, Qimeng Wang, Chengqiang Lu, Yan Gao 0017, Yi Wu, Yao Hu 0002, Hui Xiong 0001. 22863-22891 [doi]
- The Proxy Presumption: From Semantic Embeddings to Valid Social MeasuresBaishi Li, Ta Yu, Kelvin J. L. Koa, Ke-wei Huang. 22892-22910 [doi]
- Nested Browser-Use Learning for Agentic Information SeekingBaixuan Li, Jialong Wu 0007, Wenbiao Yin, Kuan Li, Zhongwang Zhang, Huifeng Yin, Zhengwei Tao, Liwen Zhang, Pengjun Xie, Jingren Zhou 0001, Yong Jiang 0005, Wentao Zhang 0001, Zhiqiang Gao. 22911-22923 [doi]
- CamoQuery: Language-Guided Reasoning Camouflaged Object SegmentationTianxin Han, Qing Dong 0004, Xingwei Wang 0001, Jie Jia 0001, Gang Wu 0007, Bowen Yang, Fu Zhang 0001. 22924-22941 [doi]
- Large Language Models Are Bad Dice Players: LLMs Struggle to Generate Random Numbers from Statistical DistributionsMinda Zhao, Yilun Du, Mengyu Wang. 22942-22959 [doi]
- PROMPRINT: Prompt Fingerprinting via First-Token Response for LLM App Cloning DetectionJungmin Lee, Peizhuo Lv, Yeonjoon Lee. 22960-22972 [doi]
- MAB-DQA: Addressing Query Aspect Importance in Document Question Answering with Multi-Armed BanditsYixin Xiang, Yunshan Ma 0002, Xiaoyu Du 0002, Yibing Chen, Yanxin Zhang, Jinhui Tang 0001. 22973-22992 [doi]
- DVCQR: Dual-View Conversational Query Rewriting with Stage-wise Reinforcement LearningChenyi Li, Xinhui Tu, Zaixiang Wang. 22993-23014 [doi]
- CoEvolve: Training LLM Agents via Agent-Data Mutual EvolutionShidong Yang, Ziyu Ma, Tongwen Huang, Yiming Hu, Yong Wang, Xiangxiang Chu. 23015-23036 [doi]
- Make LLMs See Like Investigators, Not Just Think More: The Role of Structured Analysis in Investigative ReasoningJaewook Lee, Myeong Cheol Kang, Jong-Hun Shin. 23037-23058 [doi]
- FormalScience: Scalable Human-in-the-Loop Autoformalisation of Science with Agentic Code Generation in LeanJordan Meadows, Lan Zhang, André Freitas. 23059-23077 [doi]
- MUR: Momentum Uncertainty guided Reasoning for Large Language ModelsHang Yan 0010, Fangzhi Xu, Rongman Xu, Yifei Li 0006, Jian Zhang 0087, Haoran Luo 0001, Xiaobao Wu, Anh Tuan Luu, Haiteng Zhao, Qika Lin, Jun Liu 0002. 23078-23103 [doi]
- BiMol-Diff: A Unified Diffusion Framework for Molecular Generation and CaptioningAditya Hemant Shahane, Anuj Kumar Sirohi, Devansh Arora, Nitin Kumar, Prathosh AP, Sandeep Kumar 0005. 23104-23117 [doi]
- PEAP: Proactive Embodied Action Sequence Planning with Joint Understanding of Vision and Audio PerceptionTianwei Lan, JiaQi Wu, Zeming Liu, Zhaoxin Fan, Haifeng Wang 0001, Yuhang Guo 0001. 23118-23138 [doi]
- Automated Creativity Evaluation of Language Models Across Open-Ended TasksTan Min Sen, Zachary Choy Kit Chun, Syed Ali Redha Alsagoff, Nadya Yuki Wangsajaya, Mohor Banerjee, Swaagat Bikash Saikia, Alvin Chan Guo Chan. 23139-23173 [doi]
- Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward ModelingJiaxuan Wang, Yulan Hu, Wenjin Yang, Zheng Pan, Xin Li, Lan-Zhe Guo. 23174-23200 [doi]
- From Synthesis to Clinical Assistance: A Strategy-Aware Agent Framework for Autism Intervention based on Real Clinical DatasetJunhong Lai, Shuzhong Lai, Yanhao Yu, Wanlin Chen, Chenyu Yan, Haifeng Li, Lin Yao, Yueming Wang. 23201-23241 [doi]
- How Training Data Shapes the Use of Parametric and In-Context Knowledge in Language ModelsMinSung Kim, Dong-Kyum Kim, Jea Kwon, Nakyeong Yang, Kyomin Jung, Meeyoung Cha. 23242-23257 [doi]
- PAR: Training-Free Positional Perturbation and Attention Recycling for Faithful OCRYao Yao, Manwen Liao, Weitian Zhang, Zuchao Li, Hai Zhao 0001. 23258-23273 [doi]
- BTC-LLM: Efficient Sub-1-Bit LLM Quantization via Learnable Transformation and Binary CodebookHao Gu, Lujun Li 0001, Hao Wang 0097, Lei Wang, Zheyu Wang, Bei Liu, Jiacheng Liu 0001, Qiyuan Zhu, Sirui Han, Yike Guo. 23274-23294 [doi]
- Learning What to Ignore: Mitigating Negative Transfer in Medical Knowledge Fusion via Clinical Task-Adaptive SelectionXinyan Deng, Shoubin Dong, Xiaorou Zheng. 23295-23309 [doi]
- MMTutorBench: The First Multimodal Benchmark for AI Math TutoringTengchao Yang, Sichen Guo, Mengzhao Jia, Jiaming Su 0008, Yuanyang Liu, Zhihan Zhang, Meng Jiang. 23310-23332 [doi]
- GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language ModelsZhaohan Zhang, Ziquan Liu, Ioannis Patras. 23333-23350 [doi]
- AutoGraph-R1: End-to-End Reinforcement Learning for Knowledge Graph ConstructionHong Ting Tsang, Jiaxin Bai, Haoyu Huang, Qiao Xiao, Tianshi Zheng, Baixuan Xu, Shujie Liu 0001, Yangqiu Song. 23351-23374 [doi]
- Understanding Structured Financial Data with LLMs: A Case Study on Fraud DetectionXuwei Tan, Yao Ma, Xueru Zhang. 23375-23390 [doi]
- Gap-K%: Measuring Top-1 Prediction Gap for Detecting Pretraining DataMinseo Kwak, Jaehyung Kim. 23391-23405 [doi]
- Experience Retrieval-Augmentation with Electronic Health Records Enables Accurate Discharge QAJustice Ou, Tinglin Huang 0001, Yilun Zhao 0001, Ziyang Yu, Peiqing Lu, Yifei Shen 0006, Rex Ying. 23406-23430 [doi]
- Are they lovers or friends? Evaluating LLMs' Social Reasoning in English and Korean DialoguesEunsu Kim, Junyeong Park, Juhyun Oh, Kiwoong Park, Seyoung Song 0001, A. Seza Dogruöz, Alice Oh, Najoung Kim. 23431-23451 [doi]
- SAIR-Comb : A Structure-Aware Iterative Refinement Framework for Combinatorics AutoformalizationWeijie Jiang, Gaolei He, Beibei Xiong, Jianlin Wang, Zhengfeng Yang. 23452-23473 [doi]
- Stop Hardening Everything: A Training-Free Neuron-Level Defense for Neural Ranking ModelsYu-An Liu 0028, Ruqing Zhang 0001, Hongru Song 0001, Jiafeng Guo, Yixing Fan, Xueqi Cheng. 23474-23484 [doi]
- TED-TTS: Training-Free Intra-Utterance Emotion and Duration Control for Text-to-Speech SynthesisQifan Liang, Yuansen Liu, Ruixin Wei, Nan Lu, Junchuan Zhao, Ye Wang. 23485-23508 [doi]
- VIB-Probe: Detecting and Mitigating Hallucinations in Vision-Language Models via Variational Information BottleneckFeiran Zhang, Yixin Wu 0005, Zhenghua Wang, Xiaohua Wang, Changze Lv, Xuanjing Huang 0001, Xiaoqing Zheng. 23509-23521 [doi]
- Detoxification for LLM: From Dataset ItselfWei Shao, Yihang Wang, Gao yu Zhu, Ziqiang Cheng, Lei Yu 0012, Jiafeng Guo, Xueqi Cheng. 23522-23540 [doi]
- When Is Thinking Enough? Early Exit via Sufficiency Assessment for Efficient ReasoningYang Xiang 0003, Yixin Ji, Ruotao Xu, Dan Qiao, Zheming Yang, Juntao Li 0005, Min Zhang 0005. 23541-23556 [doi]
- Instant Personalized Large Language Model Adaptation via HypernetworkZhaoxuan Tan, Zixuan Zhang, Haoyang Wen, Zheng Li 0018, Rongzhi Zhang, Pei Chen, Fengran Mo, Zheyuan Liu 0010, Qingkai Zeng 0001, Qingyu Yin, Meng Jiang 0001. 23557-23580 [doi]
- From Off-Policy to On-Policy: Enhancing GUI Agents via Bi-level Expert-to-Policy AssimilationZezhou Wang, Ziyun Zhang, Xiaoyi Zhang, Zhuzhong Qian, Yan Lu. 23581-23623 [doi]
- Safeguarding LLM Fine-tuning via Push-Pull Distributional AlignmentHaozhong Wang, Zhuo Li, Yibo Yang, He Zhao 0001, Hongyuan Zha, Dandan Guo. 23624-23646 [doi]
- I²B-LPO: Latent Policy Optimization via Iterative Information BottleneckHuilin Deng, Hongchen Luo, Yue Zhu, Long Li, Zhuoyue Chen, Xinghao Zhao, Ming Li, Chuyang Zhao, Jihai Zhang, Mengchang Wang, Yang Cao 0010, Yu Kang 0001. 23647-23664 [doi]
- What Do Prosody and Text Convey? Characterizing How Meaningful Information is Distributed Across Multiple ChannelsAditya Yadavalli, Tiago Pimentel, Tamar I. Regev, Ethan Gotlieb Wilcox, Alex Warstadt. 23665-23679 [doi]
- Right at My Level: A Unified Multilingual Framework for Proficiency-Aware Text SimplificationJinhong Jeong, Junghun Park, Youngjae Yu. 23680-23706 [doi]
- See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMsYicheng Ji, Jun Zhang 0069, Jinpeng Chen 0001, Cong Wang, Lidan Shou, Gang Chen 0001, Huan Li 0003. 23707-23726 [doi]
- LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language ModelsJian Gao, Richeng Xuan, Zhaolu Kang, Dingshi Liao, Wenxin Huang, Zongmou Huang, Yangdi Xu, Bowen Qin, Zheqi He, Xi Yang, Changjin Li, Yonghua Lin. 23727-23743 [doi]
- Gradient-Guided Multi-Judge Prompt OptimizationChenzhuo Zhao, Xinda Wang 0006, Pu Zhao 0004, Yue Huang, Junting Lu, Ziqian Liu, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang 0001. 23744-23773 [doi]
- ASTRA: Adaptive Semantic Tree Reasoning Architecture for Complex Table Question AnsweringXiaoke Guo, Songze Li, Zhiqiang Liu, Zhaoyan Gong, Yuanxiang Liu, Huajun Chen, Wen Zhang 0015. 23774-23803 [doi]
- DEBAR: Mitigating Contextual Bias in Cross-Document Relation Extraction via Dual-Stream DecouplingZhixuan Yang, Fu Zhang 0001, Huangming Xu, Jingwei Cheng. 23804-23815 [doi]
- IF-RewardBench: Benchmarking Judge Models for Instruction-Following EvaluationBosi Wen, Yilin Niu, Cunxiang Wang, Xiaoying Ling, Ying Zhang, Pei Ke, Hongning Wang, Minlie Huang. 23816-23843 [doi]
- LegalChainReasoner: Grounding Criminal Judicial Opinion Generation via Structured Legal ChainsWeizhe Shi, Qiqi Wang 0005, Yihong Pan, Qian Liu 0012, Kaiqi Zhao 0001. 23844-23863 [doi]
- InsideOut: Measuring and Mitigating Insider-Outsider Bias in Interview Script GenerationYixin Wan, Xingrun Chen, Kai-Wei Chang 0001. 23864-23883 [doi]
- Beyond Meta-Reasoning: Metacognitive Consolidation for Self-Improving LLM ReasoningZiqing Zhuang, Linhai Zhang, Jiasheng Si, Deyu Zhou, Yulan He 0001. 23884-23913 [doi]
- Mnemis: Dual-Route Retrieval on Hierarchical Graphs for Long-Term LLM MemoryZihao Tang, Xin Yu, Ziyu Xiao, Zengxuan Wen, Zelin Li, Jiaxi Zhou, Hualei Wang, Haohua Wang, Haizhen Huang, Weiwei Deng, Feng Sun 0008, Qi Zhang 0066. 23914-23928 [doi]
- Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient ConcentrationYang Zhao 0023, Yangou Ouyang, Xiao Ding, Hepeng Wang, Bibo Cai, Kai Xiong 0002, Jinglong Gao, Zhouhao Sun, Li Du, Bing Qin 0001, Ting Liu 0001. 23929-23941 [doi]
- ADVICE: Answer-Dependent Verbalized Confidence EstimationKi Jung Seo, Sehun Lim 0002, Taeuk Kim. 23942-23962 [doi]
- Powering Verifiable Learning via Automated Evolutionary Data SynthesisHe Du, Bowen Li 0002, Aijun Yang, Siyang He, Qipeng Guo, Kai Chen 0026, Dacheng Tao. 23963-23980 [doi]
- SPARK: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic LearningJinyang Wu, Shuo Yang, Yuhao Shen, Shuai Zhang 0014, Zhengqi Wen, Jianhua Tao 0001. 23981-24004 [doi]
- Scaling Laws for Code: A More Data-Hungry RegimeXianzhen Luo, Wenzhen Zheng, Qingfu Zhu, Rongyi Zhang, Houyi Li, Siming Huang, Yuantao Fan, Wanxiang Che. 24005-24021 [doi]
- When TableQA Meets Noise: A Dual Denoising Framework for Complex Questions and Large-scale TablesShenghao Ye, Yu Guo, Dong Jin 0004, Yuxiang Wang, Yikai Shen, Yunpeng Hou, Shuangwu Chen, Jian Yang 0014, Xiaofeng Jiang. 24022-24045 [doi]
- VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-TrainingDingwei Zhu, Shihan Dou, Zhiheng Xi, Senjie Jin, Guoqiang Zhang, Jiazheng Zhang, Junjie Ye 0005, Mingxu Chai, Enyu Zhou, Ming Zhang 0030, Yuhui Wang, Caishuang Huang, Chenhao Huang, Yunke Zhang, Yuran Wang, Tao Gui, Qi Zhang 0001, Xipeng Qiu, Xuanjing Huang 0001. 24046-24067 [doi]
- Taming Actor-Observer Asymmetry in Agents via Dialectical AlignmentBobo Li 0001, Rui Wu, Zibo Ji, Meishan Zhang, Hao Fei 0001, Min Zhang 0005, Mong-Li Lee, Wynne Hsu. 24068-24084 [doi]
- Knowledge Beyond Language: Bridging the Gap in Multilingual Machine Unlearning EvaluationKyomin Hwang, Hyeonjin Kim, Sangyeon Cho, Nojun Kwak. 24085-24119 [doi]
- AT²PO: Agentic Turn-based Policy Optimization via Tree SearchZefang Zong, Dingwei Chen, Yang Li, Qi Yi, Bo Zhou, Chengming Li, B. O. Qian, Peng Chen, Jie Jiang. 24120-24143 [doi]
- SecureVibeBench: Benchmarking Secure Vibe Coding of AI Agents via Reconstructing Vulnerability-Introducing ScenariosJunKai Chen, Huihui Huang, Yunbo Lyu, Junwen An, Jieke Shi, Chengran Yang, Ting Zhang 0011, Haoye Tian, Yikun Li, Zhenhao Li 0002, Xin Zhou 0014, Xing Hu 0008, David Lo 0001. 24144-24168 [doi]
- Text-Guided Multi-Scale Frequency Representation AdaptationWeicai Yan, Xinhua Ma, Wang Lin, Tao Jin. 24169-24187 [doi]
- ADAPT: Benchmarking Commonsense Planning under Unspecified Affordance ConstraintsPei-An Chen, Yong-Ching Liang, Jia-Fong Yeh, Hung-Ting Su, Yi-Ting Chen, Min Sun, Winston H. Hsu. 24188-24206 [doi]
- GeoRA: Geometry-Aware Low-Rank Adaptation for RLVRJiaying Zhang, Lei Shi, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He. 24207-24221 [doi]
- KoCo: Conditioning Language Model Pre-training on Knowledge CoordinatesYudong Li 0001, Jiawei Cai, LinLin Shen. 24222-24235 [doi]
- Truth or Sophistry? LoFa: A Benchmark for LLM Robustness Against Logical FallaciesXudong Shen, Li Yuan, Ye Chen, Xin Wu 0003, Yi Cai 0001, Zhiyong Wu. 24236-24268 [doi]
- Merging Triggers, Breaking Backdoors: Defensive Poisoning for Instruction-Tuned Language ModelsSan Kim, Gary Lee. 24269-24287 [doi]
- SHAPE: Stage-aware Hierarchical Advantage via Potential Estimation for LLM ReasoningZhengyang Ai, Zikang Shan, Xiaodong Ai, Jingxian Tang, Hangkai Hu, Pinyan Lu. 24288-24305 [doi]
- Looking Beyond the One: Operationalizing and Eliciting Visual Ambiguity in VLLMsYuchong Chen, Bowei Zou, Yuhan Chen, Yifan Fan, Xinyu Li, Shujun Cao, Yu Hong 0001. 24306-24323 [doi]
- JanusMM: A Benchmark for Self-Deprecation Understanding in Real-World Multimodal ConversationsXinyi Xu, Bingguang Hao, Yongyi Xiong, Zimo Chen, Xinchen Liu, Hongxin Guo, Xuelong Wang, Silin Zhou, Shihan Dou. 24324-24343 [doi]
- Attention as Selector: Unlocking VLM Attention for Long Document Page RetrievalMinfeng Zhu 0001, Linxin Bao, Wei Chen 0001, Linchao Zhu. 24344-24365 [doi]
- LAMCL: A Length-aware Momentum Contrastive Learning Framework for Multiscale Machine-Revised Text DetectionBing Zhou, Zhe Huang, Shilei Tan, Kai Zhao 0004, Yongcheng Zhou. 24366-24380 [doi]
- Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language ModelsJiahuan Zhang, Shunwen Bai, Tianheng Wang, Kaiwen Guo, Zijia Song, Hanqing Wu, Guozheng Rao, Kai Han, Kaicheng Yu. 24381-24404 [doi]
- Safe-FedLLM: Delving into the Safety of Federated Large Language ModelsMingxiang Tao, Yu Tian, Wenxuan Tu, Yue Yang, Xue Yang, Xiangyan Tang. 24405-24420 [doi]
- TEMA: Anchor the Image, Follow the Text for Multi-Modification Composed Image RetrievalZixu Li 0001, Yupeng Hu 0003, Zhiheng Fu, Zhiwei Chen 0003, Yongqi Li 0001, Liqiang Nie. 24421-24442 [doi]
- ImCoref-CeS: An Improved Lightweight Pipeline for Coreference Resolution with LLM-based Checker-Splitter RefinementKangyang Luo, Yuzhuo Bai, Shuzheng Si, Cheng Gao, Zhitong Wang, Yingli Shen, Wenhao Li 0003, Zhu Liu 0005, Yufeng Han, Jiayi Wu, Cunliang Kong, Maosong Sun 0001. 24443-24471 [doi]
- When Efficiency Meets Safety: A Benchmark Security Analysis of KV Cache Compression in Large Language ModelsXiaoxiao Ma, Kuofeng Gao, Zeyi Lu, Wenxi Jiang, Hao Fang 0011, Hao Wu, Bin Chen 0011, Shu-Tao Xia. 24472-24485 [doi]
- WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation ModelsRui Wang 0015, Ce Zhang 0009, Jun-Yu Ma, Jianshu Zhang, Hongru Wang 0003, Yi Chen 0007, Boyang Xue, Tianqing Fang, Zhisong Zhang, Hongming Zhang 0009, Haitao Mi, Dong Yu 0001, Kam-Fai Wong. 24486-24517 [doi]
- SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving AgentsXinshun Feng, Xinhao Song, Lijun Li, Gongshen Liu, Jing Shao. 24518-24535 [doi]
- Good Arguments Against the People Pleasers: How Reasoning Mitigates (Yet Masks) LLM SycophancyZhaoxin Feng, Zheng Chen, Jianfei Ma, Yip Tin Po, Emmanuele Chersoni, Bo Li. 24536-24570 [doi]
- Can Persona-Prompted LLMs Emulate Subgroup Values? An Empirical Analysis of Generalisability and Fairness in Cultural AlignmentBryan Chen Zhengyu Tan, Zhengyuan Liu, Xiaoyuan Yi, Jing Yao 0003, Xing Xie 0001, Nancy F. Chen, Roy Ka-Wei Lee. 24571-24590 [doi]
- FoE: Forest of Errors Makes the First Solution the Best in Large Reasoning ModelsKehan Jiang, Haonan Dong, Zhaolu Kang, Zhengzhou Zhu, Guojie Song. 24591-24629 [doi]
- Lingua-Graph: A Unified Representation of Cross-Task Common Substructures for Analytic Language ProcessingMingming Sun 0001, Runze Jiang, Zhu Zhangchenxi, Minlong Peng, Yunfeng Cai. 24630-24646 [doi]
- Adaptive Spatial and Temporal Redundancy Optimization for Efficient Reasoning in Large Language ModelsTianle Chen, Pengyu Cheng, Qiyuan Zhu, Jiacheng Wang, Bei Liu, Hao Gu, Ruijie Shen, Xiaofeng Hou, Sirui Han, Jiacheng Liu. 24647-24662 [doi]
- AAPO: Enhancing the Reasoning Capabilities of LLMs with Advantage MarginJian-xiong, Jingbo Zhou 0003, Jingyong Ye, Qiang Huang, Dejing Dou. 24663-24680 [doi]
- Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical ReasoningZiheng Li, Liu Kang, Feng Xiao, Luxi Xing, Qingyi Si, Zhuoran Li, Weikang Gong, Deqing Yang, Yanghua Xiao, Hongcheng Guo. 24681-24693 [doi]
- Learning to Edit Knowledge via Instruction-based Chain-of-Thought PromptingJinhu Fu, Yan Bai, Longzhu He, Yihang Lou, Yanxiao Zhao, Li Sun 0008, Sen Su. 24694-24711 [doi]
- BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers?Fengqing Jiang, Yichen Feng, Yuetai Li, Luyao Niu, Basel Alomair, Radha Poovendran. 24712-24727 [doi]
- DFAMS: Dynamic-flow guided Federated Alignment based Multi-prototype SearchZhiBang Yang, Xinke Jiang, Rihong Qiu, Ruiqing Li, Yihang Zhang, Yue Fang, Yongxin Xu, Hongxin Ding, Xu Chu, Junfeng Zhao 0001, Yasha Wang. 24728-24752 [doi]
- PARIF: Pushing the Pareto Frontier of Instruction Following and Reasoning with Curriculum Reinforcement LearningRongchuan Mu, Zexin Wang, Qianyu Wang, Minghua Ma, Zekun Wang 0001, Ming Liu 0004, Bing Qin 0001. 24753-24783 [doi]
- GeoLaux: A Benchmark for Evaluating MLLMs' Geometry Performance on Long-Step Problems Requiring Auxiliary LinesYumeng Fu, Jiayin Zhu, Lingling Zhang 0001, Wenjun Wu, Bo Zhao, Shaoxuan Ma, Yushun Zhang, Jun Liu 0002. 24784-24809 [doi]
- Unlocking Multilingual Reasoning Capability of LLMs and LVLMs through Representation EngineeringQiming Li, Xiaocheng Feng, Yixuan Ma, Ruihan Chen 0001, Zihe Tong, Zekai Ye, Xiachong Feng, Libo Qin 0001, Haoyu Ren, Kun Chen, Yunfei Lu, Dandan Tu, Bing Qin 0001. 24810-24829 [doi]
- Into the Gray Zone: Domain Contexts Can Blur LLM Safety BoundariesKi Sen Hung, Xi Yang, Chang Liu 0089, Haoran Li 0003, Kejiang Chen, Changxuan Fan, Tsun On Kwok, Weiming Zhang 0001, Xiaomeng Li 0001, Yangqiu Song. 24830-24867 [doi]
- MED-COREASONER: Reducing Language Disparities in Medical Reasoning via Language-Informed Co-ReasoningFan Gao, Sherry T. Tong, Jiwoong Sohn, Jiahao Huang, Junfeng Jiang, Ding Xia, Piyalitt Ittichaiwong, Kanyakorn Veerakanjana, Hyunjae Kim, Qingyu Chen 0001, Edison Marrese-Taylor, Kazuma Kobayashi, Akiko Aizawa, Irene Li. 24868-24888 [doi]
- Psyche-R1: Towards Reliable Psychological LLMs through Unified Empathy, Expertise, and ReasoningChongyuan Dai, Jinpeng Hu, Hongchang Shi, Zhuo Li, Dan Guo 0001, Xun Yang 0001, Meng Wang 0001. 24889-24906 [doi]
- Mitigating Action-Relation Hallucinations in LVLMs via Relation-aware Visual EnhancementZhenxin Qin, Qiang Li, Qingzhuo Wang, Ruiyang Qin, Zhihua Wei 0001, Wen Shen 0002. 24907-24923 [doi]
- Agentic Oversight via Dialectic ReasoningLeonardo Ranaldi, Federico Ranaldi. 24924-24944 [doi]
- FOREVER: Forgetting Curve-Inspired Memory Replay for Language Model Continual LearningYujie Feng, Hao Wang, Jian Li, Xu Chu, Zhaolu Kang, Yiran Liu, Yasha Wang, Philip S. Yu, Xiao-Ming Wu 0003. 24945-24965 [doi]
- CharTide: Data-Centric Chart-to-Code Generation via Tri-Perspective Tuning and Inquiry-Driven EvolutionXiangxi Zheng, Kuang He, Jiayi Hu, Ping Yu, Rui Yan, Yuan Yao, Peng Hou, Anxiang Zeng, Alex Jinpeng Wang. 24966-24985 [doi]
- PRISP: Privacy-Safe Few-Shot Personalization via Lightweight AdaptationJunho Park, Dohoon Kim 0002, Taesup Moon. 24986-25003 [doi]
- IF-CRITIC: Towards a Fine-Grained LLM Critic for Instruction-Following EvaluationBosi Wen, Yilin Niu, Cunxiang Wang, Pei Ke, Xiaoying Ling, Ying Zhang, Aohan Zeng, Hongning Wang, Minlie Huang. 25004-25029 [doi]
- Know Your Place: Diagnosing Implicit Social Adaptation Failures in Chinese Large Language ModelsYu Tian, Jie Xing, Ziming Li, Jiang Li 0013, Zehua Duo, Tian Lan, Xu Liu, Guanglai Gao, Xiangdong Su. 25030-25062 [doi]
- Agent Newsroom: Efficient Chronological Report Generation via Dynamic Multi-Agent CollaborationZhenhua Wang, Chunlei Wang, Yue Geng, Bang Wang 0001. 25063-25084 [doi]
- Locomo-Plus: Beyond-Factual Cognitive Memory Evaluation Framework for LLM AgentsYifei Li 0006, Weidong Guo, Lingling Zhang 0005, Rongman Xu, Muye Huang, Hui Liu, Lijiao Xu, Yu Xu, Jun Liu 0002. 25085-25100 [doi]
- CUB: Benchmarking Context Utilisation Techniques for Language ModelsLovisa Hagström, Youna Kim, Haeun Yu, Sang-goo Lee, Richard Johansson, Hyunsoo Cho, Isabelle Augenstein. 25101-25133 [doi]
- VLN-NF: Feasibility-Aware Vision-and-Language Navigation with False-Premise InstructionsHung-Ting Su, Ting-Jun Wang, Jia-Fong Yeh, Min Sun, Winston H. Hsu. 25134-25150 [doi]
- NiuTrans.LMT: Toward Inclusive and Scalable Multilingual Machine Translation with LLMsYingfeng Luo, Ziqiang Xu, Yuxuan Ouyang, Murun Yang, Dingyang Lin, Kaiyan Chang 0001, Tong Zheng, Bei Li, Peinan Feng, Quan Du, Tong Xiao 0001, Jingbo Zhu. 25151-25179 [doi]
- ChipSeek: Optimizing Verilog Generation via EDA-Integrated Reinforcement LearningZhirong Chen, Kaiyan Chang, Zhuolin Li, Cangyuan Li, Xinyang He, Chujie Chen, Mengdi Wang 0004, Haobo Xu, Yinhe Han 0001, Huawei Li 0001, Ying Wang 0001. 25180-25201 [doi]
- MERIT Feedback Elicits Better Bargaining in LLM NegotiatorsJihwan Oh, Murad Aghazada, Yooju Shin, Se-Young Yun, Taehyeon Kim 0001. 25202-25223 [doi]
- Collision to Cognition: Hash-Driven Graph Construction for Efficient RAGChuang Zhou 0002, Zheng Yuan 0013, Linhao Luo, Zhaozhuo Xu, Yilin Xiao 0002, Junnan Dong, Siyu An, Di Yin, Xing Sun 0001, Xiao Huang 0001. 25224-25240 [doi]
- WebSynthesis: World Model-Guided Monte Carlo Tree Search for Efficient WebAgent Trajectory SynthesisYifei Gao, Junhong Ye, Yifan Yang, Jiaqi Wang 0003, Yi Zhang 0101, Ruichen Zhang, Jitao Sang 0001. 25241-25258 [doi]
- EyeMulator: Improving Code Language Models by Mimicking Human Visual AttentionYifan Zhang 0013, Chen Huang 0006, Yueke Zhang, Jiahao Zhang, Toby Jia-Jun Li, Collin McMillan, Kevin Leach, Yu Huang 0015. 25259-25272 [doi]
- TPA: Next Token Probability Attribution for Detecting Hallucinations in RAGPengqian Lu, Jie Lu 0001, Anjin Liu, Guangquan Zhang 0001. 25273-25292 [doi]
- GMFL: Efficient Global Masking for Federated LLM Fine-tuningXin Huang, Yan Hu, Yue-jiao Gong, Xinglin Zhang 0001. 25293-25312 [doi]
- AgentGL: Towards Agentic Graph Learning with LLMs via Reinforcement LearningYuanfu Sun, Kang Li, Dongzhe Fan, Jiajin Liu, Qiaoyu Tan. 25313-25335 [doi]
- MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-JudgeSua Lee, Sanghee Park, Jinbae Im. 25336-25373 [doi]
- CSPO: Alleviating Reward Ambiguity for Structured Table-to-LaTeX GenerationYunfan Yang, Cuiling Lan, Jitao Sang, Yan Lu 0001. 25374-25391 [doi]
- Chart-MRAG: Benchmarking Multimodal Retrieval Augmented Generation on Chart-based DocumentsYuming Yang, Jiang Zhong, Li Jin, Xiao Sun, Jingwang Huang, Jinpeng Gao, Qing Liu, Yang Bai, Jingyuan Zhang, Rui Jiang, Qin Lei, Kaiwen Wei. 25392-25445 [doi]
- Towards Stable and Effective Reinforcement Learning for Mixture-of-ExpertsDi Zhang, Xun Wu, Shaohan Huang, Lingjie Jiang, Yaru Hao, Li Dong 0004, Zewen Chi, Zhifang Sui, Furu Wei. 25446-25457 [doi]
- AIRCoder: Adaptive Integration of Multi-dimensional Retrieval for Repository-level Code CompletionChuanqi Shi, Miao Gao, Zhiqiang Gao. 25458-25470 [doi]
- ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web CodingYuhang Li, Chenchen Zhang, Ruilin Lv, Ao Liu, Ken Deng, Yuanxing Zhang, Jiaheng Liu, Bo Zhou. 25471-25485 [doi]
- SafetyMem: Adaptive Jailbreak Defense via Dual-Component Safety MemoryHao Wang, Ziyi Ni, Huacan Wang, Pin Lyu, Lei Sha. 25486-25509 [doi]
- Enhancing Agentic Textual Graph Retrieval with Synthetic Stepwise SupervisionGe Chang 0002, Jinbo Su, Jiacheng Liu, Pengfei Yang, Yuhao Shang, Huiwen Zheng, Hongli Ma, Yan Liang, Yuanchun Li 0003, Yunxin Liu 0001. 25510-25525 [doi]
- Cognitive Scaffold: From Fluid Context to Crystallized Memory for Long-Horizon DeepResearch AgentsQiuyuan Ai, Zenghuang Fu, Zhaoyang Li, Ping Jiang, Haoyu Wu, Jie Song 0002, Guannan He. 25526-25542 [doi]
- Revisiting Metric Reliability for Fine-grained Evaluation of Machine Translation and Summarization in Indian LanguagesAmir Hossein Yari, Kalmit Kulkarni, Ahmad Raza Khan, Fajri Koto. 25543-25561 [doi]
- Learning to Think on Hypergraph: HyperCoT for Structure-Guided N-ary Knowledge Graph CompletionMengxue Yang 0001, Jinming Li, Chun Yang, Jiaqi Zhu, Jiafan Li, Guanhua Zhang, Ying Li. 25562-25579 [doi]
- Two Pathways to Truthfulness: On the Intrinsic Encoding of LLM HallucinationsWen Luo 0001, Guangyue Peng, Wei Li 0101, Shaohang Wei, Feifan Song 0001, Liang Wang 0046, Nan Yang 0002, Xingxing Zhang 0002, Jing Jin, Furu Wei, Houfeng Wang. 25580-25626 [doi]
- LLM-ForcedAligner: A Non-Autoregressive and Accurate LLM-Based Forced Aligner for Multilingual and Long-Form SpeechBingshen Mu, Xian Shi, Xiong Wang, Hexin Liu, Jin Xu 0010, Lei Xie 0001. 25627-25638 [doi]
- Forget What Matters, Keep the Rest: Selective Unlearning of Informative TokensSeunghee Koh, Sunghyun Baek, Youngdong Kim, Junmo Kim 0002. 25639-25655 [doi]
- Latent-Condensed Transformer for Efficient Long Context ModelingZeng You, Yaofo Chen, Qiuwu Chen, Ying Sun, Shuhai Zhang, Yingjian Li 0001, Yaowei Wang 0001, Mingkui Tan. 25656-25671 [doi]
- MedForge: Interpretable Medical Deepfake Detection via Forgery-aware ReasoningZhihui Chen, Kai He 0001, Qingyuan Lei, Bin Pu, Jian Zhang 0087, Yuling Xu, Mengling Feng. 25672-25692 [doi]
- CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious AttacksXu Zhang, Hao Li, Zhichao Lu. 25693-25707 [doi]
- Can Spectral-Clipping Enable Better Learning While Forgetting Less for Low-Rank Adaptation?Hyowon Wi, Noseong Park. 25708-25734 [doi]
- Re³: Relevance & Recency Retrieval for Mitigating Temporal HallucinationJiawei Cao, Jie Ouyang, Mingyue Cheng 0004, Zhaomeng Zhou, Chunli Liu 0001, Yupeng Li, Zirui Liu 0010, Shijin Wang 0001. 25735-25760 [doi]
- TeCES: Collaborative Geometric Knowledge Representation Framework under Evolving Fact SnapshotsJiujiang Guo, Zhengliang Guo, Kai Wang, Meiyang Wang, Dehua Peng, Shaozu Yuan, Chengyin Hu, Shuan Ai, Yiwei Wei. 25761-25780 [doi]
- MicroC-KT: Modeling Community Effect via Learning Micro-Environment for Evidence-Grounded Explainable Knowledge TracingZhiyi Duan, Zixing Shi, Bing Jia, Qi Wang 0078. 25781-25803 [doi]
- ImF: Embedding an Implicit Fingerprint in Your Large Language ModelsJiaxuan Wu, Wanli Peng, Hang Fu, Yiming Xue, Juan Wen. 25804-25825 [doi]
- Temp-R1: A Unified Autonomous Agent for Complex Temporal KGQA via Reverse Curriculum Reinforcement LearningZhaoyan Gong, Zhiqiang Liu, Songze Li, Xiaoke Guo, Yuanxiang Liu, Xinle Deng, Zhizhen Liu, Lei Liang, Huajun Chen, Wen Zhang. 25826-25845 [doi]
- S2G-RAG: Structured Sufficiency and Gap Judging for Iterative Retrieval-Augmented QAMinghan Li 0003, Junjie Zou, Xinxuan Lv, Chao Zhang, Guodong Zhou 0001. 25846-25862 [doi]
- Jailbreaking Multimodal Large Language Models using Multi-Clip VideoChoongwon Kang, Seungjong Sun, Hyunmin Jun, Jang-Hyun Kim 0001. 25863-25889 [doi]
- HAG: Hierarchical Demographic Tree-based Agent Generation for Topic-Adaptive SimulationRongxin Chen, Tianyu Wu, Bingbing Xu 0001, Jiatang Luo, Xiucheng Xu, Huawei Shen. 25890-25906 [doi]
- Stable-RAG: Mitigating Retrieval-Permutation-Induced Hallucinations in Retrieval-Augmented GenerationQianchi Zhang, Hainan Zhang 0001, Liang Pang 0001, Hongwei Zheng 0003, Zhiming Zheng 0001. 25907-25926 [doi]
- From Logical to Computational Sparsity: Structure-Aware Block-Sparse Attention for Long-Code CompletionYanli Wang 0001, Yanlin Wang 0001, Bowen Zhang, YiWei Zhang, Daya Guo, Jiachi Chen, Hongyu Zhang 0002, Zibin Zheng. 25927-25942 [doi]
- CogEvolve: A Multimodal Benchmark for Evaluating Relational Reasoning in Semantic ExtensionJingjie Zeng, Huayang Li, Liang Yang 0003, Yuanyuan Sun 0002, Shaowu Zhang 0002, Hongfei Lin. 25943-25960 [doi]
- Towards Privacy-Preserving Large Language Model: Text-free Inference Through Alignment and AdaptationJeongho Yoon, Chanhee Park, Yongchan Chun, Hyeonseok Moon, HeuiSeok Lim. 25961-25981 [doi]
- VisRet: Visualization Improves Knowledge-Intensive Text-to-Image RetrievalDi Wu 0054, Yixin Wan, Kai-Wei Chang 0001. 25982-26001 [doi]
- Selective Knowledge Distillation: Fusing LLM Semantic Strengths with DNN Efficiency for Binary Code Similarity DetectionShize Zhou, Peiyu Liu 0003, Lirong Fu, Tong Ye, Wenhai Wang. 26002-26014 [doi]
- Mixture-of-Experts with Intermediate CTC Supervision for Accented Speech RecognitionWonjun Lee, Hyounghun Kim, Gary Lee. 26015-26027 [doi]
- TransLLM: A Unified Multi-Task Large Language Model for Urban Transportation via Learnable PromptingJiaming Leng, Yunying Bi, Chuan Qin 0002, Zhenya Huang, Bing Yin, Haojie Ren, Yanyong Zhang, Chao Wang 0086. 26028-26042 [doi]
- CoreCodeBench: Decoupling Code Intelligence via Fine-Grained Repository-Level TasksLingyue Fu, Hao Guan 0001, Bolun Zhang, Haowei Yuan, Yaoming Zhu, Lin Qiu, Zongyu Wang, Xuezhi Cao, Xunliang Cai, Weiwen Liu, Weinan Zhang 0001, Yong Yu 0001. 26043-26067 [doi]
- Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM AgentsYanxu Mao, Peipei Liu, Tiehan Cui, Congying Liu, Mingzhe Xing, Datao You. 26068-26085 [doi]
- Attention Basin: Why Contextual Position Matters in Large Language ModelsZihao Yi, Zhenqing Ling, Delong Zeng, Haohao Luo, Zhe Xu 0009, Wei Liu 0302, Jian Luan 0001, Wanxia Cao, Ying Shen 0001. 26086-26106 [doi]
- RRAtention: Dynamic Block Sparse Attention via Per-Head Round-Robin Shifts for Long-Context InferenceSiran Liu, Guoxia Wang, Sa Wang, Jinle Zeng, Haoyang Xie, Siyu Lou, Jiabin Yang, Dianhai Yu, Haifeng Wang, Chao Yang. 26107-26124 [doi]
- Beyond Surface Features: Advancing Medical Vision-Language Alignment via Dynamic Evidence-Guided Preference OptimizationZixuan Huang, Zhihong Zhu, Xiaolong Liu, Yanchao Hao, Manman Zhang, Zheng Wei 0003, Bowen Xing, Xian Wu 0001, Ye Li 0002, Fen Miao, Yefeng Zheng 0001. 26125-26137 [doi]
- SAFE-QAQ: End-to-End Slow-Thinking Audio-Text Fraud Detection via Reinforcement LearningPeidong Wang, Zhiming Ma, Xin Dai, Yongkang Liu 0002, Shi Feng 0001, Xiaocui Yang, Wenxing Hu, ZhiHao Wang, Mingjun Pan, Li Yuan 0007, Daling Wang. 26138-26157 [doi]
- MaDS: Long-Horizon GUI Automation via Synergizing Dual-Layer Memory and Multi-Round DebatePengchen Chen, Shi Chen 0005, Qiming Ye, Xinli Chen, Xinran Li, Wei Xiang 0008. 26158-26180 [doi]
- CIRAG: Construction-Integration Retrieval and Adaptive Generation for Multi-hop Question AnsweringZili Wei, Yilin Wang, Xiaocui Yang, Shi Feng 0001, Weidong Bao 0005, Daling Wang, Zihan Wang, Yifei Zhang 0003. 26181-26197 [doi]
- TinyJudge: Unverifiable Constraint Alignment via Lightweight Specialist EnsemblesYirong Zeng, Yufei Liu, Xiao Ding, Yutai Hou, Yuxian Wang, Wu Ning, Haonan Song, Dandan Tu, Qixun Zhang, Yuxiang He, Bibo Cai, Ting Liu 0001. 26198-26212 [doi]
- Dynamic Infilling Anchors for Format-Constrained Generation in Diffusion Large Language ModelsBoyan Han, Yiwei Wang 0001, Yi Song, Yujun Cai, Chi Zhang 0007. 26213-26227 [doi]
- Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy BackdoorsRui Yin, Tianxu Han, Naen Xu, Changjiang Li, Ping He, Chunyi Zhou 0001, Jun Wang 0020, Zhihui Fu, Tianyu Du, Jinbao Li, Shouling Ji. 26228-26245 [doi]
- Inhibitory Attacks on Backdoor-based Fingerprinting for Large Language ModelsHang Fu, Wanli Peng, Yinghan Zhou, Jiaxuan Wu, Juan Wen, Yiming Xue. 26246-26266 [doi]
- TimeSAF: Towards LLM-Guided Semantic Asynchronous Fusion for Time Series ForecastingFan Zhang 0045, Shiming Fan, Hua Wang 0012. 26267-26284 [doi]
- Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMsWai Man Si, Mingjie Li 0007, Michael Backes 0001, Yang Zhang 0016. 26285-26302 [doi]
- EQUIP: EQUivariant preserving In-Place updates for Efficient Token PruningArun Ramachandran, R. Govindarajan, Murali Annavaram, Prakash Sathyanath Raghavendra. 26303-26323 [doi]
- Exons-Detect: Identifying and Amplifying Exonic Tokens via Hidden-State Discrepancy for Robust AI-Generated Text DetectionXiaowei Zhu, Yubing Ren, Fang Fang 0009, Shi Wang 0002, Yanan Cao 0001, Li Guo 0001. 26324-26336 [doi]
- Reasoning Fails Where Step Flow BreaksXiaoyu Xu, YuLan Pan, Xiaosong Yuan, Zhihong Shen, Minghao Su, Yuanhao Su, Xiaofeng Zhang 0006. 26337-26353 [doi]
- Cat-MoD: Accelerating Multimodal Alignment via Caption Token Guided Asymmetric Mixture-of-DepthsYijie Huang, Xiaocui Yang, Shi Feng 0001, Wen Zhang, Kaisong Song, Yifei Zhang 0003, Daling Wang. 26354-26376 [doi]
- Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-TrainingChanghao Jiang, Ming Zhang 0030, Yifei Cao, Junjie Ye 0005, Xiaoran Fan, Shihan Dou, Zhiheng Xi, Jiajun Sun, Yi Dong, Yujiong Shen, Jingqi Tong, Baoyu Fan, Tao Gui, Qi Zhang 0001, Xuanjing Huang 0001. 26377-26396 [doi]
- Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language ModelsYan Liu, Feng Zhang, Zhanyu Ma, Jun Xu 0001, Jiuchong Gao, Jinghua Hao, Renqing He, Han Liu, Yangdong Deng. 26397-26414 [doi]
- TriPlay-RL: Tri-Role Self-Play Reinforcement Learning for LLM Safety AlignmentZhewen Tan, Wenhan Yu, Jianfeng Si, Tongxin Liu, Kaiqi Guan, Huiyan Jin, Jiawen Tao, Xiaokun Yuan, Xiangzheng Zhang, Duohe Ma, Tong Yang 0003, Lin Sun 0010. 26415-26429 [doi]
- Cross-Modal Coreference Alignment: Enabling Reliable Information Transfer in Omni-LLMsHongcheng Liu, Yuhao Wang, Zhe Chen 0024, Pingjie Wang, Zhiyuan Zhu, Yixuan Hou, Yanfeng Wang 0001, Yu Wang 0027. 26430-26453 [doi]
- Inflated Excellence or True Performance? Rethinking Medical Diagnostic Benchmarks with Dynamic EvaluationXiangxu Zhang, Lei Li 0053, Yanyun Zhou, Xiao Zhou 0005, Yingying Zhang, Xian Wu 0001. 26454-26493 [doi]
- TrendFact: A Benchmark Towards Hotspot Perception in Automatic Fact-CheckingXiaocheng Zhang, Xi Wang, Yifei Lu, Jianing Wang, Zhuangzhuang Ye, Mengjiao Bao, Peng Yan, Xiaohong Su. 26494-26513 [doi]
- MPBoCo: Multimodal Prompt-based Boundary-enhanced Continual Framework for Joint Entity and Relation ExtractionGuanglu Sun, Xinyu Liu, Lili Liang, Yang Yu, Fei Lang, Suxia Zhu, Ming Liu. 26514-26524 [doi]
- ConfSpec: Efficient Step-Level Speculative Reasoning via Confidence-Gated VerificationSiran Liu, Zane Cao, Yongchao He. 26525-26538 [doi]
- Personalizing LLMs with Binary Feedback: A Preference-Calibrated Optimization FrameworkXilai Ma, Liye Zhao, Weijun Yao, Haibing Di, Wenya Wang, Jing Li. 26539-26555 [doi]
- Localized Low-Rank Adaptation within Clustered Parameter SubspacesJiahao Xiong, Yihe Liu, Xianming Hu, Hongbo Zhao, Nuoyi Chen, Jie Zhang, Kai Zhang. 26556-26572 [doi]
- SGVEF-LOOP: Coverage-Guided Progressive Topological Exploration and Fact-Grounded Metamorphic Evaluation for MCP AgentsZenghao Liu, Yansong Zhang. 26573-26599 [doi]
- MentalSeek-Dx: Towards Progressive Hypothetico-Deductive Reasoning for Real-world Psychiatric DiagnosisXiao Sun, Yuming Yang, Xinyi Jiang, Yu Tian, Junnan Zhu, Jiang Zhong, Qin Lei, Jingwang Huang, Haoyang Zeng, Xinyu Zhou, Xin Xiao, Kaiwen Wei. 26600-26636 [doi]
- Think Parallax: Solving Multi-Hop Problems via Multi-View Knowledge-Graph-Based Retrieval-Augmented GenerationJinliang Liu, Jiale Bai, Shaoning Zeng. 26637-26655 [doi]
- AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language ReasoningXiping Li, Jianghong Ma. 26656-26681 [doi]
- Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language ModelsShaonan Liu, Guo Yu, Xiaoling Luo 0001, Shiyi Zheng, Jie Liu 0044, Wenting Chen, LinLin Shen. 26682-26697 [doi]
- Data Pollination: An Emergent Ecological Process Driving AI Population EvolutionShufang Xie 0003, Qizhi Pei, Ang Lv, Jingyang Hu, Lijun Wu 0003, Rui Yan 0001. 26698-26721 [doi]
- Extending First-Order Logic for Factual Reasoning over Knowledge GraphsYuanzhen Hao, Desheng Wu. 26722-26738 [doi]
- Diffuse Thinking: Exploring Diffusion Language Models as Efficient Thought Proposers for ReasoningChenyang Shao, Sijian Ren, Fengli Xu, Yong Li 0008. 26739-26757 [doi]
- Does Memory Need Graphs? A Unified Framework and Empirical Analysis for Long-Term Dialog MemorySen Hu 0005, Yuxiang Wei, Jiaxin Ran, Xueran Han, Zhiyuan Yao, Huacan Wang, Ronghao Chen, Lei Zou 0001. 26758-26782 [doi]
- False Friends in the Shell: Unveiling the Emoticon Semantic Confusion in Large Language ModelsWeipeng Jiang, Xiaoyu Zhang 0013, Juan Zhai, ShiQing Ma, Chao Shen 0001, Yang Liu 0003. 26783-26803 [doi]
- DocLens: A Tool-Augmented Multi-Agent Framework for Long Visual Document UnderstandingDawei Zhu, Rui Meng, Jiefeng Chen 0001, Sujian Li, Tomas Pfister, Jinsung Yoon. 26804-26829 [doi]
- Stability Implies Redundancy: Delta Attention Selective Halting for Efficient Long-Context PrefillingYujie Chen, Tailai Chen, Yifeng Gao, Zoe Wanying He, Yijue Xu, Shaobo Wang, Linfeng Zhang. 26830-26848 [doi]
- Beyond Self-Report: Bridging the Intention-Behavior Gap in Critical Thinking Assessment via Interpretable Multi-Agent SystemZekun Li, Jifan Yu, Haoxuan Li 0003, Ye He, Daniel Zhang-li, Shangqing Tu, Joy Lim Jia Yin, Yikun Jiang, Jiaxin Yuan, Yu Zhang 0186. 26849-26871 [doi]
- LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness SignalsLihao Sun, Hang Dong 0004, Bo Qiao 0001, Qingwei Lin, Dongmei Zhang 0001, Saravan Rajmohan. 26872-26887 [doi]
- A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAMΔ Integration into Upcycled MoEHao Zhou 0012, Tianhao Li, Zhijun Wang, Shuaijie She, Linjuan Wu, Hao-Ran Wei, Baosong Yang, Jiajun Chen 0001, Shujian Huang. 26888-26904 [doi]
- The Evolution of Thought: Tracking LLM Overthinking via Reasoning Dynamics AnalysisZihao Wei, Liang Pang 0001, Jiahao Liu, Wenjie Shi, Jingcheng Deng, Shicheng Xu, Zenghao Duan, Jingang Wang, Fei Sun 0001, Huawei Shen, Xueqi Cheng. 26905-26920 [doi]
- CoCoNUTS: Concentrating on Content while Neglecting Uninformative Textual Styles for AI-Generated Peer Review DetectionYihan Chen, Jiawei Chen 0011, Guozhao Mo, Xuanang Chen, Ben He 0001, Xianpei Han, Le Sun 0001. 26921-26950 [doi]
- Can LLMs Estimate Cognitive Complexity of Reading Comprehension Items?Seonjeong Hwang, Hyounghun Kim, Gary Lee. 26951-26966 [doi]
- ReCoQA: A Benchmark for Tool-Augmented and Multi-Step Reasoning in Real Estate Question and AnsweringYindong Zhang, Wenmian Yang, Yiquan Zhang, Weijia Jia 0001. 26967-26987 [doi]
- Human or LLM as Standardized Patients? A Comparative Study in Medical EducationBingquan Zhang, Xiaoxiao Liu, YuChi Wang, Zhou Lei, Qianqian Xie, Benyou Wang. 26988-27012 [doi]
- Harmonizing the Past, Present, and Future: A Null-Space Constrained Region-Specific Method for Continual Learning in LLMsJinhui Chen, Shizhu He, Xingchang Yang, Huanxuan Liao, Yequan Wang, Xiangwen Liao, Wenhao Teng, Kang Liu 0001, Jun Zhao 0001. 27013-27033 [doi]
- Attention Weights as an Indicator: Analyzing and Improving Document Utilization in Retrieval-Augmented GenerationJing Jin, Yuhan Song, Wen Luo 0001, Houfeng Wang. 27034-27052 [doi]
- Inertia in Moral and Value Judgments of Large Language ModelsBruce W. Lee, Yeongheon Lee, Hyunsoo Cho. 27053-27075 [doi]
- LiveCultureBench: a Multi-Agent, Multi-Cultural Benchmark for Large Language Models in Dynamic Social SimulationsViet-Thanh Pham, Lizhen Qu, Thuy-Trang Vu, Gholamreza Haffari, Dinh Q. Phung. 27076-27105 [doi]
- Enabling Agents to Communicate Entirely in Latent SpaceZhuoyun Du, Runze Wang, Huiyu Bai, Zouying Cao, Xiaoyong Zhu, Yu Cheng, Bo Zheng, Wei Chen 0001, Haochao Ying. 27106-27129 [doi]
- DR-Arena: an Automated Evaluation Framework for Deep Research AgentsYiwen Gao 0001, Ruochen Zhao, Yang Deng 0002, Wenxuan Zhang 0001. 27130-27152 [doi]
- Question Tells You Where the Answer Is: Intention-aware Long-Context KV Cache CompressionLiang Zhao, Xiaocheng Feng, Weihong Zhong, Lei Huang 0021, Kun Zhu 0025, Baoxin Wang, Dayong Wu, Guoping Hu, Ting Liu 0001, Bing Qin 0001. 27153-27169 [doi]
- LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language ModelsChenglin Wang, Yucheng Zhou, Shuang Chen, Tao Wang, Kai Zhang. 27170-27183 [doi]
- PACE: Predictive Adaptive Context Extraction for Long-Horizon LLM AgentsLei Wei, Xiao Peng, Tt, Guannan Zhang, Chenhao Jiang, HongYu Li, Lanbo Lin, Yuanwu Xu, Jiayao Liu, Kesu Wang, Bin Wang. 27184-27199 [doi]
- PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated ReasoningJingcheng Hu, Yinmin Zhang, Shijie Shang, Xiaobo Yang, Yue Peng, Zhewei Huang, Hebin Zhou, Xin Wu, Jie Cheng, Fanqi Wan, Xiangwen Kong, Chengyuan Yao, Kaiwen Yan, Ailin Huang, Hongyu Zhou, Qi Han, Zheng Ge, Xiangyu Zhang 0005, Heung-Yeung Shum. 27200-27215 [doi]
- Draft, Verify, Restore: Self-Refining Historical Inscription Restoration with a Unified MLLMYuyi Zhang 0002, Junle Liu, Peirong Zhang 0001, Jianliang Liu, Zhenhua Yang, Lianwen Jin. 27216-27231 [doi]
- SAM3-I: Segment Anything with InstructionsJingjing Li, Yue Feng, Yuchen Guo, Jincai Huang 0003, Wei Ji 0011, Qi Bi, Yongri Piao, Miao Zhang 0004, Xiaoqi Zhao 0003, Qiang Chen 0007, Shihao Zou, Huchuan Lu, Li Cheng 0001. 27232-27249 [doi]
- Stop When Enough: Adaptive Early-Stopping for Chain-of-Thought ReasoningRenliang Sun, Wei Cheng 0002, Dawei Li 0008, Haifeng Chen, Wei Wang 0010. 27250-27268 [doi]
- Improving Long-Context Translation via Self-Supervised Dual LearningShanbo Cheng, Shuaijie She, Yu Bao, Jianbing Zhang, Jiajun Chen 0001, Shujian Huang. 27269-27280 [doi]
- CaRL-EM: Cost-Aware Reinforcement Learning for Entity Matching with LLMsChaohui Guo, Michel C. A. Klein, Zhisheng Huang. 27281-27293 [doi]
- Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language ModelsZirui Song, Qian Jiang, Mingxuan Cui, Mingzhe Li, Lang Gao, Zeyu Zhang, Zixiang Xu, Yanbo Wang, Guangxian Ouyang, Zhenhao Chen, Xiuying Chen. 27294-27308 [doi]
- When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue AgentsJiahe Guo, Xiangran Guo, Yulin Hu, Zimo Long, Xingyu Sui, Xuda Zhi, Yongbo Huang, Hao He, Weixiang Zhao, Yanyan Zhao, Bing Qin 0001. 27309-27335 [doi]
- AlphaContext: An Evolutionary Tree-based Psychometric Context Generator for Creativity AssessmentYixuan Wang, Yue Huang, Hong Qian, Yunzhao Wei, Yifei Ding, Wenkai Wang, Zhi Liu, Zhongjing Huang, Aimin Zhou, Jiajun Guo. 27336-27357 [doi]
- Demystifying Data Organization for Enhanced LLM TrainingYalun Dai, Yangyu Huang, Tongshen Yang, Yonghan Wang, Xin Zhang, Wenshan Wu, QiHao Zhao, Hao Li, Yuanyuan Gao, Kim-Hui Yap, Scarlett Li. 27358-27375 [doi]
- Beyond Single View: A Comprehensive Benchmark for Medical Multimodal Large Language Models on Multi-Image UnderstandingDexuan Xu, Jiayin Yuan, Jianing Wang, Yanyuan Chen, Hanpin Wang, Yu Huang 0004. 27376-27394 [doi]
- When Seeing Is not Enough: Revealing the Limits of Active Reasoning in MLLMsHongcheng Liu, Pingjie Wang, Yuhao Wang, Siqu Ou, Yanfeng Wang 0001, Yu Wang 0027. 27395-27422 [doi]
- CuMA: Aligning LLMs with Sparse Cultural Values via Demographic-Aware Mixture of AdaptersAo Sun, Xiaoyu Wang, Zhe Tan, Yu Li, Jiachen Zhu, Yuheng Jia, Shu Su. 27423-27441 [doi]
- Neo-Classic: A Benchmark for Evaluating Linguistic-Aesthetic Reasoning in Classical Chinese PoetryHan Zhang, Zihan Gu, Zhiyuan Wang, Tianyi Ma, Jiacheng Lu 0002, Xinyan Zhang, Yuhao Wei, Cheng Hua. 27442-27465 [doi]
- A Multi-Agent Framework for Feature-Constrained Difficulty Control in Reading Comprehension Item GenerationSeonjeong Hwang, Jun Seo, Hyounghun Kim, Gary Lee. 27466-27488 [doi]
- ToMMeR - Efficient Entity Mention Detection from Large Language ModelsVictor Morand, Nadi Tomeh, Josiane Mothe, Benjamin Piwowarski. 27489-27509 [doi]
- Shuttle Between Symbolic Instructions and Neural Parameters of Large Language ModelsWangtao Sun, Haotian Xu, Huanxuan Liao, Xuanqing Yu, Zhongtao Jiang, Shizhu He, Jun Zhao 0001, Kang Liu 0001. 27510-27524 [doi]
- Mitigating Spurious Correlations in Text Classification Using Latent Space GeometryJiasen Gao, Xiaoliang Chen 0003, Duoqian Miao 0001, Xu Gu 0001, Xianyong Li, Yajun Du. 27525-27539 [doi]
- Efficient Hyperparameter Optimization for LLM Reinforcement LearningMinping Chen, Bowen Xiao, Du Liang, Chuxuan Zeng, Zeyi Wen. 27540-27552 [doi]
- Hetero-Designer: Automated Design of Multi-Agent Systems with Heterogeneous LLMsZhiheng Zhang, Yuanzhe Zhang, Bohan Yu, Daojian Zeng, Kang Liu, Jun Zhao. 27553-27574 [doi]
- Achieving Multi-Hop Calculation and Safe Abstention in Financial Numerical Reasoning by Metric Graph Constrained LLMsAoyuan Jiang, Liang Hong, Haoxuan Liu, Rui Wang. 27575-27595 [doi]
- SOCIA-EVO: Automated Simulator Construction via Dual-Anchored Bi-Level OptimizationYuncheng Hua, Sion Weatherhead, Mehdi Jafari, Hao Xue 0001, Flora D. Salim. 27596-27634 [doi]
- SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal ModelsAafiya Shamshad Hussain, Gaurav Srivastava 0012, Alvi Md. Ishmam, Zaber Ibn Abdul Hakim, Chris Thomas 0004. 27635-27663 [doi]
- Trust Within? Seek Beyond? Knowledge Boundary Aware Policy Optimization for Agentic SearchTao Feng, Xinke Jiang, Xinyan Hu, Yonggang Zhang, Zhen Tao, Wentao Zhang, Boyang Liu, Wenhao Jiang, Chao Wu. 27664-27682 [doi]
- RPC-Bench: A Fine-grained Benchmark for Research Paper ComprehensionYelin Chen, Fanjin Zhang, Suping Sun, Yunhe Pang 0001, Yuanchun Wang 0002, Jian Song 0016, Xiaoyan Li, Lei Hou 0001, Shu Zhao 0005, Jie Tang 0001, Juanzi Li. 27683-27717 [doi]
- FusionFlow: Enabling Deep Structural Exploration for Automated Agentic Workflow GenerationXiang Wang, Zongtao Yang, Zhuojian Hong, Shuhao Zhang, Wei Wei. 27718-27760 [doi]
- CompTab: A Comprehensive Benchmark for Real-World TableQA with Complex Reasoning and Irregular TablesZhen Yang 0010, Wei Du, Jie Wang, Wenze Zhou, XiangFeng Meng, Zhengyang Wang, Suping Sun, Ziwei Du, Haodong Zou, Jie Chen 0025, Yongbin Liu, Shicheng Tan, Jiahao Ying, Shu Zhao 0005. 27761-27774 [doi]
- Learning More from Less: Exploiting Counterfactuals for Data-Efficient Chart UnderstandingJianzhu Bao, Haozhen Zhang, Kuicai Dong, Bozhi Wu, Sarthak Ketanbhai Modi, Zi Pong Lim, Yon Shin Teo, Wenya Wang 0001. 27775-27797 [doi]
- Video-MMMU: Evaluating Knowledge Acquisition from Multidisciplinary Professional VideosKairui Hu, Penghao Wu, Fanyi Pu, Wang Xiao, Xiang Yue, Bo Li 0080, Yuanhan Zhang, Ziwei Liu 0002. 27798-27828 [doi]
- Semantically Comprehensive Token Pruning in LVLMs via Maximizing Concept CoverageXueting Li, Qi Liu, Chenghao Xu, Xu Yang 0019, Guangtao Lyu, Jiahua Li, Cheng Deng 0002. 27829-27846 [doi]
- OptiCo: Adaptive Distributed Training Optimization via Collaborative Agent ReasoningSheng Chen, Tang Zhe, Weixing Zhang, Fei Yang 0007, Yuanyuan Wang, Tianlin Li, Yang Liu 0003. 27847-27867 [doi]
- MemBuilder: Reinforcing LLMs for Long-Term Memory Construction via Attributed Dense RewardsZhiyu Shen, Ziming Wu, Fuming Lai, Shaobing Lian, Yanghui Rao. 27868-27887 [doi]
- Towards Fine-grained Audio Captioning with Multimodal Contextual FusionShunian Chen, Xinyuan Xie, Zheshu Chen, Owen Lee, Liyan Zhao, Zhan Su 0002, Qilin Sun 0001, Benyou Wang. 27888-27913 [doi]
- Probing Semantic Alignment, Lexical Invariance, and Syntactic Influence in LLM Metaphor ProcessingFengying Ye, Shanshan Wang 0009, Lidia S. Chao, Derek F. Wong. 27914-27932 [doi]
- MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical ReasoningWeikang Shi, Aldrich Yu, Rongyao Fang, Houxing Ren, Ke Wang 0036, Aojun Zhou, Changyao Tian, Xinyu Fu 0004, Yuxuan Hu, Zimu Lu, Linjiang Huang, Si Liu 0001, Rui Liu 0019, Hongsheng Li 0001. 27933-27954 [doi]
- Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model AgentsZeping Li, Hongru Wang 0003, Yiwen Zhao, Guanhua Chen 0001, Yixia Li, Keyang Chen, Yixin Cao 0002, Guangnan Ye, Hongfeng Chai, Zhenfei Yin. 27955-27967 [doi]
- Collaboration of Fusion and Independence: Hypercomplex-driven Robust Multi-Modal Knowledge Graph CompletionZhiqiang Liu, Yichi Zhang, Mengshu Sun, Lei Liang, Wen Zhang. 27968-27983 [doi]
- LLM-MC-Affect: LLM-Based Monte Carlo Modeling of Affective Trajectories and Latent Ambiguity for Interpersonal Dynamic InsightYu-Zheng Lin, Bono Po-Jen Shih, John Paul Martin Encinas, Elizabeth Victoria Abraham Achom, Karan Himanshu Patel, Jesus Horacio Pacheco, Sicong Shao, Jyotikrishna Dass, Soheil Salehi, Pratik Satam. 27984-28000 [doi]
- Multilingual and Cross-Lingual Citation Needed Detection on Wikipedia for Lower-Resource LanguagesGerrit Quaremba, Amy Rechkemmer, Elizabeth Black, Denny Vrandecic, Elena Simperl. 28001-28021 [doi]
- Process Reward Models Meet Planning: Generating Precise and Scalable Datasets for Step-Level RewardsRaffaele Pisano, Roberto Navigli. 28022-28042 [doi]
- UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text InstructionsChunyu Qiang, Xiaopeng Wang, Kang Yin, Yuzhe Liang, Yuxin Guo, Teng Ma, Ziyu Zhang, Tianrui Wang, Cheng Gong, Yushen Chen, Ruibo Fu, Longbiao Wang, Jianwu Dang 0001. 28043-28054 [doi]
- AgentAsk: Multi-Agent Systems Need to AskBohan Lin, Kuo Yang 0002, Zelin Tan, Yingchuan Lai, Chen Zhang 0007, Guibin Zhang, Xinlei Yu, Miao Yu, Xu Wang 0029, Yu-Dong Zhang 0001, Yang Wang 0015. 28055-28077 [doi]
- HopWeaver: Cross-Document Synthesis of High-Quality and Authentic Multi-Hop QuestionsZhiyu Shen, Jiyuan Liu 0013, Yunhe Pang 0001, Yanghui Rao, Fu Lee Wang, Jianxing Yu. 28078-28109 [doi]
- REST: Stress Testing Large Reasoning Models by Asking Multiple Problems at OnceZhuoshi Pan, Qizhi Pei, Yu Li 0006, Zinan Tang 0001, Qiyao Sun, H. Vicky Zhao, Conghui He, Lijun Wu 0003. 28110-28140 [doi]
- You Can Have a Second Chance: Unbiased and Multi-bit Watermarking for Diffusion Language Models with Regret-based RemaskingKe Yang, Dongyang Liang, Jing Yu 0007, Shuguang Yuan 0003, Chi Chen 0001. 28141-28160 [doi]
- VCORE: Variance-Controlled Optimization-based Reweighting for Chain-of-Thought SupervisionXuan Gong, Senmiao Wang, Hanbo Huang, Ruoyu Sun 0001, Shiyu Liang. 28161-28180 [doi]
- MAGNET: Towards Adaptive GUI Agents with Memory-Driven Knowledge EvolutionLibo Sun, Jiwen Zhang, Siyuan Wang, Zhongyu Wei. 28181-28206 [doi]
- VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation AgentsXunyi Zhao, Gengze Zhou, Qi Wu 0001. 28207-28231 [doi]
- ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language ModelsChonghan Qin, Xiachong Feng, Weitao Ma, Xiaocheng Feng, Lingpeng Kong. 28232-28261 [doi]
- Semantic Hardness Is Not Visual Hardness: Sign-Aware Hard Negative Mining for Sign Language RetrievalJunmyeong Lee, Chan Hur, ChangSu Choi, Sukmin Cho, Fitsum Gaim, Eui Jun Hwang, Hoyun Song, Kyungtae Lim. 28262-28277 [doi]
- Difference in Task Performance on Sparse Speech RepresentationsWenjie Peng, Chen Chen, Thomas Hain. 28278-28291 [doi]
- VerilogLAVD: LLM-Aided Pattern Generation for Verilog CWE DetectionXiang Long, Yingjie Xia, Li Kuang, Yao Wan, Zihao Liu. 28292-28308 [doi]
- Temporal Sampling for Forgotten Reasoning in LLMsYuetai Li, Zhangchen Xu, Fengqing Jiang, Bhaskar Ramasubramanian, Luyao Niu, Bill Yuchen Lin, Xiang Yue, Radha Poovendran. 28309-28327 [doi]
- Conflict-Aware Memory for Embodied Agents: Enhancing Vector Data Quality via Detection RulesKexin Ma 0008, Haotian Wang 0001, Shenglin Chen, Yishuai Cai, Yu Huang, Ruochun Jin. 28328-28347 [doi]
- Benchmarking Deflection and Hallucination in Large Vision-Language ModelsNicholas Moratelli, Christopher Davis, Leonardo F. R. Ribeiro, Bill Byrne, Gonzalo Iglesias. 28348-28370 [doi]
- STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent TrainingQiuyi Qi, Tian Liang, Mutian Bao, Jinjian Zhang, Dongnan Liu, Wei Zhou, Linjian Mo, Ming Kong, Jie Liu, Feng Zhang, Qiang Zhu. 28371-28392 [doi]
- Read As Human: Compressing Context via Parallelizable Close Reading and SkimmingJiwei Tang, Shilei Liu, Zhicheng Zhang 0008, Qingsong Lv, Runsong Zhao, Tingwei Lu, Langming Liu, Haibin Chen, Yujin Yuan, Hai-Tao Zheng, Wenbo Su, Bo Zheng. 28393-28406 [doi]
- OASIS: Mitigating Harmful Fine-tuning Attacks on LLMs via Orthogonal and Adaptive Safety Alignment StrategyJiayu Tang, Guowei Peng, Qiuhao Xie, Yuning Yang, Xiurui Xie, Guisong Liu. 28407-28421 [doi]
- KoCo-Bench: Can Large Language Models Leverage Domain Knowledge in Software Development?Xue Jiang, Ge Li 0001, Jiaru Qian, Xianjie Shi, Chenjie Li, Hao Zhu, Ziyu Wang, Jielun Zhang, Zeyu Zhao, Kechi Zhang, Jia Li, Wenpin Jiao, Zhi Jin 0001, Yihong Dong. 28422-28441 [doi]
- Enhancing Two Steps Textual Anomaly Detection through Anisotropy MitigationPierre Fihey, Matthieu Labeau, Pavlo Mozharovskyi. 28442-28464 [doi]
- InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent TrainingZiyun Zhang, Zezhou Wang, Xiaoyi Zhang, Zongyu Guo, Jiahao Li 0001, Bin Li 0012, Yan Lu 0001. 28465-28492 [doi]
- MagicBench: Diagnosing Visual Agency Loss and Semantic Dependency in Multimodal LLMsTang Da Huang, Weidong Tang, Wen Qi Xu, Xianpeng Guo. 28493-28511 [doi]
- Bloom-Eval: A Hierarchical Evaluation Benchmark for Automatic Survey Generation Based on Bloom's TaxonomyFei Zhang, Zhe Zhao, Haibin Wen, Tianshuo Wei, Zaixi Zhang, Chao Yang, Ye Wei. 28512-28544 [doi]
- Cultivating Forensic Reasoning for Generalizable Multimodal Manipulation DetectionYuchen Zhang, Yaxiong Wang, Kecheng Han, Yujiao Wu, Lianwei Wu, Li Zhu 0003, Zhedong Zheng. 28545-28560 [doi]
- Fair-CCD: Mitigating Bias in Large Language Models for Tabular Classification Through Context-Contrastive DecodingDonghan Liu, Han Sun, Zhaohui Wang, Qin Li, Min Zhang 0002. 28561-28575 [doi]
- DVI-DTM: Dual-View Representation Learning for Interpretable Short Text Dynamic Topic ModelingDi Liu, Zheng Fang, Bin Wu. 28576-28593 [doi]
- GenesisFunc: Multi-Agent Data Generation for Accurate and Generalizable Function-CallingHao-Xiang Xu, Chong Deng, Jiaqing Liu, Wen Wang 0001, Qian Chen 0003, Lujia Bao, Xiangang Li, Zhen-Hua Ling. 28594-28616 [doi]
- Selective Test-Time Debiasing for CLIP via Reward GatingJaeho Han, Jisoo Yang, Hyeondong Woo, Mingyu Jeon, Sunjae Yoon, Junyeong Kim. 28617-28631 [doi]
- CURE: Critique-Driven Unified Reinforcement Learning for Test-Time Self-ImprovementGuirong Chen, Shuqi Ye, Wenkai Yang, Shiqi Shen, Guangyao Shen, Yankai Lin 0001. 28632-28653 [doi]
- LGSA: Label Geometry Structuring and Aligning for Hierarchical Text ClassificationShuai Zhang 0002, Weibo Xu, Jiahao Nie 0001, Kecheng Huang. 28654-28665 [doi]
- FactVerse: A Benchmark for Factual Consistency in Interleaved Image-Text GenerationYubo Shan, Kun Zhang 0041, Qiming Xu, Liping Cao, Yingying Cao, Jian Zhang, Yu Wang, Jingyuan Li 0002, Yuanzhuo Wang. 28666-28689 [doi]
- GMSA: Enhancing Context Compression via Group Merging and Layer Semantic AlignmentJiwei Tang, Zhicheng Zhang 0008, Shunlong Wu, Jingheng Ye, Lichen Bai, Zitai Wang, Tingwei Lu, Lin Hai, Yiming Zhao, Hai-Tao Zheng 0002, Hong-Gee Kim. 28690-28704 [doi]
- SpidR-Adapt: A Universal Speech Representation Model for Few-Shot AdaptationMahi Luthra, Jiayi Shen, Maxime Poli, Angelo Ortiz Tandazo, Yosuke Higuchi, Youssef Benchekroun, Martin Gleize, Charles-Éric Saint-James, Dongyan Lin, Phillip Rust, Angel Villar-Corrales, Surya Parimi, Vanessa Stark, Rashel Moritz, Juan Pino 0001, Yann LeCun, Emmanuel Dupoux. 28705-28728 [doi]
- EIFFEL: a novel benchmark to measure bias of English heavy training on French idiomatic expressionsCharlotte Noel, Nicholas Asher, Olivier Gouvert, Farah Benamara, Julie Hunter 0001. 28729-28747 [doi]
- Latent Attention Denoising: A Training-Free Energy-Based Framework for Mitigating Hallucinations in Vision-Language ModelsZhiwen Luo, Siyu Jiang, Weilong Jiang, Kun He 0001. 28748-28777 [doi]
- From Knowing to Teaching: Scaffolding Pedagogical Decisions for LLM AgentYucheng Wang 0015, Shen Yang, Jifan Yu, Haoxuan Li 0003, Joy Lim Jia Yin, Daniel Zhang-li, Huiqin Liu, Lei Hou 0001, Juanzi Li, Bin Xu 0001. 28778-28801 [doi]
- Learn Like Humans: Use Meta-cognitive Reflection for Efficient Self-ImprovementXinmeng Hou, Bohao Qu, Wuqi Wang, Peiliang Gong, Qing Guo 0005, Yang Liu. 28802-28824 [doi]
- Think Faster Than Words: Efficient LLM Chain-of-Thought Reasoning via Dynamic Shortcut DecodingFan Liu, Yanhao Wang, Min Zhang, Zhikang Chen, Zeyuan Li, Lewei He, Jiahui Pan 0003. 28825-28836 [doi]
- AEA: Adaptive Expert Allocation Improves Sentence Embeddings from Mixture-of-Experts LLMShufan Yang, Zifeng Cheng, Zhiwei Jiang 0001, Qingfeng Qi, Yafeng Yin 0002, Cong Wang 0034, Ao Zhou, Qing Gu 0001. 28837-28851 [doi]
- It's High Time: A Survey of Temporal Question AnsweringBhawna Piryani, Abdelrahman Abdallah, Jamshid Mozafari, Avishek Anand, Adam Jatowt. 28852-28881 [doi]
- SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language UnderstandingShuang Cheng, Yuhua Jiang, Zineng Zhou, Dawei Liu, Tao Wang, Linfeng Zhang 0001, Biqing Qi, Bowen Zhou 0002. 28882-28901 [doi]
- N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety EvaluatorZheyu Lin, Jirui Yang, Yukui Qiu, Yubing Bao, Hengqi Guo, Yao Guan. 28902-28923 [doi]
- Don't Act Blindly: Robust GUI Automation via Action-Effect Verification and Self-CorrectionYuzhe Zhang, Xianwei Xue, Xingyong Wu, MengKe Chen, Chen Liu, Xinran He, Run Shao, Feiran Liu, Huanmin Xu, Qiutong Pan, Haiwei Wang. 28924-28941 [doi]
- Beyond Static Persona Consistency: Dynamic Persona Coherence in LLM Role-PlayingYirui Qi, Xiaoming Zhang, Ruilin Zeng, Mengyao Liu, Ziyi Zhou 0003, Dezhuang Miao, Bingyu Yan, Zhenyu Guan. 28942-28956 [doi]
- What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test TimeDong Yan, Jian Liang 0001, Yanbo Wang 0004, Shuo Lu, Ran He 0001, Tieniu Tan. 28957-28970 [doi]
- Exploring and Distilling Multi-Dimensional Clues for Interpretable Social Bot DetectionYi Han, Haiqi Lu, Lizi Liao, Shuhan Zhou, Yuanxing Liu 0001, Weinan Zhang 0003, Ting Liu 0001. 28971-28992 [doi]
- Why Are We Moral? An LLM-based Agent Simulation Approach to the Study of Moral EvolutionZhou Ziheng, Huacong Tang, Mingjie Bi, Wanying He, Fang Sun, Yizhou Sun, Ying Nian Wu, Demetri Terzopoulos, Yipeng Kang, Fangwei Zhong. 28993-29046 [doi]
- Systematicity between Forms and Meanings across Languages Supports Efficient CommunicationDoreen Osmelak, Yang Xu, Michael Hahn 0001, Kate McCurdy. 29047-29083 [doi]
- On the (In-)Security of the Shuffling Defense in the Transformer Secure InferenceZhengyi Li 0002, Yakai Wang, Jingwen Leng, Kang Yang 0002, Yu Yu 0001, Jiaping Gui, Yu Feng 0007, Ning Liu 0007, Minyi Guo. 29084-29098 [doi]
- LaCo: Layer-wise Compensation for Pruned Large Language ModelsYingen Liu, Fan Wu, Xuyan Pan, Ruihui Li, Zhuo Tang, Kenli Li 0001. 29099-29113 [doi]
- QiMeng-PRepair: Precise Code Repair via Edit-Aware Reward OptimizationChangxin Ke, Rui Zhang 0040, Jiaming Guo, Yuanbo Wen 0001, Li Ding, Shuo Wang, Xuyuan Zhu, Xiong Peng, Di Huang, Zidong Du, Xing Hu 0001, Qi Guo 0001, Yunji Chen. 29114-29129 [doi]
- Location Not Found: Exposing Implicit Local and Global Biases in Multilingual LLMsGuy Mor-Lan, Omer Goldman, Matan Eyal, Adi Mayrav Gilady, Sivan Eiger, Idan Szpektor, Avinatan Hassidim, Yossi Matias, Reut Tsarfaty. 29130-29150 [doi]
- Incorporating Temporal Coherence to Cross-Document Event Coreference ResolutionXinyu Chen, Peifeng Li 0001, Qiaoming Zhu. 29151-29168 [doi]
- LLMs in Sarcasm Detection? It's elementary! (Or is it?)Priyanshu Mahato, Aniket Santosh Mishra, Kripabandhu Ghosh. 29169-29199 [doi]
- Beyond Itinerary Planning - A Real-World Benchmark for Multi-Turn and Tool-Using Travel TasksXiang Cheng, Yulan Hu, Xiangwen Zhang, Lu Xu, Lide Tan, Zheng Pan, Xin Li, Yong Liu. 29200-29251 [doi]
- TLoRA: Task-aware Low Rank Adaptation of Large Language ModelsWeicheng Lin, Yi Zhang 0109, Jiawei Dang, Liang-Jie Zhang. 29252-29269 [doi]
- MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent CooperationDawei Wang, Di Zhao, Xinyuan Liu, Marci Chi Ma, Xiaoyang Liu, Chengming Zhou, Gary Ushaw, Richard Davison 0001. 29270-29289 [doi]
- Persona-E²: A Human-Grounded Dataset for Personality-Shaped Emotional Responses to Textual EventsYuqin Yang, Haowu Zhou, Haoran Tu, Zhiwen Hui, Shiqi Yan, Haoyang Li, Dong She, Xianrong Yao, Yang Gao 0025, Zhanpeng Jin. 29290-29315 [doi]
- Interleaved Latent Visual Reasoning with Selective Perceptual ModelingShuai Dong, Siyuan Wang, Xingyu Liu, Chenglin Li, Haowen Hou, Zhongyu Wei. 29316-29335 [doi]
- Think before Go: Hierarchical Reasoning for Image-goal NavigationPengna Li, Kangyi Wu, Shaoqing Xu, Fang Li, Lin Zhao, Long Chen 0005, Zhi-Xin Yang, Nanning Zheng 0001. 29336-29357 [doi]
- LLMs as Knowledge Graph Refiners: Mitigating Factual Inconsistencies in Generative Knowledge ExtractionDonghyun Kim, Hyeongjun Yang, Seokju Hwang, Kyong-Ho Lee, Chanhee Lee. 29358-29378 [doi]
- SILO-BENCH: A Scalable Environment for Evaluating Distributed Coordination in Multi-Agent LLM SystemsYuzhe Zhang, Feiran Liu, Yi Shan, Xinyi Huang, Xin Yang, Yueqi Zhu, Xuxin Cheng, Cao Liu, Ke Zeng, Terry Jingchen Zhang, Wenyuan Jiang. 29379-29398 [doi]
- Mitigating Structural Knowledge Collapse in Domain-Specific LLMs via Morpheme-Aware KV-AggregationYuxuan Si, Zheqi Lv, Chengxi Zang, Zhengyu Chen 0001, Fei Wu 0001. 29399-29413 [doi]
- Zero-shot Jianzi Recognition as Structured Visual Information Extraction in Open Compositional Symbolic SystemsZehan Li, Fu Zhang 0001, Zhijun Liu, Jingwei Cheng. 29414-29429 [doi]
- Whose Facts Win? LLM Source Preferences under Knowledge ConflictsJakob Schuster, Vagrant Gautam, Katja Markert. 29430-29459 [doi]
- CLARity: Reasoning Consistency Alone Can Teach Reinforced ExpertsJiuheng Lin, Cong Jiang, Zirui Wu, Jiarui Sun, Yansong Feng 0002. 29460-29480 [doi]
- EGSS: Entropy-guided Stepwise Scaling for Reliable Software EngineeringChenhui Mao, Yuanting Lei, Zhixiang Wei, Ming Liang, Zhixiang Wang, Jingxuan Xu, Dajun Chen, Wei Jiang 0041, Yong Li 0004. 29481-29499 [doi]
- Detecting What Queries Seek: Steering LLM Safety with FFN Output Activation MonitoringXiaohao Luo, Ying Wei, Rui Zhao. 29500-29514 [doi]
- Temporal Evidence Chain for Temporal Knowledge Graph Question Answering with Large Language ModelsShihao Liu, Xiaofei Zhou, Bo Wang, Geyuan Zhang. 29515-29529 [doi]
- Modal Dependency Parsing as Structured Prediction over Source-Cue ScopeJayeol Chun, Nianwen Xue. 29530-29540 [doi]
- DEFT: Demystifying VLN Failures via a Unified Dual-View Explainability Framework for LLM-based AgentsYawen Wang, Yihan Dai, Jianming Chen, Junjie Wang 0001, Qing Wang 0001. 29541-29560 [doi]
- GLIER: Generative Legal Inference and Evidence Ranking for Legal Case RetrievalMinghan Li 0003, Tianrui Lv, Chao Zhang, Guodong Zhou 0001. 29561-29572 [doi]
- LLMs (Almost) Never Abstain Under Medical UncertaintyAlessio Cocchieri, Luca Ragazzi, Giuseppe Tagliavini, Gianluca Moro. 29573-29613 [doi]
- TOWER+: Bridging Generality and Translation Specialization in Multilingual LLMsRicardo Rei, Nuno Miguel Guerreiro, José Pombal, João Alves 0003, M. Amin Farajian, Pedro Teixeirinha, André F. T. Martins. 29614-29635 [doi]
- Culture-Aware Machine Translation in Large Language Models: Benchmarking and InvestigationZekun Yuan, Yangfan Ye, Xiaocheng Feng, Baohang Li, Qichen Hong, Yunfei Lu, Dandan Tu, Bing Qin 0001. 29636-29661 [doi]
- Learning from Near-Misses: Error-Aware Contrastive Few-Shot Learning for NL2FormulaZhihao Shuai, Yiyun Chen, Maolin Ma, Yutong Chen, Hanjia Qiu, Jing Xu, Ziye Chen, Weikai Yang. 29662-29676 [doi]
- Calibrated Speculative Decoding: Frequency-Guided Candidate Selection for Efficient InferenceXuwen Zhou, Fangxin Liu, Chao Wang, Xiao Zheng, Hao Zheng, Min He, Li Jiang, Haibing Guan. 29677-29688 [doi]
- Learning from Mistakes: Negative Reasoning Samples Enhance Out-of-Domain GeneralizationTian Xueyun, Minghua Ma, Bingbing Xu 0001, Nuoyan Lyu, Wei Li 0176, Heng Dong, Zheng Chu, Yuanzhuo Wang, Huawei Shen. 29689-29711 [doi]
- LongTutor: Benchmarking Large Language Models for Long-term Personalized TutoringNing Li, Zheng Zhang 0048, Zhenya Huang, Rui Li 0093, Yi Zhan, Yinbo Luo, Qi Liu 0003, Enhong Chen. 29712-29737 [doi]
- HiChunk: Evaluating and Enhancing Retrieval Augmented Generation with Hierarchical ChunkingWensheng Lu, Keyu Chen, Zhifeng Shen, Ruizhi Qiao, Xing Sun 0001. 29738-29753 [doi]
- How Good is Your Wikipedia? Auditing Data Quality for Low-resource and Multilingual NLPKushal Tatariya, Artur Kulmizev, Wessel Poelman, Esther Ploeger, Marcel Bollmann, Johannes Bjerva, Jiaming Luo, Heather C. Lent, Miryam de Lhoneux. 29754-29774 [doi]
- Understanding and Mitigating Political Stance Cross-topic Generalization in Large Language ModelsJiayi Zhang, Shu Yang 0010, Junchao Wu, Derek F. Wong, Di Wang 0015. 29775-29797 [doi]
- MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI AgentsRuihan Chen 0001, Qiming Li, Xiaocheng Feng, Weihong Zhong, Xiaoliang Yang, Yuxuan Gu 0004, Zekun Zhou, Yunfei Lu, Haoyu Ren, Kun Chen, Dandan Tu, Bing Qin 0001. 29798-29832 [doi]
- CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-EvolutionTeng Pan, Yuchen Yan, Zixuan Wang, Ruiqing Zhang, Guiyang Hou, Wenqi Zhang 0001, Weiming Lu 0001, Jun Xiao 0001, Yongliang Shen 0001. 29833-29853 [doi]
- From Weights to Activations: Is Steering the Next Frontier of Adaptation?Simon Ostermann 0002, Daniil Gurgurov, Tanja Baeumel, Michael A. Hedderich, Sebastian Lapuschkin, Wojciech Samek, Vera Schmitt. 29854-29879 [doi]
- Can LLMs Act as Historians? Evaluating Historical Research Capabilities of LLMs via the Chinese Imperial ExaminationLirong Gao, Zeqing Wang, Yuyan Cai, Jiayi Deng, Yanmei Gu, Yiming Zhang, Jia Zhou, Yanfei Zhang, Junbo Zhao 0001. 29880-29911 [doi]
- Less Languages, Less Tokens: An Efficient Unified Logic Cross-lingual Chain-of-Thought Reasoning FrameworkChenyuan Zhang, Qiguang Chen, Xie Chen 0001, Zhuotao Tian, Bowen Xing, Meishan Zhang, Libo Qin 0001, Baotian Hu, Min Zhang 0005. 29912-29929 [doi]
- Embracing Anisotropy: Turning Massive Activations into Interpretable Control Knobs for Large Language ModelsYoungji Roh, Hyunjin Cho, Jaehyung Kim. 29930-29956 [doi]
- From Language to Driving: A Dual-Loop SLM-Enhanced Framework for Multi-Planner Scheduling via a Domain-Specific LanguageJiawei Liu, Xun Gong 0007, Muli Yang, Xingrui Yu, Fen Fang, XuLei Yang, Ivor W. Tsang, Yunfeng Hu 0003, Hong Chen 0003, Qing Guo 0005. 29957-29973 [doi]
- One Cognitive Loop Is Enough: SODA unlocks Pure-Text Spatial Reasoning in Large Language ModelsShunwen Bai, Jiahuan Zhang, Haoran Huang, Yurun Wang, Jiale Liu, Yanxi Wu, Ningzhe Yu, Yudong Gao, Mingjun Cheng. 29974-29996 [doi]
- Compatibility-Aware Dynamic Fine-Tuning for Large Language ModelsYucheng Zhou 0001, Junwei Sheng, Qianning Wang, Jianbing Shen. 29997-30008 [doi]
- Spectral Characterization and Mitigation of Sequential Knowledge Editing CollapseChi Zhang 0102, Mengqi Zhang 0002, Xiaotian Ye, Runxi Cheng, Zisheng Zhou, Ying Zhou, Pengjie Ren, Zhumin Chen. 30009-30032 [doi]
- SSA: Improving Performance With a Better Scoring FunctionOmar Naim, Swarnadeep Bhar, Jérôme Bolte, Nicholas Asher. 30033-30051 [doi]
- Think Better, Not Longer: Token-Level Marginal Utility for Efficient Reasoning in Large Reasoning ModelsJiawei Li 0020, Yang Gao 0016, Huashan Sun, Chong Feng 0001. 30052-30063 [doi]
- AgentSlimming: Towards Efficient and Cost-Aware Multi-Agent SystemsYulang Chen, Haoxuan Peng, Jinyan Liu, Zichen Wen, Dongrui Liu, Linfeng Zhang. 30064-30086 [doi]
- Reusable Experiences: Latent Routing and Modular Composition in LLMsShuai Ling, Lizi Liao, Dongmei Jiang, Weili Guan. 30087-30100 [doi]
- Communicating in Emergent Language with an Induced Morphological PhrasebookBrendon Boldt, David R. Mortensen. 30101-30121 [doi]
- Controllable Contamination Detection for Reliable LLM Evaluation with Statistical GuaranteesZheng Zhang 0048, Qi Liu 0003, Siyuan Liang 0004, Ning Li, Zirui Hu, Weibo Gao, Rui Li 0093, Zhenya Huang, Leszek Rutkowski, Baosheng Yu, Dacheng Tao. 30122-30143 [doi]
- From 1, 000, 000 Users to Every User: Scaling Up Personalized Preference for User-level AlignmentJia-Nan Li, Jian Guan 0002, Songhao Wu, Wei Wu 0014, Rui Yan 0001. 30144-30168 [doi]
- Beyond Atomic Characters: Glyph-Aware Sub-character Alignment for Low-Resource Multilingual OCRMengxiao Zhu 0004, Haixu Chen, Jiu Sha, Jie Liu, Ge Shi. 30169-30185 [doi]
- Why Supervised Fine-Tuning Fails to Learn: A Systematic Study of Incomplete Learning in Large Language ModelsChao Xue, Yao Wang, Mengqiao Liu, Di Liang, Xingsheng Han, Peiyang Liu, Xianjie Wu, Chenyao Lu, Lei Jiang, Yu Lu, Haibo Shi, Shuang Liang, Minlong Peng, Flora D. Salim. 30186-30213 [doi]
- KnowMe-Bench: Benchmarking Person Understanding for Lifelong Digital CompanionsTingyu Wu, Zhisheng Chen, Ziyan Weng, Shuhe Wang, Shuo Zhang, Sen Hu 0005, Silin Wu, Qizhen Lan, Huacan Wang, Ronghao Chen. 30214-30238 [doi]
- PersonalityDBench: A Dataset for Personality Disorders - from Modeling to Controlled GenerationFederico Ravenda, Seyed Ali Bahrainian, Daniele Montagnani, Antonietta Mira, Andrea Raballo. 30239-30259 [doi]
- Towards Interpretable Tabular Reasoning: Enhancing LLM Reasoning on Tabular Data with Pre-Constructed Logic GraphLirong Gao, Zewei Yu, Zhongrui Yin, Qi Zhang 0077, Yuke Zhu, Bo Zheng, Haobo Wang 0001, Junbo Zhao 0002, Gang Chen 0001, Sheng Guo. 30260-30280 [doi]
- Beyond Explicit Refusals: Soft-Failure Attacks on Retrieval-Augmented GenerationWentao Zhang, Yan Zhuang 0002, ZhuHang Zheng, Mingfei Zhang, Jiawen Deng, Fuji Ren. 30281-30302 [doi]
- Compressing LLM Knowledge into Graph Representations for Text-attributed Graphs LearningRunhuai Chen, Dian Shen, Dandan Zhang, Kaihong Huang, Linghui Meng, Beilun Wang. 30303-30318 [doi]
- End-to-End Optimization of LLM-Driven Multi-Agent Search Systems via Heterogeneous-Group-Based Reinforcement LearningGuanzhong Chen, Shaoxiong Yang, Chao Li 0033, Wei Liu 0302, Jian Luan 0001, Zenglin Xu. 30319-30338 [doi]
- Translation with Thought: Difficulty-Adaptive Reasoning via Reinforcement Learning for Multi-Domain Machine TranslationYongshi Ye, Biao Fu, Chongxuan Huang, Yidong Chen 0001, Xiaodong Shi. 30339-30370 [doi]
- Segment, Embed, and Align: A Universal Recipe for Aligning Subtitles to SigningZifan Jiang, Youngjoon Jang 0001, Liliane Momeni, Gül Varol, Sarah Ebling, Andrew Zisserman. 30371-30384 [doi]
- Understanding Emergent Misalignment via Feature Superposition GeometryGouki Minegishi, Hiroki Furuta, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo. 30385-30414 [doi]
- MavenCoder: Competitive Code Generation via Model Adaptive Planning Strategies and Multi-Perspective Verification EnhancementZhenChun Xu, Yi Cai 0001, Dajun Zheng, Li Yuan, Mengchen Zhao, Qixiang Wang, Jiexin Wang. 30415-30439 [doi]
- Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context ReasoningXin Guan, Zijian Li, Shen Huang, Pengjun Xie, Jingren Zhou 0001, Jiuxin Cao. 30440-30454 [doi]
- Generating Attribution Reports for Manipulated Facial Images: A Dataset and BaselineJingchun Lian, Lingyu Liu, Yaxiong Wang, Yujiao Wu, Lianwei Wu, Li Zhu 0003, Zhedong Zheng. 30455-30473 [doi]
- Optimizing RAG Rerankers with LLM Feedback via Reinforcement LearningYuhang Wu, Xiangqing Shen, Fanfan Wang, Cangqi Zhou, Zhen Wu 0002, Xinyu Dai, Rui Xia. 30474-30490 [doi]
- Explainable and Fine-Grained Safeguarding of LLM Multi-Agent Systems via Bi-Level Graph Anomaly DetectionJunJun Pan, Yixin Liu 0001, Rui Miao 0003, Kaize Ding, Yu Zheng 0013, Quoc Viet Hung Nguyen, Alan Wee-Chung Liew, Shirui Pan. 30491-30506 [doi]
- Understanding and Mitigating Bias Inheritance in LLM-based Data Augmentation on Downstream TasksMiaomiao Li, Hao Chen 0102, Yang Wang, Tingyuan Zhu, Weijia Zhang, Kaijie Zhu, Kam-Fai Wong, Jindong Wang 0001. 30507-30533 [doi]
- Beyond the Panorama: Training-Free Hierarchical Perception-Reasoning for Fine-Grained Vision in MLLMsXiaoyang Yi, Jing Chen, Li Peng, Yuru Bao, Jian Zhang. 30534-30549 [doi]
- To Judge or Not to Judge: Can Large Language Models Leverage the Dispute Focus in Legal Judgment?Luoming Hu, Liang Yang, Jingjie Zeng, Zijie Xing. 30550-30571 [doi]
- CPR-RAG: Clinical Prior-Regularized Retrieval for Anatomy-Aware 3D CT Report GenerationSungkyu Yang, Kang Min Kim, Mansu Kim. 30572-30587 [doi]
- Evaluating Answer Leakage Robustness of LLM Tutors against Adversarial Student AttacksJin Zhao, Marta Knezevic, Tanja Käser. 30588-30617 [doi]
- Expect the Unexpected? Testing the Surprisal of Salient EntitiesJessica Lin 0004, Amir Zeldes. 30618-30629 [doi]
- ArgGenBench: Benchmarking the Complex Controlled Argument Generation Capability of Large Language ModelsBojun Jin, Jianzhu Bao, Yang Sun, Yice Zhang, Ruifeng Xu 0001. 30630-30662 [doi]
- Language Models Learn Universal Representations of Numbers and Here's Why You Should CareMichal Stefánik, Timothee Mickus, Marek Kadlcík, Bertram Højer, Michal Spiegel, Raúl Vázquez, Aman Sinha 0002, Josef Kuchar, Philipp Mondorf, Pontus Stenetorp. 30663-30681 [doi]
- CURE-Med: Curriculum-Informed Reinforcement Learning for Multilingual Medical ReasoningEric Onyame, Akash Ghosh, Subhadip Baidya, Sriparna Saha 0001, Xiuying Chen, Chirag Agarwal. 30682-30703 [doi]
- Inverting the Shield: Systematically Generating Safety Tests from Policy SpecificationsXiaoyue Lu, XiangLin Yang, Haijun Liu, Jiahao Liu, Kuntai Cai, Yan Xiao 0002, Jin Song Dong 0001. 30704-30731 [doi]
- HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics AlignmentZhanyu Liu, Qingguo Hu, Ante Wang, Chenqing Liu, Zhishang Xiang, Hui Li, Delai Qiu, Jinsong Su. 30732-30748 [doi]
- Do LLMs Encode Functional Importance of Reasoning Tokens ?Janvijay Singh, Dilek Hakkani-Tür. 30749-30773 [doi]
- EA-Agent: A Structured Multi-Step Reasoning Agent for Entity AlignmentYixuan Nan, Xixun Lin, Yanmin Shang, Ge Zhang 0002, Zheng Fang 0002, Fang Fang 0009, Yanan Cao 0001. 30774-30787 [doi]
- Too Nice to Tell the Truth: Quantifying Agreeableness-Driven Sycophancy in Role-Playing Language ModelsArya Shah, Deepali Mishra, Chaklam Silpasuwanchai. 30788-30801 [doi]
- Mobile-R1: Towards Interactive Capability for VLM-Based Mobile Agent via Systematic TrainingJihao Gu, Qihang Ai, Yingyao Wang, Pi Bu, Jingxuan Xing, Yue Cao, Zekun Zhu, Wei Jiang, Ziming Wang, Yingxiu Zhao, Ming-Liang Zhang, Jun Song, Yuning Jiang 0001, Bo Zheng 0007. 30802-30820 [doi]
- QuantumQA: Enhancing Scientific Reasoning via Physics-Consistent Dataset and Verification-Aware Reinforcement LearningSongxin Qu, Tai-Ping Sun, Yun-Jie Wang, Huan-Yu Liu, Cheng Xue, Xiao-Fan Xu, Han Fang, Yang Yang 0026, Yu-chun Wu, Guo-Ping Guo, Zhao-Yun Chen. 30821-30845 [doi]
- The "Knowledge-Behavior Gap" in Cultural Taboo Safety of Large Language ModelsYing He, Sihang Jiang, Xingzhou Chen, Zhouhong Gu, Yiwei Gu, Minggui He, Shimin Tao, Hongxia Ma, Yanghua Xiao. 30846-30866 [doi]
- OSCBench: Benchmarking Object State Change in Text-to-Video GenerationXianjing Han, Bin Zhu 0006, Shiqi Hu, Franklin Mingzhe Li, Patrick Carrington, Roger Zimmermann, Jingjing Chen 0001. 30867-30884 [doi]
- Evaluation Pitfalls and Challenges in Multimedia Event ExtractionPhilipp Seeberger, Steffen Freisinger, Tobias Bocklet, Korbinian Riedhammer. 30885-30900 [doi]
- UMPIRE: Unveiling LLM-generated Posts via Redundant ExpressionsXiaoquan Yi, Haixing Wu, Haozhao Wang, Yichen Li 0006, Yuhua Li 0003, Rui Zhang 0003, Ruixuan Li 0001. 30901-30913 [doi]
- SpeechMedAssist: Efficiently and Effectively Adapting Speech Language Models for Medical ConsultationSirry Chen, Jieyi Wang, Wei Chen 0088, Zhongyu Wei. 30914-30935 [doi]
- An Experimental Study on the Influence of Culture on Cross-Lingual Sentiment TransferAhao Liu, Haitong Yang, Chuanrong Wang. 30936-30955 [doi]
- Attribution, Citation, and Quotation: A Survey of Evidence-based Text Generation with Large Language ModelsTobias Schreieder, Tim Schopf, Michael Färber 0001. 30956-31000 [doi]
- MirrorCAPTCHA: Wild CAPTCHA, Wild Distribution, Wild Web-based Platform Meet Multimodal LLM AgentsXiangyu Wu, Yuwei Hu, Tianyu Cui, Yueying Tian, Qingguo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Yang Yang 0074, Jianfeng Lu 0003. 31001-31017 [doi]
- ReCreate: Reasoning and Creating Domain Agents Driven by ExperienceZhezheng Hao, Hong Wang, Jian Luo, Jianqing Zhang, Yuyan Zhou, Qiang Lin, Can Wang, Hande Dong, Jiawei Chen. 31018-31046 [doi]
- Can AI-Generated Persuasion Be Detected? Persuaficial Benchmark and AI vs. Human Linguistic DifferencesArkadiusz Modzelewski, Pawel Golik, Anna Kolos, Giovanni Da San Martino. 31047-31072 [doi]
- GASE: Graph-Aware Semantic Embedding Learning with Frozen LLMs for Text-Attributed GraphsMingqian Ding, Jianjun Li 0010, Wenqi Yang, Zhibo Zhang 0009, Yushen Fang. 31073-31086 [doi]
- Compositional Steering of Large Language Models with Steering TokensGorjan Radevski, Kiril Gashteovski, Giwon Hong, Carolin Lawrence, Goran Glavas. 31087-31104 [doi]
- Rethinking Entropy Interventions in RLVR: An Entropy Change PerspectiveZhezheng Hao, Hong Wang, Haoyang Liu, Jian Luo, Jiarui Yu, Hande Dong, Qiang Lin, Can Wang, Jiawei Chen. 31105-31133 [doi]
- SwissGov-RSD: A Human-annotated, Cross-lingual Benchmark for Token-level Recognition of Semantic Differences Between Related DocumentsMichelle Wastl, Jannis Vamvas, Rico Sennrich. 31134-31163 [doi]
- Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-ExpertsHaolei Xu, Haiwen Hong, Hongxing Li, Rui Zhou, Yang Zhang, Longtao Huang, Hui Xue 0001, Yongliang Shen 0001, Weiming Lu 0001, Yueting Zhuang. 31164-31178 [doi]
- RubricBench: Aligning Model-Generated Rubrics with Human StandardsJunyi Zhou, Qiyuan Zhang 0001, Yufei Wang 0005, Fuyuan Lyu, Yidong Ming, Can Xu 0002, Qingfeng Sun, Kai Zheng 0001, Peng Kang, Xue Liu 0001, Chen Ma 0001. 31179-31200 [doi]
- Verify Before You Commit: Towards Faithful Reasoning in LLM Agents via Self-AuditingWenhao Yuan 0005, Chenchen Lin, Jian Chen 0011, Jinfeng Xu 0003, Xuehe Wang, Edith Cheuk-Han Ngai. 31201-31225 [doi]
- GiLT: Augmenting Transformer Language Models with Dependency GraphsTianyu Huang, Yida Zhao, Chuyan Zhou, Kewei Tu. 31226-31237 [doi]
- TAMAS: Benchmarking Adversarial Risks in Multi-Agent LLM SystemsIshan Kavathekar, Hemang Jain, Ameya Rathod, Ponnurangam Kumaraguru, Tanuja Ganu. 31238-31268 [doi]
- How Controllable Are Large Language Models? A Unified Evaluation across Behavioral GranularitiesZiwen Xu, Kewei Xu, Haoming Xu, Haiwen Hong, Longtao Huang, Hui Xue 0001, Ningyu Zhang 0001, Yongliang Shen 0001, Guozhou Zheng, Huajun Chen, Shumin Deng. 31269-31299 [doi]
- Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical ReasoningZelin Tan, Hejia Geng, Xiaohang Yu, Mulei Zhang, Guancheng Wan, Yifan Zhou, Qiang He, Xiangyuan Xue, Heng Zhou, Yutao Fan, Zhong-Zhi Li, Zaibin Zhang, Guibin Zhang, Chen Zhang 0007, Zhenfei Yin, Philip Torr 0001, Lei Bai 0001. 31300-31319 [doi]
- RubricHub: A Comprehensive and Highly Discriminative Rubric Dataset via Automated Coarse-to-Fine GenerationSunzhu Li, Jiale Zhao, Huimin Ren, Zhenlin Wei, Yang Zhou, Jingwen Yang, Shunyu Liu 0001, Kaike Zhang, Chen Wei. 31320-31344 [doi]
- MIND Your Reasoning: A Meta-Cognitive Intuitive-Reflective Network for Dual-Reasoning in Multimodal Stance DetectionBingbing Wang, Zhengda Jin, Bin Liang 0004, Wenjie Li 0002, Jing Li 0049, Ruifeng Xu 0001, Min Zhang 0005. 31345-31355 [doi]
- A Survey of Inductive Reasoning for Large Language ModelsKedi Chen, Dezhao Ruan, Yuhao Dan, Yaoting Wang, Siyu Yan, Xuecheng Wu, Yinqi Zhang, Qin Chen 0001, Jie Zhou 0015, Liang He 0001, Biqing Qi, Linyang Li, Qipeng Guo, Xiaoming Shi, Wei Zhang 0010. 31356-31382 [doi]
- CogToM: A Comprehensive Theory of Mind Benchmark inspired by Human Cognition for Large Language ModelsHaibo Tong, Zeyang Yue, Feifei Zhao, Erliang Lin, Lu Jia, Ruolin Chen, Yinqian Sun, Qian Zhang 0080, Yi Zeng 0001. 31383-31425 [doi]
- CITE: Benchmarking Heterogeneous Text-Attributed Graph ModelsChenghao Zhang, Qingqing Long, Ludi Wang, Wenjuan Cui, Jianjun Yu, Yi Du. 31426-31448 [doi]
- MM-StanceDet: Retrieval-Augmented Multi-modal Multi-agent Stance DetectionWeihai Lu, Zhejun Zhao, Yanshu Li, Huan He. 31449-31464 [doi]
- Disentangling Reasoning Logic to Resolve Explicit Knowledge ConflictsXianda Zheng, Zijian Huang 0003, Meng-Fen Chiang, Jiamou Liu, Yuan Fang, Michael J. Witbrock, Kaiqi Zhao 0001. 31465-31478 [doi]
- UniVocal: Unified Speech-Singing Code-Switching SynthesisYufei Shi, Qian Chen 0003, Wen Wang 0001, Xiangang Li, Zhen-Hua Ling, Yang Ai. 31479-31496 [doi]
- ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha MomentsYuquan Wang, Mi Zhang 0001, Yining Wang, Geng Hong, Mi Wen, Xiaoyu You, Min Yang 0002. 31497-31526 [doi]
- VecInfer: Efficient LLM Inference with Low-Bit KV Cache via Outlier-Suppressed Vector QuantizationDingyu Yao, Chenxu Yang, Zhengyang Tong, Zheng Lin 0001, Wei Liu 0302, Jian Luan 0001, Weiping Wang 0005. 31527-31543 [doi]
- When Does Mixing Help? Analyzing Query Embedding Interpolation in Multilingual Dense RetrievalTongyao Zhu, Huang Chao Ming, Min-Yen Kan. 31544-31562 [doi]
- WIST: Web-Grounded Iterative Self-Play Tree for Domain-Targeted Reasoning ImprovementFangyuan Li, Pengfei Li 0011, Shijie Wang, Junqi Gao, Jianxing Liu, Biqing Qi, Yuqiang Li. 31563-31585 [doi]
- Frankentext: Stitching random text fragments into long-form narrativesChau Minh Pham, Jenna Russell, Dzung Pham 0002, Mohit Iyyer. 31586-31625 [doi]
- SAFO: Stable Adaptive Fairness Optimization for LLM-Based Social Survey SimulationChenxi Lin, Zhuoren Jiang, Kaisong Song, Yiquan Wu. 31626-31654 [doi]
- The Prosody of EmojisGiulio Zhou, Tsz Kin Lam, Alexandra Birch, Barry Haddow. 31655-31671 [doi]
- Piece of Table: A Divide-and-Conquer Approach for Selecting Subtables in Table Question AnsweringWonjin Lee 0001, Kyumin Kim 0001, Sungjae Lee 0006, Jihun Lee 0001, Kwang In Kim. 31672-31688 [doi]
- QA-MoE: Towards a Continuous Reliability Spectrum with Quality-Aware Mixture of Experts for Robust Multimodal Sentiment AnalysisYitong Zhu, Yuxuan Jiang, Guanxuan Jiang, Bojing Hou, Peng Yuan Zhou, Ge Lin 0001, Yuyang Wang. 31689-31703 [doi]
- Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy OptimizationJunzhe Wang 0001, Zhiheng Xi, Yajie Yang, Hao Luo, Shihan Dou, Tao Gui, Qi Zhang 0001. 31704-31718 [doi]
- Why Steering Works: Toward a Unified View of Language Model Parameter DynamicsZiwen Xu, Chenyan Wu, Hengyu Sun, Haiwen Hong, Mengru Wang, Yunzhi Yao, Longtao Huang, Hui Xue 0001, Shumin Deng, Zhixuan Chu, Huajun Chen, Ningyu Zhang 0001. 31719-31736 [doi]
- EmoMAS: Emotion-Aware Multi-Agent System for High-Stakes Edge-Deployable Negotiation with Bayesian OrchestrationYunbo Long, Yuhan Liu, Liming Xu. 31737-31773 [doi]
- Decisive: Guiding User Decisions with Optimal Preference Elicitation from Unstructured DocumentsAkriti Jain, Anish Mulay, Divyansh Verma, Aishani Pandey, Pritika Ramu, Aparna Garimella. 31774-31786 [doi]
- From Naturalness to Norms: Interactional Cultural Competence for SpeechLMsT. Y. S. S. Santosh. 31787-31802 [doi]
- Optimizing User Profiles via Contextual Bandits for Retrieval-Augmented LLM PersonalizationLinfeng Du, Ye Yuan 0017, Zichen Zhao, Fuyuan Lyu, Emiliano Penaloza, Xiuying Chen, Zipeng Sun, Jikun Kang, Laurent Charlin, Xue Liu 0001, Haolun Wu. 31803-31817 [doi]
- Teaching Language Models to Check Grounded Claim Factuality with Human Test-Taking StrategiesYuxuan Ye, Raúl Santos-Rodríguez, Edwin Simpson. 31818-31834 [doi]
- Evo-PI: Aligning Medical Reasoning via Evolving Principle-Guided SupervisionXianda Zheng, Huan Gao, Meng-Fen Chiang, Michael J. Witbrock, Kaiqi Zhao 0001, Shangyang Li. 31835-31850 [doi]
- Understanding LLM Performance Degradation in Multi-Instance Processing: The Roles of Instance Count and Context LengthJingxuan Chen, Mohammad Taher Pilehvar, José Camacho-Collados. 31851-31884 [doi]
- Gated Differentiable Working Memory for Long-Context Language ModelingLingrui Mei, Shenghua Liu, Yiwei Wang 0001, Yuyao Ge, Baolong Bi, Jiayu Yao, Jun Wan, Ziling Yin, Jiafeng Guo, Xueqi Cheng. 31885-31913 [doi]
- Stress Testing Factual Consistency Metrics for Long-Document SummarizationZain Muhammad Mujahid, Dustin Wright 0001, Isabelle Augenstein. 31914-31933 [doi]
- Do LLMs Know Tool Irrelevance? Demystifying Structural Alignment Bias in Tool InvocationsYilong Liu, Xixun Lin, Pengfei Cao, Ge Zhang 0002, Fang Fang 0009, Yanan Cao 0001. 31934-31958 [doi]
- PASs-MoE: Mitigating Misaligned Co-drift among Router and Experts via Pathway Activation Subspaces for Continual LearningZhiyan Hou, Haiyun Guo, Haokai Ma, Yandu Sun, Yonghui Yang, Jinqiao Wang. 31959-31972 [doi]
- LLM-Generated Text May Harm Your Retrieval! A Robust Detection Strategy for Retrieval-Augmented GenerationZhaoheng Huang, Yutao Zhu 0001, Ji-Rong Wen, Zhicheng Dou. 31973-31988 [doi]
- GQLBench: A Large-Scale Cross-Domain, Cross-Dialect Benchmark for NL2GQLYanning Su, Yuhang Zhou, Yang Fang, Sen Liu, Guangnan Ye, Hongfeng Chai. 31989-32014 [doi]
- ReviewGrounder: Improving Review Substantiveness with Rubric-Guided, Tool-Integrated AgentsZhuofeng Li, Yi Lu, Dongfu Jiang, Haoxiang Zhang, Yuyang Bai, Chuan Li, Yu Wang, Shuiwang Ji, Jianwen Xie, Yu Zhang 0044. 32015-32044 [doi]
- The Retrieval Bottleneck: Scaling Laws for Reinforcement Learning in RAGShu Zhou, Jinman Leng, Yufei Song, Xin Wang, Tao Fan, Hao Wang. 32045-32069 [doi]
- Generating then Refining for Reliable Knowledge Base Question AnsweringJianqi Gao 0001, Hang Yu 0006, Jian Cao 0001, Ranran Bu, Jinghua Tang, Nengjun Zhu, Yonggang Zhang 0003. 32070-32087 [doi]
- EvoSpark: Endogenous Interactive Agent Societies for Unified Long-Horizon Narrative EvolutionShiyu He, Minchi Kuang, Mengxian Wang, Bin Hu, Tingxiang Gu. 32088-32107 [doi]
- SeCuRepair: Semantics-Aligned, Curriculum-Driven, and Reasoning-Enhanced Vulnerability Repair FrameworkChengran Yang, Ting Zhang 0011, Jinfeng Jiang, Xin Zhou 0014, Haoye Tian, Mingzhe Du, Jieke Shi, JunKai Chen, Yikun Li, Eng Lieh Ouh, Lwin Khin Shar, David Lo 0001. 32108-32123 [doi]
- HiddenGuard: Fine-Grained Safe Generation with Specialized Representation RouterLingrui Mei, Shenghua Liu, Yiwei Wang 0001, Baolong Bi, Ruibin Yuan, Xueqi Cheng. 32124-32156 [doi]
- Why Do LLM-based Web Agents Fail? A Hierarchical Planning PerspectiveMohamed Aghzal, Gregory J. Stein, Ziyu Yao 0002. 32157-32180 [doi]
- Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable RewardWeiyang Guo, Zesheng Shi, Zeen Zhu, Yuan Zhou, Min Zhang, Jing Li. 32181-32201 [doi]
- On the Proper Treatment of Units in Surprisal TheorySamuel Kiegeland, Vésteinn Snæbjarnarson, Tim Vieira, Ryan Cotterell. 32202-32224 [doi]
- ThreadSumm: Summarization of Nested Discourse Threads Using Tree of ThoughtsOlubusayo Olabisi, Ekata Mitra, Ameeta Agrawal. 32225-32240 [doi]
- InquireMobile: Teaching VLM-based Mobile Agent to Request Human Assistance via Reinforcement Fine-TuningQihang Ai, Pi Bu, Yue Cao, Yingyao Wang, Jihao Gu, Jingxuan Xing, Zekun Zhu, Wei Jiang, Zhicheng Zheng, Jun Song, Yuning Jiang 0001. 32241-32255 [doi]
- Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via sequence-level likelihoodXingyu Lin, Yilin Wen 0007, Du Su, En Wang, Wenbin Liu, Zhonghou Lv, Jinchang Hou, Chenfu Bao. 32256-32269 [doi]
- De-Anonymization at Scale via Tournament-Style AttributionLirui Zhang, Huishuai Zhang. 32270-32283 [doi]
- Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic CompositionalityWei Li 0317, Zhen Huang 0007, Xinmei Tian 0001. 32284-32308 [doi]
- StratMem-Bench: Evaluating Strategic Memory Use in Virtual Character Conversation Beyond Factual RecallYerong Wu, Tianxing Wu 0001, Minghao Zhu, Hangyu Sha, Haofen Wang. 32309-32328 [doi]
- RLSeek: Evidence-Grounded Reasoning for RAG Hallucination DetectionZhaoheng Huang, Dacheng Wen, Yutao Zhu 0001, Xiaoying Lian, Yushi Liang, Kai Hao, Nan Li, Liangjie Zhang, Qi Zhang 0001, Ji-Rong Wen, Zhicheng Dou, Fangzhao Wu. 32329-32347 [doi]
- CO-EVO: Co-evolving Semantic Anchoring and Style Diversification for Federated DG-ReIDFengchun Zhang, Qiang Ma, Liuyu Xiang, Jinshan Lai, Tingxuan Huang, Jianwei Hu. 32348-32359 [doi]
- Discovering Properties of Inflectional Morphology in Neural Emergent CommunicationMiles Gilberti, Shane Storks, Huteng Dai. 32360-32377 [doi]
- Label Effects: Shared Heuristic Reliance in Trust Assessment by Humans and LLM-as-a-JudgeXin Sun 0016, Di Wu, Sijing Qin, Isao Echizen, Abdallah El-Ali, Saku Sugawara. 32378-32392 [doi]
- Self-SoftCoT: A Self-Consistent Framework via Position-Aware Latent Space Reinforcement LearningLiangliang Dong, Lianlei Shan, Shuaimin Li. 32393-32414 [doi]
- Bayesian Social Deduction with Graph-Informed Language ModelsShahab Rahimirad, Guven Gergerli, Lucia Romero, Angela Qian, Matthew Lyle Olson, Simon Stepputtis, Joseph Campbell. 32415-32440 [doi]
- Routing with Generated Data: Annotation-Free LLM Skill Estimation and Expert SelectionTianyi Niu, Justin Chih-Yao Chen, Genta Indra Winata, Shi-Xiong Zhang, Supriyo Chakraborty, Sambit Sahu, Yue Zhang 0004, Elias Stengel-Eskin, Mohit Bansal. 32441-32466 [doi]
- Injecting Context via Situation Working Memory for Logical Reasoning with LLMsJieun Kim, Seoha Lim, YoungHae Choi, Sung-Bae Cho. 32467-32480 [doi]
- ProMed: Shapley Information Gain Guided Reinforcement Learning for Proactive Medical LLMsHongxin Ding, Baixiang Huang, Yue Fang, Weibin Liao, Xinke Jiang, Jinyang Zhang, Yinghao Zhu, Zheng Li, Liantao Ma, Junfeng Zhao 0001, Yasha Wang. 32481-32515 [doi]
- SafeAgent: Safeguarding LLM Agents via an Automated Risk SimulatorXueyang Zhou, Weidong Wang, Lin Lu 0003, Jiawen Shi, Guiyao Tie, Yongtian Xu, Lixing Chen, Pan Zhou 0001, Neil Zhenqiang Gong, Lichao Sun 0001. 32516-32543 [doi]
- Diagnosing Hidden Instabilities in Model Editing via Uncertainty QuantificationZihan Gu, Tianyi Zhang, Xinyan Zhang, Zhiyuan Wang, Han Zhang 0008, Yuhao Wei, Jiacheng Lu, Tianyi Ma, Xingsheng Zhang, Hua Zhang 0008, Yue Hu. 32544-32566 [doi]
- Alexandria: A Multi-Domain Dialectal Arabic Machine Translation Dataset for Culturally Inclusive and Linguistically Diverse LLMsAbdellah El Mekki, Samar Mohamed Magdy, Houdaifa Atou, Ruwa AbuHweidi, Baraah Qawasmeh, Omer Nacar, Thikra Al-Hibiri, Razan Saadie, Hamzah A. Alsayadi, Nadia Ghezaiel Hammouda, Alshima Mohammed Alkhazimi, Aya Hamod, Al-Yas Yaqoob Al-Ghafri, Wesam El-Sayed, Asila Ismail Al Sharji, Mohamad Ballout, Anas Belfathi, Karim Ghaddar, Serry Sibaee, Alaa Aoun, Aeej Mohammed Aseri, Lina Abureesh, Ahlam Bashiti, Majdal Yousef, Abdulaziz Hafiz, Yehdih Mohamed, Emira Hamedtou, Brakehe Emehah, Rahaf Alhamouri, Youssef Nafea, Aya El aatar, Walid Al-Dhabyani, Emhemed Hamed, Sara Shatnawi, Fakhraddin Alwajih, Khalid Elkhidir, Ashwag Alasmari, Abdurrahman Gerrio, Omar Said Alshahri, AbdelRahim A. Elmadany, Ismail Berrada, Amir Azad Adli Alkathiri, Fadi A. Zaraket, Mustafa Jarrar, Yahya Mohamed El Hadj, Hassan Alhuzali, Muhammad Abdul-Mageed. 32567-32592 [doi]
- Can AI Be a Good Peer Reviewer? A Survey of Peer Review Process, Evaluation, and the FutureSihong Wu, Owen Jiang, Yilun Zhao 0001, Tiansheng Hu, Yiling Ma, Kaiyan Zhang, Manasi Patwardhan 0001, Arman Cohan. 32593-32619 [doi]
- How Much Would a Clinician Edit This Draft? Evaluating LLM Alignment for Patient Message Response DraftingParker Seegmiller, Joseph Gatto, Sarah E. Greer, Ganza Belise Isingizwe, Rohan Ray, Timothy E. Burdick, Sarah Masud Preum. 32620-32646 [doi]
- MetaBench: A Multi-task Benchmark for Assessing LLMs in MetabolomicsYuxing Lu, Xukai Zhao, J. Ben Tamo, Micky C. Nnamdi, Rui Peng 0006, Shuang Zeng, Xingyu Hu, Jinzhuo Wang, May Dongmei Wang. 32647-32668 [doi]
- MTA: Multi-Granular Trajectory Alignment for Large Language Model DistillationPham Khanh Chi, Quoc Phong Dao, Thuat Nguyen, Linh Ngo Van 0001, Trung Le 0001, Thanh Hong Nguyen. 32669-32684 [doi]
- Measuring Distribution Shift in User Prompts and Its Effects on LLM PerformanceParker Seegmiller, Sarah Masud Preum. 32685-32704 [doi]
- TALAS: Teacher-Anchored Layer Alignment with Adaptive Sharpness-Aware Minimization for Embedding DistillationQuoc Phong Dao, Hoang-Son Nguyen, Pham Khanh Chi, Linh Ngo Van 0001, Nguyen Thi Ngoc Diep, Thien Huu Nguyen, Trung Le 0001. 32705-32723 [doi]
- Vocabulary Shapes Cross-Lingual Variation of Word-Order Learnability in Language ModelsJonas Mayer Martins, Jaap Jumelet, Viola Priesemann, Lisa Beinborn. 32724-32740 [doi]
- Quantifying and Understanding Uncertainty in Large Reasoning ModelsYangyi Li, Chenxu Zhao, Mengdi Huai. 32741-32754 [doi]
- SimPBL: A Multi-Agent Framework for Project-Based LearningDaniel Zhang-li, Joy Lim Jia Yin, Binglin Liu, Shangqing Tu, Zijun Yao 0002, Hao Peng 0015, Jifan Yu, Haoxuan Li 0003, Zhanxin Hao, Ye He, Zekun Li, Jiangyi Wang, Lei Hou 0001, Bin Xu 0001, Xin Cong, Zhiyuan Liu 0001, Huiqin Liu, Yu Zhang 0186, Juanzi Li. 32755-32772 [doi]
- Schoenfeld's Anatomy of Mathematical Reasoning by Language ModelsMing Li 0010, Chenrui Fan, Yize Cheng, Soheil Feizi, Tianyi Zhou 0001. 32773-32802 [doi]
- Diagnosing Spatial Consistency across Perspectives and Viewpoints in Large Vision-Language ModelsYoonji Kim, Jieun Kim, Yujin Jeong, Sung-Bae Cho. 32803-32827 [doi]
- A Multi-Agent Framework for High-Interaction Terminal SimulationKai Wei, Yuwen Cui, Kehan Shen, Hua Wei, Guangjing Wang 0001. 32828-32845 [doi]
- Parameter Importance is Not Static: Evolving Parameter Isolation for Supervised Fine-TuningZekai Lin, Chao Xue, Di Liang, Xingsheng Han, Peiyang Liu, Xianjie Wu, Lei Jiang, Yu Lu, Bob Simons, Shuang Liang, Minlong Peng. 32846-32864 [doi]
- Enhanced Reasoning for Biomedical Document-Level Relation Extraction via a Novel Cascade Language Model FrameworkHaohua Song, Wenhao Gu, Zhijing Li 0007, Yunwen Yu, Tiantian Zhu, Xiao Yang 0019, Zexuan Zhu 0001. 32865-32879 [doi]
- Multimodal Large Language Models for Multi-Subject In-Context Image GenerationYucheng Zhou 0001, Dubing Chen, Huan Zheng, Jianbing Shen. 32880-32898 [doi]
- RSMeM: Knowledge-Enhanced Memory Evolution for Remote Sensing Agents with Systematic EvaluationBingxian Wu, Yu Zhang 0186, Zonghao Guo, Tang Liu, Chen Qian, Yuxiang Lu, Xingbo Du, Yanghao Li, Yidan Zhang, Chi Chen 0005, Ling Yao, Chenghu Zhou, Maosong Sun 0001. 32899-32915 [doi]
- Synthetic Data Generation for Training Diversified Commonsense Reasoning ModelsTianhui Zhang, Bei Peng, Danushka Bollegala. 32916-32937 [doi]
- Discourse Realization of Generics in Human and LLM-generated TextsSøren Kirkegaard Fomsgaard, Martial Pastor, Gaël Dias, Nelleke Oostdijk. 32938-32960 [doi]
- SRA: Span Representation Alignment for Large Language Model DistillationQuoc Phong Dao, Hoang-Son Nguyen, Pham Khanh Chi, Tung Nguyen, Linh Ngo Van 0001, Nguyen Thi Ngoc Diep, Trung Le 0001. 32961-32975 [doi]
- The GDN-CC Dataset: Automatic Corpus Clarification for AI-enhanced Democratic Citizen ConsultationsPierre-Antoine Lequeu, Léo Labat, Laurène Cave, Gaël Lejeune, François Yvon, Benjamin Piwowarski. 32976-33006 [doi]
- Behavior Knowledge Merge in Reinforced Agentic ModelsXiangchi Yuan, Dachuan Shi, Chunhui Zhang, Zheyuan Liu 0010, Shenglong Yao, Soroush Vosoughi, Wenke Lee. 33007-33028 [doi]
- Leveraging Outline-Optimized Generative Interactions and Critique for Self-Refining Outlines with Reinforcement LearningHengwei Liu, Haoyuan Ma, Qingqing Lyu, Daoxin Zhang, Yao Hu, Yongliang Shen 0001, Yin Zhang 0006, Weiming Lu 0001. 33029-33046 [doi]
- Neuron-Aware Active Few-Shot Learning for LLMsZhuowei Chen, Liwei Chen, Christian Schunn, Raquel Coelho, Xiang Lorraine Li. 33047-33062 [doi]
- CommonLID: Re-evaluating State-of-the-Art Language Identification Performance on Web DataPedro Ortiz Suarez, Laurie Burchell, Catherine Arnett, Rafael Mosquera, Sara Hincapié Monsalve, Thom Vaughan, Damian Stewart, Malte Ostendorff, Idris Abdulmumin, Vukosi Marivate, Shamsuddeen Hassan Muhammad, Atnafu Lambebo Tonja, Hend Al-Khalifa 0001, Nadia Ghezaiel Hammouda, Verrah Akinyi Otiende, Tack Hwa Wong, Jakhongir Saydaliev, Melika Nobakhtian, Muhammad Ravi Shulthan Habibi, Kranti Chalamalasetti, Carol Muchemi, Khang Nguyen, Faisal Muhammad Adam, Luis Frentzen Salim, Reem Alqifari, Cynthia Jayne Amol, Joseph Marvin Imperial, Ilker Kesen, Ahmad Mustafid, Pavel Stepachev, Leshem Choshen, David Anugraha, Hamada Nayel, Seid Muhie Yimam, Vallerie Alexandra Putra, My Chiffon Nguyen, Azmine Toushik Wasi, Gouthami Vadithya, Rob van der Goot, Lanwenn Ar C'horr, Karan Dua, Andrew Yates, Mithil Bangera, Yeshil Bangera, Hitesh Laxmichand Patel, Shu Okabe, Fenal Ashokbhai Ilasariya, Dmitry Gaynullin, Genta Indra Winata, Yiyuan Li, Juan Pablo Martínez, Amit Agarwal, Ikhlasul Akmal Hanif, Raia Abu Ahmad, Esther Adenuga, Filbert Aurelian Tjiaranata, Weerayut Buaphet, Michael Anugraha, Sowmya Vajjala, Benjamin Rice, Azril Hafizi Amirudin, Jesujoba Oluwadara Alabi, Srikant Panda, Yassine Toughrai, Bruhan Kyomuhendo, Daniel Ruffinelli, Akshata A, Manuel Goulão, Ej Zhou, Ingrid Gabriela Franco Ramirez, Cristina Aggazzotti, Konstantin Dobler, Jun Kevin, Quentin Pagès, Nicholas Andrews, Nuhu Ibrahim, Mattes Ruckdeschel, Amr Keleg, Mike Zhang, Casper Rufaro Muziri, Saron Samuel, Sotaro Takeshita, Kun Kerdthaisong, Luca Foppiano, Rasul Dent, Tommaso Green, Ahmad Mustapha Wali, Kamohelo Makaaka, Vicky Feliren, Inshirah Idris, Hande Çelikkanat, Abdulhamid Abubakar, Jean Maillard, Benoît Sagot, Thibault Clérice, Kenton Murray, Sarah K. K. Luger. 33063-33080 [doi]
- Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical ReasoningBowen Ding, Yuhan Chen, Jiayang Lyu, Jiyao Yuan, Qi Zhu 0011, Shuangshuang Tian, Dantong Zhu, Futing Wang, Heyuan Deng, Fei Mi, Lifeng Shang, Tao Lin. 33081-33106 [doi]
- LoPT: Lossless Parallel Tokenization Acceleration for Long Context Inference of Large Language ModelWei Shao, Lingchao Zheng, Pengyu Wang, Peizhen Zheng, Li Jun, Yuwei Fan. 33107-33122 [doi]
- SSSD: Simply-Scalable Speculative DecodingMichele Marzollo, Jiawei Zhuang, Niklas Roemer, Niklas Zwingenberger, Lorenz K. Müller, Lukas Cavigelli. 33123-33139 [doi]
- RedCoder: Automated Multi-Turn Red Teaming for Code LLMsWenjie Jacky Mo, Qin Liu 0010, Xiaofei Wen, Dongwon Jung, Hadi Askari, Wenxuan Zhou 0002, Zhe Zhao, Muhao Chen 0001. 33140-33155 [doi]
- Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight ModelsMehrzad Samadi, Aleksander Ficek, Sean Narenthiran, Siddhartha Jain 0001, Wasi Uddin Ahmad, Somshubra Majumdar, Vahid Noroozi, Boris Ginsburg. 33156-33169 [doi]
- PIArena: A Platform for Prompt Injection EvaluationRunpeng Geng, Chenlong Yin, Yanting Wang 0001, Ying Chen, Jinyuan Jia 0001. 33170-33192 [doi]
- Clozing the Gap: Exploring Why Language Model Surprisal Outperforms Cloze SurprisalSathvik Nair, Byung-Doh Oh. 33193-33210 [doi]
- ChemReason-Bench: Benchmarking Large Language Models for Procedural Reasoning in Experimental ChemistryJinwei Zhang, Xucheng Liang, Yu Zhang, Ruijie Yu, Xiaokang Yang 0001, Yaohui Jin, Yanyan Xu 0002. 33211-33248 [doi]
- How Instruction and Reasoning Data shape Post-Training: Data Quality through the Lens of Layer-wise GradientsMing Li, Yanhong Li, Ziyue Li, Tianyi Zhou. 33249-33299 [doi]
- Tailored Primitive Initialization is the Secret Key to Reinforcement LearningYihang Yao, Guangtao Zeng, Raina Wu, Yang Zhang 0001, Ding Zhao, Zhang-Wei Hong, Chuang Gan 0001. 33300-33318 [doi]
- MARS²: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code GenerationPengfei Li 0011, Shijie Wang, Fangyuan Li, Yikun Fu, Kaifeng Liu, Kaiyan Zhang, Dazhi Zhang, Yuqiang Li, Biqing Qi, Bowen Zhou 0002. 33319-33335 [doi]
- LoVeC: Reinforcement Learning for Better Verbalized Confidence in Long-Form GenerationCaiqi Zhang, Xiaochen Zhu, Chengzu Li, Nigel Collier, Andreas Vlachos 0001. 33336-33363 [doi]
- Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention RewardsMing Li, Pei Chen, Zhenhao Zhang, Tao Yang, Xinyang Zhang, Han Li, Tianyu Cao 0001, Ming Zeng 0001, Zhuofeng Wu 0005, Meng Jiang 0001, Huasheng Li, Lihong Li 0001, Bing Yin. 33364-33381 [doi]
- AdabNER: Arabic Digital Archive Books with Nested Entity RecognitionAya Mourad, Mustafa Jarrar. 33382-33396 [doi]
- Anchoring the Cache: Mitigating Contextual Hallucination in KV-Compressed Long-Context SummarizationYu Fu 0009, Chen Luo 0003, Josef Valvoda, Xin Zhang, Xuejing Lei, Xiao Pan, Hui Liu 0033, Yue Dong 0002. 33397-33413 [doi]
- NeuralFSM: Adaptive Multi-Agent Coordination via Learning Finite-State Execution PolicyJiye Wang, Yu Wang, Jianbin Li, Shiduo Yang, Kenan Guo, Yuanhe Zhao. 33414-33436 [doi]
- Ranking Reasoning LLMs under Test-Time ScalingMohsen Hariri, Michael Hinczewski, Jing Ma 0002, Vipin Chaudhary. 33437-33478 [doi]
- Quantifying and Improving the Robustness of Retrieval-Augmented Language Models Against Spurious Features in Grounding DataShiping Yang, Jie Wu, Wenbiao Ding, Ning Wu 0013, Shining Liang, Ming Gong 0001, Hongzhi Li, Hengyuan Zhang, Angel X. Chang, Dongmei Zhang 0001. 33479-33499 [doi]
- CL²GEC: A Multi-Discipline Benchmark for Continual Learning in Chinese Literature Grammatical Error CorrectionShang Qin, Jingheng Ye, Yinghui Li, Hai-Tao Zheng 0002, Qi Li 0002, Jinxiao Shan, Zhixing Li, Hong-Gee Kim. 33500-33521 [doi]
- PEARL: Self-Evolving Assistant for Time Management with Reinforcement LearningBingxuan Li, Jeonghwan Kim, Cheng Qian 0008, Xiusi Chen, Eitan Anzenberg, Niran Kundapur, Heng Ji 0001. 33522-33539 [doi]
- Beyond Static Artifacts: An Evolutionary Framework for Synthetic Claim GenerationYeqing Teng, Jiasheng Si, Shuxia Lin, Linhai Zhang, Weiyu Zhang 0001, Wenpeng Lu, Deyu Zhou, Xiaoming Wu. 33540-33570 [doi]
- CloneMem: Benchmarking Long-Term Memory for AI ClonesSen Hu 0005, Zhiyu Zhang, Yuxiang Wei, Xueran Han, Zhenheng Tang, Ronghao Chen, Huacan Wang. 33571-33602 [doi]
- Memory efficiency and resource-rational encoding in sentence processingWeijie Xu, Brian Dillon, Richard Futrell. 33603-33618 [doi]
- PRISM: Probing Reasoning, Instruction, and Source Memory in LLM HallucinationsYuhe Wu, Guangyu Wang, Yuran Chen, Jiatong Zhang, Yutong Zhang, Yujie Chen, Jiaming Shang, Guang Zhang, Zhuang Liu. 33619-33656 [doi]
- VC-Inspector: Advancing Reference-free Evaluation of Video Captions with Factual AnalysisShubhashis Roy Dipta, Tz-Ying Wu, Subarna Tripathi. 33657-33672 [doi]
- MQM Re-Annotation: A Technique for Collaborative Evaluation of Machine TranslationParker Riley, Daniel Deutsch, Mara Finkelstein, Colten DiIanni, Juraj Juraska, Markus Freitag. 33673-33684 [doi]
- Multilingual Language Models Encode Script Over Linguistic StructureAastha A K. Verma, Anwoy Chatterjee, Mehak Gupta, Tanmoy Chakraborty 0002. 33685-33719 [doi]
- ChiKhaPo: A Large-Scale Multilingual Benchmark for Evaluating Lexical Comprehension and Generation in Large Language ModelsEmily Chang, Niyati Bafna. 33720-33754 [doi]
- UniDataBench: Evaluating Data Analytics Agents Across Structured and Unstructured DataHan Weng, Zhou Liu, Yuanfeng Song, Xiaoming Yin, Xing Chen, Wentao Zhang. 33755-33780 [doi]
- Beyond Code Pairs: Dialogue-Based Data Generation for LLM Code TranslationLe Chen, Nuo Xu 0013, Winson Chen, Bin Lei, Pei-Hung Lin, Dunzhi Zhou, Rajeev Thakur, Caiwen Ding, Ali Jannesari, Chunhua Liao. 33781-33803 [doi]
- MM-PoisonRAG: Disrupting Multimodal RAG with Local and Global Knowledge Poisoning AttacksHyeonjeong Ha, Qiusi Zhan, Jeonghwan Kim, Dimitrios Bralios, Saikrishna Sanniboina, Nanyun Peng 0001, Kai-Wei Chang 0001, Daniel Kang 0001, Heng Ji 0001. 33804-33826 [doi]
- IterCOMP: Reasoning-aware Adaptive Prompt Compression for Multi-hop Question AnsweringJungmin Yun, Youngbin Kim. 33827-33840 [doi]
- Do LLMs Really Memorize Personally Identifiable Information? Revisiting PII Leakage with a Cue-Controlled Memorization FrameworkXiaoyu Luo, Yiyi Chen 0002, Qiongxiu Li, Johannes Bjerva. 33841-33861 [doi]
- Observations and Remedies for Large Language Model Bias in Self-Consuming Performative LoopYaxuan Wang, Zhongteng Cai, Yujia Bao, Xueru Zhang, Yang Liu 0018. 33862-33882 [doi]
- RAG-on-a-Diet: A Reinforcement Learning-Based Dynamic Resource Optimization Framework for RAGHongwen Ding, Yizheng Zhao. 33883-33904 [doi]
- MTSQL-R1: Towards Long-Horizon Multi-Turn Text-to-SQL via Agentic TrainingTaicheng Guo, Hai Wang, Chaochun Liu, Mohsen Golalikhani, Xin Chen, Xiangliang Zhang 0001, Chandan K. Reddy. 33905-33938 [doi]
- The Subjectivity of Respect in Police Traffic Stops: Modeling Community Perspectives in Body-Worn Camera FootagePreni Golazizian, Elnaz Rahmati, Jackson Trager, Zhivar Sourati, Nona Ghazizadeh, Georgios Chochlakis, Jose J. Alcocer, Kerby Bennett, Aarya Vijay Devnani, Parsa Hejabi, Harry G. Muttram, Akshay Kiran Padte, Mehrshad Saadatinia, Chenhao Wu, Alireza Salkhordeh Ziabari, Michael Sierra-Arévalo, Nicholas Weller, Shrikanth Narayanan, Benjamin A. T. Graham, Morteza Dehghani. 33939-33961 [doi]
- LLM-Based Multi-Task Bangla Hate Speech Detection: Type, Severity, and TargetMd. Arid Hasan, Firoj Alam, Md Fahad Hossain, Usman Naseem, Syed Ishtiaque Ahmed. 33962-33980 [doi]
- MMSciCode: Real-world Evaluation of Multilingual Multi-Discipline Scientific Research CodingXue Xia, Zheyuan Yang, Arman Cohan, Yilun Zhao 0001. 33981-33999 [doi]
- CURA: Clinical Uncertainty Risk Alignment for Language Model-Based Risk PredictionSizhe Wang, Ziqi Xu 0002, Claire Najjuuko, Charles Alba, Chenyang Lu 0001. 34000-34018 [doi]
- Unlocking the Black Box of Latent Reasoning: An Interpretability-Guided Approach to InterventionShuochen Chang, Tong Bai, Xiaofeng Zhang 0006, Qianli Ma 0008, Qingyang Liu 0008, Zhaohe Liao, Yibo Miao, Li Niu 0002. 34019-34032 [doi]
- EthicMind: A Risk-Aware Framework for Ethical-Emotional Alignment in Multi-Turn DialogueJiawen Deng, Wei Li 0308, Wentao Zhang, Ziyun Jiao, Fuji Ren. 34033-34050 [doi]
- Resolving the Security-Auditability Dilemma with Auditable Latent Chain-of-Thought AlignmentGuan Wang, Biyu Zhou, Xuehai Tang, Jizhong Han, Songlin Hu 0001. 34051-34067 [doi]
- ART: Attention Replacement Technique to Improve Factuality in LLMsZiqin Luo, Yihao Quan, Xiaofeng Zhang 0006, Xiaosong Yuan, Chen Shen 0003. 34068-34078 [doi]
- More Thinking, Less Talking: Internalizing Deliberative Safety into LLM ParametersGuan Wang, Xuehai Tang, Biyu Zhou, Jizhong Han, Songlin Hu 0001. 34079-34094 [doi]
- ToolScope: Enhancing LLM Agent Tool Use through Tool Merging and Context-Aware FilteringMarianne Menglin Liu, Daniel Garcia, Fjona Parllaku, Vikas Upadhyay, Fahad Shah, Dan Roth 0001. 34095-34119 [doi]
- PRInTS: Reward Modeling for Long-Horizon Information SeekingJaewoo Lee 0001, Archiki Prasad, Justin Chih-Yao Chen, Zaid Khan 0001, Elias Stengel-Eskin, Mohit Bansal. 34120-34138 [doi]
- Follow the Flow: On Information Flow Across Textual Tokens in Text-to-Image ModelsGuy Kaplan, Michael Toker, Yuval Reif, Yonatan Belinkov, Roy Schwartz 0001. 34139-34157 [doi]
- Fiction Flows: A Replication and Reinterpretation of Narrative SequentialityAndrew Piper, Sil Hamilton, Haiqi Zhou, Federico Pianzola. 34158-34174 [doi]
- Conjunctive Prompt Attacks in Multi-Agent LLM SystemsNokimul Hasan Arif, Qian Lou, Mengxin Zheng. 34175-34191 [doi]
- Evaluating Visual Narrative Coherence in Story Visualization via Diversified StorylinesMinha Jhang, Kyeongman Park, Hyukhun Koh, Kyomin Jung. 34192-34207 [doi]
- Rethinking the Idiomaticity Decomposability Hypothesis: Evidence from Distributional LearningMaggie Mi, Golzar Atefi, Atsuki Yamaguchi, Felix A. Gers, Aline Villavicencio, Nafise Sadat Moosavi. 34208-34229 [doi]
- KinyaProp: Fine-Grained Propaganda Annotation in KinyarwandaManzi Fabrice Niyigaba, Ivory Yang, Soroush Vosoughi. 34230-34243 [doi]
- Revisiting Audio-language Pretraining for Learning General-purpose Audio RepresentationWei-Cheng Tseng, Xuanru Zhou, Mingyue Huo, Yiwen Shao, Hao Zhang 0112, Dong Yu 0001. 34244-34263 [doi]
- Trajectory Signatures of Deception in Large Language ModelsViraaji Mothukuri, Reza M. Parizi. 34264-34276 [doi]
- Improving the Distributional Alignment of LLMs using SupervisionGauri Kambhatla, Sanjana Gautam, Angela Zhang, Alexander Liu, Ravi Srinivasan, Junyi Jessy Li, Matthew Lease. 34277-34305 [doi]
- SMARTER: A Data-efficient Framework to Improve Toxicity Detection with Explanation via Self-augmenting Large Language ModelsHuy Nghiem, Advik Sachdeva, Hal Daumé III. 34306-34332 [doi]
- GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual AgentsYunzhe Wang, Runhui Xu, Kexin Zheng, Tianyi Zhang, Jayavibhav Niranjan Kogundi, Soham Hans, Volkan Ustun. 34333-34355 [doi]
- DeepFact: Co-Evolving Benchmarks and Agents for Deep Research FactualityYukun Huang, Leonardo F. R. Ribeiro, Momchil Hardalov, Bhuwan Dhingra, Markus Dreyer, Venkatesh Saligrama. 34356-34386 [doi]
- R1-RE: Cross-Domain Relation Extraction with RLVRRunpeng Dai, Tong Zheng, Run Yang, Kaixian Yu, Hongtu Zhu. 34387-34401 [doi]
- Training LLMs for Divide-and-Conquer Reasoning Elevates Test-Time ScalabilityXiao Liang, Zhong-Zhi Li, Zhenghao Lin, Eric Hanchen Jiang, Hengyuan Zhang, Yelong Shen, Kai-Wei Chang 0001, Ying Nian Wu, Yeyun Gong, Weizhu Chen. 34402-34427 [doi]
- ClaimDB: A Fact Verification Benchmark over Large Structured DataMichael Theologitis, Preetam Prabhu Srikar Dammu, Chirag Shah 0001, Dan Suciu. 34428-34451 [doi]
- PluRule: A Benchmark for Moderating Pluralistic Communities on Social MediaZoher Kachwala, Bao Tran Truong, Rasika Muralidharan, Haewoon Kwak, Jisun An, Filippo Menczer. 34452-34471 [doi]
- What Makes a Good Curriculum? Disentangling the Effects of Data Ordering on LLM Mathematical ReasoningYaning Jia, Chunhui Zhang, Xingjian Diao, Xiangchi Yuan, Zhongyu Ouyang, Chiyu Ma, Soroush Vosoughi. 34472-34488 [doi]
- CASS: Nvidia to AMD Transpilation with Data, Models, and BenchmarkAhmed Heakl, Gustavo Bertolo Stahl, Sarim Hashmi, Seung Hun Eddie Han, Mukul Ranjan, Arina Kharlamova, Salman Khan 0001, Abdulrahman Mahmoud. 34489-34508 [doi]
- SAHM: A Benchmark for Arabic Financial and Shari'ah-Compliant ReasoningRania Elbadry, Sarfraz Ahmad, Ahmed Heakl, Dani Bouch, Momina Ahsan, Muhra AlMahri, Marwa Elsaid Khalil, Yuxia Wang 0003, Salem Lahlou, Sophia Ananiadou, Veselin Stoyanov, Jimin Huang, Xueqing Peng, Preslav Nakov, Zhuohan Xie. 34509-34536 [doi]
- Confident, Calibrated, or Complicit: Safety Alignment and Ideological Bias in LLM Hate Speech DetectionSanjeevan Selvaganapathy, Mehwish Nasim. 34537-34552 [doi]
- Aligning Large Language Models via Fully Self-Synthetic DataShangjian Yin, Zhepei Wei, Xinyu Zhu, Wei-Lin Chen, Yu Meng 0001. 34553-34568 [doi]
- Corpus-Dependent Subcharacter Encoding via HMM-Guided Code AssignmentTatsuya Hiraoka. 34569-34593 [doi]
- DRInQ: Evaluating Conversational Implicature with Controlled Context VariationHirona Jacqueline Arai, Xiang Ren 0001. 34594-34611 [doi]
- From Individual to Common: An Early Exploration of Consensus in Non-verifiable Data for Balanced Preference OptimizationShangjian Yin, Zhouxing Shi. 34612-34630 [doi]
- RIMRULE: Improving Tool-Using Language Agents via MDL-Guided Rule LearningXiang Gao 0011, Yuguang Yao, Qi Zhang, Kaiwen Dong, Avinash Baidya, Ruocheng Guo, Hilaf Hasson, Kamalika Das. 34631-34646 [doi]
- GAM: Hierarchical Graph-based Agentic Memory for LLM AgentsZhaofen Wu, Hanrong Zhang, Fulin Lin, Wujiang Xu, Xinran Xu, Yankai Chen 0001, Henry Peng Zou, Shaowen Chen, Weizhi Zhang 0001, Xue Liu 0001, Philip S. Yu, Hongwei Wang. 34647-34664 [doi]
- CypherSmith: Transforming Text-to-Cypher Generation for LLMs with Synthetic DataZeyu Zhang, Kexuan Sun 0002, Zheng Tang, Jens-S. Vöckler, Thien Huu Nguyen, Thuy Vu. 34665-34682 [doi]
- New Terms, New Toxicity: Consensus-based Chinese Neologism Toxicity Detection via Search-Augmented LLMsShiyao Cui, Qinglin Zhang, Di Wang, Yida Lu, Zhexin Zhang, Jinhua Gao, Jinglin Yang, Min He, Han Qiu 0001, Minlie Huang. 34683-34701 [doi]
- ATGL: An Adaptive-Threshold Global Loss for Document-level Relation ExtractionHuangming Xu, Fu Zhang 0001, Zhixuan Yang, Lu Zhang, Jingwei Cheng. 34702-34716 [doi]
- L2Dir: Integrating L_2-Norm and Directional Alignment for Unsupervised Contrastive Representation Learning in Multimodal RetrievalTianyu Zong, Rui Dai, Hongzhu Yi, Yuanxiang Wang, Zhenghao Zhang, Zhenyu Guan, Yujia Yang, Bingkang Shi, Yueyang Ding, Xiangxiang Chu, Kaikui Liu, Jungang Xu. 34717-34740 [doi]
- Towards Intrinsic Interpretability of Large Language Models: A Survey of Design Principles and ArchitecturesYutong Gao, Qinglin Meng, Yuan Zhou, Liangming Pan. 34741-34754 [doi]
- ScholaWrite: A Dataset of End-to-End Scholarly WritingKhanh Chi Le, Linghe Wang, Minhwa Lee, Ross Volkov, Luan Tuyen Chau, Dongyeop Kang. 34755-34788 [doi]
- What Deserves Memory: Adaptive Memory Distillation for LLM AgentsWenquan Ma, Jiayan Nan, Wenlong Wu. 34789-34812 [doi]
- SOAPTriage: SOAP-Guided Multi-View Clinical Text Modeling Framework for Automated ESI PredictionEnming Wang, Jianlei Wang, Xueping Peng, Hongjiao Guan, Yinglong Wang 0001, Sibo Wei, Jianbin Guo, Ruifeng Xu 0001, Wenpeng Lu. 34813-34837 [doi]
- MoRI: Learning Motivation-Grounded Reasoning for Scientific Ideation in Large Language ModelsChenyang Gu, Jiahao Cheng, Meicong Zhang, Pujun Zheng, Jinquan Zheng, Guoxiu He. 34838-34869 [doi]
- WSDPO: A Generative Word Sense Disambiguation Framework with Chain-of-Thought and Preference OptimizationKunpeng Kang, Shuaimin Li, Kaiyuan Zhang, Luyang Zhang, Jiasheng Si, Bing Xu, Kehai Chen, Muyun Yang, Wenpeng Lu. 34870-34889 [doi]
- From Regulatory Approvals to Patents: Cross-Domain Linking for Cardiovascular Device TraceabilityQingqing Yang, Haijiang Liu, Moyan Li. 34890-34906 [doi]
- TrustTable: A Neuro-Symbolic Auditing Framework for Faithful Table QAGuangzhen Zhao, Dechang Kong, Tongyu Wu, Zhenjiang Dong. 34907-34934 [doi]
- Lizard: An Efficient Linearization Framework for Large Language ModelsChien Van Nguyen, Huy Huu Nguyen, Ruiyi Zhang 0002, Hanieh Deilamsalehy, Puneet Mathur, Viet Dac Lai, Haoliang Wang, Jayakumar Subramanian, Ryan A. Rossi, Trung Bui, Nikos Vlassis, Franck Dernoncourt, Thien Huu Nguyen. 34935-34948 [doi]
- TPS-Bench: Evaluating AI Agents' Tool Planning & Scheduling Abilities in Compounding TasksHanwen Xu, Xuyao Huang, Yuzhe Liu, Zhijie Deng. 34949-34961 [doi]
- S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech ModelsFeng Jiang 0007, Zhiyu Lin, Yiyang Liu, Liumeng Xue, Fan Bu, Yuhao Du, Xiangying Chen, Benyou Wang, Haizhou Li 0001. 34962-34978 [doi]
- Can LLM Safety Be Ensured by Constraining Parameter Regions?Zongmin Li, Jian Su, Farah Benamara, Aixin Sun. 34979-35011 [doi]
- CityVG: Contrastive Fine-Tuning and Reward-Based Chain-of-Thought Reasoning for Zero-Shot City-Scale 3D Visual GroundingJianjun Zhang, Hanli Wang. 35012-35031 [doi]
- E2EDev: Benchmarking Large Language Models in End-to-End Software Development TaskJingyao Liu, Chen Huang 0006, Zhizhao Guan, Wenqiang Lei, Yang Deng 0002. 35032-35068 [doi]
- Reasoning While Asking: Transforming Reasoning Large Language Models from Passive Solvers to Proactive InquirersXin Chen 0032, Feng Jiang, Yiqian Zhang, Hardy Chen, Shuo Yan, Wenya Xie, Min Yang 0007, Shujian Huang. 35069-35090 [doi]
- Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented GenerationWeiqing Luo, Zongye Hu, Xiao Wang, Zhiyuan Yu, Haofeng Zhang 0008, Ziyi Huang. 35091-35124 [doi]
- Mitigating Selection Bias in Large Language Models via Permutation-Aware GRPOJinquan Zheng, Jia Yuan, Jiacheng Yao, Chenyang Gu, Pujun Zheng, Guoxiu He. 35125-35143 [doi]
- KG-ViP: Bridging Knowledge Grounding and Visual Perception in Multi-modal LLMs for Visual Question AnsweringZhiyang Li, Ao Ke, Yukun Cao, Xike Xie. 35144-35157 [doi]
- Reinforcement Learning-Guided Adaptive Tuning for Out-of-Distribution Harmful Text DetectionMengyu Xiang, Tinghao Chen, Boxu Han, Qiudan Li, Shu Wu, Daniel Dajun Zeng. 35158-35174 [doi]
- SOAR: Supervision from Observation for Agentic Reinforcement LearningMeng Li, Lei Li, Xiting Wang, Yi Yuan, Zheng Wei, Jiang Bian, Zang Li. 35175-35197 [doi]
- Business as Rulesual: A Benchmark and Framework for Business Rule Flow Modeling with LLMsChen Yang, Ruping Xu, Ruizhe Li, Bin Cao, Jing Fan. 35198-35220 [doi]
- Specializing Large Models for Oracle Bone Script Interpretation via Component-Grounded Multimodal Knowledge AugmentationJianing Zhang, Runan Li, Honglin Pang, Ding Xia, Zhou Zhu, Qian Zhang, Chuntao Li, Xi Yang 0017. 35221-35236 [doi]
- HyperMem: Hypergraph Memory for Long-Term ConversationsJuwei Yue, Chuanrui Hu, Jiawei Sheng, Zuyi Zhou, Wenyuan Zhang 0002, Tingwen Liu, Li Guo 0001, Yafeng Deng. 35237-35254 [doi]
- LeLoRA: Learnable Low-Rank Adaptation of Large Language ModelsXiaoling Zhou, Mingjie Zhang, Zhemg Lee, Wei Ye 0004, Shikun Zhang. 35255-35273 [doi]
- Gated Tree Cross-Attention for Checkpoint-Compatible Syntax Injection in Decoder-Only LLMsXinyu Gao, Shaonan Wang, Nai Ding. 35274-35288 [doi]
- DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary DomainSong Jin, Juntian Zhang, Xun Zhang, Zeying Tian, Fei Jiang, Guojun Yin, Wei Lin, Yong Liu, Rui Yan 0001. 35289-35310 [doi]
- Octopus: Gated Selective Attention for Memory-Bounded Long-Context Inference in Large Language ModelsChien Van Nguyen, Ryan A. Rossi, Linh Ngo Van 0001, Franck Dernoncourt, Thien Huu Nguyen. 35311-35323 [doi]
- SAME: Safety-Aware Model Editing Guided by Safety TransformationJiayi Wang, Shipeng Wang 0002, Ji Wu, Jian Sun 0009. 35324-35343 [doi]
- Where the Cat Sat: A Multilingual Framework for Spatial Language UnderstandingDemian Inostroza Améstica, Ekaterina Vylomova, Charles Kemp, Mae Carroll, Wanchun Li, Meladel Mistica. 35344-35362 [doi]
- LCMA-SRT: Language-Conditional Mixture-of-Experts Adapters for Joint Multilingual Speech Recognition and TranslationNanjie Li, Xiaoyong Guo, Hao Huang 0009, Haihua Xu 0001, Wei Shi. 35363-35377 [doi]
- DefGen-Bench: A Benchmark for Chinese Criminal Defence Opinion Generation in LegalAISenbo Zhang, Qiqi Wang 0005, Fanghao Lou, Guanyu Chen, Yihong Pan, Huijia Li, Qian Liu 0012. 35378-35392 [doi]
- Escaping the Echo Trap: On Credit Assignment Failure in Multi-turn LLM Self-ReflectionLinxuan Du, Guangquan Xue, Xiaobo Liang, Qipeng Huang, Yuyang Ding, Xinyu Shi 0005, Zhang Yijun, Ji Qi, Wenpeng Zhu, Juntao Li 0005, Min Zhang 0005. 35393-35405 [doi]
- ARF-RLHF: Adaptive Reward-Following for RLHF through Emotion-Driven Self-Supervision and Trace-Biased Dynamic OptimizationYuxuan Zhang. 35406-35425 [doi]
- SMART: Evaluating LLMs' Mathematical Reasoning via a Human Cognitive Process-Inspired BenchmarkYujie Hou, Mei Wang, Yaoyao Zhong, Ting Zhang 0002, Xuetao Ma 0001, Hua Huang 0001. 35426-35452 [doi]
- Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language ModelsYanbin Yin, Kun Zhou 0002, Zhen Wang 0041, Xiangdong Zhang, Yifei Shao, Shibo Hao, Yi Gu 0002, Jieyuan Liu, Somanshu Singla, Tianyang Liu 0003, Eric P. Xing, Zhengzhong Liu 0001, Haojian Jin, Zhiting Hu. 35453-35469 [doi]
- LBLLM: Lightweight Binarization of Large Language Models via Three-Stage DistillationSiqing Song, Chuang Wang 0007, Yong Lang, Yi Yang, Xu-Yao Zhang. 35470-35484 [doi]
- SeDev: Structured Semantic Exploration for LLM-Driven Code GenerationRonghui Yang, Jie Liu, Jiajie Zeng, Jiexin Wang, Jiuchuan Jiang, Bo An 0001, Yi Cai 0001, Mengchen Zhao. 35485-35512 [doi]
- EVM-QuestBench: An Execution-Grounded Benchmark for Natural-Language Transaction Code GenerationPei Yang, Wanyi Chen, Ke Wang, Lynn Ai, Eric Yang, Tianyu Shi. 35513-35529 [doi]
- TIGER: Text-Informed Generalized Enzyme-Reaction RetrievalYuhang Zhang, Keyan Ding, Peilin Chen 0001, Han Liu, Can Lin, Ruixi Chen, Shiqi Wang 0001, Qi Song 0004. 35530-35548 [doi]
- MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment GroundingFuwen Luo, Shengfeng Lou, Chi Chen 0005, Ziyue Wang 0002, Chenliang Li 0003, Weizhou Shen, Jiyue Guo, Peng Li 0030, Ming Yan 0008, Ji Zhang 0011, Fei Huang 0002, Yang Liu 0005. 35549-35561 [doi]
- User Perceptions vs. Proxy LLM Judges: Privacy and Helpfulness in LLM Responses to Privacy-Sensitive ScenariosXiaoyuan Wu, Roshni Kaushik, Wenkai Li, Lujo Bauer, Koichi Onoue. 35562-35579 [doi]
- HARPO: Hierarchical Agentic Reasoning for User-Aligned Conversational RecommendationSubham Raj, Aman Vaibhav Jha, Mayank Anand, Sriparna Saha 0001. 35580-35599 [doi]
- ShopSimulator: Evaluating and Exploring RL-Driven LLM Agent for Shopping AssistantsPei Wang, Yanan Wu, Xiaoshuai Song, Weixun Wang, Gengru Chen, Zhongwen Li, Kezhong Yan, Qi Liu, Ken Deng, Shuaibing Zhao, Shaopan Xiong, Xuepeng Liu, XueFeng Chen, Wanxi Deng, Wenbo Su, Bo Zheng. 35600-35619 [doi]
- NL \Rightarrow Schedule: Evaluate Multitask Scheduling Capability of Large Language ModelsWenrui Liao, Weihong Du, Yi Li, Hongru Liang, Wenqiang Lei. 35620-35640 [doi]
- SLICEFORMER: Static Program Slicing Using Language Models With Dataflow-Aware Pretraining and Constrained DecodingPengfei He, Shaowei Wang 0002, Tse-Hsun Chen, Muhammad Asaduzzaman. 35641-35652 [doi]
- SCOPE: Boosting LLM Efficiency with Scoped Position EncodingQingGuo Qi, Hongyang Chen 0001, Zhao Li. 35653-35673 [doi]
- Debate-of-Thoughts: Resolving Knowledge Conflicts in LLMs Through Internal DeliberationGuocong Li, Qirui Hu, Ping Wang, Guofeng Zhang 0001, Jian Wu 0001, Hongxia Xu. 35674-35696 [doi]
- Projecting Out the Malice: A Global Subspace Approach to LLM DetoxificationZenghao Duan, Zhiyi Yin, Zhichao Shi 0001, Liang Pang 0001, Shaoling Jing, Zihe Huang, Jiayi Wu, Yu Yan, Jingcheng Deng, Huawei Shen, Xueqi Cheng. 35697-35719 [doi]
- From Local to Global: Revisiting Structured Pruning Paradigms for Large Language ModelsZiyan Wang, Enmao Diao, Qi Le, Pu Wang, Minwoo Lee, Shu-ping Yeh, Evgeny Stupachenko, Hao Feng, Li Yang. 35720-35739 [doi]
- Audio MultiChallenge: A Multi-Turn Evaluation of Spoken Dialogue Systems on Natural Human InteractionAdvait Gosai, Tyler Vuong, Utkarsh Tyagi, Steven Li, Wenjia You, Miheer Bavare, Arda Uçar, Zhongwang Fang, Brian Jang, Bing Liu, Yunzhong He. 35740-35770 [doi]
- GenomeQA: Benchmarking General Large Language Models for Genome Sequence UnderstandingWeicai Long, Yusen Hou, Junning Feng 0001, Houcheng Su, Shuo Yang, Donglin Xie, Yanlin Zhang. 35771-35792 [doi]
- VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAGHonghao Fu, Miao Xu, Yiwei Wang 0001, Dailing Zhang, Jun Liu 0036, Yujun Cai. 35793-35805 [doi]
- Massively Multilingual Joint Segmentation and GlossingMichael Ginn, Lindia Tjuatja, Enora Rice, Ali Marashian, Maria R. Valentini, Jasmine Xu, Graham Neubig, Alexis Palmer. 35806-35820 [doi]
- TexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX ReconstructionChengye Wang, Lin Fu, Zexi Kuang, Yilun Zhao 0001. 35821-35845 [doi]
- If an LLM Were a Character, Would It Know Its Own Story? Evaluating Lifelong Learning in LLMsSiqi Fan 0001, Xiusheng Huang, Yiqun Yao, Xuezhi Fang, Kang Liu 0001, Peng Han 0005, Shuo Shang, Aixin Sun, Yequan Wang. 35846-35858 [doi]
- Graph Reasoning Paradigm: Structured and Symbolic Reasoning with Topology-Aware Reinforcement Learning for Large Language ModelsRunxuan Liu, Xianhao Ou, Xinyan Ma, Jiyuan Wang, Jiafeng Liang, Jiaqi Li 0004, Tao He 0014, Zheng Chu, Rongchuan Mu, Zekun Wang 0001, Baoxin Wang, Dayong Wu, Ming Liu 0004, Shijin Wang 0001, Guoping Hu, Bing Qin 0001. 35859-35881 [doi]
- LLM-Powered Benchmark Factory: Reliable, Generic, and EfficientPeiwen Yuan, Shaoxiong Feng, Yiwei Li 0001, Xinglin Wang, Yueqi Zhang, Jiayi Shi, Chuyi Tan, Boyuan Pan, Yao Hu 0002, Kan Li 0001. 35882-35903 [doi]
- COSMOS: Connectivity-Oriented Submodular Maximization for Optimal Subgraph RetrievalBoci Peng, Xiao Liu 0029, Boren Hu, Yun Zhu 0007, Xuanbo Fan, Yanwei Yue, Chunyu Yang 0005, Yan Zhang 0117. 35904-35924 [doi]
- Attn-GS: Attention-Guided Context Compression for Efficient Personalized LLMsShenglai Zeng, Tianqi Zheng, Chuan Tian, Dante Everaert, Yau-Shian Wang, Yupin Huang, Michael J. Morais, Rohit Patki, Jinjin Tian, Xinnan Dai, Kai Guo 0003, Monica Xiao Cheng, Hui Liu 0031. 35925-35946 [doi]
- Structured Semantic Information Helps Retrieve Better Examples for In-Context Learning Applied to Few-Shot Relation ExtractionAunabil Chakma, Mihai Surdeanu, Eduardo Blanco 0002. 35947-35971 [doi]
- DUD: Decoupled Update Dynamics for Reliable Uncertainty Quantification in Large Language ModelsYixin Bu, Runze Xia, Guanyun Zou, Yupeng Ji, Hongliang Dai, Haodong Liu, Piji Li. 35972-35993 [doi]
- JurisBench: A Deep Benchmark for Assessing Large Language Models in Professional Legal PracticeZiang Chen, Guannan Li, Fanlin Ji, Yipeng Kang, Jiaqi Li 0021, Muhan Zhang, Yangtao Zhang, Li Tianjiao, Jiannan Wang, Xin Guo, Song Chun Zhu, Bin Ling. 35994-36018 [doi]
- LeCoDe: A Benchmark Dataset for Interactive Legal Consultation Dialogue EvaluationWeikang Yuan, Kaisong Song, Zhuoren Jiang, Junjie Cao 0003, Yujie Zhang, Jun Lin, Kun Kuang 0001, Ji Zhang, Xiaozhong Liu 0001. 36019-36048 [doi]
- METER: Evaluating Multi-Level Contextual Causal Reasoning in Large Language ModelsPengfeng Li, Chen Huang 0006, Chaoqun Hao, Hongyao Chen, Xiao-Yong Wei, Wenqiang Lei, See-Kiong Ng. 36049-36073 [doi]
- PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric RecordsYibo Lyu, Gongwei Chen, Rui Shao 0001, Weili Guan, Liqiang Nie. 36074-36089 [doi]
- Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task PlanningTianyi Men, Zhuoran Jin, Pengfei Cao, Yubo Chen 0001, Kang Liu 0001, Jun Zhao 0001. 36090-36108 [doi]
- "Excuse me, may I say something..." CoLabScience, A Proactive AI Assistant for Biomedical Discovery and LLM-Expert CollaborationsYang Wu, Jinhong Yu, Jingwei Xiong, Zhimin Tao, Xiaozhong Liu 0001. 36109-36129 [doi]
- Knowledge-driven Augmentation and Retrieval for Integrative Temporal AdaptationWeisi Liu, Guangzeng Han, Xiaolei Huang 0002. 36130-36143 [doi]
- SAD: A Large-Scale Strategic Argumentative Dialogue DatasetYongkang Liu 0002, Jiayang Yu, Mingyang Wang 0003, Yiqun Zhang, Ercong Nie, Shi Feng 0001, Daling Wang, Kaisong Song, Hinrich Schütze. 36144-36164 [doi]
- PICTURE: Enhancing Theory-of-Mind in Large Language Models by Revealing, Not Hiding, Characters' Lack of KnowledgeEojin Jeon, SangKeun Lee 0001. 36165-36192 [doi]
- Union-of-Experts: Neurons in Mixture-of-Experts are Secretly RoutersSonghao Wu, Ang Lv, Ruobing Xie, Samm Sun, Di Wang 0052, Rui Yan 0001, Yankai Lin 0001. 36193-36206 [doi]
- ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment FrameworkKai Qin, Liangxin Liu, Yu Liang, Longzheng Wang, Yan Wang 0165, Yueyang Zhang, Long Xia, Zhiyuan Sun, Houde Liu, Daiting Shi. 36207-36223 [doi]
- SQL-Trail: Multi-Turn Reinforcement Learning with Interleaved Feedback for Text-to-SQLHarper Hua, Zhen Han, Zhengyuan Shen, Meng-Chieh Lee, Sheng Guan, Qi Zhu 0008, Sullam Jeoung, Yueyan Chen, Yunfei Bai, Shuai Wang, Vassilis N. Ioannidis, Huzefa Rangwala. 36224-36246 [doi]
- Bootstrapping Code Translation with Weighted Multilanguage ExplorationYuhan Wu 0006, Huan Zhang 0019, Wei Cheng 0010, Chen Shen, Jingyue Yang, Wei Hu 0007. 36247-36259 [doi]
- Flow-Based Page Unique Semantic Mapping Architecture for Document Visual Question AnsweringHaosen Wang, Jing Xiao, Chaochao Du, Xiaowang Zhang, Zhiyong Feng 0002. 36260-36280 [doi]
- Pub-LawBench: Public-Oriented Benchmarking for LegalAIQiaoyu Zheng, Zehan Ma, Yijing Zhang, Qiqi Wang 0005, Huijia Li, Qian Liu 0012. 36281-36303 [doi]
- SWAN: Semantic Watermarking with Abstract Meaning RepresentationZiping Ye, Gourab Dey, Christos Christodoulopoulos 0001, Charith Peris, Anil Ramakrishna, Weitong Ruan, Aram Galstyan, Kai-Wei Chang 0001, Rahul Gupta 0001, Ninareh Mehrabi. 36304-36315 [doi]
- Turning Failures into Value: Negative Experience Replay for RLVR via Confidence Gating and Boundary Failure SamplingJiaLiang Guo, Fucheng Xiong, Xu He, Haodong Zhao, Xingyang Li, Ke Zeng, Xunliang Cai. 36316-36334 [doi]
- LazyEviction: Lagged KV Eviction with Attention Pattern Observation for Efficient Long ReasoningHaoyue Zhang, Hualei Zhang, Xiaosong Ma, Jie Zhang 0076, Song Guo 0001. 36335-36352 [doi]
- Diversity in Unity, Theory in Practice: Hierarchical Multitask Benchmarks for Chinese Minority LanguagesYijie Li 0005, Xi Cao, Yuan Sun 0010, Quulgan Minggad, Abdulla Ablikim, Jia Qing Cai Wang. 36353-36373 [doi]
- LangSAE Editing: Improving Multilingual Information Retrieval via Post-hoc Language Identity RemovalDongjun Kim, Jeongho Yoon, Chanjun Park, HeuiSeok Lim. 36374-36389 [doi]
- Interpretable Traces, Unexpected Outcomes: Investigating the Disconnect in Trace-Based Knowledge DistillationSiddhant Bhambri, Upasana Biswas, Subbarao Kambhampati. 36390-36408 [doi]
- SpecMind: Cognitively Inspired, Interactive Multi-Turn Framework for Postcondition InferenceCuong Chi Le, Minh V. T. Pham, Tung Duy Vu, Cuong Duc Van, Huy Nhat Phan, Hoang Nhat Phan, Tien N. Nguyen. 36409-36424 [doi]
- Memorization, Emergence, and Explaining Reversal Failures: A Controlled Study of Relational Semantics in LLMsYihua Zhu 0002, Qianying Liu, Jiaxin Wang, Fei Cheng 0002, Chaoran Liu, Akiko Aizawa, Sadao Kurohashi, Hidetoshi Shimodaira. 36425-36443 [doi]
- Framing Political Bias in Multilingual LLMs Across Pakistani LanguagesAfrozah Nadeem, Mark Dras, Usman Naseem. 36444-36486 [doi]
- InsAT: Instance-aware Semantic Alignment and Transfer from Human-Object Keypoints for Zero-to-Few-shot Action UnderstandingKazuki Tsutsukawa. 36487-36504 [doi]
- Multi-View Attention Multiple-Instance Learning Enhanced by LLM Reasoning for Cognitive Distortion DetectionJun Seo Kim, Hyemi Kim, Woo Joo Oh, Hongjin Cho, Hochul Lee, Hye Hyeon Kim. 36505-36525 [doi]
- CHAIRO: Contextual Hierarchical Analogical Induction and Reasoning Optimization for LLMsHaotian Lu 0011, Yuchen Mou, Bingzhe Wu. 36526-36537 [doi]
- Test of Time: Rethinking Temporal Signal of Benchmark ContaminationTerry Jingchen Zhang, Gopal Dev, Ning Wang, Max Obreiter, Wenyuan Jiang, Punya Syon Pandey, Keenan Samway, Yinya Huang, Bernhard Schölkopf, Mrinmaya Sachan, Zhijing Jin 0001. 36538-36555 [doi]
- An Existence Proof for Neural Language Models That Can Explain Garden-Path Effects via SurprisalRyo Yoshida, Shinnosuke Isono, Taiga Someya, Yohei Oseki, Tatsuki Kuribayashi. 36556-36569 [doi]
- How Context Shapes Truth: Geometric Transformations of Statement-level Truth Representations in LLMsShivam Adarsh, Maria Maistro, Christina Lioma. 36570-36590 [doi]
- Mitigating Tokenization-Induced Distance Distortion in Long-Context Multilingual Machine TranslationKhotso Selialia, Antoine Nzeyimana, Fatima M. Anwar 0001. 36591-36602 [doi]
- Probing Audio-Visual Reasoning in Multimodal Language Models through the Lens of AudioKaixiong Gong, Kaituo Feng, BoHao Li, Yibing Wang, Mofan Cheng, Shijia Yang, Jiaming Han, Benyou Wang, Yutong Bai, Zhuoran Yang, Xiangyu Yue 0001. 36603-36645 [doi]
- Reasoning Hijacking: The Fragility of Reasoning Alignment in Large Language ModelsYuansen Liu, Yixuan Tang, Anthony Kum Hoe Tung. 36646-36665 [doi]
- The Dominance of Text Space: Unveiling the Asymmetric Nature of Cross-Modal Alignment in Large Language ModelsLinqing Chen, Hanmeng Zhong, Wentao Wu, Peng Zhou. 36666-36678 [doi]
- Towards Explainable Diagnosis: A Self-learned Explanatory Knowledge Base ApproachDongqi Huang, Tong Zhou 0014, Zhuoran Jin, Shenghui Shi, Yujiao Mao, Kang Liu 0001, Jun Zhao 0001, Yubo Chen 0001. 36679-36700 [doi]
- WildFeedback: Aligning LLMs With In-situ User Interactions And FeedbackTaiwei Shi, Zhuoer Wang, Longqi Yang 0001, Ying Chun Lin, Zexue He, Mengting Wan, Pei Zhou, Sujay Kumar Jauhar, Sihao Chen, Shan Xia, Hongfei Zhang, Jieyu Zhao 0001, Xiaofeng Xu, Xia Song, Jennifer Neville. 36701-36725 [doi]
- SSG: Logit-Balanced Vocabulary Partitioning for LLM WatermarkingChenxi Gu, Xiaoning Du 0001, John C. Grundy. 36726-36737 [doi]
- PaT: Planning-after-Trial for Efficient Test-Time Code GenerationYoungsik Yoon, Sungjae Lee, Seockbean Song, Siwei Wang 0002, Wei Chen 0013, Jungseul Ok. 36738-36755 [doi]
- Joint Knowledge Base Completion and Question Answering by Combining Large Language Models and Small Language ModelsYinan Liu 0001, Dongying Lin, Sigang Luo, Xiaochun Yang 0001, Bin Wang 0065. 36756-36775 [doi]
- Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search SystemsYilun Zhao 0001, Jinbiao Wei, Tingyu Song, Siyue Zhang, Chen Zhao 0013, Arman Cohan. 36776-36806 [doi]
- The Role of Mixed-Language Documents for Multilingual Large Language Model PretrainingJiandong Shao, Raphael Tang, Crystina Zhang, Karin Sevegnani, Pontus Stenetorp, Jianfei Yang, Yao Lu. 36807-36818 [doi]
- ARCHITECT: Uncertainty-Aware Dynamic Tool Learning via Causal Intervention for Open-World AgentsZhangyi Wang, Jiexiang Xu, Bingnan Yu, Zongze Li 0001. 36819-36829 [doi]
- ES4R: Speech Encoding Based on Prepositive Affective Modeling for Empathetic Response GenerationZhuoyue Gao, Xiaohui Wang, Xiaocui Yang, Wen Zhang, Daling Wang, Shi Feng 0001, Yifei Zhang 0003. 36830-36847 [doi]
- MAGMA: A Multi-Graph based Agentic Memory Architecture for AI AgentsDongming Jiang, Yi Li, Guanpeng Li, Bingzhe Li. 36848-36865 [doi]
- The Side Effects of Being Smart: Safety Risks in MLLMs' Multi-Image ReasoningRenmiao Chen, Yida Lu, Shiyao Cui, Xuan Ouyang, Victor Shea-Jay Huang, Shumin Zhang, Chengwei Pan, Han Qiu 0001, Minlie Huang. 36866-36882 [doi]
- Action Boundary Blindness: When LLM Agents Cannot Tell Where One Action Ends and Another BeginsZhangyi Wang, Bingnan Yu, Jiexiang Xu, Zongze Li. 36883-36899 [doi]
- Verbal-R3: Verbal Reranker as the Missing Bridge between Retrieval and ReasoningSangkwon Park, Donghun Kang, Jisoo Mok, Sungroh Yoon. 36900-36918 [doi]
- IGenBench: Benchmarking the Reliability of Text-to-Infographic GenerationYinghao Tang, Xueding Liu, Boyuan Zhang, Tingfeng Lan, Yupeng Xie, Jiale Lao, Yiyao Wang, Haoxuan Li, Tingting Gao, Bo Pan 0004, Luoxuan Weng, Xiuqi Huang, Minfeng Zhu 0001, Yingchaojie Feng, Yuyu Luo, Wei Chen 0001. 36919-36954 [doi]
- ProMedical: Hierarchical Fine-Grained Criteria Modeling for Medical LLM Alignment via Explicit InjectionHe Geng, Yangmin Huang, Lixian Lai, Qianyun Du, hui Chu, Zhiyang He, Jiaxue Hu, Xiaodong Tao. 36955-36994 [doi]
- R2IF: Aligning Reasoning with Decisions via Composite Rewards for Interpretable LLM Function CallingAijia Cheng, Kailong Wang 0001, Ling Shi 0002, Yongxin Zhao. 36995-37008 [doi]
- From Detection to Understanding: Multi-Turn Reasoning for Video Misinformation AnalysisZhi Zeng 0001, Jiaying Wu, Minnan Luo, Di Zhang, Yifei Yang, Xiangzheng Kong, Herun Wan, Zihan Ma 0010. 37009-37027 [doi]
- Frozen LLMs are Native Decoders for High-Norm Semantic VectorsYunsheng Zeng, Yongmei Tan. 37028-37043 [doi]
- Enhancing Reinforcement Learning for Radiology Report Generation with Evidence-aware Rewards and Self-correcting Preference LearningQin Zhou 0002, Guoyan Liang, Qianyi Yang, Jingyuan Chen, Sai Wu, Chang Yao 0001, Zhe Wang 0002. 37044-37056 [doi]
- VisAidMath: Benchmarking Visual-Aided Mathematical ReasoningJingkun Ma, Runzhe Zhan, Yang Li, Di Sun, Hou Pong Chan, Lidia S. Chao, Derek F. Wong. 37057-37103 [doi]
- RISK: A Framework for GUI Agents in E-commerce Risk ManagementRenqi Chen, Zeyin Tao, Jianming Guo, Jingzhe Zhu, Yiheng Peng, Qingqing Sun, Tianyi Zhang, Shuai Chen. 37104-37120 [doi]
- MiniRAG: A Lightweight RAG system with Small Language ModelsTianyu Fan, Jingyuan Wang 0001, Xubin Ren, Chao Huang 0001. 37121-37144 [doi]
- Glyph: Scaling Context Windows via Visual-Text CompressionJiale Cheng, Yusen Liu, Xinyu Zhang, Yulin Fei, Wenyi Hong, Ruiliang Lyu, Weihan Wang, Zhe Su, Xiaotao Gu, Xiao Liu 0036, Yushi Bai, Jie Tang 0001, Hongning Wang, Minlie Huang. 37145-37158 [doi]
- TA-GRPO-d: Trajectory-Aware GRPO for Optimizing Denoising Trajectories in Diffusion LLMsGyunyeop Kim, Sangwoo Kang 0002. 37159-37174 [doi]
- AG-GRPO: Answer-Guided GRPO for Masked Diffusion Language ModelsJuhyeong Kim 0001, Gyunyeop Kim, Sangwoo Kang 0002. 37175-37191 [doi]
- Grammar as Control: Modular Language Generation for the Long TailNdapa Nakashole. 37192-37222 [doi]
- MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval BenchmarksJunhao Ruan, Abudukeyumu Abudula, Bei Li, Yongjing Yin, Xinyu Liu, Kechen Jiao, Xin Chen, Jingang Wang, Xunliang Cai, Tong Xiao 0001, Jingbo Zhu. 37223-37250 [doi]
- Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement LearningWeiqin Wang, Yile Wang, Kehao Chen, Hui Huang 0004. 37251-37265 [doi]
- Beyond Markovian Forgetfulness: Episodic Memory for Reasoning-Intensive RetrievalDohyeon Lee, Yeonseok Jeong, Seung-won Hwang. 37266-37280 [doi]
- DUAL RM: Beyond Rule-based Preference Reward Modeling via Meta-RewardXiaobo Liang, Wanfu Wang, Qipeng Huang, Yuyang Ding, Zecheng Tang, Yixin Ji, Qianben Chen, Zhe Zhao, Kehai Chen, Juntao Li 0005, Min Zhang 0005. 37281-37296 [doi]
- Evolutionary Negative Module Pruning for Better LoRA MergingAnda Cao, Zhuo Gou, Yi Wang 0068, Kaixuan Chen 0004, Yu Wang 0176, Can Wang, Mingli Song, Jie Song 0011. 37297-37310 [doi]
- Example Quality Matters: Multi-Aspects Example Augmentation for Private Library ProgrammingYuhao Li, Haifeng Sun 0001, Xuesong Zhang, Shu Yao, Haoyu Zheng, Yvchuan Wang, Huazheng Wang, Zirui Zhuang, Qi Qi 0001, Jianxin Liao, Jingyu Wang. 37311-37327 [doi]
- Resonating with RoPE: Spectral Quantization for High-Fidelity Key Cache CompressionXuefei Wang, Haoyu Tang 0002, Tianyuan Liang, Zhibin Wang, Yupeng Hu 0003, Weili Guan. 37328-37348 [doi]
- CSRP: Chain-of-Thought Reasoning for Chinese Text Correction via Reinforcement Learning with Efficiency-Aware RewardsWei Tian, Yuhao Zhou, Man Lan. 37349-37365 [doi]
- Adaptive Retrieval for ReasoningJongho Kim, Jaeyoung Kim, Jihyuk Kim, Yu-Jin Kim, Seung-won Hwang, Moontae Lee. 37366-37381 [doi]
- On Emergent Social World Models - Evidence for Functional Integration of Theory of Mind and Pragmatic Reasoning in Language ModelsPolina Tsvilodub, Jan-Felix Klumpp, Amir Pour, Jennifer Hu 0001, Michael Franke. 37382-37420 [doi]
- ToolOmni: Enabling Open-World Tool Use via Agentic learning with Proactive Retrieval and Grounded ExecutionShouzheng Huang, Meishan Zhang, Baotian Hu, Min Zhang 0005. 37421-37439 [doi]
- From TDMA to CDMA: A Multi-bit Watermark for Diffusion Language ModelsBaizhou Huang, Xiaojun Wan 0001. 37440-37454 [doi]
- LegalGraphRAG: Multi-Agent Graph Retrieval-Augmented Generation for Reliable Legal ReasoningZerui Chen, Qinggang Zhang, Zhishang Xiang, Zhimin Wei, Linfeng Gao, Xiao Huang, Zhihong Zhang, Jinsong Su. 37455-37484 [doi]
- Characterizing the Expressivity of Local Attention in TransformersJiaoda Li, Ryan Cotterell. 37485-37507 [doi]
- TH-RAG : Topic-Based Hierarchical Knowledge Graphs for Robust Multi-hop Reasoning in Graph-based RAG SystemsJungHyoun Kim, Soohyeong Kim, Seok Jun Hwang, Jeonghyeon Park, Yong Suk Choi. 37508-37531 [doi]
- Beyond Static Benchmarks: Synthesizing Harmful Content via Persona-based Simulation for Robust EvaluationHuije Lee, Jisu Shin 0001, Hoyun Song, Changgeon Ko, Jong C. Park. 37532-37551 [doi]
- DiVE: Decoupling Intra-layer Visual Evidence for Mitigating Hallucinations in Large Vision-Language ModelsXinwei Li, Li Lin 0011, Hui Jiao, Li Yao 0003, Tien-Tsin Wong, Hanqian Wu. 37552-37568 [doi]
- Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing AgentsMuyu He, Anand Kumar, Soumyadeep Bakshi, James Zou 0001, Nazneen Rajani. 37569-37602 [doi]
- Efficient Process Reward Modeling via Contrastive Mutual InformationNakyung Lee, Sangwoo Hong, Jungwoo Lee 0001. 37603-37617 [doi]
- R³: End-to-End Reasoning-based Planning for Multi-step Retrosynthesis via Reinforcement LearningYifei Wang, Qizhi Pei, JiangTao Feng, Yuntian Shi, Yi Duan, Lihao Wang, Lei Bai 0001, Lijun Wu 0003, Wei-Ying Ma, Hao Zhou 0012. 37618-37632 [doi]
- River-LLM: Large Language Model Seamless Exit Based on KV ShareYingtao Shen, An Zou. 37633-37645 [doi]
- Execution as Verification: Fine-Grained Self-Correcting Reasoning for Complex KBQAMinghan Zhang, Zhen Yang 0010, Haodong Zou, Jie Chen 0025, Zhen Duan, Shu Zhao 0005. 37646-37663 [doi]
- Zero-Shot Detection of LLM-Generated Text using Temperature SensitivityShixuan Ma, Jiahao Li 0004, Zhendong Mao 0001, Quan Wang 0002. 37664-37679 [doi]
- MARD: Module-Aware Reasoning Distillation for Language Models with Adaptive SupervisionWenqi Yang, Jianjun Li 0010, Zhibo Zhang 0009, Mingqian Ding, Yushen Fang. 37680-37695 [doi]
- Dashboard2Code: Evaluating Multimodal Models on Reconstructing Interactive DashboardsTianhao Niu, Ziyu Han, Qiguang Chen, Shiqi Zhou, Baocai Shan, Hengjie Fang, Qingfu Zhu, Wanxiang Che. 37696-37732 [doi]
- Can Compact Language Models Search Like Agents? Distillation-Guided Policy Optimization for Preserving Agentic RAG CapabilitiesRikuto Kotoge, Mai Nishimura, Jiaxin Ma. 37733-37746 [doi]
- CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement LearningZhenpeng Su, Leiyu Pan, Minxuan Lv, Yuntao Li, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou. 37747-37760 [doi]
- Omni-I2C: A Holistic Benchmark for High-Fidelity Image-to-Code GenerationJiawei Zhou, Chi Zhang 0080, Xiang Feng, Qiming Zhang 0001, Haibo Qiu, Lihuo He, Dengpan Ye, Xinbo Gao 0001, Jing Zhang 0037. 37761-37798 [doi]
- Revealing Procedural Reasoning Structures in Chain-of-Thought Training via Span-Level Gradient OrganizationJia Liu 0009, Jiaxin Luo, Weiwen Xu, Jonathan M. Garibaldi, Xiaokun Wu 0004, Yixue Hao, Min Chen 0003. 37799-37845 [doi]
- StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to ReasonKaiyi Zhang, Ang Lv, Jinpeng Li 0003, Yongbo Wang, Feng Wang 0023, Haoyuan Hu, Rui Yan 0001. 37846-37864 [doi]
- Social Dynamics as Critical Vulnerabilities that Undermine Objective Decision-Making in LLM CollectivesChanggeon Ko, Jisu Shin 0001, Hoyun Song, Huije Lee, Eui Jun Hwang, Jong C. Park. 37865-37890 [doi]
- FairQE: Multi-Agent Framework for Mitigating Gender Bias in Translation Quality EstimationJinhee Jang, Juhwan Choi, DongJin Lee, Seunguk Yu, Youngbin Kim. 37891-37911 [doi]
- AdaDPI: Document-level Translation Adaptive Agent via Dynamic Parametric InternalizationHong Ren, Liting Deng, ShaoLin Zhu, Deyi Xiong. 37912-37929 [doi]
- Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation EnergyEric Hanchen Jiang, Weixuan Ou, Run Liu 0005, Shengyuan Pang, Guancheng Wan, Ranjie Duan, Wei Dong 0007, Kai-Wei Chang 0001, Xiaofeng Wang, Ying Nian Wu, Xinfeng Li. 37930-37950 [doi]
- Refining and Reusing Annotation Guidelines for LLM AnnotationKon Woo Kim, Jin-Dong Kim, Akiko Aizawa. 37951-37964 [doi]
- Cross-Examination Framework: A Task-Agnostic Diagnostic for Information Fidelity in Text-to-Text GenerationTathagata Raha, Clément Christophe, Nada Saadi, Hamza Javed, Marco A. F. Pimentel, Ronnie Rajan, Praveenkumar Kanithi. 37965-37985 [doi]
- AlignCultura: Towards Culturally Aligned Large Language Models?Gautam Siddharth Kashyap, Mark Dras, Usman Naseem. 37986-37996 [doi]
- UPDESH: Synthesizing Grounded Instruction Tuning Data for 13 Indic LanguagesPranjal A. Chitale, Varun Gumma, Sanchit Ahuja, Prashant Kodali, Manan Uppadhyay, Deepthi Sudharsan, Sunayana Sitaram. 37997-38041 [doi]
- Dynamic Generation of Multi LLM Agents Communication Topologies with Graph Diffusion ModelsEric Hanchen Jiang, Levina Li, Frank Wan, Xiao Liang, Sophia Yin, Yuchen Wu, Xinfeng Li, Yizhou Sun, Wei Wang, Kai-Wei Chang 0001, Ying Nian Wu. 38042-38060 [doi]
- TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax PracticeGang Hu 0003, Yating Chen, Haiyan Ding, Wang Gao 0002, Jiajia Huang, Min Peng 0002, Qianqian Xie, Kun Yue. 38061-38104 [doi]
- Think How to Think: Mitigating Overthinking with Autonomous Difficulty Cognition in Large Reasoning ModelsYongjiang Liu, Haoxi Li, Xiaosong Ma, Jie Zhang 0076, Song Guo 0001. 38105-38126 [doi]
- Theory-optimal Quantization Based on FlatnessXiusheng Huang, Zhe Li, Xuanwu Yin, Lu Wang 0029, Yequan Wang, Dong Li 0025, Emad Barsoum, Kang Liu 0001. 38127-38142 [doi]
- When Background Matters: Breaking Medical Vision Language Models by Transferable AttackAkash Ghosh, Subhadip Baidya, Sriparna Saha 0001, Xiuying Chen. 38143-38170 [doi]
- Tears or Cheers? Benchmarking LLMs via Culturally Elicited Distinct Affective ResponsesChongyuan Dai, Yaling Shen, Zihan Gao, Jia Li, Yishun Jiang, Yaxiong Wang, Liu Liu, ZongYuan Ge, Jinpeng Hu. 38171-38196 [doi]
- Emergent Misalignment via In-Context Learning: Narrow in-context examples can produce broadly misaligned LLMsNikita Afonin, Nikita Andriyanov, Vahagn Hovhannisyan, Nikhil Bageshpura, Kyle Liu, Kevin Zhu, Sunishchal Dev, Ashwinee Panda, Oleg Rogov, Elena Tutubalina, Alexander Panchenko, Mikhail Seleznyov. 38197-38212 [doi]
- EvoRoute: Experience-Driven Self-Routing LLM Agent SystemsGuibin Zhang, Haiyang Yu 0003, Kaiming Yang, Bingli Wu, Fei Huang 0002, Yongbin Li 0001, Shuicheng Yan. 38213-38225 [doi]
- Foresight Optimization for Strategic Reasoning in Large Language ModelsJessie Wang 0004, Jiawen Duan, Jian Wang 0054, Kaitao Song, Chunpu Xu, Johnny K. W. Ho, Fenggang Yu, Johan F. Hoorn, Wenjie Li 0002. 38226-38246 [doi]
- DetectRL-X: Towards Reliable Multilingual and Real-World LLM-Generated Text DetectionJunchao Wu, Yefeng Liu, Chenyu Zhu, Hao Zhang 0018, Zeyu Wu, Tianqi Shi, Yichao Du, Longyue Wang, Weihua Luo, Jinsong Su, Derek F. Wong. 38247-38294 [doi]
- ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation AlignmentJun-Hak Yun, Seung-bin Kim, Seong-Whan Lee. 38295-38314 [doi]
- When Efficiency Becomes a Vulnerability: Computational Cost Attacks on WebAgentsLiang-Bo Ning 0001, Yuchen Zhu, Heqing Huang 0002, Xin Wang, Yi Chang, Qing Li 0001, Wenqi Fan. 38315-38335 [doi]
- Evolving Beyond Snapshots: Harmonizing Structure and Sequence via Entity State Tuning for Temporal Knowledge Graph ForecastingSiyuan Li, Yunjia Wu, Yiyong Xiao, Pingyang Huang, Peize Li, Ruitong Liu, Yan Wen, Te Sun 0001. 38336-38350 [doi]
- CodeRipple: Wavelet-Based Detection of LLM-Generated CodeXingyu Yao, Zhendong Mao 0001, Quan Wang 0002. 38351-38364 [doi]
- PHOTON: Hierarchical Autoregressive Modeling for Lightspeed and Memory-Efficient Language GenerationYuma Ichikawa, Naoya Takagi, Takumi Nakagawa, Yuzi Kanazawa, Akira Sakai. 38365-38383 [doi]
- CoMeT: Collaborative Memory Transformer for Efficient Long Context ModelingRunsong Zhao, Shilei Liu, Jiwei Tang, Langming Liu, Haibin Chen, Weidong Zhang, Yujin Yuan, Tong Xiao 0001, Jingbo Zhu, Wenbo Su, Bo Zheng 0007. 38384-38402 [doi]
- CheckRLM: Effective Knowledge-Thought Coherence Checking in Retrieval-Augmented ReasoningDingling Xu, Ruobing Wang, Qingfei Zhao, Yukun Yan, Zhichun Wang, Daren Zha, Shi Yu 0001, Zhenghao Liu 0001, Shuo Wang 0013, Xu Han 0007, Maosong Sun 0001. 38403-38426 [doi]
- CAMEC: Complexity-Aware Multi-Expert Collaboration for Reliable Chinese Medical Question AnsweringYukang Wu, Xiyuan Jia, Jiayi Wu, Hongchen Yu, Yuhan Qiu, Guohua Wu. 38427-38457 [doi]
- Vocabulary Hijacking in LVLMs: Unveiling Critical Attention Heads by Excluding Inert Tokens to Mitigate HallucinationYangneng Chen, Junlin Li, Weijun Yao, Xilai Ma, Guodong Du 0008, Wenya Wang 0001, Jing Li. 38458-38485 [doi]
- HumanLLM: Benchmarking and Improving LLM Anthropomorphism via Human Cognitive PatternsXintao Wang 0001, Jian Yang 0003, Weiyuan Li, Rui Xie 0005, Jen-tse Huang 0001, Jun Gao, Shuai Huang, Yueping Kang, Yuanli Guo, Hongwei Feng, Yanghua Xiao. 38486-38517 [doi]
- Vision-Language Introspection: Mitigating Overconfident Hallucinations in MLLMs via Interpretable Bi-Causal SteeringShuliang Liu, Songbo Yang, Dong Fang, Sihang Jia, Yuqi Tang, Lingfeng Su, Ruoshui Peng, Yibo Yan, Xin Zou 0001, Xuming Hu. 38518-38543 [doi]
- v-HUB: A Benchmark for Video Humor Understanding from Vision and SoundZhengpeng Shi, Yanpeng Zhao, Jianqun Zhou, Yuxuan Wang 0004, Qinrong Cui, Wei Bi, Song Chun Zhu, Bo Zhao, Zilong Zheng. 38544-38567 [doi]
- Beyond Single Representations: Multi-Model Embedding Fusion for Stable Text ClassificationJiho Gwak, Yuchul Jung. 38568-38577 [doi]
- Confidence Should Be Calibrated More Than One Turn DeepZhaohan Zhang, Chengzhengxu Li, Xiaoming Liu, Chao Shen 0001, Ziquan Liu, Ioannis Patras. 38578-38594 [doi]
- NaviMaster: Learning a Unified Policy for GUI and Embodied Navigation TasksZhiHao Luo, Wentao Yan, Jingyu Gong, Min Wang 0024, Zhizhong Zhang 0001, Xuhong Wang, Yuan Xie 0006, Xin Tan 0002. 38595-38615 [doi]
- Teaching LLMs Human-Like Editing of Inappropriate Argumentation via Reinforcement LearningTimon Ziegenbein, Maja Stahl, Henning Wachsmuth. 38616-38637 [doi]
- FLAIR: Steering LLM Mathematical Problem Solving based on A Fuzzy-Logic-AssIsted ReasonerHao Wu, Hongru Sun, Wanqing Li 0001, Xinguo Yu, Hao Ming, Xiao Luo, Wenbin Zhang 0002, Jiahong Zhao, Yi Guo 0001, Jie Yang 0009. 38638-38661 [doi]
- QuDAR: Query-Wise Dual-Perspective Adaptive RetrievalJoeun Kim, Seunghyouk Yoon, Xuan Bach Le, Youngeun Nam, Doyoung Kim, Hwanjun Song, Jae-Gil Lee. 38662-38679 [doi]
- Trait Activation in Silicon: A Situation-Aware Framework for Psychologically Grounded Role-PlayingZuolong Li, Pingyu Wu, Xianwen Huang, Tianyi Wei, Wenbo Zhou 0004. 38680-38698 [doi]
- SPARKLE: A Structured and Plug-and-play Agentic Retrieval Policy for Adaptive RAG ModelsJinyuan Fang, Zaiqiao Meng, Craig Macdonald. 38699-38719 [doi]
- G-IdiomAlign: A Gloss-Pivoted Benchmark for Cross-Lingual Idiom AlignmentFengying Ye, Yanming Sun, Runzhe Zhan, Lidia S. Chao, Zheqi Zhang, Derek F. Wong. 38720-38739 [doi]
- SciCoQA: Quality Assurance for Scientific Paper-Code AlignmentTim Baumgärtner, Iryna Gurevych. 38740-38770 [doi]
- ImpRIF: Stronger Implicit Reasoning Leads to Better Complex Instruction FollowingYuancheng Yang, Lin Yang, Xu Wang, Chao Tong, Haihua Yang. 38771-38796 [doi]
- HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language ModelsFeiyu Zhao, Yiming Chen, Wenhuan Lu, Daipeng Zhang, Xianghu Yue, Jianguo Wei. 38797-38816 [doi]
- ReTraceQA: Evaluating Reasoning Traces of Small Language Models in Commonsense Question AnsweringFrancesco Maria Molfese, Luca Moroni, Ciro Porcaro, Simone Conia, Roberto Navigli. 38817-38832 [doi]
- BEFT: Bias-Efficient Fine-Tuning of Language Models in Low-Data RegimesBaichuan Huang, Ananth Balashankar, Amir Aminifar. 38833-38851 [doi]
- JoPR: Joint Emotion Perception and Reasoning for Conversational Emotion RecognitionYumeng Fu, Weitao Huang, Junjie Wu 0005, Hao Teng, Meishan Zhang, Bingquan Liu. 38852-38864 [doi]
- Uncertainty-Aware Routing for Principled Alignment with MoE DynamicsYilong Chen, Junyuan Shang, Yuchen Feng, Zhenyu Zhang 0006, Naibin Gu, Ziqi Wang, Tingwen Liu, Shuohuan Wang, Yu Sun, Hua Wu 0003, Haifeng Wang 0001. 38865-38880 [doi]
- S⌃4: Operationalizing Speech Act Theory for Strategic Semi-Structured Psychiatric InterviewGuanqun Bi, Zhoufu Liu, Zhuang Chen 0002, Dazhen Wan, Xiyao Xiao, Minlie Huang. 38881-38899 [doi]
- More Aligned, Less Diverse? Analyzing the Grammar and Lexicon of Two Generations of LLMsAdrián Gude, Roi Santos-Rios, Francis Bond, Dan Flickinger, Carlos Gómez-Rodríguez, Olga Zamaraeva. 38900-38911 [doi]
- MemCoRL: Alternating Co-Optimization of Memory Retrieval and Utilization via Collaborative Reinforcement LearningYuewen Liu, Peng Xu, Muxi Diao, Anyi Zhang, Yang Li, Yutong Zhang. 38912-38924 [doi]
- Fast and Accurate Fisher-Guided Quantization via Efficient Kronecker FactorizationViktoriia Chekalina, Gerasin Timofey, Andrey Kuznetsov, Evgeny Frolov. 38925-38935 [doi]
- Discovering a Shared Logical Subspace: Steering LLM Logical Reasoning via Alignment of Natural-Language and Symbolic ViewsFeihao Fang, My T. Thai, Yuanyuan Lei 0001. 38936-38956 [doi]
- One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query RefinementYixiao Zhou, Dongzhou Cheng, Zhiliang Wu, Yi Yang 0001, Yu Cheng 0001, Hehe Fan. 38957-38978 [doi]
- Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language ModelsDan Shi 0001, Zhuowen Han, Simon Ostermann 0002, Renren Jin, Josef van Genabith, Deyi Xiong. 38979-39000 [doi]
- Polymorphic Universal TransformerYilong Chen, Zitian Gao, Yihao Xiao, Jason Klein Liu, Xinyu Yang, Yifan Luo, Haoming Luo, Zhengmao Ye, Tingwen Liu, Ran Tao, Bryan Dai. 39001-39013 [doi]
- Can Reasoning Path still be Effective as Input? Bridging Post-Reasoning to Chain-of-Thought CompressionChengzhengxu Li, Xiaoming Liu 0002, Zhaohan Zhang, Shengchao Liu, Guoxin Ma, Yu Lan 0001, Cong Wang 0001, Chao Shen 0001. 39014-39034 [doi]
- REAL: REtrieval-reAsoning and Logic-constructed Attention Behaviors for Long-Context KV Cache CompressionMengjie Li, Yuan Feng, Xike Xie, William J. Song. 39035-39052 [doi]
- From Where Words Come: Efficient Regularization of Code Tokenizers Through Source AttributionPavel Chizhov, Egor Bogomolov, Ivan P. Yamshchikov. 39053-39073 [doi]
- EmoS: A High-Fidelity Multimodal Benchmark for Fine-grained Streaming Emotional UnderstandingPengze Guo, Jingxi Liang, Zhiwen Xie, Qifeng Wang, Derek F. Wong. 39074-39089 [doi]
- Surprisal Minimisation over Goal-directed Alternatives Predicts Production Choice in DialogueThomas P. Utting, Mario Giulianelli, Arabella Sinclair. 39090-39109 [doi]
- HowToNarrate: A General-Domain Benchmark for Synchronized Video Narration with External KnowledgeXueyan Wang, Dingyi Yang, Qin Jin. 39110-39131 [doi]
- Putting HUMANS first: Efficient LAM Evaluation with Human Preference AlignmentWoody Haosheng Gan, William Barr Held, Diyi Yang. 39132-39174 [doi]
- Towards Fast and Accurate Modeling for Cross-Lingual Label ProjectionThang Le, Huy Huu Nguyen, Anh Tuan Luu, Thamar Solorio, Thien Huu Nguyen. 39175-39198 [doi]
- False Friends or Cognates? A Cross-lingual Semantic Ambiguity Evaluation for Galician, Portuguese and SpanishMarta Vázquez Abuín, José Camacho-Collados, Marcos García 0001. 39199-39214 [doi]
- BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown AttacksRui Miao 0003, Yixin Liu 0001, Yili Wang 0004, Xu Shen 0002, Yue Tan, Yiwei Dai, Shirui Pan, Xin Wang 0035. 39215-39234 [doi]
- Black-Box Membership Inference Attacks for Video Training Data in Multimodal Large Language ModelsJinrui Wang, Zhenfeng Gao, Wendan Wang, Huili Wang, Zichen Qin, Linjie Zhu, Hongke Fu, Shangguang Wang, Tao Qi. 39235-39248 [doi]
- Mitigating Safety Context Amnesia in Multimodal Reasoning Models via Intent-Guided Safety ReasoningXiyao Dong, Guangsheng Cheng, Yilong Chen, Xiaojin Zhang, Kun He. 39249-39276 [doi]
- On-policy Reinforcement Fine-tuning with Offline reward for Multi-step Embodied PlanningDi Wu, Jiaxin Fan, Chloe Gu, Guanbo Wang, Wei Yin, Wenhao Li 0001, Bo Jin 0003. 39277-39307 [doi]
- Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive DecodingYupeng Qi, Ziyu Lyu, Lixin Cui, Lu Bai 0001, Feng Xia. 39308-39325 [doi]
- Knowledge Injection Exists in MoE? Exploring Expert-Aware Contrast Decoding in MoE for Mitigating LLMs' HallucinationsXinyue Fang, Zhiliang Tian, Zhen Huang, Ziyi Pan, Zhihua Wen, Xi Wang, Quntian Fang, Dongsheng Li. 39326-39343 [doi]
- ERCThinker: Fast-Slow Thinking for Emotion Recognition in ConversationYumeng Fu, Weitao Huang, Junjie Wu 0005, Hao Teng, Shouduo Shang, Meishan Zhang, Bingquan Liu. 39344-39359 [doi]
- REaR : Retrieve, Expand and Refine for Effective Multitable RetrievalRishita Agarwal, Himanshu Singhal, Peter Baile Chen, Manan Roy Choudhury, Dan Roth 0001, Vivek Gupta 0001. 39360-39374 [doi]
- Figure It Out: Improve the Frontier of Reasoning with Executable Visual StatesMeiqi Chen 0001, Fandong Meng, Jie Zhou 0016. 39375-39388 [doi]
- MARCH: Multi-Agent Reinforced Check for HallucinationZhuo Li, Yupeng Zhang, Pengyu Cheng, Jiajun Song, Mengyu Zhou, Hao Li, Shujie Hu, Yu Qin, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang. 39389-39415 [doi]
- A Survey of Deep Learning for Geometry Problem SolvingJianzhe Ma, Wenxuan Wang 0001, Qin Jin. 39416-39448 [doi]
- ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-TrainingYu Liang, Liangxin Liu, Longzheng Wang, Yan Wang 0165, Yueyang Zhang, Long Xia, Zhiyuan Sun, Daiting Shi. 39449-39466 [doi]
- Beyond Experience Retrieval: Learning to Generate Utility-Optimized Structured Experience for Frozen LLMsXuancheng Li, Haitao Li 0006, Yujia Zhou 0002, Yiqun Liu 0001, Qingyao Ai. 39467-39482 [doi]
- Zero-shot Large Language Models for Automatic Readability AssessmentRiley Grossman, Yi Chen 0001. 39483-39499 [doi]
- NoisyCausal: A Benchmark for Evaluating Causal Reasoning Under Structured NoiseZhi Xu, Yun Fu. 39500-39513 [doi]
- Chain-of-Thought as a Lens: Evaluating Structured Reasoning Alignment between Human Preferences and Large Language ModelsBoxuan Wang, Zhuoyun Li, Xinmiao Huang, Xiaowei Huang 0001, Yi Dong 0002. 39514-39530 [doi]
- Robust Membership Inference for Large Language Models under Adversarial Generative CorruptionYuanhong Huang, Huili Wang, Xueying Bai, Jinrui Wang, Jiajun Liu, Ziqin Wang, Wanchun Ni, Shangguang Wang, Tao Qi. 39531-39547 [doi]
- Towards Trustworthy Smart Contract Synthesis: A Multi-Agent Framework with Lean-Based VerificationBowei Zhang, Hanbing Liu, Qixin Tian, Siyu Chen, Ziyuan Wang, Qi Qi 0003. 39548-39582 [doi]
- LoRA on the Go: Instance-level Dynamic LoRA Selection and MergingSeungeon Lee 0006, Soumi Das, Manish Gupta, Krishna P. Gummadi. 39583-39601 [doi]
- Deep Supervised Contrastive Learning of Pitch Contours for Robust Pitch Accent Classification in Seoul KoreanHyunjung Joo, Gyeongtaek Lee. 39602-39621 [doi]
- DARM: Distribution-Aware Reward Modeling by Alleviating Biases from Low Preference-Context Dependency DataShaofan Liu, Guoqiang Zhang, Shihan Dou, Huiyuan Zheng, Yiming Zhou, Junjie Ye 0005, Shaowen Wang, Shichun Liu, Jiazheng Zhang, Tao Gui, Qi Zhang 0001, Xuanjing Huang 0001. 39622-39639 [doi]
- KnowRL: Exploring Knowledgeable Reinforcement Learning for FactualityBaochang Ren, Shuofei Qiao, Ningyu Zhang 0001, Da Zheng 0004, Huajun Chen. 39640-39658 [doi]
- Rethinking Depression Prediction from a Fine-Grained Subscore Modeling Perspective via Multi-Task LearningZhenguang Wang, Bo Li 0041, Wenhui Tan, Peng Cao 0001, Yang Wang, Jia Duan, Fei Wang 0064, Osmar R. Zaïane. 39659-39672 [doi]
- PDTrim: Targeted Pruning for Prefill-Decode Disaggregation in InferenceHao Zhang, Mengsi Lyu, Zhuo Chen 0040, Yulong Ao, Yonghua Lin. 39673-39690 [doi]
- ASTRA: An Automated Framework for Strategy Discovery, Retrieval, and Evolution for Jailbreaking LLMsXu Liu, Yan Chen, Kan Ling, Yichi Zhu, Hengrun Zhang 0004, Guisheng Fan, Huiqun Yu. 39691-39710 [doi]
- LLM Safety From Within: Detecting Harmful Content with Internal RepresentationsDifan Jiao, Yilun Liu 0002, Ye Yuan, Zhenwei Tang, Linfeng Du, Haolun Wu, Ashton Anderson. 39711-39727 [doi]
- AttnPO: Attention-Guided Process Supervision for Efficient ReasoningShuaiyi Nie, Siyu Ding, Wenyuan Zhang 0002, Linhao Yu, Tianmeng Yang, Yao Chen 0009, Weichong Yin, Yu Sun, Hua Wu 0003, Tingwen Liu. 39728-39748 [doi]
- Evaluating LLMs on Large-Scale Graph Property Estimation via Random WalksSunil Kumar Maurya, Xin Liu 0020. 39749-39777 [doi]
- MedEinst: Benchmarking the Einstellung Effect in Medical LLMs through Counterfactual Differential DiagnosisWenting Chen, Guolin Huang, Wenxuan Wang 0001, Zhongrui Zhu. 39778-39798 [doi]
- Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-SystemYifei Wei, Linqing Zhong, Yi Liu 0081, Yuxiang Lu, Xindong He, Maoqing Yao, Guanghui Ren. 39799-39815 [doi]
- Language Statistics and False Belief Reasoning: Evidence from 41 Open-Weight LMsSean Trott, Samuel M. Taylor, Cameron Robert Jones, James A. Michaelov, Pamela D. Rivière. 39816-39833 [doi]
- Decoding-Unlearning: Fact Forgetting via Entropy-Guided InferenceJingwen Pu, Mingjun Shi, Xinrui Ren, Yizhe Wang, Xinyu Zhang, Zhaokun Wang, Kun She. 39834-39860 [doi]
- Global Adaptive Momentum Meets Local Personalized Perturbation: Efficient Federated LLM Fine-Tuning with Zeroth-Order GradientsZihan Chen 0001, Howard Hao Yang, Tony Q. S. Quek, Kai Fong Ernest Chong. 39861-39875 [doi]
- Beyond Query Memorization: Large Language Model Routing with Query Decomposition and Historical MatchingBo Lv, Jingbo Sun, Jianwei Lv, Chen Tang, Shaojie Zhang, Nayu Liu, Guoxin Yu, Zihao Li, Qichao Zhang, Dongbin Zhao, Ping Luo 0002, Yue Yu. 39876-39892 [doi]
- Market-Bench: Benchmarking Large Language Models on Economic and Trade CompetitionYushuo Zheng, Huiyu Duan, Zicheng Zhang, Yucheng Zhu, Xiongkuo Min, Guangtao Zhai. 39893-39906 [doi]
- Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point FormatsManyi Zhang, Ji-Fu Li, Zhongao Sun, Haoli Bai, Hui-Ling Zhen, Zhenhua Dong, Xianzhi Yu. 39907-39923 [doi]
- HiEdit: Lifelong Model Editing with Hierarchical Reinforcement LearningYangfan Wang, Tianyang Sun, Chen Tang, Jie Liu, Wei Cai, Jingchi Jiang. 39924-39942 [doi]
- Too Long, Do Re-weighting for Efficient LLM Reasoning CompressionZhong-Zhi Li, Xiao Liang, Zihao Tang, Lei Ji 0001, Peijie Wang, Haotian Xu, Xing W, Haizhen Huang, Weiwei Deng, Yeyun Gong, Zhijiang Guo, Xiao Liu 0040, Fei Yin, Cheng-Lin Liu 0001. 39943-39962 [doi]
- Measuring Social Bias in Vision-Language Models with Face-Only Counterfactuals from Real PhotosHaodong Chen, Qiang Huang, Jiaqi Zhao, Qiuping Jiang, Xiaojun Chang, Jun Yu 0002. 39963-39987 [doi]
- KASER: Knowledge-Aligned Student Error Simulator for Open-Ended Coding TasksZhangqi Duan, Nigel Fernandez, Andrew Lan. 39988-40006 [doi]
- GroupToM-Bench: Benchmarking Group Theory of Mind and Nonlinear Social Emergence in MLLMsWeidong Tang, Jierui Li, Yueling Hou, Zihan Mei, Can Zhang, Xinyan Wan, Zhiyuan Liang, Pengfei Zhou, Yang You 0001, Wangbo Zhao. 40007-40031 [doi]
- Assessing the Belief Consistency of Large Language Models on the Logical Conversation ProcessTomoki Tsujimura, Matiss Rikters, Masaki Asada, Shusaku Egami, Tatsuya Ishigaki, Ken Yano, Hiroya Takamura. 40032-40055 [doi]
- Textual Steering Vectors Can Improve Visual Understanding in Multimodal Large Language ModelsWoody Haosheng Gan, Deqing Fu, Julian Asilis, Ollie Liu, Vatsal Sharan, Robin Jia, Willie Neiswanger. 40056-40087 [doi]
- Learning Uncertainty from Sequential Internal Dispersion in Large Language ModelsPonhvoan Srey, Xiaobao Wu, Cong-Duy T. Nguyen, Anh Tuan Luu. 40088-40106 [doi]
- On-the-Fly VLA Adaptation via Test-Time Reinforcement LearningChangyu Liu, Yiyang Liu 0003, Taowen Wang, Qiao Zhuang, James Chenhao Liang, Wenhao Yang, Renjing Xu, Qifan Wang 0001, Dongfang Liu, Cheng Han 0001. 40107-40125 [doi]
- AdaMix: Adaptive Mixing for Short and Long Reasoning AdaptersHao Luo, Xiao Yan 0002, Xinyan Li, Qiming Zeng, Yuhao Lin, Shanshan Feng 0001, Hao Wang 0013, Jiawei Jiang 0001. 40126-40147 [doi]
- Quantifying and Mitigating Socially Desirable Responding in LLMs: A Desirability-Matched Graded Forced-Choice Psychometric StudyKensuke Okada, Yui Furukawa, Kyosuke Bunji. 40148-40166 [doi]
- From Curated Data to Scalable Models: Continual Pre-training of Dense and MoE Large Language Models for TibetanLei Yang, Leiyu Pan, Bojian Xiong, Renren Jin, Shaowei Zhang, Yue Chen, Ling Shi 0004, Jiang Zhou, Junru Wu, Zhen Wang, Jianxiang Peng, Juesi Xiao, Tianyu Dong, Zhuowen Han, Zhuo Chen, Yuqi Ren, Deyi Xiong. 40167-40182 [doi]
- UrbanGeoEval: A City-Scale Benchmark for Evaluating Large Language Models in Geospatial ReasoningMutian Bao, Qiuyi Qi, Tian Liang, Jinjian Zhang, Wei Zhou, Ming Kong, Linjian Mo, Qiang Zhu. 40183-40223 [doi]
- TAIGR: Towards Modeling Influencer Content on Social Media via Structured, Pragmatic InferenceNishanth Sridhar Nakshatri, Eylon Caplan, Rajkumar Pujari, Dan Goldwasser. 40224-40248 [doi]
- Afri-MCQA: Multimodal Cultural Question Answering for African LanguagesAtnafu Lambebo Tonja, Srija Anand, Emilio Villa-Cueva, Israel Abebe Azime, Jesujoba Oluwadara Alabi, Muhidin Mohamed, Debela Desalegn Yadeta, Negasi Haile Abadi, Abigail Oppong, Nnaemeka Casmir Obiefuna, Idris Abdulmumin, Naome A. Etori, Eric Peter Wairagala, Kanda Patrick Tshinu, Imanigirimbabazi Emmanuel, Gabofetswe Malema, Alham Fikri Aji, David Ifeoluwa Adelani, Thamar Solorio. 40249-40282 [doi]
- E-ViC: Reasoning Beyond Text via Embodied Visual Chain for Spatial IntelligenceJunbo Qi, Yi Zhang, Hanchu Ni, Che Liu 0002, Zhimin Yao, Ruilin Yang, Xiancong Ren, Liangjian Wen, Wei Ge, Yuya Ieiri, Osamu Yoshie, Yong Dai 0001, Xiaozhu Ju. 40283-40303 [doi]
- MessToClean: Evidence-Grounded Structure-Preserving Reconstruction for Real-World Degraded Exam Paper ImagesJiayi Tuo, Cheng Tang 0004, Zihan Wang, Chenyue Zhou, Yao Li, Yanbiao Ma, Chao Wang 0003, Wei Dai 0015, Mingxuan Wang, Shitong Qin, Ziwei Zhao. 40304-40322 [doi]
- Phonemes to the Rescue: Multilingual Tokenization Based on International Phonetic AlphabetMilan Miletic, Julie Kallini, Ekaterina Shutova. 40323-40349 [doi]
- Structure Guided Retrieval-Augmented Generation for Factual QueriesMiao Xie, Xiao Zhang, Yi Li, Chunli Lv. 40350-40370 [doi]
- GROKE: Vision-Free Navigation Instruction Evaluation via Graph Reasoning on OpenStreetMapFarzad Shami, Subhrasankha Dey, Nico Van de Weghe, Henrikki Tenkanen. 40371-40391 [doi]
- Emotion-Wheel-Guided Audio-Referred Text Representation for Multimodal Emotion Recognition in ConversationEunseon Seong, Harim Lee, Dahye Kim 0005, Changhyun Kim, Dong-Kyu Chae. 40392-40403 [doi]
- LongVideoAgent: Multi-Agent Reasoning with Long VideosRuntao Liu, Ziyi Liu, Jiaqi Tang 0005, Yue Ma 0016, Renjie Pi, Jipeng Zhang, Qifeng Chen 0001. 40404-40416 [doi]
- BOSCH: Black-Box Binary Optimization for Short-Context Attention-Head Selection in LLMsAbbas Ghaddar, Ivan Kobyzev, Boxing Chen, Yufei Cui. 40417-40444 [doi]
- Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning ModelsTingchen Fu, Yafu Li, Jiawei Gu, Xiaoye Qu, Yu Cheng 0001. 40445-40463 [doi]
- MirrorQA: Benchmarking Multimodal LLMs on Mirror-Orientation ReasoningJingPing Liu, Xingchen Peng, Yan Zhou, Ziyan Liu, Jie Zhai, Ronghao Chen, Huacan Wang, Xiaofeng Jia. 40464-40476 [doi]
- Robust Tool Use via Fission-GRPO: Learning to Recover from Execution ErrorsZhiwei Zhang, Fei Zhao 0012, Rui Wang 0092, Zezhong Wang 0004, Bin Liang 0004, Jiakang Wang, Yao Hu 0002, Shaosheng Cao, Kam-Fai Wong. 40477-40491 [doi]
- DimABSA: Building Multilingual and Multidomain Datasets for Dimensional Aspect-Based Sentiment AnalysisLung-Hao Lee, Liang-Chih Yu, Natalia V. Loukachevitch, Ilseyar Alimova, Alexander Panchenko, Tzu-Mi Lin, Zhe-Yu Xu, Jian Yu Zhou, Guangmin Zheng 0001, Jin Wang 0008, Sharanya Awasthi, Jonas Becker, Jan Philip Wahle, Terry Ruas, Shamsuddeen Hassan Muhammad, Saif M. Mohammad. 40492-40518 [doi]
- CAP: Controllable Alignment Prompting for Unlearning in LLMsZhaokun Wang, Jinyu Guo, Jingwen Pu, Hongli Pu, Meng Yang, Xunlei Chen, Jie Ou, Wenyi Li, Guangchun Luo, Wenhong Tian. 40519-40539 [doi]
- GeoRC: A Benchmark for Geolocation Reasoning ChainsMohit Talreja, Joshua Diao, Jim James, Radu Casapu, Tejas Santanam, Ethan Mendes, Alan Ritter, Wei Xu 0004, James Hays. 40540-40564 [doi]
- SemCSE-Multi: Multifaceted and Decodable Embeddings for Aspect-Specific and Interpretable Scientific Domain MappingMarc Felix Brinner, Sina Zarrieß. 40565-40586 [doi]
- Rendering Data Unlearnable by Exploiting LLM Alignment MechanismsRuihan Zhang, Jun Sun. 40587-40598 [doi]
- CAR-bench: Evaluating the Consistency and Limit-Awareness of LLM Agents under Real-World UncertaintyJohannes Kirmayr, Lukas Stappen, Elisabeth André. 40599-40618 [doi]
- Tiny Scales, Great Challenges: The Limits of Multimodal LLMs in Scale RecognitionJihang Jin, Ronghao Chen, Hao Zhang, Ziyan Liu, Huacan Wang, Qi Ye 0004, JingPing Liu. 40619-40632 [doi]
- M³-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question AnsweringJiatong Ma, Longteng Guo, Yuchen Liu, Zijia Zhao, Dongze Hao, Xuanxu Lin, Jing Liu 0001. 40633-40669 [doi]
- From Selection to Refinement: Iterative Optimization for Instruction DataHang Hu, Ziyan Liu, Rujie Wen, Ruihui Hou, Xueyan Wu, Mu Zhang, Jianxing Yu, Tong Ruan, JingPing Liu. 40670-40684 [doi]
- VISTA: Verification In Sequential Turn-based AssessmentAshley Lewis, Andrew Perrault, Eric Fosler-Lussier, Michael White 0001. 40685-40714 [doi]
- Knowledge-to-Verification: Exploring RLVR for LLMs in Knowledge-Intensive DomainsZhonghang Yuan, Zhefan Wang 0002, Fang Hu, Zihong Chen, Jinzhe Li, Gang Li, Jie Ying, Huanjun Kong, Songyang Zhang, Nanqing Dong. 40715-40749 [doi]
- Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM AgentsYuanchen Bei, Tianxin Wei, Xuying Ning, Yanjun Zhao, Zhining Liu 0002, Xiao Lin 0016, Yada Zhu, Hendrik F. Hamann, Jingrui He, Hanghang Tong. 40750-40784 [doi]
- HarDBench: A Benchmark for Draft-Based Co-Authoring Jailbreak Attacks for Safe Human-LLM Collaborative WritingEuntae Kim, Soomin Han, Buru Chang. 40785-40831 [doi]
- Mind Reader: Latent User Demand-Guided Content Optimization for Generative Search EngineTong Chen, Jiawei Guo, Yuxi Li, Baiming Chen, Houxing Ren, Zhang Zhiwei, Yunxiang Zhang, Hanyang Xia, Kun Liang, Zhaoran Fan. 40832-40848 [doi]
- Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language ModelsGuangyu Yang, Jinghong Chen, Jingbiao Mei, Weizhe Lin, Bill Byrne. 40849-40868 [doi]
- CNSL-bench: Benchmarking the Sign Language Understanding Capabilities of MLLMs on Chinese National Sign LanguageRui Zhao, Xuewen Zhong, Xiaoyun Zheng, Jinsong Su, Yidong Chen 0001. 40869-40890 [doi]
- Thinking in Schemas: Robust Syllogistic Reasoning in LLMsFederico Ranaldi, Leonardo Ranaldi, Fabio Massimo Zanzotto, Shay B. Cohen. 40891-40909 [doi]
- Amadeus: Autoregressive Model with Bidirectional Attribute Modelling for Symbolic MusicHongju Su, Ke Li 0004, Lan Yang 0014, Honggang Zhang 0002, Yi-Zhe Song. 40910-40928 [doi]
- FedMental: Evaluating Federated Learning for Mental Health Detection from Social Media DataNuredin Ali Abdelkadir, Anjali Ratnam, Zeerak Talat, Stevie Chancellor. 40929-40944 [doi]
- Edit-Aware Reward Modeling for Chinese Grammatical Error CorrectionYilin Li, Xiaojun Wan 0001. 40945-40957 [doi]
- GenPT: Beyond Self-Report for Reliable LLM Psychometrics via Generative Projective TestingMing Wang 0006, Shuang Wu, Bixuan Wang, Lu Lin, Yuxin Chen, Xiaocui Yang, Daling Wang, Shi Feng 0001, Yifei Zhang 0003, Yufan Sun. 40958-40974 [doi]
- Still Between Us? Evaluating and Improving Voice Assistant Robustness to Third-Party InterruptionsDongwook Lee, Eunwoo Song, Che Hyun Lee, Heeseung Kim, Sungroh Yoon. 40975-41004 [doi]
- Learning to Conceal Risk: Controllable Multi-turn Red Teaming for LLMs in the Financial DomainGang Cheng, Haibo Jin, Wenbin Zhang 0002, Haohan Wang, Jun Zhuang 0004. 41005-41020 [doi]
- Beyond Static Alignment: Adaptive Arbitration for Semantic Incongruence in Semi-Supervised Multimodal Sentiment AnalysisHuicong Li, Xiangbo Ji, Wei Wu. 41021-41032 [doi]
- LLM Beliefs Are in Their HeadsAlessandro Corona Mendozza, Anders Søgaard. 41033-41067 [doi]
- ProactiveEval: A Unified Evaluation Framework for Proactive Dialogue AgentsTianjian Liu, Fanqi Wan, Jiajian Guo, Xiaojun Quan. 41068-41100 [doi]
- The Visual Iconicity Challenge: Evaluating Vision-Language Models on Sign Language Form-Meaning MappingOnur Keles, Asli Özyürek, Gerardo Ortega, Kadir Gökgöz, Esam Ghaleb. 41101-41116 [doi]
- From Competition to Synergy: Unlocking Reinforcement Learning for Subject-Driven Image GenerationZiwei Huang 0005, Yin Shu, Hao Fang, Quanyu Long, Wenya Wang 0001, Qiushi Guo, Tiezheng Ge, Leilei Gan. 41117-41136 [doi]
- Deep-Reporter: Deep Research for Grounded Multimodal Long-Form GenerationFangda Ye, Kuicai Dong, Zhifei Xie, Yuxin Hu, Yihang Yin, Shurui Huang, Shikai Dong, Chen Zhang 0003, Jianzhu Bao, Shuicheng Yan. 41137-41177 [doi]
- Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive TasksWenqi Zhang 0001, Mengna Wang, Gangao Liu, Huixin Xu, Yiwei Jiang, Yongliang Shen 0001, Guiyang Hou, Zhe Zheng, Hang Zhang, Xin Li 0056, Jiajun Liu, Weiming Lu 0001, Peng Li 0031, Yueting Zhuang. 41178-41207 [doi]
- Temporal Precision Matters: Brain-Tuning Speech Language Models with Millisecond-Resolution Neural SignalsZhejun Zhang, Wenqing Zhou, Haozhe Xu, Lin Zhang 0013, Lei Li 0009. 41208-41226 [doi]
- One Pair Suffices: Unlocking Universal Zero-Shot Translation via Cross-Architecture AlignmentHao Zong, Conghu Yuan, Chao Bei, Wentao Chen, Huan Liu, Kaiyu Huang, Degen Huang. 41227-41237 [doi]
- LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM SafetyJunxiao Yang, Haoran Liu, Jinzhe Tu, Jiale Cheng, Zhexin Zhang, Shiyao Cui, Jiaqi Weng, Jialing Tao, Hui Xue, Hongning Wang, Han Qiu 0001, Minlie Huang. 41238-41259 [doi]
- Modeling Annotator Disagreement with Demographic-Aware Experts and Synthetic PerspectivesYinuo Xu, Veronica Derricks, Allison Earl, David Jurgens. 41260-41294 [doi]
- Multimodal Safety Evaluation in Generative Agent Social SimulationsAlhim Adonai Vera Gonzalez, Carlos Hinojosa, Karen Sanchez, Haidar Bin Hamid, Donghoon Kim, Bernard Ghanem. 41295-41310 [doi]
- Quantifying the Impact of Translation Errors on Multilingual LLM EvaluationKlaudia Thellmann, Bernhard Stadler 0001, Michael Färber 0001, Jens Lehmann 0001. 41311-41334 [doi]
- Long-Context Reasoning Through Proxy-Based Chain-of-Thought TuningMiao Li, Irina Saparina, Alexander Gurung, Mirella Lapata. 41335-41347 [doi]
- MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM ReasoningXiaoliang Fu, Jiaye Lin, Yangyi Fang, Binbin Zheng, Chaowen Hu, Zekai Shao 0001, Cong Qin, Lu Pan, Ke Zeng, Xunliang Cai. 41348-41365 [doi]
- Towards A Scanpath-Conditioned Surprisal Theory: Modeling Reader Information StatesMichael Mooney, Edmond S. L. Ho. 41366-41380 [doi]
- SafeMT: Multi-turn Safety for Multimodal Language ModelsHan Zhu, Juntao Dai, Jiaming Ji, Haoran Li, Chengkun Cai, Pengcheng Wen, Chi-Min Chan, Boyuan Chen 0008, Yaodong Yang 0001, Sirui Han, Yike Guo. 41381-41409 [doi]
- From łog π to π: Taming Divergence in Soft Clipping via Bilateral Decoupled Decay of Probability Gradient WeightXiaoliang Fu, Jiaye Lin, Yangyi Fang, Chaowen Hu, Cong Qin, Zekai Shao 0001, Binbin Zheng, Lu Pan, Ke Zeng. 41410-41430 [doi]
- Paramanu: Compact and Competitive Monolingual Language Models for Low-Resource Morphologically Rich Indian LanguagesMitodru Niyogi, Éric Gaussier, Arnab Bhattacharya 0001. 41431-41458 [doi]
- Linear-Time and Constant-Memory Text Embeddings Based on Recurrent Language ModelsTobias Grantner, Emanuel Sallinger, Martin Flechl. 41459-41481 [doi]
- Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward ModelsBinghai Wang, Yantao Liu, Yuxuan Liu, Tianyi Tang, Shenzhi Wang, Chang Gao, Chujie Zheng, Yichang Zhang, Le Yu, Shixuan Liu, Tao Gui, Qi Zhang 0001, Xuanjing Huang 0001, Bowen Yu 0002, Fei Huang 0002, Junyang Lin. 41482-41508 [doi]
- CIS-BWE: Chaos-Informed Speech Bandwidth ExtensionTarikul Islam Tamiti, Tonmoy Das, Nursadul Mamun, Anomadarshi Barua. 41509-41529 [doi]
- The Pitfalls of KV Cache CompressionAlex Chen, Renato Lui Geh, Aditya Grover, Guy Van den Broeck, Daniel Mingyi Israel. 41530-41553 [doi]
- Survey Response Generation: Generating Closed-Ended Survey Responses In-Silico with Large Language ModelsGeorg Ahnert, Anna-Carolina Haensch, Barbara Plank, Markus Strohmaier. 41554-41577 [doi]
- Sign-Language Datasets at Scale: A Comprehensive Survey on Resources, Benchmarks, and Annotation StandardsYiming Ni, Zhi-Qi Cheng, Jiayu Li, Wei Cheng. 41578-41604 [doi]
- Anchoring the Affective Manifold: Learning Canonical and Disentangled Representations via Generative Cross-Modal AlignmentWeibin Li, Jintao Cheng, Xiaoyu Tang, Chi-Man Vong. 41605-41614 [doi]
- Who Plays Which Role When? Communication Role Dynamics for Peer Recognition and Team Performance PredictionYifan Song 0007, Wenxuan Wendy Shi, Brian P. Bailey, Tal August. 41615-41628 [doi]
- Incomplete In-context LearningWenqiang Wang, Yujia Wen, Yan Xiao 0002, Zhifeng Chen, Yangshijie Zhang, Peng Chen, Mingbo Yang, Xiaochun Cao. 41629-41650 [doi]
- Fine-tuning vs. In-context Learning in Large Language Models: A Formal Language Learning PerspectiveBishwamittra Ghosh, Soumi Das, Till Speicher, Qinyuan Wu, Mohammad Aflah Khan, Deepak Garg, Krishna P. Gummadi, Evimaria Terzi. 41651-41697 [doi]
- Where Paths Split: Localized, Calibrated Control of Moral Reasoning in Large Language ModelsChenchen Yuan, Zheyu Zhang 0007, Gjergji Kasneci. 41698-41721 [doi]
- Social Story Frames: Contextual Reasoning about Narrative Intent and ReceptionJoel Mire, Maria Antoniak, Steven R. Wilson 0001, Zexin Ma, Achyutarama R. Ganti, Andrew Piper, Maarten Sap. 41722-41763 [doi]
- Lightweight and Faithful Visual Condition Checking in Behavior Trees via Expert-Regularized Reinforcement LearningHyosik Moon, Eldan Cohen. 41764-41799 [doi]
- When in Doubt, Consult: Expert Debate for Sexism Detection via Confidence-Based RoutingAnwar Alajmi, Gabriele Pergola. 41800-41822 [doi]
- Failure Modes in Multi-Hop QA: The Weakest Link Effect and the Recognition BottleneckMeiru Zhang, Zaiqiao Meng, Nigel Collier. 41823-41846 [doi]
- TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal GroundingMingyue Huo, Yiwen Shao, Yuheng Zhang. 41847-41862 [doi]
- On the Effect of Hyperparameters in Language Modeling for Computational LinguisticsRuoxi Ning, Yongpeng Zhu, Qingcheng Zeng, Tatsuki Kuribayashi, Freda Shi. 41863-41880 [doi]
- Prosody as Supervision: Bridging the Non-Verbal-Verbal for Multilingual Speech Emotion RecognitionGirish, Mohd Mujtaba Akhtar, Muskaan Singh. 41881-41893 [doi]
- Mechanisms of Prompt-Induced Hallucination in Vision-Language ModelsWilliam Rudman, Michal Golovanevsky, Dana Arad, Yonatan Belinkov, Carsten Eickhoff, Ritambhara Singh, Kyle Mahowald. 41894-41912 [doi]
- LLM4Cell: Taxonomy and Evaluation of LLM and Agentic Models for Single-Cell BiologySajib Acharjee Dip, Adrika Zafor, Bikash Kumar Paul, Uddip Acharjee Shuvo, Muhit Islam Emon, Xuan Wang, Liqing Zhang. 41913-41954 [doi]
- Wait! There's a Way Out: A Decision Mechanism for Forecasting Conversational DerailmentLaerdon Kim, Vivian Nguyen, Cristian Danescu-Niculescu-Mizil. 41955-41974 [doi]
- From Nodes to Narratives: Explaining Graph Neural Networks with LLMs and Graph ContextPeyman Baghershahi, Gregoire Fournier, Pranav Nyati, Sourav Medya. 41975-41994 [doi]
- RealChart2Code: Bridging the Gap in Real-World Chart-to-Code Generation via Multi-Task EvaluationJiajun Zhang, Yuying Li, Zhixun Li, Xingyu Guo, Jingzhuo Wu, Leqi Zheng, Yiran Yang, Jianke Zhang, Qingbin Li, Shannan Yan, Changguo Jia, Junfei Wu, Zilei Wang, Qiang Liu, Liang Wang. 41995-42032 [doi]
- Success and Cost Elicit Convention Formation for Efficient CommunicationSaujas Vaduguru, Yilun Hua, Yoav Artzi, Daniel Fried. 42033-42050 [doi]
- Measuring User's Mental Models of Speech Translation in Human-AI CollaborationHyojung Han 0001, Nishant Balepur, Jordan Lee Boyd-Graber, Marine Carpuat. 42051-42065 [doi]
- VeriTaS: The First Dynamic Benchmark for Multimodal Automated Fact-CheckingMark Rothermel, Marcus Kornmann, Marcus Rohrbach, Anna Rohrbach. 42066-42100 [doi]
- A Survey of Reasoning-Intensive Retrieval: Progress and ChallengesYiyang Wei, Tingyu Song, Siyue Zhang, Yilun Zhao 0001. 42101-42122 [doi]
- Which Reasoning Trajectories Teach Students to Reason Better? A Simple Metric of Informative AlignmentYuming Yang 0001, Mingyoung Lai, Wanxu Zhao, Xiaoran Fan, Zhiheng Xi, Mingqi Wu, Chiyue Huang, Jun Zhao 0019, Haijun Lv, Jian Tong, Yunhua Zhou, Yicheng Zou, Qipeng Guo, Tao Gui, Qi Zhang 0001, Xuanjing Huang 0001. 42123-42150 [doi]
- From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language ModelsFarima Fatahi Bayat, Pouya Pezeshkpour, Estevam Hruschka. 42151-42169 [doi]
- Paper Circle: An Open-source Multi-agent Research Discovery and Analysis FrameworkKomal Kumar, Aman Chadha, Salman Khan 0001, Fahad Shahbaz Khan, Hisham Cholakkal. 42170-42188 [doi]
- PEAR: Pairwise Evaluation for Automatic Relative Scoring in Machine TranslationLorenzo Proietti 0002, Roman Grundkiewicz, Matt Post. 42189-42207 [doi]
- AV-Dialog: Spoken Dialogue Models with Audio-Visual InputTuochao Chen, Bandhav Veluri, Hongyu Gong, Shyamnath Gollakota. 42208-42225 [doi]
- A BERTology View of LLM Orchestrations: Token- and Layer-Selective Probes for Efficient Single-Pass ClassificationGonzalo Ariel Meyoyan, Luciano Del Corro. 42226-42239 [doi]
- Can Large Language Models Keep Up? Benchmarking Online Adaptation to Continual Knowledge StreamsJiyeon Kim, Hyunji Lee, Dylan Zhou, Sue Hyun Park, Seunghyun Yoon 0002, Trung Bui, Franck Dernoncourt, Sungmin Cha, Minjoon Seo. 42240-42272 [doi]
- Evaluating Language Model Pluralism through In-the-wild Crowd DiscussionsGagan Mundada, Rohan Surana, Nandhini Swaminathan, Bodhisattwa Prasad Majumder, Junda Wu, Julian J. McAuley, Zhouhang Xie. 42273-42296 [doi]
- PRBench: Large-Scale Expert Rubrics for Evaluating High-Stakes Professional ReasoningAfra Feyza Akyürek, Advait Gosai, Chen Bo Calvin Zhang, Vipul Gupta, Jaehwan Jeong, Anisha Gunjal, Tahseen Rabbani, Maria Mazzone, David Randolph IV, Mohammad Mahmoudi Meymand, Gurshaan Chattha, Paula Rodriguez, Diego A Mares Buendia, Pavit Singh, Michael Liu, Subodh Chawla, Peter Cline, Lucy Ogaz, Ernesto Gabriel Hernández Montoya, Zihao Wang, Pavi Bhatter, Marcos Ayestaran, Bing Liu, Yunzhong He. 42297-42325 [doi]
- Constructing Interpretable Features from Compositional Neuron GroupsOr David Shafran, Atticus Geiger, Mor Geva. 42326-42348 [doi]
- Simulated Students in Tutoring Dialogues: Substance or Illusion?Alexander Scarlatos, Jaewook Lee 0006, Simon Woodhead 0002, Andrew Lan. 42349-42385 [doi]
- A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to ReasoningTianyu Yang, Sihong Wu, Yilun Zhao 0001, Zhenwen Liang, Lisen Dai, Chen Zhao 0013, Minhao Cheng, Arman Cohan, Xiangliang Zhang 0001. 42386-42408 [doi]
- Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy OptimizationYifeng Ding, Hung Le, Songyang Han, Kangrui Ruan, Zhenghui Jin, Varun Kumar, Zijian Wang 0002, Anoop Deoras. 42409-42423 [doi]
- HypoEval: Hypothesis-Guided Evaluation for Natural Language GenerationMingxuan Li, Hanchen Li, Chenhao Tan. 42424-42443 [doi]
- LLMSurgeon: Diagnosing Data Mixture of Large Language ModelsYaxin Luo, Jiacheng Cui, Xiaohan Zhao, Xinyi Shang, Jiacheng Liu, Xinyue Bi, Zhaoyi Li, Zhiqiang Shen. 42444-42459 [doi]
- The African Languages Lab: A Collaborative Approach to Advancing Low-Resource African NLPSheriff Issaka, Keyi Wang, Yinka Ajibola, Oluwatumininu Samuel-Ipaye, Zhaoyi Zhang, Nicte Aguillon Jimenez, Evans Kofi Agyei, Abraham Lin, Rohan Ramachandran, Sadick Abdul Mumin, Faith Nchifor, Mohammed Shuraim Issah, Erick Rosas Gonzalez, Lieqi Liu, Sylvester Kpei, Jemimah Kusi Osei, Carlene Ajeneza, Persis Boateng, Prisca Adwoa Dufie Yeboah, Saadia Gabriel. 42460-42477 [doi]
- LogosKG: Hardware-Optimized Scalable and Interpretable Knowledge Graph RetrievalHe Cheng, Yifu Wu, Saksham Khatwani, Maya Kruse, Dmitriy Dligach, Timothy A. Miller, Majid Afshar, Yanjun Gao. 42478-42493 [doi]
- GCA Framework: A GCC Countries-Grounded Dataset and Agentic Pipeline for Climate Decision SupportMuhammad Umer Sheikh, Khawar Shehzad, Salman Khan 0001, Fahad Shahbaz Khan, Muhammad Haris Khan. 42494-42506 [doi]
- Effects of Collaboration on the Performance of Interactive Theme Discovery SystemsAlvin Po-Chun Chen, Rohan Das, Dananjay Srinivas, Alexandra Barry, Maksim Seniw, Maria Leonor Pacheco. 42507-42526 [doi]
- GraphSynth: Resolving the Diversity-Reliability Trade-off with Probabilistic Factor GraphsZehua Cheng, Wei Dai 0015, Jiahao Sun, Thomas Lukasiewicz. 42527-42543 [doi]
- A Structured Clustering Approach for Inducing Media NarrativesRohan Das, Advait Deshmukh, Alexandria Leto, Zohar Naaman, I-Ta Lee, Maria Leonor Pacheco. 42544-42577 [doi]
- ACBQ: Adaptive Cross-Block Quantization of Large Language ModelsHailing Wang, Jianglin Lu, Yitian Zhang, Huimin Zeng, Yun Fu 0001. 42578-42592 [doi]
- SecureGate: Learning When to Reveal PII Safely via Token-Gated Dual-Adapters for Federated LLMsMohamed Shaaban, Mohamed Elmahallawy. 42593-42610 [doi]
- EDUMATH: Generating Standards-aligned Educational Math Word ProblemsBryan R. Christ, Penelope Molitz, Beau LeBlond, Zachary Gottesman, Jonathan Kropko, Thomas Hartvigsen. 42611-42643 [doi]
- AdaFuse: Adaptive Ensemble Decoding for Large Language ModelsChengming Cui, Tianxin Wei, Ziyi Chen, Ruizhong Qiu, Zhichen Zeng 0001, Zhining Liu 0002, Xuying Ning, Duo Zhou, Jingrui He. 42644-42657 [doi]
- Uncertainty-Aware Test-Time Search for Optimization Problem SolvingLinlin Yu, Xujiang Zhao, Dong Li 0034, Yanchi Liu, Wei Cheng 0002, Zhengzhang Chen, Chen Zhao 0010, Feng Chen 0001, Haifeng Chen. 42658-42669 [doi]
- TLPO: Token-Level Policy Optimization for Mitigating Language Confusion in Large Language ModelsJinho Choo, Junseung Lee, Jimyeong Kim, Yeeho Song, S. K. Hong, Yeong-Dae Kwon. 42670-42690 [doi]
- JW-SVD: Bridging the Cross-Modal Mismatch in Post-Training MLLM CompressionRunchao Li, Yao Fu, Mu Sheng, Haotian Yu, Xianxuan Long, Kenneth A. Loparo. 42691-42702 [doi]
- Advancing Reasoning in Diffusion Language Models with Denoising Process RewardsShaoan Xie, Lingjing Kong, Xiangchen Song, Xinshuai Dong, Guangyi Chen 0002, Eric P. Xing, Kun Zhang 0001. 42703-42720 [doi]
- Estimating the Black-box LLM Uncertainty with Distribution-Aligned Adversarial DistillationHuizi Cui, Huan Ma, Qilin Wang, Yuhang Gao, Changqing Zhang. 42721-42740 [doi]
- CoDial: Interpretable Task-Oriented Dialogue Systems Through Dialogue Flow AlignmentRadin Shayanfar, Chu Fei Luo, Rohan Bhambhoria, Samuel Dahan, Xiaodan Zhu 0001. 42741-42763 [doi]
- BioProAgent: Neuro-Symbolic Grounding for Constrained Scientific PlanningYuyang Liu, Jingya Wang, Liuzhenghao Lv, Yonghong Tian 0001. 42764-42783 [doi]
- MDP-GRPO: Stabilized Group Relative Policy Optimization for Multi-Constraint Instruction FollowingMohammad Mahdi Salmani-Zarchi, Zahra Rahimi, Heshaam Faili, Mohammad Javad Dousti. 42784-42797 [doi]
- TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model PairsSibo Xiao, Jinyuan Fu, Zhongle Xie, Lidan Shou. 42798-42812 [doi]
- GUIDE: Towards Scalable Advising for Research IdeasYaowenqi Liu, BingXu Meng, Rui Pan 0002, Yuxing Liu, Jerry Huang, Jiaxuan You, Tong Zhang 0001. 42813-42834 [doi]
- ARES: Adaptive Red-Teaming and End-to-End Repair of Policy-Reward SystemJiacheng Liang, Yao Ma, Tharindu Kumarage, Satyapriya Krishna, Rahul Gupta 0001, Kai-Wei Chang 0001, Aram Galstyan, Charith Peris. 42835-42851 [doi]
- Reasoning Traces Shape Outputs but Models Won't Say SoYijie Hao, Lingjie Chen, Ali Emami, Joyce C. Ho. 42852-42878 [doi]
- Value of Information: A Framework for Human-Agent CommunicationYijiang River Dong, Tiancheng Hu, Zheng Hui, Caiqi Zhang, Ivan Vulic, Andreea Bobu, Nigel Collier. 42879-42896 [doi]
- AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning ModelsJiacheng Liang, Tanqiu Jiang, Yuhui Wang 0003, Rongyi Zhu, Fenglong Ma, Ting Wang 0006. 42897-42931 [doi]
- Thinking Alignment of Scenario-Oriented User SimulationXiaoting Wu, Yi Huang 0017, Chunyang Gao, Mengfei Guo, Jingyu Yao, Junlan Feng. 42932-42945 [doi]
- AdapShot: Adaptive Many-Shot In-Context Learning with Semantic-Aware KV Cache ReuseJie Ou, Jinyu Guo, Shiyao Guo, Yuang Li, Ruiqi Wu, Zhaokun Wang, Wenyi Li, Wenhong Tian. 42946-42960 [doi]
- Credal Concept Bottleneck Models for Epistemic-Aleatoric Uncertainty DecompositionTanmoy Mukherjee, Thomas Bailleux, Pierre Marquis, Zied Bouraoui. 42961-42980 [doi]
- How do Role Models Shape Collective Morality? Exemplar-Driven Moral Learning in Multi-Agent SimulationJunjie Liao, Huacong Tang, Zhou Ziheng, Yizhou Wang, Fangwei Zhong. 42981-43016 [doi]
- ReActR: Reasoning through Error-Activated Reflection for LLM Post-TrainingLina Sun. 43017-43028 [doi]
- RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy OptimizationYihong Dong, Xue Jiang, Yongding Tao, Huanyu Liu 0001, Kechi Zhang, Lili Mou, Rongyu Cao, Yingwei Ma, Jue Chen, Binhua Li, Zhi Jin 0001, Fei Huang 0002, Yongbin Li 0001, Ge Li 0001. 43029-43053 [doi]
- Explain the Synth: Interpretable Evaluation of LLM Data SynthesisYue Yang, Fan Yang, Yu Bai, Hao Wang. 43054-43077 [doi]
- Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language ModelsWenxuan Wang 0001, Zizhan Ma, Guo Yu, Yiu-Fai Cheung, Meidan Ding, Jie Liu 0044, Wenting Chen, LinLin Shen. 43078-43123 [doi]
- Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni PerceptionZhen Wan, Chao-Han Huck Yang, Jinchuan Tian, Hanrong Ye, Ankita Pasad, Szu-Wei Fu, Arushi Goel, Ryo Hachiuma, Shizhe Diao, Kunal Dhawan, Sreyan Ghosh, Yusuke Hirota, Zhehuai Chen, Rafael Valle, Chenhui Chu, Shinji Watanabe 0001, Boris Ginsburg, Yu-Chiang Frank Wang. 43124-43142 [doi]
- When Personalization Tricks Detectors: The Feature-Inversion Trap in Machine-Generated Text DetectionLang Gao, Xuhui Li, Chenxi Wang 0001, Mingzhe Li 0001, Wei Liu 0005, Zirui Song, Jinghui Zhang 0002, Rui Yan 0001, Preslav Nakov, Xiuying Chen. 43143-43171 [doi]
- HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM InferenceZhiyuan Shi, Qibo Qiu, Feng Xue, Zhonglin Jiang, Li Yu, Jian Jiang, Xiaofei He 0001, Wenxiao Wang 0001. 43172-43187 [doi]
- Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse RolloutsSijia Luo, Xiaokang Zhang, Yuxuan Hu, Bohan Zhang, Ke Wang, Jinbo Su, Mengshu Sun, Lei Liang, Jing Zhang. 43188-43201 [doi]
- C-World: A Computer Use Agent Environment CreatorZiqiao Xi, Shuang Liang, Qi Liu, Jiaqing Zhang, Letian Peng, Fang Nan, Meshal Nayim, Tianhui Zhang, Rishika Mundada, Lianhui Qin, Biwei Huang, Kun Zhou 0002. 43202-43216 [doi]
- Do Morals Guide How LLMs Think? The Role of Ethical Perspectives in General Problem SolvingIseo Kim, Eunjin Hong, Juae Kim. 43217-43238 [doi]
- ViLL-E: Video LLM Embeddings for RetrievalRohit Gupta 0012, Jayakrishnan Unnikrishnan, Fan Fei 0002, Sheng Liu, Son Tran, Mubarak Shah. 43239-43258 [doi]
- From Trajectories to Graphs: Contract-Checked Editing for Verifier-Guided LLM ReasoningRui Li, Shuang Cao. 43259-43306 [doi]
- SiLP: Enhancing Non-Dominant Language Capabilities with a Selective Bidirectional Language Projection FrameworkJunpeng Liu, Jiuyi Li, Kaiyu Huang, Bo Jin 0001, Degen Huang, Hui Xiong 0001. 43307-43325 [doi]
- Simple Agents, Biased Judges: Efficient Multi-Party Dialogue Generation & The Evaluation GapKunal Samanta, Faisal Tareque Shohan, Amine Trabelsi, Richard Khoury. 43326-43345 [doi]
- EdgeFormer: Latency-Aware Collaborative Multi-Head Attention of Transformer Inference in Edge NetworksYiming Yao, Jianwei Niu 0002, Bin Dai 0009, Tao Ren 0001. 43346-43361 [doi]
- LEAF: Knowledge Distillation of Text Embedding Models with Teacher-Aligned RepresentationsRobin Vujanic, Thomas Rückstieß. 43362-43383 [doi]
- SAT: Balancing Reasoning Accuracy and Efficiency with Stepwise Adaptive ThinkingWeiyang Huang, Xuefeng Bai 0001, Kehai Chen, Xinyang Chen 0001, Yibin Chen, Weili Guan, Min Zhang 0005. 43384-43402 [doi]
- Deep Research with Open-Domain Evaluation and Multi-Stage Guardrails for SafetyWei-Chieh Huang, Henry Peng Zou, Yaozu Wu, Dongyuan Li, Yankai Chen 0001, Weizhi Zhang 0001, Yangning Li, Angelo Zangari, Jizhou Guo, ChunYu Miao, Liancheng Fang, Langzhou He, Yinghui Li, Renhe Jiang, Philip S. Yu. 43403-43446 [doi]
- P-Check: Advancing Personalized Reward Model via Learning to Generate Dynamic ChecklistKwangwook Seo, Dongha Lee 0003. 43447-43471 [doi]
- Locate and Explain: Joint Multimodal Emotion Cause Extraction and Summarization in ConversationJikun Wan, Chen Gong 0004, Guohong Fu. 43472-43489 [doi]
- Understanding the Behaviors of Environment-aware Information RetrievalRuifeng Yuan, Chaohao Yuan, David Dai, Yu Rong 0001, Hong Cheng 0001, Hou Pong Chan, Chenghao Xiao. 43490-43503 [doi]
- ServImage: An Image Generation and Editing Benchmark from Real-world Commercial Imaging ServicesFengxian Ji, Jingpu Yang, Zirui Song, Lang Gao, Junhong Liang, Zhenhao Chen, Jinghui Zhang, Xiuying Chen. 43504-43529 [doi]
- FAIRGAMER: Evaluating Social Biases in LLM-Based Video Game NPCsBingkang Shi, Jen-tse Huang 0001, Luo Long, Tianyu Zong, Hongzhu Yi, Yuanxiang Wang, Songlin Hu 0001, Xiaodan Zhang 0004, Zhongjiang Yao. 43530-43552 [doi]
- EVOTOOL: Self-Evolving Tool-Use Policy Optimization in LLM Agents via Blame-Aware Mutation and Diversity-Aware SelectionShuo Yang, Caren Han, Xueqi Ma, Yan Li 0186, Mohammad Reza Ghasemi Madani, Eduard H. Hovy. 43553-43572 [doi]
- A Lightweight Explainable Guardrail for Prompt SafetyMd. Asiful Islam, Mihai Surdeanu. 43573-43591 [doi]
- Explainable Disentangled Representation Learning for Generalizable Authorship Attribution in the Era of Generative AIHieu Man, Van-Cuong Pham, Nghia Trung Ngo, Franck Dernoncourt, Thien Huu Nguyen. 43592-43604 [doi]
- PodBench: A Comprehensive Benchmark for Instruction-Aware Audio-Oriented Podcast Script GenerationChenning Xu, Mao Zheng, Mingyu Zheng, MingYang Song. 43605-43621 [doi]
- MIND: From Passive Mimicry to Active Reasoning through Capability-Aware Multi-Perspective CoT DistillationJin Cui, Jiaqi Guo, Jiepeng Zhou, Ruixuan Yang, Jiayi Lu, Jiajun Xu, Jiangcheng Song, Boran Zhao, Pengju Ren. 43622-43636 [doi]
- Knowledge Vector of Logical Reasoning in Large Language ModelsZixuan Wang, Yuanyuan Lei 0001. 43637-43651 [doi]
- BanHADEX: Towards Explainable HAte Speech Detection in Bangla Using Human Annotated EXplanationFaisal Hossain Raquib, Akm Moshiur Rahman Mazumder, Md Fahim, Md. Tahmid Hasan Fuad, Md Farhan Ishmam, Faria Sultana, M. Ashraful Amin, Amin Ahsan Ali, AKMMahbubur Rahman. 43652-43674 [doi]
- SMILE-Next: Teaching Large Language Models to Detect, Classify, and Reason about LaughterJungMok Lee, Sung-Bin Kim, Joohyun Chang, Lee Hyun 0001, Tae Hyun Oh. 43675-43693 [doi]
- MolMem: Memory-Augmented Agentic Reinforcement Learning for Sample-Efficient Molecular OptimizationZiqing Wang, Yibo Wen, Abhishek Pandey, Han Liu, Kaize Ding. 43694-43712 [doi]
- Activation Decomposition and Steering for LLM Backdoor RemediationLingfeng Zhong, Qiongkai Xu, Usman Naseem. 43713-43737 [doi]
- A Survey of Large Language Models for Text-Guided Molecular Discovery: From Molecule Generation to OptimizationZiqing Wang, Kexin Zhang 0007, Zihan Zhao, Yibo Wen, Abhishek Pandey, Han Liu, Kaize Ding. 43738-43769 [doi]
- Reward Alignment Optimization: A Direct Point-wise Alignment ApproachZelin Li, Jia Leng, Dawei Song, Yangen Hu. 43770-43784 [doi]
- Programming over Thinking: Efficient and Robust Multi-Constraint PlanningDerrick-Goh-Xin Deik, Quanyu Long, Zhengyuan Liu, Nancy F. Chen, Wenya Wang 0001. 43785-43837 [doi]
- LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint GuidanceYuchun Fan, Bei Li, Peiguang Li, Yilin Wang, Yongyu Mu, Jian Yang, Xin Chen, Rongxiang Weng, Jingang Wang, Xunliang Cai, Jingbo Zhu, Tong Xiao 0001. 43838-43866 [doi]
- Can You Make It Sound Like You? Post-Editing LLM-Generated Text for Personal StyleConnor Baumler, Calvin Bao, Huy Nghiem, Xinchen Yang, Marine Carpuat, Hal Daumé III. 43867-43895 [doi]
- ReCode: Reinforcing Code Generation with Reasoning-Process RewardsLishui Fan, Yu Zhang, Mouxiang Chen, Zhongxin Liu 0002. 43896-43914 [doi]
- PPA-Plan: Proactive Pitfall Avoidance for Reliable Planning in Long-Context LLM ReasoningByeongjin Kim, Gyuwan Kim, Seo-Yeon Park. 43915-43941 [doi]
- OPeRA: A Dataset of Observation, Persona, Rationale, and Action for Evaluating LLMs on Human Online Shopping Behavior SimulationZiyi Wang, Yuxuan Lu 0003, Wenbo Li, Amirali Amini, Bo Sun, Yakov Bart, Weimin Lyu, Jiri Gesi, Tian Wang, Jing Huang, Yu Su, Upol Ehsan, Malihe Alikhani, Toby Jia-Jun Li, Lydia B. Chilton, Dakuo Wang. 43942-43960 [doi]
- Can LLM Agents Simulate Multi-Turn Human Behavior? Evidence from Real Online Customer Behavior DataYuxuan Lu 0003, Jing Huang, Yan Han 0001, Bingsheng Yao, Sisong Bei, Yaochen Xie, Yisi Sang, Qi He 0002, Dakuo Wang. 43961-43977 [doi]
- RATE: Reviewer Profiling and Annotation-free Training for Expertise Ranking in Peer Review SystemsWeicong Liu, Zixuan Yang, YiBo Zhao, Xiang Li. 43978-43996 [doi]
- The Bitter Lesson of Diffusion Language Models for Agentic Workflows: A Comprehensive Reality CheckQingyu Lu 0001, Liang Ding 0006, Kanjian Zhang, Jinxia Zhang, Dacheng Tao. 43997-44020 [doi]
- Trajectory2Task: Training Robust Tool-Calling Agents with Synthesized Yet Verifiable Data for Complex User IntentsZiyi Wang, Yuxuan Lu 0003, Yimeng Zhang, Pei Chen, Ziwei Dong, Jing Huang, Jiri Gesi, Xianfeng Tang, Chen Luo 0003, Qun Liu, Yisi Sang, Hanqing Lu, Manling Li, Jin Lai, Dakuo Wang. 44021-44044 [doi]
- CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report GenerationRuifeng Yuan, Wanxing Chang, Weiwei Cao, Bowen Shi, Zhongyu Wei, Ling Zhang 0002, Jianpeng Zhang. 44045-44058 [doi]
- Lost in Execution: On the Multilingual Robustness of Tool Calling in Large Language ModelsZheng Luo, Thirulogasankar Pranav Kutralingam, Ogochukwu N. Okoani, Wanpeng Xu, Hua Wei 0001, Xiyang Hu. 44059-44077 [doi]
- MTA: A Merge-then-Adapt Framework for Personalized Large Language ModelsXiaopeng Li 0014, Yuanjin Zheng, Wanyu Wang, Wenlin Zhang 0001, Pengyue Jia, Yingyi Zhang 0001, Haiying He, Mengyang Ma, Yiqi Wang 0001, Maolin Wang 0001, Xuetao Wei, Xiangyu Zhao 0001. 44078-44091 [doi]
- Investigating Counterfactual Unfairness in LLMs towards Identities through HumorShubin Kim, Yejin Son, Junyeong Park, Keummin Ka, Seungbeen Lee, Jaeyoung Lee, Hyeju Jang, Alice Oh, Youngjae Yu. 44092-44138 [doi]
- Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video UnderstandingKe Ma, Jiaqi Tang 0005, Bin Guo 0001, Xueting Han, Ruonan Xu, Qingfeng He, Ziheng Wang, Xu Wang 0018, Qifeng Chen 0001, Zhiwen Yu 0001, Yunhao Liu 0001. 44139-44153 [doi]
- POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question AnsweringYichen Xu 0003, Liangyu Chen 0008, Liang Zhang, Zihao Yue, Jianzhe Ma, Wenxuan Wang 0001, Qin Jin. 44154-44186 [doi]
- Nature-Inspired Population-Based Evolution of Large Language ModelsYiqun Zhang, Peng Ye 0006, Xiaocui Yang, Shi Feng 0001, Shufei Zhang, Lei Bai 0001, Wanli Ouyang, Shuyue Hu. 44187-44205 [doi]
- MTRouter: Cost-Aware Multi-Turn LLM Routing with History-Model Joint EmbeddingsYiqun Zhang, Hao Li 0069, Zihan Wang, Shi Feng 0001, Xiaocui Yang, Daling Wang, Bo Zhang 0069, Lei Bai 0001, Shuyue Hu. 44206-44226 [doi]
- Feeling Right vs. Being Right: How AI Sycophancy Affects Value-Laden DeliberationJeongwoo Ryu, Soomin Kim 0001, Jinsu Eun, Kyusik Kim 0001, Changhoon Oh, Bongwon Suh. 44227-44245 [doi]
- ParaSuite: Boosting LLM Reasoning via Paradox ResolutionBin Chen 0006, Yu Zhang 0296, Hongfei Ye, Huiyang Wang, Wenxi Liu, Hongyang Chen 0001. 44246-44256 [doi]
- ReTRE: Benchmarking LLM Transfer Robustness with Structure-Preserving VariantsZhongDong Li, Weijie Shi, Yue Cui 0001, Haolun Ma, Yuanjun Liu 0001, Jiawei Li, An Liu 0002, Jia Zhu 0003, Jiajie Xu 0001. 44257-44268 [doi]
- Do MLLMs Capture How Interfaces Guide User Behavior? A Benchmark for Multimodal UI/UX Design UnderstandingJaehyun Jeon 0002, Min-Soo Kim 0007, Janghan Yoon, Sumin Shim, Yejin Choi 0004, Hanbin Kim, Dae-Hyun Kim, Youngjae Yu. 44269-44294 [doi]
- DarwinTOD: LLM-Driven Lifelong Self-evolution for Task-oriented Dialog SystemsShuyu Zhang, Yujie Liu, Xinru Wang, Cheng Zhang, Yanmin Zhu, Bin Li. 44295-44332 [doi]
- Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix OptimizationHaochun Tang, Yuliang Yan, Jiahua Lu, Huaxiao Liu, Enyan Dai. 44333-44347 [doi]
- GUI0: Self-Evolving Foundational GUI Agents in Super App EcosystemsXinyi Wang, Wei Dai, Kyle Qiao, Ke Wang, Peng Chen, Gang Cao, Kang Qin, Zhongpu Wang, Xiaode Zhang, Yanming Liu, Jihao Gu, Jingtao Xu, Zhi Gong. 44348-44361 [doi]
- Understanding the Prompt SensitivityYang Liu, Chenhui Chu. 44362-44388 [doi]
- rSIM: Incentivizing Reasoning Capabilities of LLMs via Reinforced Strategy InjectionSijia Chen, Baochun Li, Di Niu. 44389-44405 [doi]
- Automatic and Reliable Evaluation for Academic Caption-to-Figure Generation with LMMsGuanghui Ye, Huan Zhao 0003, Qin Zhu, Fengnan Li, Jiaqi Li 0008, Yixian Shen, Zhonghao Ren, Zhihua Jiang. 44406-44423 [doi]
- SafeConstellations: Mitigating Over-Refusals in LLMs Through Task-Aware Representation SteeringUtsav Maskey, Sumit Yadav, Mark Dras, Usman Naseem. 44424-44440 [doi]
- AIPO: Adaptive Information Guided Token-Level Reinforcement Learning for Large Language Model ReasoningBin Chen 0006, Hongfei Ye, Huiyang Wang, Wenxi Liu, Yu Zhang 0296, Furui Liu. 44441-44450 [doi]
- AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World EnvironmentsZhiheng Xi, Dingwen Yang, Jiaqi Liu, Jixuan Huang, Honglin Guo, Baodai Huang, Tinggang Chen, Qi Zhang 0001, Zhonghang Lu, Chenyu Liu, Jiajun Sun, Jiazheng Zhang, Dingwei Zhu, Xin Guo, Junzhe Wang 0001, Zhihao Zhang 0002, Yuming Yang 0001, Junjie Ye 0005, Minghe Gao, Dongrui Liu, Jiaming Ji, Guohao Li, Tao Gui, Xuanjing Huang 0001. 44451-44479 [doi]
- Through the Magnifying Glass: Adaptive Perception Magnification for Hallucination-Free VLM DecodingShunqi Mao, Chaoyi Zhang, Tom Weidong Cai. 44480-44501 [doi]
- Beyond Fully Random Masking: Attention-Guided Denoising and Optimization for Diffusion Language ModelsJia Deng, Junyi Li 0001, Xin Zhao 0018, Jinpeng Wang 0001, Hongyu Lu, Ji-Rong Wen. 44502-44514 [doi]
- MemRec: Collaborative Memory-Augmented Agentic Recommender SystemWeixin Chen 0001, Yuhan Zhao 0001, Jingyuan Huang, Zihe Ye, Mingxuan Ju, Tong Zhao 0003, Neil Shah, Li Chen 0009, Yongfeng Zhang 0003. 44515-44544 [doi]
- INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMsJunqi Yang, Yuecong Min, Jie Zhang 0071, Shiguang Shan, Xilin Chen 0001. 44545-44560 [doi]
- CLAOCS-TX: Cross-Lingual Triplet Extraction with Aspect-Opinion-Aware Code-Switched Prompting and LLM-Guided Contrastive DistillationLipika Dewangan, Chandresh Kumar Maurya. 44561-44577 [doi]
- DAC-Bench: A Decision-Aware Benchmark for Compositional Mobile GUI TasksYuqing Zhang, Honghui Sheng, Xueyu Hu, Shengyu Zhang 0001, Fei Wu 0001. 44578-44598 [doi]
- GMoE: Global Mixture of Experts with Logit PropagationGeonwoo Hong, Taehwan Kim. 44599-44614 [doi]
- When Does Language Matter? Multilingual Instructions Reveal Step-wise Language Sensitivity in Vision-Language-Action ModelsXuan Dong, Zhe Han, Tianhao Niu, Qingfu Zhu, Wanxiang Che. 44615-44629 [doi]
- DialDefer: A Framework for Detecting and Mitigating LLM Dialogic DeferenceParisa Rabbani, Priyam Sahoo, Ruben Mathew, Aishee Mondal, Harshita Ketharaman, Nimet Beyza Bozdag, Dilek Hakkani-Tür. 44630-44671 [doi]
- Benchmarking Fine-Grained Error Detection in Multimodal ReasoningChi-Min Chan, Han Zhu, Chunyang Jiang, Jiaming Ji, Juntao Dai, Wei Xue 0002, Sirui Han, Yike Guo. 44672-44702 [doi]
- Parallel Test-Time Scaling for Latent Reasoning ModelsRunyang You, Yongqi Li 0001, Meng Liu 0006, Wenjie Wang 0007, Liqiang Nie, Wenjie Li 0002. 44703-44717 [doi]
- SciMDR: Advancing Scientific Multimodal Document ReasoningZiyu Chen, Yilun Zhao 0001, Chengye Wang, Rilyn Han, Manasi Patwardhan 0001, Arman Cohan. 44718-44742 [doi]
- When Benchmarks Leak: Inference-Time Decontamination for LLMsJianzhe Chai, Zhe Yu, Jun Sakuma. 44743-44760 [doi]
- HSGraphAgent: Knowledge-Graph-Guided Large Language Models for Harmonized System Code ClassificationQiang Xia, Zijian Zhang, Ao Wang, Wenhan Wang, Xiangyu Wang, Jian Li. 44761-44773 [doi]
- Truth as a Trajectory: What Internal Representations Reveal About Large Language Model ReasoningHamed Damirchi, Imezadelajara, Ehsan Abbasnejad, Afshar Shamsi, Zhen Zhang 0008, Javen Qinfeng Shi. 44774-44790 [doi]
- VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models ReasoningWenyi Xiao, Xinchi Xu, Leilei Gan. 44791-44815 [doi]
- Don't Corrupt the Fact: A Trustworthy RAG Watermarking Framework based on Dual Factual ShieldHao Huang, Jiatang Luo, Ruihua Zhou, Yunpeng Li 0006, Yuling Liu. 44816-44826 [doi]
- I2E: From Image Pixels to Actionable Interactive Environments for Text-Guided Image EditingJinghan Yu, Junhao Xiao, Chenyu Zhu, Jiaming Li, Jia Li, Hanming Deng, Xirui Wang, Guoli Jia, Jianjun Li 0010, Xiang Bai, Bowen Zhou 0002, Zhiyuan Ma 0005. 44827-44850 [doi]
- TInR: Exploring Tool-Internalized Reasoning in Large Language ModelsQiancheng Xu, Yongqi Li 0001, Fan Liu, Hongru Wang 0011, Min Yang 0005, Wenjie Li 0002. 44851-44865 [doi]
- Fine-Grained Analysis of Shared Syntactic Mechanisms in Language ModelsRyoma Kumon, Hitomi Yanaka. 44866-44891 [doi]
- One Persona, Many Cues, Different Results: How Sociodemographic Cues Impact LLM PersonalizationFranziska Weeber, Vera Neplenbroek, Jan Batzner, Sebastian Padó. 44892-44921 [doi]
- Lost in the Mix: Evaluating LLM Understanding of Code-Switched TextAmr Mohamed 0005, Yang Zhang, Michalis Vazirgiannis, Guokan Shang. 44922-44938 [doi]
- Building LLMs Like LEGO: Two-dimensional Architecture Reassembly of Large Language ModelsXingyu Wu, Yu Zhou 0045, Kay Chen Tan. 44939-44956 [doi]
- How Long Reasoning Chains Influence LLMs' Judgment of Answer FactualityMinzhu Tu, Shiyu Ni, Keping Bi. 44957-44972 [doi]
- MMErroR: A Benchmark for Erroneous Reasoning in Vision-Language ModelsYang Shi, Yifeng Xie, Minzhe Guo, Liangsi Lu, Mingxuan Huang, Jingchao Wang, Zhihong Zhu, Boyan Xu, Zhiqi Huang. 44973-44986 [doi]
- Learning How and What to Memorize: Cognition-Inspired Two-Stage Optimization for Evolving MemoryDerong Xu, Shuochen Liu, Pengfei Luo, Pengyue Jia, Yingyi Zhang 0001, Yi Wen 0001, Yimin Deng, Wenlin Zhang 0001, Enhong Chen, Xiangyu Zhao 0001, Tong Xu 0001. 44987-45011 [doi]
- PolitNuggets: Benchmarking Agentic Discovery of Long-Tail Political FactsYifei Zhu. 45012-45035 [doi]
- Diagnosing and Remedying Representation Deficiencies for Deterministic Reasoning in KGQAGewen Liang, Mufan Xu, Kehai Chen, Wei Wang 0164, Yuwei Wang, Muyun Yang, Tiejun Zhao, Min Zhang 0005. 45036-45054 [doi]
- Revealing the Seen, Imagining the Beyond: A Survey of Image-Grounded Chain-of-Thought Reasoning in Multimodal LLMsQihua Dong, Yitian Zhang, Huimin Zeng, Yizhou Wang 0006, Jianglin Lu, Kuo Yang, Yun Fu 0001. 45055-45070 [doi]
- Learning Faster with Better Tokens: Parameter-Efficient Vocabulary Adaptation for Specialized Text SummarizationGunjan Balde, Soumyadeep Roy, Mainack Mondal, Niloy Ganguly. 45071-45086 [doi]
- Adversarial Metric Learning for Fine-Grained Emotion ClassificationJunfan Chen 0001, Sizhe Wu, Richong Zhang, Chunming Hu. 45087-45099 [doi]
- OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language ModelsQiguang Chen, Chengyu Luan, Jiajun Wu, Qiming Yu, Yi Yang, Yizhuo Li 0007, Jingqi Tong, Xiachong Feng, Libo Qin 0001, Wanxiang Che. 45100-45135 [doi]
- Authorship Attribution in Multilingual Machine-Generated TextsLucio La Cava, Dominik Macko, Róbert Móro, Ivan Srba, Andrea Tagarelli. 45136-45152 [doi]
- Layer-Wise High-Impact Parameter Ratio Optimization in Post-Training Quantization for Large Language ModelsCuong Pham 0007, Dung Anh Hoang, Cuong C. Nguyen, Trung Le 0001, Gustavo Carneiro 0001, Thanh-Toan Do. 45153-45166 [doi]
- On the Role of Discriminative Models in Generative Relation ExtractionGuozheng Li, Peng Wang 0004, Zijie Xu 0003, Jing Zhou, Jiajun Liu 0005, Ziyu Shang. 45167-45183 [doi]
- Speculative End-Turn Detector for Efficient Speech Chatbot AssistantHyunjong Ok, Suho Yoo, Jaeho Lee. 45184-45197 [doi]
- TwiUSD: A Benchmark Dataset and Structure-Aware LLM Framework for User Stance DetectionFuqiang Niu, Zini Chen 0001, Zhiyu Xie 0006, Hu Huang 0009, Qing Liao, Qianlong Wang, Genan Dai, Bowen Zhang 0005. 45198-45212 [doi]
- Breaking the Impasse: Dual-Scale Evolutionary Policy Training for Social Language AgentsMinzheng Wang 0001, Run Luo, Yanbo Wang, Zichen Liu, Yuqiao Tan, Tao Tan, Nan Xu 0004, Lu Wang, Wenji Mao. 45213-45235 [doi]
- Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent ReasoningYifan Wang, Shiyu Li, Peiming Li, Xiaochen Yang, Zheng Wei, Yang Tang. 45236-45253 [doi]
- Legal Judgment Prediction: A Reflection on the State of the ArtYi Feng 0005, Chuanyi Li, Vincent Ng 0001. 45254-45273 [doi]
- GRAD: Generalizing RAG Adaptation with DecodingYoungwon Lee 0003, Seung-won Hwang, Zhewei Yao, Yuxiong He. 45274-45290 [doi]
- SHARP: Self-adaptive Harmful Category-aware Prompt Generation for Black-box JailbreakingYingjie Xue, Xingyou Xia, Jun Zhang, Yunbo Cao, Dengpan Ye, Guotong Geng, Fei Li. 45291-45303 [doi]
- Unveiling the Limits of Large Language Models in Inferring Pragmatic Meaning from Non-Verbal ResponsesSugyeong Eo, HeuiSeok Lim. 45304-45316 [doi]
- Does RLVR Extend Reasoning Boundaries? Investigating Capability Expansion in Vision-Language ModelsMinghe Shen, Zhuo Zhi, Chonghan Liu, Shuo Xing, Zhengzhong Tu, Che Liu. 45317-45331 [doi]
- Perception, Understanding and Reasoning: A Multimodal Benchmark for Video Fake News DetectionYakun Cui, Peng Qi, Fushuo Huo, Hang Du, Weijie Shi, Juntao Dai, Zhenghao Zhu, Sirui Han. 45332-45363 [doi]
- RV-HATE: Reinforced Multi-Module Voting for Implicit Hate Speech DetectionYejin Lee, Hyeseon An, Yo-Sub Han. 45364-45383 [doi]
- Cross-Prompt Automated Essay Scoring of Multiple Traits: Making Sense of the State of the ArtShengjie Li 0002, Vincent Ng 0001. 45384-45406 [doi]
- JARVIS or Ultron? A Survey on the Safety and Security Threats of Computer-Using AgentsAda Chen, Yongjiang Wu, Junyuan Zhang, Jingyu Xiao, Shu Yang 0010, Jen-tse Huang 0001, Kun Wang 0056, Wenxuan Wang 0001, Shuai Wang 0011. 45407-45441 [doi]
- Rose-SQL: Role-State Evolution Guided Structured Reasoning for Multi-Turn Text-to-SQLLe Zhou, Feng Yao, Fengcai Qiao, Bo Xu, Fangyuan Wang 0003, Boyan Xu. 45442-45459 [doi]
- Why Do More Experts Fail? A Theoretical Analysis of Model MergingZijing Wang, Xingle Xu, Yongkang Liu 0002, Yiqun Zhang, Peiqin Lin, Shi Feng 0001, Daling Wang, Xiaocui Yang, Hinrich Schütze. 45460-45482 [doi]
- Combining Distantly Supervised Models with In Context Learning for Monolingual and Cross-Lingual Relation ExtractionVipul Kumar Rathore, Malik Hammad Faisal, Parag Singla, Mausam. 45483-45509 [doi]
- Explaining Sources of Uncertainty in Automated Fact-CheckingJingyi Sun, Greta Warren, Irina Shklovski, Isabelle Augenstein. 45510-45534 [doi]
- TRACE: A Corpus of Team Creative DiscussionsYixuan Jiang, Tiancheng Hu, José Hernández-Orallo, David Stillwell, Luning Sun 0001. 45535-45552 [doi]
- Evaluating Structure-Aware Retrieval and Safety in Statute-Centric Legal QAKyubyung Chae, Je Won Yeom, JeongJae Park, Seunghyun Bae, Ijun Jang, Hyunbin Jin, Jinkwan Jang, Taesup Kim. 45553-45573 [doi]
- PRISMA: Preference-Reinforced Self-Training Approach for Interpretable Emotionally Intelligent Negotiation DialoguesPrajwal Vijay Kajare, Priyanshu Priya, Bikash Santra, Asif Ekbal. 45574-45596 [doi]
- SkMTEB: Slovak Massive Text Embedding Benchmark and Model AdaptationMarek Suppa, Andrej Ridzik, Daniel Hládek, Natália Knazeková, Viktoria Ondrejova. 45597-45628 [doi]
- A Linguistics-Aware LLM Watermarking via Syntactic PredictabilityShinwoo Park, Hyejin Park, Hyeseon An, Yo-Sub Han. 45629-45647 [doi]
- Selective Contrastive Learning For Gloss Free Sign Language TranslationChanghao Lai, Rui Zhao, Xuewen Zhong, Jinsong Su, Yidong Chen 0001. 45648-45660 [doi]
- SciCustom: A Framework for Custom Evaluation of Scientific Capabilities in Large Language ModelsYiyang Gu, Junwei Yang, Junyu Luo 0002, Ye Yuan 0016, Bin Feng, Yingce Xia, Shufang Xie 0003, Kaili Liu, Bohan Wu, Qi Shi, Haoran Li 0003, Beier Xiao, Zhiping Xiao 0001, Xiao Luo 0001, Weizhi Zhang 0001, Philip S. Yu, Zequn Liu, Ming Zhang 0004. 45661-45678 [doi]
- NSF-SciFy: Mining the NSF Awards Database for Scientific ClaimsDelip Rao, Weiqiu You, Eric Wong 0001, Chris Callison-Burch. 45679-45697 [doi]
- Learning Invariant Modality Representation for Robust Multimodal Learning from a Causal Inference PerspectiveSijie Mai, Shiqin Han. 45698-45721 [doi]
- Multi-Task Representation Alignment on Language Understanding: A Mutual Information PerspectiveDou Hu 0001, Lingwei Wei, Hongjiang Xiao, Songlin Hu 0001, Yuan Zhang 0013. 45722-45740 [doi]
- EconProver: Towards More Economical Test-Time Scaling for Automated Theorem ProvingMukai Li, Linfeng Song, Zhenwen Liang, Jiahao Xu, Shansan Gong, Qi Liu, Haitao Mi, Dong Yu. 45741-45753 [doi]
- Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement LearningSiyuan Gan, Jiaheng Liu, Boyan Wang, Tianpei Yang, Runqing Miao, Yuyao Zhang, Fanyu Meng, Junlan Feng, Linjian Meng, Jing Huo, Yang Gao 0001. 45754-45771 [doi]
- LLM-Based Multi-Agent Systems for Clinical Workflows: A Survey of AI HospitalsZonghai Yao, Hong Yu 0001. 45772-45793 [doi]
- Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMsRohit Sinha 0005, Aditya Sanjiv Kanade, Sai Srinivas Kancheti, Vineeth N. Balasubramanian, Tanuja Ganu. 45794-45835 [doi]
- EverMemOS: A Self-Organizing Memory Operating System for Structured Long-Horizon ReasoningChuanrui Hu, Xingze Gao, Zuyi Zhou, Dannong Xu, Yi Bai, Xintong Li, Hui Zhang 0093, Tong Li, Chong Zhang, Lidong Bing, Yafeng Deng. 45836-45853 [doi]
- Interpretable Coreference Resolution Evaluation Using Explicit SemanticsBruno Gatti, Giuliano Martinelli 0001, Roberto Navigli. 45854-45872 [doi]
- SURE or Not? Investigating Semantic Understanding in Dense Retrieval ModelsLingdi Kong, Xuanang Chen, Ben He 0001, Le Sun 0001. 45873-45887 [doi]
- When High Accuracy Hides Poor Calibration: Rethinking Confidence Evaluation in Transformer-Based Text Classification with Balanced Brier ScoreGuilherme Fonseca, Gabriel Prenassi, Washington Cunha, Leonardo Chaves Dutra da Rocha, Marcos André Gonçalves. 45888-45900 [doi]
- Doc-V^*: Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQAYuanlei Zheng, Pei Fu, Hang Li 0001, Ziyang Wang, Yuyi Zhang, Wenyu Ruan, Xiaojin Zhang 0002, Zhongyu Wei, Zhenbo Luo, Jian Luan 0001, Wei Chen 0088, Xiang Bai. 45901-45923 [doi]
- Privacy-R1: Privacy-Aware Multi-LLM Agent Collaboration via Reinforcement LearningZheng Hui, Yijiang River Dong, Sanhanat Sivapiromrat, Ehsan Shareghi, Nigel Collier. 45924-45937 [doi]
- Reinforcement Learning for Diffusion LLMs via Energy-Based Gibbs AlignmentYijia Fan, Jing Yang, Mingyu Liu, Kaitong Cai, Jian Wang 0100, Keze Wang, Jusheng Zhang. 45938-45948 [doi]
- CxMP: A Linguistic Minimal-Pair Benchmark for Evaluating Constructional Understanding in Language ModelsMiyu Oba, Saku Sugawara. 45949-45963 [doi]
- Evaluating Temporal Consistency in Multi-Turn Language ModelsYash Kumar Atri, Steven L. Johnson, Thomas Hartvigsen. 45964-45982 [doi]
- Synthia: Scalable Grounded Persona Generation from Social Media DataVahid Rahimzadeh, Erfan Moosavi Monazzah, Mohammad Taher Pilehvar, Yadollah Yaghoobzadeh. 45983-46006 [doi]
- From Recognition to Reasoning: Benchmarking and Enhancing MLLMs on Real-World Receipt Document UnderstandingYandi Wang, Libin Zhan, Ziwei Huang 0005, Tiancheng Luo, Yuxuan Jiang, Wang Dong, Leilei Gan, Jun Chen. 46007-46024 [doi]
- LogicEval: A Systematic Framework for Evaluating Automated Repair Techniques for Logical Vulnerabilities in Real-World SoftwareSyed Md. Mukit Rashid, Abdullah Al Ishtiaq, Kai Tu, Yilu Dong, Tianwei Wu, Ali Ranjbar, Tianchang Yang, Najrin Sultana, Shagufta Mehnaz, Syed Rafiul Hussain. 46025-46049 [doi]
- Mind the Pause: Disfluency-Aware Objective Tuning for Multilingual Speech Correction with LLMsDeepak Kumar, Baban Gain, Asif Ekbal. 46050-46070 [doi]
- BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language ModelsXin Gao, Ruiyi Zhang, Meixi Du, Peijia Qin, Pengtao Xie. 46071-46086 [doi]
- COMPASS: A Framework for Evaluating Organization-Specific Policy Alignment in LLMsDasol Choi, Donggeon Lee, Brigitta Jesica Kartono, Helena Berndt, Taeyoun Kwon, Joonwon Jang, Haon Park, Hwanjo Yu, Minsuk Kahng. 46087-46133 [doi]
- Paper2Rebuttal: A Multi-Agent Framework for Transparent Author Response AssistanceQianli Ma 0008, Chang Guo, Zhiheng Tian, Siyu Wang, Jipeng Xiao, Yuanhao Yue, Zhipeng Zhang. 46134-46166 [doi]
- Data Efficient RLVR via Off-Policy Influence GuidanceErle Zhu, Dazhi Jiang, Yuan Wang, Xujun Li, Jiale Cheng, Yuxian Gu, Yilin Niu, Aohan Zeng, Jie Tang 0001, Minlie Huang, Hongning Wang. 46167-46192 [doi]
- CEBC: Conformal Evidence-Bounded Control for Low-Hallucination Vision-Language GenerationAshish Mishra 0005, Tarun Kumar, Arpit Shah, Suparna Bhattacharya, Martin Foltin. 46193-46206 [doi]
- Dual Alignment Between Language Model Layers and Human Sentence ProcessingTatsuki Kuribayashi, Alex Warstadt, Yohei Oseki, Ethan Gotlieb Wilcox. 46207-46223 [doi]
- Rethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image EditingTingyu Song, Yanzhao Zhang, Mingxin Li, Zhuoning Guo, Dingkun Long, Pengjun Xie, Siyue Zhang, Yilun Zhao 0001, Shu Wu. 46224-46242 [doi]
- EDSD: Entropy-Driven Design for Faster Speculative DecodingLongkai Cheng, Ximing Wang, Jiangcai Zhu, Kailai Shao, Chao Chen, Haixiang Hu. 46243-46260 [doi]
- MUTANT: A Recipe for Multilingual Tokenizer DesignSouvik Rana, Ashish Kulkarni, Arul Menezes, Chandra Khatri, Shubham Agarwal. 46261-46277 [doi]
- FactCorrector: A Graph-Inspired Approach to Long-Form Factuality Correction of Large Language ModelsJavier Carnerero-Cano, Massimiliano Pronesti, Radu Marinescu 0002, Tigran T. Tchrakian, James Barry, Jasmina Gajcin, Yufang Hou 0001, Alessandra Pascale, Elizabeth M. Daly. 46278-46307 [doi]
- MADE: A Living Benchmark for Multi-Label Text Classification with Uncertainty Quantification of Medical Device Adverse EventsRaunak Agarwal, Markus A. Wenzel, Simon Baur, Jonas Zimmer, George Harvey, Jackie Ma. 46308-46328 [doi]
- Overcoming Copyright Barriers in Corpus Distribution Through Non-Reversible HashingArthur Amalvy, Vincent Labatut, Xavier Bost, Hen-Hsen Huang. 46329-46345 [doi]
- UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained AssessmentYuanyuan Wang, Dongchao Yang, Yayue Deng, Zhiyong Wu 0001, Steven Y. Guo, Helen M. Meng, Xixin Wu. 46346-46366 [doi]
- DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based AgentsJunshuo Zhang, Chengrui Huang 0001, Feng Guo, Zihan Li, Ke Shi, Menghua Jiang, Jiguo Yu, Shuo Shang, Shen Gao. 46367-46389 [doi]
- TEA-Bench: A Systematic Benchmarking of Tool-enhanced Emotional Support Dialogue AgentXingyu Sui, Yanyan Zhao, Yulin Hu, Jiahe Guo, Weixiang Zhao, Bing Qin 0001. 46390-46416 [doi]
- An Information-Theoretic Foundation for the Subregular HierarchyMai Phan Quoc Hung, Khanh Nguyen Quoc, Doàn Minh Luong, Duong Thu Ngan, Duong Thi Phuong Thao, Tuan Do. 46417-46429 [doi]
- ReGATE: Learning Faster and Better with Fewer Tokens in MLLMsChaoyu Li, Yogesh Kulkarni,