Abstract is missing.
- From Lazy to Prolific: Tackling Missing Labels in Open Vocabulary Extreme Classification by Positive-Unlabeled Sequence LearningRanran Haoran Zhang, Bensu Uçar, Soumik Dey, Hansi Wu, Binbin Li 0009, Rui Zhang 0037. 1-16 [doi]
- DiffZOO: A Purely Query-Based Black-Box Attack for Red-teaming Text-to-Image Generative Model via Zeroth Order OptimizationPucheng Dang, Xing Hu 0001, Dong Li, Rui Zhang 0040, Qi Guo 0001, Kaidi Xu. 17-31 [doi]
- MedOdyssey: A Medical Domain Benchmark for Long Context Evaluation Up to 200K TokensYongqi Fan, Hongli Sun, Kui Xue, Xiaofan Zhang 0002, Shaoting Zhang 0001, Tong Ruan. 32-56 [doi]
- Can LLMs Learn Macroeconomic Narratives from Social Media?Almog Gueta, Amir Feder, Zorik Gekhman, Ariel Goldstein, Roi Reichart. 57-78 [doi]
- Code-Optimise: Self-Generated Preference Data for Correctness and EfficiencyLeonidas Gee, Milan Gritta, Gerasimos Lampouras, Ignacio Iacobacci. 79-94 [doi]
- People will agree what I think: Investigating LLM's False Consensus EffectJunhyuk Choi, Yeseon Hong, Bugeun Kim. 95-126 [doi]
- LawInstruct: A Resource for Studying Language Model Adaptation to the Legal DomainJoel Niklaus, Lucia Zheng, Arya D. McCarthy, Christopher Hahn, Brian M. Rosen, Peter Henderson 0002, Daniel E. Ho, Garrett Honke, Percy Liang, Christopher D. Manning. 127-152 [doi]
- Stephanie: Step-by-Step Dialogues for Mimicking Human Interactions in Social ConversationsHao Yang, Hongyuan Lu, Xinhua Zeng, Yang Liu 0246, Xiang Zhang, Haoran Yang, Yumeng Zhang, Shan Huang, Yiran Wei, Wai Lam. 153-166 [doi]
- ConShift: Sense-based Language Variation Analysis using Flexible AlignmentClare Arrington, Maurício Gruppi, Sibel Adali. 167-181 [doi]
- Breaking the Stigma! Unobtrusively Probe Symptoms in Depression Disorder Diagnosis DialogueJieming Cao, Chen Huang, Yanan Zhang, Ruibo Deng, JinCheng Zhang, Wenqiang Lei. 182-200 [doi]
- ToVo: Toxicity Taxonomy via VotingTinh Son Luong, Thanh-Thien Le, Thang Viet Doan, Linh Ngo Van 0001, Thien Huu Nguyen, Nguyen Thi Ngoc Diep. 201-212 [doi]
- HALLUCANA: Fixing LLM Hallucination with A Canary LookaheadTianyi Li, Erenay Dayanik, Shubhi Tyagi, Andrea Pierleoni. 213-230 [doi]
- Enhancing Adversarial Transferability in Visual-Language Pre-training Models via Local Shuffle and Sample-based AttackXin Liu 0087, Aoyang Zhou, Kun He 0001. 231-245 [doi]
- Dis2Dis: Explaining Ambiguity in Fact-CheckingIeva Staliunaite, Andreas Vlachos 0001. 246-267 [doi]
- Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-ImprovementXiyao Wang, Jiuhai Chen, Zhaoyang Wang, Yuhang Zhou, Yiyang Zhou, Huaxiu Yao, Tianyi Zhou 0001, Tom Goldstein, Parminder Bhatia, Taha A. Kass-Hout, Furong Huang, Cao Xiao. 268-282 [doi]
- RePD: Defending Jailbreak Attack through a Retrieval-based Prompt Decomposition ProcessPeiran Wang, Xiaogeng Liu, Chaowei Xiao. 283-294 [doi]
- ChatCRS: Incorporating External Knowledge and Goal Guidance for LLM-based Conversational Recommender SystemsChuang Li 0006, Yang Deng 0002, Hengchang Hu, Min-Yen Kan, Haizhou Li 0001. 295-312 [doi]
- Data-Efficiently Learn Large Language Model for Universal 3D Scene PerceptionZehan Wang 0001, Haifeng Huang, Yang Zhao 0022, Ziang Zhang, Tao Jin 0004, Zhou Zhao 0001. 313-333 [doi]
- UnifiedMLLM: Enabling Unified Representation for Multi-modal Multi-tasks With Large Language ModelZhaowei Li, Wei Wang 0378, Yiqing Cai, Qi Xu, Pengyu Wang 0006, Dong Zhang, Hang Song, Botian Jiang, Zhida Huang, Tao Wang. 334-344 [doi]
- PEMV: Improving Spatial Distribution for Emotion Recognition in Conversations Using Proximal Emotion Mean VectorsChen Lin, Fei Li 0021, Donghong Ji, Chong Teng. 345-357 [doi]
- DiscoverGPT: Multi-task Fine-tuning Large Language Model for Related Table DiscoveryXuming Hu, Xiao Qin 0003, Chuan Lei, Asterios Katsifodimos, Zhengyuan Shen, Balasubramaniam Srinivasan, Huzefa Rangwala. 358-373 [doi]
- Can GPT-4 Sway Experts' Investment Decisions?Takehiro Takayanagi, Hiroya Takamura, Kiyoshi Izumi, Chung-Chi Chen 0001. 374-383 [doi]
- PolyJoin: Semantic Multi-key Joinable Table Search in Data LakesXuming Hu, Chuan Lei, Xiao Qin 0003, Asterios Katsifodimos, Christos Faloutsos, Huzefa Rangwala. 384-395 [doi]
- Marrying LLMs with Dynamic Forecasting: A Graph Mixture-of-expert PerspectiveDapeng Jiang, Xiao Luo. 396-410 [doi]
- DialogGen: Multi-modal Interactive Dialogue System with Multi-turn Text-Image GenerationMinbin Huang, Yanxin Long, Xinchi Deng, Ruihang Chu, Jiangfeng Xiong, Xiaodan Liang, Hong Cheng 0001, Qinglin Lu, Wei Liu 0005. 411-426 [doi]
- RELexED: Retrieval-Enhanced Legal Summarization with Exemplar DiversityT. Y. S. S. Santosh, Chen Jia, Patrick Goroncy, Matthias Grabmair. 427-434 [doi]
- CLaMP 2: Multimodal Music Information Retrieval Across 101 Languages Using Large Language ModelsShangda Wu, Yashan Wang, Ruibin Yuan, Zhancheng Guo, Xu Tan 0003, Ge Zhang, Monan Zhou, Jing Chen, Xuefeng Mu, Yuejie Gao, Yuanliang Dong, Jiafeng Liu, Xiaobing Li, Feng Yu, Maosong Sun 0001. 435-451 [doi]
- LogRules: Enhancing Log Analysis Capability of Large Language Models through RulesXin Huang, Ting Zhang, Wen Zhao. 452-470 [doi]
- Audio Description Generation in the Era of LLMs and VLMs: A Review of Transferable Generative AI TechnologiesYingqiang Gao, Lukas Fischer 0003, Alexa Lintner, Sarah Ebling. 471-490 [doi]
- Adaptive Retrieval-Augmented Generation for Conversational SystemsXi Wang 0012, Procheta Sen, Ruizhe Li 0001, Emine Yilmaz. 491-503 [doi]
- Multimodal Generation with Consistency TransferringJunxiang Qiu, Jinda Lu, Shuo Wang 0008. 504-513 [doi]
- On the Impact of Noise in Differentially Private Text RewritingStephen Meisenbacher, Maulik Chevli, Florian Matthes. 514-532 [doi]
- Teaching Large Language Models Number-Focused Headline Generation With Key Element RationalesZhen Qian, Xiuzhen Zhang 0001, Xiaofei Xu, Feng Xia 0001. 533-550 [doi]
- Zero-Shot Strategies for Length-Controllable SummarizationFabian Retkowski, Alexander Waibel. 551-572 [doi]
- SIMPLOT: Enhancing Chart Question Answering by Distilling EssentialsWonjoong Kim, Sangwu Park, Yeonjun In, Seokwon Han, Chanyoung Park 0001. 573-593 [doi]
- InstructAny2Pix: Image Editing with Multi-Modal PromptsShufan Li, Harkanwar Singh, Aditya Grover. 594-619 [doi]
- Lost in Overlap: Exploring Logit-based Watermark Collision in LLMsYiyang Luo, Ke Lin 0003, Chao Gu, Jiahui Hou, Lijie Wen, Luo Ping. 620-637 [doi]
- Prompt-Guided Selective Masking Loss for Context-Aware Emotive Text-to-SpeechYejin Jeon, Youngjae Kim, Jihyun Lee, Gary Lee 0001. 638-650 [doi]
- Identifying and Mitigating Social Bias Knowledge in Language ModelsRuizhe Chen, Yichen Li, Jianfei Yang, Yang Feng 0011, Joey Tianyi Zhou, Jian Wu 0001, Zuozhu Liu. 651-672 [doi]
- DiaSynth: Synthetic Dialogue Generation Framework for Low Resource Dialogue ApplicationsSathya Krishnan Suresh, Mengjun Wu, Tushar Pranav, Engsiong Chng. 673-690 [doi]
- Do Not Design, Learn: A Trainable Scoring Function for Uncertainty Estimation in Generative LLMsDuygu Nur Yaldiz, Yavuz Faruk Bakman, Baturalp Buyukates, Chenyang Tao, Anil Ramakrishna, Dimitrios Dimitriadis, Jieyu Zhao, Salman Avestimehr. 691-713 [doi]
- Joint Learning Event-Specific Probe and Argument Library with Differential Optimization for Document-Level Multi-Event ExtractionJianpeng Hu, Chao Xue, Chunqing Yu, Jiacheng Xu, Chengxiang Tan. 714-726 [doi]
- Synonym-unaware Fast Adversarial Training against Textual Adversarial AttacksYichen Yang 0009, Xin Liu 0087, Kun He 0001. 727-739 [doi]
- Tethering Broken Themes: Aligning Neural Topic Models with Labels and AuthorsMayank Nagda, Phil Ostheimer, Sophie Fellenz. 740-760 [doi]
- Towards Zero-Shot Multimodal Machine TranslationMatthieu Futeral, Cordelia Schmid, Benoît Sagot, Rachel Bawden. 761-778 [doi]
- Large-Scale Corpus Construction and Retrieval-Augmented Generation for Ancient Chinese Poetry: New Method and Data InsightsYang Liu 0353, Lan Lan, Jiahuan Cao, Hiuyi Cheng, Kai Ding 0009, Lianwen Jin. 779-817 [doi]
- OpenBioNER: Lightweight Open-Domain Biomedical Named Entity Recognition Through Entity Type DescriptionAlessio Cocchieri, Giacomo Frisoni, Marcos Martínez Galindo, Gianluca Moro, Giuseppe Tagliavini, Francesco Candoli. 818-837 [doi]
- Dialetto, ma Quanto Dialetto? Transcribing and Evaluating Dialects on a ContinuumRyan Soh-Eun Shim, Barbara Plank. 838-849 [doi]
- Linguistically Grounded Analysis of Language Models using Shapley Head ValuesMarcell Fekete, Johannes Bjerva. 850-865 [doi]
- How Do Large Language Models Perform in Dynamical System ModelingXiao Luo 0001, Binqi Chen, Haixin Wang 0003, Zhiping Xiao 0001, Ming Zhang 0004, Yizhou Sun. 866-880 [doi]
- LMMs-Eval: Reality Check on the Evaluation of Large Multimodal ModelsKaichen Zhang, Bo Li 0125, Peiyuan Zhang, Fanyi Pu, Joshua Adrian Cahyono, Kairui Hu, Shuai Liu 0002, Yuanhan Zhang, Jingkang Yang, Chunyuan Li, Ziwei Liu 0002. 881-916 [doi]
- Pairwise Prompt-Based Tuning with Parameter Efficient Fast Adaptation for Generalized Zero-Shot Intent DetectionXiaotong Zhang 0003, Qianru Zhou, Han Liu 0008, Hong Yu 0005. 917-929 [doi]
- FaithfulPersona: Balancing Faithfulness and Personalization in Code Explanations through Self-CritiqueZhuang Luo, Yichuan Li 0001, Zexing Xu, Kyumin Lee, S. Rasoul Etesami 0001. 930-944 [doi]
- Efficient Multi-Agent Collaboration with Tool Use for Online Planning in Complex Table Question AnsweringWei Zhou, Mohsen Mesgar, Annemarie Friedrich, Heike Adel. 945-968 [doi]
- Ground Every Sentence: Improving Retrieval-Augmented LLMs with Interleaved Reference-Claim GenerationSirui Xia, Xintao Wang 0001, Jiaqing Liang, Yifei Zhang, Weikang Zhou, Jiaji Deng, Fei Yu, Yanghua Xiao. 969-988 [doi]
- Understanding the Role of Mental Models in User Interaction with an Adaptive Dialog AgentLindsey Vanderlyn, Dirk Väth, Ngoc Thang Vu. 989-1015 [doi]
- CoPERLex: Content Planning with Event-based Representations for Legal Case SummarizationT. Y. S. S. Santosh, Youssef Farag, Matthias Grabmair. 1016-1032 [doi]
- DisComp: A Two-Stage Prompt Optimization Framework Combining Task-Agnostic and Task-Aware CompressionQuancai Liu, Haihui Fan, Jinchao Zhang, Xiangfang Li, Chuanrong Li, Bo Li. 1033-1044 [doi]
- A Large-Scale Benchmark for Vietnamese Sentence ParaphrasesSang Quang Nguyen, Kiet Van Nguyen. 1045-1060 [doi]
- RAMQA: A Unified Framework for Retrieval-Augmented Multi-Modal Question AnsweringYang Bai, Christan Grant, Daisy Zhe Wang. 1061-1076 [doi]
- MultiCAT: Multimodal Communication Annotations for TeamsAdarsh Pyarelal, John Culnan, Ayesha Qamar, Meghavarshini Krishnaswamy, Yuwei Wang, Cheonkam Jeong, Chen Chen, Md Messal Monem Miah, Shahriar Hormozi, Jonathan Tong, Ruihong Huang. 1077-1111 [doi]
- Prototype Tuning: A Meta-Learning Approach for Few-Shot Document-Level Relation Extraction with Large Language ModelsDinghao Pan, Yuanyuan Sun 0002, Bo Xu 0009, Jiru Li, Zhihao Yang, Ling Luo 0001, Hongfei Lin, Jian Wang 0021. 1112-1128 [doi]
- LegalSeg: Unlocking the Structure of Indian Legal Judgments Through Rhetorical Role ClassificationShubham Kumar Nigam, Tanmay Dubey, Govind Sharma 0004, Noel Shallum, Kripabandhu Ghosh, Arnab Bhattacharya 0001. 1129-1144 [doi]
- Claim-Guided Textual Backdoor Attack for Practical ApplicationsMinkyoo Song, Hanna Kim, Jaehan Kim, Youngjin Jin, Seungwon Shin 0001. 1145-1159 [doi]
- ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use CapabilitiesJiarui Lu, Thomas Holleis, Yizhe Zhang 0002, Bernhard Aumayer, Feng Nan, Haoping Bai, Shuang Ma, Shen Ma, Mengyu Li, Guoli Yin, Zirui Wang, Ruoming Pang. 1160-1183 [doi]
- SusGen-GPT: A Data-Centric LLM for Financial NLP and Sustainability Report GenerationQilong Wu, Xiaoneng Xiang, Hejia Huang, Xuan Wang, Wei Jie Yeo, Ranjan Satapathy, Ricardo Shirota Filho, Bharadwaj Veeravalli. 1184-1203 [doi]
- GrEmLIn: A Repository of Green Baseline Embeddings for 87 Low-Resource Languages Injected with Multilingual Graph KnowledgeDaniil Gurgurov, Rishu Kumar, Simon Ostermann 0002. 1204-1221 [doi]
- In-Context Example Selection via Similarity Search Improves Low-Resource Machine TranslationArmel Randy Zebaze, Benoît Sagot, Rachel Bawden. 1222-1252 [doi]
- Self-Training Large Language Models for Tool-Use Without DemonstrationsNe Luo, Aryo Pradipta Gema, Xuanli He, Emile van Krieken, Pietro Lesci, Pasquale Minervini. 1253-1271 [doi]
- Can Large Language Models Generate High-quality Patent Claims?Lekang Jiang, Caiqi Zhang, Pascal A Scherz, Stefan Goetz. 1272-1287 [doi]
- Obliviate: Neutralizing Task-agnostic Backdoors within the Parameter-efficient Fine-tuning ParadigmJaehan Kim, Minkyoo Song, Seung Ho Na, Seungwon Shin 0001. 1288-1307 [doi]
- CORAL: Benchmarking Multi-turn Conversational Retrieval-Augmented GenerationYiruo Cheng, Kelong Mao, Ziliang Zhao, Guanting Dong, Hongjin Qian, Yongkang Wu, Tetsuya Sakai, Ji-Rong Wen, Zhicheng Dou. 1308-1330 [doi]
- Beyond English: The Impact of Prompt Translation Strategies across Languages and Tasks in Multilingual LLMsItai Mondshine, Tzuf Paz-Argaman, Reut Tsarfaty. 1331-1354 [doi]
- QuaLLM: An LLM-based Framework to Extract Quantitative Insights from Online ForumsVarun Nagaraj Rao, Eesha Agarwal, Samantha Dalal, Dana Calacci, Andrés Monroy-Hernández. 1355-1369 [doi]
- The Promises and Pitfalls of LLM Annotations in Dataset Labeling: a Case Study on Media Bias DetectionTomás Horych, Christoph Mandl, Terry Ruas, André Greiner-Petter, Bela Gipp, Akiko Aizawa, Timo Spinde. 1370-1386 [doi]
- Mechanistic Unveiling of Transformer Circuits: Self-Influence as a Key to Model ReasoningLin Zhang, Lijie Hu, Di Wang 0015. 1387-1404 [doi]
- Intrinsic Model Weaknesses: How Priming Attacks Unveil Vulnerabilities in Large Language ModelsYuyi Huang, Runzhe Zhan, Derek F. Wong, Lidia S. Chao, Ailin Tao. 1405-1425 [doi]
- AdParaphrase: Paraphrase Dataset for Analyzing Linguistic Features toward Generating Attractive Ad TextsSoichiro Murakami, Peinan Zhang, Hidetaka Kamigaito, Hiroya Takamura, Manabu Okumura. 1426-1439 [doi]
- Token Weighting for Long-Range Language ModelingFalko Helm, Nico Daheim, Iryna Gurevych. 1440-1459 [doi]
- Learning to Explore and Select for Coverage-Conditioned Retrieval-Augmented GenerationTakyoung Kim, Kyungjae Lee 0002, Young Rok Jang, Ji Yong Cho, Gangwoo Kim, Minseok Cho, Moontae Lee. 1460-1480 [doi]
- LayAlign: Enhancing Multilingual Reasoning in Large Language Models via Layer-Wise Adaptive Fusion and Alignment StrategyZhiwen Ruan, Yixia Li, He Zhu, Longyue Wang, Weihua Luo, Kaifu Zhang, Yun Chen 0007, Guanhua Chen 0001. 1481-1495 [doi]
- On the Impacts of Contexts on Repository-Level Code GenerationNam Le Hai, Dung Manh Nguyen, Nghi D. Q. Bui. 1496-1524 [doi]
- From Argumentation to Deliberation: Perspectivized Stance Vectors for Fine-grained (Dis)agreement AnalysisMoritz Plenz, Philipp Heinisch, Janosch Gehring, Philipp Cimiano, Anette Frank. 1525-1553 [doi]
- LVLM-Compress-Bench: Benchmarking the Broader Impact of Large Vision-Language Model CompressionSouvik Kundu 0002, Anahita Bhiwandiwalla, Sungduk Yu, Phillip Howard, Tiep Le, Sharath Nittur Sridhar, David Cobbley, Hao Kang, Vasudev Lal. 1554-1570 [doi]
- Does Generative AI speak Nigerian-Pidgin?: Issues about Representativeness and Bias for Multilingualism in LLMsDavid Ifeoluwa Adelani, A. Seza Dogruöz, Iyanuoluwa Shode, Anuoluwapo Aremu. 1571-1583 [doi]
- A Guide To Effectively Leveraging LLMs for Low-Resource Text Summarization: Data Augmentation and Semi-supervised ApproachesGaurav Sahu, Olga Vechtomova, Issam H. Laradji. 1584-1603 [doi]
- Decoding Dark Matter: Specialized Sparse Autoencoders for Interpreting Rare Concepts in Foundation ModelsAashiq Muhamed, Mona T. Diab, Virginia Smith. 1604-1635 [doi]
- MAiDE-up: Multilingual Deception Detection of AI-generated Hotel ReviewsOana Ignat, Xiaomeng Xu, Rada Mihalcea. 1636-1653 [doi]
- LeCoPCR: Legal Concept-guided Prior Case Retrieval for European Court of Human Rights casesT. Y. S. S. Santosh, Isaac Misael Olguín Nolasco, Matthias Grabmair. 1654-1661 [doi]
- How much do contextualized representations encode long-range context?Simeng Sun, Cheng-Ping Hsieh. 1662-1679 [doi]
- Data Poisoning for In-context LearningPengfei He, Han Xu 0002, Yue Xing 0002, Hui Liu 0031, Makoto Yamada, Jiliang Tang. 1680-1700 [doi]
- Synthetic Audio Helps for Cognitive State TasksAdil Soubki, John Murzaku, Peter Zeng, Owen Rambow. 1701-1708 [doi]
- BioEL: A Comprehensive Python Package for Biomedical Entity LinkingPrasanth Bathala, Christophe Ye, Batuhan Nursal, Shubham Lohiya, David Kartchner, Cassie S. Mitchell. 1709-1721 [doi]
- PairScale: Analyzing Attitude Change with Pairwise ComparisonsRupak Sarkar, Patrick Y. Wu, Kristina Miler, Alexander Miserlis Hoyle, Philip Resnik. 1722-1738 [doi]
- Semantic Consistency-Based Uncertainty Quantification for Factuality in Radiology Report GenerationChenyu Wang, Weichao Zhou, Shantanu Ghosh, Kayhan Batmanghelich, Wenchao Li 0001. 1739-1754 [doi]
- RewardBench: Evaluating Reward Models for Language ModelingNathan Lambert 0001, Valentina Pyatkin, Jacob Morrison, Lester James V. Miranda, Bill Yuchen Lin, Khyathi Raghavi Chandu, Nouha Dziri, Sachin Kumar 0009, Tom Zick, Yejin Choi 0001, Noah A. Smith, Hannaneh Hajishirzi. 1755-1797 [doi]
- Evaluating Vision-Language Models for Emotion RecognitionSree Bhattacharyya, James Z. Wang 0001. 1798-1820 [doi]
- Tomato, Tomahto, Tomate: Do Multilingual Language Models Understand Based on Subword-Level Semantic Concepts?Crystina Zhang, Jing Lu, Vinh Q. Tran 0002, Tal Schuster, Donald Metzler, Jimmy Lin. 1821-1837 [doi]
- Open Domain Question Answering with Conflicting ContextsSiyi Liu, Qiang Ning, Kishaloy Halder, Zheng Qi, Wei Xiao, Phu Mon Htut, Yi Zhang 0001, Neha Anna John, Bonan Min, Yassine Benajiba, Dan Roth. 1838-1854 [doi]
- The Geometry of Prompting: Unveiling Distinct Mechanisms of Task Adaptation in Language ModelsArtem Kirsanov, Chi-Ning Chou, KyungHyun Cho, SueYeon Chung. 1855-1888 [doi]
- Biases in Opinion Dynamics in Multi-Agent Systems of Large Language Models: A Case Study on Funding AllocationPedro Cisneros-Velarde. 1889-1916 [doi]
- CaseSumm: A Large-Scale Dataset for Long-Context Summarization from U.S. Supreme Court OpinionsMourad Heddaya, Kyle MacMillan, Hongyuan Mei, Chenhao Tan, Anup Malani. 1917-1942 [doi]
- Chasing Random: Instruction Selection Strategies Fail to GeneralizeHarshita Diddee, Daphne Ippolito. 1943-1957 [doi]
- Can't Hide Behind the API: Stealing Black-Box Commercial Embedding ModelsManveer Singh Tamber, Jasper Xian, Jimmy Lin. 1958-1969 [doi]
- CAMEL-Bench: A Comprehensive Arabic LMM BenchmarkSara Ghaboura, Ahmed Heakl, Omkar Thawakar, Ali Husain Salem Abdulla Alharthi, Ines Riahi, Abduljalil Radman, Jorma Laaksonen, Fahad Shahbaz Khan, Salman Khan 0001, Rao Muhammad Anwer. 1970-1980 [doi]
- ProxyLM: Predicting Language Model Performance on Multilingual Tasks via Proxy ModelsDavid Anugraha, Genta Indra Winata, Chenyue Li, Patrick Amadeus Irawan, En-Shiun Annie Lee. 1981-2011 [doi]
- SimSMoE: Toward Efficient Training Mixture of Experts via Solving Representational CollapseGiang Do, Hung Le 0002, Truyen Tran 0001. 2012-2025 [doi]
- UniRAG: Universal Retrieval Augmentation for Large Vision Language ModelsSahel Sharifymoghaddam, Shivani Upadhyay, Wenhu Chen, Jimmy Lin. 2026-2039 [doi]
- Evaluating the Performance of Large Language Models via DebatesBehrad Moniri, Hamed Hassani, Edgar Dobriban. 2040-2075 [doi]
- CausalGraph2LLM: Evaluating LLMs for Causal QueriesIvaxi Sheth, Bahare Fatemi, Mario Fritz. 2076-2098 [doi]
- PuzzleGPT: Emulating Human Puzzle-Solving Ability for Time and Location PredictionHammad A. Ayyubi, Xuande Feng, Junzhang Liu, Xudong Lin 0003, Zhecan Wang, Shih-Fu Chang. 2099-2116 [doi]
- SAFR: Neuron Redistribution for InterpretabilityRuidi Chang, Chunyuan Deng, Hanjie Chen. 2117-2126 [doi]
- GPT-4V Cannot Generate Radiology Reports YetYuyang Jiang, Chacha Chen, Dang Nguyen 0006, Benjamin M. Mervak, Chenhao Tan. 2127-2154 [doi]
- Is Semantic Chunking Worth the Computational Cost?Renyi Qu, Ruixuan Tu, Forrest Sheng Bao. 2155-2177 [doi]
- On Using Arabic Language Dialects in Recommendation SystemsAbdulla Alshabanah, Murali Annavaram. 2178-2186 [doi]
- Assessing LLMs for Zero-shot Abstractive Summarization Through the Lens of Relevance ParaphrasingHadi Askari, Anshuman Chhabra, Muhao Chen, Prasant Mohapatra. 2187-2201 [doi]
- Beyond Silent Letters: Amplifying LLMs in Emotion Recognition with Vocal NuancesZehui Wu, Ziwei Gong, Lin Ai, Pengyuan Shi, Kaan Donbekci, Julia Hirschberg. 2202-2218 [doi]
- DomainSum: A Hierarchical Benchmark for Fine-Grained Domain Shift in Abstractive Text SummarizationHaohan Yuan, Haopeng Zhang 0005. 2219-2231 [doi]
- Test-time Backdoor Mitigation for Black-Box Large Language Models with Defensive DemonstrationsWenjie Jacky Mo, Jiashu Xu, Qin Liu 0010, Jiongxiao Wang, Jun Yan 0012, Hadi Askari, Chaowei Xiao, Muhao Chen. 2232-2249 [doi]
- "All that Glitters": Techniques for Evaluations with Unreliable Model and Human AnnotationsMichael Hardy. 2250-2278 [doi]
- KwaiChat: A Large-Scale Video-Driven Multilingual Mixed-Type Dialogue CorpusXiaoming Shi, Zeming Liu, Yiming Lei, Chenkai Zhang, Haitao Leng, Chuan Wang 0002, Qingjie Liu, Wanxiang Che, Yunhong Wang 0001. 2279-2294 [doi]
- GenEOL: Harnessing the Generative Power of LLMs for Training-Free Sentence EmbeddingsRaghuveer Thirukovalluru, Bhuwan Dhingra. 2295-2308 [doi]
- Attention Tracker: Detecting Prompt Injection Attacks in LLMsKuo-Han Hung, Ching Yun Ko, Ambrish Rawat, I-Hsin Chung, Winston H. Hsu, Pin-Yu Chen. 2309-2322 [doi]
- Unsupervised Speech-text word-level alignment with Dynamic ProgrammingTianshu Yu, Zihan Gong, Minghuan Tan, Guhong Chen, Min Yang 0007. 2323-2334 [doi]
- SciAssess: Benchmarking LLM Proficiency in Scientific Literature AnalysisHengxing Cai, Xiaochen Cai, Junhan Chang, Sihang Li 0002, Lin Yao 0003, Changxin Wang, Zhifeng Gao, Hongshuai Wang, Yongge Li, MuJie Lin, Shuwen Yang, Jiankun Wang 0011, Mingjun Xu, Jin Huang, Xi Fang, Jiaxi Zhuang, Yuqi Yin, Yaqi Li, Changhong Chen, Zheng Cheng, Zifeng Zhao, Linfeng Zhang 0002, Guolin Ke. 2335-2357 [doi]
- Towards Understanding the Fragility of Multilingual LLMs against Fine-Tuning AttacksSamuele Poppi, Zheng Xin Yong, Yifei He, Bobbie Chern, Han Zhao 0002, Aobo Yang, Jianfeng Chi. 2358-2372 [doi]
- MASSW: A New Dataset and Benchmark Tasks for AI-Assisted Scientific WorkflowsXingjian Zhang 0002, Yutong Xie 0007, Jin Huang, Jinge Ma, Zhaoying Pan, Qijia Liu, Ziyang Xiong, Tolga Ergen, Dongsub Shim, Honglak Lee, Qiaozhu Mei. 2373-2394 [doi]
- Neuro-symbolic Training for Reasoning over Spatial LanguageTanawan Premsri, Parisa KordJamshidi. 2395-2414 [doi]
- On Localizing and Deleting Toxic Memories in Large Language ModelsAnubrata Das, Manoj Kumar 0007, Ninareh Mehrabi, Anil Ramakrishna, Anna Rumshisky, Kai-Wei Chang, Aram Galstyan, Morteza Ziyadi, Rahul Gupta 0001. 2415-2423 [doi]
- DiVISe: Direct Visual-Input Speech Synthesis Preserving Speaker Characteristics And IntelligibilityYifan Liu, Yu Fang, Zhouhan Lin. 2424-2439 [doi]
- GraphICL: Unlocking Graph Learning Potential in LLMs through Structured Prompt DesignYuanfu Sun, Zhengnan Ma, Yi Fang, Jing Ma, Qiaoyu Tan. 2440-2459 [doi]
- FIDELITY: Fine-grained Interpretable Distillation for Effective Language Insights and Topic YieldingDivyansh Singh, Brodie Mather, Demi Zhang, Patrick Lehman, Justin Ho, Bonnie J. Dorr. 2460-2472 [doi]
- Classic4Children: Adapting Chinese Literary Classics for Children with Large Language ModelJiali Chen, Xusen Hei, Yuqi Xue, Zihan Wu, Jiayuan Xie, Yi Cai 0001. 2473-2488 [doi]
- Considering Length Diversity in Retrieval-Augmented SummarizationJuseon-Do, Jaesung Hwang, Jingun Kwon, Hidetaka Kamigaito, Manabu Okumura. 2489-2500 [doi]
- LMOD: A Large Multimodal Ophthalmology Dataset and Benchmark for Large Vision-Language ModelsZhenyue Qin, Yu Yin, Dylan Campbell, Xuansheng Wu, Ke Zou, Ninghao Liu, Yih Chung Tham, Xiuzhen Zhang 0001, Qingyu Chen 0001. 2501-2522 [doi]
- Syntriever: How to Train Your Retriever with Synthetic Data from LLMsMinsang Kim, Seung Jun Baek 0001. 2523-2539 [doi]
- DynClean: Training Dynamics-based Label Cleaning for Distantly-Supervised Named Entity RecognitionQi Zhang, Huitong Pan, Zhijia Chen, Longin Jan Latecki, Cornelia Caragea, Eduard C. Dragut. 2540-2556 [doi]
- An Efficient Rehearsal Scheme for Catastrophic Forgetting Mitigation during Multi-stage Fine-tuningAndrew Bai, Chih-Kuan Yeh, Cho-Jui Hsieh, Ankur Taly. 2557-2569 [doi]
- COAST: Enhancing the Code Debugging Ability of LLMs through Communicative Agent Based Data SynthesisWeiqing Yang, Hanbin Wang, Zhenghao Liu, Xinze Li, Yukun Yan, Shuo Wang, Yu Gu 0002, Minghe Yu, Zhiyuan Liu 0001, Ge Yu 0001. 2570-2585 [doi]
- Chain-of-Probe: Examining the Necessity and Accuracy of CoT Step-by-StepZezhong Wang 0004, Xingshan Zeng, Weiwen Liu, Yufei Wang 0005, Liangyou Li, Yasheng Wang, Lifeng Shang, Xin Jiang 0002, Qun Liu 0001, Kam-Fai Wong. 2586-2606 [doi]
- INDIC QA BENCHMARK: A Multilingual Benchmark to Evaluate Question Answering capability of LLMs for Indic LanguagesAbhishek Kumar Singh, Vishwajeet Kumar, Rudra Murthy, Jaydeep Sen, Ashish R. Mittal, Ganesh Ramakrishnan. 2607-2626 [doi]
- Learning with Less: Knowledge Distillation from Large Language Models via Unlabeled DataJuanhui Li, Sreyashi Nag, Hui Liu 0031, Xianfeng Tang, Sheikh Muhammad Sarwar, Limeng Cui, Hansu Gu, Suhang Wang, Qi He 0002, Jiliang Tang. 2627-2641 [doi]
- LSDC: An Efficient and Effective Large-Scale Data Compression Method for Supervised Fine-tuning of Large Language ModelsZhaoguang Long, Yuhao Zhou, Shangqing Zhao, Yupei Ren, Li Cai, Chenghao Jia, Zhe Chen, Zhe Fang, Yuxiang Song, Man Lan. 2642-2653 [doi]
- What Is Missing in Multilingual Visual Reasoning and How to Fix ItYueqi Song, Simran Khanuja, Graham Neubig. 2654-2667 [doi]
- Enhancing the Prototype Network with Local-to-Global Optimization for Few-Shot Relation ExtractionHui Sun, Rongxin Chen. 2668-2677 [doi]
- LLMs for Mathematical Modeling: Towards Bridging the Gap between Natural and Mathematical LanguagesXuhan Huang, Qingning Shen, Yan Hu, Anningzhe Gao, Benyou Wang. 2678-2710 [doi]
- Advancing Persian LLM EvaluationSara Bourbour Hosseinbeigi, Behnam Rohani, Mostafa Masoudi, Mehrnoush Shamsfard, Zahra Saaberi, Mostafa Karimi Manesh, Mohammad Amin Abbasi. 2711-2727 [doi]
- Supportiveness-based Knowledge Rewriting for Retrieval-augmented Language ModelingZile Qiao, Wei Ye 0004, Yong Jiang 0005, Tong Mo, Pengjun Xie, Weiping Li, Fei Huang 0004, Shikun Zhang. 2728-2740 [doi]
- Evaluating Self-Generated Documents for Enhancing Retrieval-Augmented Generation with Large Language ModelsJiatao Li, Xinyu Hu 0001, Xunjian Yin, Xiaojun Wan 0001. 2741-2775 [doi]
- PREMISE: Matching-based Prediction for Accurate Review RecommendationWei Han 0002, Hui Chen 0023, Soujanya Poria. 2776-2794 [doi]
- Semi-supervised Fine-tuning for Large Language ModelsJunyu Luo 0002, Xiao Luo 0001, Xiusi Chen, Zhiping Xiao 0001, Wei Ju, Ming Zhang 0004. 2795-2808 [doi]
- CALM: Unleashing the Cross-Lingual Self-Aligning Ability of Language Model Question AnsweringYumeng Wang, Zhiyuan Fan, Qingyun Wang, Yi R. Fung, Heng Ji. 2809-2817 [doi]
- Towards Prompt Generalization: Grammar-aware Cross-Prompt Automated Essay ScoringHeejin Do, Taehee Park, Sangwon Ryu, Gary Lee 0001. 2818-2824 [doi]
- MedEureka: A Medical Domain Benchmark for Multi-Granularity and Multi-Data-Type Embedding-Based RetrievalYongqi Fan, Nan Wang, Kui Xue, JingPing Liu, Tong Ruan. 2825-2851 [doi]
- A Federated Framework for LLM-based RecommendationJujia Zhao, Wenjie Wang 0007, Chen Xu 0010, See-Kiong Ng, Tat-Seng Chua. 2852-2865 [doi]
- WaterSeeker: Pioneering Efficient Detection of Watermarked Segments in Large DocumentsLeyi Pan, Aiwei Liu, Yijian Lu, Zitian Gao, Yichen Di, Lijie Wen 0001, Irwin King, Philip S. Yu. 2866-2882 [doi]
- MIRAGE: A Metric-Intensive Benchmark for Retrieval-Augmented Generation EvaluationChanhee Park, Hyeonseok Moon, Chanjun Park, HeuiSeok Lim. 2883-2900 [doi]
- FIRE: Fact-checking with Iterative Retrieval and VerificationZhuohan Xie, Rui Xing, Yuxia Wang, Jiahui Geng, Hasan Iqbal, Dhruv Sahnan, Iryna Gurevych, Preslav Nakov. 2901-2914 [doi]
- Lessons from a User Experience Evaluation of NLP InterfacesEduardo Calò, Lydia Penkert, Saad Mahamood. 2915-2929 [doi]
- TrendSim: Simulating Trending Topics in Social Media Under Poisoning Attacks with LLM-based Multi-agent SystemZeyu Zhang 0007, Jianxun Lian, Chen Ma 0001, Yaning Qu, Ye Luo, Lei Wang 0198, Rui Li 0086, Xu Chen 0017, Yankai Lin, Le Wu, Xing Xie 0001, Ji-Rong Wen. 2930-2949 [doi]
- ASRank: Zero-Shot Re-Ranking with Answer Scent for Document RetrievalAbdelrahman Abdallah, Jamshid Mozafari, Bhawna Piryani, Adam Jatowt. 2950-2970 [doi]
- DSQG-Syn: Synthesizing High-quality Data for Text-to-SQL Parsing by Domain Specific Question GenerationShaoming Duan, Youxuan Wu, Chuanyi Liu, Yuhao Zhang, Zirui Wang, Peiyi Han, Shengyuan Yu, Liang Yan, Yingwei Liang. 2971-2989 [doi]
- EgoSpeak: Learning When to Speak for Egocentric Conversational Agents in the WildJunhyeok Kim 0002, Min-Soo Kim, Jiwan Chung, Jungbin Cho, Jisoo Kim, Sungwoong Kim, Gyeongbo Sim, Youngjae Yu. 2990-3005 [doi]
- Plot2Code: A Comprehensive Benchmark for Evaluating Multi-modal Large Language Models in Code Generation from Scientific PlotsChengyue Wu, Zhixuan Liang, Yixiao Ge, Qiushan Guo, Zeyu Lu, Jiahao Wang, Ying Shan, Ping Luo 0002. 3006-3028 [doi]
- FunnelRAG: A Coarse-to-Fine Progressive Retrieval Paradigm for RAGXinping Zhao, Yan Zhong, Zetian Sun, Xinshuo Hu, Zhenyu Liu, Dongfang Li 0002, Baotian Hu, Min Zhang 0005. 3029-3046 [doi]
- The Power of Bullet Lists: A Simple Yet Effective Prompting Approach to Enhancing Spatial Reasoning in Large Language ModelsIkhyun Cho, Changyeon Park, Julia Hockenmaier. 3047-3057 [doi]
- Overcoming both Domain Shift and Label Shift for Referring Video SegmentationHai Huang 0013, Sashuai Zhou, Yan Xia 0006. 3058-3069 [doi]
- Language Modeling with Editable External KnowledgeBelinda Z. Li, Emmy Liu, Alexis Ross, Abbas Zeitoun, Graham Neubig, Jacob Andreas. 3070-3090 [doi]
- Beyond Excess and Deficiency: Adaptive Length Bias Mitigation in Reward Models for RLHFYuyan Bu, Liangyu Huo, Yi Jing, Qing Yang. 3091-3098 [doi]
- Neuroplasticity and Corruption in Model Mechanisms: A Case Study Of Indirect Object IdentificationVishnu Kabir Chhabra, Ding Zhu, Mohammad Mahdi Khalili. 3099-3122 [doi]
- VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMsHanan Gani, Rohit Bharadwaj 0001, Muzammal Naseer, Fahad Shahbaz Khan, Salman Khan 0001. 3123-3140 [doi]
- Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion ModelsJiachen Ma 0005, Yijiang Li, Zhiqing Xiao, Anda Cao, Jie Zhang, Chao Ye, Junbo Zhao 0002. 3141-3157 [doi]
- Emo3D: Metric and Benchmarking Dataset for 3D Facial Expression Generation from Emotion DescriptionMahshid Dehghani, Amirahmad Shafiee, Ali Shafiei, Neda Fallah, Farahmand Alizadeh, Mohammad Mehdi Gholinejad, Hamid Behroozi, Jafar Habibi, Ehsaneddin Asgari. 3158-3172 [doi]
- Task-wrapped Continual Learning in Task-Oriented Dialogue SystemsMin Zeng, Haiqin Yang, Xi Chen, Yike Guo. 3173-3183 [doi]
- Untangling Hate Speech Definitions: A Semantic Componential Analysis Across Cultures and DomainsKaterina Korre, Arianna Muti, Federico Ruggeri, Alberto Barrón-Cedeño. 3184-3198 [doi]
- CodeRAG-Bench: Can Retrieval Augment Code Generation?Zora Zhiruo Wang, Akari Asai, Xinyan Velocity Yu, Frank F. Xu, Yiqing Xie, Graham Neubig, Daniel Fried. 3199-3214 [doi]
- Multi-Condition Guided Diffusion Network for Multimodal Emotion Recognition in ConversationWenjin Tian, Xianying Huang, Shihao Zou. 3215-3227 [doi]
- Thank You, Stingray: Multilingual Large Language Models Can Not (Yet) Disambiguate Cross-Lingual Word SensesSamuel Cahyawijaya, Ruochen Zhang, Jan Christian Blaise Cruz, Holy Lovenia, Elisa Gilbert, Hiroki Nomoto, Alham Fikri Aji. 3228-3250 [doi]
- Atoxia: Red-teaming Large Language Models with Target Toxic AnswersYuhao Du, Zhuo Li, Pengyu Cheng, Xiang Wan, Anningzhe Gao. 3251-3266 [doi]
- A Practical Method for Generating String CounterfactualsMatan Avitan, Ryan Cotterell, Yoav Goldberg, Shauli Ravfogel. 3267-3286 [doi]
- Probing-RAG: Self-Probing to Guide Language Models in Selective Document RetrievalIngeol Baek, Hwan Chang, Byeongjeong Kim, Jimin Lee, Hwanhee Lee. 3287-3304 [doi]
- Extracting Military Event Temporal Relations via Relative Event Time Prediction and Virtual Adversarial TrainingJie Gong, Qiwang Hu. 3305-3317 [doi]
- Unlocking the Planning Capabilities of Large Language Models with Maximum Diversity Fine-tuningWenjun Li, Changyu Chen, Pradeep Varakantham. 3318-3340 [doi]
- Continuous Speech Tokenizer in Text To SpeechYixing Li, Ruobing Xie, Xingwu Sun, Yu Cheng, Zhanhui Kang. 3341-3347 [doi]
- Efficient Annotator Reliability Assessment and Sample Weighting for Knowledge-Based Misinformation Detection on Social MediaOwen Cook, Charlie Grimshaw, Ben Peng Wu 0001, Sophie Dillon, Jack Hicks, Luke Jones, Thomas Smith, Matyas Szert, Xingyi Song. 3348-3358 [doi]
- Challenges in Trustworthy Human Evaluation of ChatbotsWenting Zhao, Alexander M. Rush, Tanya Goyal. 3359-3365 [doi]
- RATSD: Retrieval Augmented Truthfulness Stance Detection from Social Media Posts Toward Factual ClaimsZhengyuan Zhu, Zeyu Zhang, Haiqi Zhang, Chengkai Li. 3366-3381 [doi]
- FACT: Examining the Effectiveness of Iterative Context Rewriting for Multi-fact RetrievalJinlin Wang, Suyuchen Wang, Ziwen Xia, Sirui Hong, Yun Zhu, Bang Liu, Chenglin Wu. 3382-3392 [doi]
- Temporal Working Memory: Query-Guided Segment Refinement for Enhanced Multimodal UnderstandingXingjian Diao, Chunhui Zhang, Weiyi Wu, Zhongyu Ouyang, Peijun Qing, Ming Cheng 0004, Soroush Vosoughi, Jiang Gui. 3393-3409 [doi]
- Investigating the Transferability of Code Repair for Low-Resource Programming LanguagesKyle Wong, Alfonso Amayuelas, Liangming Pan, William Yang Wang. 3410-3432 [doi]
- Multilingual Blending: Large Language Model Safety Alignment Evaluation with Language MixtureJiayang Song, Yuheng Huang 0004, Zhehua Zhou, Lei Ma 0003. 3433-3449 [doi]
- Mitigating Hallucinations in Multimodal Spatial Relations through Constraint-Aware PromptingJiarui Wu, Zhuo Liu, Hangfeng He 0001. 3450-3468 [doi]
- Concise and Organized Perception Facilitates Reasoning in Large Language ModelsJunjie Liu, Shaotian Yan, Chen Shen 0003, Zhengdong Xiao, Liang Xie 0003, Wenxiao Wang 0001, Jieping Ye. 3469-3498 [doi]
- Verifiable Format Control for Large Language Model GenerationsZhaoyang Wang, Jinqi Jiang, Huichi Zhou, Wenhao Zheng, Xuchao Zhang, Chetan Bansal, Huaxiu Yao. 3499-3513 [doi]
- Taxonomy and Analysis of Sensitive User Queries in Generative AI Search SystemHwiyeol Jo, Taiwoo Park, HyunWoo Lee, Nayoung Choi, Changbong Kim, Ohjoon Kwon, Donghyeon Jeon, Eui-Hyeon Lee, Kyoungho Shin, Sun Suk Lim, Kyungmi Kim, Jihye Lee, Sun Kim. 3514-3529 [doi]
- SynGhost: Invisible and Universal Task-agnostic Backdoor Attack via Syntactic TransferPengzhou Cheng, Wei Du, Zongru Wu, Fengwei Zhang, Libo Chen, Zhuosheng Zhang 0001, Gongshen Liu. 3530-3546 [doi]
- TESTEVAL: Benchmarking Large Language Models for Test Case GenerationWenhan Wang, Chenyuan Yang, Zhijie Wang, Yuheng Huang, Zhaoyang Chu, Da Song, Lingming Zhang, An Ran Chen, Lei Ma. 3547-3562 [doi]
- Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language ModelsSiyin Wang, Xingsong Ye, Qinyuan Cheng, Junwen Duan, Shimin Li, JinLan Fu, Xipeng Qiu, Xuanjing Huang 0001. 3563-3605 [doi]
- FLEX: A Benchmark for Evaluating Robustness of Fairness in Large Language ModelsDahyun Jung, Seungyoon Lee, Hyeonseok Moon, Chanjun Park, HeuiSeok Lim. 3606-3620 [doi]
- When and How to Augment Your Input: Question Routing Helps Balance the Accuracy and Efficiency of Large Language ModelsShufan Chen, He Zheng, Lei Cui. 3621-3634 [doi]
- GraPPI: A Retrieve-Divide-Solve GraphRAG Framework for Large-scale Protein-protein Interaction ExplorationZiwen Li, Xiang Chen, Youngseung Jeon. 3635-3648 [doi]
- From Curiosity to Clarity : Exploring the Impact of Consecutive Why-QuestionsGeonyeong Son, Jaeyoung Lee, Misuk Kim. 3649-3664 [doi]
- CollabStory: Multi-LLM Collaborative Story Generation and Authorship AnalysisSaranya Venkatraman, Nafis Irtiza Tripto, Dongwon Lee. 3665-3679 [doi]
- NTSEBENCH: Cognitive Reasoning Benchmark for Vision Language ModelsPranshu Pandya, Vatsal Gupta, Agney S. Talwarr, Tushar Kataria, Dan Roth, Vivek Gupta 0001. 3680-3708 [doi]
- KnowAgent: Knowledge-Augmented Planning for LLM-Based AgentsYuqi Zhu, Shuofei Qiao, Yixin Ou, Shumin Deng, Shiwei Lyu, Yue Shen, Lei Liang 0002, Jinjie Gu, Huajun Chen, Ningyu Zhang 0001. 3709-3732 [doi]
- SWITCH: Studying with Teacher for Knowledge Distillation of Large Language ModelsJahyun Koo 0004, Yerin Hwang, Yongil Kim, Taegwan Kang, Hyunkyung Bae, Kyomin Jung. 3733-3746 [doi]
- Thought2Text: Text Generation from EEG Signal using Large Language Models (LLMs)Abhijit Mishra, Shreya Shukla, Jose Torres, Jacek Gwizdka, Shounak Roychowdhury. 3747-3759 [doi]
- A Comprehensive Survey of Contemporary Arabic Sentiment Analysis: Methods, Challenges, and Future DirectionsZhiqiang Shi, Ruchit Agrawal. 3760-3772 [doi]
- Towards Cross-Lingual Explanation of Artwork in Large-scale Vision Language ModelsShintaro Ozaki, Kazuki Hayashi, Yusuke Sakai 0010, Hidetaka Kamigaito, Katsuhiko Hayashi 0001, Taro Watanabe. 3773-3809 [doi]
- Large Language Models are Easily Confused: A Quantitative Metric, Security Implications and Typological AnalysisYiyi Chen 0002, Qiongxiu Li, Russa Biswas, Johannes Bjerva. 3810-3827 [doi]
- Huatuo-26M, a Large-scale Chinese Medical QA DatasetXidong Wang, Jianquan Li, Shunian Chen, Yuxuan Zhu, Xiangbo Wu, Zhiyi Zhang 0007, Xiaolong Xu, Junying Chen, Jie Fu 0001, Xiang Wan, Anningzhe Gao, Benyou Wang. 3828-3848 [doi]
- SEP-MLDC: A Simple and Effective Paradigm for Multi-Label Document ClassificationHan Liu 0008, Shuqin Li, Xiaotong Zhang 0003, Yuanyuan Wang, Feng Zhang 0027, Hongyang Chen, Hong Yu 0005. 3849-3859 [doi]
- Improving Pre-trained Language Models with Knowledge Enhancement and Filtering FrameworkQi Zhao, Qi Song, Tian Xie, Haiyue Zhang, Hongyu Yang, Xiangyang Li. 3860-3871 [doi]
- Using Review Combination and Pseudo-Tokens for Aspect Sentiment Quad PredictionJiazhou Chen, Xu Jia, Ruiqiang Guo. 3872-3883 [doi]
- DDGIP: Radiology Report Generation Through Disease Description Graph and Informed PromptingChentao Huang, Guangli Li, Xinjiong Zhou, Yafeng Ren, Hongbin Zhang 0004. 3884-3894 [doi]
- Lossless Acceleration of Large Language Models with Hierarchical Drafting based on Temporal Locality in Speculative DecodingSukmin Cho, Sangjin Choi, Taeho Hwang, Jeongyeon Seo, Soyeong Jeong, Huije Lee, Hoyun Song, Jong C. Park, Youngjin Kwon. 3895-3911 [doi]
- Improve Decoding Factuality by Token-wise Cross Layer Entropy of Large Language ModelsJialiang Wu, Yi Shen, Sijia Liu, Yi Tang, Sen Song, Xiaoyi Wang, Longjun Cai. 3912-3921 [doi]
- TEaR: Improving LLM-based Machine Translation with Systematic Self-RefinementZhaopeng Feng, Yan Zhang 0113, Hao Li, Bei Wu, Jiayu Liao, Wenqiang Liu, Jun Lang 0001, Yang Feng 0011, Jian Wu 0001, Zuozhu Liu. 3922-3938 [doi]
- Vulnerability of Large Language Models to Output Prefix Jailbreaks: Impact of Positions on SafetyYiwei Wang 0001, Muhao Chen, Nanyun Peng 0001, Kai-Wei Chang. 3939-3952 [doi]
- ImaRA: An Imaginative Frame Augmented Method for Low-Resource Multimodal Metaphor Detection and ExplanationYuan Tian, Minzheng Wang 0001, Nan Xu, Wenji Mao. 3953-3967 [doi]
- XAMPLER: Learning to Retrieve Cross-Lingual In-Context ExamplesPeiqin Lin, André F. T. Martins, Hinrich Schütze. 3968-3977 [doi]
- Evaluating Cultural and Social Awareness of LLM Web AgentsHaoyi Qiu, Alexander R. Fabbri, Divyansh Agarwal, Kung-Hsiang Huang, Sarah Tan, Nanyun Peng 0001, Chien-Sheng Wu. 3978-4005 [doi]
- GRAIT: Gradient-Driven Refusal-Aware Instruction Tuning for Effective Hallucination MitigationRunchuan Zhu, Xinke Jiang, Jiang Wu, Zhipeng Ma, Jiahe Song, Fengshuo Bai, Dahua Lin, Lijun Wu, Conghui He. 4006-4021 [doi]
- Entity Pair-guided Relation Summarization and Retrieval in LLMs for Document-level Relation ExtractionFu Zhang 0001, Hongsen Yu, Jingwei Cheng, Huangming Xu. 4022-4037 [doi]
- A Recipe of Parallel Corpora Exploitation for Multilingual Large Language ModelsPeiqin Lin, André F. T. Martins, Hinrich Schütze. 4038-4050 [doi]
- Omni-Chart-600K: A Comprehensive Dataset of Chart Types for Chart UnderstandingShulei Wang, Shuai Yang, Wang Lin, Zirun Guo, Sihang Cai, Hai Huang 0013, Ye Wang 0018, Jingyuan Chen, Tao Jin 0004. 4051-4069 [doi]
- Comprehensive Layer-wise Analysis of SSL Models for Audio Deepfake DetectionYassine El Kheir, Younes Samih, Suraj Maharjan, Tim Polzehl, Sebastian Möller 0001. 4070-4082 [doi]
- Attention on Multiword Expressions: A Multilingual Study of BERT-based Models with Regard to Idiomaticity and MicrosyntaxIuliia Zaitova, Vitalii Hirak, Badr M. Abdullah, Dietrich Klakow, Bernd Möbius, Tania Avgustinova. 4083-4092 [doi]
- Perception Compressor: A Training-Free Prompt Compression Framework in Long Context ScenariosJiwei Tang, Jin Xu, Tingwei Lu, Zhicheng Zhang, Yiming Zhao, Lin Hai, Hai-Tao Zheng. 4093-4108 [doi]
- MojoBench: Language Modeling and Benchmarks for MojoNishat Raihan, Joanna C. S. Santos, Marcos Zampieri. 4109-4128 [doi]
- VLind-Bench: Measuring Language Priors in Large Vision-Language ModelsKang Il Lee, Minbeom Kim, Seunghyun Yoon, MinSung Kim, Dongryeol Lee, Hyukhun Koh, Kyomin Jung. 4129-4144 [doi]
- GRAG: Graph Retrieval-Augmented GenerationYuntong Hu, Zhihan Lei, Zheng Zhang 0047, Bo Pan, Chen Ling 0003, Liang Zhao 0002. 4145-4157 [doi]
- Sequence-level Large Language Model Training with Contrastive Preference OptimizationZhili Feng, Dhananjay Ram, Cole Hawkins, Aditya Rawal, Jinman Zhao, Sheng Zha. 4158-4164 [doi]
- Scaling Up Membership Inference: When and How Attacks Succeed on Large Language ModelsHaritz Puerto, Martin Gubri, Sangdoo Yun, Seong Joon Oh. 4165-4182 [doi]
- Mitigating Hallucinations in Large Vision-Language Models via Summary-Guided DecodingKyungmin Min, Minbeom Kim, Kang Il Lee, Dongryeol Lee, Kyomin Jung. 4183-4198 [doi]
- Exploring Hybrid Sampling Inference for Aspect-based Sentiment AnalysisXiaoyi Bao, Minjie Qiang, Jinghang Gu, Zhongqing Wang, Chu-Ren Huang. 4199-4210 [doi]
- FeRG-LLM : Feature Engineering by Reason Generation Large Language ModelsJeonghyun Ko, Gyeongyun Park, Donghoon Lee, Kyunam Lee. 4211-4228 [doi]
- Effective Self-Mining of In-Context Examples for Unsupervised Machine Translation with LLMsAbdellah El Mekki, Muhammad Abdul-Mageed. 4229-4256 [doi]
- GPT-NER: Named Entity Recognition via Large Language ModelsShuhe Wang, Xiaofei Sun 0001, Xiaoya Li 0001, Rongbin Ouyang, Fei Wu 0001, Tianwei Zhang 0004, Jiwei Li 0001, Guoyin Wang 0002, Chen Guo. 4257-4275 [doi]
- QPruner: Probabilistic Decision Quantization for Structured Pruning in Large Language ModelsChanghai Zhou, Yuhua Zhou, Yibin Wang, Shijie Han, Qian Qiao, Hongguang Li. 4276-4286 [doi]
- MES-RAG: Bringing Multi-modal, Entity-Storage, and Secure Enhancements to RAGPingyu Wu, Daiheng Gao, Jin Tang 0001, Huimin Chen, Wenbo Zhou, Weiming Zhang 0001, Nenghai Yu. 4287-4298 [doi]
- LVPruning: An Effective yet Simple Language-Guided Vision Token Pruning Approach for Multi-modal Large Language ModelsYizheng Sun, Yanze Xin, Hao Li 0074, Jingyuan Sun, Chenghua Lin, Riza Batista-Navarro. 4299-4308 [doi]
- How Much Knowledge Can You Pack into a LoRA Adapter without Harming LLM?Sergey Pletenev, Maria Marina, Daniil Moskovskiy, Vasily Konovalov, Pavel Braslavski 0001, Alexander Panchenko, Mikhail Salnikov. 4309-4322 [doi]
- TART: An Open-Source Tool-Augmented Framework for Explainable Table-based ReasoningXinyuan Lu, Liangming Pan, Yubo Ma, Preslav Nakov, Min-Yen Kan. 4323-4339 [doi]
- Enhancing Text-to-SQL with Question Classification and Multi-Agent CollaborationZhihui Shao, Shubin Cai, Rongsheng Lin, Zhong Ming 0001. 4340-4349 [doi]
- Efficient Nearest Neighbor based Uncertainty Estimation for Natural Language Processing TasksWataru Hashimoto, Hidetaka Kamigaito, Taro Watanabe. 4350-4366 [doi]
- BitAbuse: A Dataset of Visually Perturbed Texts for Defending Phishing AttacksHanyong Lee, Chaelyn Lee, Yongjae Lee, Jaesung Lee. 4367-4384 [doi]
- Unfolding the Headline: Iterative Self-Questioning for News Retrieval and Timeline SummarizationWeiqi Wu, Shen Huang, Yong Jiang 0005, Pengjun Xie, Fei Huang 0004, Hai Zhao 0001. 4385-4398 [doi]
- RetrieverGuard: Empowering Information Retrieval to Combat LLM-Generated MisinformationChuwen Chen, Shuai Zhang. 4399-4411 [doi]
- Unified Automated Essay Scoring and Grammatical Error CorrectionSeungwoo Song, Junghun Yuk, ChangSu Choi, Hangyeol Yoo, HyeonSeok Lim, Kyungtae Lim, Jungyeul Park. 4412-4426 [doi]
- A Closer Look into Mixture-of-Experts in Large Language ModelsKa Man Lo, Zeyu Huang, Zihan Qiu, Zili Wang, Jie Fu 0001. 4427-4447 [doi]
- CDB: A Unified Framework for Hope Speech Detection Through Counterfactual, Desire and BeliefTulio Ferreira Leite Da Silva, Gonzalo Freijedo Aduna, Farah Benamara, Alda Mari, Zongmin Li, Li Yue, Jian Su. 4448-4463 [doi]
- How Well Do LLMs Handle Cantonese? Benchmarking Cantonese Capabilities of Large Language ModelsJiyue Jiang, Pengan Chen, Liheng Chen, Sheng Wang, Qinghang Bao, Lingpeng Kong, Yu Li, Chuan Wu. 4464-4505 [doi]
- Improving Reward Models with Synthetic CritiquesZihuiwen Ye, Fraser Greenlee-Scott, Max Bartolo, Phil Blunsom, Jon Ander Campos, Matthias Gallé. 4506-4520 [doi]
- Rethinking Smoothness for Fast and Adaptable Entity Alignment DecodingYuanyi Wang, Han Li, Haifeng Sun 0001, Lei Zhang, Bo He 0003, Wei Tang 0013, Tianhao Yan, Qi Qi 0001, Jingyu Wang. 4521-4535 [doi]
- Lost in the Distance: Large Language Models Struggle to Capture Long-Distance Relational KnowledgeMeiyun Wang, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo. 4536-4544 [doi]
- FinNLI: Novel Dataset for Multi-Genre Financial Natural Language Inference BenchmarkingJabez Magomere, Elena Kochkina, Samuel Mensah, Simerjot Kaur, Charese Smiley. 4545-4568 [doi]
- Music for All: Representational Bias and Cross-Cultural Adaptability of Music Generation ModelsAtharva Mehta, Shivam Chauhan, Amirbek Djanibekov, Atharva Kulkarni, Gus Xia, Monojit Choudhury. 4569-4585 [doi]
- SFMSS: Service Flow aware Medical Scenario Simulation for Conversational Data GenerationZhijie Bao, Qingyun Liu 0012, Xuanjing Huang 0001, Zhongyu Wei. 4586-4604 [doi]
- Re-evaluating Automatic LLM System Ranking for Alignment with Human PreferenceMingqi Gao 0002, Yixin Liu 0003, Xinyu Hu 0001, Xiaojun Wan 0001, Jonathan Bragg, Arman Cohan. 4605-4629 [doi]
- GuideQ: Framework for Guided Questioning for progressive informational collection and classificationPriya Mishra, Suraj Racha, Kaustubh Ponkshe, Adit Akarsh, Ganesh Ramakrishnan. 4630-4644 [doi]
- Richer Output for Richer Countries: Uncovering Geographical Disparities in Generated Stories and Travel RecommendationsKirti Bhagat, Kinshuk Vasisht, Danish Pruthi. 4645-4653 [doi]
- Swan and ArabicMTEB: Dialect-Aware, Arabic-Centric, Cross-Lingual, and Cross-Cultural Embedding Models and BenchmarksGagan Bhatia, El Moatez Billah Nagoudi, Abdellah El Mekki, Fakhraddin Alwajih, Muhammad Abdul-Mageed. 4654-4670 [doi]
- TAGCOS: Task-agnostic Gradient Clustered Coreset Selection for Instruction Tuning DataJipeng Zhang, Yaxuan Qin, Renjie Pi, Weizhong Zhang, Rui Pan 0002, Tong Zhang 0001. 4671-4686 [doi]
- From Text to Emoji: How PEFT-Driven Personality Manipulation Unleashes the Emoji Potential in LLMsNavya Jain, Zekun Wu 0003, Cristian E. Muñoz Villalobos, Airlie Hilliard, Xin Guan, Adriano S. Koshiyama, Emre Kazim, Philip C. Treleaven. 4687-4723 [doi]
- Decoding Fatphobia: Examining Anti-Fat and Pro-Thin Bias in AI-Generated ImagesJane Warren, Gary M. Weiss, Fernando Martinez, Annika Guo, Yijun Zhao. 4724-4736 [doi]
- MMAU: A Holistic Benchmark of Agent Capabilities Across Diverse DomainsGuoli Yin, Haoping Bai, Shuang Ma, Feng Nan, Yanchao Sun, Zhaoyang Xu, Shen Ma, Jiarui Lu, Xiang Kong, Aonan Zhang, Dian Ang Yap, Yizhe Zhang 0002, Karsten Ahnert, Vik Kamath, Mathias Berglund, Dominic Walsh, Tobias Gindele, Juergen Wiest, Zhengfeng Lai, Xiaoming Wang, Jiulong Shan, Meng Cao, Ruoming Pang, Zirui Wang. 4737-4765 [doi]
- Improving Consistency in LLM Inference using Probabilistic TokenizationAshutosh Sathe, Divyanshu Aggarwal, Sunayana Sitaram. 4766-4778 [doi]
- WordGame: Efficient & Effective LLM Jailbreak via Simultaneous Obfuscation in Query and ResponseTianrong Zhang, Bochuan Cao, Yuanpu Cao, Lu Lin 0001, Prasenjit Mitra, Jinghui Chen. 4779-4807 [doi]
- Human and LLM-Based Resume Matching: An Observational StudySwanand Vaishampayan, Hunter Leary, Yoseph Berhanu Alebachew, Louis Hickman, Brent A Stevenor, Weston Beck, Chris Brown 0001. 4808-4823 [doi]
- A Practical Examination of AI-Generated Text Detectors for Large Language ModelsBrian Tufts, Xuandong Zhao, Lei Li 0005. 4824-4841 [doi]
- Robust Bias Detection in MLMs and its Application to Human Trait RatingsIngroj Shrestha, Louis Tay, Padmini Srinivasan. 4842-4858 [doi]
- How Inclusively do LMs Perceive Social and Moral Norms?Michael Galarnyk, Agam Shah, Dipanwita Guhathakurta, Poojitha Nandigam, Sudheer Chava. 4859-4869 [doi]
- Jailbreaking with Universal Multi-PromptsYu-Ling Hsu, Hsuan Su, Shang-Tse Chen. 4870-4891 [doi]
- Echoes of Discord: Forecasting Hater Reactions to CounterspeechXiaoying Song, Sharon Lisseth Perez, Xinchen Yu, Eduardo Blanco 0002, Lingzi Hong. 4892-4905 [doi]
- Contextual Metric Meta-Evaluation by Measuring Local Metric AccuracyAthiya Deviyani, Fernando Diaz. 4906-4925 [doi]
- Advocating Character Error Rate for Multilingual ASR EvaluationThennal D. K, Jesin James, Deepa P. Gopinath, Muhammed Ashraf K. 4926-4935 [doi]
- Enhancing Temporal Understanding in LLMs for Semi-structured TablesIrwin Deng, Kushagra Dixit, Dan Roth, Vivek Gupta 0001. 4936-4955 [doi]
- BnTTS: Few-Shot Speaker Adaptation in Low-Resource SettingMohammad Jahid Ibna Basher, Md. Kowsher, Md Saiful Islam, Rabindra Nath Nandi, Nusrat Jahan Prottasha, Mehadi Hasan Menon, Tareq Al Muntasir, Shammur Absar Chowdhury, Firoj Alam, Niloofar Yousefi, Ozlem O. Garibay. 4956-4968 [doi]
- Playing with Voices: Tabletop Role-Playing Game Recordings as a Diarization ChallengeLian Remme, Kevin Tang. 4969-4983 [doi]
- Causally Testing Gender Bias in LLMs: A Case Study on Occupational BiasYuen Chen, Vethavikashini Chithrra Raghuram, Justus Mattern, Rada Mihalcea, Zhijing Jin 0001. 4984-5004 [doi]
- OLMES: A Standard for Language Model EvaluationsYuling Gu, Oyvind Tafjord, Bailey Kuehl, Dany Haddad, Jesse Dodge, Hannaneh Hajishirzi. 5005-5033 [doi]
- Induction Heads as an Essential Mechanism for Pattern Matching in In-context LearningJoy Crosbie, Ekaterina Shutova. 5034-5096 [doi]
- MoLA: MoE LoRA with Layer-wise Expert AllocationChongyang Gao, Kezhen Chen, Jinmeng Rao, Ruibo Liu, Baochen Sun, Yawen Zhang, Daiyi Peng, Xiaoyuan Guo, V. S. Subrahmanian. 5097-5112 [doi]
- CodeSim: Multi-Agent Code Generation and Problem Solving through Simulation-Driven Planning and DebuggingMd. Ashraful Islam, Mohammed Eunus Ali, Md. Rizwan Parvez. 5113-5139 [doi]
- On the Feasibility of In-Context Probing for Data AttributionCathy Jiao, Weizhen Gao, Aditi Raghunathan, Chenyan Xiong. 5140-5155 [doi]
- Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?Gonçalo Gomes, Chrysoula Zerva, Bruno Martins 0001. 5156-5175 [doi]
- Avoiding Copyright Infringement via Large Language Model UnlearningGuangyao Dou, Zheyuan Liu 0010, Qing Lyu 0001, Kaize Ding, Eric Wong 0001. 5176-5200 [doi]
- A Context-Aware Contrastive Learning Framework for Hateful Meme Detection and SegmentationXuanyu Su, Yansong Li, Diana Inkpen, Nathalie Japkowicz. 5201-5215 [doi]
- LLM-Generated Passphrases That Are Secure and Easy to RememberJie S. Li 0001, Jonas Geiping, Micah Goldblum, Aniruddha Saha, Tom Goldstein. 5216-5234 [doi]
- Does Data Contamination Detection Work (Well) for LLMs? A Survey and Evaluation on Detection AssumptionsYujuan Fu, Özlem Uzuner, Meliha Yetisgen, Fei Xia 0004. 5235-5256 [doi]
- Representation-to-Creativity (R2C): Automated Holistic Scoring Model for Essay CreativityDeokgi Kim, Joonyoung Jo, Byung-Won On, Ingyu Lee. 5257-5275 [doi]
- From Single to Multi: How LLMs Hallucinate in Multi-Document SummarizationCatarina G. Belém, Pouya Pezeshkpour, Hayate Iso, Seiji Maekawa, Nikita Bhutani, Estevam Hruschka. 5276-5309 [doi]
- Aligning to Constraints for Data-Efficient Language Model CustomizationFei Wang 0060, Chao Shang, Shuai Wang, Sarthak Jain, Qiang Ning, Bonan Min, Vittorio Castelli, Yassine Benajiba, Dan Roth. 5310-5325 [doi]
- Where is this coming from? Making groundedness count in the evaluation of Document VQA modelsArmineh Nourbakhsh, Siddharth Parekh, Pranav Shetty, Zhao Jin, Sameena Shah, Carolyn P. Rosé. 5326-5346 [doi]
- Transformer-based Causal Language Models Perform ClusteringXinbo Wu, Lav R. Varshney. 5347-5372 [doi]
- Towards Better Multi-task Learning: A Framework for Optimizing Dataset Combinations in Large Language ModelsZaifu Zhan, Rui Zhang. 5373-5386 [doi]
- Gender Bias in Instruction-Guided Speech Synthesis ModelsChun-Yi Kuan, Hung-yi Lee. 5387-5413 [doi]
- ResoFilter: Fine-grained Synthetic Data Filtering for Large Language Models through Data-Parameter Resonance AnalysisZeao Tu, Xiangdi Meng, Yu He, Zihan Yao, Tianyu Qi, Jun Liu, Ming Li. 5414-5428 [doi]
- UCFE: A User-Centric Financial Expertise Benchmark for Large Language ModelsYuzhe Yang, Yifei Zhang, Yan Hu, Yilin Guo, Ruoli Gan, Yueru He, Mingcong Lei, Xiao Zhang, Haining Wang, Qianqian Xie, Jimin Huang, Honghai Yu, Benyou Wang. 5429-5448 [doi]
- BRIEF: Bridging Retrieval and Inference for Multi-hop Reasoning via CompressionYuankai Li, Jia-Chen Gu, Di Wu 0054, Kai-Wei Chang, Nanyun Peng 0001. 5449-5470 [doi]
- An Optimizable Suffix Is Worth A Thousand Templates: Efficient Black-box Jailbreaking without Affirmative Phrases via LLM as OptimizerWeipeng Jiang, Zhenting Wang, Juan Zhai, ShiQing Ma, Zhengyu Zhao 0001, Chao Shen 0001. 5471-5483 [doi]
- Multi-Stage LLM Fine-Tuning with a Continual Learning SettingChanghao Guan, Chao Huang, Hongliang Li, You Li, Ning Cheng, Zihe Liu, Yufeng Chen 0005, Jinan Xu, Jian Liu 0032. 5484-5498 [doi]
- Constraining Sequential Model Editing with Editing Anchor CompressionHao-Xiang Xu, Jun-Yu Ma, Zhen-Hua Ling, Ningyu Zhang 0001, Jia-Chen Gu. 5499-5515 [doi]
- MLKV: Multi-Layer Key-Value Heads for Memory Efficient Transformer DecodingZayd Muhammad Kawakibi Zuhri, Muhammad Farid Adilazuarda, Ayu Purwarianti, Alham Fikri Aji. 5516-5525 [doi]
- Clarify When Necessary: Resolving Ambiguity Through Interaction with LMsMichael J. Q. Zhang, Eunsol Choi. 5526-5543 [doi]
- DOLFIN - Document-Level Financial Test-Set for Machine TranslationMariam Nakhlé, Marco Dinarelli, Raheel Qader, Emmanuelle Esperança-Rodier, Hervé Blanchon. 5544-5556 [doi]
- Are Large Language Models Effective in Clinical Trial Design? A Study on Baseline Feature GenerationNafis Neehal, Bowen Wang, Shayom Debopadhaya, Corey Curran, Keerthiram Murugesan, Soham Dan, Vibha Anand, Kristin P. Bennett. 5557-5570 [doi]
- Lightweight Contenders: Navigating Semi-Supervised Text Mining through Peer Collaboration and Self TranscendenceQianren Mao, Weifeng Jiang, Junnan Liu, Chenghua Lin, Qian Li, Xianqing Wen, Jianxin Li 0002, Jinhu Lu. 5571-5585 [doi]
- Language-based Valence and Arousal Expressions between the United States and China: a Cross-Cultural ExaminationYoung-Min Cho, Dandan Pang, Stuti Thapa, Garrick Sherman, Lyle H. Ungar, Louis Tay, Sharath Chandra Guntuku. 5586-5600 [doi]
- Chain-of-Rank: Enhancing Large Language Models for Domain-Specific RAG in Edge DeviceJuntae Lee, Jihwan Bang, Kyuhong Shim, Seunghan Yang, Simyung Chang. 5601-5608 [doi]
- MALoRA: Mixture of Asymmetric Low-Rank Adaptation for Enhanced Multi-Task LearningXujia Wang, Haiyan Zhao, Shuo Wang, Hanqing Wang 0003, Zhiyuan Liu 0001. 5609-5626 [doi]
- LlamaLens: Specialized Multilingual LLM for Analyzing News and Social Media ContentMohamed Bayan Kmainasi, Ali Ezzat Shahroor, Maram Hasanain, Sahinur Rahman Laskar, Naeemul Hassan, Firoj Alam. 5627-5649 [doi]
- LLMs are Biased Teachers: Evaluating LLM Bias in Personalized EducationIain Weissburg, Sathvika Anand, Sharon Levy, Haewon Jeong. 5650-5698 [doi]
- Preserving Zero-shot Capability in Supervised Fine-tuning for Multi-label Text ClassificationSi-An Chen, Hsuan-Tien Lin, Chih-Jen Lin. 5699-5712 [doi]
- Data-centric NLP Backdoor Defense from the Lens of MemorizationZhenting Wang, Zhizhi Wang, Mingyu Jin, Mengnan Du, Juan Zhai, ShiQing Ma. 5713-5731 [doi]
- Neuro-Symbolic Integration Brings Causal and Reliable Reasoning ProofsSen Yang 0005, Xin Li 0056, Leyang Cui, Lidong Bing, Wai Lam. 5732-5744 [doi]
- Infogent: An Agent-Based Framework for Web Information AggregationRevanth Gangi Reddy, Sagnik Mukherjee, Jeonghwan Kim, Zhenhailong Wang, Dilek Hakkani-Tür, Heng Ji. 5745-5758 [doi]
- On the Role of Key Phrases in Argument MiningNilmadhab Das, Vijaya V. Saradhi, Ashish Anand. 5759-5772 [doi]
- TabComp: A Dataset for Visual Table Reading ComprehensionSomraj Gautam, Abhishek Bhandari, Gaurav Harit. 5773-5780 [doi]
- RankAdaptor: Hierarchical Rank Allocation for Efficient Fine-Tuning Pruned LLMs via Performance ModelChanghai Zhou, Shijie Han, Lining Yang, Yuhua Zhou, Xu Cheng, Yibin Wang, Hongguang Li. 5781-5795 [doi]
- Rationale Behind Essay Scores: Enhancing S-LLM's Multi-Trait Essay Scoring with Rationale Generated by LLMsSeongYeub Chu, Jong Woo Kim, Bryan Wong, Mun Yong Yi. 5796-5814 [doi]
- MTPChat: A Multimodal Time-Aware Persona Dataset for Conversational AgentsWanqi Yang, Yanda Li, Meng Fang, Ling Chen 0006. 5815-5826 [doi]
- MetaAlign: Align Large Language Models with Diverse Preferences during Inference TimeMozhi Zhang, Pengyu Wang 0006, Chenkun Tan, Mianqiu Huang, Dong Zhang, Yaqian Zhou 0001, Xipeng Qiu. 5827-5845 [doi]
- MAQA: Evaluating Uncertainty Quantification in LLMs Regarding Data UncertaintyYongjin Yang, Haneul Yoo, Hwaran Lee. 5846-5863 [doi]
- Tuning-Free Personalized Alignment via Trial-Error-Explain In-Context LearningHyundong Justin Cho, Karishma Sharma, Nicolaas Paul Jedema, Leonardo F. R. Ribeiro, Jonathan May, Alessandro Moschitti. 5864-5885 [doi]
- Causal Inference with Large Language Model: A SurveyJing Ma 0002. 5886-5898 [doi]
- Ask Optimal Questions: Aligning Large Language Models with Retriever's Preference in ConversationChanwoong Yoon, Gangwoo Kim, Byeongguk Jeon, Sungdong Kim, Yohan Jo, Jaewoo Kang. 5899-5921 [doi]
- Systematic Knowledge Injection into Large Language Models via Diverse Augmentation for Domain-Specific RAGKushagra Bhushan, Yatin Nandwani, Dinesh Khandelwal, Sonam Gupta, Gaurav Pandey 0001, Dinesh Raghu, Sachindra Joshi. 5922-5943 [doi]
- Find the Intention of Instruction: Comprehensive Evaluation of Instruction Understanding for Large Language ModelsHyeonseok Moon, Jaehyung Seo, Seungyoon Lee, Chanjun Park, HeuiSeok Lim. 5944-5964 [doi]
- Long-Tail Crisis in Nearest Neighbor Language ModelsYuto Nishida, Makoto Morishita, Hiroyuki Deguchi, Hidetaka Kamigaito, Taro Watanabe. 5965-5978 [doi]
- Keep Guessing? When Considering Inference Scaling, Mind the BaselinesGal Yona, Or Honovich, Omer Levy, Roee Aharoni. 5979-5991 [doi]
- Large Language Models for Anomaly and Out-of-Distribution Detection: A SurveyRuiyao Xu, Kaize Ding. 5992-6012 [doi]
- Time-aware ReAct Agent for Temporal Knowledge Graph Question AnsweringQianyiHu QianyiHu, Xinhui Tu, Guo Cong, Shunping Zhang. 6013-6024 [doi]
- SG-FSM: A Self-Guiding Zero-Shot Prompting Paradigm for Multi-Hop Question Answering Based on Finite State MachineXiaochen Wang, Junqing He, Liang Chen 0024, Gholamreza Haffari, Yiru Wang, Zhe Yang 0013, Xiangdi Meng, Kunhao Pan, Zhifang Sui. 6025-6037 [doi]
- Dynamic Strategy Planning for Efficient Question Answering with Large Language ModelsTanmay Parekh, Pradyot Prakash, Alexander Radovic, Akshay Shekher, Denis Savenkov. 6038-6059 [doi]
- Can I Introduce My Boyfriend to My Grandmother? Evaluating Large Language Models Capabilities on Iranian Social Norm ClassificationHamidreza Saffari, Mohammadamin Shafiei, Donya Rooein, Francesco Pierri 0002, Debora Nozza. 6060-6074 [doi]
- PLD+: Accelerating LLM Inference by Leveraging Language Model ArtifactsShwetha Somasundaram, Anirudh Phukan, Apoorv Saxena. 6075-6089 [doi]
- Adapting LLM Agents with Universal Communication FeedbackKuan Wang, Yadong Lu, Michael Santacroce, Yeyun Gong, Chao Zhang, Yelong Shen. 6090-6107 [doi]
- Ignore the KL Penalty! Boosting Exploration on Critical Tokens to Enhance RL Fine-TuningJean Vassoyan, Nathanaël Beau, Roman Plaud. 6108-6118 [doi]
- SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast AsiaChaoqun Liu, Wenxuan Zhang 0001, Jiahao Ying, Mahani Aljunied, Anh Tuan Luu, Lidong Bing. 6119-6136 [doi]
- Learning to Search Effective Example Sequences for In-Context LearningXiang Gao, Ankita Sinha, Kamalika Das. 6137-6146 [doi]
- From Intentions to Techniques: A Comprehensive Taxonomy and Challenges in Text Watermarking for Large Language ModelsHarsh Nishant Lalai, Aashish Anantha Ramakrishnan, Raj Sanjay Shah, Dongwon Lee 0001. 6147-6160 [doi]
- M-IFEval: Multilingual Instruction-Following EvaluationAntoine Dussolle, Andrea Cardeña Díaz, Shota Sato, Peter Devine. 6161-6176 [doi]
- Automatic Annotation Augmentation Boosts Translation between Molecules and Natural LanguageZhiqiang Zhong, Simon Sataa-Yu Larsen, Haoyu Guo, Tao Tang, Kuangyu Zhou, Davide Mottin. 6177-6194 [doi]
- Let Modalities Teach Each Other: Modal-Collaborative Knowledge Extraction and Fusion for Multimodal Knowledge Graph CompletionGuoliang Zhu, Tao Ren, Dandan Wang, Jun Hu. 6195-6207 [doi]
- Modeling the Differential Prevalence of Online Supportive Interactions in Private Instant Messages of AdolescentsOndrej Sotolár, Michal Tkaczyk, Jaromír Plhák, David Smahel. 6208-6226 [doi]
- Dynamic Feature Fusion for Sign Language Translation Using HyperNetworksRuiquan Zhang, Rui Zhao, Zhicong Wu, Liang Zhang, Haoqi Zhang, Yidong Chen 0001. 6227-6239 [doi]
- Selective Self-to-Supervised Fine-Tuning for Generalization in Large Language ModelsSonam Gupta, Yatin Nandwani, Asaf Yehudai, Dinesh Khandelwal, Dinesh Raghu, Sachindra Joshi. 6240-6249 [doi]
- ProverbEval: Exploring LLM Evaluation Challenges for Low-resource Language UnderstandingIsrael Abebe Azime, Atnafu Lambebo Tonja, Tadesse Destaw Belay, Yonas Chanie, Bontu Fufa Balcha, Negasi Haile Abadi, Henok Biadglign Ademtew, Mulubrhan Abebe Nerea, Debela Desalegn Yadeta, Derartu Dagne Geremew, Assefa Atsbiha tesfau, Philipp Slusallek, Thamar Solorio, Dietrich Klakow. 6250-6266 [doi]
- MRE-MI: A Multi-image Dataset for Multimodal Relation Extraction in Social Media PostsShizhou Huang, Bo Xu 0023, Changqun Li, Yang Yu, Xin Alex Lin. 6267-6277 [doi]
- Discrete Diffusion Language Model for Efficient Text SummarizationDo Huu Dat, Duc Anh Do, Anh Tuan Luu, Wray L. Buntine. 6278-6290 [doi]
- CAPE: A Chinese Dataset for Appraisal-based Emotional Generation in Large Language ModelsJune M. Liu, He Cao, Renliang Sun, Rui Wang, Yu Li 0003, Jiaxing Zhang 0001. 6291-6309 [doi]
- Beyond Under-Alignment: Atomic Preference Enhanced Factuality Tuning for Large Language ModelsHongbang Yuan, Yubo Chen 0001, Pengfei Cao, Zhuoran Jin, Kang Liu 0001. 6310-6323 [doi]
- Weight-based Analysis of Detokenization in Language Models: Understanding the First Stage of Inference Without InferenceGo Kamoda, Benjamin Heinzerling, Tatsuro Inaba, Keito Kudo, Keisuke Sakaguchi, Kentaro Inui. 6324-6343 [doi]
- DiPT: Enhancing LLM Reasoning through Diversified Perspective-TakingHoang Anh Just, Mahavir Dabas, Lifu Huang, Ming Jin 0002, Ruoxi Jia 0001. 6344-6374 [doi]
- SOLID: Self-seeding and Multi-intent Self-instructing LLMs for Generating Intent-aware Information-Seeking DialogsArian Askari, Roxana Petcu, Chuan Meng, Mohammad Aliannejadi, Amin Abolghasemi, Evangelos Kanoulas, Suzan Verberne. 6375-6395 [doi]
- CollagePrompt: A Benchmark for Budget-Friendly Visual Recognition with GPT-4VSiyu Xu, Yunke Wang, Daochang Liu, Bo Du 0001, Chang Xu 0002. 6396-6418 [doi]
- ARISE: Iterative Rule Induction and Synthetic Data Generation for Text ClassificationYaswanth M, Vaibhav Singh, Ayush Maheshwari, Amrith Krishna, Ganesh Ramakrishnan. 6419-6434 [doi]
- Unleashing Multi-Hop Reasoning Potential in Large Language Models through Repetition of Misordered ContextSangwon Yu, Ik-Hwan Kim, Jongyoon Song, Saehyung Lee, Junsung Park, Sungroh Yoon. 6435-6455 [doi]
- Text Annotation via Inductive Coding: Comparing Human Experts to LLMs in Qualitative Data AnalysisAngelina Parfenova, Andreas Marfurt, Jürgen Pfeffer, Alexander Denzler. 6456-6469 [doi]
- Investigating the Zone of Proximal Development of Language Models for In-Context LearningPeng Cui 0006, Mrinmaya Sachan. 6470-6483 [doi]
- Breaking ReAct Agents: Foot-in-the-Door Attack Will Get You InItay Nakash, George Kour, Guy Uziel, Ateret Anaby-Tavor. 6484-6509 [doi]
- As easy as PIE: understanding when pruning causes language models to disagreePietro Tropeano, Maria Maistro, Tuukka Ruotsalo, Christina Lioma. 6510-6536 [doi]
- Multi-Agent Simulator Drives Language Models for Legal Intensive InteractionShengbinYue ShengbinYue, Ting Huang, Zheng Jia, Siyuan Wang, Shujun Liu, Yun Song, Xuanjing Huang 0001, Zhongyu Wei. 6537-6570 [doi]
- Exploring Backward Reasoning in Large Language ModelsLeonardo Ranaldi, Giulia Pucci. 6571-6586 [doi]
- MMLF: Multi-query Multi-passage Late Fusion RetrievalYuan-Ching Kuo, Yi Yu, Chih-Ming Chen 0003, Chuan-Ju Wang. 6587-6598 [doi]
- Dynamic Guided and Domain Applicable Safeguards for Enhanced Security in Large Language ModelsWeidi Luo, He Cao, Zijing Liu, Yu Wang, Aidan Wong, Bin Feng 0001, Yuan Yao 0013, Yu Li 0003. 6599-6620 [doi]
- kNN For Whisper And Its Effect On Bias And Speaker AdaptationMaya K. Nachesa, Vlad Niculae. 6621-6627 [doi]
- VisualCoder: Guiding Large Language Models in Code Execution with Fine-grained Multimodal Chain-of-Thought ReasoningCuong Chi Le, Hoang Chau Truong Vinh, Huy Nhat Phan, Dung Duy Le, Tien N. Nguyen, Nghi D. Q. Bui. 6628-6645 [doi]
- Optimizing LLMs for Italian: Reducing Token Fertility and Enhancing Efficiency Through Vocabulary AdaptationLuca Moroni, Giovanni Puccetti 0002, Pere-Lluís Huguet Cabot, Andrei Stefan Bejgu, Alessio Miaschi, Edoardo Barba, Felice dell'Orletta, Andrea Esuli, Roberto Navigli. 6646-6660 [doi]
- Beyond the Mode: Sequence-Level Distillation of Multilingual Translation Models for Low-Resource Language PairsAarón Galiano Jiménez, Juan Antonio Pérez-Ortiz, Felipe Sánchez-Martínez, Víctor M. Sánchez-Cartagena. 6661-6676 [doi]
- LLMs for Extremely Low-Resource Finno-Ugric LanguagesTaido Purason, Hele-Andra Kuulmets, Mark Fishel. 6677-6697 [doi]
- LOFT: Scalable and More Realistic Long-Context EvaluationJinhyuk Lee, Anthony Chen, Zhuyun Dai, Dheeru Dua, Devendra Singh Sachan, Michael Boratko, Yi Luan, Sébastien M. R. Arnold, Vincent Perot, Siddharth Dalmia, Hexiang Hu, Xudong Lin 0008, Panupong Pasupat, Aida Amini, Jeremy R. Cole, Sebastian Riedel 0001, Iftekhar Naim, Ming-Wei Chang, Kelvin Guu. 6698-6723 [doi]
- On the Influence of Context Size and Model Choice in Retrieval-Augmented Generation SystemsJuraj Vladika, Florian Matthes. 6724-6736 [doi]
- Aligning Black-box Language Models with Human JudgmentsGerrit J. J. van den Burg, Gen Suzuki, Wei Liu, Murat Sensoy. 6737-6749 [doi]
- Guideline Compliance in Task-Oriented Dialogue: The Chained Prior ApproachXiangyu Wen, Jianyuan Zhong, Zhijian Xu, Qiang Xu 0001. 6750-6776 [doi]
- AutoBreach: Universal and Adaptive Jailbreaking with Efficient Wordplay-Guided Optimization via Multi-LLMsJiawei Chen, Xiao Yang, Zhengwei Fang, Yu Tian, Yinpeng Dong, Zhaoxia Yin, Hang Su 0006. 6777-6798 [doi]
- \mathcalS²IT: Stepwise Syntax Integration Tuning for Large Language Models in Aspect Sentiment Quad PredictionBingfeng Chen, Chenjie Qiu, Yifeng Xie, Boyan Xu, Ruichu Cai, Zhifeng Hao. 6799-6806 [doi]
- BanNERD: A Benchmark Dataset and Context-Driven Approach for Bangla Named Entity RecognitionMd. Motahar Mahtab, Faisal Ahamed Khan, Md. Ekramul Islam, Md. Shahad Mahmud Chowdhury, Labib Imam Chowdhury, Sadia Afrin, Hazrat Ali, Mohammad Mamun Or Rashid, Nabeel Mohammed, Mohammad Ruhul Amin. 6807-6828 [doi]
- Large Language Models Reflect Human Citation Patterns with a Heightened Citation BiasAndres Algaba, Carmen Mazijn, Vincent Holst, Floriano Tori, Sylvia Wenmackers, Vincent Ginis. 6829-6864 [doi]
- What can Large Language Models Capture about Code Functional Equivalence?Nickil Maveli, Antonio Vergari, Shay B. Cohen. 6865-6903 [doi]
- Make Every Penny Count: Difficulty-Adaptive Self-Consistency for Cost-Efficient ReasoningXinglin Wang, Shaoxiong Feng, Yiwei Li 0001, Peiwen Yuan, Yueqi Zhang, Chuyi Tan, Boyuan Pan, Yao Hu, Kan Li 0001. 6904-6917 [doi]
- Large Language Models Are Better Logical Fallacy Reasoners with Counterargument, Explanation, and Goal-Aware Prompt FormulationJiwon Jeong, Hyeju Jang, Hogun Park. 6918-6937 [doi]
- MorphNLI: A Stepwise Approach to Natural Language Inference Using Text MorphingVlad-Andrei Negru, Robert Vacareanu, Camelia Lemnaru, Mihai Surdeanu, Rodica Potolea. 6938-6953 [doi]
- Unmasking Database Vulnerabilities: Zero-Knowledge Schema Inference Attacks in Text-to-SQL SystemsDorde Klisura, Anthony Rios. 6954-6976 [doi]
- Media of Langue: Exploring Word Translation NetworkGoki Muramoto, Atsuki Sato, Takayoshi Koyama. 6977-6994 [doi]
- Tackling Social Bias against the Poor: a Dataset and a Taxonomy on AporophobiaGeorgina Curto, Svetlana Kiritchenko, Muhammad Hammad Fahim Siddiqui, Isar Nejadgholi, Kathleen C. Fraser. 6995-7016 [doi]
- The American Sign Language Knowledge Graph: Infusing ASL Models with Linguistic KnowledgeLee Kezar, Nidhi Munikote, Zian Zeng, Zed Sevcikova Sehyr, Naomi Caselli, Jesse Thomason. 7017-7029 [doi]
- Reinforcement Learning for Aligning Large Language Models Agents with Interactive Environments: Quantifying and Mitigating Prompt OverfittingMohamed Salim Aissi, Clément Romac, Thomas Carta, Sylvain Lamprier, Pierre-Yves Oudeyer, Olivier Sigaud, Laure Soulier, Nicolas Thome. 7030-7046 [doi]
- An empirical study of validating synthetic data for formula generationUsneek Singh, José Cambronero, Sumit Gulwani, Aditya Kanade 0001, Anirudh Khatry, Vu Le 0002, Mukul Singh, Gust Verbruggen. 7047-7054 [doi]
- TeCoFeS: Text Column Featurization using Semantic AnalysisAnanya Singha, Mukul Singh, Ashish Tiwari 0001, Sumit Gulwani, Vu Le 0002, Chris Parnin. 7055-7061 [doi]
- CA*: Addressing Evaluation Pitfalls in Computation-Aware Latency for Simultaneous Speech TranslationXi Xu, Wenda Xu, Siqi Ouyang, Lei Li 0005. 7062-7067 [doi]
- Augmented Adversarial Trigger LearningZhe Wang, Yanjun Qi. 7068-7100 [doi]
- Adaptive Attacks Break Defenses Against Indirect Prompt Injection Attacks on LLM AgentsQiusi Zhan, Richard Fang, Henil Shalin Panchal, Daniel Kang. 7101-7117 [doi]
- Flaming-hot Initiation with Regular Execution Sampling for Large Language ModelsWeizhe Chen, Zhicheng Zhang, Guanlin Liu, Renjie Zheng, Wenlei Shi, Chen Dun, Zheng Wu, Xing Jin, Lin Yan. 7118-7127 [doi]
- HEISIR: Hierarchical Expansion of Inverted Semantic Indexing for Training-free Retrieval of Conversational Data using LLMsSangyeop Kim 0001, Hangyeul Lee, Yohan Lee. 7128-7144 [doi]
- "Women do not have heart attacks!" Gender Biases in Automatically Generated Clinical Cases in FrenchFanny Ducel, Nicolas Hiebel, Olivier Ferret, Karën Fort, Aurélie Névéol. 7145-7159 [doi]
- NOTA: Multimodal Music Notation Understanding for Visual Large Language ModelMingni Tang, Jiajia Li, Lu Yang 0008, Zhiqiang Zhang, Jinhao Tian, Zuchao Li, Lefei Zhang, Ping Wang 0028. 7160-7173 [doi]
- Exploring Large Language Models for Hate Speech Detection in Rioplatense SpanishJuan Manuel Pérez, Paula Miguel, Viviana Cotik. 7174-7187 [doi]
- An Annotated Dataset of Errors in Premodern Greek and Baselines for Detecting ThemCreston Brooks, Johannes Haubold, Charlie Cowen-Breen, Jay White, Desmond DeVaul, Frederick Riemenschneider, Karthik R. Narasimhan, Barbara Graziosi. 7188-7202 [doi]
- WorldMedQA-V: a multilingual, multimodal medical examination dataset for multimodal language models evaluationJoão Matos, Shan Chen 0004, Siena Placino, Yingya Li, Juan Carlos Climent Pardo, Daphna Idan, Takeshi Tohyama, David Restrepo, Luis Filipe Nakayama, Jose M. M. Pascual-Leone, Guergana K. Savova, Hugo J. W. L. Aerts, Leo Anthony Celi, An-Kwok Ian Wong, Danielle S. Bitterman, Jack Gallifant. 7203-7216 [doi]
- BanTH: A Multi-label Hate Speech Detection Dataset for Transliterated BanglaFabiha Haider, Fariha Tanjim Shifat, Md Farhan Ishmam, Md Sakib Ul Rahman Sourove, Deeparghya Dutta Barua, Md Fahim, Farhad Alam Bhuiyan. 7217-7236 [doi]
- Mutual Reinforcement of LLM Dialogue Synthesis and Summarization Capabilities for Few-Shot Dialogue SummarizationYen-Ju Lu, Ting-Yao Hu, Hema Swetha Koppula, Hadi Pouransari, Jen-Hao Rick Chang, Yin Xia, Xiang Kong, Qi Zhu, Simon Wang, Oncel Tuzel, Raviteja Vemulapalli. 7237-7256 [doi]
- UNLEARN Efficient Removal of Knowledge in Large Language ModelsTyler Lizzo, Larry Heck. 7257-7268 [doi]
- Adaptive Parameter Compression for Language ModelsJeremias Bohn, Frederic Mrozinski, Georg Groh. 7269-7286 [doi]
- Personalize Your LLM: Fake it then Align itYijing Zhang, Dyah Adila, Changho Shin, Frederic Sala. 7287-7301 [doi]
- A Survey to Recent Progress Towards Understanding In-Context LearningHaitao Mao, Guangliang Liu, Yao Ma 0001, Rongrong Wang, Kristen Marie Johnson, Jiliang Tang. 7302-7323 [doi]
- Inference Scaling for Bridging Retrieval and Augmented GenerationYoungwon Lee 0003, Seung-won Hwang, Daniel F. Campos, Filip Gralinski, Zhewei Yao, Yuxiong He. 7324-7339 [doi]
- GeoCoder: Solving Geometry Problems by Generating Modular Code through Vision-Language ModelsAditya Sharma, Aman Dalmia, Mehran Kazemi, Amal Zouaq, Christopher Pal. 7340-7356 [doi]
- SEEval: Advancing LLM Text Evaluation Efficiency and Accuracy through Self-Explanation PromptingMeng-Chen Wu, Md Mosharaf Hossain, Tess Wood, Shayan Ali Akbar, Si-Chi Chin, Erwin Cornejo. 7357-7368 [doi]
- When natural language is not enough: The limits of in-context learning demonstrations in multilingual reasoningLeonardo Ranaldi, Barry Haddow, Alexandra Birch. 7369-7396 [doi]
- Uncovering Latent Arguments in Social Media Messaging by Employing LLMs-in-the-Loop StrategyTunazzina Islam, Dan Goldwasser. 7397-7429 [doi]
- AcrosticSleuth: Probabilistic Identification and Ranking of Acrostics in Multilingual CorporaAleksandr Fedchin, Isabel Cooperman, Pramit Chaudhuri, Joseph P. Dexter. 7430-7437 [doi]
- MedThink: A Rationale-Guided Framework for Explaining Medical Visual Question AnsweringXiaotang Gai, Chenyi Zhou, Jiaxiang Liu, Yang Feng 0011, Jian Wu 0001, Zuozhu Liu. 7438-7450 [doi]
- How to Learn in a Noisy World? Self-Correcting the Real-World Data Noise in Machine TranslationYan Meng, Di Wu, Christof Monz. 7451-7467 [doi]
- Rejected Dialects: Biases Against African American Language in Reward ModelsJoel Mire, Zubin Trivadi Aysola, Daniel Chechelnitsky, Nicholas Deas, Chrysoula Zerva, Maarten Sap. 7468-7487 [doi]
- Do Large Language Models Align with Core Mental Health Counseling Competencies?Viet Cuong Nguyen, Mohammad Taher, Dongwan Hong, Vinicius Konkolics Possobom, Vibha Thirunellayi Gopalakrishnan, Ekta Raj, Zihang Li, Heather J. Soled, Michael L. Birnbaum, Srijan Kumar, Munmun De Choudhury. 7488-7511 [doi]
- Uncertainty Quantification for Clinical Outcome Predictions with (Large) Language ModelsZizhang Chen, Peizhao Li, Xiaomeng Dong, Pengyu Hong. 7512-7523 [doi]
- Hypothesis Generation for Materials Discovery and Design Using Goal-Driven and Constraint-Guided LLM AgentsShrinidhi Kumbhar, Venkatesh Mishra, Kevin Coutinho, Divij Handa, Ashif Iquebal, Chitta Baral. 7524-7555 [doi]
- Aligning to What? Limits to RLHF Based AlignmentLogan Barnhart, Reza Akbarian Bafghi, Stephen Becker, Maziar Raissi. 7556-7591 [doi]
- Beyond Words: Exploring Cultural Value Sensitivity in Multimodal ModelsSrishti Yadav, Zhi Zhang, Daniel Hershcovich, Ekaterina Shutova. 7592-7608 [doi]
- Features that Make a Difference: Leveraging Gradients for Improved Dictionary LearningJeffrey Olmo, Jared Wilson, Max Forsey, Bryce Hepner, Thomas Vin Howe, David Wingate. 7609-7619 [doi]
- Tooling or Not Tooling? The Impact of Tools on Language Agents for Chemistry Problem SolvingBotao Yu, Frazier N. Baker, Ziru Chen, Garrett Herb, Boyu Gou, Daniel Adu-Ampratwum, Xia Ning, Huan Sun 0001. 7620-7640 [doi]
- RusCode: Russian Cultural Code Benchmark for Text-to-Image GenerationViacheslav Vasilev, Julia Agafonova, Nikolai Gerasimenko, Alexander Kapitanov, Polina Mikhailova, Evelina Mironova, Denis Dimitrov. 7641-7657 [doi]
- Evaluation of LLMs-based Hidden States as Author Representations for Psychological Human-Centered NLP TasksNikita Soni 0002, Pranav Chitale, Khushboo Singh, Niranjan Balasubramanian, H. Andrew Schwartz. 7658-7667 [doi]
- Large Language Models and Causal Inference in Collaboration: A Comprehensive SurveyXiaoyu Liu 0003, Paiheng Xu, Junda Wu, Jiaxin Yuan, Yifan Yang 0006, Yuhang Zhou, Fuxiao Liu, Tianrui Guan, Haoliang Wang, Tong Yu 0001, Julian J. McAuley, Wei Ai 0002, Furong Huang. 7668-7684 [doi]
- ThoughtSculpt: Reasoning with Intermediate Revision and SearchYizhou Chi, Kevin Yang, Dan Klein. 7685-7711 [doi]
- Optimizing Hidden Markov Language Models: An Empirical Study of Reparameterization and Initialization TechniquesIvan Lee, Taylor Berg-Kirkpatrick. 7712-7723 [doi]
- Using Linguistic Entrainment to Evaluate Large Language Models for Use in Cognitive Behavioral TherapyMina J. Kian, Kaleen Shrestha, Katrin Fischer, Xiaoyuan Zhu, Jonathan Ong, Aryan Trehan, Jessica Wang, Gloria Chang, Sébastien M. R. Arnold, Maja Mataric. 7724-7743 [doi]
- Analysis of LLM as a grammatical feature tagger for African American EnglishRahul Porwal, Alice Rozet, Jotsna Gowda, Pryce Houck, Kevin Tang, Sarah Moeller. 7744-7756 [doi]
- LLM-Microscope: Uncovering the Hidden Role of Punctuation in Context Memory of TransformersAnton Razzhigaev, Matvey Mikhalchuk, Temurbek Rahmatullaev, Elizaveta Goncharova, Polina Druzhinina, Ivan Oseledets, Andrey Kuznetsov. 7757-7764 [doi]
- On A Scale From 1 to 5: Quantifying Hallucination in Faithfulness EvaluationXiaonan Jing, Srinivas Billa, Danny Godbout. 7765-7780 [doi]
- LITERA: An LLM Based Approach to Latin-to-English TranslationPaul Rosu. 7781-7794 [doi]
- Investigating the Shortcomings of LLMs in Step-by-Step Legal ReasoningVenkatesh Mishra, Bimsara Pathiraja, Mihir Parmar, Sat Chidananda, Jayanth Srinivasa, Gaowen Liu, Ali Payani, Chitta Baral. 7795-7826 [doi]
- Towards Long Context Hallucination DetectionSiyi Liu, Kishaloy Halder, Zheng Qi, Wei Xiao, Nikolaos Pappas 0004, Phu Mon Htut, Neha Anna John, Yassine Benajiba, Dan Roth. 7827-7835 [doi]
- How to Talk to Language Models: Serialization Strategies for Structured Entity MatchingHaoteng Yin, Jinha Kim, Prashant Mathur, Krishanu Sarker, Vidit Bansal. 7836-7850 [doi]
- Accounting for Sycophancy in Language Model Uncertainty EstimationAnthony Sicilia, Mert Inan, Malihe Alikhani. 7851-7866 [doi]
- Zero-Shot Keyphrase Generation: Investigating Specialized Instructions and Multi-sample Aggregation on Large Language ModelsJishnu Ray Chowdhury, Jayanth Mohan, Tomás Malík, Cornelia Caragea. 7867-7884 [doi]
- Meta-Reasoning Improves Tool Use in Large Language ModelsLisa Alazraki, Marek Rei. 7885-7897 [doi]
- CLERC: A Dataset for U. S. Legal Case Retrieval and Retrieval-Augmented Analysis GenerationAbe Bohan Hou, Orion Weller, Guanghui Qin, Eugene Yang, Dawn J. Lawrie, Nils Holzenberger, Andrew Blair-Stanek, Benjamin Van Durme. 7898-7913 [doi]
- GAIfE: Using GenAI to Improve Literacy in Low-resourced SettingsAllahsera Auguste Tapo, Nouhoum Souleymane Coulibaly, Seydou Diallo, Sébastien Diarra, Christopher M. Homan, Mamadou K. Keita, Michael Leventhal. 7914-7929 [doi]
- Hard Emotion Test Evaluation Sets for Language ModelsTiberiu Sosea, Cornelia Caragea. 7930-7944 [doi]
- UCL-Bench: A Chinese User-Centric Legal Benchmark for Large Language ModelsRuoli Gan, Duanyu Feng, Chen Zhang 0020, Zhihang Lin, Haochen Jia, Hao Wang, Zhenyang Cai, Lei Cui, Qianqian Xie, Jimin Huang, Benyou Wang. 7945-7988 [doi]
- MIDAS: Multi-level Intent, Domain, And Slot Knowledge Distillation for Multi-turn NLUYan Li, So-Eon Kim, Seong-Bae Park, Soyeon Caren Han. 7989-8012 [doi]
- A Practical Analysis of Human Alignment with *POKian Ahrabian, Xihui Lin, Barun Patra, Vishrav Chaudhary, Alon Benhaim, Jay Pujara, Xia Song. 8013-8021 [doi]
- Understanding Reference Policies in Direct Preference OptimizationYixin Liu 0003, Pengfei Liu 0003, Arman Cohan. 8022-8037 [doi]
- LLM-Coordination: Evaluating and Analyzing Multi-agent Coordination Abilities in Large Language ModelsSaaket Agashe, Yue Fan, Anthony Reyna, Xin Eric Wang. 8038-8057 [doi]
- AssertionBench: A Benchmark to Evaluate Large-Language Models for Assertion GenerationVaishnavi Pulavarthi, Deeksha Nandal, Soham Dan, Debjit Pal. 8058-8065 [doi]
- On Reference (In-)Determinacy in Natural Language InferenceSihao Chen, Chaitanya Malaviya, Alex Fabrikant, Hagai Taitelbaum, Tal Schuster, Senaka Buthpitiya, Dan Roth. 8066-8078 [doi]
- DHP Benchmark: Are LLMs Good NLG Evaluators?Yicheng Wang, Jiayi Yuan, Yu-Neng Chuang, Zhuoer Wang, Yingchi Liu, Mark Cusick, Param Kulkarni, Zhengping Ji, Yasser Ibrahim, Xia Hu. 8079-8094 [doi]
- GraphEval36K: Benchmarking Coding and Reasoning Capabilities of Large Language Models on Graph DatasetsQiming Wu, Zichen Chen, Will Corcoran, Misha Sra, Ambuj K. Singh. 8095-8117 [doi]
- SimulBench: Evaluating Language Models with Creative Simulation TasksQi Jia, Xiang Yue, Tuney Zheng, Jie Huang, Bill Yuchen Lin. 8118-8131 [doi]
- ReasoningRec: Bridging Personalized Recommendations and Human-Interpretable Explanations through LLM ReasoningMillennium Bismay, Xiangjue Dong, James Caverlee. 8132-8148 [doi]
- 2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional SupervisionShilong Li, Yancheng He, Hui Huang, Xingyuan Bu, Jiaheng Liu, Hangyu Guo, Weixun Wang, Jihao Gu, Wenbo Su, Bo Zheng 0007. 8149-8173 [doi]
- Demystifying the Power of Large Language Models in Graph GenerationYu Wang 0160, Ryan A. Rossi, Namyong Park, Nesreen K. Ahmed, Danai Koutra, Franck Dernoncourt, Tyler Derr. 8174-8189 [doi]
- COIG-CQIA: Quality is All You Need for Chinese Instruction Fine-tuningYuelin Bai, Xeron Du, Yiming Liang, Leo Jin, Junting Zhou, Ziqiang Liu, Feiteng Fang, Mingshan Chang, Tianyu Zheng, Xincheng Zhang, Nuo Ma, Zekun Moore Wang, Ruibin Yuan, Haihong Wu, Hongquan Lin, Wenhao Huang, Jiajun Zhang, Chenghua Lin, Jie Fu 0001, Min Yang 0007, Shiwen Ni, Ge Zhang. 8190-8205 [doi]
- Gradient-guided Attention Map Editing: Towards Efficient Contextual Hallucination MitigationYu Wang, Jiaxin Zhang, Xiang Gao, Wendi Cui, Peng Li, Kamalika Das. 8206-8217 [doi]
- Alleviating Hallucinations of Large Language Models through Induced HallucinationsYue Zhang, Leyang Cui, Wei Bi, Shuming Shi. 8218-8232 [doi]
- MoDE: Effective Multi-task Parameter Efficient Fine-Tuning with a Mixture of Dyadic ExpertsLin Ning 0001, Harsh Lara, Meiqi Guo, Abhinav Rastogi. 8233-8246 [doi]
- Unsupervised Sentence Representation Learning with Syntactically Aligned Negative SamplesZhilan Wang, Zekai Zhi, Rize Jin, Kehui Song, He Wang, Da-Jung Cho. 8247-8259 [doi]
- Hierarchical Speculative Decoding with Dynamic WindowShensian Syu, Hung-yi Lee. 8260-8273 [doi]
- Q-FAKER: Query-free Hard Black-box Attack via Controlled GenerationCheolWon Na, Yunseok Choi, Jee-Hyong Lee 0001. 8274-8289 [doi]
- PRDetect: Perturbation-Robust LLM-generated Text Detection Based on Syntax TreeXiang Li, Zhiyi Yin, Hexiang Tan, Shaoling Jing, Du Su, Yi Cheng, Huawei Shen, Fei Sun 0001. 8290-8301 [doi]
- Enabling Natural Zero-Shot Prompting on Encoder Models via Statement-TuningAhmed Elshabrawy, Yongxin Huang, Iryna Gurevych, Alham Fikri Aji. 8302-8321 [doi]
- Faster Machine Translation Ensembling with Reinforcement Learning and Competitive CorrectionKritarth Prasad, Mohammadi Zaki, Pratik Rakesh Singh, Pankaj Wasnik. 8322-8335 [doi]
- Evaluating Numeracy of Language Models as a Natural Language Inference TaskRahmad Mahendra, Damiano Spina, Lawrence Cavedon, Karin Verspoor. 8336-8361 [doi]
- Are Language Models Agnostic to Linguistically Grounded Perturbations? A Case Study of Indic LanguagesPoulami Ghosh, Raj Dabre, Pushpak Bhattacharyya. 8362-8396 [doi]
- Do LLMs Have Distinct and Consistent Personality? TRAIT: Personality Testset designed for LLMs with PsychometricsSeungbeen Lee, Seungwon Lim, Seungju Han, Giyeong Oh, Hyungjoo Chae, Jiwan Chung, Minju Kim, Beong-woo Kwak, Yeonsoo Lee, Dongha Lee 0003, Jinyoung Yeo, Youngjae Yu. 8397-8437 [doi]
- Tell Me What You Know About Sexism: Expert-LLM Interaction Strategies and Co-Created Definitions for Zero-Shot Sexism DetectionMyrthe Reuver, Indira Sen, Matteo Melis, Gabriella Lapesa. 8438-8467 [doi]
- The Role of Prosody in Spoken Question AnsweringJie Chi, Maureen de Seyssel, Natalie Schluter. 8468-8479 [doi]
- Target-Augmented Shared Fusion-based Multimodal Sarcasm Explanation GenerationPalaash Goel, Dushyant Singh Chauhan, Md. Shad Akhtar. 8480-8493 [doi]
- Seeds of Discourse: A Multilingual Corpus of Direct Quotations from African Media on Agricultural BiotechnologiesPatricia Chiril, Trevor Spreadbury, Joeva Rock, Brian Dowd-Uribe, David Uminsky 0001. 8494-8500 [doi]
- Position Really Matters: Towards a Holistic Approach for Prompt TuningXianjun Yang, Wei Cheng 0002, Xujiang Zhao, Wenchao Yu, Linda Ruth Petzold, Haifeng Chen. 8501-8523 [doi]