Abstract is missing.
- Quality and Security Signals in AI-Generated Python Refactoring Pull RequestsMohamed Almukhtar, Anwar Ghammam, Ming Hua 0003. 1-10 [doi]
- Configuring Agentic AI Coding Tools: An Exploratory StudyMatthias Galster, Seyedmoein Mohsenimofidi, Jai Lal Lulla, Muhammad Auwal Abubakar, Christoph Treude, Sebastian Baltes. 11-20 [doi]
- Can LLMs Really Reason about Code? Studying How Well LLMs Understand the Relation between Input, Code, and OutputNorman Becker, Tural Mammadov, Andreas Zeller. 21-30 [doi]
- Accountable Agents in Software Engineering: An Analysis of Terms of Service and a Research RoadmapChristoph Treude. 31-37 [doi]
- Beyond Translation Accuracy: Addressing False Failures in LLM-Based Code TranslationFazle Rabbi, Soumit Kanti Saha, Jinqiu Yang 0001. 38-42 [doi]
- Deterministic vs. LLM-Controlled Orchestration for COBOL-to-Python ModernizationNaing Oo Lwin, Rajesh Kumar 0016. 43-50 [doi]
- Using Mutation-Analysis to Examine an LLM's Ability to Summarize CodeLara Khatib, Michael Pu, Bogdan Vasilescu, Meiyappan Nagappan. 51-60 [doi]
- Collaborator or Assistant? How AI Coding Agents Partition Work across Pull Request LifecyclesYoung Jo Chung, Safwat Hassan. 61-70 [doi]
- Testing AIware Systems: A Software Engineering SurveyKarla Gonzalez, Mariam El Mezouar. 71-86 [doi]
- Zombie Agents: Detecting Semantic Livelock in Long-Horizon Autonomous SoftwareSimarjot Khanna. 87-89 [doi]
- Executable but Unlearnable: Designing Code That Resists LLM-Based LearningViraaji Mothukuri, Reza M. Parizi. 90-95 [doi]
- From Assistance to Agency: Rethinking Autonomy and Control in CI/CD PipelinesMarcus Emmanuel Barnes, Taher Ahmed Ghaleb, Safwat Hassan. 96-100 [doi]
- From Code Review to Spec-Driven Contracts: A Vision for Auditable AIWare SystemsMohammad Hamdaqa, Moataz Chouchen. 101-105 [doi]
- Operationalizing Ethics for AI Agents: How Developers Encode Values into Repository Context FilesChristoph Treude, Sebastian Baltes, Marc Cheong. 106-109 [doi]
- Detecting Unsoundness in Neural Network Verifiers via Concrete-Abstract ConsistencyKaijie Liu, Yulei Sui. 110-119 [doi]
- Artifact Readiness Gates with Saturation Stop Rules and Host-Parity Admissibility for FM Release EvaluationYanick Kanyiki. 120-128 [doi]
- When AI Coding Assistants Leak Training Data: A Study of LLM Memorization in Code GenerationXiaoyu Cheng, Kundi Yao, Pengyu Nie 0001, Weiyi Shang. 129-134 [doi]
- SOSecure: The Wisdom of the Crowd for Safer AI-Generated CodeManisha Mukherjee, Vincent Josua Hellendoorn. 135-144 [doi]
- From Correctness to Consistency: Redefining Reliability for the Agentware EraXue-qin, Maurício Gruppi. 145-150 [doi]
- An Empirical Study of Reasoning Steps in Thinking Code LLMsHaoran Xue, Gias Uddin 0001, Song Wang 0009. 151-159 [doi]
- VeriTrans: Fine-Tuned LLM-Assisted NL→PL Translation via a Deterministic Neuro-symbolic PipelineXuan Liu, Dheeraj Kodakandla, Kushagra Srivastva, Mahfuza Farooque. 160-167 [doi]
- Is Artificial Intelligence an Elixir to the Software Engineering Community? An Empirical Study among ManagersXin Zhao 0041, Brian Vu, Sitesh Pattanaik. 168-177 [doi]
- Kubernetes Misconfigurations in the Wild: Taxonomy, Evolution, and Automated Repair with Large Language ModelsMostafa Anouar Ghorab, Ahmad Abdellatif, Mohamed Aymen Saied. 178-187 [doi]
- When Code Authors Are Agents: A Large-Scale Study of Human-Agent Collaboration in Pull RequestsAnthonia Oluchukwu Njoku, Zohreh Sharafi, Foutse Khomh. 188-196 [doi]
- VISOR: A Vision-Language Model-Based Test Oracle for Testing RobotsPrasun Saurabh, Pablo Valle, Aitor Arrieta, Shaukat Ali 0001, Paolo Arcaini. 197-207 [doi]
- Wink: Recovering from Misbehaviors in Coding AgentsRahul Nanda, Chandra Maddila, Smriti Jha, Euna Mehnaz Khan, Matteo Paltenghi, Satish Chandra 0001. 208-217 [doi]
- Co-located Tests, Better AI Code: How Test Syntax Structure Affects Foundation Model Code GenerationÉric Jacopin. 218-227 [doi]
- Towards AI as a Collaborative Partner: A Taxonomy of AI Agent Behavior in Software EngineeringTao Dong, Sherry Y. Shi, Harini Sampath, Andrew Macvean. 228-237 [doi]
- Understanding Conversational Patterns in Multi-agent Programming: A Case Study on Fibonacci Game DevelopmentSrijita Basu, Viktor Kjellberg, Simin Sun, Bengt Haraldsson, Md. Abu Ahammed Babu, Wilhelm Meding, Farnaz Fotrousi, Miroslaw Staron. 238-247 [doi]
- Fixpad++: Automated Bug Fix Verification using LLM AgentsMustafa Özkan Ir, Mehmet Dedeler, Anil Koyuncu, Eray Tüzün. 248-258 [doi]
- A Preliminary Study on Explaining Risk of Code Changes using LLM-Based Prediction ModelsYalin Liu, Kosay Jabre, Rui Abreu 0001, Zachariah J. Carmichael, Vijayaraghavan Murali, Akshay Patel, Jun Ge, Weiyan Sun, Cong Zhang 0009, Audris Mockus, David Khavari, Peter C. Rigby, Nachiappan Nagappan. 259-267 [doi]
- Towards Migrating Neural Network ImplementationsNadia Daoudi, Iván Alfonso, Jordi Cabot. 268-277 [doi]
- Auditing Who Appears to Belong: A Large-Scale Empirical Study of Bias in Deployed Text-to-Image Systems for Software EngineeringMohamad Kassab. 278-287 [doi]
- How Robustly Do LLMs Understand Execution Semantics?Claudio Spiess, Prem Devanbu, Earl T. Barr. 288-298 [doi]
- TriORM: Workload-Aware Neural-Symbolic Multi-objective Optimization for ORM Mapping Designsasan azizian, Ayoub Hazrati, Artin Azizian, Elham Rastegari. 299-307 [doi]
- Neural-Symbolic Multi-objective Optimization for Performance-Aware ORM Database Designsasan azizian, Ayoub Hazrati, Artin Azizian, Elham Rastegari, Hamid Bagheri, Juan Cui. 308-313 [doi]
- A Dataset of Agentic AI Coding Tool ConfigurationsMatthias Galster, Seyedmoein Mohsenimofidi, Levi Böhme, Jai Lal Lulla, Muhammad Auwal Abubakar, Christoph Treude, Sebastian Baltes. 314-322 [doi]
- AgenticFlict: A Large-Scale Dataset of Merge Conflicts in AI Coding Agent Pull Requests on GitHubDaniel Ogenrwot, John Businge. 323-331 [doi]
- SWE-Bench+: Enhanced LLM Coding BenchmarkHaoran Xue, Reem Aleithan, Nafid Enan, Gias Uddin 0001, Song Wang 0009. 332-339 [doi]
- ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code GenerationYeheng Chen, Chaoxiang Xie, Yuling Shi, Wenhao Zeng, Yongpan Wang, Hongyu Zhang 0002, Xiaodong Gu 0002. 340-348 [doi]
- Do Agents Dream of Root Shells? Partial-Credit Evaluation of LLM Agents in Capture the Flag ChallengesAli Al-Kaswan, Maksim Plotnikov, Maxim Hájek, Roland Vízner, Arie van Deursen, Maliheh Izadi. 349-357 [doi]
- TOGBench: A Developer-Written Multi-variant Dataset and Benchmark Suite for Test Oracle GenerationTasfia Tasnim, Matthew B. Dwyer, Soneya Binta Hossain. 358-366 [doi]
- CrossCommitVuln-Bench: A Dataset of Multi-commit Python Vulnerabilities Invisible to Per-Commit Static AnalysisArunabh Majumdar. 367-370 [doi]
- HEJ-Robust: A Robustness Benchmark for LLM-Based Automated Program RepairFazle Rabbi, Jinqiu Yang 0001. 371-375 [doi]
- RustBuildEq: A Benchmark for Binary Equivalence under Build VariabilityElliott Wen, Chenye Ni, Valerio Terragni, Jens Dietrich 0001. 376-379 [doi]
- AgentTelemetry: A Fault Detection Benchmark and Toolkit for LLM Agent ObservabilityKrishna Chaitanya Balusu. 380-387 [doi]
- SecVulEval: Context-Aware Benchmarking of LLMs for Vulnerability DetectionMd Basim Uddin Ahmed, Nima Shiri Harzevili, Jiho Shin, Hung Viet Pham, Song Wang. 388-396 [doi]
- SecMutBench: Evaluating LLM-Generated Security Tests via Mutation-Based Vulnerability DetectionMariam Almutairi, Chang-Tien Lu. 397-405 [doi]
- JunoBench: A Benchmark Dataset of Crashes in Python Machine Learning Jupyter NotebooksYiran Wang, José Antonio Hernández López, Ulf Nilsson, Dániel Varró. 406-413 [doi]
- REBench: A Procedural, Fair-by-Construction Benchmark for LLMs on Stripped-Binary Types and NamesJun Yeon Won 0001, Xin Jin, ShiQing Ma, Zhiqiang Lin 0001. 414-422 [doi]