Abstract is missing.
- Scalable Processing-Near-Memory for 1M-Token LLM Inference: CXL-Enabled KV-Cache Management Beyond GPU LimitsDowon Kim, MinJae Lee, Janghyeon Kim, Hyucksung Kwon, Hyeonggyu Jeong, Sang-Soo Park, Minyong Yoon, Si-Dong Roh, Yongsuk Kwon, Jinin So, Jungwook Choi. 1-13 [doi]
- SPipe: Hybrid GPU and CPU Pipeline for Training LLMs under Memory PressureJunyeol Ryu, Yujin Jeong, Daeyoung Park, Jinpyo Kim, Heehoon Kim, Jaejin Lee. 14-29 [doi]
- ScaleMoE: A Fast and Scalable Distributed Training Framework for Large-Scale Mixture-of-Experts ModelsSeohong Choi, Huize Hong, Tae-Hee Han, Joonsung Kim. 30-42 [doi]
- LibraPIM: Dynamic Load Rebalancing to Maximize Utilization in PIM-Assisted LLM Inference SystemsHyeongjun Cho, Yoonho Jang, Hyungi Kim, Seongwook Kim, Keewon Kwon, Gwangsun Kim, Seokin Hong. 43-56 [doi]
- Doppeladler: Adaptive Tensor Parallelism for Latency-Critical LLM Deployment on CPU-GPU Integrated End-User DeviceJiazhi Jiang, Xiao Liu, Jiangsu Du, Dan Huang 0001, Yutong Lu. 57-70 [doi]
- Exploring Memory Tiering Systems in the CXL Era via FPGA-based Emulation and Device-Side ManagementYiqi Chen, Xiping Dong, Zhe Zhou 0002, Zhao Wang, Jie Zhang 0048, Guangyu Sun 0003. 71-83 [doi]
- CPC: Coordinated Page Cache for Serverless ComputingKeun Soo Lim, Yunjay Hong, Jongheon Jeong, Sam Son, Donguk Kim, Yeonhong Park, Jae W. Lee, Jinkyu Jeong. 84-96 [doi]
- SCREME: A Scalable Framework for Resilient Memory DesignFan Li, Mimi Xie, Yanan Guo, Huize Li, Xin Xin. 97-109 [doi]
- Cache Miss Curve Analysis via Cardinality DomainEishi Arima, Martin Schulz 0001. 110-121 [doi]
- EARTH: Efficient Architecture for RISC-V Vector Memory AccessHongyi Guan, Yichuan Gao, Chenlu Miao, Haoyang Wu, Hang Zhu, Mingfeng Lin, Huayue Liang. 122-134 [doi]
- ANG: Accelerating NFA processing on GPUs via Exploring Multi-Level Fine-Grained ParallelismYuguang Wang 0005, Yunmo Zhang, Zeyu Liu, Junqiao Qiu, Zhenlin Wang 0003. 135-147 [doi]
- Accelerating DFS-based Subgraph Matching on GPU via Reusing IntersectionChen Chen, Shanzhi Gu, Junsheng Chang, Li Shen. 148-159 [doi]
- Multiway Merge Partitioning for Sparse-Sparse Matrix Multiplication on GPUsEric Lorimer, Ruobing Han, Sung Ha Kang, Hyesoon Kim. 160-171 [doi]
- DMO-DB: Mitigating the Data Movement Bottlenecks of GPU-Accelerated Relational OLAPChaemin Lim, Suhyun Lee 0002, Jinwoo Choi 0003, Joonsung Kim 0001, Jinho Lee 0001, Youngsok Kim. 172-185 [doi]
- Agentic Auto-Scheduling: An Experimental Study of LLM-Guided Loop OptimizationMassinissa Merouani, Islem Kara Bernou, Riyadh Baghdadi. 186-200 [doi]
- LOOPer: A Learned Automatic Code Optimizer For Polyhedral CompilersMassinissa Merouani, Afif Boudaoud, Iheb Nassim Aouadj, Nassim Tchoulak, Islem Kara Bernou, Hamza Benyamina, Fatima Benbouzid-Si Tayeb, Karima Benatchba, Hugh Leather, Riyadh Baghdadi. 201-215 [doi]
- Guess, Measure & Edit: Using Lowering to Lift Tensor CodeJosé Wesley de Souza Magalhães, Jackson Woodruff, Jordi Armengol-Estapé, Alexander Brauckmann, Luc Jaulmes, Elizabeth Polgreen, Michael F. P. O'Boyle. 216-228 [doi]
- Automatic Generation of Actor-based Parallelism from Shared-Memory Parallel ProgramsJun Shirako, Vivek Sarkar. 229-242 [doi]
- Automatic Code-Generation for Accelerating Structured-Mesh-Based Explicit Numerical Solvers on FPGAsBeniel Thileepan, Suhaib A. Fahmy, Gihan R. Mudalige. 243-256 [doi]
- FLASH: An Abstract Machine for Modelling Fully Homomorphic Encryption AcceleratorsAlireza Tabatabaeian, Arrvindh Shriraman. 257-269 [doi]
- Energy-Efficient Acceleration of Hash-Based Post-Quantum Cryptographic Schemes on Embedded Spatial ArchitecturesYanze Wu, Md Tanvir Arafin. 270-280 [doi]
- Fine-Grained Fusion: The Missing Piece in Area-Efficient State Space Model AccelerationRobin Geens, Arne Symons, Marian Verhelst. 281-291 [doi]
- Squire: A General-Purpose Accelerator to Exploit Fine-Grain Parallelism on Dependency-Bound KernelsRubén Langarita, Jesús Alastruey-Benedé, Pablo Ibáñez-Marín, Santiago Marco-Sola, Miquel Moretó, Adrià Armejach. 292-305 [doi]
- Bancroft: Genomics Acceleration Beyond On-Device MemorySe-Min Lim, Seongyoung Kang, Sang-Woo Jun. 306-319 [doi]
- Hera: A Heterogeneity-Aware Multi-Tenant Inference Server for Personalized RecommendationsYujeong Choi, John Kim 0001, Minsoo Rhu. 320-332 [doi]
- Salient Store: Enabling Smart Storage for Continuous Learning Edge ServersCyan Subhra Mishra, Deeksha Chaudhary, Mahmut Taylan Kandemir, Chita R. Das. 333-346 [doi]
- Bit-Level Semantics: Scalable RAG Retrieval with Neurosymbolic Hyperdimensional ComputingHyunsei Lee, Shinhyoung Jang, Jaewoo Gwak, Jongho Park, Yeseong Kim. 347-358 [doi]
- Optimizing 3D Gaussian Splattering for Mobile GPUsMd. Musfiqur Rahman Sanim, Zhihao Shu, Bahram Afsharmanesh, AmirAli Mirian, Jiexiong Guan, Wei Niu 0002, Bin Ren 0002, Gagan Agrawal. 359-371 [doi]
- GPU Stream-Aware Communication for Effective PipeliningNaveen Namashivayam, Krishna Kandalla, Pen-Chung Yew, Trey White, Larry Kaplan, Mark Pagel. 372-384 [doi]
- TPE: XPU-Point: Simulator-Agnostic Sample Selection Methodology for Heterogeneous CPU-GPU ApplicationsAlen Sabu, Harish Patil, Wim Heirman, Changxi Liu, Trevor E. Carlson. 385-400 [doi]
- Generating Two-Level, GPU-Aware Mappings for Distributed Tensor ComputationsBotao Wu, Martin Kong. 401-415 [doi]
- A Stable Marriage Requires a Shared Residence with Low Contention and Mutual ComplementarityJiaxin Liu, Rubao Lee, Cathy H. Xia, Xia Odong Zhang. 416-430 [doi]
- Optimize Winograd Convolution for a Novel MIMD Many-core Architecture PEZY-SC3sYi Zhou, Qinglin Wang, Lian Wang, Zhiyan Liu, Bingwei Wang, Feiming Liu, Xiangdong Pei, Jie Liu. 431-443 [doi]
- CoroAMU: Unleashing Memory-Driven Coroutines through Latency-Aware Decoupled OperationsZhuolun Jiang, Songyue Wang, Xiaokun Pei, Tianyue, Mingyu Chen. 444-457 [doi]
- POSTER: DaPPA: A Data-Parallel Programming Framework for Processing-in-Memory ArchitecturesGeraldo F. Oliveira, Alain Kohli, David Novo, Ataberk Olgun, A. Giray Yaglikçi, Saugata Ghose, Juan Gómez-Luna, Onur Mutlu. 458-460 [doi]
- Poster: HeteroSched: Co-Optimizing Scheduling and Parallelization for Deep Learning WorkloadsBahram Afsharmanesh, Md. Musfiqur Rahman Sanim, AmirAli Mirian, Gagan Agrawal. 461-463 [doi]
- POSTER: IRISX: A Dynamic Trade-off System for Performance Portability on Multi-Accelerator PlatformsSanil Rao, Mohammad Alaul Haque Monil, Het Mankad, Narasinga Rao Miniskar, Keita Teranishi, Jeffrey S. Vetter, Franz Franchetti. 464-466 [doi]
- POSTER: PIMAP: Characterizing a Real Processing-in-Memory System for Analytical Data ProcessingManos Frouzakis, Juan Gómez-Luna, Geraldo F. Oliveira, Mohammad Sadrosadati, Onur Mutlu. 467-469 [doi]
- Poster:Value-Aware Scheduler for Energy ReductionHaiyue Ma, Kaifeng Xu, David Wentzlaff. 470-472 [doi]