Abstract is missing.
- SimPoint+: More Stable, Accurate and Efficient Program AnalysisJiangying Xue, Tianyu Xiong, Lingwei Chao, Ruini Xue. 3-17 [doi]
- DCI: An Efficient Workload-Aware Dual-Cache Allocation GNN Inference Acceleration SystemYi Luo, Yaobin Wang, Qi Wang, Yingchen Song, Huan Wu, Qingfeng Wang 0004, Jun Huang 0005. 18-32 [doi]
- ARM SVE Unleashed: Performance and Insights Across HPC Applications on Nvidia GraceRuimin Shi, Gabin Schieffer, Maya B. Gokhale, Pei-Hung Lin, Hiren D. Patel, Ivy Peng. 33-47 [doi]
- SkipNZ: Non-zero Value Skipping for Efficient CNN AccelerationJoonyup Kwon, Jinhyeok Choi, Ngoc-Son Pham, Sangwon Shin, Taeweon Suh. 48-59 [doi]
- CoQMoE: Co-Designed Quantization and Computation Orchestration for Mixture-of-Experts Vision Transformer on FPGAJiale Dong, Hao Wu, Zihao Wang, Wenqi Lou, Zhendong Zheng, Lei Gong, Chao Wang 0003, Xuehai Zhou. 60-74 [doi]
- FDHA: Fusion-Driven Heterogeneous Accelerator for Efficient Diffusion Model InferenceYudong Mu, Zhihua Fan, Xiaoxia Yao, Wenming Li, Zhiyuan Zhang, Honglie Wang, Xuejun An, Xiaochun Ye. 75-88 [doi]
- SONet: Towards Practical Online Neural Network for Enhancing Hard-to-Predict BranchesZhenxuan Xiong, Libo Huang, Ling Yang 0008, Hui Guo 0004, Junhui Wang, Zhong Zheng, Songwen Pei, Gang Chen 0023, Yongwen Wang. 89-102 [doi]
- BATCH-DNN: Adaptive and Dynamic Batching for Multi-DNN AcceleratorsPiyumal Ranawaka, Per Stenström. 103-117 [doi]
- CacheC: LLM-Based GPU Cache Management to Enhance Kernel ConcurrencyMengyue Xi, Jingyi He, Xianwei Zhang 0001. 118-131 [doi]
- ParTEE: A Framework for Secure Parallel Computing of RISC-V Trusted Execution EnvironmentsHao Lan, Ziang Zhou, Qi Zhu, Wei Yan, Qinfen Hao, Xiaochun Ye, Yong Liu, Ninghui Sun. 132-145 [doi]
- CSGC: Collaborative File System Garbage Collection with Computational StorageJin Pu, Shengan Zheng, Penghao Sun, Guifeng Wang, Xin Xie, Linpeng Huang. 146-160 [doi]
- Cocache: An Accurate and Low-Overhead Dynamic Caching Method for GNNsZhaoyang Zeng, Yujuan Tan, Jiali Li, Zhuoxin Bai, Jun Liu, Kan Zhong, Duo Liu, Ao Ren. 161-174 [doi]
- ReSpike: A Co-Design Framework for Evaluating SNNs on ReRAM-Based Neuromorphic ProcessorsKazi Asifuzzaman, Aaron R. Young, Prasanna Date, Shruti R. Kulkarni, Narasinga Rao Miniskar, Matthew J. Marinella, Jeffrey S. Vetter. 175-189 [doi]
- AlphaSparseTensor: Discovering Faster Sparse Matrix Multiplication Algorithms on GPUs for LLM InferenceXuanzheng Wang, Shuo Miao, Zihan Zhu, Peng Qu, Youhui Zhang. 193-206 [doi]
- DiffNO: Neural Operator Learning Using Physically Structured Constrained Diffusion ModelZhichen Feng, Xin Zhang. 207-220 [doi]
- Saving Memory via Residual Reduction for DNN Training with Compressed CommunicationXinjue Zheng, Zhangqiang Ming, Yuchong Hu, Chenxuan Yao, Wenxiang Zhou, Rui Wang, Xun Chen, Dan Feng 0001. 221-235 [doi]
- Interval-Asynchrony: Delimited Intervals of Localised Asynchrony for Fast Parallel SGDJacob Garby, Philippas Tsigas. 236-249 [doi]
- Tutoring LLM into a Better CUDA OptimizerMatyás Brabec, Jirí Klepl, Michal Töpfer, Martin Krulis. 250-263 [doi]
- iAug: Accelerating Augmentation with Importance Sampling in Deep Neural Network TrainingRubayet Rahman Rongon, Xuechen Zhang 0001. 264-277 [doi]
- 2:4 Pruning on Edge Devices: Performance, Energy Efficiency and AccuracyNicolás Hernández, Pedro A. Toledo, Vicente Blanco 0001, Francisco Almeida. 278-291 [doi]
- TopServe: Task-Operator Co-scheduling for Efficient Multi-DNN Inference Serving on GPUsAo Chen, Guangli Li, Feng Yu 0019, Xueying Wang 0003, Jiacheng Zhao, Huimin Cui, Xiaobing Feng 0002, Jingling Xue. 292-305 [doi]
- Robustness of Deep Learning Classification to Adversarial Input on GPUs: Asynchronous Parallel Accumulation Is a Source of VulnerabilitySanjif Shanmugavelu, Mathieu Taillefumier, Christopher Culver, Vijay Ganesh 0001, Oscar R. Hernandez, Ada Sedova. 306-320 [doi]
- Scalable Compression of Massive Data Collections on HPC SystemsLoris Belcastro, Paolo Ferragina, Giovanni Manzini, Fabrizio Marozzo, Domenico Talia, Paolo Trunfio. 321-334 [doi]
- EFIM: Efficient Serving of LLMs for Infilling Tasks with Improved KV Cache ReuseTianyu Guo 0009, Hande Dong, Yichong Leng, Feng Liu, Cheater Lin, Nong Xiao 0001, Xianwei Zhang 0001. 335-348 [doi]
- Light-DiT: An Importance-Aware Dynamic Compression Framework for Diffusion TransformersCheng Gu, Gang Li 0015, Xuan Zhang 0001, Jiayao Ling, Xiaolong Lin, Zhuoran Song, Jian Cheng 0001, Xiaoyao Liang. 349-364 [doi]
- On-Device Federated Learning for Remote Alpine Livestock MonitoringSabtain Ahmad, Thomas Schneidergruber, Ivona Brandic, Johannes Scholz. 365-379 [doi]