Abstract is missing.
- Failures in Large-Scale Systems: Insights from the FieldSudhanva Gurumurthi. 1 [doi]
- A Principled Approach to HPC Event MonitoringAlireza Goudarzi, Dorian C. Arnold, Darko Stefanovic, Kurt B. Ferreira, Guy Feldman. 3-10 [doi]
- LogDiver: A Tool for Measuring Resilience of Extreme-Scale Systems and ApplicationsCatello Di Martino, Saurabh Jha, William Kramer, Zbigniew T. Kalbarczyk, Ravishankar K. Iyer. 11-18 [doi]
- Resilient Matrix Multiplication of Hierarchical Semi-Separable MatricesBrian Austin, Eric Roman, Xiaoye Li. 19-26 [doi]
- Voltage Overscaling Algorithms for Energy-Efficient Workflow Computations With Timing ErrorsAurélien Cavelan, Yves Robert, Hongyang Sun, Frédéric Vivien. 27-34 [doi]
- Empirical Studies of the Soft Error Susceptibility ofSorting Algorithms to Statistical Fault InjectionQiang Guan, Nathan DeBardeleben, Sean Blanchard, Song Fu. 35-40 [doi]
- Evolving the Message Passing Programming Model via a Fault-Tolerant, Object-oriented Transport LayerJeremiah J. Wilke, Keita Teranishi, Janine C. Bennett, Hemanth Kolla, David S. Hollman, Nicole Slattengren. 41-46 [doi]
- How Much SSD Is Useful for Resilience in SupercomputersAiman Fang, Andrew A. Chien. 47-54 [doi]
- The Path to Exascale: Code Optimizations and Hardening Solutions ReliabilityDaniel Alfonso Gonçalves de Oliveira, Laércio Lima Pilla, Caio B. Lunardi, Luigi Carro, Philippe O. A. Navaux, Paolo Rech. 55-62 [doi]
- Transient Fault Resilient QR Factorization on GPUsFelix Loh, Parameswaran Ramanathan, Kewal K. Saluja. 63-70 [doi]