Towards An Approach to Identify Divergences in Hardware Designs for HPC Workloads
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Popovici, Doru Thom, Vega, Mario, Ioannou, Angelos, Chaix, Fabien, Mosuli, Dania, Reasoner, Blair, Nguyen, Tan, Yang, Xiaokun, Shalf, John |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Educating for Hardware Specialization in the Chiplet Era: A Path for the HPC Community
par: Yoshii, Kazutomo, et autres
Publié: (2024)
par: Yoshii, Kazutomo, et autres
Publié: (2024)
Towards Efficient Neuro-Symbolic AI: From Workload Characterization to Hardware Architecture
par: Wan, Zishen, et autres
Publié: (2024)
par: Wan, Zishen, et autres
Publié: (2024)
Multi-Objective Hardware-Mapping Co-Optimisation for Multi-DNN Workloads on Chiplet-based Accelerators
par: Das, Abhijit, et autres
Publié: (2022)
par: Das, Abhijit, et autres
Publié: (2022)
Towards Efficient IMC Accelerator Design Through Joint Hardware-Workload Co-optimization
par: Krestinskaya, Olga, et autres
Publié: (2024)
par: Krestinskaya, Olga, et autres
Publié: (2024)
Toward Open-Source Chiplets for HPC and AI: Occamy and Beyond
par: Scheffler, Paul, et autres
Publié: (2025)
par: Scheffler, Paul, et autres
Publié: (2025)
ControlPULP: A RISC-V On-Chip Parallel Power Controller for Many-Core HPC Processors with FPGA-Based Hardware-In-The-Loop Power and Thermal Emulation
par: Ottaviano, Alessandro, et autres
Publié: (2023)
par: Ottaviano, Alessandro, et autres
Publié: (2023)
Workload Characterization for Branch Predictability
par: Vikas, FNU, et autres
Publié: (2025)
par: Vikas, FNU, et autres
Publié: (2025)
SLTarch: Towards Scalable Point-Based Neural Rendering by Taming Workload Imbalance and Memory Irregularity
par: Li, Xingyang, et autres
Publié: (2025)
par: Li, Xingyang, et autres
Publié: (2025)
Towards Efficient LUT-based PIM: A Scalable and Low-Power Approach for Modern Workloads
par: Khabbazan, Bahareh, et autres
Publié: (2025)
par: Khabbazan, Bahareh, et autres
Publié: (2025)
Cocco: Hardware-Mapping Co-Exploration towards Memory Capacity-Communication Optimization
par: Tan, Zhanhong, et autres
Publié: (2024)
par: Tan, Zhanhong, et autres
Publié: (2024)
Towards the Certification of Hybrid Architectures: Analysing Interference on Hardware Accelerators through PML
par: Lesage, Benjamin, et autres
Publié: (2024)
par: Lesage, Benjamin, et autres
Publié: (2024)
Generic and ML Workloads in an HPC Datacenter: Node Energy, Job Failures, and Node-Job Analysis
par: Chu, Xiaoyu, et autres
Publié: (2024)
par: Chu, Xiaoyu, et autres
Publié: (2024)
Affordable HPC: Leveraging Small Clusters for Big Data and Graph Computing
par: Wu, Ruilong, et autres
Publié: (2024)
par: Wu, Ruilong, et autres
Publié: (2024)
Energy-Efficient FPGA Framework for Non-Quantized Convolutional Neural Networks
par: Athanasiadis, Angelos, et autres
Publié: (2025)
par: Athanasiadis, Angelos, et autres
Publié: (2025)
A Survey on Deep Learning Hardware Accelerators for Heterogeneous HPC Platforms
par: Silvano, Cristina, et autres
Publié: (2023)
par: Silvano, Cristina, et autres
Publié: (2023)
Architectural Classification of XR Workloads: Cross-Layer Archetypes and Implications
par: Shi, Xinyu, et autres
Publié: (2026)
par: Shi, Xinyu, et autres
Publié: (2026)
Allspark: Workload Orchestration for Visual Transformers on Processing In-Memory Systems
par: Ge, Mengke, et autres
Publié: (2024)
par: Ge, Mengke, et autres
Publié: (2024)
Towards LLM-based Root Cause Analysis of Hardware Design Failures
par: Qiu, Siyu, et autres
Publié: (2025)
par: Qiu, Siyu, et autres
Publié: (2025)
Nexus Machine: An Active Message Inspired Reconfigurable Architecture for Irregular Workloads
par: Juneja, Rohan, et autres
Publié: (2025)
par: Juneja, Rohan, et autres
Publié: (2025)
Communication Characterization of AI Workloads for Large-scale Multi-chiplet Accelerators
par: Musavi, Mariam, et autres
Publié: (2024)
par: Musavi, Mariam, et autres
Publié: (2024)
TROOP: At-the-Roofline Performance for Vector Processors on Low Operational Intensity Workloads
par: Purayil, Navaneeth Kunhi, et autres
Publié: (2025)
par: Purayil, Navaneeth Kunhi, et autres
Publié: (2025)
Calibrating DRAMPower Model for HPC: A Runtime Perspective from Real-Time Measurements
par: Shi, Xinyu, et autres
Publié: (2024)
par: Shi, Xinyu, et autres
Publié: (2024)
Sustainable Hardware Specialization
par: Dangi, Pranav, et autres
Publié: (2024)
par: Dangi, Pranav, et autres
Publié: (2024)
Workload-Aware Hardware Accelerator Mining for Distributed Deep Learning Training
par: Adnan, Muhammad, et autres
Publié: (2024)
par: Adnan, Muhammad, et autres
Publié: (2024)
EnergAIzer: Fast and Accurate GPU Power Estimation Framework for AI Workloads
par: Lee, Kyungmi, et autres
Publié: (2026)
par: Lee, Kyungmi, et autres
Publié: (2026)
Messaging-based Adaptive Vector Computing (MAVeC) Accelerator for AI Workloads
par: Chowdhury, Md. Rownak Hossain, et autres
Publié: (2024)
par: Chowdhury, Md. Rownak Hossain, et autres
Publié: (2024)
elasticAI.explorer: Towards a Unified End-to-End Framework for Hardware-Aware Neural Architecture Search
par: Maman, Natalie, et autres
Publié: (2026)
par: Maman, Natalie, et autres
Publié: (2026)
Characterization of Real Communication Patterns and Congestion Dynamics in HPC Interconnection Networks
par: de La Rosa, Miguel Sánchez, et autres
Publié: (2026)
par: de La Rosa, Miguel Sánchez, et autres
Publié: (2026)
CIMinus: Empowering Sparse DNN Workloads Modeling and Exploration on SRAM-based CIM Architectures
par: Qi, Yingjie, et autres
Publié: (2025)
par: Qi, Yingjie, et autres
Publié: (2025)
Mapping Space Exploration for Multi-Chiplet Accelerators Targeting LLM Inference Serving Workloads
par: Li, Boyu, et autres
Publié: (2025)
par: Li, Boyu, et autres
Publié: (2025)
Apple vs. Oranges: Evaluating the Apple Silicon M-Series SoCs for HPC Performance and Efficiency
par: Hübner, Paul, et autres
Publié: (2025)
par: Hübner, Paul, et autres
Publié: (2025)
MERE: Hardware-Software Co-Design for Masking Cache Miss Latency in Embedded Processors
par: You, Dean, et autres
Publié: (2025)
par: You, Dean, et autres
Publié: (2025)
CoroAMU: Unleashing Memory-Driven Coroutines through Latency-Aware Decoupled Operations
par: Jiang, Zhuolun, et autres
Publié: (2025)
par: Jiang, Zhuolun, et autres
Publié: (2025)
Workload-Aware Early-Stage Power Delivery Network Optimization via Architectural Power Traces
par: Hayes, Oran, et autres
Publié: (2026)
par: Hayes, Oran, et autres
Publié: (2026)
3D-TrIM: A Memory-Efficient Spatial Computing Architecture for Convolution Workloads
par: Sestito, Cristian, et autres
Publié: (2025)
par: Sestito, Cristian, et autres
Publié: (2025)
HCiM: ADC-Less Hybrid Analog-Digital Compute in Memory Accelerator for Deep Learning Workloads
par: Negi, Shubham, et autres
Publié: (2024)
par: Negi, Shubham, et autres
Publié: (2024)
Spatzformer: An Efficient Reconfigurable Dual-Core RISC-V V Cluster for Mixed Scalar-Vector Workloads
par: Perotti, Matteo, et autres
Publié: (2024)
par: Perotti, Matteo, et autres
Publié: (2024)
THERMOS: Thermally-Aware Multi-Objective Scheduling of AI Workloads on Heterogeneous Multi-Chiplet PIM Architectures
par: Kanani, Alish, et autres
Publié: (2025)
par: Kanani, Alish, et autres
Publié: (2025)
Analyzing and Improving Hardware Modeling of Accel-Sim
par: Huerta, Rodrigo, et autres
Publié: (2024)
par: Huerta, Rodrigo, et autres
Publié: (2024)
Hardware and software build flow with SoCMake
par: Pejašinović, Risto, et autres
Publié: (2025)
par: Pejašinović, Risto, et autres
Publié: (2025)
Documents similaires
-
Educating for Hardware Specialization in the Chiplet Era: A Path for the HPC Community
par: Yoshii, Kazutomo, et autres
Publié: (2024) -
Towards Efficient Neuro-Symbolic AI: From Workload Characterization to Hardware Architecture
par: Wan, Zishen, et autres
Publié: (2024) -
Multi-Objective Hardware-Mapping Co-Optimisation for Multi-DNN Workloads on Chiplet-based Accelerators
par: Das, Abhijit, et autres
Publié: (2022) -
Towards Efficient IMC Accelerator Design Through Joint Hardware-Workload Co-optimization
par: Krestinskaya, Olga, et autres
Publié: (2024) -
Toward Open-Source Chiplets for HPC and AI: Occamy and Beyond
par: Scheffler, Paul, et autres
Publié: (2025)