Execution-Centric Characterization of FP8 Matrix Cores, Asynchronous Execution, and Structured Sparsity on AMD MI300A
Fuente:
arXiv
Salvato in:
| Autori principali: | Jarmusch, Aaron, Vitz, Connor, Chandrasekaran, Sunita |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Microbenchmark-Driven Analytical Performance Modeling Across Modern GPU Architectures
di: Jarmusch, Aaron, et al.
Pubblicazione: (2026)
di: Jarmusch, Aaron, et al.
Pubblicazione: (2026)
Kitsune: Enabling Dataflow Execution on GPUs
di: Davies, Michael, et al.
Pubblicazione: (2025)
di: Davies, Michael, et al.
Pubblicazione: (2025)
Achieving Dependability of AI Execution with Radiation Hardened Processors
di: Taquichiri, Carlos Rafael Tordoya, et al.
Pubblicazione: (2025)
di: Taquichiri, Carlos Rafael Tordoya, et al.
Pubblicazione: (2025)
Data-aware Dynamic Execution of Irregular Workloads on Heterogeneous Systems
di: Bai, Zhenyu, et al.
Pubblicazione: (2025)
di: Bai, Zhenyu, et al.
Pubblicazione: (2025)
MVDRAM: Enabling GeMV Execution in Unmodified DRAM for Low-Bit LLM Acceleration
di: Kubo, Tatsuya, et al.
Pubblicazione: (2025)
di: Kubo, Tatsuya, et al.
Pubblicazione: (2025)
Lit Silicon: A Case Where Thermal Imbalance Couples Concurrent Execution in Multiple GPUs
di: Kurzynski, Marco, et al.
Pubblicazione: (2025)
di: Kurzynski, Marco, et al.
Pubblicazione: (2025)
Compiler Support for Speculation in Decoupled Access/Execute Architectures
di: Szafarczyk, Robert, et al.
Pubblicazione: (2025)
di: Szafarczyk, Robert, et al.
Pubblicazione: (2025)
Fine-Grained Power and Energy Attribution on AMD GPU/APU-Based Exascale Nodes
di: McDaniel, Adam, et al.
Pubblicazione: (2026)
di: McDaniel, Adam, et al.
Pubblicazione: (2026)
Characterizing CPU-Induced Slowdowns in Multi-GPU LLM Inference
di: Chung, Euijun, et al.
Pubblicazione: (2026)
di: Chung, Euijun, et al.
Pubblicazione: (2026)
Tascade: Hardware Support for Atomic-free, Asynchronous and Efficient Reduction Trees
di: Orenes-Vera, Marcelo, et al.
Pubblicazione: (2023)
di: Orenes-Vera, Marcelo, et al.
Pubblicazione: (2023)
Memory-Centric Computing: Recent Advances in Processing-in-DRAM
di: Mutlu, Onur, et al.
Pubblicazione: (2024)
di: Mutlu, Onur, et al.
Pubblicazione: (2024)
Memory-Centric Computing: Solving Computing's Memory Problem
di: Mutlu, Onur, et al.
Pubblicazione: (2025)
di: Mutlu, Onur, et al.
Pubblicazione: (2025)
FlexVector: A SpMM Vector Processor with Flexible VRF for GCNs on Varying-Sparsity Graphs
di: Li, Bohan, et al.
Pubblicazione: (2026)
di: Li, Bohan, et al.
Pubblicazione: (2026)
SpArch: Efficient Architecture for Sparse Matrix Multiplication
di: Zhang, Zhekai, et al.
Pubblicazione: (2020)
di: Zhang, Zhekai, et al.
Pubblicazione: (2020)
BlockAMC: Scalable In-Memory Analog Matrix Computing for Solving Linear Systems
di: Pan, Lunshuai, et al.
Pubblicazione: (2024)
di: Pan, Lunshuai, et al.
Pubblicazione: (2024)
DiP: A Scalable, Energy-Efficient Systolic Array for Matrix Multiplication Acceleration
di: Abdelmaksoud, Ahmed J., et al.
Pubblicazione: (2024)
di: Abdelmaksoud, Ahmed J., et al.
Pubblicazione: (2024)
Accelerated Execution of Bayesian Neural Networks using a Single Probabilistic Forward Pass and Code Generation
di: Klein, Bernhard, et al.
Pubblicazione: (2025)
di: Klein, Bernhard, et al.
Pubblicazione: (2025)
MANOJAVAM: A Scalable, Unified FPGA Accelerator for Matrix Multiplication and Singular Value Decomposition in Principal Component Analysis
di: Ramasubramanian, Srivaths, et al.
Pubblicazione: (2026)
di: Ramasubramanian, Srivaths, et al.
Pubblicazione: (2026)
A New Family of Thread to Core Allocation Policies for an SMT ARM Processor
di: Navarro, Marta, et al.
Pubblicazione: (2025)
di: Navarro, Marta, et al.
Pubblicazione: (2025)
Topology-Aware Virtualization over Inter-Core Connected Neural Processing Units
di: Feng, Dahu, et al.
Pubblicazione: (2025)
di: Feng, Dahu, et al.
Pubblicazione: (2025)
Functionally-Complete Boolean Logic in Real DRAM Chips: Experimental Characterization and Analysis
di: Yuksel, Ismail Emir, et al.
Pubblicazione: (2024)
di: Yuksel, Ismail Emir, et al.
Pubblicazione: (2024)
Simultaneous Many-Row Activation in Off-the-Shelf DRAM Chips: Experimental Characterization and Analysis
di: Yuksel, Ismail Emir, et al.
Pubblicazione: (2024)
di: Yuksel, Ismail Emir, et al.
Pubblicazione: (2024)
SpeedMalloc: Improving Multi-threaded Applications via a Lightweight Core for Memory Allocation
di: Li, Ruihao, et al.
Pubblicazione: (2025)
di: Li, Ruihao, et al.
Pubblicazione: (2025)
Application Experiences on a GPU-Accelerated Arm-based HPC Testbed
di: Elwasif, Wael, et al.
Pubblicazione: (2022)
di: Elwasif, Wael, et al.
Pubblicazione: (2022)
Chopper: A Multi-Level GPU Characterization Tool & Derived Insights Into LLM Training Inefficiency
di: Kurzynski, Marco, et al.
Pubblicazione: (2025)
di: Kurzynski, Marco, et al.
Pubblicazione: (2025)
RevaMp3D: Architecting the Processor Core and Cache Hierarchy for Systems with Monolithically-Integrated Logic and Memory
di: Ghiasi, Nika Mansouri, et al.
Pubblicazione: (2022)
di: Ghiasi, Nika Mansouri, et al.
Pubblicazione: (2022)
IOMMU Support for Virtual-Address Remote DMA in an ARMv8 environment
di: Psistakis, Antonis
Pubblicazione: (2025)
di: Psistakis, Antonis
Pubblicazione: (2025)
HieraSparse: Hierarchical Semi-Structured Sparse KV Attention
di: Wang, Haoxuan, et al.
Pubblicazione: (2026)
di: Wang, Haoxuan, et al.
Pubblicazione: (2026)
TeraPool-SDR: An 1.89TOPS 1024 RV-Cores 4MiB Shared-L1 Cluster for Next-Generation Open-Source Software-Defined Radios
di: Zhang, Yichao, et al.
Pubblicazione: (2024)
di: Zhang, Yichao, et al.
Pubblicazione: (2024)
TeraPool: A Physical Design Aware, 1024 RISC-V Cores Shared-L1-Memory Scaled-up Cluster Design with High Bandwidth Main Memory Link
di: Zhang, Yichao, et al.
Pubblicazione: (2026)
di: Zhang, Yichao, et al.
Pubblicazione: (2026)
Dissecting the NVIDIA Blackwell Architecture with Microbenchmarks
di: Jarmusch, Aaron, et al.
Pubblicazione: (2025)
di: Jarmusch, Aaron, et al.
Pubblicazione: (2025)
TreeVQA: A Tree-Structured Execution Framework for Shot Reduction in Variational Quantum Algorithms
di: Hou, Yuewen, et al.
Pubblicazione: (2025)
di: Hou, Yuewen, et al.
Pubblicazione: (2025)
GPU-Augmented OLAP Execution Engine: GPU Offloading
di: Chang, Ilsun
Pubblicazione: (2025)
di: Chang, Ilsun
Pubblicazione: (2025)
Taming Asynchronous CPU-GPU Coupling for Frequency-aware Latency Estimation on Mobile Edge
di: Chen, Jiesong, et al.
Pubblicazione: (2026)
di: Chen, Jiesong, et al.
Pubblicazione: (2026)
Vector-Centric Machine Learning Systems: A Cross-Stack Approach
di: Jiang, Wenqi
Pubblicazione: (2025)
di: Jiang, Wenqi
Pubblicazione: (2025)
TT-Edge: A Hardware-Software Co-Design for Energy-Efficient Tensor-Train Decomposition on Edge AI
di: Kwak, Hyunseok, et al.
Pubblicazione: (2025)
di: Kwak, Hyunseok, et al.
Pubblicazione: (2025)
The DEEP-ER project: I/O and resiliency extensions for the Cluster-Booster architecture
di: Kreuzer, Anke, et al.
Pubblicazione: (2019)
di: Kreuzer, Anke, et al.
Pubblicazione: (2019)
An Evaluation and Comparison of GPU Hardware and Solver Libraries for Accelerating the OPM Flow Reservoir Simulator
di: Qiu, Tong Dong, et al.
Pubblicazione: (2023)
di: Qiu, Tong Dong, et al.
Pubblicazione: (2023)
SLIM: A Heterogeneous Accelerator for Edge Inference of Sparse Large Language Model via Adaptive Thresholding
di: Xu, Weihong, et al.
Pubblicazione: (2025)
di: Xu, Weihong, et al.
Pubblicazione: (2025)
COMET: A Framework for Modeling Compound Operation Dataflows with Explicit Collectives
di: Negi, Shubham, et al.
Pubblicazione: (2025)
di: Negi, Shubham, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Microbenchmark-Driven Analytical Performance Modeling Across Modern GPU Architectures
di: Jarmusch, Aaron, et al.
Pubblicazione: (2026) -
Kitsune: Enabling Dataflow Execution on GPUs
di: Davies, Michael, et al.
Pubblicazione: (2025) -
Achieving Dependability of AI Execution with Radiation Hardened Processors
di: Taquichiri, Carlos Rafael Tordoya, et al.
Pubblicazione: (2025) -
Data-aware Dynamic Execution of Irregular Workloads on Heterogeneous Systems
di: Bai, Zhenyu, et al.
Pubblicazione: (2025) -
MVDRAM: Enabling GeMV Execution in Unmodified DRAM for Low-Bit LLM Acceleration
di: Kubo, Tatsuya, et al.
Pubblicazione: (2025)