HARP: A Taxonomy for Heterogeneous and Hierarchical Processors for Mixed-reuse Workloads
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Garg, Raveesh, Pellauer, Michael, Krishna, Tushar |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CELLO: Co-designing Schedule and Hybrid Implicit/Explicit Buffer for Complex Tensor Reuse
par: Garg, Raveesh, et autres
Publié: (2023)
par: Garg, Raveesh, et autres
Publié: (2023)
Data-aware Dynamic Execution of Irregular Workloads on Heterogeneous Systems
par: Bai, Zhenyu, et autres
Publié: (2025)
par: Bai, Zhenyu, et autres
Publié: (2025)
A Reliable, Time-Predictable Heterogeneous SoC for AI-Enhanced Mixed-Criticality Edge Applications
par: Garofalo, Angelo, et autres
Publié: (2025)
par: Garofalo, Angelo, et autres
Publié: (2025)
Achieving Dependability of AI Execution with Radiation Hardened Processors
par: Taquichiri, Carlos Rafael Tordoya, et autres
Publié: (2025)
par: Taquichiri, Carlos Rafael Tordoya, et autres
Publié: (2025)
A New Family of Thread to Core Allocation Policies for an SMT ARM Processor
par: Navarro, Marta, et autres
Publié: (2025)
par: Navarro, Marta, et autres
Publié: (2025)
Workload-Aware Hardware Accelerator Mining for Distributed Deep Learning Training
par: Adnan, Muhammad, et autres
Publié: (2024)
par: Adnan, Muhammad, et autres
Publié: (2024)
FlexVector: A SpMM Vector Processor with Flexible VRF for GCNs on Varying-Sparsity Graphs
par: Li, Bohan, et autres
Publié: (2026)
par: Li, Bohan, et autres
Publié: (2026)
Generic and ML Workloads in an HPC Datacenter: Node Energy, Job Failures, and Node-Job Analysis
par: Chu, Xiaoyu, et autres
Publié: (2024)
par: Chu, Xiaoyu, et autres
Publié: (2024)
Implementation and Evaluation of GBDI Memory Compression Algorithm Using C/C++ on a Broader Range of Workloads
par: Aina, Adeyemi
Publié: (2025)
par: Aina, Adeyemi
Publié: (2025)
RevaMp3D: Architecting the Processor Core and Cache Hierarchy for Systems with Monolithically-Integrated Logic and Memory
par: Ghiasi, Nika Mansouri, et autres
Publié: (2022)
par: Ghiasi, Nika Mansouri, et autres
Publié: (2022)
A Heterogeneous Chiplet Architecture for Accelerating End-to-End Transformer Models
par: Sharma, Harsh, et autres
Publié: (2023)
par: Sharma, Harsh, et autres
Publié: (2023)
Profiling Concurrent Vision Inference Workloads on NVIDIA Jetson -- Extended
par: Chakraborty, Abhinaba, et autres
Publié: (2025)
par: Chakraborty, Abhinaba, et autres
Publié: (2025)
Optimizing Offload Performance in Heterogeneous MPSoCs
par: Colagrande, Luca, et autres
Publié: (2024)
par: Colagrande, Luca, et autres
Publié: (2024)
Scheduling Techniques of AI Models on Modern Heterogeneous Edge GPU -- A Critical Review
par: Majeed, Ashiyana Abdul, et autres
Publié: (2025)
par: Majeed, Ashiyana Abdul, et autres
Publié: (2025)
Evaluating Rapid Makespan Predictions for Heterogeneous Systems with Programmable Logic
par: Wilhelm, Martin, et autres
Publié: (2025)
par: Wilhelm, Martin, et autres
Publié: (2025)
Enabling Mixed criticality applications for the Versal AI-Engines
par: Sprave, Vincent, et autres
Publié: (2026)
par: Sprave, Vincent, et autres
Publié: (2026)
HgPCN: A Heterogeneous Architecture for E2E Embedded Point Cloud Inference
par: Gao, Yiming, et autres
Publié: (2025)
par: Gao, Yiming, et autres
Publié: (2025)
A Survey of Real-time Scheduling on Accelerator-based Heterogeneous Architecture for Time Critical Applications
par: Zou, An, et autres
Publié: (2025)
par: Zou, An, et autres
Publié: (2025)
HieraSparse: Hierarchical Semi-Structured Sparse KV Attention
par: Wang, Haoxuan, et autres
Publié: (2026)
par: Wang, Haoxuan, et autres
Publié: (2026)
EPOCH: Enabling Preemption Operation for Context Saving in Heterogeneous FPGA Systems
par: Malik, Arsalan Ali, et autres
Publié: (2025)
par: Malik, Arsalan Ali, et autres
Publié: (2025)
SLIM: A Heterogeneous Accelerator for Edge Inference of Sparse Large Language Model via Adaptive Thresholding
par: Xu, Weihong, et autres
Publié: (2025)
par: Xu, Weihong, et autres
Publié: (2025)
XDMA: A Distributed, Extensible DMA Architecture for Layout-Flexible Data Movements in Heterogeneous Multi-Accelerator SoCs
par: Kong, Fanchen, et autres
Publié: (2025)
par: Kong, Fanchen, et autres
Publié: (2025)
FLEX: Leveraging FPGA-CPU Synergy for Mixed-Cell-Height Legalization Acceleration
par: Liu, Xingyu, et autres
Publié: (2025)
par: Liu, Xingyu, et autres
Publié: (2025)
GreenLLM: Disaggregating Large Language Model Serving on Heterogeneous GPUs for Lower Carbon Emissions
par: Shi, Tianyao, et autres
Publié: (2024)
par: Shi, Tianyao, et autres
Publié: (2024)
SpeedMalloc: Improving Multi-threaded Applications via a Lightweight Core for Memory Allocation
par: Li, Ruihao, et autres
Publié: (2025)
par: Li, Ruihao, et autres
Publié: (2025)
LayerDAG: A Layerwise Autoregressive Diffusion Model for Directed Acyclic Graph Generation
par: Li, Mufei, et autres
Publié: (2024)
par: Li, Mufei, et autres
Publié: (2024)
Performance Modeling and Workload Analysis of Distributed Large Language Model Training and Inference
par: Kundu, Joyjit, et autres
Publié: (2024)
par: Kundu, Joyjit, et autres
Publié: (2024)
Kitsune: Enabling Dataflow Execution on GPUs
par: Davies, Michael, et autres
Publié: (2025)
par: Davies, Michael, et autres
Publié: (2025)
Exploring the Efficiency of 3D-Stacked AI Chip Architecture for LLM Inference with Voxel
par: Liu, Yiqi, et autres
Publié: (2026)
par: Liu, Yiqi, et autres
Publié: (2026)
iHAC: A Hybrid Cluster Architecture for Enhanced Performance and Resilience
par: Muntaka, Siddique Abubakr, et autres
Publié: (2026)
par: Muntaka, Siddique Abubakr, et autres
Publié: (2026)
Fine-Grained Power and Energy Attribution on AMD GPU/APU-Based Exascale Nodes
par: McDaniel, Adam, et autres
Publié: (2026)
par: McDaniel, Adam, et autres
Publié: (2026)
A Modern Primer on Processing in Memory
par: Mutlu, Onur, et autres
Publié: (2020)
par: Mutlu, Onur, et autres
Publié: (2020)
The Dawn of Disaggregation and the Coherence Conundrum: A Call for Federated Coherence
par: Hong, Jaewan, et autres
Publié: (2025)
par: Hong, Jaewan, et autres
Publié: (2025)
COMET: A Framework for Modeling Compound Operation Dataflows with Explicit Collectives
par: Negi, Shubham, et autres
Publié: (2025)
par: Negi, Shubham, et autres
Publié: (2025)
DCRA: A Distributed Chiplet-based Reconfigurable Architecture for Irregular Applications
par: Orenes-Vera, Marcelo, et autres
Publié: (2023)
par: Orenes-Vera, Marcelo, et autres
Publié: (2023)
Torrent: A Distributed DMA for Efficient and Flexible Point-to-Multipoint Data Movement
par: Deng, Yunhao, et autres
Publié: (2025)
par: Deng, Yunhao, et autres
Publié: (2025)
LFOC: A Lightweight Fairness-Oriented Cache Clustering Policy for Commodity Multicores
par: García-García, Adrián, et autres
Publié: (2024)
par: García-García, Adrián, et autres
Publié: (2024)
Muchisim: A Simulation Framework for Design Exploration of Multi-Chip Manycore Systems
par: Orenes-Vera, Marcelo, et autres
Publié: (2023)
par: Orenes-Vera, Marcelo, et autres
Publié: (2023)
DiP: A Scalable, Energy-Efficient Systolic Array for Matrix Multiplication Acceleration
par: Abdelmaksoud, Ahmed J., et autres
Publié: (2024)
par: Abdelmaksoud, Ahmed J., et autres
Publié: (2024)
Chopper: A Multi-Level GPU Characterization Tool & Derived Insights Into LLM Training Inefficiency
par: Kurzynski, Marco, et autres
Publié: (2025)
par: Kurzynski, Marco, et autres
Publié: (2025)
Documents similaires
-
CELLO: Co-designing Schedule and Hybrid Implicit/Explicit Buffer for Complex Tensor Reuse
par: Garg, Raveesh, et autres
Publié: (2023) -
Data-aware Dynamic Execution of Irregular Workloads on Heterogeneous Systems
par: Bai, Zhenyu, et autres
Publié: (2025) -
A Reliable, Time-Predictable Heterogeneous SoC for AI-Enhanced Mixed-Criticality Edge Applications
par: Garofalo, Angelo, et autres
Publié: (2025) -
Achieving Dependability of AI Execution with Radiation Hardened Processors
par: Taquichiri, Carlos Rafael Tordoya, et autres
Publié: (2025) -
A New Family of Thread to Core Allocation Policies for an SMT ARM Processor
par: Navarro, Marta, et autres
Publié: (2025)