Design in Tiles: Automating GEMM Deployment on Tile-Based Many-PE Accelerators
Fuente:
arXiv
Salvato in:
| Autori principali: | Shen, Aofeng, Zhang, Chi, Budanaz, Yakup, Calotoiu, Alexandru, Hoefler, Torsten, Benini, Luca |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Can Asymmetric Tile Buffering Be Beneficial?
di: Wang, Chengyue, et al.
Pubblicazione: (2025)
di: Wang, Chengyue, et al.
Pubblicazione: (2025)
Optimizing Offload Performance in Heterogeneous MPSoCs
di: Colagrande, Luca, et al.
Pubblicazione: (2024)
di: Colagrande, Luca, et al.
Pubblicazione: (2024)
Taming Offload Overheads in a Massively Parallel Open-Source RISC-V MPSoC: Analysis and Optimization
di: Colagrande, Luca, et al.
Pubblicazione: (2025)
di: Colagrande, Luca, et al.
Pubblicazione: (2025)
TeraPool: A Physical Design Aware, 1024 RISC-V Cores Shared-L1-Memory Scaled-up Cluster Design with High Bandwidth Main Memory Link
di: Zhang, Yichao, et al.
Pubblicazione: (2026)
di: Zhang, Yichao, et al.
Pubblicazione: (2026)
A Lightweight High-Throughput Collective-Capable NoC for Large-Scale ML Accelerators
di: Colagrande, Luca, et al.
Pubblicazione: (2026)
di: Colagrande, Luca, et al.
Pubblicazione: (2026)
Towards Specialized Supercomputers for Climate Sciences: Computational Requirements of the Icosahedral Nonhydrostatic Weather and Climate Model
di: Hoefler, Torsten, et al.
Pubblicazione: (2024)
di: Hoefler, Torsten, et al.
Pubblicazione: (2024)
TCDM Burst Access: Breaking the Bandwidth Barrier in Shared-L1 RVV Clusters Beyond 1000 FPUs
di: Shen, Diyou, et al.
Pubblicazione: (2025)
di: Shen, Diyou, et al.
Pubblicazione: (2025)
MemPool Flavors: Between Versatility and Specialization in a RISC-V Manycore Cluster
di: Mazzola, Sergio, et al.
Pubblicazione: (2025)
di: Mazzola, Sergio, et al.
Pubblicazione: (2025)
TAPA-CS: Enabling Scalable Accelerator Design on Distributed HBM-FPGAs
di: Prakriya, Neha, et al.
Pubblicazione: (2023)
di: Prakriya, Neha, et al.
Pubblicazione: (2023)
MATCHA: Efficient Deployment of Deep Neural Networks on Multi-Accelerator Heterogeneous Edge SoCs
di: Russo, Enrico, et al.
Pubblicazione: (2026)
di: Russo, Enrico, et al.
Pubblicazione: (2026)
TeraPool-SDR: An 1.89TOPS 1024 RV-Cores 4MiB Shared-L1 Cluster for Next-Generation Open-Source Software-Defined Radios
di: Zhang, Yichao, et al.
Pubblicazione: (2024)
di: Zhang, Yichao, et al.
Pubblicazione: (2024)
RailX: A Flexible, Scalable, and Low-Cost Network Architecture for Hyper-Scale LLM Training Systems
di: Feng, Yinxiao, et al.
Pubblicazione: (2025)
di: Feng, Yinxiao, et al.
Pubblicazione: (2025)
MAC-DO: An Efficient Output-Stationary GEMM Accelerator for CNNs Using DRAM Technology
di: Jeong, Minki, et al.
Pubblicazione: (2022)
di: Jeong, Minki, et al.
Pubblicazione: (2022)
A Reliable, Time-Predictable Heterogeneous SoC for AI-Enhanced Mixed-Criticality Edge Applications
di: Garofalo, Angelo, et al.
Pubblicazione: (2025)
di: Garofalo, Angelo, et al.
Pubblicazione: (2025)
DeepStack: Scalable and Accurate Design Space Exploration for Distributed 3D-Stacked AI Accelerators
di: Mo, Zhiwen, et al.
Pubblicazione: (2026)
di: Mo, Zhiwen, et al.
Pubblicazione: (2026)
Simultaneous Many-Row Activation in Off-the-Shelf DRAM Chips: Experimental Characterization and Analysis
di: Yuksel, Ismail Emir, et al.
Pubblicazione: (2024)
di: Yuksel, Ismail Emir, et al.
Pubblicazione: (2024)
FlexStep: Enabling Flexible Error Detection in Multi/Many-core Real-time Systems
di: Wang, Tinglue, et al.
Pubblicazione: (2025)
di: Wang, Tinglue, et al.
Pubblicazione: (2025)
PULSAR: Simultaneous Many-Row Activation for Reliable and High-Performance Computing in Off-the-Shelf DRAM Chips
di: Yuksel, Ismail Emir, et al.
Pubblicazione: (2023)
di: Yuksel, Ismail Emir, et al.
Pubblicazione: (2023)
Sparse MTTKRP Acceleration for Tensor Decomposition on GPU
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2024)
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2024)
Leveraging SIMD for Accelerating Large-number Arithmetic
di: Das, Subhrajit, et al.
Pubblicazione: (2026)
di: Das, Subhrajit, et al.
Pubblicazione: (2026)
Accelerating Sparse DNNs Based on Tiled GEMM
di: Guo, Cong, et al.
Pubblicazione: (2024)
di: Guo, Cong, et al.
Pubblicazione: (2024)
Accelerating Triangle Counting with Real Processing-in-Memory Systems
di: Asquini, Lorenzo, et al.
Pubblicazione: (2025)
di: Asquini, Lorenzo, et al.
Pubblicazione: (2025)
Balanced Data Placement for GEMV Acceleration with Processing-In-Memory
di: Ibrahim, Mohamed Assem, et al.
Pubblicazione: (2024)
di: Ibrahim, Mohamed Assem, et al.
Pubblicazione: (2024)
Accelerating Data Chunking in Deduplication Systems using Vector Instructions
di: Udayashankar, Sreeharsha, et al.
Pubblicazione: (2025)
di: Udayashankar, Sreeharsha, et al.
Pubblicazione: (2025)
Accelerating MoE with Dynamic In-Switch Computing on Multi-GPUs
di: Zhang, Qijun, et al.
Pubblicazione: (2026)
di: Zhang, Qijun, et al.
Pubblicazione: (2026)
Efficient Edge AI: Deploying Convolutional Neural Networks on FPGA with the Gemmini Accelerator
di: Peccia, Federico Nicolas, et al.
Pubblicazione: (2024)
di: Peccia, Federico Nicolas, et al.
Pubblicazione: (2024)
A Heterogeneous Chiplet Architecture for Accelerating End-to-End Transformer Models
di: Sharma, Harsh, et al.
Pubblicazione: (2023)
di: Sharma, Harsh, et al.
Pubblicazione: (2023)
Application Experiences on a GPU-Accelerated Arm-based HPC Testbed
di: Elwasif, Wael, et al.
Pubblicazione: (2022)
di: Elwasif, Wael, et al.
Pubblicazione: (2022)
Workload-Aware Hardware Accelerator Mining for Distributed Deep Learning Training
di: Adnan, Muhammad, et al.
Pubblicazione: (2024)
di: Adnan, Muhammad, et al.
Pubblicazione: (2024)
NasZip: Software and Hardware Co-Design to Accelerate Approximate Nearest Neighbor Search with DIMM-Based Near-Data Processing
di: Zou, Cheng, et al.
Pubblicazione: (2026)
di: Zou, Cheng, et al.
Pubblicazione: (2026)
Automated Deep Neural Network Inference Partitioning for Distributed Embedded Systems
di: Kreß, Fabian, et al.
Pubblicazione: (2024)
di: Kreß, Fabian, et al.
Pubblicazione: (2024)
FLEX: Leveraging FPGA-CPU Synergy for Mixed-Cell-Height Legalization Acceleration
di: Liu, Xingyu, et al.
Pubblicazione: (2025)
di: Liu, Xingyu, et al.
Pubblicazione: (2025)
Generic and ML Workloads in an HPC Datacenter: Node Energy, Job Failures, and Node-Job Analysis
di: Chu, Xiaoyu, et al.
Pubblicazione: (2024)
di: Chu, Xiaoyu, et al.
Pubblicazione: (2024)
An Evaluation and Comparison of GPU Hardware and Solver Libraries for Accelerating the OPM Flow Reservoir Simulator
di: Qiu, Tong Dong, et al.
Pubblicazione: (2023)
di: Qiu, Tong Dong, et al.
Pubblicazione: (2023)
MVDRAM: Enabling GeMV Execution in Unmodified DRAM for Low-Bit LLM Acceleration
di: Kubo, Tatsuya, et al.
Pubblicazione: (2025)
di: Kubo, Tatsuya, et al.
Pubblicazione: (2025)
CMDS: Cross-layer Dataflow Optimization for DNN Accelerators Exploiting Multi-bank Memories
di: Shi, Man, et al.
Pubblicazione: (2024)
di: Shi, Man, et al.
Pubblicazione: (2024)
DiP: A Scalable, Energy-Efficient Systolic Array for Matrix Multiplication Acceleration
di: Abdelmaksoud, Ahmed J., et al.
Pubblicazione: (2024)
di: Abdelmaksoud, Ahmed J., et al.
Pubblicazione: (2024)
EDEA: Efficient Dual-Engine Accelerator for Depthwise Separable Convolution with Direct Data Transfer
di: Chen, Yi, et al.
Pubblicazione: (2025)
di: Chen, Yi, et al.
Pubblicazione: (2025)
DP-HLS: A High-Level Synthesis Framework for Accelerating Dynamic Programming Algorithms in Bioinformatics
di: Cao, Yingqi, et al.
Pubblicazione: (2024)
di: Cao, Yingqi, et al.
Pubblicazione: (2024)
CCSS: Hardware-Accelerated RTL Simulation with Fast Combinational Logic Computing and Sequential Logic Synchronization
di: Feng, Weigang, et al.
Pubblicazione: (2025)
di: Feng, Weigang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Can Asymmetric Tile Buffering Be Beneficial?
di: Wang, Chengyue, et al.
Pubblicazione: (2025) -
Optimizing Offload Performance in Heterogeneous MPSoCs
di: Colagrande, Luca, et al.
Pubblicazione: (2024) -
Taming Offload Overheads in a Massively Parallel Open-Source RISC-V MPSoC: Analysis and Optimization
di: Colagrande, Luca, et al.
Pubblicazione: (2025) -
TeraPool: A Physical Design Aware, 1024 RISC-V Cores Shared-L1-Memory Scaled-up Cluster Design with High Bandwidth Main Memory Link
di: Zhang, Yichao, et al.
Pubblicazione: (2026) -
A Lightweight High-Throughput Collective-Capable NoC for Large-Scale ML Accelerators
di: Colagrande, Luca, et al.
Pubblicazione: (2026)