DeepStack: Scalable and Accurate Design Space Exploration for Distributed 3D-Stacked AI Accelerators
Fuente:
arXiv
Salvato in:
| Autori principali: | Mo, Zhiwen, Li, Guoyu, Chen, Hao Mark, Cheng, Yu, Tang, Zhengju, Wang, Qianzhou, Wang, Lei, Liang, Shuang, Ma, Lingxiao, Zhou, Xianqi, Guo, Yuxiao, Luk, Wayne, Xue, Jilong, Fan, Hongxiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Exploring the Efficiency of 3D-Stacked AI Chip Architecture for LLM Inference with Voxel
di: Liu, Yiqi, et al.
Pubblicazione: (2026)
di: Liu, Yiqi, et al.
Pubblicazione: (2026)
DeFiNES: Enabling Fast Exploration of the Depth-first Scheduling Space for DNN Accelerators through Analytical Modeling
di: Mei, Linyan, et al.
Pubblicazione: (2022)
di: Mei, Linyan, et al.
Pubblicazione: (2022)
Vector-Centric Machine Learning Systems: A Cross-Stack Approach
di: Jiang, Wenqi
Pubblicazione: (2025)
di: Jiang, Wenqi
Pubblicazione: (2025)
TAPA-CS: Enabling Scalable Accelerator Design on Distributed HBM-FPGAs
di: Prakriya, Neha, et al.
Pubblicazione: (2023)
di: Prakriya, Neha, et al.
Pubblicazione: (2023)
MLDSE: Scaling Design Space Exploration Infrastructure for Multi-Level Hardware
di: Qu, Huanyu, et al.
Pubblicazione: (2025)
di: Qu, Huanyu, et al.
Pubblicazione: (2025)
ELK: Exploring the Efficiency of Inter-core Connected AI Chips with Deep Learning Compiler Techniques
di: Liu, Yiqi, et al.
Pubblicazione: (2025)
di: Liu, Yiqi, et al.
Pubblicazione: (2025)
DiP: A Scalable, Energy-Efficient Systolic Array for Matrix Multiplication Acceleration
di: Abdelmaksoud, Ahmed J., et al.
Pubblicazione: (2024)
di: Abdelmaksoud, Ahmed J., et al.
Pubblicazione: (2024)
MANOJAVAM: A Scalable, Unified FPGA Accelerator for Matrix Multiplication and Singular Value Decomposition in Principal Component Analysis
di: Ramasubramanian, Srivaths, et al.
Pubblicazione: (2026)
di: Ramasubramanian, Srivaths, et al.
Pubblicazione: (2026)
Characterizing CPU-Induced Slowdowns in Multi-GPU LLM Inference
di: Chung, Euijun, et al.
Pubblicazione: (2026)
di: Chung, Euijun, et al.
Pubblicazione: (2026)
CCSS: Hardware-Accelerated RTL Simulation with Fast Combinational Logic Computing and Sequential Logic Synchronization
di: Feng, Weigang, et al.
Pubblicazione: (2025)
di: Feng, Weigang, et al.
Pubblicazione: (2025)
NMP-PaK: Near-Memory Processing Acceleration of Scalable De Novo Genome Assembly
di: Kim, Heewoo, et al.
Pubblicazione: (2025)
di: Kim, Heewoo, et al.
Pubblicazione: (2025)
Accelerating MoE with Dynamic In-Switch Computing on Multi-GPUs
di: Zhang, Qijun, et al.
Pubblicazione: (2026)
di: Zhang, Qijun, et al.
Pubblicazione: (2026)
JExplore: Design Space Exploration Tool for Nvidia Jetson Boards
di: Kutukcu, Basar, et al.
Pubblicazione: (2025)
di: Kutukcu, Basar, et al.
Pubblicazione: (2025)
Sparse MTTKRP Acceleration for Tensor Decomposition on GPU
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2024)
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2024)
Leveraging SIMD for Accelerating Large-number Arithmetic
di: Das, Subhrajit, et al.
Pubblicazione: (2026)
di: Das, Subhrajit, et al.
Pubblicazione: (2026)
Muchisim: A Simulation Framework for Design Exploration of Multi-Chip Manycore Systems
di: Orenes-Vera, Marcelo, et al.
Pubblicazione: (2023)
di: Orenes-Vera, Marcelo, et al.
Pubblicazione: (2023)
Accelerating Triangle Counting with Real Processing-in-Memory Systems
di: Asquini, Lorenzo, et al.
Pubblicazione: (2025)
di: Asquini, Lorenzo, et al.
Pubblicazione: (2025)
Balanced Data Placement for GEMV Acceleration with Processing-In-Memory
di: Ibrahim, Mohamed Assem, et al.
Pubblicazione: (2024)
di: Ibrahim, Mohamed Assem, et al.
Pubblicazione: (2024)
Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap
di: Pal, Shagnik, et al.
Pubblicazione: (2025)
di: Pal, Shagnik, et al.
Pubblicazione: (2025)
BlockAMC: Scalable In-Memory Analog Matrix Computing for Solving Linear Systems
di: Pan, Lunshuai, et al.
Pubblicazione: (2024)
di: Pan, Lunshuai, et al.
Pubblicazione: (2024)
Accelerating Data Chunking in Deduplication Systems using Vector Instructions
di: Udayashankar, Sreeharsha, et al.
Pubblicazione: (2025)
di: Udayashankar, Sreeharsha, et al.
Pubblicazione: (2025)
MoE-Hub: Taming Software Complexity for Seamless MoE Overlap with Hardware-Accelerated Communication on Multi-GPU Systems
di: Zhou, Zhuoshan, et al.
Pubblicazione: (2026)
di: Zhou, Zhuoshan, et al.
Pubblicazione: (2026)
Exploration of Cryptocurrency Mining-Specific GPUs in AI Applications: A Case Study of CMP 170HX
di: Kangwei, Xing
Pubblicazione: (2025)
di: Kangwei, Xing
Pubblicazione: (2025)
A Heterogeneous Chiplet Architecture for Accelerating End-to-End Transformer Models
di: Sharma, Harsh, et al.
Pubblicazione: (2023)
di: Sharma, Harsh, et al.
Pubblicazione: (2023)
Application Experiences on a GPU-Accelerated Arm-based HPC Testbed
di: Elwasif, Wael, et al.
Pubblicazione: (2022)
di: Elwasif, Wael, et al.
Pubblicazione: (2022)
Workload-Aware Hardware Accelerator Mining for Distributed Deep Learning Training
di: Adnan, Muhammad, et al.
Pubblicazione: (2024)
di: Adnan, Muhammad, et al.
Pubblicazione: (2024)
Design in Tiles: Automating GEMM Deployment on Tile-Based Many-PE Accelerators
di: Shen, Aofeng, et al.
Pubblicazione: (2025)
di: Shen, Aofeng, et al.
Pubblicazione: (2025)
FLEX: Leveraging FPGA-CPU Synergy for Mixed-Cell-Height Legalization Acceleration
di: Liu, Xingyu, et al.
Pubblicazione: (2025)
di: Liu, Xingyu, et al.
Pubblicazione: (2025)
An Evaluation and Comparison of GPU Hardware and Solver Libraries for Accelerating the OPM Flow Reservoir Simulator
di: Qiu, Tong Dong, et al.
Pubblicazione: (2023)
di: Qiu, Tong Dong, et al.
Pubblicazione: (2023)
MVDRAM: Enabling GeMV Execution in Unmodified DRAM for Low-Bit LLM Acceleration
di: Kubo, Tatsuya, et al.
Pubblicazione: (2025)
di: Kubo, Tatsuya, et al.
Pubblicazione: (2025)
CMDS: Cross-layer Dataflow Optimization for DNN Accelerators Exploiting Multi-bank Memories
di: Shi, Man, et al.
Pubblicazione: (2024)
di: Shi, Man, et al.
Pubblicazione: (2024)
EDEA: Efficient Dual-Engine Accelerator for Depthwise Separable Convolution with Direct Data Transfer
di: Chen, Yi, et al.
Pubblicazione: (2025)
di: Chen, Yi, et al.
Pubblicazione: (2025)
WaferLLM: Large Language Model Inference at Wafer Scale
di: He, Congjie, et al.
Pubblicazione: (2025)
di: He, Congjie, et al.
Pubblicazione: (2025)
DP-HLS: A High-Level Synthesis Framework for Accelerating Dynamic Programming Algorithms in Bioinformatics
di: Cao, Yingqi, et al.
Pubblicazione: (2024)
di: Cao, Yingqi, et al.
Pubblicazione: (2024)
A Survey of Real-time Scheduling on Accelerator-based Heterogeneous Architecture for Time Critical Applications
di: Zou, An, et al.
Pubblicazione: (2025)
di: Zou, An, et al.
Pubblicazione: (2025)
A Lightweight High-Throughput Collective-Capable NoC for Large-Scale ML Accelerators
di: Colagrande, Luca, et al.
Pubblicazione: (2026)
di: Colagrande, Luca, et al.
Pubblicazione: (2026)
SLIM: A Heterogeneous Accelerator for Edge Inference of Sparse Large Language Model via Adaptive Thresholding
di: Xu, Weihong, et al.
Pubblicazione: (2025)
di: Xu, Weihong, et al.
Pubblicazione: (2025)
XDMA: A Distributed, Extensible DMA Architecture for Layout-Flexible Data Movements in Heterogeneous Multi-Accelerator SoCs
di: Kong, Fanchen, et al.
Pubblicazione: (2025)
di: Kong, Fanchen, et al.
Pubblicazione: (2025)
HieraSparse: Hierarchical Semi-Structured Sparse KV Attention
di: Wang, Haoxuan, et al.
Pubblicazione: (2026)
di: Wang, Haoxuan, et al.
Pubblicazione: (2026)
FpgaHub: Fpga-centric Hyper-heterogeneous Computing Platform for Big Data Analytics
di: Wang, Zeke, et al.
Pubblicazione: (2025)
di: Wang, Zeke, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Exploring the Efficiency of 3D-Stacked AI Chip Architecture for LLM Inference with Voxel
di: Liu, Yiqi, et al.
Pubblicazione: (2026) -
DeFiNES: Enabling Fast Exploration of the Depth-first Scheduling Space for DNN Accelerators through Analytical Modeling
di: Mei, Linyan, et al.
Pubblicazione: (2022) -
Vector-Centric Machine Learning Systems: A Cross-Stack Approach
di: Jiang, Wenqi
Pubblicazione: (2025) -
TAPA-CS: Enabling Scalable Accelerator Design on Distributed HBM-FPGAs
di: Prakriya, Neha, et al.
Pubblicazione: (2023) -
MLDSE: Scaling Design Space Exploration Infrastructure for Multi-Level Hardware
di: Qu, Huanyu, et al.
Pubblicazione: (2025)