CMDS: Cross-layer Dataflow Optimization for DNN Accelerators Exploiting Multi-bank Memories
Fuente:
arXiv
Salvato in:
| Autori principali: | Shi, Man, Colleman, Steven, VanDeMieroop, Charlotte, Joseph, Antony, Meijer, Maurice, Dehaene, Wim, Verhelst, Marian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DeFiNES: Enabling Fast Exploration of the Depth-first Scheduling Space for DNN Accelerators through Analytical Modeling
di: Mei, Linyan, et al.
Pubblicazione: (2022)
di: Mei, Linyan, et al.
Pubblicazione: (2022)
XDMA: A Distributed, Extensible DMA Architecture for Layout-Flexible Data Movements in Heterogeneous Multi-Accelerator SoCs
di: Kong, Fanchen, et al.
Pubblicazione: (2025)
di: Kong, Fanchen, et al.
Pubblicazione: (2025)
Torrent: A Distributed DMA for Efficient and Flexible Point-to-Multipoint Data Movement
di: Deng, Yunhao, et al.
Pubblicazione: (2025)
di: Deng, Yunhao, et al.
Pubblicazione: (2025)
Kitsune: Enabling Dataflow Execution on GPUs
di: Davies, Michael, et al.
Pubblicazione: (2025)
di: Davies, Michael, et al.
Pubblicazione: (2025)
SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators
di: Li, Jonathan, et al.
Pubblicazione: (2025)
di: Li, Jonathan, et al.
Pubblicazione: (2025)
Accelerating Recommender Model ETL with a Streaming FPGA-GPU Dataflow
di: Zhu, Yu, et al.
Pubblicazione: (2025)
di: Zhu, Yu, et al.
Pubblicazione: (2025)
Stream: Design Space Exploration of Layer-Fused DNNs on Heterogeneous Dataflow Accelerators
di: Symons, Arne, et al.
Pubblicazione: (2022)
di: Symons, Arne, et al.
Pubblicazione: (2022)
COMET: A Framework for Modeling Compound Operation Dataflows with Explicit Collectives
di: Negi, Shubham, et al.
Pubblicazione: (2025)
di: Negi, Shubham, et al.
Pubblicazione: (2025)
Accelerating Triangle Counting with Real Processing-in-Memory Systems
di: Asquini, Lorenzo, et al.
Pubblicazione: (2025)
di: Asquini, Lorenzo, et al.
Pubblicazione: (2025)
Balanced Data Placement for GEMV Acceleration with Processing-In-Memory
di: Ibrahim, Mohamed Assem, et al.
Pubblicazione: (2024)
di: Ibrahim, Mohamed Assem, et al.
Pubblicazione: (2024)
Efficient Hardware Accelerator Based on Medium Granularity Dataflow for SpTRSV
di: Chen, Qian, et al.
Pubblicazione: (2024)
di: Chen, Qian, et al.
Pubblicazione: (2024)
Survey of Disaggregated Memory: Cross-layer Technique Insights for Next-Generation Datacenters
di: Wang, Jing, et al.
Pubblicazione: (2025)
di: Wang, Jing, et al.
Pubblicazione: (2025)
PIUMA: Programmable Integrated Unified Memory Architecture
di: Aananthakrishnan, Sriram, et al.
Pubblicazione: (2020)
di: Aananthakrishnan, Sriram, et al.
Pubblicazione: (2020)
Towards Fair and Firm Real-Time Scheduling in DNN Multi-Tenant Multi-Accelerator Systems via Reinforcement Learning
di: Russo, Enrico, et al.
Pubblicazione: (2024)
di: Russo, Enrico, et al.
Pubblicazione: (2024)
Memory-Centric Computing: Solving Computing's Memory Problem
di: Mutlu, Onur, et al.
Pubblicazione: (2025)
di: Mutlu, Onur, et al.
Pubblicazione: (2025)
NMP-PaK: Near-Memory Processing Acceleration of Scalable De Novo Genome Assembly
di: Kim, Heewoo, et al.
Pubblicazione: (2025)
di: Kim, Heewoo, et al.
Pubblicazione: (2025)
Accelerating DNA Read Mapping with Digital Processing-in-Memory
di: Ben-Hur, Rotem, et al.
Pubblicazione: (2024)
di: Ben-Hur, Rotem, et al.
Pubblicazione: (2024)
Analyzing a Two-Tier Disaggregated Memory Protection Scheme Based on Memory Replication
di: Volos, Haris, et al.
Pubblicazione: (2025)
di: Volos, Haris, et al.
Pubblicazione: (2025)
DABench-LLM: Standardized and In-Depth Benchmarking of Post-Moore Dataflow AI Accelerators for LLMs
di: Hu, Ziyu, et al.
Pubblicazione: (2025)
di: Hu, Ziyu, et al.
Pubblicazione: (2025)
A Modern Primer on Processing in Memory
di: Mutlu, Onur, et al.
Pubblicazione: (2020)
di: Mutlu, Onur, et al.
Pubblicazione: (2020)
INR-Arch: A Dataflow Architecture and Compiler for Arbitrary-Order Gradient Computations in Implicit Neural Representation Processing
di: Abi-Karam, Stefan, et al.
Pubblicazione: (2023)
di: Abi-Karam, Stefan, et al.
Pubblicazione: (2023)
Sparse MTTKRP Acceleration for Tensor Decomposition on GPU
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2024)
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2024)
Leveraging SIMD for Accelerating Large-number Arithmetic
di: Das, Subhrajit, et al.
Pubblicazione: (2026)
di: Das, Subhrajit, et al.
Pubblicazione: (2026)
Efficient Architecture for RISC-V Vector Memory Access
di: Guan, Hongyi, et al.
Pubblicazione: (2025)
di: Guan, Hongyi, et al.
Pubblicazione: (2025)
Memory-Centric Computing: Recent Advances in Processing-in-DRAM
di: Mutlu, Onur, et al.
Pubblicazione: (2024)
di: Mutlu, Onur, et al.
Pubblicazione: (2024)
Compiler Support for Speculation in Decoupled Access/Execute Architectures
di: Szafarczyk, Robert, et al.
Pubblicazione: (2025)
di: Szafarczyk, Robert, et al.
Pubblicazione: (2025)
Accelerating Data Chunking in Deduplication Systems using Vector Instructions
di: Udayashankar, Sreeharsha, et al.
Pubblicazione: (2025)
di: Udayashankar, Sreeharsha, et al.
Pubblicazione: (2025)
Accelerating MoE with Dynamic In-Switch Computing on Multi-GPUs
di: Zhang, Qijun, et al.
Pubblicazione: (2026)
di: Zhang, Qijun, et al.
Pubblicazione: (2026)
Tangram: Accelerating Serverless LLM Loading through GPU Memory Reuse and Affinity
di: Zhu, Wenbin, et al.
Pubblicazione: (2025)
di: Zhu, Wenbin, et al.
Pubblicazione: (2025)
FengHuang: Next-Generation Memory Orchestration for AI Inferencing
di: Li, Jiamin, et al.
Pubblicazione: (2025)
di: Li, Jiamin, et al.
Pubblicazione: (2025)
Handling of Memory Page Faults during Virtual-Address RDMA
di: Psistakis, Antonis
Pubblicazione: (2025)
di: Psistakis, Antonis
Pubblicazione: (2025)
A Heterogeneous Chiplet Architecture for Accelerating End-to-End Transformer Models
di: Sharma, Harsh, et al.
Pubblicazione: (2023)
di: Sharma, Harsh, et al.
Pubblicazione: (2023)
Application Experiences on a GPU-Accelerated Arm-based HPC Testbed
di: Elwasif, Wael, et al.
Pubblicazione: (2022)
di: Elwasif, Wael, et al.
Pubblicazione: (2022)
Workload-Aware Hardware Accelerator Mining for Distributed Deep Learning Training
di: Adnan, Muhammad, et al.
Pubblicazione: (2024)
di: Adnan, Muhammad, et al.
Pubblicazione: (2024)
TAPA-CS: Enabling Scalable Accelerator Design on Distributed HBM-FPGAs
di: Prakriya, Neha, et al.
Pubblicazione: (2023)
di: Prakriya, Neha, et al.
Pubblicazione: (2023)
Pooling Engram Conditional Memory in Large Language Models using CXL
di: Ma, Ruiyang, et al.
Pubblicazione: (2026)
di: Ma, Ruiyang, et al.
Pubblicazione: (2026)
New Tools, Programming Models, and System Support for Processing-in-Memory Architectures
di: Oliveira, Geraldo F.
Pubblicazione: (2025)
di: Oliveira, Geraldo F.
Pubblicazione: (2025)
Exploiting long vectors with a CFD code: a co-design show case
di: Blancafort, Marc, et al.
Pubblicazione: (2024)
di: Blancafort, Marc, et al.
Pubblicazione: (2024)
Design in Tiles: Automating GEMM Deployment on Tile-Based Many-PE Accelerators
di: Shen, Aofeng, et al.
Pubblicazione: (2025)
di: Shen, Aofeng, et al.
Pubblicazione: (2025)
FLEX: Leveraging FPGA-CPU Synergy for Mixed-Cell-Height Legalization Acceleration
di: Liu, Xingyu, et al.
Pubblicazione: (2025)
di: Liu, Xingyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DeFiNES: Enabling Fast Exploration of the Depth-first Scheduling Space for DNN Accelerators through Analytical Modeling
di: Mei, Linyan, et al.
Pubblicazione: (2022) -
XDMA: A Distributed, Extensible DMA Architecture for Layout-Flexible Data Movements in Heterogeneous Multi-Accelerator SoCs
di: Kong, Fanchen, et al.
Pubblicazione: (2025) -
Torrent: A Distributed DMA for Efficient and Flexible Point-to-Multipoint Data Movement
di: Deng, Yunhao, et al.
Pubblicazione: (2025) -
Kitsune: Enabling Dataflow Execution on GPUs
di: Davies, Michael, et al.
Pubblicazione: (2025) -
SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators
di: Li, Jonathan, et al.
Pubblicazione: (2025)