Mitigating the Bandwidth Wall via Data-Streaming System-Accelerator Co-Design
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Qunyou, Zapater, Marina, Atienza, David |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MatrixFlow: System-Accelerator co-design for high-performance transformer applications
di: Liu, Qunyou, et al.
Pubblicazione: (2025)
di: Liu, Qunyou, et al.
Pubblicazione: (2025)
Gem5-AcceSys: Enabling System-Level Exploration of Standard Interconnects for Novel Accelerators
di: Liu, Qunyou, et al.
Pubblicazione: (2025)
di: Liu, Qunyou, et al.
Pubblicazione: (2025)
SigmaQuant: Hardware-Aware Heterogeneous Quantization Method for Edge DNN Inference
di: Liu, Qunyou, et al.
Pubblicazione: (2026)
di: Liu, Qunyou, et al.
Pubblicazione: (2026)
CXLRAMSim v1.0: System-Level Exploration of CXL Memory Expander Cards
di: Pathak, Karan, et al.
Pubblicazione: (2026)
di: Pathak, Karan, et al.
Pubblicazione: (2026)
HAVEN: High-Bandwidth Flash Augmented Vector Engine for Large-Scale Approximate Nearest-Neighbor Search Acceleration
di: Hsu, Po-Kai, et al.
Pubblicazione: (2026)
di: Hsu, Po-Kai, et al.
Pubblicazione: (2026)
Pushing the Memory Bandwidth Wall with CXL-enabled Idle I/O Bandwidth Harvesting
di: Kadiyala, Divya Kiran, et al.
Pubblicazione: (2025)
di: Kadiyala, Divya Kiran, et al.
Pubblicazione: (2025)
STRELA: STReaming ELAstic CGRA Accelerator for Embedded Systems
di: Vazquez, Daniel, et al.
Pubblicazione: (2024)
di: Vazquez, Daniel, et al.
Pubblicazione: (2024)
An Irredundant and Compressed Data Layout to Optimize Bandwidth Utilization of FPGA Accelerators
di: Ferry, Corentin, et al.
Pubblicazione: (2024)
di: Ferry, Corentin, et al.
Pubblicazione: (2024)
Stream: Design Space Exploration of Layer-Fused DNNs on Heterogeneous Dataflow Accelerators
di: Symons, Arne, et al.
Pubblicazione: (2022)
di: Symons, Arne, et al.
Pubblicazione: (2022)
StreamTensor: Make Tensors Stream in Dataflow Accelerators for LLMs
di: Ye, Hanchen, et al.
Pubblicazione: (2025)
di: Ye, Hanchen, et al.
Pubblicazione: (2025)
X-HEEP: An Open-Source, Configurable and Extendible RISC-V Microcontroller for the Exploration of Ultra-Low-Power Edge Accelerators
di: Machetti, Simone, et al.
Pubblicazione: (2024)
di: Machetti, Simone, et al.
Pubblicazione: (2024)
TRACE: Unlocking Effective CXL Bandwidth via Lossless Compression and Precision Scaling
di: Xie, Rui, et al.
Pubblicazione: (2025)
di: Xie, Rui, et al.
Pubblicazione: (2025)
DataMaestro: A Versatile and Efficient Data Streaming Engine Bringing Decoupled Memory Access To Dataflow Accelerators
di: Yi, Xiaoling, et al.
Pubblicazione: (2025)
di: Yi, Xiaoling, et al.
Pubblicazione: (2025)
Stream-HLS: Towards Automatic Dataflow Acceleration
di: Basalama, Suhail, et al.
Pubblicazione: (2025)
di: Basalama, Suhail, et al.
Pubblicazione: (2025)
NDFT: Accelerating Density Functional Theory Calculations via Hardware/Software Co-Design on Near-Data Computing System
di: Jiang, Qingcai, et al.
Pubblicazione: (2025)
di: Jiang, Qingcai, et al.
Pubblicazione: (2025)
Generalized Ping-Pong: Off-Chip Memory Bandwidth Centric Pipelining Strategy for Processing-In-Memory Accelerators
di: Wang, Ruibao, et al.
Pubblicazione: (2024)
di: Wang, Ruibao, et al.
Pubblicazione: (2024)
Demystifying the 7-D Convolution Loop Nest for Data and Instruction Streaming in Reconfigurable AI Accelerators
di: Chowdhury, Md Rownak Hossain, et al.
Pubblicazione: (2025)
di: Chowdhury, Md Rownak Hossain, et al.
Pubblicazione: (2025)
Potamoi: Accelerating Neural Rendering via a Unified Streaming Architecture
di: Feng, Yu, et al.
Pubblicazione: (2024)
di: Feng, Yu, et al.
Pubblicazione: (2024)
CogSys: Efficient and Scalable Neurosymbolic Cognition System via Algorithm-Hardware Co-Design
di: Wan, Zishen, et al.
Pubblicazione: (2025)
di: Wan, Zishen, et al.
Pubblicazione: (2025)
Co-Design of CNN Accelerators for TinyML using Approximate Matrix Decomposition
di: Morales, José Juan Hernández, et al.
Pubblicazione: (2026)
di: Morales, José Juan Hernández, et al.
Pubblicazione: (2026)
METRO: A Software-Hardware Co-Design of Interconnections for Spatial DNN Accelerators
di: Wang, Zhao, et al.
Pubblicazione: (2021)
di: Wang, Zhao, et al.
Pubblicazione: (2021)
Hardware-Software Co-Design for Accelerating Transformer Inference Leveraging Compute-in-Memory
di: Kim, Dong Eun, et al.
Pubblicazione: (2025)
di: Kim, Dong Eun, et al.
Pubblicazione: (2025)
Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression
di: Cheng, Feng, et al.
Pubblicazione: (2025)
di: Cheng, Feng, et al.
Pubblicazione: (2025)
DIRC-RAG: Accelerating Edge RAG with Robust High-Density and High-Loading-Bandwidth Digital In-ReRAM Computation
di: Shao, Kunming, et al.
Pubblicazione: (2025)
di: Shao, Kunming, et al.
Pubblicazione: (2025)
Per-Bank Memory Bandwidth Regulation for Predictable and Performant Real-Time System
di: Sullivan, Connor Rudy, et al.
Pubblicazione: (2026)
di: Sullivan, Connor Rudy, et al.
Pubblicazione: (2026)
EyeCoD: Eye Tracking System Acceleration via FlatCam-based Algorithm & Accelerator Co-Design
di: You, Haoran, et al.
Pubblicazione: (2022)
di: You, Haoran, et al.
Pubblicazione: (2022)
Tasa: Thermal-aware 3D-Stacked Architecture Design with Bandwidth Sharing for LLM Inference
di: He, Siyuan, et al.
Pubblicazione: (2025)
di: He, Siyuan, et al.
Pubblicazione: (2025)
StreamGrid: Streaming Point Cloud Analytics via Compulsory Splitting and Deterministic Termination
di: Feng, Yu, et al.
Pubblicazione: (2025)
di: Feng, Yu, et al.
Pubblicazione: (2025)
Per-Bank Bandwidth Regulation of Shared Last-Level Cache for Real-Time Systems
di: Sullivan, Connor, et al.
Pubblicazione: (2024)
di: Sullivan, Connor, et al.
Pubblicazione: (2024)
A Sparsity-Aware Autonomous Path Planning Accelerator with HW/SW Co-Design and Multi-Level Dataflow Optimization
di: Zhang, Yifan, et al.
Pubblicazione: (2025)
di: Zhang, Yifan, et al.
Pubblicazione: (2025)
GCoD: Graph Convolutional Network Acceleration via Dedicated Algorithm and Accelerator Co-Design
di: You, Haoran, et al.
Pubblicazione: (2021)
di: You, Haoran, et al.
Pubblicazione: (2021)
CD-PIM: A High-Bandwidth and Compute-Efficient LPDDR5-Based PIM for Low-Batch LLM Acceleration on Edge-Device
di: Lin, Ye, et al.
Pubblicazione: (2026)
di: Lin, Ye, et al.
Pubblicazione: (2026)
AutoRAC: Automated Processing-in-Memory Accelerator Design for Recommender Systems
di: Cheng, Feng, et al.
Pubblicazione: (2025)
di: Cheng, Feng, et al.
Pubblicazione: (2025)
StreamDCIM: A Tile-based Streaming Digital CIM Accelerator with Mixed-stationary Cross-forwarding Dataflow for Multimodal Transformer
di: Qin, Shantian, et al.
Pubblicazione: (2025)
di: Qin, Shantian, et al.
Pubblicazione: (2025)
Just TestIt! An SBST Approach To Automate System-Integration Testing
di: Terzano, Tommaso, et al.
Pubblicazione: (2025)
di: Terzano, Tommaso, et al.
Pubblicazione: (2025)
A Quantitative Analysis and Guidelines of Data Streaming Accelerator in Modern Intel Xeon Scalable Processors
di: Kuper, Reese, et al.
Pubblicazione: (2023)
di: Kuper, Reese, et al.
Pubblicazione: (2023)
Sparsity-Aware Streaming SNN Accelerator with Output-Channel Dataflow for Automatic Modulation Classification
di: Yang, Kuilian, et al.
Pubblicazione: (2026)
di: Yang, Kuilian, et al.
Pubblicazione: (2026)
SnipSnap: A Joint Compression Format and Dataflow Co-Optimization Framework for Efficient Sparse LLM Accelerator Design
di: Wu, Junyi, et al.
Pubblicazione: (2025)
di: Wu, Junyi, et al.
Pubblicazione: (2025)
When Pipelined In-Memory Accelerators Meet Spiking Direct Feedback Alignment: A Co-Design for Neuromorphic Edge Computing
di: Ren, Haoxiong, et al.
Pubblicazione: (2025)
di: Ren, Haoxiong, et al.
Pubblicazione: (2025)
DRACO: Co-design for DSP-Efficient Rigid Body Dynamics Accelerator
di: Liu, Xingyu, et al.
Pubblicazione: (2025)
di: Liu, Xingyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MatrixFlow: System-Accelerator co-design for high-performance transformer applications
di: Liu, Qunyou, et al.
Pubblicazione: (2025) -
Gem5-AcceSys: Enabling System-Level Exploration of Standard Interconnects for Novel Accelerators
di: Liu, Qunyou, et al.
Pubblicazione: (2025) -
SigmaQuant: Hardware-Aware Heterogeneous Quantization Method for Edge DNN Inference
di: Liu, Qunyou, et al.
Pubblicazione: (2026) -
CXLRAMSim v1.0: System-Level Exploration of CXL Memory Expander Cards
di: Pathak, Karan, et al.
Pubblicazione: (2026) -
HAVEN: High-Bandwidth Flash Augmented Vector Engine for Large-Scale Approximate Nearest-Neighbor Search Acceleration
di: Hsu, Po-Kai, et al.
Pubblicazione: (2026)