Implementing and Optimizing the Scaled Dot-Product Attention on Streaming Dataflow
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sohn, Gina, Zhang, Nathan, Olukotun, Kunle |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DFModel: Design Space Optimization of Large-Scale Systems Exploiting Dataflow Mappings
par: Ko, Sho, et autres
Publié: (2024)
par: Ko, Sho, et autres
Publié: (2024)
SSM-RDU: A Reconfigurable Dataflow Unit for Long-Sequence State-Space Models
par: Ko, Sho, et autres
Publié: (2025)
par: Ko, Sho, et autres
Publié: (2025)
Streaming Tensor Programs: A Streaming Abstraction for Dynamic Parallelism
par: Sohn, Gina, et autres
Publié: (2025)
par: Sohn, Gina, et autres
Publié: (2025)
FuseFlow: A Fusion-Centric Compilation Framework for Sparse Deep Learning on Streaming Dataflow
par: Lacouture, Rubens, et autres
Publié: (2025)
par: Lacouture, Rubens, et autres
Publié: (2025)
Revet: A Language and Compiler for Dataflow Threads
par: Rucker, Alexander, et autres
Publié: (2023)
par: Rucker, Alexander, et autres
Publié: (2023)
Sieve: Dynamic Expert-Aware PIM Acceleration for Evolving Mixture-of-Experts Models
par: Kim, Jungwoo, et autres
Publié: (2026)
par: Kim, Jungwoo, et autres
Publié: (2026)
Fast Cross-Operator Optimization of Attention Dataflow
par: Chang, Haodong, et autres
Publié: (2026)
par: Chang, Haodong, et autres
Publié: (2026)
StreamTensor: Make Tensors Stream in Dataflow Accelerators for LLMs
par: Ye, Hanchen, et autres
Publié: (2025)
par: Ye, Hanchen, et autres
Publié: (2025)
Stream-HLS: Towards Automatic Dataflow Acceleration
par: Basalama, Suhail, et autres
Publié: (2025)
par: Basalama, Suhail, et autres
Publié: (2025)
LowRA: Accurate and Efficient LoRA Fine-Tuning of LLMs under 2 Bits
par: Zhou, Zikai, et autres
Publié: (2025)
par: Zhou, Zikai, et autres
Publié: (2025)
FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Large Attention-Based Model Inference on Tile-Based Accelerators
par: Zhang, Chi, et autres
Publié: (2026)
par: Zhang, Chi, et autres
Publié: (2026)
CODO: An Automated Compiler for Comprehensive Dataflow Optimization
par: Zhang, Weichuang, et autres
Publié: (2026)
par: Zhang, Weichuang, et autres
Publié: (2026)
FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators
par: Zhang, Chi, et autres
Publié: (2025)
par: Zhang, Chi, et autres
Publié: (2025)
Sparsity-Aware Streaming SNN Accelerator with Output-Channel Dataflow for Automatic Modulation Classification
par: Yang, Kuilian, et autres
Publié: (2026)
par: Yang, Kuilian, et autres
Publié: (2026)
SIRA: Scaled-Integer Range Analysis for Optimizing FPGA Dataflow Neural Network Accelerators
par: Umuroglu, Yaman, et autres
Publié: (2025)
par: Umuroglu, Yaman, et autres
Publié: (2025)
Multilayer Dataflow: Orchestrate Butterfly Sparsity to Accelerate Attention Computation
par: Wu, Haibin, et autres
Publié: (2024)
par: Wu, Haibin, et autres
Publié: (2024)
Stream: Design Space Exploration of Layer-Fused DNNs on Heterogeneous Dataflow Accelerators
par: Symons, Arne, et autres
Publié: (2022)
par: Symons, Arne, et autres
Publié: (2022)
StreamDCIM: A Tile-based Streaming Digital CIM Accelerator with Mixed-stationary Cross-forwarding Dataflow for Multimodal Transformer
par: Qin, Shantian, et autres
Publié: (2025)
par: Qin, Shantian, et autres
Publié: (2025)
NEURAL: An Elastic Neuromorphic Architecture with Hybrid Data-Event Execution and On-the-fly Attention Dataflow
par: Chen, Yuehai, et autres
Publié: (2025)
par: Chen, Yuehai, et autres
Publié: (2025)
DataMaestro: A Versatile and Efficient Data Streaming Engine Bringing Decoupled Memory Access To Dataflow Accelerators
par: Yi, Xiaoling, et autres
Publié: (2025)
par: Yi, Xiaoling, et autres
Publié: (2025)
MIREDO: MIP-Driven Resource-Efficient Dataflow Optimization for Computing-in-Memory Accelerator
par: He, Xiaolin, et autres
Publié: (2025)
par: He, Xiaolin, et autres
Publié: (2025)
A Sparsity-Aware Autonomous Path Planning Accelerator with HW/SW Co-Design and Multi-Level Dataflow Optimization
par: Zhang, Yifan, et autres
Publié: (2025)
par: Zhang, Yifan, et autres
Publié: (2025)
PIMfused: Near-Bank DRAM-PIM with Fused-layer Dataflow for CNN Data Transfer Optimization
par: Yang, Simei, et autres
Publié: (2025)
par: Yang, Simei, et autres
Publié: (2025)
DORA: Dataflow-Instruction Orchestration Architecture for DNN Acceleration
par: Chen, Xingzhen, et autres
Publié: (2026)
par: Chen, Xingzhen, et autres
Publié: (2026)
LP-Spec: Leveraging LPDDR PIM for Efficient LLM Mobile Speculative Inference with Architecture-Dataflow Co-Optimization
par: He, Siyuan, et autres
Publié: (2025)
par: He, Siyuan, et autres
Publié: (2025)
AccelCIM: Systematic Dataflow Exploration for SRAM Compute-in-Memory Accelerator
par: Xue, Chenhao, et autres
Publié: (2026)
par: Xue, Chenhao, et autres
Publié: (2026)
A Dataflow Compiler for Efficient LLM Inference using Custom Microscaling Formats
par: Cheng, Jianyi, et autres
Publié: (2023)
par: Cheng, Jianyi, et autres
Publié: (2023)
SnipSnap: A Joint Compression Format and Dataflow Co-Optimization Framework for Efficient Sparse LLM Accelerator Design
par: Wu, Junyi, et autres
Publié: (2025)
par: Wu, Junyi, et autres
Publié: (2025)
Dataflow Optimized Reconfigurable Acceleration for FEM-based CFD Simulations
par: Kapetanakis, Anastassis, et autres
Publié: (2024)
par: Kapetanakis, Anastassis, et autres
Publié: (2024)
LoopTree: Exploring the Fused-layer Dataflow Accelerator Design Space
par: Gilbert, Michael, et autres
Publié: (2024)
par: Gilbert, Michael, et autres
Publié: (2024)
A High-Throughput FPGA Accelerator for Lightweight CNNs With Balanced Dataflow
par: Zhao, Zhiyuan, et autres
Publié: (2024)
par: Zhao, Zhiyuan, et autres
Publié: (2024)
Hermes: A Unified High-Performance NTT Architecture with Hybrid Dataflow
par: Gu, Hang, et autres
Publié: (2026)
par: Gu, Hang, et autres
Publié: (2026)
LoopLynx: A Scalable Dataflow Architecture for Efficient LLM Inference
par: Zheng, Jianing, et autres
Publié: (2025)
par: Zheng, Jianing, et autres
Publié: (2025)
A Composable Dynamic Sparse Dataflow Architecture for Efficient Event-based Vision Processing on FPGA
par: Gao, Yizhao, et autres
Publié: (2024)
par: Gao, Yizhao, et autres
Publié: (2024)
A Persistent-State Dataflow Accelerator for Memory-Bound Linear Attention Decode on FPGA
par: Gupta, Neelesh, et autres
Publié: (2026)
par: Gupta, Neelesh, et autres
Publié: (2026)
Evaluation of Posits for Spectral Analysis Using a Software-Defined Dataflow Architecture
par: Deshmukh, Sameer, et autres
Publié: (2024)
par: Deshmukh, Sameer, et autres
Publié: (2024)
LLMulator: Generalizable Cost Modeling for Dataflow Accelerators with Input-Adaptive Control Flow
par: Chang, Kaiyan, et autres
Publié: (2025)
par: Chang, Kaiyan, et autres
Publié: (2025)
PacQ: A SIMT Microarchitecture for Efficient Dataflow in Hyper-asymmetric GEMMs
par: Yin, Ruokai, et autres
Publié: (2025)
par: Yin, Ruokai, et autres
Publié: (2025)
DAS-MP: Enabling High-Quality Macro Placement with Enhanced Dataflow Awareness
par: Zhao, Xiaotian, et autres
Publié: (2025)
par: Zhao, Xiaotian, et autres
Publié: (2025)
ReDas: A Lightweight Architecture for Supporting Fine-Grained Reshaping and Multiple Dataflows on Systolic Array
par: Han, Meng, et autres
Publié: (2023)
par: Han, Meng, et autres
Publié: (2023)
Documents similaires
-
DFModel: Design Space Optimization of Large-Scale Systems Exploiting Dataflow Mappings
par: Ko, Sho, et autres
Publié: (2024) -
SSM-RDU: A Reconfigurable Dataflow Unit for Long-Sequence State-Space Models
par: Ko, Sho, et autres
Publié: (2025) -
Streaming Tensor Programs: A Streaming Abstraction for Dynamic Parallelism
par: Sohn, Gina, et autres
Publié: (2025) -
FuseFlow: A Fusion-Centric Compilation Framework for Sparse Deep Learning on Streaming Dataflow
par: Lacouture, Rubens, et autres
Publié: (2025) -
Revet: A Language and Compiler for Dataflow Threads
par: Rucker, Alexander, et autres
Publié: (2023)