FuseMax: Leveraging Extended Einsums to Optimize Attention Accelerator Design
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nayak, Nandeeka, Wu, Xinrui, Odemuyiwa, Toluwanimi O., Pellauer, Michael, Emer, Joel S., Fletcher, Christopher W. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TeAAL: A Declarative Framework for Modeling Sparse Tensor Accelerators
par: Nayak, Nandeeka, et autres
Publié: (2023)
par: Nayak, Nandeeka, et autres
Publié: (2023)
Mambalaya: Einsum-Based Fusion Optimizations on State-Space Models
par: Odemuyiwa, Toluwanimi O., et autres
Publié: (2026)
par: Odemuyiwa, Toluwanimi O., et autres
Publié: (2026)
RTeAAL Sim: Using Tensor Algebra to Represent and Accelerate RTL Simulation (Extended Version)
par: Zhu, Yan, et autres
Publié: (2026)
par: Zhu, Yan, et autres
Publié: (2026)
LoopTree: Exploring the Fused-layer Dataflow Accelerator Design Space
par: Gilbert, Michael, et autres
Publié: (2024)
par: Gilbert, Michael, et autres
Publié: (2024)
Modeling Analog-Digital-Converter Energy and Area for Compute-In-Memory Accelerator Design
par: Andrulis, Tanner, et autres
Publié: (2024)
par: Andrulis, Tanner, et autres
Publié: (2024)
Tailors: Accelerating Sparse Tensor Algebra by Overbooking Buffer Capacity
par: Xue, Zi Yu, et autres
Publié: (2023)
par: Xue, Zi Yu, et autres
Publié: (2023)
Fast and Fusiest: An Optimal Fusion-Aware Mapper for Accelerator Design
par: Andrulis, Tanner, et autres
Publié: (2026)
par: Andrulis, Tanner, et autres
Publié: (2026)
The Turbo-Charged Mapper: Fast and Optimal Mapping for Energy-efficient and Low-latency Accelerator Design
par: Gilbert, Michael, et autres
Publié: (2026)
par: Gilbert, Michael, et autres
Publié: (2026)
HaShiFlex: A High-Throughput Hardened Shifter DNN Accelerator with Fine-Tuning Flexibility
par: Herbst, Jonathan, et autres
Publié: (2025)
par: Herbst, Jonathan, et autres
Publié: (2025)
CiMLoop: A Flexible, Accurate, and Fast Compute-In-Memory Modeling Tool
par: Andrulis, Tanner, et autres
Publié: (2024)
par: Andrulis, Tanner, et autres
Publié: (2024)
Stream: Design Space Exploration of Layer-Fused DNNs on Heterogeneous Dataflow Accelerators
par: Symons, Arne, et autres
Publié: (2022)
par: Symons, Arne, et autres
Publié: (2022)
Architecture-Level Modeling of Photonic Deep Neural Network Accelerators
par: Andrulis, Tanner, et autres
Publié: (2024)
par: Andrulis, Tanner, et autres
Publié: (2024)
FuseFPS: Accelerating Farthest Point Sampling with Fusing KD-tree Construction for Point Clouds
par: Han, Meng, et autres
Publié: (2023)
par: Han, Meng, et autres
Publié: (2023)
Hardware-Software Co-Design for Accelerating Transformer Inference Leveraging Compute-in-Memory
par: Kim, Dong Eun, et autres
Publié: (2025)
par: Kim, Dong Eun, et autres
Publié: (2025)
Leveraging Recurrent Patterns in Graph Accelerators
par: Rahimi, Masoud, et autres
Publié: (2025)
par: Rahimi, Masoud, et autres
Publié: (2025)
Multilayer Dataflow: Orchestrate Butterfly Sparsity to Accelerate Attention Computation
par: Wu, Haibin, et autres
Publié: (2024)
par: Wu, Haibin, et autres
Publié: (2024)
FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Large Attention-Based Model Inference on Tile-Based Accelerators
par: Zhang, Chi, et autres
Publié: (2026)
par: Zhang, Chi, et autres
Publié: (2026)
FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators
par: Zhang, Chi, et autres
Publié: (2025)
par: Zhang, Chi, et autres
Publié: (2025)
ADE-HGNN: Accelerating HGNNs through Attention Disparity Exploitation
par: Han, Dengke, et autres
Publié: (2024)
par: Han, Dengke, et autres
Publié: (2024)
HARP: A Taxonomy for Heterogeneous and Hierarchical Processors for Mixed-reuse Workloads
par: Garg, Raveesh, et autres
Publié: (2025)
par: Garg, Raveesh, et autres
Publié: (2025)
SnipSnap: A Joint Compression Format and Dataflow Co-Optimization Framework for Efficient Sparse LLM Accelerator Design
par: Wu, Junyi, et autres
Publié: (2025)
par: Wu, Junyi, et autres
Publié: (2025)
The Quest for Reliable AI Accelerators: Cross-Layer Evaluation and Design Optimization
par: Li, Meng, et autres
Publié: (2026)
par: Li, Meng, et autres
Publié: (2026)
Chiplet-Gym: Optimizing Chiplet-based AI Accelerator Design with Reinforcement Learning
par: Mishty, Kaniz, et autres
Publié: (2024)
par: Mishty, Kaniz, et autres
Publié: (2024)
Optimizing Layer-Fused Scheduling of Transformer Networks on Multi-accelerator Platforms
par: Colleman, Steven, et autres
Publié: (2024)
par: Colleman, Steven, et autres
Publié: (2024)
Hybrid Photonic-digital Accelerator for Attention Mechanism
par: Li, Huize, et autres
Publié: (2025)
par: Li, Huize, et autres
Publié: (2025)
Late Breaking Results: Leveraging Approximate Computing for Carbon-Aware DNN Accelerators
par: Panteleaki, Aikaterini Maria, et autres
Publié: (2025)
par: Panteleaki, Aikaterini Maria, et autres
Publié: (2025)
DiffuSE: Cross-Layer Design Space Exploration of DNN Accelerator via Diffusion-Driven Optimization
par: Ren, Yi, et autres
Publié: (2025)
par: Ren, Yi, et autres
Publié: (2025)
SystolicAttention: Fusing FlashAttention within a Single Systolic Array
par: Lin, Jiawei, et autres
Publié: (2025)
par: Lin, Jiawei, et autres
Publié: (2025)
PIMfused: Near-Bank DRAM-PIM with Fused-layer Dataflow for CNN Data Transfer Optimization
par: Yang, Simei, et autres
Publié: (2025)
par: Yang, Simei, et autres
Publié: (2025)
Holistic Optimization Framework for FPGA Accelerators
par: Pouget, Stéphane, et autres
Publié: (2025)
par: Pouget, Stéphane, et autres
Publié: (2025)
CELLO: Co-designing Schedule and Hybrid Implicit/Explicit Buffer for Complex Tensor Reuse
par: Garg, Raveesh, et autres
Publié: (2023)
par: Garg, Raveesh, et autres
Publié: (2023)
Leveraging Application-Specific Knowledge for Energy-Efficient Deep Learning Accelerators on Resource-Constrained FPGAs
par: Qian, Chao
Publié: (2025)
par: Qian, Chao
Publié: (2025)
A Sparsity-Aware Autonomous Path Planning Accelerator with HW/SW Co-Design and Multi-Level Dataflow Optimization
par: Zhang, Yifan, et autres
Publié: (2025)
par: Zhang, Yifan, et autres
Publié: (2025)
Accelerating Multi-Scale Deformable Attention Using Near-Memory-Processing Architecture
par: Li, Huize, et autres
Publié: (2026)
par: Li, Huize, et autres
Publié: (2026)
FAST-Prefill: FPGA Accelerated Sparse Attention for Long Context LLM Prefill
par: Jayanth, Rakshith, et autres
Publié: (2026)
par: Jayanth, Rakshith, et autres
Publié: (2026)
Convolutions Predictable Offloading to an Accelerator: Formalization and Optimization
par: Husson, Benjamin, et autres
Publié: (2026)
par: Husson, Benjamin, et autres
Publié: (2026)
Modeling and Optimizing Performance Bottlenecks for Neuromorphic Accelerators
par: Yik, Jason, et autres
Publié: (2025)
par: Yik, Jason, et autres
Publié: (2025)
Fast Cross-Operator Optimization of Attention Dataflow
par: Chang, Haodong, et autres
Publié: (2026)
par: Chang, Haodong, et autres
Publié: (2026)
Oobleck: Low-Compromise Design for Fault Tolerant Accelerators
par: Wilks, Guy, et autres
Publié: (2025)
par: Wilks, Guy, et autres
Publié: (2025)
GSIM: Accelerating RTL Simulation for Large-Scale Designs
par: Chen, Lu, et autres
Publié: (2025)
par: Chen, Lu, et autres
Publié: (2025)
Documents similaires
-
TeAAL: A Declarative Framework for Modeling Sparse Tensor Accelerators
par: Nayak, Nandeeka, et autres
Publié: (2023) -
Mambalaya: Einsum-Based Fusion Optimizations on State-Space Models
par: Odemuyiwa, Toluwanimi O., et autres
Publié: (2026) -
RTeAAL Sim: Using Tensor Algebra to Represent and Accelerate RTL Simulation (Extended Version)
par: Zhu, Yan, et autres
Publié: (2026) -
LoopTree: Exploring the Fused-layer Dataflow Accelerator Design Space
par: Gilbert, Michael, et autres
Publié: (2024) -
Modeling Analog-Digital-Converter Energy and Area for Compute-In-Memory Accelerator Design
par: Andrulis, Tanner, et autres
Publié: (2024)