Tailors: Accelerating Sparse Tensor Algebra by Overbooking Buffer Capacity
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xue, Zi Yu, Wu, Yannan Nellie, Emer, Joel S., Sze, Vivienne |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
LoopTree: Exploring the Fused-layer Dataflow Accelerator Design Space
von: Gilbert, Michael, et al.
Veröffentlicht: (2024)
von: Gilbert, Michael, et al.
Veröffentlicht: (2024)
CiMLoop: A Flexible, Accurate, and Fast Compute-In-Memory Modeling Tool
von: Andrulis, Tanner, et al.
Veröffentlicht: (2024)
von: Andrulis, Tanner, et al.
Veröffentlicht: (2024)
Fast and Fusiest: An Optimal Fusion-Aware Mapper for Accelerator Design
von: Andrulis, Tanner, et al.
Veröffentlicht: (2026)
von: Andrulis, Tanner, et al.
Veröffentlicht: (2026)
The Turbo-Charged Mapper: Fast and Optimal Mapping for Energy-efficient and Low-latency Accelerator Design
von: Gilbert, Michael, et al.
Veröffentlicht: (2026)
von: Gilbert, Michael, et al.
Veröffentlicht: (2026)
Modeling Analog-Digital-Converter Energy and Area for Compute-In-Memory Accelerator Design
von: Andrulis, Tanner, et al.
Veröffentlicht: (2024)
von: Andrulis, Tanner, et al.
Veröffentlicht: (2024)
Architecture-Level Modeling of Photonic Deep Neural Network Accelerators
von: Andrulis, Tanner, et al.
Veröffentlicht: (2024)
von: Andrulis, Tanner, et al.
Veröffentlicht: (2024)
TeAAL: A Declarative Framework for Modeling Sparse Tensor Accelerators
von: Nayak, Nandeeka, et al.
Veröffentlicht: (2023)
von: Nayak, Nandeeka, et al.
Veröffentlicht: (2023)
Systolic Sparse Tensor Slices: FPGA Building Blocks for Sparse and Dense AI Acceleration
von: Taka, Endri, et al.
Veröffentlicht: (2025)
von: Taka, Endri, et al.
Veröffentlicht: (2025)
FuseMax: Leveraging Extended Einsums to Optimize Attention Accelerator Design
von: Nayak, Nandeeka, et al.
Veröffentlicht: (2024)
von: Nayak, Nandeeka, et al.
Veröffentlicht: (2024)
RTeAAL Sim: Using Tensor Algebra to Represent and Accelerate RTL Simulation (Extended Version)
von: Zhu, Yan, et al.
Veröffentlicht: (2026)
von: Zhu, Yan, et al.
Veröffentlicht: (2026)
Accelerating Sparse Graph Neural Networks with Tensor Core Optimization
von: Wu, Ka Wai
Veröffentlicht: (2024)
von: Wu, Ka Wai
Veröffentlicht: (2024)
Mambalaya: Einsum-Based Fusion Optimizations on State-Space Models
von: Odemuyiwa, Toluwanimi O., et al.
Veröffentlicht: (2026)
von: Odemuyiwa, Toluwanimi O., et al.
Veröffentlicht: (2026)
StreamTensor: Make Tensors Stream in Dataflow Accelerators for LLMs
von: Ye, Hanchen, et al.
Veröffentlicht: (2025)
von: Ye, Hanchen, et al.
Veröffentlicht: (2025)
Error Checking for Sparse Systolic Tensor Arrays
von: Peltekis, Christodoulos, et al.
Veröffentlicht: (2024)
von: Peltekis, Christodoulos, et al.
Veröffentlicht: (2024)
FLAASH: Flexible Accelerator Architecture for Sparse High-Order Tensor Contraction
von: Kulp, Gabriel, et al.
Veröffentlicht: (2024)
von: Kulp, Gabriel, et al.
Veröffentlicht: (2024)
Open-source Stand-Alone Versatile Tensor Accelerator
von: Faure-Gignoux, Anthony, et al.
Veröffentlicht: (2025)
von: Faure-Gignoux, Anthony, et al.
Veröffentlicht: (2025)
ATLAAS: Automatic Tensor-Level Abstraction of Accelerator Semantics
von: Gao, Ruijie, et al.
Veröffentlicht: (2026)
von: Gao, Ruijie, et al.
Veröffentlicht: (2026)
Sparse MTTKRP Acceleration for Tensor Decomposition on GPU
von: Wijeratne, Sasindu, et al.
Veröffentlicht: (2024)
von: Wijeratne, Sasindu, et al.
Veröffentlicht: (2024)
A Tensor-Train Decomposition based Compression of LLMs on Group Vector Systolic Accelerator
von: Huang, Sixiao, et al.
Veröffentlicht: (2025)
von: Huang, Sixiao, et al.
Veröffentlicht: (2025)
AME-PIM: Can Memory be Your Next Tensor Accelerator?
von: Venieri, Emanuele, et al.
Veröffentlicht: (2026)
von: Venieri, Emanuele, et al.
Veröffentlicht: (2026)
FETTA: Flexible and Efficient Hardware Accelerator for Tensorized Neural Network Training
von: Lu, Jinming, et al.
Veröffentlicht: (2025)
von: Lu, Jinming, et al.
Veröffentlicht: (2025)
FADiff: Fusion-Aware Differentiable Optimization for DNN Scheduling on Tensor Accelerators
von: Jia, Shuao, et al.
Veröffentlicht: (2025)
von: Jia, Shuao, et al.
Veröffentlicht: (2025)
An Efficient Sparse Hardware Accelerator for Spike-Driven Transformer
von: Li, Zhengke, et al.
Veröffentlicht: (2025)
von: Li, Zhengke, et al.
Veröffentlicht: (2025)
Systolic Array Acceleration of Diagonal-Optimized Sparse-Sparse Matrix Multiplication for Efficient Quantum Simulation
von: Su, Yuchao, et al.
Veröffentlicht: (2025)
von: Su, Yuchao, et al.
Veröffentlicht: (2025)
Branch Target Buffer Reverse Engineering on Arm
von: Wan, Junpeng
Veröffentlicht: (2024)
von: Wan, Junpeng
Veröffentlicht: (2024)
Sparse-on-Dense: Area and Energy-Efficient Computing of Sparse Neural Networks on Dense Matrix Multiplication Accelerators
von: Yoon, Hyunsung, et al.
Veröffentlicht: (2026)
von: Yoon, Hyunsung, et al.
Veröffentlicht: (2026)
SnipSnap: A Joint Compression Format and Dataflow Co-Optimization Framework for Efficient Sparse LLM Accelerator Design
von: Wu, Junyi, et al.
Veröffentlicht: (2025)
von: Wu, Junyi, et al.
Veröffentlicht: (2025)
Platinum: Path-Adaptable LUT-Based Accelerator Tailored for Low-Bit Weight Matrix Multiplication
von: Shan, Haoxuan, et al.
Veröffentlicht: (2025)
von: Shan, Haoxuan, et al.
Veröffentlicht: (2025)
GTA: a new General Tensor Accelerator with Better Area Efficiency and Data Reuse
von: Ai, Chenyang, et al.
Veröffentlicht: (2024)
von: Ai, Chenyang, et al.
Veröffentlicht: (2024)
SuperUROP: An FPGA-Based Spatial Accelerator for Sparse Matrix Operations
von: Parthasarathy, Rishab
Veröffentlicht: (2025)
von: Parthasarathy, Rishab
Veröffentlicht: (2025)
VitaLLM: A Versatile, Ultra-Compact Ternary LLM Accelerator with Dependency-Aware Scheduling
von: Lin, Zi-Wei, et al.
Veröffentlicht: (2026)
von: Lin, Zi-Wei, et al.
Veröffentlicht: (2026)
VitaLLM: A Versatile and Tiny Accelerator for Mixed-Precision LLM Inference on Edge Devices
von: Lin, Zi-Wei, et al.
Veröffentlicht: (2026)
von: Lin, Zi-Wei, et al.
Veröffentlicht: (2026)
Energy-adaptive Buffering for Efficient, Responsive, and Persistent Batteryless Systems
von: Williams, Harrison, et al.
Veröffentlicht: (2024)
von: Williams, Harrison, et al.
Veröffentlicht: (2024)
LMB: Augmenting PCIe Devices with CXL-Linked Memory Buffer
von: Wang, Jiapin, et al.
Veröffentlicht: (2024)
von: Wang, Jiapin, et al.
Veröffentlicht: (2024)
FAST-Prefill: FPGA Accelerated Sparse Attention for Long Context LLM Prefill
von: Jayanth, Rakshith, et al.
Veröffentlicht: (2026)
von: Jayanth, Rakshith, et al.
Veröffentlicht: (2026)
A Low-Power Sparse Deep Learning Accelerator with Optimized Data Reuse
von: Hsu, Kai-Chieh, et al.
Veröffentlicht: (2025)
von: Hsu, Kai-Chieh, et al.
Veröffentlicht: (2025)
GUST: Graph Edge-Coloring Utilization for Accelerating Sparse Matrix Vector Multiplication
von: Gerami, Armin, et al.
Veröffentlicht: (2024)
von: Gerami, Armin, et al.
Veröffentlicht: (2024)
ADE-HGNN: Accelerating HGNNs through Attention Disparity Exploitation
von: Han, Dengke, et al.
Veröffentlicht: (2024)
von: Han, Dengke, et al.
Veröffentlicht: (2024)
LogicSparse: Enabling Engine-Free Unstructured Sparsity for Quantised Deep-learning Accelerators
von: Li, Changhong, et al.
Veröffentlicht: (2025)
von: Li, Changhong, et al.
Veröffentlicht: (2025)
CIM-Tuner: Balancing the Compute and Storage Capacity of SRAM-CIM Accelerator via Hardware-mapping Co-exploration
von: Chen, Jinwu, et al.
Veröffentlicht: (2026)
von: Chen, Jinwu, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
LoopTree: Exploring the Fused-layer Dataflow Accelerator Design Space
von: Gilbert, Michael, et al.
Veröffentlicht: (2024) -
CiMLoop: A Flexible, Accurate, and Fast Compute-In-Memory Modeling Tool
von: Andrulis, Tanner, et al.
Veröffentlicht: (2024) -
Fast and Fusiest: An Optimal Fusion-Aware Mapper for Accelerator Design
von: Andrulis, Tanner, et al.
Veröffentlicht: (2026) -
The Turbo-Charged Mapper: Fast and Optimal Mapping for Energy-efficient and Low-latency Accelerator Design
von: Gilbert, Michael, et al.
Veröffentlicht: (2026) -
Modeling Analog-Digital-Converter Energy and Area for Compute-In-Memory Accelerator Design
von: Andrulis, Tanner, et al.
Veröffentlicht: (2024)