Salca: A Sparsity-Aware Hardware Accelerator for Efficient Long-Context Attention Decoding
Fuente:
arXiv
Salvato in:
| Autori principali: | Fan, Wang, Cao, Wei, Zha, Xi, Ma, Kedi, Sun, MingQian, Chen, Jialin, Zhang, Fengzhe, Zhang, Fan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SATA: Sparsity-Aware Scheduling for Selective Token Attention
di: Fan, Zhenkun, et al.
Pubblicazione: (2026)
di: Fan, Zhenkun, et al.
Pubblicazione: (2026)
Multilayer Dataflow: Orchestrate Butterfly Sparsity to Accelerate Attention Computation
di: Wu, Haibin, et al.
Pubblicazione: (2024)
di: Wu, Haibin, et al.
Pubblicazione: (2024)
HASS: Hardware-Aware Sparsity Search for Dataflow DNN Accelerator
di: Yu, Zhewen, et al.
Pubblicazione: (2024)
di: Yu, Zhewen, et al.
Pubblicazione: (2024)
SwiftKV: An Edge-Oriented Attention Algorithm and Multi-Head Accelerator for Fast, Efficient LLM Decoding
di: Zhang, Junming, et al.
Pubblicazione: (2026)
di: Zhang, Junming, et al.
Pubblicazione: (2026)
TENET: An Efficient Sparsity-Aware LUT-Centric Architecture for Ternary LLM Inference On Edge
di: Huang, Zhirui, et al.
Pubblicazione: (2025)
di: Huang, Zhirui, et al.
Pubblicazione: (2025)
PULSE: Parametric Hardware Units for Low-power Sparsity-Aware Convolution Engine
di: Aliyev, Ilkin, et al.
Pubblicazione: (2024)
di: Aliyev, Ilkin, et al.
Pubblicazione: (2024)
An Efficient Sparse Hardware Accelerator for Spike-Driven Transformer
di: Li, Zhengke, et al.
Pubblicazione: (2025)
di: Li, Zhengke, et al.
Pubblicazione: (2025)
Sparsity-Aware Streaming SNN Accelerator with Output-Channel Dataflow for Automatic Modulation Classification
di: Yang, Kuilian, et al.
Pubblicazione: (2026)
di: Yang, Kuilian, et al.
Pubblicazione: (2026)
FAST-Prefill: FPGA Accelerated Sparse Attention for Long Context LLM Prefill
di: Jayanth, Rakshith, et al.
Pubblicazione: (2026)
di: Jayanth, Rakshith, et al.
Pubblicazione: (2026)
FETTA: Flexible and Efficient Hardware Accelerator for Tensorized Neural Network Training
di: Lu, Jinming, et al.
Pubblicazione: (2025)
di: Lu, Jinming, et al.
Pubblicazione: (2025)
SD-Acc: Accelerating Stable Diffusion through Phase-aware Sampling and Hardware Co-Optimizations
di: Wang, Zhican, et al.
Pubblicazione: (2025)
di: Wang, Zhican, et al.
Pubblicazione: (2025)
A Sparsity-Aware Autonomous Path Planning Accelerator with HW/SW Co-Design and Multi-Level Dataflow Optimization
di: Zhang, Yifan, et al.
Pubblicazione: (2025)
di: Zhang, Yifan, et al.
Pubblicazione: (2025)
FireFly-S: Exploiting Dual-Side Sparsity for Spiking Neural Networks Acceleration with Reconfigurable Spatial Architecture
di: Li, Tenglong, et al.
Pubblicazione: (2024)
di: Li, Tenglong, et al.
Pubblicazione: (2024)
FireFly-T: High-Throughput Sparsity Exploitation for Spiking Transformer Acceleration with Dual-Engine Overlay Architecture
di: Li, Tenglong, et al.
Pubblicazione: (2025)
di: Li, Tenglong, et al.
Pubblicazione: (2025)
HyDRA: Deadline and Reuse-Aware Cacheability for Hardware Accelerators
di: Agarwal, Ayushi, et al.
Pubblicazione: (2026)
di: Agarwal, Ayushi, et al.
Pubblicazione: (2026)
FPGA-Optimized Hardware Accelerator for Fast Fourier Transform and Singular Value Decomposition in AI
di: Ding, Hong, et al.
Pubblicazione: (2025)
di: Ding, Hong, et al.
Pubblicazione: (2025)
Hardware Acceleration of Kolmogorov-Arnold Network (KAN) for Lightweight Edge Inference
di: Huang, Wei-Hsing, et al.
Pubblicazione: (2024)
di: Huang, Wei-Hsing, et al.
Pubblicazione: (2024)
Hardware Acceleration of Kolmogorov-Arnold Network (KAN) in Large-Scale Systems
di: Huang, Wei-Hsing, et al.
Pubblicazione: (2025)
di: Huang, Wei-Hsing, et al.
Pubblicazione: (2025)
Energy-Efficient Hardware Acceleration of Whisper ASR on a CGLA
di: Ando, Takuto, et al.
Pubblicazione: (2025)
di: Ando, Takuto, et al.
Pubblicazione: (2025)
Wit-HW: Bug Localization in Hardware Design Code via Witness Test Case Generation
di: Ma, Ruiyang, et al.
Pubblicazione: (2025)
di: Ma, Ruiyang, et al.
Pubblicazione: (2025)
VIKIN: A Reconfigurable Accelerator for KANs and MLPs with Two-Stage Sparsity Support
di: Ou, Wenhui, et al.
Pubblicazione: (2026)
di: Ou, Wenhui, et al.
Pubblicazione: (2026)
Sparsity-Aware Hardware-Software Co-Design of Spiking Neural Networks: An Overview
di: Aliyev, Ilkin, et al.
Pubblicazione: (2024)
di: Aliyev, Ilkin, et al.
Pubblicazione: (2024)
SeDA: Secure and Efficient DNN Accelerators with Hardware/Software Synergy
di: Xuan, Wei, et al.
Pubblicazione: (2025)
di: Xuan, Wei, et al.
Pubblicazione: (2025)
ADE-HGNN: Accelerating HGNNs through Attention Disparity Exploitation
di: Han, Dengke, et al.
Pubblicazione: (2024)
di: Han, Dengke, et al.
Pubblicazione: (2024)
HERO: Hardware-Efficient RL-based Optimization Framework for NeRF Quantization
di: Zhang, Yipu, et al.
Pubblicazione: (2025)
di: Zhang, Yipu, et al.
Pubblicazione: (2025)
H-FA: A Hybrid Floating-Point and Logarithmic Approach to Hardware Accelerated FlashAttention
di: Alexandridis, Kosmas, et al.
Pubblicazione: (2025)
di: Alexandridis, Kosmas, et al.
Pubblicazione: (2025)
Memory-Guided Unified Hardware Accelerator for Mixed-Precision Scientific Computing
di: Wang, Chuanzhen, et al.
Pubblicazione: (2026)
di: Wang, Chuanzhen, et al.
Pubblicazione: (2026)
FlexNeRFer: A Multi-Dataflow, Adaptive Sparsity-Aware Accelerator for On-Device NeRF Rendering
di: Noh, Seock-Hwan, et al.
Pubblicazione: (2025)
di: Noh, Seock-Hwan, et al.
Pubblicazione: (2025)
Hardware-Aware Neural Dropout Search for Reliable Uncertainty Prediction on FPGA
di: Zhang, Zehuan, et al.
Pubblicazione: (2024)
di: Zhang, Zehuan, et al.
Pubblicazione: (2024)
Enabling Efficient Hardware Acceleration of Hybrid Vision Transformer (ViT) Networks at the Edge
di: Dumoulin, Joren, et al.
Pubblicazione: (2025)
di: Dumoulin, Joren, et al.
Pubblicazione: (2025)
Hardware Efficient Accelerator for Spiking Transformer With Reconfigurable Parallel Time Step Computing
di: Chen, Bo-Yu, et al.
Pubblicazione: (2025)
di: Chen, Bo-Yu, et al.
Pubblicazione: (2025)
AutoPDR: Circuit-Aware Solver Configuration Prediction for Hardware Model Checking
di: Hu, Guangyu, et al.
Pubblicazione: (2026)
di: Hu, Guangyu, et al.
Pubblicazione: (2026)
Hardware-Aware DNN Compression for Homogeneous Edge Devices
di: Zhang, Kunlong, et al.
Pubblicazione: (2025)
di: Zhang, Kunlong, et al.
Pubblicazione: (2025)
Aging Aware Adaptive Voltage Scaling for Reliable and Efficient AI Accelerators
di: Xie, Tong, et al.
Pubblicazione: (2026)
di: Xie, Tong, et al.
Pubblicazione: (2026)
Hardware-Aware Neural Network Compilation with Learned Optimization: A RISC-V Accelerator Approach
di: Ganti, Ravindra, et al.
Pubblicazione: (2025)
di: Ganti, Ravindra, et al.
Pubblicazione: (2025)
Cross-Layer Design of Vector-Symbolic Computing: Bridging Cognition and Brain-Inspired Hardware Acceleration
di: Du, Shuting, et al.
Pubblicazione: (2025)
di: Du, Shuting, et al.
Pubblicazione: (2025)
Prosperity: Accelerating Spiking Neural Networks via Product Sparsity
di: Wei, Chiyue, et al.
Pubblicazione: (2025)
di: Wei, Chiyue, et al.
Pubblicazione: (2025)
MCBP: A Memory-Compute Efficient LLM Inference Accelerator Leveraging Bit-Slice-enabled Sparsity and Repetitiveness
di: Wang, Huizheng, et al.
Pubblicazione: (2025)
di: Wang, Huizheng, et al.
Pubblicazione: (2025)
FireBridge: Cycle-Accurate Hardware + Firmware Co-Verification for Modern Accelerators
di: Abarajithan, G, et al.
Pubblicazione: (2026)
di: Abarajithan, G, et al.
Pubblicazione: (2026)
METRO: A Software-Hardware Co-Design of Interconnections for Spatial DNN Accelerators
di: Wang, Zhao, et al.
Pubblicazione: (2021)
di: Wang, Zhao, et al.
Pubblicazione: (2021)
Documenti analoghi
-
SATA: Sparsity-Aware Scheduling for Selective Token Attention
di: Fan, Zhenkun, et al.
Pubblicazione: (2026) -
Multilayer Dataflow: Orchestrate Butterfly Sparsity to Accelerate Attention Computation
di: Wu, Haibin, et al.
Pubblicazione: (2024) -
HASS: Hardware-Aware Sparsity Search for Dataflow DNN Accelerator
di: Yu, Zhewen, et al.
Pubblicazione: (2024) -
SwiftKV: An Edge-Oriented Attention Algorithm and Multi-Head Accelerator for Fast, Efficient LLM Decoding
di: Zhang, Junming, et al.
Pubblicazione: (2026) -
TENET: An Efficient Sparsity-Aware LUT-Centric Architecture for Ternary LLM Inference On Edge
di: Huang, Zhirui, et al.
Pubblicazione: (2025)