ESACT: An End-to-End Sparse Accelerator for Compute-Intensive Transformers via Local Similarity
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Hongxiang, Deng, Zhifang, Pu, Tong, Lu, Shengli |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
End-to-End Transformer Acceleration Through Processing-in-Memory Architectures
di: Yang, Xiaoxuan, et al.
Pubblicazione: (2025)
di: Yang, Xiaoxuan, et al.
Pubblicazione: (2025)
PoTAcc: A Pipeline for End-to-End Acceleration of Power-of-Two Quantized DNNs
di: Saha, Rappy, et al.
Pubblicazione: (2026)
di: Saha, Rappy, et al.
Pubblicazione: (2026)
TeLLMe v2: An Efficient End-to-End Ternary LLM Prefill and Decode Accelerator with Table-Lookup Matmul on Edge FPGAs
di: Qiao, Ye, et al.
Pubblicazione: (2025)
di: Qiao, Ye, et al.
Pubblicazione: (2025)
PiC-BNN: A 128-kbit 65 nm Processing-in-CAM-Based End-to-End Binary Neural Network Accelerator
di: Harary, Yuval, et al.
Pubblicazione: (2026)
di: Harary, Yuval, et al.
Pubblicazione: (2026)
Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference
di: Yubeaton, Patrick, et al.
Pubblicazione: (2025)
di: Yubeaton, Patrick, et al.
Pubblicazione: (2025)
FSL-HDnn: A 5.7 TOPS/W End-to-end Few-shot Learning Classifier Accelerator with Feature Extraction and Hyperdimensional Computing
di: Yang, Haichao, et al.
Pubblicazione: (2024)
di: Yang, Haichao, et al.
Pubblicazione: (2024)
MiCo: End-to-End Mixed Precision Neural Network Co-Exploration Framework for Edge AI
di: Jiang, Zijun, et al.
Pubblicazione: (2025)
di: Jiang, Zijun, et al.
Pubblicazione: (2025)
iEEG Seizure Detection with a Sparse Hyperdimensional Computing Accelerator
di: Cuyckens, Stef, et al.
Pubblicazione: (2025)
di: Cuyckens, Stef, et al.
Pubblicazione: (2025)
Torch2Chip: An End-to-end Customizable Deep Neural Network Compression and Deployment Toolkit for Prototype Hardware Accelerator Design
di: Meng, Jian, et al.
Pubblicazione: (2024)
di: Meng, Jian, et al.
Pubblicazione: (2024)
Sustainable Transformer Neural Network Acceleration with Stochastic Photonic Computing
di: Afifi, S., et al.
Pubblicazione: (2026)
di: Afifi, S., et al.
Pubblicazione: (2026)
An Analog and Digital Hybrid Attention Accelerator for Transformers with Charge-based In-memory Computing
di: Moradifirouzabadi, Ashkan, et al.
Pubblicazione: (2024)
di: Moradifirouzabadi, Ashkan, et al.
Pubblicazione: (2024)
Mamba-X: An End-to-End Vision Mamba Accelerator for Edge Computing Devices
di: Yoon, Dongho, et al.
Pubblicazione: (2025)
di: Yoon, Dongho, et al.
Pubblicazione: (2025)
MetaML-Pro: Cross-Stage Design Flow Automation for Efficient Deep Learning Acceleration
di: Que, Zhiqiang, et al.
Pubblicazione: (2025)
di: Que, Zhiqiang, et al.
Pubblicazione: (2025)
GCoD: Graph Convolutional Network Acceleration via Dedicated Algorithm and Accelerator Co-Design
di: You, Haoran, et al.
Pubblicazione: (2021)
di: You, Haoran, et al.
Pubblicazione: (2021)
Efficient In-Memory Acceleration of Sparse Block Diagonal LLMs
di: de Lima, João Paulo Cardoso, et al.
Pubblicazione: (2025)
di: de Lima, João Paulo Cardoso, et al.
Pubblicazione: (2025)
COBRA: Algorithm-Architecture Co-optimized Binary Transformer Accelerator for Edge Inference
di: Qiao, Ye, et al.
Pubblicazione: (2025)
di: Qiao, Ye, et al.
Pubblicazione: (2025)
VEXP: A Low-Cost RISC-V ISA Extension for Accelerated Softmax Computation in Transformers
di: Wang, Run, et al.
Pubblicazione: (2025)
di: Wang, Run, et al.
Pubblicazione: (2025)
Accelerating Sparse Graph Neural Networks with Tensor Core Optimization
di: Wu, Ka Wai
Pubblicazione: (2024)
di: Wu, Ka Wai
Pubblicazione: (2024)
FLAASH: Flexible Accelerator Architecture for Sparse High-Order Tensor Contraction
di: Kulp, Gabriel, et al.
Pubblicazione: (2024)
di: Kulp, Gabriel, et al.
Pubblicazione: (2024)
Enabling Unstructured Sparse Acceleration on Structured Sparse Accelerators
di: Jeong, Geonhwa, et al.
Pubblicazione: (2024)
di: Jeong, Geonhwa, et al.
Pubblicazione: (2024)
Binary Weight Multi-Bit Activation Quantization for Compute-in-Memory CNN Accelerators
di: Zhou, Wenyong, et al.
Pubblicazione: (2025)
di: Zhou, Wenyong, et al.
Pubblicazione: (2025)
Efficient yet Accurate End-to-End SC Accelerator Design
di: Li, Meng, et al.
Pubblicazione: (2024)
di: Li, Meng, et al.
Pubblicazione: (2024)
PIMCOMP: An End-to-End DNN Compiler for Processing-In-Memory Accelerators
di: Sun, Xiaotian, et al.
Pubblicazione: (2024)
di: Sun, Xiaotian, et al.
Pubblicazione: (2024)
Accelerating Computer Architecture Simulation through Machine Learning
di: Ali, Wajid, et al.
Pubblicazione: (2024)
di: Ali, Wajid, et al.
Pubblicazione: (2024)
ITA: An Energy-Efficient Attention and Softmax Accelerator for Quantized Transformers
di: İslamoğlu, Gamze, et al.
Pubblicazione: (2023)
di: İslamoğlu, Gamze, et al.
Pubblicazione: (2023)
An Efficient Data Reuse with Tile-Based Adaptive Stationary for Transformer Accelerators
di: Li, Tseng-Jen, et al.
Pubblicazione: (2025)
di: Li, Tseng-Jen, et al.
Pubblicazione: (2025)
GFormer: Accelerating Large Language Models with Optimized Transformers on Gaudi Processors
di: Zhang, Chengming, et al.
Pubblicazione: (2024)
di: Zhang, Chengming, et al.
Pubblicazione: (2024)
An FPGA-Based Reconfigurable Accelerator for Convolution-Transformer Hybrid EfficientViT
di: Shao, Haikuo, et al.
Pubblicazione: (2024)
di: Shao, Haikuo, et al.
Pubblicazione: (2024)
NSFlow: An End-to-End FPGA Framework with Scalable Dataflow Architecture for Neuro-Symbolic AI
di: Yang, Hanchen, et al.
Pubblicazione: (2025)
di: Yang, Hanchen, et al.
Pubblicazione: (2025)
TransAxx: Efficient Transformers with Approximate Computing
di: Danopoulos, Dimitrios, et al.
Pubblicazione: (2024)
di: Danopoulos, Dimitrios, et al.
Pubblicazione: (2024)
Low Power Vision Transformer Accelerator with Hardware-Aware Pruning and Optimized Dataflow
di: Hsiung, Ching-Lin, et al.
Pubblicazione: (2025)
di: Hsiung, Ching-Lin, et al.
Pubblicazione: (2025)
Atleus: Accelerating Transformers on the Edge Enabled by 3D Heterogeneous Manycore Architectures
di: Dhingra, Pratyush, et al.
Pubblicazione: (2025)
di: Dhingra, Pratyush, et al.
Pubblicazione: (2025)
ARTEMIS: A Mixed Analog-Stochastic In-DRAM Accelerator for Transformer Neural Networks
di: Afifi, Salma, et al.
Pubblicazione: (2024)
di: Afifi, Salma, et al.
Pubblicazione: (2024)
U-SWIM: Universal Selective Write-Verify for Computing-in-Memory Neural Accelerators
di: Yan, Zheyu, et al.
Pubblicazione: (2023)
di: Yan, Zheyu, et al.
Pubblicazione: (2023)
Voyager: An End-to-End Framework for Design-Space Exploration and Generation of DNN Accelerators
di: Prabhu, Kartik, et al.
Pubblicazione: (2025)
di: Prabhu, Kartik, et al.
Pubblicazione: (2025)
Reusing Softmax Hardware Unit for GELU Computation in Transformers
di: Peltekis, Christodoulos, et al.
Pubblicazione: (2024)
di: Peltekis, Christodoulos, et al.
Pubblicazione: (2024)
SeVeDo: A Heterogeneous Transformer Accelerator for Low-Bit Inference via Hierarchical Group Quantization and SVD-Guided Mixed Precision
di: Choi, Yuseon, et al.
Pubblicazione: (2025)
di: Choi, Yuseon, et al.
Pubblicazione: (2025)
RACE-IT: A Reconfigurable Analog Computing Engine for In-Memory Transformer Acceleration
di: Zhao, Lei, et al.
Pubblicazione: (2023)
di: Zhao, Lei, et al.
Pubblicazione: (2023)
Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
di: Kim, Wonung, et al.
Pubblicazione: (2025)
di: Kim, Wonung, et al.
Pubblicazione: (2025)
MixDiT: Accelerating Image Diffusion Transformer Inference with Mixed-Precision MX Quantization
di: Kim, Daeun, et al.
Pubblicazione: (2025)
di: Kim, Daeun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
End-to-End Transformer Acceleration Through Processing-in-Memory Architectures
di: Yang, Xiaoxuan, et al.
Pubblicazione: (2025) -
PoTAcc: A Pipeline for End-to-End Acceleration of Power-of-Two Quantized DNNs
di: Saha, Rappy, et al.
Pubblicazione: (2026) -
TeLLMe v2: An Efficient End-to-End Ternary LLM Prefill and Decode Accelerator with Table-Lookup Matmul on Edge FPGAs
di: Qiao, Ye, et al.
Pubblicazione: (2025) -
PiC-BNN: A 128-kbit 65 nm Processing-in-CAM-Based End-to-End Binary Neural Network Accelerator
di: Harary, Yuval, et al.
Pubblicazione: (2026) -
Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference
di: Yubeaton, Patrick, et al.
Pubblicazione: (2025)