ESACT: An End-to-End Sparse Accelerator for Compute-Intensive Transformers via Local Similarity
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Hongxiang, Deng, Zhifang, Pu, Tong, Lu, Shengli |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
End-to-End Transformer Acceleration Through Processing-in-Memory Architectures
por: Yang, Xiaoxuan, et al.
Publicado: (2025)
por: Yang, Xiaoxuan, et al.
Publicado: (2025)
PoTAcc: A Pipeline for End-to-End Acceleration of Power-of-Two Quantized DNNs
por: Saha, Rappy, et al.
Publicado: (2026)
por: Saha, Rappy, et al.
Publicado: (2026)
TeLLMe v2: An Efficient End-to-End Ternary LLM Prefill and Decode Accelerator with Table-Lookup Matmul on Edge FPGAs
por: Qiao, Ye, et al.
Publicado: (2025)
por: Qiao, Ye, et al.
Publicado: (2025)
PiC-BNN: A 128-kbit 65 nm Processing-in-CAM-Based End-to-End Binary Neural Network Accelerator
por: Harary, Yuval, et al.
Publicado: (2026)
por: Harary, Yuval, et al.
Publicado: (2026)
Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference
por: Yubeaton, Patrick, et al.
Publicado: (2025)
por: Yubeaton, Patrick, et al.
Publicado: (2025)
FSL-HDnn: A 5.7 TOPS/W End-to-end Few-shot Learning Classifier Accelerator with Feature Extraction and Hyperdimensional Computing
por: Yang, Haichao, et al.
Publicado: (2024)
por: Yang, Haichao, et al.
Publicado: (2024)
MiCo: End-to-End Mixed Precision Neural Network Co-Exploration Framework for Edge AI
por: Jiang, Zijun, et al.
Publicado: (2025)
por: Jiang, Zijun, et al.
Publicado: (2025)
iEEG Seizure Detection with a Sparse Hyperdimensional Computing Accelerator
por: Cuyckens, Stef, et al.
Publicado: (2025)
por: Cuyckens, Stef, et al.
Publicado: (2025)
Torch2Chip: An End-to-end Customizable Deep Neural Network Compression and Deployment Toolkit for Prototype Hardware Accelerator Design
por: Meng, Jian, et al.
Publicado: (2024)
por: Meng, Jian, et al.
Publicado: (2024)
Sustainable Transformer Neural Network Acceleration with Stochastic Photonic Computing
por: Afifi, S., et al.
Publicado: (2026)
por: Afifi, S., et al.
Publicado: (2026)
An Analog and Digital Hybrid Attention Accelerator for Transformers with Charge-based In-memory Computing
por: Moradifirouzabadi, Ashkan, et al.
Publicado: (2024)
por: Moradifirouzabadi, Ashkan, et al.
Publicado: (2024)
Mamba-X: An End-to-End Vision Mamba Accelerator for Edge Computing Devices
por: Yoon, Dongho, et al.
Publicado: (2025)
por: Yoon, Dongho, et al.
Publicado: (2025)
MetaML-Pro: Cross-Stage Design Flow Automation for Efficient Deep Learning Acceleration
por: Que, Zhiqiang, et al.
Publicado: (2025)
por: Que, Zhiqiang, et al.
Publicado: (2025)
GCoD: Graph Convolutional Network Acceleration via Dedicated Algorithm and Accelerator Co-Design
por: You, Haoran, et al.
Publicado: (2021)
por: You, Haoran, et al.
Publicado: (2021)
Efficient In-Memory Acceleration of Sparse Block Diagonal LLMs
por: de Lima, João Paulo Cardoso, et al.
Publicado: (2025)
por: de Lima, João Paulo Cardoso, et al.
Publicado: (2025)
COBRA: Algorithm-Architecture Co-optimized Binary Transformer Accelerator for Edge Inference
por: Qiao, Ye, et al.
Publicado: (2025)
por: Qiao, Ye, et al.
Publicado: (2025)
VEXP: A Low-Cost RISC-V ISA Extension for Accelerated Softmax Computation in Transformers
por: Wang, Run, et al.
Publicado: (2025)
por: Wang, Run, et al.
Publicado: (2025)
Accelerating Sparse Graph Neural Networks with Tensor Core Optimization
por: Wu, Ka Wai
Publicado: (2024)
por: Wu, Ka Wai
Publicado: (2024)
FLAASH: Flexible Accelerator Architecture for Sparse High-Order Tensor Contraction
por: Kulp, Gabriel, et al.
Publicado: (2024)
por: Kulp, Gabriel, et al.
Publicado: (2024)
Enabling Unstructured Sparse Acceleration on Structured Sparse Accelerators
por: Jeong, Geonhwa, et al.
Publicado: (2024)
por: Jeong, Geonhwa, et al.
Publicado: (2024)
Binary Weight Multi-Bit Activation Quantization for Compute-in-Memory CNN Accelerators
por: Zhou, Wenyong, et al.
Publicado: (2025)
por: Zhou, Wenyong, et al.
Publicado: (2025)
Efficient yet Accurate End-to-End SC Accelerator Design
por: Li, Meng, et al.
Publicado: (2024)
por: Li, Meng, et al.
Publicado: (2024)
PIMCOMP: An End-to-End DNN Compiler for Processing-In-Memory Accelerators
por: Sun, Xiaotian, et al.
Publicado: (2024)
por: Sun, Xiaotian, et al.
Publicado: (2024)
Accelerating Computer Architecture Simulation through Machine Learning
por: Ali, Wajid, et al.
Publicado: (2024)
por: Ali, Wajid, et al.
Publicado: (2024)
ITA: An Energy-Efficient Attention and Softmax Accelerator for Quantized Transformers
por: İslamoğlu, Gamze, et al.
Publicado: (2023)
por: İslamoğlu, Gamze, et al.
Publicado: (2023)
An Efficient Data Reuse with Tile-Based Adaptive Stationary for Transformer Accelerators
por: Li, Tseng-Jen, et al.
Publicado: (2025)
por: Li, Tseng-Jen, et al.
Publicado: (2025)
GFormer: Accelerating Large Language Models with Optimized Transformers on Gaudi Processors
por: Zhang, Chengming, et al.
Publicado: (2024)
por: Zhang, Chengming, et al.
Publicado: (2024)
An FPGA-Based Reconfigurable Accelerator for Convolution-Transformer Hybrid EfficientViT
por: Shao, Haikuo, et al.
Publicado: (2024)
por: Shao, Haikuo, et al.
Publicado: (2024)
NSFlow: An End-to-End FPGA Framework with Scalable Dataflow Architecture for Neuro-Symbolic AI
por: Yang, Hanchen, et al.
Publicado: (2025)
por: Yang, Hanchen, et al.
Publicado: (2025)
TransAxx: Efficient Transformers with Approximate Computing
por: Danopoulos, Dimitrios, et al.
Publicado: (2024)
por: Danopoulos, Dimitrios, et al.
Publicado: (2024)
Low Power Vision Transformer Accelerator with Hardware-Aware Pruning and Optimized Dataflow
por: Hsiung, Ching-Lin, et al.
Publicado: (2025)
por: Hsiung, Ching-Lin, et al.
Publicado: (2025)
Atleus: Accelerating Transformers on the Edge Enabled by 3D Heterogeneous Manycore Architectures
por: Dhingra, Pratyush, et al.
Publicado: (2025)
por: Dhingra, Pratyush, et al.
Publicado: (2025)
ARTEMIS: A Mixed Analog-Stochastic In-DRAM Accelerator for Transformer Neural Networks
por: Afifi, Salma, et al.
Publicado: (2024)
por: Afifi, Salma, et al.
Publicado: (2024)
U-SWIM: Universal Selective Write-Verify for Computing-in-Memory Neural Accelerators
por: Yan, Zheyu, et al.
Publicado: (2023)
por: Yan, Zheyu, et al.
Publicado: (2023)
Voyager: An End-to-End Framework for Design-Space Exploration and Generation of DNN Accelerators
por: Prabhu, Kartik, et al.
Publicado: (2025)
por: Prabhu, Kartik, et al.
Publicado: (2025)
Reusing Softmax Hardware Unit for GELU Computation in Transformers
por: Peltekis, Christodoulos, et al.
Publicado: (2024)
por: Peltekis, Christodoulos, et al.
Publicado: (2024)
SeVeDo: A Heterogeneous Transformer Accelerator for Low-Bit Inference via Hierarchical Group Quantization and SVD-Guided Mixed Precision
por: Choi, Yuseon, et al.
Publicado: (2025)
por: Choi, Yuseon, et al.
Publicado: (2025)
RACE-IT: A Reconfigurable Analog Computing Engine for In-Memory Transformer Acceleration
por: Zhao, Lei, et al.
Publicado: (2023)
por: Zhao, Lei, et al.
Publicado: (2023)
Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
por: Kim, Wonung, et al.
Publicado: (2025)
por: Kim, Wonung, et al.
Publicado: (2025)
MixDiT: Accelerating Image Diffusion Transformer Inference with Mixed-Precision MX Quantization
por: Kim, Daeun, et al.
Publicado: (2025)
por: Kim, Daeun, et al.
Publicado: (2025)
Ejemplares similares
-
End-to-End Transformer Acceleration Through Processing-in-Memory Architectures
por: Yang, Xiaoxuan, et al.
Publicado: (2025) -
PoTAcc: A Pipeline for End-to-End Acceleration of Power-of-Two Quantized DNNs
por: Saha, Rappy, et al.
Publicado: (2026) -
TeLLMe v2: An Efficient End-to-End Ternary LLM Prefill and Decode Accelerator with Table-Lookup Matmul on Edge FPGAs
por: Qiao, Ye, et al.
Publicado: (2025) -
PiC-BNN: A 128-kbit 65 nm Processing-in-CAM-Based End-to-End Binary Neural Network Accelerator
por: Harary, Yuval, et al.
Publicado: (2026) -
Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference
por: Yubeaton, Patrick, et al.
Publicado: (2025)