SOFA: A Compute-Memory Optimized Sparsity Accelerator via Cross-Stage Coordinated Tiling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Huizheng, Fang, Jiahao, Tang, Xinru, Yue, Zhiheng, Li, Jinxi, Qin, Yubin, Guan, Sihan, Yang, Qize, Wang, Yang, Li, Chao, Hu, Yang, Yin, Shouyi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Designing Spatial Architectures for Sparse Attention: STAR Accelerator via Cross-Stage Tiling
par: Wang, Huizheng, et autres
Publié: (2025)
par: Wang, Huizheng, et autres
Publié: (2025)
MCBP: A Memory-Compute Efficient LLM Inference Accelerator Leveraging Bit-Slice-enabled Sparsity and Repetitiveness
par: Wang, Huizheng, et autres
Publié: (2025)
par: Wang, Huizheng, et autres
Publié: (2025)
PADE: A Predictor-Free Sparse Attention Accelerator via Unified Execution and Stage Fusion
par: Wang, Huizheng, et autres
Publié: (2025)
par: Wang, Huizheng, et autres
Publié: (2025)
Efficient Orchestrated AI Workflows Execution on Scale-out Spatial Architecture
par: Deng, Jinyi, et autres
Publié: (2024)
par: Deng, Jinyi, et autres
Publié: (2024)
TEMP: A Memory Efficient Physical-aware Tensor Partition-Mapping Framework on Wafer-scale Chips
par: Wang, Huizheng, et autres
Publié: (2025)
par: Wang, Huizheng, et autres
Publié: (2025)
From Quarter to All: Accelerating Speculative LLM Decoding via Floating-Point Exponent Remapping and Parameter Sharing
par: Zhao, Yushu, et autres
Publié: (2025)
par: Zhao, Yushu, et autres
Publié: (2025)
VIKIN: A Reconfigurable Accelerator for KANs and MLPs with Two-Stage Sparsity Support
par: Ou, Wenhui, et autres
Publié: (2026)
par: Ou, Wenhui, et autres
Publié: (2026)
Prosperity: Accelerating Spiking Neural Networks via Product Sparsity
par: Wei, Chiyue, et autres
Publié: (2025)
par: Wei, Chiyue, et autres
Publié: (2025)
StreamDCIM: A Tile-based Streaming Digital CIM Accelerator with Mixed-stationary Cross-forwarding Dataflow for Multimodal Transformer
par: Qin, Shantian, et autres
Publié: (2025)
par: Qin, Shantian, et autres
Publié: (2025)
Sparsity-Aware Streaming SNN Accelerator with Output-Channel Dataflow for Automatic Modulation Classification
par: Yang, Kuilian, et autres
Publié: (2026)
par: Yang, Kuilian, et autres
Publié: (2026)
Aging Aware Adaptive Voltage Scaling for Reliable and Efficient AI Accelerators
par: Xie, Tong, et autres
Publié: (2026)
par: Xie, Tong, et autres
Publié: (2026)
A Switch-Centric In-Network Architecture for Accelerating LLM Inference in Shared-Memory Network
par: Jiang, Aojie, et autres
Publié: (2026)
par: Jiang, Aojie, et autres
Publié: (2026)
HPIM: Heterogeneous Processing-In-Memory-based Accelerator for Large Language Models Inference
par: Duan, Cenlin, et autres
Publié: (2025)
par: Duan, Cenlin, et autres
Publié: (2025)
Ironman: Accelerating Oblivious Transfer Extension for Privacy-Preserving AI with Near-Memory Processing
par: Lin, Chenqi, et autres
Publié: (2025)
par: Lin, Chenqi, et autres
Publié: (2025)
A Bit Level Weight Reordering Strategy Based on Column Similarity to Explore Weight Sparsity in RRAM-based NN Accelerator
par: Yang, Weiping, et autres
Publié: (2025)
par: Yang, Weiping, et autres
Publié: (2025)
AutoRAC: Automated Processing-in-Memory Accelerator Design for Recommender Systems
par: Cheng, Feng, et autres
Publié: (2025)
par: Cheng, Feng, et autres
Publié: (2025)
Multilayer Dataflow: Orchestrate Butterfly Sparsity to Accelerate Attention Computation
par: Wu, Haibin, et autres
Publié: (2024)
par: Wu, Haibin, et autres
Publié: (2024)
LogicSparse: Enabling Engine-Free Unstructured Sparsity for Quantised Deep-learning Accelerators
par: Li, Changhong, et autres
Publié: (2025)
par: Li, Changhong, et autres
Publié: (2025)
Be CIM or Be Memory: A Dual-mode-aware DNN Compiler for CIM Accelerators
par: Zhao, Shixin, et autres
Publié: (2025)
par: Zhao, Shixin, et autres
Publié: (2025)
FireFly-S: Exploiting Dual-Side Sparsity for Spiking Neural Networks Acceleration with Reconfigurable Spatial Architecture
par: Li, Tenglong, et autres
Publié: (2024)
par: Li, Tenglong, et autres
Publié: (2024)
FireFly-T: High-Throughput Sparsity Exploitation for Spiking Transformer Acceleration with Dual-Engine Overlay Architecture
par: Li, Tenglong, et autres
Publié: (2025)
par: Li, Tenglong, et autres
Publié: (2025)
PIMCOMP: An End-to-End DNN Compiler for Processing-In-Memory Accelerators
par: Sun, Xiaotian, et autres
Publié: (2024)
par: Sun, Xiaotian, et autres
Publié: (2024)
Tensor Manipulation Unit (TMU): Reconfigurable, Near-Memory Tensor Manipulation for High-Throughput AI SoC
par: Zhou, Weiyu, et autres
Publié: (2025)
par: Zhou, Weiyu, et autres
Publié: (2025)
Towards Efficient SRAM-PIM Architecture Design by Exploiting Unstructured Bit-Level Sparsity
par: Duan, Cenlin, et autres
Publié: (2024)
par: Duan, Cenlin, et autres
Publié: (2024)
The Quest for Reliable AI Accelerators: Cross-Layer Evaluation and Design Optimization
par: Li, Meng, et autres
Publié: (2026)
par: Li, Meng, et autres
Publié: (2026)
MIREDO: MIP-Driven Resource-Efficient Dataflow Optimization for Computing-in-Memory Accelerator
par: He, Xiaolin, et autres
Publié: (2025)
par: He, Xiaolin, et autres
Publié: (2025)
An Efficient Data Reuse with Tile-Based Adaptive Stationary for Transformer Accelerators
par: Li, Tseng-Jen, et autres
Publié: (2025)
par: Li, Tseng-Jen, et autres
Publié: (2025)
Efficient SRAM-PIM Co-design by Joint Exploration of Value-Level and Bit-Level Sparsity
par: Duan, Cenlin, et autres
Publié: (2025)
par: Duan, Cenlin, et autres
Publié: (2025)
Accelerating Multi-Scale Deformable Attention Using Near-Memory-Processing Architecture
par: Li, Huize, et autres
Publié: (2026)
par: Li, Huize, et autres
Publié: (2026)
AccelCIM: Systematic Dataflow Exploration for SRAM Compute-in-Memory Accelerator
par: Xue, Chenhao, et autres
Publié: (2026)
par: Xue, Chenhao, et autres
Publié: (2026)
FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators
par: Zhang, Chi, et autres
Publié: (2025)
par: Zhang, Chi, et autres
Publié: (2025)
A 33.6-136.2 TOPS/W Nonlinear Analog Computing-In-Memory Macro for Multi-bit LSTM Accelerator in 65 nm CMOS
par: Yang, Junyi, et autres
Publié: (2025)
par: Yang, Junyi, et autres
Publié: (2025)
Generalized Ping-Pong: Off-Chip Memory Bandwidth Centric Pipelining Strategy for Processing-In-Memory Accelerators
par: Wang, Ruibao, et autres
Publié: (2024)
par: Wang, Ruibao, et autres
Publié: (2024)
NOVA: Coordinated Test Selection and Bayes-Optimized Constrained Randomization for Accelerated Coverage Closure
par: Peng, Weijie, et autres
Publié: (2025)
par: Peng, Weijie, et autres
Publié: (2025)
CIMPool: Scalable Neural Network Acceleration for Compute-In-Memory using Weight Pools
par: Li, Shurui, et autres
Publié: (2025)
par: Li, Shurui, et autres
Publié: (2025)
Survey of Disaggregated Memory: Cross-layer Technique Insights for Next-Generation Datacenters
par: Wang, Jing, et autres
Publié: (2025)
par: Wang, Jing, et autres
Publié: (2025)
TurboFuzz: FPGA Accelerated Hardware Fuzzing for Processor Agile Verification
par: Zhong, Yang, et autres
Publié: (2025)
par: Zhong, Yang, et autres
Publié: (2025)
Memory-Guided Unified Hardware Accelerator for Mixed-Precision Scientific Computing
par: Wang, Chuanzhen, et autres
Publié: (2026)
par: Wang, Chuanzhen, et autres
Publié: (2026)
PIM-GPT: A Hybrid Process-in-Memory Accelerator for Autoregressive Transformers
par: Wu, Yuting, et autres
Publié: (2023)
par: Wu, Yuting, et autres
Publié: (2023)
DCI: A Coordinated Allocation and Filling Workload-Aware Dual-Cache Allocation GNN Inference Acceleration System
par: Luo, Yi, et autres
Publié: (2025)
par: Luo, Yi, et autres
Publié: (2025)
Documents similaires
-
Designing Spatial Architectures for Sparse Attention: STAR Accelerator via Cross-Stage Tiling
par: Wang, Huizheng, et autres
Publié: (2025) -
MCBP: A Memory-Compute Efficient LLM Inference Accelerator Leveraging Bit-Slice-enabled Sparsity and Repetitiveness
par: Wang, Huizheng, et autres
Publié: (2025) -
PADE: A Predictor-Free Sparse Attention Accelerator via Unified Execution and Stage Fusion
par: Wang, Huizheng, et autres
Publié: (2025) -
Efficient Orchestrated AI Workflows Execution on Scale-out Spatial Architecture
par: Deng, Jinyi, et autres
Publié: (2024) -
TEMP: A Memory Efficient Physical-aware Tensor Partition-Mapping Framework on Wafer-scale Chips
par: Wang, Huizheng, et autres
Publié: (2025)