AttentionLego: An Open-Source Building Block For Spatially-Scalable Large Language Model Accelerator With Processing-In-Memory Technology
Fuente:
arXiv
Salvato in:
| Autori principali: | Cong, Rongqing, He, Wenyang, Li, Mingxuan, Luo, Bangning, Yang, Zebin, Yang, Yuchao, Huang, Ru, Yan, Bonan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Generalized Ping-Pong: Off-Chip Memory Bandwidth Centric Pipelining Strategy for Processing-In-Memory Accelerators
di: Wang, Ruibao, et al.
Pubblicazione: (2024)
di: Wang, Ruibao, et al.
Pubblicazione: (2024)
RAS: A Bit-Exact rANS Accelerator For High-Performance Neural Lossless Compression
di: Qin, Yuchao, et al.
Pubblicazione: (2025)
di: Qin, Yuchao, et al.
Pubblicazione: (2025)
Non-Binary LDPC Arithmetic Error Correction For Processing-in-Memory
di: Shi, Daijing, et al.
Pubblicazione: (2025)
di: Shi, Daijing, et al.
Pubblicazione: (2025)
LaZagna: An Open-Source Framework for Flexible 3D FPGA Architectural Exploration
di: Youssef, Ismael, et al.
Pubblicazione: (2025)
di: Youssef, Ismael, et al.
Pubblicazione: (2025)
Accelerating Multi-Scale Deformable Attention Using Near-Memory-Processing Architecture
di: Li, Huize, et al.
Pubblicazione: (2026)
di: Li, Huize, et al.
Pubblicazione: (2026)
Efficient Sparse Processing-in-Memory Architecture (ESPIM) for Machine Learning Inference
di: He, Mingxuan, et al.
Pubblicazione: (2024)
di: He, Mingxuan, et al.
Pubblicazione: (2024)
HPIM: Heterogeneous Processing-In-Memory-based Accelerator for Large Language Models Inference
di: Duan, Cenlin, et al.
Pubblicazione: (2025)
di: Duan, Cenlin, et al.
Pubblicazione: (2025)
AutoRAC: Automated Processing-in-Memory Accelerator Design for Recommender Systems
di: Cheng, Feng, et al.
Pubblicazione: (2025)
di: Cheng, Feng, et al.
Pubblicazione: (2025)
Systolic Sparse Tensor Slices: FPGA Building Blocks for Sparse and Dense AI Acceleration
di: Taka, Endri, et al.
Pubblicazione: (2025)
di: Taka, Endri, et al.
Pubblicazione: (2025)
STAR: An Efficient Softmax Engine for Attention Model with RRAM Crossbar
di: Zhai, Yifeng, et al.
Pubblicazione: (2024)
di: Zhai, Yifeng, et al.
Pubblicazione: (2024)
CRYPTONITE: Scalable Accelerator Design for Cryptographic Primitives and Algorithms
di: Maheswaran, Karthikeya Sharma, et al.
Pubblicazione: (2025)
di: Maheswaran, Karthikeya Sharma, et al.
Pubblicazione: (2025)
The BRAM is the Limit: Shattering Myths, Shaping Standards, and Building Scalable PIM Accelerators
di: Kabir, MD Arafat, et al.
Pubblicazione: (2024)
di: Kabir, MD Arafat, et al.
Pubblicazione: (2024)
Ironman: Accelerating Oblivious Transfer Extension for Privacy-Preserving AI with Near-Memory Processing
di: Lin, Chenqi, et al.
Pubblicazione: (2025)
di: Lin, Chenqi, et al.
Pubblicazione: (2025)
Work-In-Progress: Accelerating Numpy With OpenBLAS For Open-Source RISC-V Chips
di: Koenig, Cyril, et al.
Pubblicazione: (2025)
di: Koenig, Cyril, et al.
Pubblicazione: (2025)
CIMPool: Scalable Neural Network Acceleration for Compute-In-Memory using Weight Pools
di: Li, Shurui, et al.
Pubblicazione: (2025)
di: Li, Shurui, et al.
Pubblicazione: (2025)
PIM-malloc: A Fast and Scalable Dynamic Memory Allocator for Processing-In-Memory (PIM) Architectures
di: Lee, Dongjae, et al.
Pubblicazione: (2025)
di: Lee, Dongjae, et al.
Pubblicazione: (2025)
PIMCOMP: An End-to-End DNN Compiler for Processing-In-Memory Accelerators
di: Sun, Xiaotian, et al.
Pubblicazione: (2024)
di: Sun, Xiaotian, et al.
Pubblicazione: (2024)
BlockAMC: Scalable In-Memory Analog Matrix Computing for Solving Linear Systems
di: Pan, Lunshuai, et al.
Pubblicazione: (2024)
di: Pan, Lunshuai, et al.
Pubblicazione: (2024)
"Test, Build, Deploy" -- A CI/CD Framework for Open-Source Hardware Designs
di: Deutschbein, Calvin, et al.
Pubblicazione: (2025)
di: Deutschbein, Calvin, et al.
Pubblicazione: (2025)
From PyTorch to Calyx: An Open-Source Compiler Toolchain for ML Accelerators
di: Xie, Jiahan, et al.
Pubblicazione: (2025)
di: Xie, Jiahan, et al.
Pubblicazione: (2025)
PIMSIM-NN: An ISA-based Simulation Framework for Processing-in-Memory Accelerators
di: Wang, Xinyu, et al.
Pubblicazione: (2024)
di: Wang, Xinyu, et al.
Pubblicazione: (2024)
PIM-GPT: A Hybrid Process-in-Memory Accelerator for Autoregressive Transformers
di: Wu, Yuting, et al.
Pubblicazione: (2023)
di: Wu, Yuting, et al.
Pubblicazione: (2023)
Efficient In-Memory Acceleration of Sparse Block Diagonal LLMs
di: de Lima, João Paulo Cardoso, et al.
Pubblicazione: (2025)
di: de Lima, João Paulo Cardoso, et al.
Pubblicazione: (2025)
End-to-End Transformer Acceleration Through Processing-in-Memory Architectures
di: Yang, Xiaoxuan, et al.
Pubblicazione: (2025)
di: Yang, Xiaoxuan, et al.
Pubblicazione: (2025)
PRIMAL: Processing-In-Memory Based Low-Rank Adaptation for LLM Inference Accelerator
di: Chong, Yue Jiet, et al.
Pubblicazione: (2026)
di: Chong, Yue Jiet, et al.
Pubblicazione: (2026)
Accelerating Time Series Analysis via Processing using Non-Volatile Memories
di: Fernandez, Ivan, et al.
Pubblicazione: (2022)
di: Fernandez, Ivan, et al.
Pubblicazione: (2022)
Systolic Array Acceleration of Diagonal-Optimized Sparse-Sparse Matrix Multiplication for Efficient Quantum Simulation
di: Su, Yuchao, et al.
Pubblicazione: (2025)
di: Su, Yuchao, et al.
Pubblicazione: (2025)
Optimizing and Exploring System Performance in Compact Processing-in-Memory-based Chips
di: Chen, Peilin, et al.
Pubblicazione: (2025)
di: Chen, Peilin, et al.
Pubblicazione: (2025)
LintLLM: An Open-Source Verilog Linting Framework Based on Large Language Models
di: Fang, Zhigang, et al.
Pubblicazione: (2025)
di: Fang, Zhigang, et al.
Pubblicazione: (2025)
Enabling Efficient Transaction Processing on CXL-Based Memory Sharing
di: Wang, Zhao, et al.
Pubblicazione: (2025)
di: Wang, Zhao, et al.
Pubblicazione: (2025)
MIREDO: MIP-Driven Resource-Efficient Dataflow Optimization for Computing-in-Memory Accelerator
di: He, Xiaolin, et al.
Pubblicazione: (2025)
di: He, Xiaolin, et al.
Pubblicazione: (2025)
SOFA: A Compute-Memory Optimized Sparsity Accelerator via Cross-Stage Coordinated Tiling
di: Wang, Huizheng, et al.
Pubblicazione: (2024)
di: Wang, Huizheng, et al.
Pubblicazione: (2024)
BBAL: A Bidirectional Block Floating Point-Based Quantisation Accelerator for Large Language Models
di: Han, Xiaomeng, et al.
Pubblicazione: (2025)
di: Han, Xiaomeng, et al.
Pubblicazione: (2025)
MCBP: A Memory-Compute Efficient LLM Inference Accelerator Leveraging Bit-Slice-enabled Sparsity and Repetitiveness
di: Wang, Huizheng, et al.
Pubblicazione: (2025)
di: Wang, Huizheng, et al.
Pubblicazione: (2025)
GOMA: Geometrically Optimal Mapping via Analytical Modeling for Spatial Accelerators
di: Yang, Wulve, et al.
Pubblicazione: (2026)
di: Yang, Wulve, et al.
Pubblicazione: (2026)
Stream-HLS: Towards Automatic Dataflow Acceleration
di: Basalama, Suhail, et al.
Pubblicazione: (2025)
di: Basalama, Suhail, et al.
Pubblicazione: (2025)
Designing Spatial Architectures for Sparse Attention: STAR Accelerator via Cross-Stage Tiling
di: Wang, Huizheng, et al.
Pubblicazione: (2025)
di: Wang, Huizheng, et al.
Pubblicazione: (2025)
X-HEEP: An Open-Source, Configurable and Extendible RISC-V Microcontroller for the Exploration of Ultra-Low-Power Edge Accelerators
di: Machetti, Simone, et al.
Pubblicazione: (2024)
di: Machetti, Simone, et al.
Pubblicazione: (2024)
HyperCroc: End-to-End Open-Source RISC-V MCU with a Plug-In Interface for Domain-Specific Accelerators
di: Sauter, Philippe, et al.
Pubblicazione: (2026)
di: Sauter, Philippe, et al.
Pubblicazione: (2026)
QED: Scalable Verification of Hardware Memory Consistency
di: Ravi, Gokulan, et al.
Pubblicazione: (2024)
di: Ravi, Gokulan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Generalized Ping-Pong: Off-Chip Memory Bandwidth Centric Pipelining Strategy for Processing-In-Memory Accelerators
di: Wang, Ruibao, et al.
Pubblicazione: (2024) -
RAS: A Bit-Exact rANS Accelerator For High-Performance Neural Lossless Compression
di: Qin, Yuchao, et al.
Pubblicazione: (2025) -
Non-Binary LDPC Arithmetic Error Correction For Processing-in-Memory
di: Shi, Daijing, et al.
Pubblicazione: (2025) -
LaZagna: An Open-Source Framework for Flexible 3D FPGA Architectural Exploration
di: Youssef, Ismael, et al.
Pubblicazione: (2025) -
Accelerating Multi-Scale Deformable Attention Using Near-Memory-Processing Architecture
di: Li, Huize, et al.
Pubblicazione: (2026)