EPIM: Efficient Processing-In-Memory Accelerators based on Epitome
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Chenyu, Dong, Zhen, Zhou, Daquan, Zhu, Zhenhua, Wang, Yu, Feng, Jiashi, Keutzer, Kurt |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FGMP: Fine-Grained Mixed-Precision Weight and Activation Quantization for Hardware-Accelerated LLM Inference
di: Hooper, Coleman, et al.
Pubblicazione: (2025)
di: Hooper, Coleman, et al.
Pubblicazione: (2025)
End-to-End Transformer Acceleration Through Processing-in-Memory Architectures
di: Yang, Xiaoxuan, et al.
Pubblicazione: (2025)
di: Yang, Xiaoxuan, et al.
Pubblicazione: (2025)
Efficient In-Memory Acceleration of Sparse Block Diagonal LLMs
di: de Lima, João Paulo Cardoso, et al.
Pubblicazione: (2025)
di: de Lima, João Paulo Cardoso, et al.
Pubblicazione: (2025)
Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
di: Kim, Wonung, et al.
Pubblicazione: (2025)
di: Kim, Wonung, et al.
Pubblicazione: (2025)
Efficient Calibration for RRAM-based In-Memory Computing using DoRA
di: Dong, Weirong, et al.
Pubblicazione: (2025)
di: Dong, Weirong, et al.
Pubblicazione: (2025)
AI and Memory Wall
di: Gholami, Amir, et al.
Pubblicazione: (2024)
di: Gholami, Amir, et al.
Pubblicazione: (2024)
Binary Weight Multi-Bit Activation Quantization for Compute-in-Memory CNN Accelerators
di: Zhou, Wenyong, et al.
Pubblicazione: (2025)
di: Zhou, Wenyong, et al.
Pubblicazione: (2025)
A Persistent-State Dataflow Accelerator for Memory-Bound Linear Attention Decode on FPGA
di: Gupta, Neelesh, et al.
Pubblicazione: (2026)
di: Gupta, Neelesh, et al.
Pubblicazione: (2026)
CHIME: Chiplet-based Heterogeneous Near-Memory Acceleration for Edge Multimodal LLM Inference
di: Chen, Yanru, et al.
Pubblicazione: (2025)
di: Chen, Yanru, et al.
Pubblicazione: (2025)
An FPGA-Based Accelerator Enabling Efficient Support for CNNs with Arbitrary Kernel Sizes
di: Wang, Miaoxin, et al.
Pubblicazione: (2024)
di: Wang, Miaoxin, et al.
Pubblicazione: (2024)
HePGA: A Heterogeneous Processing-in-Memory based GNN Training Accelerator
di: Ogbogu, Chukwufumnanya, et al.
Pubblicazione: (2025)
di: Ogbogu, Chukwufumnanya, et al.
Pubblicazione: (2025)
An FPGA-Based Reconfigurable Accelerator for Convolution-Transformer Hybrid EfficientViT
di: Shao, Haikuo, et al.
Pubblicazione: (2024)
di: Shao, Haikuo, et al.
Pubblicazione: (2024)
On-Device Qwen2.5: Efficient LLM Inference with Model Compression and Hardware Acceleration
di: Xiang, Maoyang, et al.
Pubblicazione: (2025)
di: Xiang, Maoyang, et al.
Pubblicazione: (2025)
Memory Is All You Need: An Overview of Compute-in-Memory Architectures for Accelerating Large Language Model Inference
di: Wolters, Christopher, et al.
Pubblicazione: (2024)
di: Wolters, Christopher, et al.
Pubblicazione: (2024)
OPIMA: Optical Processing-In-Memory for Convolutional Neural Network Acceleration
di: Sunny, Febin, et al.
Pubblicazione: (2024)
di: Sunny, Febin, et al.
Pubblicazione: (2024)
TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs
di: Qiao, Ye, et al.
Pubblicazione: (2025)
di: Qiao, Ye, et al.
Pubblicazione: (2025)
U-SWIM: Universal Selective Write-Verify for Computing-in-Memory Neural Accelerators
di: Yan, Zheyu, et al.
Pubblicazione: (2023)
di: Yan, Zheyu, et al.
Pubblicazione: (2023)
EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture
di: Duan, Bowen, et al.
Pubblicazione: (2026)
di: Duan, Bowen, et al.
Pubblicazione: (2026)
GFormer: Accelerating Large Language Models with Optimized Transformers on Gaudi Processors
di: Zhang, Chengming, et al.
Pubblicazione: (2024)
di: Zhang, Chengming, et al.
Pubblicazione: (2024)
Designing Efficient LLM Accelerators for Edge Devices
di: Haris, Jude, et al.
Pubblicazione: (2024)
di: Haris, Jude, et al.
Pubblicazione: (2024)
TrainDeeploy: Hardware-Accelerated Parameter-Efficient Fine-Tuning of Small Transformer Models at the Extreme Edge
di: Wang, Run, et al.
Pubblicazione: (2026)
di: Wang, Run, et al.
Pubblicazione: (2026)
Memory-Efficient FPGA Implementation of Stochastic Simulated Annealing
di: Shin, Duckgyu, et al.
Pubblicazione: (2026)
di: Shin, Duckgyu, et al.
Pubblicazione: (2026)
Token-Picker: Accelerating Attention in Text Generation with Minimized Memory Transfer via Probability Estimation
di: Park, Junyoung, et al.
Pubblicazione: (2024)
di: Park, Junyoung, et al.
Pubblicazione: (2024)
When Small Variations Become Big Failures: Reliability Challenges in Compute-in-Memory Neural Accelerators
di: Qin, Yifan, et al.
Pubblicazione: (2026)
di: Qin, Yifan, et al.
Pubblicazione: (2026)
ITA: An Energy-Efficient Attention and Softmax Accelerator for Quantized Transformers
di: İslamoğlu, Gamze, et al.
Pubblicazione: (2023)
di: İslamoğlu, Gamze, et al.
Pubblicazione: (2023)
Accelerating Neural Networks for Large Language Models and Graph Processing with Silicon Photonics
di: Afifi, Salma, et al.
Pubblicazione: (2024)
di: Afifi, Salma, et al.
Pubblicazione: (2024)
DG-RePlAce: A Dataflow-Driven GPU-Accelerated Analytical Global Placement Framework for Machine Learning Accelerators
di: Kahng, Andrew B., et al.
Pubblicazione: (2024)
di: Kahng, Andrew B., et al.
Pubblicazione: (2024)
Efficient Tabular Data Preprocessing of ML Pipelines
di: Zhu, Yu, et al.
Pubblicazione: (2024)
di: Zhu, Yu, et al.
Pubblicazione: (2024)
SafeCiM: Investigating Resilience of Hybrid Floating-Point Compute-in-Memory Deep Learning Accelerators
di: Bhattacharya, Swastik, et al.
Pubblicazione: (2025)
di: Bhattacharya, Swastik, et al.
Pubblicazione: (2025)
Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective
di: Li, Jinhao, et al.
Pubblicazione: (2024)
di: Li, Jinhao, et al.
Pubblicazione: (2024)
TeLLMe v2: An Efficient End-to-End Ternary LLM Prefill and Decode Accelerator with Table-Lookup Matmul on Edge FPGAs
di: Qiao, Ye, et al.
Pubblicazione: (2025)
di: Qiao, Ye, et al.
Pubblicazione: (2025)
Layer-wise Weight Selection for Power-Efficient Neural Network Acceleration
di: Fang, Jiaxun, et al.
Pubblicazione: (2025)
di: Fang, Jiaxun, et al.
Pubblicazione: (2025)
An Efficient Data Reuse with Tile-Based Adaptive Stationary for Transformer Accelerators
di: Li, Tseng-Jen, et al.
Pubblicazione: (2025)
di: Li, Tseng-Jen, et al.
Pubblicazione: (2025)
SiHGNN: Leveraging Properties of Semantic Graphs for Efficient HGNN Acceleration
di: Xue, Runzhen, et al.
Pubblicazione: (2024)
di: Xue, Runzhen, et al.
Pubblicazione: (2024)
Effective and Memory-Efficient Alternatives to ECC for Reliable Large-Scale DNNs
di: Ahmadilivani, Mohammad Hasan, et al.
Pubblicazione: (2026)
di: Ahmadilivani, Mohammad Hasan, et al.
Pubblicazione: (2026)
HPIM: Heterogeneous Processing-In-Memory-based Accelerator for Large Language Models Inference
di: Duan, Cenlin, et al.
Pubblicazione: (2025)
di: Duan, Cenlin, et al.
Pubblicazione: (2025)
Column-wise Quantization of Weights and Partial Sums for Accurate and Efficient Compute-In-Memory Accelerators
di: Kim, Jiyoon, et al.
Pubblicazione: (2025)
di: Kim, Jiyoon, et al.
Pubblicazione: (2025)
RETENTION: Resource-Efficient Tree-Based Ensemble Model Acceleration with Content-Addressable Memory
di: Liao, Yi-Chun, et al.
Pubblicazione: (2025)
di: Liao, Yi-Chun, et al.
Pubblicazione: (2025)
Enabling Long FFT Convolutions on Memory-Constrained FPGAs via Chunking
di: Wang, Peter, et al.
Pubblicazione: (2025)
di: Wang, Peter, et al.
Pubblicazione: (2025)
MAx-DNN: Multi-Level Arithmetic Approximation for Energy-Efficient DNN Hardware Accelerators
di: Leon, Vasileios, et al.
Pubblicazione: (2025)
di: Leon, Vasileios, et al.
Pubblicazione: (2025)
Documenti analoghi
-
FGMP: Fine-Grained Mixed-Precision Weight and Activation Quantization for Hardware-Accelerated LLM Inference
di: Hooper, Coleman, et al.
Pubblicazione: (2025) -
End-to-End Transformer Acceleration Through Processing-in-Memory Architectures
di: Yang, Xiaoxuan, et al.
Pubblicazione: (2025) -
Efficient In-Memory Acceleration of Sparse Block Diagonal LLMs
di: de Lima, João Paulo Cardoso, et al.
Pubblicazione: (2025) -
Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
di: Kim, Wonung, et al.
Pubblicazione: (2025) -
Efficient Calibration for RRAM-based In-Memory Computing using DoRA
di: Dong, Weirong, et al.
Pubblicazione: (2025)