SHIELD: A Segmented Hierarchical Memory Architecture for Energy-Efficient LLM Inference on Edge NPUs
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Jintao, Fong, Xuanyao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LEAP: LLM Inference on Scalable PIM-NoC Architecture with Balanced Dataflow and Fine-Grained Parallelism
di: Wang, Yimin, et al.
Pubblicazione: (2025)
di: Wang, Yimin, et al.
Pubblicazione: (2025)
PRIMAL: Processing-In-Memory Based Low-Rank Adaptation for LLM Inference Accelerator
di: Chong, Yue Jiet, et al.
Pubblicazione: (2026)
di: Chong, Yue Jiet, et al.
Pubblicazione: (2026)
From Principles to Practice: A Systematic Study of LLM Serving on Multi-core NPUs
di: Zhu, Tianhao, et al.
Pubblicazione: (2025)
di: Zhu, Tianhao, et al.
Pubblicazione: (2025)
CHIME: Chiplet-based Heterogeneous Near-Memory Acceleration for Edge Multimodal LLM Inference
di: Chen, Yanru, et al.
Pubblicazione: (2025)
di: Chen, Yanru, et al.
Pubblicazione: (2025)
Benchmarking Ultra-Low-Power $μ$NPUs
di: Millar, Josh, et al.
Pubblicazione: (2025)
di: Millar, Josh, et al.
Pubblicazione: (2025)
Hierarchical Recording Architecture for Three-Dimensional Magnetic Recording
di: Jian, Yugen, et al.
Pubblicazione: (2025)
di: Jian, Yugen, et al.
Pubblicazione: (2025)
PICNIC: Silicon Photonic Interconnected Chiplets with Computational Network and In-memory Computing for LLM Inference Acceleration
di: Chong, Yue Jiet, et al.
Pubblicazione: (2025)
di: Chong, Yue Jiet, et al.
Pubblicazione: (2025)
TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs
di: Qiao, Ye, et al.
Pubblicazione: (2025)
di: Qiao, Ye, et al.
Pubblicazione: (2025)
COBRA: Algorithm-Architecture Co-optimized Binary Transformer Accelerator for Edge Inference
di: Qiao, Ye, et al.
Pubblicazione: (2025)
di: Qiao, Ye, et al.
Pubblicazione: (2025)
xTern: Energy-Efficient Ternary Neural Network Inference on RISC-V-Based Edge Systems
di: Rutishauser, Georg, et al.
Pubblicazione: (2024)
di: Rutishauser, Georg, et al.
Pubblicazione: (2024)
Designing Efficient LLM Accelerators for Edge Devices
di: Haris, Jude, et al.
Pubblicazione: (2024)
di: Haris, Jude, et al.
Pubblicazione: (2024)
Memory Is All You Need: An Overview of Compute-in-Memory Architectures for Accelerating Large Language Model Inference
di: Wolters, Christopher, et al.
Pubblicazione: (2024)
di: Wolters, Christopher, et al.
Pubblicazione: (2024)
PolyThrottle: Energy-efficient Neural Network Inference on Edge Devices
di: Yan, Minghao, et al.
Pubblicazione: (2023)
di: Yan, Minghao, et al.
Pubblicazione: (2023)
Huff-LLM: End-to-End Lossless Compression for Efficient LLM Inference
di: Yubeaton, Patrick, et al.
Pubblicazione: (2025)
di: Yubeaton, Patrick, et al.
Pubblicazione: (2025)
P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats
di: Chen, Yuzong, et al.
Pubblicazione: (2025)
di: Chen, Yuzong, et al.
Pubblicazione: (2025)
EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture
di: Duan, Bowen, et al.
Pubblicazione: (2026)
di: Duan, Bowen, et al.
Pubblicazione: (2026)
From LLM to Silicon: RL-Driven ASIC Architecture Exploration for On-Device AI Inference
di: Ganti, Ravindra, et al.
Pubblicazione: (2026)
di: Ganti, Ravindra, et al.
Pubblicazione: (2026)
MemExplorer: Navigating the Heterogeneous Memory Design Space for Agentic Inference NPUs
di: Wu, Haoran, et al.
Pubblicazione: (2026)
di: Wu, Haoran, et al.
Pubblicazione: (2026)
L3: DIMM-PIM Integrated Architecture and Coordination for Scalable Long-Context LLM Inference
di: Liu, Qingyuan, et al.
Pubblicazione: (2025)
di: Liu, Qingyuan, et al.
Pubblicazione: (2025)
On-Device Qwen2.5: Efficient LLM Inference with Model Compression and Hardware Acceleration
di: Xiang, Maoyang, et al.
Pubblicazione: (2025)
di: Xiang, Maoyang, et al.
Pubblicazione: (2025)
ENEC: A Lossless AI Model Compression Method Enabling Fast Inference on Ascend NPUs
di: Yang, Jinwu, et al.
Pubblicazione: (2026)
di: Yang, Jinwu, et al.
Pubblicazione: (2026)
TeLLMe v2: An Efficient End-to-End Ternary LLM Prefill and Decode Accelerator with Table-Lookup Matmul on Edge FPGAs
di: Qiao, Ye, et al.
Pubblicazione: (2025)
di: Qiao, Ye, et al.
Pubblicazione: (2025)
Taming the Exponential: A Fast Softmax Surrogate for Integer-Native Edge Inference
di: Danopoulos, Dimitrios, et al.
Pubblicazione: (2026)
di: Danopoulos, Dimitrios, et al.
Pubblicazione: (2026)
PACiM: A Sparsity-Centric Hybrid Compute-in-Memory Architecture via Probabilistic Approximation
di: Zhang, Wenlun, et al.
Pubblicazione: (2024)
di: Zhang, Wenlun, et al.
Pubblicazione: (2024)
A Hybrid Edge Classifier: Combining TinyML-Optimised CNN with RRAM-CMOS ACAM for Energy-Efficient Inference
di: Woodward, Kieran, et al.
Pubblicazione: (2025)
di: Woodward, Kieran, et al.
Pubblicazione: (2025)
End-to-End Transformer Acceleration Through Processing-in-Memory Architectures
di: Yang, Xiaoxuan, et al.
Pubblicazione: (2025)
di: Yang, Xiaoxuan, et al.
Pubblicazione: (2025)
Atleus: Accelerating Transformers on the Edge Enabled by 3D Heterogeneous Manycore Architectures
di: Dhingra, Pratyush, et al.
Pubblicazione: (2025)
di: Dhingra, Pratyush, et al.
Pubblicazione: (2025)
SigmaQuant: Hardware-Aware Heterogeneous Quantization Method for Edge DNN Inference
di: Liu, Qunyou, et al.
Pubblicazione: (2026)
di: Liu, Qunyou, et al.
Pubblicazione: (2026)
From Loop Nests to Silicon: Mapping AI Workloads onto AMD NPUs with MLIR-AIR
di: Wang, Erwei, et al.
Pubblicazione: (2025)
di: Wang, Erwei, et al.
Pubblicazione: (2025)
T-MAN: Enabling End-to-End Low-Bit LLM Inference on NPUs via Unified Table Lookup
di: Wei, Jianyu, et al.
Pubblicazione: (2025)
di: Wei, Jianyu, et al.
Pubblicazione: (2025)
An FPGA-Based SoC Architecture with a RISC-V Controller for Energy-Efficient Temporal-Coding Spiking Neural Networks
di: Sekonji, Mohammad Javad, et al.
Pubblicazione: (2026)
di: Sekonji, Mohammad Javad, et al.
Pubblicazione: (2026)
VeriCache: Turning Lossy KV Cache into Lossless LLM Inference
di: Yao, Jiayi, et al.
Pubblicazione: (2026)
di: Yao, Jiayi, et al.
Pubblicazione: (2026)
AI Accelerators for Large Language Model Inference: Architecture Analysis and Scaling Strategies
di: Sharma, Amit
Pubblicazione: (2025)
di: Sharma, Amit
Pubblicazione: (2025)
KLLM: Fast LLM Inference with K-Means Quantization
di: Wu, Xueying, et al.
Pubblicazione: (2025)
di: Wu, Xueying, et al.
Pubblicazione: (2025)
vMCU: Coordinated Memory Management and Kernel Optimization for DNN Inference on MCUs
di: Zheng, Size, et al.
Pubblicazione: (2024)
di: Zheng, Size, et al.
Pubblicazione: (2024)
H2PIPE: High throughput CNN Inference on FPGAs with High-Bandwidth Memory
di: Doumet, Mario, et al.
Pubblicazione: (2024)
di: Doumet, Mario, et al.
Pubblicazione: (2024)
MEMHD: Memory-Efficient Multi-Centroid Hyperdimensional Computing for Fully-Utilized In-Memory Computing Architectures
di: Kang, Do Yeong, et al.
Pubblicazione: (2025)
di: Kang, Do Yeong, et al.
Pubblicazione: (2025)
Memory-Efficient FPGA Implementation of Stochastic Simulated Annealing
di: Shin, Duckgyu, et al.
Pubblicazione: (2026)
di: Shin, Duckgyu, et al.
Pubblicazione: (2026)
Efficient In-Memory Acceleration of Sparse Block Diagonal LLMs
di: de Lima, João Paulo Cardoso, et al.
Pubblicazione: (2025)
di: de Lima, João Paulo Cardoso, et al.
Pubblicazione: (2025)
EPIM: Efficient Processing-In-Memory Accelerators based on Epitome
di: Wang, Chenyu, et al.
Pubblicazione: (2023)
di: Wang, Chenyu, et al.
Pubblicazione: (2023)
Documenti analoghi
-
LEAP: LLM Inference on Scalable PIM-NoC Architecture with Balanced Dataflow and Fine-Grained Parallelism
di: Wang, Yimin, et al.
Pubblicazione: (2025) -
PRIMAL: Processing-In-Memory Based Low-Rank Adaptation for LLM Inference Accelerator
di: Chong, Yue Jiet, et al.
Pubblicazione: (2026) -
From Principles to Practice: A Systematic Study of LLM Serving on Multi-core NPUs
di: Zhu, Tianhao, et al.
Pubblicazione: (2025) -
CHIME: Chiplet-based Heterogeneous Near-Memory Acceleration for Edge Multimodal LLM Inference
di: Chen, Yanru, et al.
Pubblicazione: (2025) -
Benchmarking Ultra-Low-Power $μ$NPUs
di: Millar, Josh, et al.
Pubblicazione: (2025)