NVLLM: A 3D NAND-Centric Architecture Enabling Edge on-Device LLM Inference
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Hao, Mingbo, Yan, Changwei, Cui, Haoyu, Yan, Zhihao, Ding, Yizhi, Qian, Zhangrui, Shan, Weiwei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
NASiC: 3D NAND-based CAM-Selected Multibit CIM Architecture for Efficient On-Device Mixture-of-Experts LLM Inference
von: Xu, Weikai, et al.
Veröffentlicht: (2026)
von: Xu, Weikai, et al.
Veröffentlicht: (2026)
TENET: An Efficient Sparsity-Aware LUT-Centric Architecture for Ternary LLM Inference On Edge
von: Huang, Zhirui, et al.
Veröffentlicht: (2025)
von: Huang, Zhirui, et al.
Veröffentlicht: (2025)
KVNAND: Efficient On-Device Large Language Model Inference Using DRAM-Free In-Flash Computing
von: Deng, Lishuo, et al.
Veröffentlicht: (2025)
von: Deng, Lishuo, et al.
Veröffentlicht: (2025)
Cambricon-LLM: A Chiplet-Based Hybrid Architecture for On-Device Inference of 70B LLM
von: Yu, Zhongkai, et al.
Veröffentlicht: (2024)
von: Yu, Zhongkai, et al.
Veröffentlicht: (2024)
A Switch-Centric In-Network Architecture for Accelerating LLM Inference in Shared-Memory Network
von: Jiang, Aojie, et al.
Veröffentlicht: (2026)
von: Jiang, Aojie, et al.
Veröffentlicht: (2026)
Tasa: Thermal-aware 3D-Stacked Architecture Design with Bandwidth Sharing for LLM Inference
von: He, Siyuan, et al.
Veröffentlicht: (2025)
von: He, Siyuan, et al.
Veröffentlicht: (2025)
VitaLLM: A Versatile and Tiny Accelerator for Mixed-Precision LLM Inference on Edge Devices
von: Lin, Zi-Wei, et al.
Veröffentlicht: (2026)
von: Lin, Zi-Wei, et al.
Veröffentlicht: (2026)
FeNOMS: Enhancing Open Modification Spectral Library Search with In-Storage Processing on Ferroelectric NAND (FeNAND) Flash
von: Pinge, Sumukh, et al.
Veröffentlicht: (2025)
von: Pinge, Sumukh, et al.
Veröffentlicht: (2025)
PolyThrottle: Energy-efficient Neural Network Inference on Edge Devices
von: Yan, Minghao, et al.
Veröffentlicht: (2023)
von: Yan, Minghao, et al.
Veröffentlicht: (2023)
Flexible In-NAND Cryptographic Processing for Secure Flash Storage
von: Noh, Seock-Hwan, et al.
Veröffentlicht: (2025)
von: Noh, Seock-Hwan, et al.
Veröffentlicht: (2025)
MCFlash: Bulk Bitwise Processing in 3D NAND with Dynamic Sensing and Multi-level Encoding
von: Rahman, Habib Ur, et al.
Veröffentlicht: (2026)
von: Rahman, Habib Ur, et al.
Veröffentlicht: (2026)
Proxima: Near-storage Acceleration for Graph-based Approximate Nearest Neighbor Search in 3D NAND
von: Xu, Weihong, et al.
Veröffentlicht: (2023)
von: Xu, Weihong, et al.
Veröffentlicht: (2023)
Dissecting and Re-architecting 3D NAND Flash PIM Arrays for Efficient Single-Batch Token Generation in LLMs
von: Jang, Yongjoo, et al.
Veröffentlicht: (2025)
von: Jang, Yongjoo, et al.
Veröffentlicht: (2025)
Search-in-Memory (SiM): Reliable, Versatile, and Efficient Data Matching in SSD's NAND Flash Memory Chip for Data Indexing Acceleration
von: Chen, Yun-Chih, et al.
Veröffentlicht: (2024)
von: Chen, Yun-Chih, et al.
Veröffentlicht: (2024)
AERO: Adaptive Erase Operation for Improving Lifetime and Performance of Modern NAND Flash-Based SSDs
von: Cho, Sungjun, et al.
Veröffentlicht: (2024)
von: Cho, Sungjun, et al.
Veröffentlicht: (2024)
From LLM to Silicon: RL-Driven ASIC Architecture Exploration for On-Device AI Inference
von: Ganti, Ravindra, et al.
Veröffentlicht: (2026)
von: Ganti, Ravindra, et al.
Veröffentlicht: (2026)
LoopLynx: A Scalable Dataflow Architecture for Efficient LLM Inference
von: Zheng, Jianing, et al.
Veröffentlicht: (2025)
von: Zheng, Jianing, et al.
Veröffentlicht: (2025)
T-MAN: Enabling End-to-End Low-Bit LLM Inference on NPUs via Unified Table Lookup
von: Wei, Jianyu, et al.
Veröffentlicht: (2025)
von: Wei, Jianyu, et al.
Veröffentlicht: (2025)
SHIELD: A Segmented Hierarchical Memory Architecture for Energy-Efficient LLM Inference on Edge NPUs
von: Zhang, Jintao, et al.
Veröffentlicht: (2026)
von: Zhang, Jintao, et al.
Veröffentlicht: (2026)
XtraMAC: An Efficient MAC Architecture for Mixed-Precision LLM Inference on FPGA
von: Yu, Feng, et al.
Veröffentlicht: (2026)
von: Yu, Feng, et al.
Veröffentlicht: (2026)
FusionCIM: Accelerating LLM Inference with Fusion-Driven Computing-in-Memory Architecture
von: Xuan, Zihao, et al.
Veröffentlicht: (2026)
von: Xuan, Zihao, et al.
Veröffentlicht: (2026)
Atleus: Accelerating Transformers on the Edge Enabled by 3D Heterogeneous Manycore Architectures
von: Dhingra, Pratyush, et al.
Veröffentlicht: (2025)
von: Dhingra, Pratyush, et al.
Veröffentlicht: (2025)
Designing Efficient LLM Accelerators for Edge Devices
von: Haris, Jude, et al.
Veröffentlicht: (2024)
von: Haris, Jude, et al.
Veröffentlicht: (2024)
Generalized Ping-Pong: Off-Chip Memory Bandwidth Centric Pipelining Strategy for Processing-In-Memory Accelerators
von: Wang, Ruibao, et al.
Veröffentlicht: (2024)
von: Wang, Ruibao, et al.
Veröffentlicht: (2024)
STRAW: A Stress-Aware WL-Based Read Reclaim Technique for High-Density NAND Flash-Based SSDs
von: Chun, Myoungjun, et al.
Veröffentlicht: (2025)
von: Chun, Myoungjun, et al.
Veröffentlicht: (2025)
A Systematic Characterization of LLM Inference on GPUs
von: Wang, Haonan, et al.
Veröffentlicht: (2025)
von: Wang, Haonan, et al.
Veröffentlicht: (2025)
CIMR-V: An End-to-End SRAM-based CIM Accelerator with RISC-V for AI Edge Device
von: and, Yan-Cheng Guo, et al.
Veröffentlicht: (2025)
von: and, Yan-Cheng Guo, et al.
Veröffentlicht: (2025)
Hardware Acceleration of Kolmogorov-Arnold Network (KAN) for Lightweight Edge Inference
von: Huang, Wei-Hsing, et al.
Veröffentlicht: (2024)
von: Huang, Wei-Hsing, et al.
Veröffentlicht: (2024)
EdgeLLM: A Highly Efficient CPU-FPGA Heterogeneous Edge Accelerator for Large Language Models
von: Huang, Mingqiang, et al.
Veröffentlicht: (2024)
von: Huang, Mingqiang, et al.
Veröffentlicht: (2024)
HDDB: Efficient In-Storage SQL Database Search Using Hyperdimensional Computing on Ferroelectric NAND Flash
von: Zhao, Quanling, et al.
Veröffentlicht: (2025)
von: Zhao, Quanling, et al.
Veröffentlicht: (2025)
HALO: Memory-Centric Heterogeneous Accelerator with 2.5D Integration for Low-Batch LLM Inference
von: Negi, Shubham, et al.
Veröffentlicht: (2025)
von: Negi, Shubham, et al.
Veröffentlicht: (2025)
Hardware-Aware DNN Compression for Homogeneous Edge Devices
von: Zhang, Kunlong, et al.
Veröffentlicht: (2025)
von: Zhang, Kunlong, et al.
Veröffentlicht: (2025)
Computing-In-Memory Aware Model Adaption For Edge Devices
von: Lin, Ming-Han, et al.
Veröffentlicht: (2025)
von: Lin, Ming-Han, et al.
Veröffentlicht: (2025)
HillInfer: Efficient Long-Context LLM Inference on the Edge with Hierarchical KV Eviction using SmartSSD
von: Sun, He, et al.
Veröffentlicht: (2026)
von: Sun, He, et al.
Veröffentlicht: (2026)
Efficient and Reliable Vector Similarity Search Using Asymmetric Encoding with NAND-Flash for Many-Class Few-Shot Learning
von: Chiang, Hao-Wei, et al.
Veröffentlicht: (2024)
von: Chiang, Hao-Wei, et al.
Veröffentlicht: (2024)
LEAP: LLM Inference on Scalable PIM-NoC Architecture with Balanced Dataflow and Fine-Grained Parallelism
von: Wang, Yimin, et al.
Veröffentlicht: (2025)
von: Wang, Yimin, et al.
Veröffentlicht: (2025)
APACHE: A Processing-Near-Memory Architecture for Multi-Scheme Fully Homomorphic Encryption
von: Ding, Lin, et al.
Veröffentlicht: (2024)
von: Ding, Lin, et al.
Veröffentlicht: (2024)
Switchable Single/Dual Edge Registers for Pipeline Architecture
von: Singh, Suyash Vardhan, et al.
Veröffentlicht: (2024)
von: Singh, Suyash Vardhan, et al.
Veröffentlicht: (2024)
LP-Spec: Leveraging LPDDR PIM for Efficient LLM Mobile Speculative Inference with Architecture-Dataflow Co-Optimization
von: He, Siyuan, et al.
Veröffentlicht: (2025)
von: He, Siyuan, et al.
Veröffentlicht: (2025)
CD-PIM: A High-Bandwidth and Compute-Efficient LPDDR5-Based PIM for Low-Batch LLM Acceleration on Edge-Device
von: Lin, Ye, et al.
Veröffentlicht: (2026)
von: Lin, Ye, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
NASiC: 3D NAND-based CAM-Selected Multibit CIM Architecture for Efficient On-Device Mixture-of-Experts LLM Inference
von: Xu, Weikai, et al.
Veröffentlicht: (2026) -
TENET: An Efficient Sparsity-Aware LUT-Centric Architecture for Ternary LLM Inference On Edge
von: Huang, Zhirui, et al.
Veröffentlicht: (2025) -
KVNAND: Efficient On-Device Large Language Model Inference Using DRAM-Free In-Flash Computing
von: Deng, Lishuo, et al.
Veröffentlicht: (2025) -
Cambricon-LLM: A Chiplet-Based Hybrid Architecture for On-Device Inference of 70B LLM
von: Yu, Zhongkai, et al.
Veröffentlicht: (2024) -
A Switch-Centric In-Network Architecture for Accelerating LLM Inference in Shared-Memory Network
von: Jiang, Aojie, et al.
Veröffentlicht: (2026)