Hardware-based Heterogeneous Memory Management for Large Language Model Inference
Fuente:
arXiv
Guardado en:
| Autores principales: | Hwang, Soojin, Kim, Jungwoo, Lee, Sanghyeon, Kim, Hongbeen, Huh, Jaehyuk |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
NeuPIMs: NPU-PIM Heterogeneous Acceleration for Batched LLM Inferencing
por: Heo, Guseul, et al.
Publicado: (2024)
por: Heo, Guseul, et al.
Publicado: (2024)
HPIM: Heterogeneous Processing-In-Memory-based Accelerator for Large Language Models Inference
por: Duan, Cenlin, et al.
Publicado: (2025)
por: Duan, Cenlin, et al.
Publicado: (2025)
Hardware-Software Co-Design for Accelerating Transformer Inference Leveraging Compute-in-Memory
por: Kim, Dong Eun, et al.
Publicado: (2025)
por: Kim, Dong Eun, et al.
Publicado: (2025)
LPU: A Latency-Optimized and Highly Scalable Processor for Large Language Model Inference
por: Moon, Seungjae, et al.
Publicado: (2024)
por: Moon, Seungjae, et al.
Publicado: (2024)
Prime+Retouch: When Cache is Locked and Leaked
por: Lee, Jaehyuk, et al.
Publicado: (2024)
por: Lee, Jaehyuk, et al.
Publicado: (2024)
RoMe: Row Granularity Access Memory System for Large Language Models
por: Nam, Hwayong, et al.
Publicado: (2025)
por: Nam, Hwayong, et al.
Publicado: (2025)
Harmonia: Algorithm-Hardware Co-Design for Memory- and Compute-Efficient BFP-based LLM Inference
por: Wang, Xinyu, et al.
Publicado: (2026)
por: Wang, Xinyu, et al.
Publicado: (2026)
NeCTAr: A Heterogeneous RISC-V SoC for Language Model Inference in Intel 16
por: Schmulbach, Viansa, et al.
Publicado: (2025)
por: Schmulbach, Viansa, et al.
Publicado: (2025)
Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
por: Kim, Wonung, et al.
Publicado: (2025)
por: Kim, Wonung, et al.
Publicado: (2025)
IANUS: Integrated Accelerator based on NPU-PIM Unified Memory System
por: Seo, Minseok, et al.
Publicado: (2024)
por: Seo, Minseok, et al.
Publicado: (2024)
PIM-MMU: A Memory Management Unit for Accelerating Data Transfers in Commercial PIM Systems
por: Lee, Dongjae, et al.
Publicado: (2024)
por: Lee, Dongjae, et al.
Publicado: (2024)
Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective
por: Li, Jinhao, et al.
Publicado: (2024)
por: Li, Jinhao, et al.
Publicado: (2024)
MemExplorer: Navigating the Heterogeneous Memory Design Space for Agentic Inference NPUs
por: Wu, Haoran, et al.
Publicado: (2026)
por: Wu, Haoran, et al.
Publicado: (2026)
LUT-LLM: Efficient Large Language Model Inference with Memory-based Computations on FPGAs
por: He, Zifan, et al.
Publicado: (2025)
por: He, Zifan, et al.
Publicado: (2025)
Hardware Memory Management for Future Mobile Hybrid Memory Systems
por: Wen, Fei, et al.
Publicado: (2020)
por: Wen, Fei, et al.
Publicado: (2020)
Optimized Memory System Architecture for VESA VDC-M Decoder with Multi-Slice Support
por: Yang, Hannah, et al.
Publicado: (2025)
por: Yang, Hannah, et al.
Publicado: (2025)
SAL-PIM: A Subarray-level Processing-in-Memory Architecture with LUT-based Linear Interpolation for Transformer-based Text Generation
por: Han, Wontak, et al.
Publicado: (2024)
por: Han, Wontak, et al.
Publicado: (2024)
A Review on Proprietary Accelerators for Large Language Models
por: Park, Sihyeong, et al.
Publicado: (2025)
por: Park, Sihyeong, et al.
Publicado: (2025)
QED: Scalable Verification of Hardware Memory Consistency
por: Ravi, Gokulan, et al.
Publicado: (2024)
por: Ravi, Gokulan, et al.
Publicado: (2024)
In-Memory Computing Architecture for Efficient Hardware Security
por: Ajmi, Hala, et al.
Publicado: (2024)
por: Ajmi, Hala, et al.
Publicado: (2024)
Sieve: Dynamic Expert-Aware PIM Acceleration for Evolving Mixture-of-Experts Models
por: Kim, Jungwoo, et al.
Publicado: (2026)
por: Kim, Jungwoo, et al.
Publicado: (2026)
Challenges and Research Directions for Large Language Model Inference Hardware
por: Ma, Xiaoyu, et al.
Publicado: (2026)
por: Ma, Xiaoyu, et al.
Publicado: (2026)
Cerberus: Cross-Layer ECC Co-Design for Robust and Efficient Memory Protection
por: Kim, Junhwan, et al.
Publicado: (2026)
por: Kim, Junhwan, et al.
Publicado: (2026)
Efficient LLM Inference with Activation Checkpointing and Hybrid Caching
por: Lee, Sanghyeon, et al.
Publicado: (2025)
por: Lee, Sanghyeon, et al.
Publicado: (2025)
Memory Is All You Need: An Overview of Compute-in-Memory Architectures for Accelerating Large Language Model Inference
por: Wolters, Christopher, et al.
Publicado: (2024)
por: Wolters, Christopher, et al.
Publicado: (2024)
SigmaQuant: Hardware-Aware Heterogeneous Quantization Method for Edge DNN Inference
por: Liu, Qunyou, et al.
Publicado: (2026)
por: Liu, Qunyou, et al.
Publicado: (2026)
LOCALUT: Harnessing Capacity-Computation Tradeoffs for LUT-Based Inference in DRAM-PIM
por: Hong, Junguk, et al.
Publicado: (2026)
por: Hong, Junguk, et al.
Publicado: (2026)
SkyByte: Architecting an Efficient Memory-Semantic CXL-based SSD with OS and Hardware Co-design
por: Zhang, Haoyang, et al.
Publicado: (2025)
por: Zhang, Haoyang, et al.
Publicado: (2025)
CHIME: Chiplet-based Heterogeneous Near-Memory Acceleration for Edge Multimodal LLM Inference
por: Chen, Yanru, et al.
Publicado: (2025)
por: Chen, Yanru, et al.
Publicado: (2025)
Piccolo: Large-Scale Graph Processing with Fine-Grained In-Memory Scatter-Gather
por: Shin, Changmin, et al.
Publicado: (2025)
por: Shin, Changmin, et al.
Publicado: (2025)
Scalable Processing-Near-Memory for 1M-Token LLM Inference: CXL-Enabled KV-Cache Management Beyond GPU Limits
por: Kim, Dowon, et al.
Publicado: (2025)
por: Kim, Dowon, et al.
Publicado: (2025)
CXL-GPU: Pushing GPU Memory Boundaries with the Integration of CXL Technologies
por: Gouk, Donghyun, et al.
Publicado: (2025)
por: Gouk, Donghyun, et al.
Publicado: (2025)
Memory-Guided Unified Hardware Accelerator for Mixed-Precision Scientific Computing
por: Wang, Chuanzhen, et al.
Publicado: (2026)
por: Wang, Chuanzhen, et al.
Publicado: (2026)
SpeedLLM: An FPGA Co-design of Large Language Model Inference Accelerator
por: Wang, Peipei, et al.
Publicado: (2025)
por: Wang, Peipei, et al.
Publicado: (2025)
Hardware Acceleration of Kolmogorov-Arnold Network (KAN) for Lightweight Edge Inference
por: Huang, Wei-Hsing, et al.
Publicado: (2024)
por: Huang, Wei-Hsing, et al.
Publicado: (2024)
ONNX-to-Hardware Design Flow for Adaptive Neural-Network Inference on FPGAs
por: Manca, Federico, et al.
Publicado: (2024)
por: Manca, Federico, et al.
Publicado: (2024)
Managing Hybrid Solid-State Drives Using Large Language Models
por: Wei, Qian, et al.
Publicado: (2025)
por: Wei, Qian, et al.
Publicado: (2025)
Realizing Hardware-Optimized General Tree-Based Data Structures for Heterogeneous System Classes
por: Biebert, Daniel, et al.
Publicado: (2025)
por: Biebert, Daniel, et al.
Publicado: (2025)
Cocco: Hardware-Mapping Co-Exploration towards Memory Capacity-Communication Optimization
por: Tan, Zhanhong, et al.
Publicado: (2024)
por: Tan, Zhanhong, et al.
Publicado: (2024)
NeoMem: Hardware/Software Co-Design for CXL-Native Memory Tiering
por: Zhou, Zhe, et al.
Publicado: (2024)
por: Zhou, Zhe, et al.
Publicado: (2024)
Ejemplares similares
-
NeuPIMs: NPU-PIM Heterogeneous Acceleration for Batched LLM Inferencing
por: Heo, Guseul, et al.
Publicado: (2024) -
HPIM: Heterogeneous Processing-In-Memory-based Accelerator for Large Language Models Inference
por: Duan, Cenlin, et al.
Publicado: (2025) -
Hardware-Software Co-Design for Accelerating Transformer Inference Leveraging Compute-in-Memory
por: Kim, Dong Eun, et al.
Publicado: (2025) -
LPU: A Latency-Optimized and Highly Scalable Processor for Large Language Model Inference
por: Moon, Seungjae, et al.
Publicado: (2024) -
Prime+Retouch: When Cache is Locked and Leaked
por: Lee, Jaehyuk, et al.
Publicado: (2024)