Memory Access Characterization of Large Language Models in CPU Environment and its Potential Impacts
Fuente:
arXiv
Salvato in:
| Autore principale: | Banasik, Spencer |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Memory Is All You Need: An Overview of Compute-in-Memory Architectures for Accelerating Large Language Model Inference
di: Wolters, Christopher, et al.
Pubblicazione: (2024)
di: Wolters, Christopher, et al.
Pubblicazione: (2024)
Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
di: Kim, Wonung, et al.
Pubblicazione: (2025)
di: Kim, Wonung, et al.
Pubblicazione: (2025)
PaCKD: Pattern-Clustered Knowledge Distillation for Compressing Memory Access Prediction Models
di: Gupta, Neelesh, et al.
Pubblicazione: (2024)
di: Gupta, Neelesh, et al.
Pubblicazione: (2024)
Concorde: Fast and Accurate CPU Performance Modeling with Compositional Analytical-ML Fusion
di: Nasr-Esfahany, Arash, et al.
Pubblicazione: (2025)
di: Nasr-Esfahany, Arash, et al.
Pubblicazione: (2025)
T-SAR: A Full-Stack Co-design for CPU-Only Ternary LLM Inference via In-Place SIMD ALU Reorganization
di: Oh, Hyunwoo, et al.
Pubblicazione: (2025)
di: Oh, Hyunwoo, et al.
Pubblicazione: (2025)
Effective and Memory-Efficient Alternatives to ECC for Reliable Large-Scale DNNs
di: Ahmadilivani, Mohammad Hasan, et al.
Pubblicazione: (2026)
di: Ahmadilivani, Mohammad Hasan, et al.
Pubblicazione: (2026)
AxMoE: Characterizing the Impact of Approximate Multipliers on Mixture-of-Experts DNN Architectures
di: Shende, Omkar B, et al.
Pubblicazione: (2026)
di: Shende, Omkar B, et al.
Pubblicazione: (2026)
LLM-USO: Large Language Model-based Universal Sizing Optimizer
di: S, Karthik Somayaji N., et al.
Pubblicazione: (2025)
di: S, Karthik Somayaji N., et al.
Pubblicazione: (2025)
GFormer: Accelerating Large Language Models with Optimized Transformers on Gaudi Processors
di: Zhang, Chengming, et al.
Pubblicazione: (2024)
di: Zhang, Chengming, et al.
Pubblicazione: (2024)
Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective
di: Li, Jinhao, et al.
Pubblicazione: (2024)
di: Li, Jinhao, et al.
Pubblicazione: (2024)
AI Accelerators for Large Language Model Inference: Architecture Analysis and Scaling Strategies
di: Sharma, Amit
Pubblicazione: (2025)
di: Sharma, Amit
Pubblicazione: (2025)
MX+: Pushing the Limits of Microscaling Formats for Efficient Large Language Model Serving
di: Lee, Jungi, et al.
Pubblicazione: (2025)
di: Lee, Jungi, et al.
Pubblicazione: (2025)
SNIP: An Adaptive Mixed Precision Framework for Subbyte Large Language Model Training
di: Pan, Yunjie, et al.
Pubblicazione: (2026)
di: Pan, Yunjie, et al.
Pubblicazione: (2026)
Accelerating Neural Networks for Large Language Models and Graph Processing with Silicon Photonics
di: Afifi, Salma, et al.
Pubblicazione: (2024)
di: Afifi, Salma, et al.
Pubblicazione: (2024)
Tender: Accelerating Large Language Models via Tensor Decomposition and Runtime Requantization
di: Lee, Jungi, et al.
Pubblicazione: (2024)
di: Lee, Jungi, et al.
Pubblicazione: (2024)
Differentiable Initialization-Accelerated CPU-GPU Hybrid Combinatorial Scheduling
di: Liu, Mingju, et al.
Pubblicazione: (2026)
di: Liu, Mingju, et al.
Pubblicazione: (2026)
LLM4DV: Using Large Language Models for Hardware Test Stimuli Generation
di: Zhang, Zixi, et al.
Pubblicazione: (2023)
di: Zhang, Zixi, et al.
Pubblicazione: (2023)
PASCAL: A Phase-Aware Scheduling Algorithm for Serving Reasoning-based Large Language Models
di: Cho, Eunyeong, et al.
Pubblicazione: (2026)
di: Cho, Eunyeong, et al.
Pubblicazione: (2026)
A Hardware-Aware, Per-Layer Methodology for Post-Training Quantization of Large Language Models
di: Killian, Earl
Pubblicazione: (2026)
di: Killian, Earl
Pubblicazione: (2026)
Duplex: A Device for Large Language Models with Mixture of Experts, Grouped Query Attention, and Continuous Batching
di: Yun, Sungmin, et al.
Pubblicazione: (2024)
di: Yun, Sungmin, et al.
Pubblicazione: (2024)
LLM-VeriPPA: Power, Performance, and Area Optimization aware Verilog Code Generation with Large Language Models
di: Thorat, Kiran, et al.
Pubblicazione: (2025)
di: Thorat, Kiran, et al.
Pubblicazione: (2025)
Energy Efficient Software Hardware CoDesign for Machine Learning: From TinyML to Large Language Models
di: Vahdatpour, Mohammad Saleh, et al.
Pubblicazione: (2026)
di: Vahdatpour, Mohammad Saleh, et al.
Pubblicazione: (2026)
GPT4AIGChip: Towards Next-Generation AI Accelerator Design Automation via Large Language Models
di: Fu, Yonggan, et al.
Pubblicazione: (2023)
di: Fu, Yonggan, et al.
Pubblicazione: (2023)
Smart-Infinity: Fast Large Language Model Training using Near-Storage Processing on a Real System
di: Jang, Hongsun, et al.
Pubblicazione: (2024)
di: Jang, Hongsun, et al.
Pubblicazione: (2024)
Anatomy of the gem5 Simulator: AtomicSimpleCPU, TimingSimpleCPU, O3CPU, and Their Interaction with the Ruby Memory System
di: Söderström, Johan, et al.
Pubblicazione: (2025)
di: Söderström, Johan, et al.
Pubblicazione: (2025)
Autoformalizing Memory Specifications with Agents
di: Ernst, Jan Ole, et al.
Pubblicazione: (2026)
di: Ernst, Jan Ole, et al.
Pubblicazione: (2026)
Unveiling Environmental Impacts of Large Language Model Serving: A Functional Unit View
di: Wu, Yanran, et al.
Pubblicazione: (2025)
di: Wu, Yanran, et al.
Pubblicazione: (2025)
Intelligent4DSE: Optimizing High-Level Synthesis Design Space Exploration with Graph Neural Networks and Large Language Models
di: Xu, Lei, et al.
Pubblicazione: (2025)
di: Xu, Lei, et al.
Pubblicazione: (2025)
Multi-objective Optimization in CPU Design Space Exploration: Attention is All You Need
di: Xue, Runzhen, et al.
Pubblicazione: (2024)
di: Xue, Runzhen, et al.
Pubblicazione: (2024)
Comprehensive Verilog Design Problems: A Next-Generation Benchmark Dataset for Evaluating Large Language Models and Agents on RTL Design and Verification
di: Pinckney, Nathaniel, et al.
Pubblicazione: (2025)
di: Pinckney, Nathaniel, et al.
Pubblicazione: (2025)
AttentionLego: An Open-Source Building Block For Spatially-Scalable Large Language Model Accelerator With Processing-In-Memory Technology
di: Cong, Rongqing, et al.
Pubblicazione: (2024)
di: Cong, Rongqing, et al.
Pubblicazione: (2024)
Cell Library Characterization for Composite Current Source Models Based on Gaussian Process Regression and Active Learning
di: Bai, Tao, et al.
Pubblicazione: (2025)
di: Bai, Tao, et al.
Pubblicazione: (2025)
CAMformer: Associative Memory is All You Need
di: Molom-Ochir, Tergel, et al.
Pubblicazione: (2025)
di: Molom-Ochir, Tergel, et al.
Pubblicazione: (2025)
Kernel Approximation using Analog In-Memory Computing
di: Büchel, Julian, et al.
Pubblicazione: (2024)
di: Büchel, Julian, et al.
Pubblicazione: (2024)
RoMe: Row Granularity Access Memory System for Large Language Models
di: Nam, Hwayong, et al.
Pubblicazione: (2025)
di: Nam, Hwayong, et al.
Pubblicazione: (2025)
Efficient In-Memory Acceleration of Sparse Block Diagonal LLMs
di: de Lima, João Paulo Cardoso, et al.
Pubblicazione: (2025)
di: de Lima, João Paulo Cardoso, et al.
Pubblicazione: (2025)
EPIM: Efficient Processing-In-Memory Accelerators based on Epitome
di: Wang, Chenyu, et al.
Pubblicazione: (2023)
di: Wang, Chenyu, et al.
Pubblicazione: (2023)
Memory-Efficient FPGA Implementation of Stochastic Simulated Annealing
di: Shin, Duckgyu, et al.
Pubblicazione: (2026)
di: Shin, Duckgyu, et al.
Pubblicazione: (2026)
Characterization and Mitigation of Training Instabilities in Microscaling Formats
di: Su, Huangyuan, et al.
Pubblicazione: (2025)
di: Su, Huangyuan, et al.
Pubblicazione: (2025)
DS-CIM: Digital Stochastic Computing-In-Memory Featuring Accurate OR-Accumulation via Sample Region Remapping for Edge AI Models
di: Shao, Kunming, et al.
Pubblicazione: (2026)
di: Shao, Kunming, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Memory Is All You Need: An Overview of Compute-in-Memory Architectures for Accelerating Large Language Model Inference
di: Wolters, Christopher, et al.
Pubblicazione: (2024) -
Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
di: Kim, Wonung, et al.
Pubblicazione: (2025) -
PaCKD: Pattern-Clustered Knowledge Distillation for Compressing Memory Access Prediction Models
di: Gupta, Neelesh, et al.
Pubblicazione: (2024) -
Concorde: Fast and Accurate CPU Performance Modeling with Compositional Analytical-ML Fusion
di: Nasr-Esfahany, Arash, et al.
Pubblicazione: (2025) -
T-SAR: A Full-Stack Co-design for CPU-Only Ternary LLM Inference via In-Place SIMD ALU Reorganization
di: Oh, Hyunwoo, et al.
Pubblicazione: (2025)