A Systematic Characterization of LLM Inference on GPUs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Haonan, Xiao, Xuxin, Yan, Mingyu, Zhu, Zhuoyuan, Han, Dengke, Wang, Duo, Li, Wenming, Ye, Xiaochun, Hu, Cunchen, Chen, Hongyang, Sun, Guangyu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TLV-HGNN: Thinking Like a Vertex for Memory-efficient HGNN Inference
par: Han, Dengke, et autres
Publié: (2025)
par: Han, Dengke, et autres
Publié: (2025)
Characterizing and Understanding HGNN Training on GPUs
par: Han, Dengke, et autres
Publié: (2024)
par: Han, Dengke, et autres
Publié: (2024)
Accelerating GNN Training through Locality-aware Dropout and Merge
par: Sun, Gongjian, et autres
Publié: (2025)
par: Sun, Gongjian, et autres
Publié: (2025)
HiHGNN: Accelerating HGNNs through Parallelism and Data Reusability Exploitation
par: Xue, Runzhen, et autres
Publié: (2023)
par: Xue, Runzhen, et autres
Publié: (2023)
Survey on Characterizing and Understanding GNNs from a Computer Architecture Perspective
par: Wu, Meng, et autres
Publié: (2024)
par: Wu, Meng, et autres
Publié: (2024)
ADE-HGNN: Accelerating HGNNs through Attention Disparity Exploitation
par: Han, Dengke, et autres
Publié: (2024)
par: Han, Dengke, et autres
Publié: (2024)
GDR-HGNN: A Heterogeneous Graph Neural Networks Accelerator Frontend with Graph Decoupling and Recoupling
par: Xue, Runzhen, et autres
Publié: (2024)
par: Xue, Runzhen, et autres
Publié: (2024)
SiHGNN: Leveraging Properties of Semantic Graphs for Efficient HGNN Acceleration
par: Xue, Runzhen, et autres
Publié: (2024)
par: Xue, Runzhen, et autres
Publié: (2024)
Accelerating Mini-batch HGNN Training by Reducing CUDA Kernels
par: Wu, Meng, et autres
Publié: (2024)
par: Wu, Meng, et autres
Publié: (2024)
Multi-objective Optimization in CPU Design Space Exploration: Attention is All You Need
par: Xue, Runzhen, et autres
Publié: (2024)
par: Xue, Runzhen, et autres
Publié: (2024)
StreamDCIM: A Tile-based Streaming Digital CIM Accelerator with Mixed-stationary Cross-forwarding Dataflow for Multimodal Transformer
par: Qin, Shantian, et autres
Publié: (2025)
par: Qin, Shantian, et autres
Publié: (2025)
MetaDSE: A Few-shot Meta-learning Framework for Cross-workload CPU Design Space Exploration
par: Xue, Runzhen, et autres
Publié: (2025)
par: Xue, Runzhen, et autres
Publié: (2025)
Ouroboros: Wafer-Scale SRAM CIM with Token-Grained Pipelining for Large Language Model Inference
par: Liu, Yiqi, et autres
Publié: (2026)
par: Liu, Yiqi, et autres
Publié: (2026)
AHASD: Asynchronous Heterogeneous Architecture for LLM Adaptive Drafting Speculative Decoding on Mobile Devices
par: Zirui, Ma, et autres
Publié: (2026)
par: Zirui, Ma, et autres
Publié: (2026)
METRO: A Software-Hardware Co-Design of Interconnections for Spatial DNN Accelerators
par: Wang, Zhao, et autres
Publié: (2021)
par: Wang, Zhao, et autres
Publié: (2021)
Multilayer Dataflow: Orchestrate Butterfly Sparsity to Accelerate Attention Computation
par: Wu, Haibin, et autres
Publié: (2024)
par: Wu, Haibin, et autres
Publié: (2024)
CarbonSet: A Dataset to Analyze Trends and Benchmark the Sustainability of CPUs and GPUs
par: Hu, Jiajun, et autres
Publié: (2025)
par: Hu, Jiajun, et autres
Publié: (2025)
Control Flow Management in Modern GPUs
par: Shoushtary, Mojtaba Abaie, et autres
Publié: (2024)
par: Shoushtary, Mojtaba Abaie, et autres
Publié: (2024)
Topkima-Former: Low-energy, Low-Latency Inference for Transformers using top-k In-memory ADC
par: Dong, Shuai, et autres
Publié: (2024)
par: Dong, Shuai, et autres
Publié: (2024)
Virgo: Cluster-level Matrix Unit Integration in GPUs for Scalability and Energy Efficiency
par: Kim, Hansung, et autres
Publié: (2024)
par: Kim, Hansung, et autres
Publié: (2024)
Mixed Structural Choice Operator: Enhancing Technology Mapping with Heterogeneous Representations
par: Hu, Zhang, et autres
Publié: (2025)
par: Hu, Zhang, et autres
Publié: (2025)
MCBP: A Memory-Compute Efficient LLM Inference Accelerator Leveraging Bit-Slice-enabled Sparsity and Repetitiveness
par: Wang, Huizheng, et autres
Publié: (2025)
par: Wang, Huizheng, et autres
Publié: (2025)
Privacy-Preserving Performance Profiling of In-The-Wild GPUs
par: McDougall, Ian, et autres
Publié: (2025)
par: McDougall, Ian, et autres
Publié: (2025)
CoverAssert: Iterative LLM Assertion Generation Driven by Functional Coverage via Syntax-Semantic Representations
par: Wang, Yonghao, et autres
Publié: (2026)
par: Wang, Yonghao, et autres
Publié: (2026)
SpeedLLM: An FPGA Co-design of Large Language Model Inference Accelerator
par: Wang, Peipei, et autres
Publié: (2025)
par: Wang, Peipei, et autres
Publié: (2025)
3D Stack In-Sensor-Computing (3DS-ISC): Accelerating Time-Surface Construction for Neuromorphic Event Cameras
par: Shang, Hongyang, et autres
Publié: (2025)
par: Shang, Hongyang, et autres
Publié: (2025)
AssertGen: Enhancement of LLM-aided Assertion Generation through Cross-Layer Signal Bridging
par: Lyu, Hongqin, et autres
Publié: (2025)
par: Lyu, Hongqin, et autres
Publié: (2025)
LLM-PRISM: Characterizing Silent Data Corruption from Permanent GPU Faults in LLM Training
par: Tyagi, Abhishek, et autres
Publié: (2026)
par: Tyagi, Abhishek, et autres
Publié: (2026)
PRIMAL: Processing-In-Memory Based Low-Rank Adaptation for LLM Inference Accelerator
par: Chong, Yue Jiet, et autres
Publié: (2026)
par: Chong, Yue Jiet, et autres
Publié: (2026)
NVLLM: A 3D NAND-Centric Architecture Enabling Edge on-Device LLM Inference
par: Hao, Mingbo, et autres
Publié: (2026)
par: Hao, Mingbo, et autres
Publié: (2026)
Bandwidth-Effective DRAM Cache for GPUs with Storage-Class Memory
par: Hong, Jeongmin, et autres
Publié: (2024)
par: Hong, Jeongmin, et autres
Publié: (2024)
FusionCIM: Accelerating LLM Inference with Fusion-Driven Computing-in-Memory Architecture
par: Xuan, Zihao, et autres
Publié: (2026)
par: Xuan, Zihao, et autres
Publié: (2026)
Cambricon-LLM: A Chiplet-Based Hybrid Architecture for On-Device Inference of 70B LLM
par: Yu, Zhongkai, et autres
Publié: (2024)
par: Yu, Zhongkai, et autres
Publié: (2024)
Harmonia: Algorithm-Hardware Co-Design for Memory- and Compute-Efficient BFP-based LLM Inference
par: Wang, Xinyu, et autres
Publié: (2026)
par: Wang, Xinyu, et autres
Publié: (2026)
LEAP: LLM Inference on Scalable PIM-NoC Architecture with Balanced Dataflow and Fine-Grained Parallelism
par: Wang, Yimin, et autres
Publié: (2025)
par: Wang, Yimin, et autres
Publié: (2025)
PICNIC: Silicon Photonic Interconnected Chiplets with Computational Network and In-memory Computing for LLM Inference Acceleration
par: Chong, Yue Jiet, et autres
Publié: (2025)
par: Chong, Yue Jiet, et autres
Publié: (2025)
PD-Swap: Prefill-Decode Logic Swapping for End-to-End LLM Inference on Edge FPGAs via Dynamic Partial Reconfiguration
par: Zhang, Yifan, et autres
Publié: (2025)
par: Zhang, Yifan, et autres
Publié: (2025)
Fleet: Hierarchical Task-based Abstraction for Megakernels on Multi-Die GPUs
par: Chowdhary, Sangeeta, et autres
Publié: (2026)
par: Chowdhary, Sangeeta, et autres
Publié: (2026)
Tasa: Thermal-aware 3D-Stacked Architecture Design with Bandwidth Sharing for LLM Inference
par: He, Siyuan, et autres
Publié: (2025)
par: He, Siyuan, et autres
Publié: (2025)
A Scalable RISC-V Vector Processor Enabling Efficient Multi-Precision DNN Inference
par: Wang, Chuanning, et autres
Publié: (2024)
par: Wang, Chuanning, et autres
Publié: (2024)
Documents similaires
-
TLV-HGNN: Thinking Like a Vertex for Memory-efficient HGNN Inference
par: Han, Dengke, et autres
Publié: (2025) -
Characterizing and Understanding HGNN Training on GPUs
par: Han, Dengke, et autres
Publié: (2024) -
Accelerating GNN Training through Locality-aware Dropout and Merge
par: Sun, Gongjian, et autres
Publié: (2025) -
HiHGNN: Accelerating HGNNs through Parallelism and Data Reusability Exploitation
par: Xue, Runzhen, et autres
Publié: (2023) -
Survey on Characterizing and Understanding GNNs from a Computer Architecture Perspective
par: Wu, Meng, et autres
Publié: (2024)