LLMPerf: GPU Performance Modeling meets Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nguyen, Khoi N. M., Do, Hoang Duy Nguyen, Le, Huyen Thao, Dao, Thanh Tuan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards Universal Performance Modeling for Machine Learning Training on Multi-GPU Platforms
par: Lin, Zhongyi, et autres
Publié: (2024)
par: Lin, Zhongyi, et autres
Publié: (2024)
Characterizing WebGPU Dispatch Overhead for LLM Inference Across Four GPU Vendors, Three Backends, and Three Browsers
par: Maczan, Jędrzej
Publié: (2026)
par: Maczan, Jędrzej
Publié: (2026)
GPU Cluster Scheduling for Network-Sensitive Deep Learning
par: Sharma, Aakash, et autres
Publié: (2024)
par: Sharma, Aakash, et autres
Publié: (2024)
Taking GPU Programming Models to Task for Performance Portability
par: Davis, Joshua H., et autres
Publié: (2024)
par: Davis, Joshua H., et autres
Publié: (2024)
Accelerating Mobile Inference through Fine-Grained CPU-GPU Co-Execution
par: Li, Zhuojin, et autres
Publié: (2025)
par: Li, Zhuojin, et autres
Publié: (2025)
A Practical Two-Stage Framework for GPU Resource and Power Prediction in Heterogeneous HPC Systems
par: Oztop, Beste, et autres
Publié: (2026)
par: Oztop, Beste, et autres
Publié: (2026)
xMem: A CPU-Based Approach for Accurate Estimation of GPU Memory in Deep Learning Training Workloads
par: Shi, Jiabo, et autres
Publié: (2025)
par: Shi, Jiabo, et autres
Publié: (2025)
DREAMS: Decentralized Resource Allocation and Service Management across the Compute Continuum Using Service Affinity
par: Dinh-Tuan, Hai, et autres
Publié: (2025)
par: Dinh-Tuan, Hai, et autres
Publié: (2025)
Analytics of Longitudinal System Monitoring Data for Performance Prediction
par: Costello, Ian J., et autres
Publié: (2020)
par: Costello, Ian J., et autres
Publié: (2020)
Scalable GPU Performance Variability Analysis framework
par: Lahiry, Ankur, et autres
Publié: (2025)
par: Lahiry, Ankur, et autres
Publié: (2025)
Multi-DNN Inference of Sparse Models on Edge SoCs
par: Luo, Jiawei, et autres
Publié: (2026)
par: Luo, Jiawei, et autres
Publié: (2026)
MIREncoder: Multi-modal IR-based Pretrained Embeddings for Performance Optimizations
par: Dutta, Akash, et autres
Publié: (2024)
par: Dutta, Akash, et autres
Publié: (2024)
Taming Cold Starts: Proactive Serverless Scheduling with Model Predictive Control
par: Nguyen, Chanh, et autres
Publié: (2025)
par: Nguyen, Chanh, et autres
Publié: (2025)
EPIC: Efficient Position-Independent Caching for Serving Large Language Models
par: Hu, Junhao, et autres
Publié: (2024)
par: Hu, Junhao, et autres
Publié: (2024)
Fake Runs, Real Fixes -- Analyzing xPU Performance Through Simulation
par: Zarkadas, Ioannis, et autres
Publié: (2025)
par: Zarkadas, Ioannis, et autres
Publié: (2025)
ReLATE: Learning Efficient Sparse Encoding for High-Performance Tensor Decomposition
par: Helal, Ahmed E., et autres
Publié: (2025)
par: Helal, Ahmed E., et autres
Publié: (2025)
CloudFormer: An Attention-based Performance Prediction for Public Clouds with Unknown Workload
par: Shahbazinia, Amirhossein, et autres
Publié: (2025)
par: Shahbazinia, Amirhossein, et autres
Publié: (2025)
You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models
par: Ding, Shiwei, et autres
Publié: (2025)
par: Ding, Shiwei, et autres
Publié: (2025)
MLCommons Chakra: Advancing Performance Benchmarking and Co-design using Standardized Execution Traces
par: Sridharan, Srinivas, et autres
Publié: (2026)
par: Sridharan, Srinivas, et autres
Publié: (2026)
Phantora: Maximizing Code Reuse in Simulation-based Machine Learning System Performance Estimation
par: Qin, Jianxing, et autres
Publié: (2025)
par: Qin, Jianxing, et autres
Publié: (2025)
KEET: Explaining Performance of GPU Kernels Using LLM Agents
par: Davis, Joshua H., et autres
Publié: (2026)
par: Davis, Joshua H., et autres
Publié: (2026)
Asyn2F: An Asynchronous Federated Learning Framework with Bidirectional Model Aggregation
par: Cao, Tien-Dung, et autres
Publié: (2024)
par: Cao, Tien-Dung, et autres
Publié: (2024)
Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems
par: Miao, Xupeng, et autres
Publié: (2023)
par: Miao, Xupeng, et autres
Publié: (2023)
High-Performance Portable GPU Primitives for Arbitrary Types and Operators in Julia
par: Pilliat, Emmanuel
Publié: (2026)
par: Pilliat, Emmanuel
Publié: (2026)
Minos: Systematically Classifying Performance and Power Characteristics of GPU Workloads on HPC Clusters
par: Jain, Rutwik, et autres
Publié: (2026)
par: Jain, Rutwik, et autres
Publié: (2026)
Optimizing Attention on GPUs by Exploiting GPU Architectural NUMA Effects
par: Choudhary, Mansi, et autres
Publié: (2025)
par: Choudhary, Mansi, et autres
Publié: (2025)
Prism: Unleashing GPU Sharing for Cost-Efficient Multi-LLM Serving
par: Yu, Shan, et autres
Publié: (2025)
par: Yu, Shan, et autres
Publié: (2025)
Record-Remix-Replay: Hierarchical GPU Kernel Optimization using Evolutionary Search
par: Nichols, Daniel, et autres
Publié: (2026)
par: Nichols, Daniel, et autres
Publié: (2026)
GPU Kernel Optimization Beyond Full Builds: An LLM Framework with Minimal Executable Programs
par: Chu, Ruifan, et autres
Publié: (2025)
par: Chu, Ruifan, et autres
Publié: (2025)
FedCert: Federated Accuracy Certification
par: Nguyen, Minh Hieu, et autres
Publié: (2024)
par: Nguyen, Minh Hieu, et autres
Publié: (2024)
An Empirical Characterization of Outages and Incidents in Public Services for Large Language Models
par: Chu, Xiaoyu, et autres
Publié: (2025)
par: Chu, Xiaoyu, et autres
Publié: (2025)
Integrating Performance Tools in Model Reasoning for GPU Kernel Optimization
par: Nichols, Daniel, et autres
Publié: (2025)
par: Nichols, Daniel, et autres
Publié: (2025)
Towards Portability at Scale: A Cross-Architecture Performance Evaluation of a GPU-enabled Shallow Water Solver
par: Villalobos, Johansell, et autres
Publié: (2025)
par: Villalobos, Johansell, et autres
Publié: (2025)
MegaFold: System-Level Optimizations for Accelerating Protein Structure Prediction Models
par: La, Hoa, et autres
Publié: (2025)
par: La, Hoa, et autres
Publié: (2025)
STAlloc: Enhancing Memory Efficiency in Large-Scale Model Training with Spatio-Temporal Planning
par: Huang, Zixiao, et autres
Publié: (2025)
par: Huang, Zixiao, et autres
Publié: (2025)
HeteGen: Heterogeneous Parallel Inference for Large Language Models on Resource-Constrained Devices
par: Zhao, Xuanlei, et autres
Publié: (2024)
par: Zhao, Xuanlei, et autres
Publié: (2024)
BestServe: Serving Strategies with Optimal Goodput in Collocation and Disaggregation Architectures
par: Hu, Xiannan, et autres
Publié: (2025)
par: Hu, Xiannan, et autres
Publié: (2025)
InkStream: Real-time GNN Inference on Streaming Graphs via Incremental Update
par: Wu, Dan, et autres
Publié: (2023)
par: Wu, Dan, et autres
Publié: (2023)
Vectorized FlashAttention with Low-cost Exponential Computation in RISC-V Vector Processors
par: Titopoulos, Vasileios, et autres
Publié: (2025)
par: Titopoulos, Vasileios, et autres
Publié: (2025)
TaxBreak: Unmasking the Hidden Costs of LLM Inference Through Overhead Decomposition
par: Vellaisamy, Prabhu, et autres
Publié: (2026)
par: Vellaisamy, Prabhu, et autres
Publié: (2026)
Documents similaires
-
Towards Universal Performance Modeling for Machine Learning Training on Multi-GPU Platforms
par: Lin, Zhongyi, et autres
Publié: (2024) -
Characterizing WebGPU Dispatch Overhead for LLM Inference Across Four GPU Vendors, Three Backends, and Three Browsers
par: Maczan, Jędrzej
Publié: (2026) -
GPU Cluster Scheduling for Network-Sensitive Deep Learning
par: Sharma, Aakash, et autres
Publié: (2024) -
Taking GPU Programming Models to Task for Performance Portability
par: Davis, Joshua H., et autres
Publié: (2024) -
Accelerating Mobile Inference through Fine-Grained CPU-GPU Co-Execution
par: Li, Zhuojin, et autres
Publié: (2025)