Enregistré dans:
| Auteurs principaux: | Chu, Ruifan, Wang, Anbang, Bai, Xiuxiu, Liu, Shuai, Dong, Xiaoshe |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2512.22147 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
KEET: Explaining Performance of GPU Kernels Using LLM Agents
par: Davis, Joshua H., et autres
Publié: (2026)
par: Davis, Joshua H., et autres
Publié: (2026)
The Energy Cost of Execution-Idle in GPU Clusters
par: Lei, Yiran, et autres
Publié: (2026)
par: Lei, Yiran, et autres
Publié: (2026)
Record-Remix-Replay: Hierarchical GPU Kernel Optimization using Evolutionary Search
par: Nichols, Daniel, et autres
Publié: (2026)
par: Nichols, Daniel, et autres
Publié: (2026)
HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing
par: Lin, Mao, et autres
Publié: (2026)
par: Lin, Mao, et autres
Publié: (2026)
Integrating Performance Tools in Model Reasoning for GPU Kernel Optimization
par: Nichols, Daniel, et autres
Publié: (2025)
par: Nichols, Daniel, et autres
Publié: (2025)
Taking GPU Programming Models to Task for Performance Portability
par: Davis, Joshua H., et autres
Publié: (2024)
par: Davis, Joshua H., et autres
Publié: (2024)
CuTeGen: An LLM-Based Agentic Framework for Generation and Optimization of High-Performance GPU Kernels using CuTe
par: Saba, Tara, et autres
Publié: (2026)
par: Saba, Tara, et autres
Publié: (2026)
Characterizing and Optimizing LLM Inference Workloads on CPU-GPU Coupled Architectures
par: Vellaisamy, Prabhu, et autres
Publié: (2025)
par: Vellaisamy, Prabhu, et autres
Publié: (2025)
Efficient allocation of image recognition and LLM tasks on multi-GPU system
par: Lawenda, Marcin, et autres
Publié: (2025)
par: Lawenda, Marcin, et autres
Publié: (2025)
FAILS: A Framework for Automated Collection and Analysis of LLM Service Incidents
par: Battaglini-Fischer, Sándor, et autres
Publié: (2025)
par: Battaglini-Fischer, Sándor, et autres
Publié: (2025)
Data-Driven Analysis to Understand GPU Hardware Resource Usage of Optimizations
par: Islam, Tanzima Z., et autres
Publié: (2024)
par: Islam, Tanzima Z., et autres
Publié: (2024)
Shared Memory-contention-aware Concurrent DNN Execution for Diversely Heterogeneous System-on-Chips
par: Dagli, Ismet, et autres
Publié: (2023)
par: Dagli, Ismet, et autres
Publié: (2023)
Prism: Unleashing GPU Sharing for Cost-Efficient Multi-LLM Serving
par: Yu, Shan, et autres
Publié: (2025)
par: Yu, Shan, et autres
Publié: (2025)
Less is More: Optimizing Function Calling for LLM Execution on Edge Devices
par: Paramanayakam, Varatheepan, et autres
Publié: (2024)
par: Paramanayakam, Varatheepan, et autres
Publié: (2024)
Accelerating Mobile Inference through Fine-Grained CPU-GPU Co-Execution
par: Li, Zhuojin, et autres
Publié: (2025)
par: Li, Zhuojin, et autres
Publié: (2025)
CUTHERMO: Understanding GPU Memory Inefficiencies with Heat Map Profiling
par: Zhao, Yanbo, et autres
Publié: (2025)
par: Zhao, Yanbo, et autres
Publié: (2025)
BurstGPT: A Real-world Workload Dataset to Optimize LLM Serving Systems
par: Wang, Yuxin, et autres
Publié: (2024)
par: Wang, Yuxin, et autres
Publié: (2024)
Unleashing the Power of Preemptive Priority-based Scheduling for Real-Time GPU Tasks
par: Wang, Yidi, et autres
Publié: (2024)
par: Wang, Yidi, et autres
Publié: (2024)
Efficient GPU-Centered Singular Value Decomposition Using the Divide-and-Conquer Method
par: Liu, Shifang, et autres
Publié: (2025)
par: Liu, Shifang, et autres
Publié: (2025)
Scalable GPU Performance Variability Analysis framework
par: Lahiry, Ankur, et autres
Publié: (2025)
par: Lahiry, Ankur, et autres
Publié: (2025)
On the Partitioning of GPU Power among Multi-Instances
par: Vamja, Tirth, et autres
Publié: (2025)
par: Vamja, Tirth, et autres
Publié: (2025)
Disaggregated Design for GPU-Based Volumetric Data Structures
par: Meneghin, Massimiliano, et autres
Publié: (2025)
par: Meneghin, Massimiliano, et autres
Publié: (2025)
PASTA: A Modular Program Analysis Tool Framework for Accelerators
par: Lin, Mao, et autres
Publié: (2026)
par: Lin, Mao, et autres
Publié: (2026)
Profiling and optimization of multi-card GPU machine learning jobs
par: Lawenda, Marcin, et autres
Publié: (2025)
par: Lawenda, Marcin, et autres
Publié: (2025)
High-Performance Portable GPU Primitives for Arbitrary Types and Operators in Julia
par: Pilliat, Emmanuel
Publié: (2026)
par: Pilliat, Emmanuel
Publié: (2026)
Minos: Systematically Classifying Performance and Power Characteristics of GPU Workloads on HPC Clusters
par: Jain, Rutwik, et autres
Publié: (2026)
par: Jain, Rutwik, et autres
Publié: (2026)
Can Tensor Cores Benefit Memory-Bound Kernels? (No!)
par: Zhang, Lingqi, et autres
Publié: (2025)
par: Zhang, Lingqi, et autres
Publié: (2025)
ExpertFlow: Adaptive Expert Scheduling and Memory Coordination for Efficient MoE Inference
par: Shen, Zixu, et autres
Publié: (2025)
par: Shen, Zixu, et autres
Publié: (2025)
Dissecting CPU-GPU Unified Physical Memory on AMD MI300A APUs
par: Wahlgren, Jacob, et autres
Publié: (2025)
par: Wahlgren, Jacob, et autres
Publié: (2025)
LEO: Tracing GPU Stall Root Causes via Cross-Vendor Backward Slicing
par: Xia, Yuning, et autres
Publié: (2026)
par: Xia, Yuning, et autres
Publié: (2026)
Fast and Scalable Mixed Precision Euclidean Distance Calculations Using GPU Tensor Cores
par: Curless, Brian, et autres
Publié: (2025)
par: Curless, Brian, et autres
Publié: (2025)
Cache Blocking of Distributed-Memory Parallel Matrix Power Kernels
par: Lacey, Dane C., et autres
Publié: (2024)
par: Lacey, Dane C., et autres
Publié: (2024)
Characterizing WebGPU Dispatch Overhead for LLM Inference Across Four GPU Vendors, Three Backends, and Three Browsers
par: Maczan, Jędrzej
Publié: (2026)
par: Maczan, Jędrzej
Publié: (2026)
Opt4GPTQ: Co-Optimizing Memory and Computation for 4-bit GPTQ Quantized LLM Inference on Heterogeneous Platforms
par: Zhang, Yaozheng, et autres
Publié: (2025)
par: Zhang, Yaozheng, et autres
Publié: (2025)
FACT: Compositional Kernel Synthesis with a Three-Stage Agentic Workflow
par: Heidari, Sina, et autres
Publié: (2026)
par: Heidari, Sina, et autres
Publié: (2026)
AGOCS -- Accurate Google Cloud Simulator Framework
par: Sliwko, Leszek, et autres
Publié: (2025)
par: Sliwko, Leszek, et autres
Publié: (2025)
GhostServe: A Lightweight Checkpointing System in the Shadow for Fault-Tolerant LLM Serving
par: Jayakody, Shakya, et autres
Publié: (2026)
par: Jayakody, Shakya, et autres
Publié: (2026)
Node Compass: Multilevel Tracing and Debugging of Request Executions in JavaScript-Based Web-Servers
par: Kabamba, Herve Mbikayi, et autres
Publié: (2023)
par: Kabamba, Herve Mbikayi, et autres
Publié: (2023)
DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference
par: Jeong, Bodon, et autres
Publié: (2026)
par: Jeong, Bodon, et autres
Publié: (2026)
Towards Portability at Scale: A Cross-Architecture Performance Evaluation of a GPU-enabled Shallow Water Solver
par: Villalobos, Johansell, et autres
Publié: (2025)
par: Villalobos, Johansell, et autres
Publié: (2025)
Documents similaires
-
KEET: Explaining Performance of GPU Kernels Using LLM Agents
par: Davis, Joshua H., et autres
Publié: (2026) -
The Energy Cost of Execution-Idle in GPU Clusters
par: Lei, Yiran, et autres
Publié: (2026) -
Record-Remix-Replay: Hierarchical GPU Kernel Optimization using Evolutionary Search
par: Nichols, Daniel, et autres
Publié: (2026) -
HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing
par: Lin, Mao, et autres
Publié: (2026) -
Integrating Performance Tools in Model Reasoning for GPU Kernel Optimization
par: Nichols, Daniel, et autres
Publié: (2025)