Improving Efficiency of GPU Kernel Optimization Agents using a Domain-Specific Language and Speed-of-Light Guidance
Fuente:
arXiv
Salvato in:
| Autori principali: | Hari, Siva Kumar Sastry, Balaji, Vignesh, Damani, Sana, Huang, Qijing, Kozyrakis, Christos |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
KernelBlaster: Continual Cross-Task CUDA Optimization via Memory-Augmented In-Context Reinforcement Learning
di: Dong, Kris Shengjun, et al.
Pubblicazione: (2026)
di: Dong, Kris Shengjun, et al.
Pubblicazione: (2026)
ProofWright: Towards Agentic Formal Verification of CUDA
di: Chatterjee, Bodhisatwa, et al.
Pubblicazione: (2025)
di: Chatterjee, Bodhisatwa, et al.
Pubblicazione: (2025)
SOL-ExecBench: Speed-of-Light Benchmarking for Real-World GPU Kernels Against Hardware Limits
di: Lin, Edward, et al.
Pubblicazione: (2026)
di: Lin, Edward, et al.
Pubblicazione: (2026)
Efficient GNN Training Through Structure-Aware Randomized Mini-Batching
di: Balaji, Vignesh, et al.
Pubblicazione: (2025)
di: Balaji, Vignesh, et al.
Pubblicazione: (2025)
Regulating Branch Parallelism in LLM Serving
di: Gandhi, Swapnil, et al.
Pubblicazione: (2026)
di: Gandhi, Swapnil, et al.
Pubblicazione: (2026)
Agent JIT Compilation for Latency-Optimizing Web Agent Planning and Scheduling
di: Winston, Caleb, et al.
Pubblicazione: (2026)
di: Winston, Caleb, et al.
Pubblicazione: (2026)
cedar: Optimized and Unified Machine Learning Input Data Pipelines
di: Zhao, Mark, et al.
Pubblicazione: (2024)
di: Zhao, Mark, et al.
Pubblicazione: (2024)
Safety-Critical Scenario Generation Via Reinforcement Learning Based Editing
di: Liu, Haolan, et al.
Pubblicazione: (2023)
di: Liu, Haolan, et al.
Pubblicazione: (2023)
ALBERTA: ALgorithm-Based Error Resilience in Transformer Architectures
di: Liu, Haoxuan, et al.
Pubblicazione: (2023)
di: Liu, Haoxuan, et al.
Pubblicazione: (2023)
Sparse Checkpointing for Fast and Reliable MoE Training
di: Gandhi, Swapnil, et al.
Pubblicazione: (2024)
di: Gandhi, Swapnil, et al.
Pubblicazione: (2024)
AgentKernelArena: Generalization-Aware Benchmarking of GPU Kernel Optimization Agents
di: Younesian, Sharareh, et al.
Pubblicazione: (2026)
di: Younesian, Sharareh, et al.
Pubblicazione: (2026)
ARGUS: Agentic GPU Optimization Guided by Data-Flow Invariants
di: Mai, Haohui, et al.
Pubblicazione: (2026)
di: Mai, Haohui, et al.
Pubblicazione: (2026)
KernelSkill: A Multi-Agent Framework for GPU Kernel Optimization
di: Sun, Qitong, et al.
Pubblicazione: (2026)
di: Sun, Qitong, et al.
Pubblicazione: (2026)
ReCycle: Resilient Training of Large DNNs using Pipeline Adaptation
di: Gandhi, Swapnil, et al.
Pubblicazione: (2024)
di: Gandhi, Swapnil, et al.
Pubblicazione: (2024)
Hunting CUDA Bugs at Scale with cuFuzz
di: ziad, Mohamed Tarek Ibn, et al.
Pubblicazione: (2026)
di: ziad, Mohamed Tarek Ibn, et al.
Pubblicazione: (2026)
AI Metropolis: Scaling Large Language Model-based Multi-Agent Simulation with Out-of-order Execution
di: Xie, Zhiqiang, et al.
Pubblicazione: (2024)
di: Xie, Zhiqiang, et al.
Pubblicazione: (2024)
Cloud Atlas: Efficient Fault Localization for Cloud Systems using Language Models and Causal Insight
di: Xie, Zhiqiang, et al.
Pubblicazione: (2024)
di: Xie, Zhiqiang, et al.
Pubblicazione: (2024)
AutoKernel: Autonomous GPU Kernel Optimization via Iterative Agent-Driven Search
di: Jaber, Jaber, et al.
Pubblicazione: (2026)
di: Jaber, Jaber, et al.
Pubblicazione: (2026)
Astra: A Multi-Agent System for GPU Kernel Performance Optimization
di: Wei, Anjiang, et al.
Pubblicazione: (2025)
di: Wei, Anjiang, et al.
Pubblicazione: (2025)
FailSafe: High-performance Resilient Serving
di: Xu, Ziyi, et al.
Pubblicazione: (2025)
di: Xu, Ziyi, et al.
Pubblicazione: (2025)
How Fast Can I Run My VLA? Demystifying VLA Inference Performance with VLA-Perf
di: Jiang, Wenqi, et al.
Pubblicazione: (2026)
di: Jiang, Wenqi, et al.
Pubblicazione: (2026)
LIMINAL: Exploring The Frontiers of LLM Decode Performance
di: Davies, Michael, et al.
Pubblicazione: (2025)
di: Davies, Michael, et al.
Pubblicazione: (2025)
Ludax: A GPU-Accelerated Domain Specific Language for Board Games
di: Todd, Graham, et al.
Pubblicazione: (2025)
di: Todd, Graham, et al.
Pubblicazione: (2025)
SYMI: Efficient Mixture-of-Experts Training via Model and Optimizer State Decoupling
di: Skiadopoulos, Athinagoras, et al.
Pubblicazione: (2025)
di: Skiadopoulos, Athinagoras, et al.
Pubblicazione: (2025)
GPU Forecasters: Language Models as Selective Surrogates for Kernel Runtime Optimization
di: Khan, Zaid, et al.
Pubblicazione: (2026)
di: Khan, Zaid, et al.
Pubblicazione: (2026)
Agenity_Paper6A_Agent_Identity_Gate
di: Chirravuri, Sastry
Pubblicazione: (2026)
di: Chirravuri, Sastry
Pubblicazione: (2026)
GPU Kernel Scientist: An LLM-Driven Framework for Iterative Kernel Optimization
di: Andrews, Martin, et al.
Pubblicazione: (2025)
di: Andrews, Martin, et al.
Pubblicazione: (2025)
EdgeReasoning: Characterizing Reasoning LLM Deployment on Edge GPUs
di: Kubwimana, Benjamin, et al.
Pubblicazione: (2025)
di: Kubwimana, Benjamin, et al.
Pubblicazione: (2025)
Speed-up of Data Analysis with Kernel Trick in Encrypted Domain
di: Yoo, Joon Soo, et al.
Pubblicazione: (2024)
di: Yoo, Joon Soo, et al.
Pubblicazione: (2024)
Record-Remix-Replay: Hierarchical GPU Kernel Optimization using Evolutionary Search
di: Nichols, Daniel, et al.
Pubblicazione: (2026)
di: Nichols, Daniel, et al.
Pubblicazione: (2026)
Efficient reconstruction of multidimensional random field models with heterogeneous data using stochastic neural networks
di: Xia, Mingtao, et al.
Pubblicazione: (2025)
di: Xia, Mingtao, et al.
Pubblicazione: (2025)
Unveiling the Supercapacitive Performance of B, P Dual‐Doped Graphene in Triple Redox Additives
di: S. Suresh Balaji, et al.
Pubblicazione: (2024)
di: S. Suresh Balaji, et al.
Pubblicazione: (2024)
A generalized Wasserstein-2 distance approach for efficient reconstruction of random field models using stochastic neural networks
di: Xia, Mingtao, et al.
Pubblicazione: (2025)
di: Xia, Mingtao, et al.
Pubblicazione: (2025)
Speed of Light Exact Greedy Decoding for RNN-T Speech Recognition Models on GPU
di: Galvez, Daniel, et al.
Pubblicazione: (2024)
di: Galvez, Daniel, et al.
Pubblicazione: (2024)
Teaching Cloud Infrastructure and Scalable Application Deployment in an Undergraduate Computer Science Program
di: Saligrama, Aditya, et al.
Pubblicazione: (2024)
di: Saligrama, Aditya, et al.
Pubblicazione: (2024)
KEET: Explaining Performance of GPU Kernels Using LLM Agents
di: Davis, Joshua H., et al.
Pubblicazione: (2026)
di: Davis, Joshua H., et al.
Pubblicazione: (2026)
From Deception to Perception: The Surprising Benefits of Deepfakes for Detecting, Measuring, and Mitigating Bias
di: Liu, Yizhi, et al.
Pubblicazione: (2025)
di: Liu, Yizhi, et al.
Pubblicazione: (2025)
What Exactly is a Deepfake?
di: Liu, Yizhi, et al.
Pubblicazione: (2025)
di: Liu, Yizhi, et al.
Pubblicazione: (2025)
Estimating Visual Attribute Effects in Advertising from Observational Data: A Deepfake-Informed Double Machine Learning Approach
di: Liu, Yizhi, et al.
Pubblicazione: (2026)
di: Liu, Yizhi, et al.
Pubblicazione: (2026)
Improving CMA-ES Convergence Speed, Efficiency, and Reliability in Noisy Robot Optimization Problems
di: Martin, Russell M., et al.
Pubblicazione: (2026)
di: Martin, Russell M., et al.
Pubblicazione: (2026)
Documenti analoghi
-
KernelBlaster: Continual Cross-Task CUDA Optimization via Memory-Augmented In-Context Reinforcement Learning
di: Dong, Kris Shengjun, et al.
Pubblicazione: (2026) -
ProofWright: Towards Agentic Formal Verification of CUDA
di: Chatterjee, Bodhisatwa, et al.
Pubblicazione: (2025) -
SOL-ExecBench: Speed-of-Light Benchmarking for Real-World GPU Kernels Against Hardware Limits
di: Lin, Edward, et al.
Pubblicazione: (2026) -
Efficient GNN Training Through Structure-Aware Randomized Mini-Batching
di: Balaji, Vignesh, et al.
Pubblicazione: (2025) -
Regulating Branch Parallelism in LLM Serving
di: Gandhi, Swapnil, et al.
Pubblicazione: (2026)