CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Dai, Weinan, Wu, Hanlin, Yu, Qiying, Gao, Huan-ang, Li, Jiahao, Jiang, Chengquan, Lou, Weiqiang, Song, Yufan, Yu, Hongli, Chen, Jiaze, Ma, Wei-Ying, Zhang, Ya-Qin, Liu, Jingjing, Wang, Mingxuan, Liu, Xin, Zhou, Hao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent
di: Yu, Hongli, et al.
Pubblicazione: (2025)
di: Yu, Hongli, et al.
Pubblicazione: (2025)
Kevin: Multi-Turn RL for Generating CUDA Kernels
di: Baronio, Carlo, et al.
Pubblicazione: (2025)
di: Baronio, Carlo, et al.
Pubblicazione: (2025)
CUDA-LLM: LLMs Can Write Efficient CUDA Kernels
di: Chen, Wentao, et al.
Pubblicazione: (2025)
di: Chen, Wentao, et al.
Pubblicazione: (2025)
Towards Robust Agentic CUDA Kernel Benchmarking, Verification, and Optimization
di: Lange, Robert Tjarko, et al.
Pubblicazione: (2025)
di: Lange, Robert Tjarko, et al.
Pubblicazione: (2025)
DICE: Diffusion Large Language Models Excel at Generating CUDA Kernels
di: Bai, Haolei, et al.
Pubblicazione: (2026)
di: Bai, Haolei, et al.
Pubblicazione: (2026)
Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles
di: Chen, Jiangjie, et al.
Pubblicazione: (2025)
di: Chen, Jiangjie, et al.
Pubblicazione: (2025)
Making LLMs Optimize Multi-Scenario CUDA Kernels Like Experts
di: Han, Yuxuan, et al.
Pubblicazione: (2026)
di: Han, Yuxuan, et al.
Pubblicazione: (2026)
ProofWright: Towards Agentic Formal Verification of CUDA
di: Chatterjee, Bodhisatwa, et al.
Pubblicazione: (2025)
di: Chatterjee, Bodhisatwa, et al.
Pubblicazione: (2025)
InteropUnityCUDA: A Tool for Interoperability Between Unity and CUDA
di: David Algis, et al.
Pubblicazione: (2025)
di: David Algis, et al.
Pubblicazione: (2025)
Accelerating Mini-batch HGNN Training by Reducing CUDA Kernels
di: Wu, Meng, et al.
Pubblicazione: (2024)
di: Wu, Meng, et al.
Pubblicazione: (2024)
Accelerating Garfield++ with CUDA
di: Neep, T., et al.
Pubblicazione: (2025)
di: Neep, T., et al.
Pubblicazione: (2025)
Hunting CUDA Bugs at Scale with cuFuzz
di: ziad, Mohamed Tarek Ibn, et al.
Pubblicazione: (2026)
di: ziad, Mohamed Tarek Ibn, et al.
Pubblicazione: (2026)
Model2Kernel: Model-Aware Symbolic Execution For Safe CUDA Kernels
di: He, Mengting, et al.
Pubblicazione: (2026)
di: He, Mengting, et al.
Pubblicazione: (2026)
CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning
di: Li, Xiaoya, et al.
Pubblicazione: (2025)
di: Li, Xiaoya, et al.
Pubblicazione: (2025)
Lightweight Gaussian Process Inference in C++ on Metal and CUDA
di: Fang, Yu-Hsueh
Pubblicazione: (2026)
di: Fang, Yu-Hsueh
Pubblicazione: (2026)
CudaForge: An Agent Framework with Hardware Feedback for CUDA Kernel Optimization
di: Zhang, Zijian, et al.
Pubblicazione: (2025)
di: Zhang, Zijian, et al.
Pubblicazione: (2025)
TiledAttention: a CUDA Tile SDPA Kernel for PyTorch
di: Khan, Taimur
Pubblicazione: (2026)
di: Khan, Taimur
Pubblicazione: (2026)
Boosting Performance of Iterative Applications on GPUs: Kernel Batching with CUDA Graphs
di: Ekelund, Jonah, et al.
Pubblicazione: (2025)
di: Ekelund, Jonah, et al.
Pubblicazione: (2025)
EvoEngineer: Mastering Automated CUDA Kernel Code Evolution with Large Language Models
di: Guo, Ping, et al.
Pubblicazione: (2025)
di: Guo, Ping, et al.
Pubblicazione: (2025)
CuSfM: CUDA-Accelerated Structure-from-Motion
di: Yu, Jingrui, et al.
Pubblicazione: (2025)
di: Yu, Jingrui, et al.
Pubblicazione: (2025)
OptiML: An End-to-End Framework for Program Synthesis and CUDA Kernel Optimization
di: Bhattacharjee, Arijit, et al.
Pubblicazione: (2026)
di: Bhattacharjee, Arijit, et al.
Pubblicazione: (2026)
Structural testing for CUDA programming model
di: Helder J. F. Luz, et al.
Pubblicazione: (2024)
di: Helder J. F. Luz, et al.
Pubblicazione: (2024)
cuPilot: A Strategy-Coordinated Multi-agent Framework for CUDA Kernel Evolution
di: Chen, Jinwu, et al.
Pubblicazione: (2025)
di: Chen, Jinwu, et al.
Pubblicazione: (2025)
Towards Feedback-to-Plan Decisions for Self-Evolving LLM Agents in CUDA Kernel Generation
di: Chong, Yee Hin, et al.
Pubblicazione: (2026)
di: Chong, Yee Hin, et al.
Pubblicazione: (2026)
CUDA Kernel Optimization and Counter-Free Performance Analysis for Depthwise Convolution in Cloud Environments
di: Babak, Huriyeh, et al.
Pubblicazione: (2026)
di: Babak, Huriyeh, et al.
Pubblicazione: (2026)
Quantum Walks-Based Adaptive Distribution Generation with Efficient CUDA-Q Acceleration
di: Chang, Yen-Jui, et al.
Pubblicazione: (2025)
di: Chang, Yen-Jui, et al.
Pubblicazione: (2025)
CUDA-based optical parametric oscillator simulator
di: Sanchez, Alfredo Daniel, et al.
Pubblicazione: (2024)
di: Sanchez, Alfredo Daniel, et al.
Pubblicazione: (2024)
Assembly of FETI dual operator using CUDA
di: Homola, Jakub, et al.
Pubblicazione: (2025)
di: Homola, Jakub, et al.
Pubblicazione: (2025)
Parallel Gaussian process with kernel approximation in CUDA
di: Carminati, Davide
Pubblicazione: (2024)
di: Carminati, Davide
Pubblicazione: (2024)
CUDA Assisted Swampland and Black Hole Thermodynamics
di: Baddis, Saad Eddine, et al.
Pubblicazione: (2025)
di: Baddis, Saad Eddine, et al.
Pubblicazione: (2025)
On Computational CUDA Studies of Black Hole Shadows
di: Baddis, S. E., et al.
Pubblicazione: (2026)
di: Baddis, S. E., et al.
Pubblicazione: (2026)
CUDABench: Benchmarking LLMs for Text-to-CUDA Generation
di: Zhu, Jiace, et al.
Pubblicazione: (2026)
di: Zhu, Jiace, et al.
Pubblicazione: (2026)
Tutoring LLM into a Better CUDA Optimizer
di: Brabec, Matyáš, et al.
Pubblicazione: (2025)
di: Brabec, Matyáš, et al.
Pubblicazione: (2025)
High‐Performance Pose Measurement Based on CUDA
di: Mulin Zhou, et al.
Pubblicazione: (2025)
di: Mulin Zhou, et al.
Pubblicazione: (2025)
KernelBlaster: Continual Cross-Task CUDA Optimization via Memory-Augmented In-Context Reinforcement Learning
di: Dong, Kris Shengjun, et al.
Pubblicazione: (2026)
di: Dong, Kris Shengjun, et al.
Pubblicazione: (2026)
DPVO-QAT++: Heterogeneous QAT and CUDA Kernel Fusion for High-Performance Deep Patch Visual Odometry
di: Liao, Cheng
Pubblicazione: (2025)
di: Liao, Cheng
Pubblicazione: (2025)
cubic: CUDA-accelerated 3D Bioimage Computing
di: Kalinin, Alexandr A., et al.
Pubblicazione: (2025)
di: Kalinin, Alexandr A., et al.
Pubblicazione: (2025)
cuVSLAM: CUDA accelerated visual odometry and mapping
di: Korovko, Alexander, et al.
Pubblicazione: (2025)
di: Korovko, Alexander, et al.
Pubblicazione: (2025)
Application of the CUDA technology to the solution of fluid dynamics problems
di: Ediguer Franco
Pubblicazione: (2014)
di: Ediguer Franco
Pubblicazione: (2014)
Linac: linear algebra with CUDA over finite fields
di: De Laurentis, Giuseppe, et al.
Pubblicazione: (2026)
di: De Laurentis, Giuseppe, et al.
Pubblicazione: (2026)
Documenti analoghi
-
MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent
di: Yu, Hongli, et al.
Pubblicazione: (2025) -
Kevin: Multi-Turn RL for Generating CUDA Kernels
di: Baronio, Carlo, et al.
Pubblicazione: (2025) -
CUDA-LLM: LLMs Can Write Efficient CUDA Kernels
di: Chen, Wentao, et al.
Pubblicazione: (2025) -
Towards Robust Agentic CUDA Kernel Benchmarking, Verification, and Optimization
di: Lange, Robert Tjarko, et al.
Pubblicazione: (2025) -
DICE: Diffusion Large Language Models Excel at Generating CUDA Kernels
di: Bai, Haolei, et al.
Pubblicazione: (2026)