cuPilot: A Strategy-Coordinated Multi-agent Framework for CUDA Kernel Evolution
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Jinwu, Wu, Qidie, Li, Bin, Ma, Lin, Si, Xin, Hu, Yang, Yin, Shouyi, Yang, Jun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Hunting CUDA Bugs at Scale with cuFuzz
por: ziad, Mohamed Tarek Ibn, et al.
Publicado: (2026)
por: ziad, Mohamed Tarek Ibn, et al.
Publicado: (2026)
CUDA-LLM: LLMs Can Write Efficient CUDA Kernels
por: Chen, Wentao, et al.
Publicado: (2025)
por: Chen, Wentao, et al.
Publicado: (2025)
cuVSLAM: CUDA accelerated visual odometry and mapping
por: Korovko, Alexander, et al.
Publicado: (2025)
por: Korovko, Alexander, et al.
Publicado: (2025)
cuConv: A CUDA Implementation of Convolution for CNN Inference
por: Jordà, Marc, et al.
Publicado: (2021)
por: Jordà, Marc, et al.
Publicado: (2021)
CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generation
por: Dai, Weinan, et al.
Publicado: (2026)
por: Dai, Weinan, et al.
Publicado: (2026)
cuAPO: A CUDA-based Parallelization of Artificial Protozoa Optimizer
por: Soliya, Henish, et al.
Publicado: (2025)
por: Soliya, Henish, et al.
Publicado: (2025)
Making LLMs Optimize Multi-Scenario CUDA Kernels Like Experts
por: Han, Yuxuan, et al.
Publicado: (2026)
por: Han, Yuxuan, et al.
Publicado: (2026)
EvoEngineer: Mastering Automated CUDA Kernel Code Evolution with Large Language Models
por: Guo, Ping, et al.
Publicado: (2025)
por: Guo, Ping, et al.
Publicado: (2025)
cuGUGA: Operator-Direct Graphical Unitary Group Approach Accelerated with CUDA
por: Pengmei, Zihan
Publicado: (2026)
por: Pengmei, Zihan
Publicado: (2026)
Kevin: Multi-Turn RL for Generating CUDA Kernels
por: Baronio, Carlo, et al.
Publicado: (2025)
por: Baronio, Carlo, et al.
Publicado: (2025)
Accelerating Mini-batch HGNN Training by Reducing CUDA Kernels
por: Wu, Meng, et al.
Publicado: (2024)
por: Wu, Meng, et al.
Publicado: (2024)
HPCTransCompile: An AI Compiler Generated Dataset for High-Performance CUDA Transpilation and LLM Preliminary Exploration
por: Lv, Jiaqi, et al.
Publicado: (2025)
por: Lv, Jiaqi, et al.
Publicado: (2025)
CUDA-L2: Surpassing cuBLAS Performance for Matrix Multiplication through Reinforcement Learning
por: Su, Songqiao, et al.
Publicado: (2025)
por: Su, Songqiao, et al.
Publicado: (2025)
Model2Kernel: Model-Aware Symbolic Execution For Safe CUDA Kernels
por: He, Mengting, et al.
Publicado: (2026)
por: He, Mengting, et al.
Publicado: (2026)
CudaForge: An Agent Framework with Hardware Feedback for CUDA Kernel Optimization
por: Zhang, Zijian, et al.
Publicado: (2025)
por: Zhang, Zijian, et al.
Publicado: (2025)
$\texttt{cuSkyrmion}$: A CUDA-OpenGL framework for interactive simulation and visualization of nuclei as Skyrmions
por: Gudnason, Sven Bjarke, et al.
Publicado: (2026)
por: Gudnason, Sven Bjarke, et al.
Publicado: (2026)
OptiML: An End-to-End Framework for Program Synthesis and CUDA Kernel Optimization
por: Bhattacharjee, Arijit, et al.
Publicado: (2026)
por: Bhattacharjee, Arijit, et al.
Publicado: (2026)
CIM-Tuner: Balancing the Compute and Storage Capacity of SRAM-CIM Accelerator via Hardware-mapping Co-exploration
por: Chen, Jinwu, et al.
Publicado: (2026)
por: Chen, Jinwu, et al.
Publicado: (2026)
KernelSkill: A Multi-Agent Framework for GPU Kernel Optimization
por: Sun, Qitong, et al.
Publicado: (2026)
por: Sun, Qitong, et al.
Publicado: (2026)
Analysis on the Evolution of Strategies for High‐Quality Coordinated Development of China–Russia Subnational Cooperation
por: Jun Li, et al.
Publicado: (2026)
por: Jun Li, et al.
Publicado: (2026)
Verco: Learning Coordinated Verbal Communication for Multi-agent Reinforcement Learning
por: Li, Dapeng, et al.
Publicado: (2024)
por: Li, Dapeng, et al.
Publicado: (2024)
DICE: Diffusion Large Language Models Excel at Generating CUDA Kernels
por: Bai, Haolei, et al.
Publicado: (2026)
por: Bai, Haolei, et al.
Publicado: (2026)
Efficient Multi-agent Reinforcement Learning by Planning
por: Liu, Qihan, et al.
Publicado: (2024)
por: Liu, Qihan, et al.
Publicado: (2024)
Towards Robust Agentic CUDA Kernel Benchmarking, Verification, and Optimization
por: Lange, Robert Tjarko, et al.
Publicado: (2025)
por: Lange, Robert Tjarko, et al.
Publicado: (2025)
cuVegas: Accelerate Multidimensional Monte Carlo Integration through a Parallelized CUDA-based Implementation of the VEGAS Enhanced Algorithm
por: Tolotti, Emiliano, et al.
Publicado: (2024)
por: Tolotti, Emiliano, et al.
Publicado: (2024)
cuPDLP-C: A Strengthened Implementation of cuPDLP for Linear Programming by C language
por: Lu, Haihao, et al.
Publicado: (2023)
por: Lu, Haihao, et al.
Publicado: (2023)
Towards Feedback-to-Plan Decisions for Self-Evolving LLM Agents in CUDA Kernel Generation
por: Chong, Yee Hin, et al.
Publicado: (2026)
por: Chong, Yee Hin, et al.
Publicado: (2026)
Multi-agent In-context Coordination via Decentralized Memory Retrieval
por: Jiang, Tao, et al.
Publicado: (2025)
por: Jiang, Tao, et al.
Publicado: (2025)
Mercapto‐Carboxyl Jointly Coordinated Frameworks for Elucidating Heterometallic Synergy in Oxygen Evolution Electrocatalysis
por: Mou‐Cheng Tang, et al.
Publicado: (2026)
por: Mou‐Cheng Tang, et al.
Publicado: (2026)
TiledAttention: a CUDA Tile SDPA Kernel for PyTorch
por: Khan, Taimur
Publicado: (2026)
por: Khan, Taimur
Publicado: (2026)
Boosting Performance of Iterative Applications on GPUs: Kernel Batching with CUDA Graphs
por: Ekelund, Jonah, et al.
Publicado: (2025)
por: Ekelund, Jonah, et al.
Publicado: (2025)
BitStopper: An Efficient Transformer Attention Accelerator via Stage-fusion and Early Termination
por: Wang, Huizheng, et al.
Publicado: (2025)
por: Wang, Huizheng, et al.
Publicado: (2025)
LAPA: Log-Domain Prediction-Driven Dynamic Sparsity Accelerator for Transformer Model
por: Wang, Huizheng, et al.
Publicado: (2025)
por: Wang, Huizheng, et al.
Publicado: (2025)
WATOS: Efficient LLM Training Strategies and Architecture Co-exploration for Wafer-scale Chip
por: Wang, Huizheng, et al.
Publicado: (2025)
por: Wang, Huizheng, et al.
Publicado: (2025)
Catch-Up Distillation: You Only Need to Train Once for Accelerating Sampling
por: Shao, Shitong, et al.
Publicado: (2023)
por: Shao, Shitong, et al.
Publicado: (2023)
VUDA: Breaking CUDA-Vulkan Isolation for Spatial Sharing of Compute and Graphics on the Same GPU
por: Xu, Bin, et al.
Publicado: (2026)
por: Xu, Bin, et al.
Publicado: (2026)
MAFIG: Multi-agent Driven Formal Instruction Generation Framework
por: Zhao, Shixing, et al.
Publicado: (2026)
por: Zhao, Shixing, et al.
Publicado: (2026)
SOFA: A Compute-Memory Optimized Sparsity Accelerator via Cross-Stage Coordinated Tiling
por: Wang, Huizheng, et al.
Publicado: (2024)
por: Wang, Huizheng, et al.
Publicado: (2024)
LLM-Coordination: Evaluating and Analyzing Multi-agent Coordination Abilities in Large Language Models
por: Agashe, Saaket, et al.
Publicado: (2023)
por: Agashe, Saaket, et al.
Publicado: (2023)
CUDABench: Benchmarking LLMs for Text-to-CUDA Generation
por: Zhu, Jiace, et al.
Publicado: (2026)
por: Zhu, Jiace, et al.
Publicado: (2026)
Ejemplares similares
-
Hunting CUDA Bugs at Scale with cuFuzz
por: ziad, Mohamed Tarek Ibn, et al.
Publicado: (2026) -
CUDA-LLM: LLMs Can Write Efficient CUDA Kernels
por: Chen, Wentao, et al.
Publicado: (2025) -
cuVSLAM: CUDA accelerated visual odometry and mapping
por: Korovko, Alexander, et al.
Publicado: (2025) -
cuConv: A CUDA Implementation of Convolution for CNN Inference
por: Jordà, Marc, et al.
Publicado: (2021) -
CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generation
por: Dai, Weinan, et al.
Publicado: (2026)