CudaForge: An Agent Framework with Hardware Feedback for CUDA Kernel Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Zijian, Wang, Rong, Li, Shiyang, Luo, Yuebo, Hong, Mingyi, Ding, Caiwen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RTop-K: Ultra-Fast Row-Wise Top-K Selection for Neural Network Acceleration on GPUs
di: Xie, Xi, et al.
Pubblicazione: (2024)
di: Xie, Xi, et al.
Pubblicazione: (2024)
Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU
di: Spoczynski, Marcin, et al.
Pubblicazione: (2026)
di: Spoczynski, Marcin, et al.
Pubblicazione: (2026)
FPTC: A Fast Parallel Transform-based Codec for Efficient Asymmetric Signal Compression
di: Mechels, Ben, et al.
Pubblicazione: (2026)
di: Mechels, Ben, et al.
Pubblicazione: (2026)
Tutoring LLM into a Better CUDA Optimizer
di: Brabec, Matyáš, et al.
Pubblicazione: (2025)
di: Brabec, Matyáš, et al.
Pubblicazione: (2025)
SwizzlePerf: Hardware-Aware LLMs for GPU Kernel Performance Optimization
di: Tschand, Arya, et al.
Pubblicazione: (2025)
di: Tschand, Arya, et al.
Pubblicazione: (2025)
Boosting Performance of Iterative Applications on GPUs: Kernel Batching with CUDA Graphs
di: Ekelund, Jonah, et al.
Pubblicazione: (2025)
di: Ekelund, Jonah, et al.
Pubblicazione: (2025)
PRAGMA: A Profiling-Reasoned Multi-Agent Framework for Automatic Kernel Optimization
di: Lei, Kelun, et al.
Pubblicazione: (2025)
di: Lei, Kelun, et al.
Pubblicazione: (2025)
CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning
di: Li, Xiaoya, et al.
Pubblicazione: (2025)
di: Li, Xiaoya, et al.
Pubblicazione: (2025)
SIGMA: An AI-Empowered Training Stack on Early-Life Hardware
di: Qu, Lei, et al.
Pubblicazione: (2025)
di: Qu, Lei, et al.
Pubblicazione: (2025)
HPCTransCompile: An AI Compiler Generated Dataset for High-Performance CUDA Transpilation and LLM Preliminary Exploration
di: Lv, Jiaqi, et al.
Pubblicazione: (2025)
di: Lv, Jiaqi, et al.
Pubblicazione: (2025)
CUDA Kernel Optimization and Counter-Free Performance Analysis for Depthwise Convolution in Cloud Environments
di: Babak, Huriyeh, et al.
Pubblicazione: (2026)
di: Babak, Huriyeh, et al.
Pubblicazione: (2026)
QiMeng-Kernel: Macro-Thinking Micro-Coding Paradigm for LLM-Based High-Performance GPU Kernel Generation
di: Zhu, Xinguo, et al.
Pubblicazione: (2025)
di: Zhu, Xinguo, et al.
Pubblicazione: (2025)
FlowKV: A Disaggregated Inference Framework with Low-Latency KV Cache Transfer and Load-Aware Scheduling
di: Li, Weiqing, et al.
Pubblicazione: (2025)
di: Li, Weiqing, et al.
Pubblicazione: (2025)
Parallel Gaussian process with kernel approximation in CUDA
di: Carminati, Davide
Pubblicazione: (2024)
di: Carminati, Davide
Pubblicazione: (2024)
Liger Kernel: Efficient Triton Kernels for LLM Training
di: Hsu, Pin-Lun, et al.
Pubblicazione: (2024)
di: Hsu, Pin-Lun, et al.
Pubblicazione: (2024)
Astra: A Multi-Agent System for GPU Kernel Performance Optimization
di: Wei, Anjiang, et al.
Pubblicazione: (2025)
di: Wei, Anjiang, et al.
Pubblicazione: (2025)
OptiML: An End-to-End Framework for Program Synthesis and CUDA Kernel Optimization
di: Bhattacharjee, Arijit, et al.
Pubblicazione: (2026)
di: Bhattacharjee, Arijit, et al.
Pubblicazione: (2026)
High-Performance Parallelization of Dijkstra's Algorithm Using MPI and CUDA
di: Song, Boyang
Pubblicazione: (2025)
di: Song, Boyang
Pubblicazione: (2025)
BanditWare: A Contextual Bandit-based Framework for Hardware Prediction
di: Coleman, Tainã, et al.
Pubblicazione: (2025)
di: Coleman, Tainã, et al.
Pubblicazione: (2025)
Glia: A Human-Inspired AI for Automated Systems Design and Optimization
di: Hamadanian, Pouya, et al.
Pubblicazione: (2025)
di: Hamadanian, Pouya, et al.
Pubblicazione: (2025)
PAT: Accelerating LLM Decoding via Prefix-Aware Attention with Resource Efficient Multi-Tile Kernel
di: Yi, Jinjun, et al.
Pubblicazione: (2025)
di: Yi, Jinjun, et al.
Pubblicazione: (2025)
MineDraft: A Framework for Batch Parallel Speculative Decoding
di: Tang, Zhenwei, et al.
Pubblicazione: (2026)
di: Tang, Zhenwei, et al.
Pubblicazione: (2026)
KPerfIR: Towards an Open and Compiler-centric Ecosystem for GPU Kernel Performance Tooling on Modern AI Workloads
di: Guan, Yue, et al.
Pubblicazione: (2025)
di: Guan, Yue, et al.
Pubblicazione: (2025)
Parallel DNA Sequence Alignment on High-Performance Systems with CUDA and MPI
di: Zwaka, Linus
Pubblicazione: (2024)
di: Zwaka, Linus
Pubblicazione: (2024)
ARGUS: Agentic GPU Optimization Guided by Data-Flow Invariants
di: Mai, Haohui, et al.
Pubblicazione: (2026)
di: Mai, Haohui, et al.
Pubblicazione: (2026)
FedSEA-LLaMA: A Secure, Efficient and Adaptive Federated Splitting Framework for Large Language Models
di: Zhang, Zishuai, et al.
Pubblicazione: (2025)
di: Zhang, Zishuai, et al.
Pubblicazione: (2025)
CA-AC-MPC: CUDA-Accelerated Actor-Critic Model Predictive Control
di: Buo, Antoonio, et al.
Pubblicazione: (2026)
di: Buo, Antoonio, et al.
Pubblicazione: (2026)
Parallel Paradigms in Modern HPC: A Comparative Analysis of MPI, OpenMP, and CUDA
di: ALHafez, Nizar, et al.
Pubblicazione: (2025)
di: ALHafez, Nizar, et al.
Pubblicazione: (2025)
Deploying Atmospheric and Oceanic AI Models on Chinese Hardware and Framework: Migration Strategies, Performance Optimization and Analysis
di: Sun, Yuze, et al.
Pubblicazione: (2025)
di: Sun, Yuze, et al.
Pubblicazione: (2025)
Improving Parallel Program Performance with LLM Optimizers via Agent-System Interfaces
di: Wei, Anjiang, et al.
Pubblicazione: (2024)
di: Wei, Anjiang, et al.
Pubblicazione: (2024)
Lessons Learned Migrating CUDA to SYCL: A HEP Case Study with ROOT RDataFrame
di: Chen, Jolly, et al.
Pubblicazione: (2024)
di: Chen, Jolly, et al.
Pubblicazione: (2024)
Accelerating Intra-Node GPU-to-GPU Communication Through Multi-Path Transfers with CUDA Graphs
di: Sojoodi, Amirhossein, et al.
Pubblicazione: (2026)
di: Sojoodi, Amirhossein, et al.
Pubblicazione: (2026)
Optimizing Data Distribution and Kernel Performance for Efficient Training of Chemistry Foundation Models: A Case Study with MACE
di: Firoz, Jesun, et al.
Pubblicazione: (2025)
di: Firoz, Jesun, et al.
Pubblicazione: (2025)
Hardware-Aware Reformulation of Convolutions for Efficient Execution on Specialized AI Hardware: A Case Study on NVIDIA Tensor Cores
di: Bikshandi, Ganesh
Pubblicazione: (2026)
di: Bikshandi, Ganesh
Pubblicazione: (2026)
The Case for Co-Designing Model Architectures with Hardware
di: Anthony, Quentin, et al.
Pubblicazione: (2024)
di: Anthony, Quentin, et al.
Pubblicazione: (2024)
StitchCUDA: An Automated Multi-Agents End-to-End GPU Programing Framework with Rubric-based Agentic Reinforcement Learning
di: Li, Shiyang, et al.
Pubblicazione: (2026)
di: Li, Shiyang, et al.
Pubblicazione: (2026)
LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving
di: Hu, Huanqi, et al.
Pubblicazione: (2025)
di: Hu, Huanqi, et al.
Pubblicazione: (2025)
Debunking the CUDA Myth Towards GPU-based AI Systems
di: Lee, Yunjae, et al.
Pubblicazione: (2024)
di: Lee, Yunjae, et al.
Pubblicazione: (2024)
Problem-Parameter-Free Decentralized Nonconvex Stochastic Optimization
di: Li, Jiaxiang, et al.
Pubblicazione: (2024)
di: Li, Jiaxiang, et al.
Pubblicazione: (2024)
Tiny but Mighty: A Software-Hardware Co-Design Approach for Efficient Multimodal Inference on Battery-Powered Small Devices
di: Li, Yilong, et al.
Pubblicazione: (2025)
di: Li, Yilong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
RTop-K: Ultra-Fast Row-Wise Top-K Selection for Neural Network Acceleration on GPUs
di: Xie, Xi, et al.
Pubblicazione: (2024) -
Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU
di: Spoczynski, Marcin, et al.
Pubblicazione: (2026) -
FPTC: A Fast Parallel Transform-based Codec for Efficient Asymmetric Signal Compression
di: Mechels, Ben, et al.
Pubblicazione: (2026) -
Tutoring LLM into a Better CUDA Optimizer
di: Brabec, Matyáš, et al.
Pubblicazione: (2025) -
SwizzlePerf: Hardware-Aware LLMs for GPU Kernel Performance Optimization
di: Tschand, Arya, et al.
Pubblicazione: (2025)