CUDA-L2: Surpassing cuBLAS Performance for Matrix Multiplication through Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Su, Songqiao, Sun, Xiaofei, Li, Xiaoya, Wang, Albert, Li, Jiwei, Shum, Chris |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning
di: Li, Xiaoya, et al.
Pubblicazione: (2025)
di: Li, Xiaoya, et al.
Pubblicazione: (2025)
GrandCode: Achieving Grandmaster Level in Competitive Programming via Agentic Reinforcement Learning
di: DeepReinforce Team, et al.
Pubblicazione: (2026)
di: DeepReinforce Team, et al.
Pubblicazione: (2026)
CRINN: Contrastive Reinforcement Learning for Approximate Nearest Neighbor Search
di: Li, Xiaoya, et al.
Pubblicazione: (2025)
di: Li, Xiaoya, et al.
Pubblicazione: (2025)
cuVSLAM: CUDA accelerated visual odometry and mapping
di: Korovko, Alexander, et al.
Pubblicazione: (2025)
di: Korovko, Alexander, et al.
Pubblicazione: (2025)
cuPilot: A Strategy-Coordinated Multi-agent Framework for CUDA Kernel Evolution
di: Chen, Jinwu, et al.
Pubblicazione: (2025)
di: Chen, Jinwu, et al.
Pubblicazione: (2025)
Kernel splitting, Streams, cuBLAS (work in progress in the MG5aMC CUDACPP plugin)
di: Valassi, Andrea
Pubblicazione: (2024)
di: Valassi, Andrea
Pubblicazione: (2024)
cuAPO: A CUDA-based Parallelization of Artificial Protozoa Optimizer
di: Soliya, Henish, et al.
Pubblicazione: (2025)
di: Soliya, Henish, et al.
Pubblicazione: (2025)
New GPU developments in the Madgraph CUDACPP plugin: kernel splitting, helicity streams, cuBLAS color sums
di: Valassi, Andrea
Pubblicazione: (2025)
di: Valassi, Andrea
Pubblicazione: (2025)
Evaluation of computational and energy performance in matrix multiplication algorithms on CPU and GPU using MKL, cuBLAS and SYCL
di: Torres, L. A., et al.
Pubblicazione: (2024)
di: Torres, L. A., et al.
Pubblicazione: (2024)
Turn That Frown Upside Down: FaceID Customization via Cross-Training Data
di: Wang, Shuhe, et al.
Pubblicazione: (2025)
di: Wang, Shuhe, et al.
Pubblicazione: (2025)
CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generation
di: Dai, Weinan, et al.
Pubblicazione: (2026)
di: Dai, Weinan, et al.
Pubblicazione: (2026)
Reinforcement Learning Enhanced LLMs: A Survey
di: Wang, Shuhe, et al.
Pubblicazione: (2024)
di: Wang, Shuhe, et al.
Pubblicazione: (2024)
Enhancing the Traditional Chinese Medicine Capabilities of Large Language Model through Reinforcement Learning from AI Feedback
di: Yu, Song, et al.
Pubblicazione: (2024)
di: Yu, Song, et al.
Pubblicazione: (2024)
SofT-GRPO: Surpassing Discrete-Token LLM Reinforcement Learning via Gumbel-Reparameterized Soft-Thinking Policy Optimization
di: Zheng, Zhi, et al.
Pubblicazione: (2025)
di: Zheng, Zhi, et al.
Pubblicazione: (2025)
Align and Surpass Human Camouflaged Perception: Visual Refocus Reinforcement Fine-Tuning
di: Shen, Ruolin, et al.
Pubblicazione: (2025)
di: Shen, Ruolin, et al.
Pubblicazione: (2025)
CUDA-LLM: LLMs Can Write Efficient CUDA Kernels
di: Chen, Wentao, et al.
Pubblicazione: (2025)
di: Chen, Wentao, et al.
Pubblicazione: (2025)
FaceID-6M: A Large-Scale, Open-Source FaceID Customization Dataset
di: Wang, Shuhe, et al.
Pubblicazione: (2025)
di: Wang, Shuhe, et al.
Pubblicazione: (2025)
Instruction Tuning for Large Language Models: A Survey
di: Zhang, Shengyu, et al.
Pubblicazione: (2023)
di: Zhang, Shengyu, et al.
Pubblicazione: (2023)
KernelBlaster: Continual Cross-Task CUDA Optimization via Memory-Augmented In-Context Reinforcement Learning
di: Dong, Kris Shengjun, et al.
Pubblicazione: (2026)
di: Dong, Kris Shengjun, et al.
Pubblicazione: (2026)
Awesome-OL: An Extensible Toolkit for Online Learning
di: Liu, Zeyi, et al.
Pubblicazione: (2025)
di: Liu, Zeyi, et al.
Pubblicazione: (2025)
Are Human-generated Demonstrations Necessary for In-context Learning?
di: Li, Rui, et al.
Pubblicazione: (2023)
di: Li, Rui, et al.
Pubblicazione: (2023)
OpenTensor: Reproducing Faster Matrix Multiplication Discovering Algorithms
di: Sun, Yiwen, et al.
Pubblicazione: (2024)
di: Sun, Yiwen, et al.
Pubblicazione: (2024)
O1 Replication Journey -- Part 2: Surpassing O1-preview through Simple Distillation, Big Progress or Bitter Lesson?
di: Huang, Zhen, et al.
Pubblicazione: (2024)
di: Huang, Zhen, et al.
Pubblicazione: (2024)
Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource
di: Li, Houyi, et al.
Pubblicazione: (2025)
di: Li, Houyi, et al.
Pubblicazione: (2025)
StockMem: An Event-Reflection Memory Framework for Stock Forecasting
di: Wang, He, et al.
Pubblicazione: (2025)
di: Wang, He, et al.
Pubblicazione: (2025)
Beyond Human Preferences: Exploring Reinforcement Learning Trajectory Evaluation and Improvement through LLMs
di: Shen, Zichao, et al.
Pubblicazione: (2024)
di: Shen, Zichao, et al.
Pubblicazione: (2024)
Template-assisted Contrastive Learning of Task-oriented Dialogue Sentence Embeddings
di: Oh, Minsik, et al.
Pubblicazione: (2023)
di: Oh, Minsik, et al.
Pubblicazione: (2023)
HPCTransCompile: An AI Compiler Generated Dataset for High-Performance CUDA Transpilation and LLM Preliminary Exploration
di: Lv, Jiaqi, et al.
Pubblicazione: (2025)
di: Lv, Jiaqi, et al.
Pubblicazione: (2025)
CUDABench: Benchmarking LLMs for Text-to-CUDA Generation
di: Zhu, Jiace, et al.
Pubblicazione: (2026)
di: Zhu, Jiace, et al.
Pubblicazione: (2026)
Architectural Scaling Surpass Basis Complexity? Efficient KANs with Single-Parameter Design
di: Chen, Zhijie, et al.
Pubblicazione: (2024)
di: Chen, Zhijie, et al.
Pubblicazione: (2024)
Spatial Blindness in Whole-Slide Multiple Instance Learning
di: Li, Xiangyu, et al.
Pubblicazione: (2026)
di: Li, Xiangyu, et al.
Pubblicazione: (2026)
Tree of Agents: Improving Long-Context Capabilities of Large Language Models through Multi-Perspective Reasoning
di: Yu, Song, et al.
Pubblicazione: (2025)
di: Yu, Song, et al.
Pubblicazione: (2025)
UR$^2$: Unify RAG and Reasoning through Reinforcement Learning
di: Li, Weitao, et al.
Pubblicazione: (2025)
di: Li, Weitao, et al.
Pubblicazione: (2025)
Towards Robust Agentic CUDA Kernel Benchmarking, Verification, and Optimization
di: Lange, Robert Tjarko, et al.
Pubblicazione: (2025)
di: Lange, Robert Tjarko, et al.
Pubblicazione: (2025)
Lateral Tree-of-Thoughts Surpasses ToT by Incorporating Logically-Consistent, Low-Utility Candidates
di: Madahar, Abhinav
Pubblicazione: (2025)
di: Madahar, Abhinav
Pubblicazione: (2025)
Meta-Cognitive Reinforcement Learning with Self-Doubt and Recovery
di: Zhang, Zhipeng, et al.
Pubblicazione: (2026)
di: Zhang, Zhipeng, et al.
Pubblicazione: (2026)
Model2Kernel: Model-Aware Symbolic Execution For Safe CUDA Kernels
di: He, Mengting, et al.
Pubblicazione: (2026)
di: He, Mengting, et al.
Pubblicazione: (2026)
From Large to Small: Transferring CUDA Optimization Expertise via Reasoning Graph
di: Gong, Junfeng, et al.
Pubblicazione: (2025)
di: Gong, Junfeng, et al.
Pubblicazione: (2025)
Evaluating GPT- and Reasoning-based Large Language Models on Physics Olympiad Problems: Surpassing Human Performance and Implications for Educational Assessment
di: Tschisgale, Paul, et al.
Pubblicazione: (2025)
di: Tschisgale, Paul, et al.
Pubblicazione: (2025)
OSC: Cognitive Orchestration through Dynamic Knowledge Alignment in Multi-Agent LLM Collaboration
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning
di: Li, Xiaoya, et al.
Pubblicazione: (2025) -
GrandCode: Achieving Grandmaster Level in Competitive Programming via Agentic Reinforcement Learning
di: DeepReinforce Team, et al.
Pubblicazione: (2026) -
CRINN: Contrastive Reinforcement Learning for Approximate Nearest Neighbor Search
di: Li, Xiaoya, et al.
Pubblicazione: (2025) -
cuVSLAM: CUDA accelerated visual odometry and mapping
di: Korovko, Alexander, et al.
Pubblicazione: (2025) -
cuPilot: A Strategy-Coordinated Multi-agent Framework for CUDA Kernel Evolution
di: Chen, Jinwu, et al.
Pubblicazione: (2025)