QiMeng-Kernel: Macro-Thinking Micro-Coding Paradigm for LLM-Based High-Performance GPU Kernel Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Xinguo, Peng, Shaohui, Guo, Jiaming, Chen, Yunji, Guo, Qi, Wen, Yuanbo, Qin, Hang, Chen, Ruizhi, Zhou, Qirui, Gao, Ke, Wu, Yanjun, Zhao, Chen, Li, Ling |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
QiMeng-Attention: SOTA Attention Operator is generated by SOTA Attention Algorithm
di: Zhou, Qirui, et al.
Pubblicazione: (2025)
di: Zhou, Qirui, et al.
Pubblicazione: (2025)
QiMeng-TensorOp: Automatically Generating High-Performance Tensor Operators with Hardware Primitives
di: Zhang, Xuzhi, et al.
Pubblicazione: (2025)
di: Zhang, Xuzhi, et al.
Pubblicazione: (2025)
QiMeng-Xpiler: Transcompiling Tensor Programs for Deep Learning Systems with a Neural-Symbolic Approach
di: Dong, Shouyang, et al.
Pubblicazione: (2025)
di: Dong, Shouyang, et al.
Pubblicazione: (2025)
QiMeng-MuPa: Mutual-Supervised Learning for Sequential-to-Parallel Code Translation
di: Ke, Changxin, et al.
Pubblicazione: (2025)
di: Ke, Changxin, et al.
Pubblicazione: (2025)
QiMeng-PRepair: Precise Code Repair via Edit-Aware Reward Optimization
di: Ke, Changxin, et al.
Pubblicazione: (2026)
di: Ke, Changxin, et al.
Pubblicazione: (2026)
QiMeng-NeuComBack: Self-Evolving Translation from IR to Assembly Code
di: Fang, Hainan, et al.
Pubblicazione: (2025)
di: Fang, Hainan, et al.
Pubblicazione: (2025)
QiMeng-SALV: Signal-Aware Learning for Verilog Code Generation
di: Zhang, Yang, et al.
Pubblicazione: (2025)
di: Zhang, Yang, et al.
Pubblicazione: (2025)
QiMeng: Fully Automated Hardware and Software Design for Processor Chip
di: Zhang, Rui, et al.
Pubblicazione: (2025)
di: Zhang, Rui, et al.
Pubblicazione: (2025)
QiMeng-CPU-v2: Automated Superscalar Processor Design by Learning Data Dependencies
di: Cheng, Shuyao, et al.
Pubblicazione: (2025)
di: Cheng, Shuyao, et al.
Pubblicazione: (2025)
ACC Saturator: Automatic Kernel Optimization for Directive-Based GPU Code
di: Matsumura, Kazuaki, et al.
Pubblicazione: (2023)
di: Matsumura, Kazuaki, et al.
Pubblicazione: (2023)
QiMeng-CodeV-R1: Reasoning-Enhanced Verilog Generation
di: Zhu, Yaoyu, et al.
Pubblicazione: (2025)
di: Zhu, Yaoyu, et al.
Pubblicazione: (2025)
Microsecond-scale Dynamic Validation of Idempotency for GPU Kernels
di: Han, Mingcong, et al.
Pubblicazione: (2024)
di: Han, Mingcong, et al.
Pubblicazione: (2024)
Astra: A Multi-Agent System for GPU Kernel Performance Optimization
di: Wei, Anjiang, et al.
Pubblicazione: (2025)
di: Wei, Anjiang, et al.
Pubblicazione: (2025)
A Framework for Fine-Grained Synchronization of Dependent GPU Kernels
di: Jangda, Abhinav, et al.
Pubblicazione: (2023)
di: Jangda, Abhinav, et al.
Pubblicazione: (2023)
KEET: Explaining Performance of GPU Kernels Using LLM Agents
di: Davis, Joshua H., et al.
Pubblicazione: (2026)
di: Davis, Joshua H., et al.
Pubblicazione: (2026)
On Similarity of Computational Kernels in our Codes and Proxies
di: McKinsey, Michael, et al.
Pubblicazione: (2026)
di: McKinsey, Michael, et al.
Pubblicazione: (2026)
PICO: Accelerating All k-Core Paradigms on GPU
di: Zhao, Chen, et al.
Pubblicazione: (2024)
di: Zhao, Chen, et al.
Pubblicazione: (2024)
The Fused Kernel Library: A C++ API to Develop Highly-Efficient GPU Libraries
di: Amoros, Oscar, et al.
Pubblicazione: (2025)
di: Amoros, Oscar, et al.
Pubblicazione: (2025)
KernelFoundry: Hardware-aware evolutionary GPU kernel optimization
di: Wiedemann, Nina, et al.
Pubblicazione: (2026)
di: Wiedemann, Nina, et al.
Pubblicazione: (2026)
QPU Micro-Kernels for Stencil Computation
di: Markidis, Stefano, et al.
Pubblicazione: (2025)
di: Markidis, Stefano, et al.
Pubblicazione: (2025)
ParallelKittens: Systematic and Practical Simplification of Multi-GPU AI Kernels
di: Sul, Stuart H., et al.
Pubblicazione: (2025)
di: Sul, Stuart H., et al.
Pubblicazione: (2025)
SwizzlePerf: Hardware-Aware LLMs for GPU Kernel Performance Optimization
di: Tschand, Arya, et al.
Pubblicazione: (2025)
di: Tschand, Arya, et al.
Pubblicazione: (2025)
QiMeng-CodeV-SVA: Training Specialized LLMs for Hardware Assertion Generation via RTL-Grounded Bidirectional Data Synthesis
di: Wu, Yutong, et al.
Pubblicazione: (2026)
di: Wu, Yutong, et al.
Pubblicazione: (2026)
Integrating Performance Tools in Model Reasoning for GPU Kernel Optimization
di: Nichols, Daniel, et al.
Pubblicazione: (2025)
di: Nichols, Daniel, et al.
Pubblicazione: (2025)
Fine-Tuning GPT-5 for GPU Kernel Generation
di: Tehrani, Ali, et al.
Pubblicazione: (2026)
di: Tehrani, Ali, et al.
Pubblicazione: (2026)
Liger Kernel: Efficient Triton Kernels for LLM Training
di: Hsu, Pin-Lun, et al.
Pubblicazione: (2024)
di: Hsu, Pin-Lun, et al.
Pubblicazione: (2024)
Syncopate: Efficient Multi-GPU AI Kernels via Automatic Chunk-Centric Compute-Communication Overlap
di: Qiang, Xinwei, et al.
Pubblicazione: (2026)
di: Qiang, Xinwei, et al.
Pubblicazione: (2026)
QiMeng-CRUX: Narrowing the Gap Between Natural Language and Verilog via Core Refined Understanding eXpression for Circuit Design
di: Huang, Lei, et al.
Pubblicazione: (2025)
di: Huang, Lei, et al.
Pubblicazione: (2025)
Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU
di: Spoczynski, Marcin, et al.
Pubblicazione: (2026)
di: Spoczynski, Marcin, et al.
Pubblicazione: (2026)
Accelerating Biclique Counting on GPU
di: Qiu, Linshan, et al.
Pubblicazione: (2024)
di: Qiu, Linshan, et al.
Pubblicazione: (2024)
Cephalo: Harnessing Heterogeneous GPU Clusters for Training Transformer Models
di: Guo, Runsheng Benson, et al.
Pubblicazione: (2024)
di: Guo, Runsheng Benson, et al.
Pubblicazione: (2024)
FlashFuser: Expanding the Scale of Kernel Fusion for Compute-Intensive Operators via Inter-Core Connection
di: Huang, Ziyu, et al.
Pubblicazione: (2025)
di: Huang, Ziyu, et al.
Pubblicazione: (2025)
FSA: An Alternative Efficient Implementation of Native Sparse Attention Kernel
di: Yan, Ran, et al.
Pubblicazione: (2025)
di: Yan, Ran, et al.
Pubblicazione: (2025)
Performant Unified GPU Kernels for Portable Singular Value Computation Across Hardware and Precision
di: Ringoot, Evelyne, et al.
Pubblicazione: (2025)
di: Ringoot, Evelyne, et al.
Pubblicazione: (2025)
FIKIT: Priority-Based Real-time GPU Multi-tasking Scheduling with Kernel Identification
di: Wu, Wenqing
Pubblicazione: (2023)
di: Wu, Wenqing
Pubblicazione: (2023)
CAT: A GPU-Accelerated FHE Framework with Its Application to High-Precision Private Dataset Query
di: Li, Qirui, et al.
Pubblicazione: (2025)
di: Li, Qirui, et al.
Pubblicazione: (2025)
GPUnion: Autonomous GPU Sharing on Campus
di: Li, Yufang, et al.
Pubblicazione: (2025)
di: Li, Yufang, et al.
Pubblicazione: (2025)
Triton-distributed: Programming Overlapping Kernels on Distributed AI Systems with the Triton Compiler
di: Zheng, Size, et al.
Pubblicazione: (2025)
di: Zheng, Size, et al.
Pubblicazione: (2025)
tritonBLAS: Triton-based Analytical Approach for GEMM Kernel Parameter Selection
di: Swann, Ryan, et al.
Pubblicazione: (2025)
di: Swann, Ryan, et al.
Pubblicazione: (2025)
From Sequential to Parallel: Reformulating Dynamic Programming as GPU Kernels for Large-Scale Stochastic Combinatorial Optimization
di: Zhao, Jingyi, et al.
Pubblicazione: (2026)
di: Zhao, Jingyi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
QiMeng-Attention: SOTA Attention Operator is generated by SOTA Attention Algorithm
di: Zhou, Qirui, et al.
Pubblicazione: (2025) -
QiMeng-TensorOp: Automatically Generating High-Performance Tensor Operators with Hardware Primitives
di: Zhang, Xuzhi, et al.
Pubblicazione: (2025) -
QiMeng-Xpiler: Transcompiling Tensor Programs for Deep Learning Systems with a Neural-Symbolic Approach
di: Dong, Shouyang, et al.
Pubblicazione: (2025) -
QiMeng-MuPa: Mutual-Supervised Learning for Sequential-to-Parallel Code Translation
di: Ke, Changxin, et al.
Pubblicazione: (2025) -
QiMeng-PRepair: Precise Code Repair via Edit-Aware Reward Optimization
di: Ke, Changxin, et al.
Pubblicazione: (2026)