Fine-Tuning GPT-5 for GPU Kernel Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Tehrani, Ali, Emara, Yahya, Wissam, Essam, Paluch, Wojciech, Atallah, Waleed, Dudziak, Łukasz, Abdelfattah, Mohamed S. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
An Efficient Heterogeneous Co-Design for Fine-Tuning on a Single GPU
por: Yang, Ruijia, et al.
Publicado: (2026)
por: Yang, Ruijia, et al.
Publicado: (2026)
A Framework for Fine-Grained Synchronization of Dependent GPU Kernels
por: Jangda, Abhinav, et al.
Publicado: (2023)
por: Jangda, Abhinav, et al.
Publicado: (2023)
Fine-Tuning and Serving Gemma 4 31B on Google Cloud TPU: A Technical Comparison with GPU Baselines
por: Kishnani, Jatin, et al.
Publicado: (2026)
por: Kishnani, Jatin, et al.
Publicado: (2026)
SwizzlePerf: Hardware-Aware LLMs for GPU Kernel Performance Optimization
por: Tschand, Arya, et al.
Publicado: (2025)
por: Tschand, Arya, et al.
Publicado: (2025)
Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU
por: Spoczynski, Marcin, et al.
Publicado: (2026)
por: Spoczynski, Marcin, et al.
Publicado: (2026)
GigaAPI for GPU Parallelization
por: Suvarna, M., et al.
Publicado: (2025)
por: Suvarna, M., et al.
Publicado: (2025)
LoHan: Low-Cost High-Performance Framework to Fine-Tune 100B Model on a Consumer GPU
por: Liao, Changyue, et al.
Publicado: (2024)
por: Liao, Changyue, et al.
Publicado: (2024)
ACC Saturator: Automatic Kernel Optimization for Directive-Based GPU Code
por: Matsumura, Kazuaki, et al.
Publicado: (2023)
por: Matsumura, Kazuaki, et al.
Publicado: (2023)
HAS-GPU: Efficient Hybrid Auto-scaling with Fine-grained GPU Allocation for SLO-aware Serverless Inferences
por: Gu, Jianfeng, et al.
Publicado: (2025)
por: Gu, Jianfeng, et al.
Publicado: (2025)
Federated Fine-Tuning of Sparsely-Activated Large Language Models on Resource-Constrained Devices
por: Chen, Fahao, et al.
Publicado: (2025)
por: Chen, Fahao, et al.
Publicado: (2025)
The Fused Kernel Library: A C++ API to Develop Highly-Efficient GPU Libraries
por: Amoros, Oscar, et al.
Publicado: (2025)
por: Amoros, Oscar, et al.
Publicado: (2025)
GPU-Virt-Bench: A Comprehensive Benchmarking Framework for Software-Based GPU Virtualization Systems
por: VG, Jithin, et al.
Publicado: (2025)
por: VG, Jithin, et al.
Publicado: (2025)
ARYA: A Physics-Constrained Composable & Deterministic World Model Architecture
por: Dobrin, Seth, et al.
Publicado: (2026)
por: Dobrin, Seth, et al.
Publicado: (2026)
Profiling and optimization of multi-card GPU machine learning jobs
por: Lawenda, Marcin, et al.
Publicado: (2025)
por: Lawenda, Marcin, et al.
Publicado: (2025)
KEET: Explaining Performance of GPU Kernels Using LLM Agents
por: Davis, Joshua H., et al.
Publicado: (2026)
por: Davis, Joshua H., et al.
Publicado: (2026)
Energy-aware Distributed Microservice Request Placement at the Edge
por: Toczé, Klervie, et al.
Publicado: (2024)
por: Toczé, Klervie, et al.
Publicado: (2024)
Energy Metrics for Edge Microservice Request Placement Strategies
por: Toczé, Klervie, et al.
Publicado: (2025)
por: Toczé, Klervie, et al.
Publicado: (2025)
Efficient allocation of image recognition and LLM tasks on multi-GPU system
por: Lawenda, Marcin, et al.
Publicado: (2025)
por: Lawenda, Marcin, et al.
Publicado: (2025)
Syncopate: Efficient Multi-GPU AI Kernels via Automatic Chunk-Centric Compute-Communication Overlap
por: Qiang, Xinwei, et al.
Publicado: (2026)
por: Qiang, Xinwei, et al.
Publicado: (2026)
Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism
por: Mo, Zizhao, et al.
Publicado: (2025)
por: Mo, Zizhao, et al.
Publicado: (2025)
Taming GPU Underutilization via Static Partitioning and Fine-grained CPU Offloading
por: Schieffer, Gabin, et al.
Publicado: (2026)
por: Schieffer, Gabin, et al.
Publicado: (2026)
FinGraV: Methodology for Fine-Grain GPU Power Visibility and Insights
por: Singhania, Varsha, et al.
Publicado: (2024)
por: Singhania, Varsha, et al.
Publicado: (2024)
UCCL-Zip: Lossless Compression Supercharged GPU Communication
por: Ma, Shuang, et al.
Publicado: (2026)
por: Ma, Shuang, et al.
Publicado: (2026)
MSCCL++: Rethinking GPU Communication Abstractions for AI Inference
por: Hwang, Changho, et al.
Publicado: (2025)
por: Hwang, Changho, et al.
Publicado: (2025)
Power- and Fragmentation-aware Online Scheduling for GPU Datacenters
por: Lettich, Francesco, et al.
Publicado: (2024)
por: Lettich, Francesco, et al.
Publicado: (2024)
Beyond the GPU: The Strategic Role of FPGAs in the Next Wave of AI
por: Jiménez, Arturo Urías
Publicado: (2025)
por: Jiménez, Arturo Urías
Publicado: (2025)
Efficient Fine-Grained GPU Performance Modeling for Distributed Deep Learning of LLM
por: Zhang, Biyao, et al.
Publicado: (2025)
por: Zhang, Biyao, et al.
Publicado: (2025)
QiMeng-Kernel: Macro-Thinking Micro-Coding Paradigm for LLM-Based High-Performance GPU Kernel Generation
por: Zhu, Xinguo, et al.
Publicado: (2025)
por: Zhu, Xinguo, et al.
Publicado: (2025)
Towards Scalable GPU-Accelerated SNN Training via Temporal Fusion
por: Li, Yanchen, et al.
Publicado: (2024)
por: Li, Yanchen, et al.
Publicado: (2024)
Accelerating Large Language Model Training with Hybrid GPU-based Compression
por: Xu, Lang, et al.
Publicado: (2024)
por: Xu, Lang, et al.
Publicado: (2024)
Speeding up Local Optimization in Vehicle Routing with Tensor-based GPU Acceleration
por: Lei, Zhenyu, et al.
Publicado: (2025)
por: Lei, Zhenyu, et al.
Publicado: (2025)
Accurate GPU Memory Prediction for Deep Learning Jobs through Dynamic Analysis
por: Shi, Jiabo, et al.
Publicado: (2025)
por: Shi, Jiabo, et al.
Publicado: (2025)
Reducing Fragmentation and Starvation in GPU Clusters through Dynamic Multi-Objective Scheduling
por: Mamirov, Akhmadillo
Publicado: (2025)
por: Mamirov, Akhmadillo
Publicado: (2025)
A Spark Optimizer for Adaptive, Fine-Grained Parameter Tuning
por: Lyu, Chenghao, et al.
Publicado: (2024)
por: Lyu, Chenghao, et al.
Publicado: (2024)
Split Fine-Tuning for Large Language Models in Wireless Networks
por: Zhang, Songge, et al.
Publicado: (2025)
por: Zhang, Songge, et al.
Publicado: (2025)
Heterogeneous Federated Fine-Tuning with Parallel One-Rank Adaptation
por: Zhang, Zikai, et al.
Publicado: (2026)
por: Zhang, Zikai, et al.
Publicado: (2026)
Symbiosis: Multi-Adapter Inference and Fine-Tuning
por: Gupta, Saransh, et al.
Publicado: (2025)
por: Gupta, Saransh, et al.
Publicado: (2025)
Record-Remix-Replay: Hierarchical GPU Kernel Optimization using Evolutionary Search
por: Nichols, Daniel, et al.
Publicado: (2026)
por: Nichols, Daniel, et al.
Publicado: (2026)
Accelerated Digital Twin Learning for Edge AI: A Comparison of FPGA and Mobile GPU
por: Xu, Bin, et al.
Publicado: (2025)
por: Xu, Bin, et al.
Publicado: (2025)
Practical offloading for fine-tuning LLM on commodity GPU via learned sparse projectors
por: Chen, Siyuan, et al.
Publicado: (2024)
por: Chen, Siyuan, et al.
Publicado: (2024)
Ejemplares similares
-
An Efficient Heterogeneous Co-Design for Fine-Tuning on a Single GPU
por: Yang, Ruijia, et al.
Publicado: (2026) -
A Framework for Fine-Grained Synchronization of Dependent GPU Kernels
por: Jangda, Abhinav, et al.
Publicado: (2023) -
Fine-Tuning and Serving Gemma 4 31B on Google Cloud TPU: A Technical Comparison with GPU Baselines
por: Kishnani, Jatin, et al.
Publicado: (2026) -
SwizzlePerf: Hardware-Aware LLMs for GPU Kernel Performance Optimization
por: Tschand, Arya, et al.
Publicado: (2025) -
Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU
por: Spoczynski, Marcin, et al.
Publicado: (2026)