Liger Kernel: Efficient Triton Kernels for LLM Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Hsu, Pin-Lun, Dai, Yun, Kothapalli, Vignesh, Song, Qingquan, Tang, Shao, Zhu, Siyu, Shimizu, Steven, Sahni, Shivam, Ning, Haowen, Chen, Yanning |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Triton-distributed: Programming Overlapping Kernels on Distributed AI Systems with the Triton Compiler
di: Zheng, Size, et al.
Pubblicazione: (2025)
di: Zheng, Size, et al.
Pubblicazione: (2025)
tritonBLAS: Triton-based Analytical Approach for GEMM Kernel Parameter Selection
di: Swann, Ryan, et al.
Pubblicazione: (2025)
di: Swann, Ryan, et al.
Pubblicazione: (2025)
Accelerating a Triton Fused Kernel for W4A16 Quantized Inference with SplitK work decomposition
di: Hoque, Adnan, et al.
Pubblicazione: (2024)
di: Hoque, Adnan, et al.
Pubblicazione: (2024)
UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training
di: Zheng, Size, et al.
Pubblicazione: (2026)
di: Zheng, Size, et al.
Pubblicazione: (2026)
Junctiond: Extending FaaS Runtimes with Kernel-Bypass
di: Saurez, Enrique, et al.
Pubblicazione: (2024)
di: Saurez, Enrique, et al.
Pubblicazione: (2024)
On Similarity of Computational Kernels in our Codes and Proxies
di: McKinsey, Michael, et al.
Pubblicazione: (2026)
di: McKinsey, Michael, et al.
Pubblicazione: (2026)
Composing Distributed Computations Through Task and Kernel Fusion
di: Yadav, Rohan, et al.
Pubblicazione: (2024)
di: Yadav, Rohan, et al.
Pubblicazione: (2024)
Improving the Efficiency of OpenCL Kernels through Pipes
di: Zarch, Mostafa Eghbali, et al.
Pubblicazione: (2022)
di: Zarch, Mostafa Eghbali, et al.
Pubblicazione: (2022)
Seer: Predictive Runtime Kernel Selection for Irregular Problems
di: Swann, Ryan, et al.
Pubblicazione: (2024)
di: Swann, Ryan, et al.
Pubblicazione: (2024)
Exploring Sparse Matrix Multiplication Kernels on the Cerebras CS-3
di: Shah, Milan, et al.
Pubblicazione: (2026)
di: Shah, Milan, et al.
Pubblicazione: (2026)
A Framework for Fine-Grained Synchronization of Dependent GPU Kernels
di: Jangda, Abhinav, et al.
Pubblicazione: (2023)
di: Jangda, Abhinav, et al.
Pubblicazione: (2023)
ACC Saturator: Automatic Kernel Optimization for Directive-Based GPU Code
di: Matsumura, Kazuaki, et al.
Pubblicazione: (2023)
di: Matsumura, Kazuaki, et al.
Pubblicazione: (2023)
Boosting Performance of Iterative Applications on GPUs: Kernel Batching with CUDA Graphs
di: Ekelund, Jonah, et al.
Pubblicazione: (2025)
di: Ekelund, Jonah, et al.
Pubblicazione: (2025)
FlashSketch: Sketch-Kernel Co-Design for Fast Sparse Sketching on GPUs
di: Dwaraknath, Rajat Vadiraj, et al.
Pubblicazione: (2026)
di: Dwaraknath, Rajat Vadiraj, et al.
Pubblicazione: (2026)
Popcorn: Accelerating Kernel K-means on GPUs through Sparse Linear Algebra
di: Bellavita, Julian, et al.
Pubblicazione: (2025)
di: Bellavita, Julian, et al.
Pubblicazione: (2025)
NineToothed: A Triton-Based High-Level Domain-Specific Language for Machine Learning
di: Huang, Jiacheng, et al.
Pubblicazione: (2025)
di: Huang, Jiacheng, et al.
Pubblicazione: (2025)
QiMeng-Kernel: Macro-Thinking Micro-Coding Paradigm for LLM-Based High-Performance GPU Kernel Generation
di: Zhu, Xinguo, et al.
Pubblicazione: (2025)
di: Zhu, Xinguo, et al.
Pubblicazione: (2025)
Hello SME! Generating Fast Matrix Multiplication Kernels Using the Scalable Matrix Extension
di: Remke, Stefan, et al.
Pubblicazione: (2024)
di: Remke, Stefan, et al.
Pubblicazione: (2024)
The Fused Kernel Library: A C++ API to Develop Highly-Efficient GPU Libraries
di: Amoros, Oscar, et al.
Pubblicazione: (2025)
di: Amoros, Oscar, et al.
Pubblicazione: (2025)
TileLink: Generating Efficient Compute-Communication Overlapping Kernels using Tile-Centric Primitives
di: Zheng, Size, et al.
Pubblicazione: (2025)
di: Zheng, Size, et al.
Pubblicazione: (2025)
Can Tensor Cores Benefit Memory-Bound Kernels? (No!)
di: Zhang, Lingqi, et al.
Pubblicazione: (2025)
di: Zhang, Lingqi, et al.
Pubblicazione: (2025)
RSH-SpMM: A Row-Structured Hybrid Kernel for Sparse Matrix-Matrix Multiplication on GPUs
di: Li, Aiying, et al.
Pubblicazione: (2026)
di: Li, Aiying, et al.
Pubblicazione: (2026)
FlashFuser: Expanding the Scale of Kernel Fusion for Compute-Intensive Operators via Inter-Core Connection
di: Huang, Ziyu, et al.
Pubblicazione: (2025)
di: Huang, Ziyu, et al.
Pubblicazione: (2025)
SpComm3D: A Framework for Enabling Sparse Communication in 3D Sparse Kernels
di: Abubaker, Nabil, et al.
Pubblicazione: (2024)
di: Abubaker, Nabil, et al.
Pubblicazione: (2024)
Syncopate: Efficient Multi-GPU AI Kernels via Automatic Chunk-Centric Compute-Communication Overlap
di: Qiang, Xinwei, et al.
Pubblicazione: (2026)
di: Qiang, Xinwei, et al.
Pubblicazione: (2026)
Fair Kernel-Lock-Free Claim/Release Protocol for Shared Object Access in Cooperatively Scheduled Runtimes
di: Chalmers, Kevin, et al.
Pubblicazione: (2025)
di: Chalmers, Kevin, et al.
Pubblicazione: (2025)
Optimizing Data Distribution and Kernel Performance for Efficient Training of Chemistry Foundation Models: A Case Study with MACE
di: Firoz, Jesun, et al.
Pubblicazione: (2025)
di: Firoz, Jesun, et al.
Pubblicazione: (2025)
KEET: Explaining Performance of GPU Kernels Using LLM Agents
di: Davis, Joshua H., et al.
Pubblicazione: (2026)
di: Davis, Joshua H., et al.
Pubblicazione: (2026)
Cache Blocking of Distributed-Memory Parallel Matrix Power Kernels
di: Lacey, Dane C., et al.
Pubblicazione: (2024)
di: Lacey, Dane C., et al.
Pubblicazione: (2024)
FACT: Compositional Kernel Synthesis with a Three-Stage Agentic Workflow
di: Heidari, Sina, et al.
Pubblicazione: (2026)
di: Heidari, Sina, et al.
Pubblicazione: (2026)
Resource-efficient Parallel Split Learning in Heterogeneous Edge Computing
di: Zhang, Mingjin, et al.
Pubblicazione: (2024)
di: Zhang, Mingjin, et al.
Pubblicazione: (2024)
W4A16 Mixed-Precision Matrix Multiplication on Decoupled Architecture: Kernel Design and Memory Bottleneck Analysis for Ascend NPUs
di: He, Yuanhong, et al.
Pubblicazione: (2026)
di: He, Yuanhong, et al.
Pubblicazione: (2026)
Iris: First-Class Multi-GPU Programming Experience in Triton
di: Awad, Muhammad, et al.
Pubblicazione: (2025)
di: Awad, Muhammad, et al.
Pubblicazione: (2025)
HAP: SPMD DNN Training on Heterogeneous GPU Clusters with Automated Program Synthesis
di: Zhang, Shiwei, et al.
Pubblicazione: (2024)
di: Zhang, Shiwei, et al.
Pubblicazione: (2024)
AcceleratedKernels.jl: Cross-Architecture Parallel Algorithms from a Unified, Transpiled Codebase
di: Nicusan, Andrei-Leonard, et al.
Pubblicazione: (2025)
di: Nicusan, Andrei-Leonard, et al.
Pubblicazione: (2025)
Portable High-Performance Kernel Generation for a Computational Fluid Dynamics Code with DaCe
di: Andersson, Måns I., et al.
Pubblicazione: (2025)
di: Andersson, Måns I., et al.
Pubblicazione: (2025)
PAT: Accelerating LLM Decoding via Prefix-Aware Attention with Resource Efficient Multi-Tile Kernel
di: Yi, Jinjun, et al.
Pubblicazione: (2025)
di: Yi, Jinjun, et al.
Pubblicazione: (2025)
KernelFoundry: Hardware-aware evolutionary GPU kernel optimization
di: Wiedemann, Nina, et al.
Pubblicazione: (2026)
di: Wiedemann, Nina, et al.
Pubblicazione: (2026)
FSA: An Alternative Efficient Implementation of Native Sparse Attention Kernel
di: Yan, Ran, et al.
Pubblicazione: (2025)
di: Yan, Ran, et al.
Pubblicazione: (2025)
Tessera: Unlocking Heterogeneous GPUs through Kernel-Granularity Disaggregation
di: Hu, Tiancheng, et al.
Pubblicazione: (2026)
di: Hu, Tiancheng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Triton-distributed: Programming Overlapping Kernels on Distributed AI Systems with the Triton Compiler
di: Zheng, Size, et al.
Pubblicazione: (2025) -
tritonBLAS: Triton-based Analytical Approach for GEMM Kernel Parameter Selection
di: Swann, Ryan, et al.
Pubblicazione: (2025) -
Accelerating a Triton Fused Kernel for W4A16 Quantized Inference with SplitK work decomposition
di: Hoque, Adnan, et al.
Pubblicazione: (2024) -
UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training
di: Zheng, Size, et al.
Pubblicazione: (2026) -
Junctiond: Extending FaaS Runtimes with Kernel-Bypass
di: Saurez, Enrique, et al.
Pubblicazione: (2024)