FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dege, Pengcuo, Luo, Qiuming, Mao, Rui, Kong, Chang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Irminsul: MLA-Native Position-Independent Caching for Agentic LLM Serving
par: Ma, Bole, et autres
Publié: (2026)
par: Ma, Bole, et autres
Publié: (2026)
Performance Portable Monte Carlo Particle Transport on Intel, NVIDIA, and AMD GPUs
par: Tramm, John, et autres
Publié: (2024)
par: Tramm, John, et autres
Publié: (2024)
Joint Training on AMD and NVIDIA GPUs
par: Hu, Jon, et autres
Publié: (2026)
par: Hu, Jon, et autres
Publié: (2026)
Accelerating Maximal Biclique Enumeration on GPUs
par: Hsieh, Chou-Ying, et autres
Publié: (2024)
par: Hsieh, Chou-Ying, et autres
Publié: (2024)
ESG: Pipeline-Conscious Efficient Scheduling of DNN Workflows on Serverless Platforms with Shareable GPUs
par: Hui, Xinning, et autres
Publié: (2024)
par: Hui, Xinning, et autres
Publié: (2024)
FlashSketch: Sketch-Kernel Co-Design for Fast Sparse Sketching on GPUs
par: Dwaraknath, Rajat Vadiraj, et autres
Publié: (2026)
par: Dwaraknath, Rajat Vadiraj, et autres
Publié: (2026)
FlashMP: Fast Discrete Transform-Based Solver for Preconditioning Maxwell's Equations on GPUs
par: Zhang, Haoyuan, et autres
Publié: (2025)
par: Zhang, Haoyuan, et autres
Publié: (2025)
Efficiently Parallelizable Strassen-Based Multiplication of a Matrix by its Transpose
par: Arrigoni, Viviana, et autres
Publié: (2021)
par: Arrigoni, Viviana, et autres
Publié: (2021)
A Pipelined Collaborative Speculative Decoding Framework for Efficient Edge-Cloud LLM Inference
par: Zhang, Yida, et autres
Publié: (2026)
par: Zhang, Yida, et autres
Publié: (2026)
Confidential Computing on NVIDIA Hopper GPUs: A Performance Benchmark Study
par: Zhu, Jianwei, et autres
Publié: (2024)
par: Zhu, Jianwei, et autres
Publié: (2024)
Serving Compound Inference Systems on Datacenter GPUs
par: Devata, Sriram, et autres
Publié: (2026)
par: Devata, Sriram, et autres
Publié: (2026)
RTop-K: Ultra-Fast Row-Wise Top-K Selection for Neural Network Acceleration on GPUs
par: Xie, Xi, et autres
Publié: (2024)
par: Xie, Xi, et autres
Publié: (2024)
Dissecting the NVIDIA Blackwell Architecture with Microbenchmarks
par: Jarmusch, Aaron, et autres
Publié: (2025)
par: Jarmusch, Aaron, et autres
Publié: (2025)
Understand and Accelerate Memory Processing Pipeline for Large Language Model Inference
par: He, Zifan, et autres
Publié: (2026)
par: He, Zifan, et autres
Publié: (2026)
Accelerating End-Cloud Collaborative Inference via Near Bubble-free Pipeline Optimization
par: Gao, Luyao, et autres
Publié: (2024)
par: Gao, Luyao, et autres
Publié: (2024)
Cicada: A Pipeline-Efficient Approach to Serverless Inference with Decoupled Management
par: Wu, Z., et autres
Publié: (2025)
par: Wu, Z., et autres
Publié: (2025)
Accelerating Sparse Matrix-Matrix Multiplication on GPUs with Processing Near HBMs
par: Li, Shiju, et autres
Publié: (2025)
par: Li, Shiju, et autres
Publié: (2025)
Characterization-Guided GPU Fault Resilience in NVIDIA MPS
par: Liu, Rixin, et autres
Publié: (2026)
par: Liu, Rixin, et autres
Publié: (2026)
AMPED: Accelerating MTTKRP for Billion-Scale Sparse Tensor Decomposition on Multiple GPUs
par: Wijeratne, Sasindu, et autres
Publié: (2025)
par: Wijeratne, Sasindu, et autres
Publié: (2025)
Popcorn: Accelerating Kernel K-means on GPUs through Sparse Linear Algebra
par: Bellavita, Julian, et autres
Publié: (2025)
par: Bellavita, Julian, et autres
Publié: (2025)
Accelerating high-order continuum kinetic plasma simulations using multiple GPUs
par: Ho, Andrew, et autres
Publié: (2024)
par: Ho, Andrew, et autres
Publié: (2024)
TrioSeq: A Novel Approach to Accelerate Triplet Sequence Alignment on GPUs
par: Graça, Miguel, et autres
Publié: (2026)
par: Graça, Miguel, et autres
Publié: (2026)
Is Flash Attention Stable?
par: Golden, Alicia, et autres
Publié: (2024)
par: Golden, Alicia, et autres
Publié: (2024)
Parallelizing Maximal Clique Enumeration on GPUs
par: Almasri, Mohammad, et autres
Publié: (2022)
par: Almasri, Mohammad, et autres
Publié: (2022)
DARIS: An Oversubscribed Spatio-Temporal Scheduler for Real-Time DNN Inference on GPUs
par: Babaei, Amir Fakhim, et autres
Publié: (2025)
par: Babaei, Amir Fakhim, et autres
Publié: (2025)
FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving
par: Ye, Zihao, et autres
Publié: (2025)
par: Ye, Zihao, et autres
Publié: (2025)
PipeSD: An Efficient Cloud-Edge Collaborative Pipeline Inference Framework with Speculative Decoding
par: Han, Yunhe, et autres
Publié: (2026)
par: Han, Yunhe, et autres
Publié: (2026)
Cuckoo-GPU: Accelerating Cuckoo Filters on Modern GPUs
par: Dortmann, Tim, et autres
Publié: (2026)
par: Dortmann, Tim, et autres
Publié: (2026)
Evaluating Emerging AI/ML Accelerators: IPU, RDU, and NVIDIA/AMD GPUs
par: Peng, Hongwu, et autres
Publié: (2023)
par: Peng, Hongwu, et autres
Publié: (2023)
APEX: Asynchronous Parallel CPU-GPU Execution for Online LLM Inference on Constrained GPUs
par: Fan, Jiakun, et autres
Publié: (2025)
par: Fan, Jiakun, et autres
Publié: (2025)
SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference
par: He, Yongchao, et autres
Publié: (2025)
par: He, Yongchao, et autres
Publié: (2025)
PPipe: Efficient Video Analytics Serving on Heterogeneous GPU Clusters via Pool-Based Pipeline Parallelism
par: Kong, Z. Jonny, et autres
Publié: (2025)
par: Kong, Z. Jonny, et autres
Publié: (2025)
DiffusionPipe: Training Large Diffusion Models with Efficient Pipelines
par: Tian, Ye, et autres
Publié: (2024)
par: Tian, Ye, et autres
Publié: (2024)
Flash-KMeans: Fast and Memory-Efficient Exact K-Means
par: Yang, Shuo, et autres
Publié: (2026)
par: Yang, Shuo, et autres
Publié: (2026)
Disaggregated Prefill and Decoding Inference System for Large Language Model Serving on Multi-Vendor GPUs
par: Chen, Xing, et autres
Publié: (2025)
par: Chen, Xing, et autres
Publié: (2025)
Fusing Depthwise and Pointwise Convolutions for Efficient Inference on GPUs
par: Qararyah, Fareed, et autres
Publié: (2024)
par: Qararyah, Fareed, et autres
Publié: (2024)
Combining Performance and Productivity: Accelerating the Network Sensing Graph Challenge with GPUs and Commodity Data Science Software
par: Samsi, Siddharth, et autres
Publié: (2025)
par: Samsi, Siddharth, et autres
Publié: (2025)
Environment-Aware Dynamic Pruning for Pipelined Edge Inference
par: O'Quinn, Austin, et autres
Publié: (2025)
par: O'Quinn, Austin, et autres
Publié: (2025)
An inherently parallel H2-ULV factorization for solving dense linear systems on GPUs
par: Ma, Qianxiang, et autres
Publié: (2025)
par: Ma, Qianxiang, et autres
Publié: (2025)
FREESH: Fair, Resource- and Energy-Efficient Scheduling for LLM Serving on Heterogeneous GPUs
par: He, Xuan, et autres
Publié: (2025)
par: He, Xuan, et autres
Publié: (2025)
Documents similaires
-
Irminsul: MLA-Native Position-Independent Caching for Agentic LLM Serving
par: Ma, Bole, et autres
Publié: (2026) -
Performance Portable Monte Carlo Particle Transport on Intel, NVIDIA, and AMD GPUs
par: Tramm, John, et autres
Publié: (2024) -
Joint Training on AMD and NVIDIA GPUs
par: Hu, Jon, et autres
Publié: (2026) -
Accelerating Maximal Biclique Enumeration on GPUs
par: Hsieh, Chou-Ying, et autres
Publié: (2024) -
ESG: Pipeline-Conscious Efficient Scheduling of DNN Workflows on Serverless Platforms with Shareable GPUs
par: Hui, Xinning, et autres
Publié: (2024)