TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Tang, Xiaojuan, Meng, Fanxu, Tang, Pingzhi, Wang, Yuxuan, Yin, Di, Sun, Xing, Zhang, Muhan
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!