TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Tang, Xiaojuan, Meng, Fanxu, Tang, Pingzhi, Wang, Yuxuan, Yin, Di, Sun, Xing, Zhang, Muhan
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!