PAT: Accelerating LLM Decoding via Prefix-Aware Attention with Resource Efficient Multi-Tile Kernel

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Yi, Jinjun, Zhao, Zhixin, Hu, Yitao, Yan, Ke, Sun, Weiwei, Wang, Hao, Zhao, Laiping, Zhang, Yuhao, Li, Wenxin, Li, Keqiu
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!