S-HPLB: Efficient LLM Attention Serving via Sparsity-Aware Head Parallelism Load Balance

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Liu, Di, Liu, Yifei, Chen, Chen, Yu, Zhibin, Fan, Xiaoyi, Chen, Quan, Guo, Minyi
Natura: Preprint
Pubblicazione: 2026
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!