QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Khanna, Danush, Guru, Aditya Kumar, Sridhar, Srivarshinee, Ahmed, Zidan, Bahirwani, Rubhav, Malhotra, Meetu, Jain, Vinija, Chadha, Aman, Das, Amitava, Ghosh, Kripabandhu
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!