QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Khanna, Danush, Guru, Aditya Kumar, Sridhar, Srivarshinee, Ahmed, Zidan, Bahirwani, Rubhav, Malhotra, Meetu, Jain, Vinija, Chadha, Aman, Das, Amitava, Ghosh, Kripabandhu
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!