LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Fu, Qichen, Cho, Minsik, Merth, Thomas, Mehta, Sachin, Rastegari, Mohammad, Najibi, Mahyar |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Superposition Prompting: Improving and Accelerating Retrieval-Augmented Generation
von: Merth, Thomas, et al.
Veröffentlicht: (2024)
von: Merth, Thomas, et al.
Veröffentlicht: (2024)
Speculative Streaming: Fast LLM Inference without Auxiliary Models
von: Bhendawade, Nikhil, et al.
Veröffentlicht: (2024)
von: Bhendawade, Nikhil, et al.
Veröffentlicht: (2024)
Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers
von: Wen, Yuxin, et al.
Veröffentlicht: (2024)
von: Wen, Yuxin, et al.
Veröffentlicht: (2024)
KV-Runahead: Scalable Causal LLM Inference by Parallel Key-Value Cache Generation
von: Cho, Minsik, et al.
Veröffentlicht: (2024)
von: Cho, Minsik, et al.
Veröffentlicht: (2024)
Do Compressed LLMs Forget Knowledge? An Experimental Study with Practical Implications
von: Hoang, Duc N. M, et al.
Veröffentlicht: (2023)
von: Hoang, Duc N. M, et al.
Veröffentlicht: (2023)
LEAP: Learnable End-to-End Adaptive Pruning of Large Language Models
von: Mozaffari, Mohammad, et al.
Veröffentlicht: (2026)
von: Mozaffari, Mohammad, et al.
Veröffentlicht: (2026)
OpenELM: An Efficient Language Model Family with Open Training and Inference Framework
von: Mehta, Sachin, et al.
Veröffentlicht: (2024)
von: Mehta, Sachin, et al.
Veröffentlicht: (2024)
LLM in a flash: Efficient Large Language Model Inference with Limited Memory
von: Alizadeh, Keivan, et al.
Veröffentlicht: (2023)
von: Alizadeh, Keivan, et al.
Veröffentlicht: (2023)
CatLIP: CLIP-level Visual Recognition Accuracy with 2.7x Faster Pre-training on Web-scale Image-Text Data
von: Mehta, Sachin, et al.
Veröffentlicht: (2024)
von: Mehta, Sachin, et al.
Veröffentlicht: (2024)
CtrlSynth: Controllable Image Text Synthesis for Data-Efficient Multimodal Learning
von: Cao, Qingqing, et al.
Veröffentlicht: (2024)
von: Cao, Qingqing, et al.
Veröffentlicht: (2024)
SeedLM: Compressing LLM Weights into Seeds of Pseudo-Random Generators
von: Shafipour, Rasoul, et al.
Veröffentlicht: (2024)
von: Shafipour, Rasoul, et al.
Veröffentlicht: (2024)
KV Prediction for Improved Time to First Token
von: Horton, Maxwell, et al.
Veröffentlicht: (2024)
von: Horton, Maxwell, et al.
Veröffentlicht: (2024)
OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference
von: Gu, Yuzhe, et al.
Veröffentlicht: (2025)
von: Gu, Yuzhe, et al.
Veröffentlicht: (2025)
M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference
von: Bhendawade, Nikhil, et al.
Veröffentlicht: (2025)
von: Bhendawade, Nikhil, et al.
Veröffentlicht: (2025)
From Dense to Dynamic: Token-Difficulty Driven MoEfication of Pre-Trained LLMs
von: Nishu, Kumari, et al.
Veröffentlicht: (2025)
von: Nishu, Kumari, et al.
Veröffentlicht: (2025)
DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference
von: Dehghanighobadi, Zahra, et al.
Veröffentlicht: (2026)
von: Dehghanighobadi, Zahra, et al.
Veröffentlicht: (2026)
Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference
von: Taniguchi, Rei, et al.
Veröffentlicht: (2026)
von: Taniguchi, Rei, et al.
Veröffentlicht: (2026)
TIDE: Every Layer Knows the Token Beneath the Context
von: Jaiswal, Ajay, et al.
Veröffentlicht: (2026)
von: Jaiswal, Ajay, et al.
Veröffentlicht: (2026)
Recursive Language Models Meet Uncertainty: The Surprising Effectiveness of Self-Reflective Program Search for Long Context
von: Alizadeh, Keivan, et al.
Veröffentlicht: (2026)
von: Alizadeh, Keivan, et al.
Veröffentlicht: (2026)
TokenSelect: Efficient Long-Context Inference and Length Extrapolation for LLMs via Dynamic Token-Level KV Cache Selection
von: Wu, Wei, et al.
Veröffentlicht: (2024)
von: Wu, Wei, et al.
Veröffentlicht: (2024)
PQCache: Product Quantization-based KVCache for Long Context LLM Inference
von: Zhang, Hailin, et al.
Veröffentlicht: (2024)
von: Zhang, Hailin, et al.
Veröffentlicht: (2024)
Reformulating KV Cache Eviction Problem for Long-Context LLM Inference
von: Mai, Tho, et al.
Veröffentlicht: (2026)
von: Mai, Tho, et al.
Veröffentlicht: (2026)
AdaSkip: Adaptive Sublayer Skipping for Accelerating Long-Context LLM Inference
von: He, Zhuomin, et al.
Veröffentlicht: (2025)
von: He, Zhuomin, et al.
Veröffentlicht: (2025)
EvoP: Robust LLM Inference via Evolutionary Pruning
von: Wu, Shangyu, et al.
Veröffentlicht: (2025)
von: Wu, Shangyu, et al.
Veröffentlicht: (2025)
Fewer is More: Boosting LLM Reasoning with Reinforced Context Pruning
von: Huang, Xijie, et al.
Veröffentlicht: (2023)
von: Huang, Xijie, et al.
Veröffentlicht: (2023)
FocusLLM: Precise Understanding of Long Context by Dynamic Condensing
von: Li, Zhenyu, et al.
Veröffentlicht: (2024)
von: Li, Zhenyu, et al.
Veröffentlicht: (2024)
HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference
von: Shi, Zhiyuan, et al.
Veröffentlicht: (2026)
von: Shi, Zhiyuan, et al.
Veröffentlicht: (2026)
XC-Cache: Cross-Attending to Cached Context for Efficient LLM Inference
von: Monteiro, João, et al.
Veröffentlicht: (2024)
von: Monteiro, João, et al.
Veröffentlicht: (2024)
DyLLM: Efficient Diffusion LLM Inference via Saliency-based Token Selection and Partial Attention
von: Lee, Younjoo, et al.
Veröffentlicht: (2026)
von: Lee, Younjoo, et al.
Veröffentlicht: (2026)
DYCP: Dynamic Context Pruning for Long-Form Dialogue with LLMs
von: Choi, Nayoung, et al.
Veröffentlicht: (2026)
von: Choi, Nayoung, et al.
Veröffentlicht: (2026)
MoEs Are Stronger than You Think: Hyper-Parallel Inference Scaling with RoE
von: Zibakhsh, Soheil, et al.
Veröffentlicht: (2025)
von: Zibakhsh, Soheil, et al.
Veröffentlicht: (2025)
Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
von: Zhang, Zhiwei, et al.
Veröffentlicht: (2025)
von: Zhang, Zhiwei, et al.
Veröffentlicht: (2025)
SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling
von: Liu, Dong, et al.
Veröffentlicht: (2025)
von: Liu, Dong, et al.
Veröffentlicht: (2025)
Towards Low-bit Communication for Tensor Parallel LLM Inference
von: Dong, Harry, et al.
Veröffentlicht: (2024)
von: Dong, Harry, et al.
Veröffentlicht: (2024)
TTKV: Temporal-Tiered KV Cache for Long-Context LLM Inference
von: Dzikanyanga, Gradwell, et al.
Veröffentlicht: (2026)
von: Dzikanyanga, Gradwell, et al.
Veröffentlicht: (2026)
SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval
von: Lin, Yueqian, et al.
Veröffentlicht: (2024)
von: Lin, Yueqian, et al.
Veröffentlicht: (2024)
Decoupled Reasoning with Implicit Fact Tokens (DRIFT): A Dual-Model Framework for Efficient Long-Context Inference
von: Xie, Wenxuan, et al.
Veröffentlicht: (2026)
von: Xie, Wenxuan, et al.
Veröffentlicht: (2026)
Entropy Meets Importance: A Unified Head Importance-Entropy Score for Stable and Efficient Transformer Pruning
von: Choi, Minsik, et al.
Veröffentlicht: (2025)
von: Choi, Minsik, et al.
Veröffentlicht: (2025)
IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference
von: Yang, Xintong, et al.
Veröffentlicht: (2026)
von: Yang, Xintong, et al.
Veröffentlicht: (2026)
LycheeDecode: Accelerating Long-Context LLM Inference via Hybrid-Head Sparse Decoding
von: Lin, Gang, et al.
Veröffentlicht: (2026)
von: Lin, Gang, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Superposition Prompting: Improving and Accelerating Retrieval-Augmented Generation
von: Merth, Thomas, et al.
Veröffentlicht: (2024) -
Speculative Streaming: Fast LLM Inference without Auxiliary Models
von: Bhendawade, Nikhil, et al.
Veröffentlicht: (2024) -
Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers
von: Wen, Yuxin, et al.
Veröffentlicht: (2024) -
KV-Runahead: Scalable Causal LLM Inference by Parallel Key-Value Cache Generation
von: Cho, Minsik, et al.
Veröffentlicht: (2024) -
Do Compressed LLMs Forget Knowledge? An Experimental Study with Practical Implications
von: Hoang, Duc N. M, et al.
Veröffentlicht: (2023)