Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking
Fuente:
arXiv
Salvato in:
| Autori principali: | Federici, Marco, Belli, Davide, van Baalen, Mart, Jalalirad, Amir, Skliar, Andrii, Major, Bence, Nagel, Markus, Whatmough, Paul |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mixture of Cache-Conditional Experts for Efficient Mobile Device Inference
di: Skliar, Andrii, et al.
Pubblicazione: (2024)
di: Skliar, Andrii, et al.
Pubblicazione: (2024)
Leech Lattice Vector Quantization for Efficient LLM Compression
di: van der Ouderaa, Tycho F. A., et al.
Pubblicazione: (2026)
di: van der Ouderaa, Tycho F. A., et al.
Pubblicazione: (2026)
Neural Augmented Kalman Filters for Road Network assisted GNSS positioning
di: van Gorp, Hans, et al.
Pubblicazione: (2025)
di: van Gorp, Hans, et al.
Pubblicazione: (2025)
GNSS Positioning using Cost Function Regulated Multilateration and Graph Neural Networks
di: Jalalirad, Amir, et al.
Pubblicazione: (2024)
di: Jalalirad, Amir, et al.
Pubblicazione: (2024)
Dissecting Quantization Error: A Concentration-Alignment Perspective
di: Federici, Marco, et al.
Pubblicazione: (2026)
di: Federici, Marco, et al.
Pubblicazione: (2026)
Dynamic Tool Dependency Retrieval for Lightweight Function Calling
di: Patel, Bhrij, et al.
Pubblicazione: (2025)
di: Patel, Bhrij, et al.
Pubblicazione: (2025)
Pruning vs Quantization: Which is Better?
di: Kuzmin, Andrey, et al.
Pubblicazione: (2023)
di: Kuzmin, Andrey, et al.
Pubblicazione: (2023)
GPTVQ: The Blessing of Dimensionality for LLM Quantization
di: van Baalen, Mart, et al.
Pubblicazione: (2024)
di: van Baalen, Mart, et al.
Pubblicazione: (2024)
STaMP: Sequence Transformation and Mixed Precision for Low-Precision Activation Quantization
di: Federici, Marco, et al.
Pubblicazione: (2025)
di: Federici, Marco, et al.
Pubblicazione: (2025)
HadaNorm: Diffusion Transformer Quantization through Mean-Centered Transformations
di: Federici, Marco, et al.
Pubblicazione: (2025)
di: Federici, Marco, et al.
Pubblicazione: (2025)
FPTQuant: Function-Preserving Transforms for LLM Quantization
di: van Breugel, Boris, et al.
Pubblicazione: (2025)
di: van Breugel, Boris, et al.
Pubblicazione: (2025)
The LLM Surgeon
di: van der Ouderaa, Tycho F. A., et al.
Pubblicazione: (2023)
di: van der Ouderaa, Tycho F. A., et al.
Pubblicazione: (2023)
When Cloud Agents Meet Device Agents: Lessons from Hybrid Multi-Agent Systems
di: Rainone, Corrado, et al.
Pubblicazione: (2026)
di: Rainone, Corrado, et al.
Pubblicazione: (2026)
FP8 Quantization: The Power of the Exponent
di: Kuzmin, Andrey, et al.
Pubblicazione: (2022)
di: Kuzmin, Andrey, et al.
Pubblicazione: (2022)
CachePrune: Privacy-Aware and Fine-Grained KV Cache Sharing for Efficient LLM Inference
di: Wu, Guanlong, et al.
Pubblicazione: (2026)
di: Wu, Guanlong, et al.
Pubblicazione: (2026)
Sparse High Rank Adapters
di: Bhardwaj, Kartikeya, et al.
Pubblicazione: (2024)
di: Bhardwaj, Kartikeya, et al.
Pubblicazione: (2024)
Rapid Switching and Multi-Adapter Fusion via Sparse High Rank Adapters
di: Bhardwaj, Kartikeya, et al.
Pubblicazione: (2024)
di: Bhardwaj, Kartikeya, et al.
Pubblicazione: (2024)
OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference
di: Gu, Yuzhe, et al.
Pubblicazione: (2025)
di: Gu, Yuzhe, et al.
Pubblicazione: (2025)
Bridge the Inference Gaps of Neural Processes via Expectation Maximization
di: Wang, Qi, et al.
Pubblicazione: (2025)
di: Wang, Qi, et al.
Pubblicazione: (2025)
Mask Tokens as Prophet: Fine-Grained Cache Eviction for Efficient dLLM Inference
di: Huang, Jianuo, et al.
Pubblicazione: (2025)
di: Huang, Jianuo, et al.
Pubblicazione: (2025)
KaVa: Latent Reasoning via Compressed KV-Cache Distillation
di: Kuzina, Anna, et al.
Pubblicazione: (2025)
di: Kuzina, Anna, et al.
Pubblicazione: (2025)
Mustafar: Promoting Unstructured Sparsity for KV Cache Pruning in LLM Inference
di: Joo, Donghyeon, et al.
Pubblicazione: (2025)
di: Joo, Donghyeon, et al.
Pubblicazione: (2025)
Cross-Self KV Cache Pruning for Efficient Vision-Language Inference
di: Pei, Xiaohuan, et al.
Pubblicazione: (2024)
di: Pei, Xiaohuan, et al.
Pubblicazione: (2024)
XC-Cache: Cross-Attending to Cached Context for Efficient LLM Inference
di: Monteiro, João, et al.
Pubblicazione: (2024)
di: Monteiro, João, et al.
Pubblicazione: (2024)
SparKV: Overhead-Aware KV Cache Loading for Efficient On-Device LLM Inference
di: Liu, Hongyao, et al.
Pubblicazione: (2026)
di: Liu, Hongyao, et al.
Pubblicazione: (2026)
KVPR: Efficient LLM Inference with I/O-Aware KV Cache Partial Recomputation
di: Jiang, Chaoyi, et al.
Pubblicazione: (2024)
di: Jiang, Chaoyi, et al.
Pubblicazione: (2024)
DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference
di: Dehghanighobadi, Zahra, et al.
Pubblicazione: (2026)
di: Dehghanighobadi, Zahra, et al.
Pubblicazione: (2026)
MaskPrune: Mask-based LLM Pruning for Layer-wise Uniform Structures
di: Qin, Jiayu, et al.
Pubblicazione: (2025)
di: Qin, Jiayu, et al.
Pubblicazione: (2025)
Clear insight into complex multimodal resins and impurities to overcome recombinant protein purification challenges: A review
di: Maryam Moazami Goodarzi, et al.
Pubblicazione: (2024)
di: Maryam Moazami Goodarzi, et al.
Pubblicazione: (2024)
Efficient LLM Inference with Activation Checkpointing and Hybrid Caching
di: Lee, Sanghyeon, et al.
Pubblicazione: (2025)
di: Lee, Sanghyeon, et al.
Pubblicazione: (2025)
The Destructive Loop: Dealing and Coping With Destructive Leadership
di: Maria Fors Brandebo, et al.
Pubblicazione: (2026)
di: Maria Fors Brandebo, et al.
Pubblicazione: (2026)
Think Big, Generate Quick: LLM-to-SLM for Fast Autoregressive Decoding
di: Bergner, Benjamin, et al.
Pubblicazione: (2024)
di: Bergner, Benjamin, et al.
Pubblicazione: (2024)
DASH: Input-Aware Dynamic Layer Skipping for Efficient LLM Inference with Markov Decision Policies
di: Yang, Ning, et al.
Pubblicazione: (2025)
di: Yang, Ning, et al.
Pubblicazione: (2025)
UniCAIM: A Unified CAM/CIM Architecture with Static-Dynamic KV Cache Pruning for Efficient Long-Context LLM Inference
di: Xu, Weikai, et al.
Pubblicazione: (2025)
di: Xu, Weikai, et al.
Pubblicazione: (2025)
KV Cache Optimization Strategies for Scalable and Efficient LLM Inference
di: Xu, Yichun, et al.
Pubblicazione: (2026)
di: Xu, Yichun, et al.
Pubblicazione: (2026)
Online Scheduling for LLM Inference with KV Cache Constraints
di: Jaillet, Patrick, et al.
Pubblicazione: (2025)
di: Jaillet, Patrick, et al.
Pubblicazione: (2025)
Active Inference for Closed-loop transmit beamsteering in Fetal Doppler Ultrasound
di: Federici, Beatrice, et al.
Pubblicazione: (2024)
di: Federici, Beatrice, et al.
Pubblicazione: (2024)
Input-to-state stability meets small-gain theory
di: Mironchenko, Andrii
Pubblicazione: (2024)
di: Mironchenko, Andrii
Pubblicazione: (2024)
ASAP: Attention-Shift-Aware Pruning for Efficient LVLM Inference
di: Pathak, Surendra, et al.
Pubblicazione: (2026)
di: Pathak, Surendra, et al.
Pubblicazione: (2026)
PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Large Language Model Inference
di: Chitty-Venkata, Krishna Teja, et al.
Pubblicazione: (2025)
di: Chitty-Venkata, Krishna Teja, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Mixture of Cache-Conditional Experts for Efficient Mobile Device Inference
di: Skliar, Andrii, et al.
Pubblicazione: (2024) -
Leech Lattice Vector Quantization for Efficient LLM Compression
di: van der Ouderaa, Tycho F. A., et al.
Pubblicazione: (2026) -
Neural Augmented Kalman Filters for Road Network assisted GNSS positioning
di: van Gorp, Hans, et al.
Pubblicazione: (2025) -
GNSS Positioning using Cost Function Regulated Multilateration and Graph Neural Networks
di: Jalalirad, Amir, et al.
Pubblicazione: (2024) -
Dissecting Quantization Error: A Concentration-Alignment Perspective
di: Federici, Marco, et al.
Pubblicazione: (2026)