Towards Threshold-Free KV Cache Pruning
Fuente:
arXiv
Guardado en:
| Autores principales: | Ni, Xuanfan, Xu, Liyan, Lyu, Chenyang, Wang, Longyue, Yu, Mo, Liu, Lemao, Meng, Fandong, Zhou, Jie, Li, Piji |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Systematic Evaluation of Large Language Models for Natural Language Generation Tasks
por: Ni, Xuanfan, et al.
Publicado: (2024)
por: Ni, Xuanfan, et al.
Publicado: (2024)
Marco-o1 v2: Towards Widening The Distillation Bottleneck for Reasoning Models
por: Yin, Huifeng, et al.
Publicado: (2025)
por: Yin, Huifeng, et al.
Publicado: (2025)
DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference
por: Dehghanighobadi, Zahra, et al.
Publicado: (2026)
por: Dehghanighobadi, Zahra, et al.
Publicado: (2026)
KVzap: Fast, Adaptive, and Faithful KV Cache Pruning
por: Jegou, Simon, et al.
Publicado: (2026)
por: Jegou, Simon, et al.
Publicado: (2026)
FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
por: Liu, Guangda, et al.
Publicado: (2025)
por: Liu, Guangda, et al.
Publicado: (2025)
SparK: Query-Aware Unstructured Sparsity with Recoverable KV Cache Channel Pruning
por: Liao, Huanxuan, et al.
Publicado: (2025)
por: Liao, Huanxuan, et al.
Publicado: (2025)
CSCD-NS: a Chinese Spelling Check Dataset for Native Speakers
por: Hu, Yong, et al.
Publicado: (2022)
por: Hu, Yong, et al.
Publicado: (2022)
DeepTrans: Deep Reasoning Translation via Reinforcement Learning
por: Wang, Jiaan, et al.
Publicado: (2025)
por: Wang, Jiaan, et al.
Publicado: (2025)
ExTrans: Multilingual Deep Reasoning Translation via Exemplar-Enhanced Reinforcement Learning
por: Wang, Jiaan, et al.
Publicado: (2025)
por: Wang, Jiaan, et al.
Publicado: (2025)
OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference
por: Gu, Yuzhe, et al.
Publicado: (2025)
por: Gu, Yuzhe, et al.
Publicado: (2025)
EAG: Extract and Generate Multi-way Aligned Corpus for Complete Multi-lingual Neural Machine Translation
por: Xu, Yulin, et al.
Publicado: (2022)
por: Xu, Yulin, et al.
Publicado: (2022)
On the token distance modeling ability of higher RoPE attention dimension
por: Hong, Xiangyu, et al.
Publicado: (2024)
por: Hong, Xiangyu, et al.
Publicado: (2024)
Lookahead Q-Cache: Achieving More Consistent KV Cache Eviction via Pseudo Query
por: Wang, Yixuan, et al.
Publicado: (2025)
por: Wang, Yixuan, et al.
Publicado: (2025)
R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
por: Cai, Zefan, et al.
Publicado: (2025)
por: Cai, Zefan, et al.
Publicado: (2025)
Beyond Next Token Prediction: Patch-Level Training for Large Language Models
por: Shao, Chenze, et al.
Publicado: (2024)
por: Shao, Chenze, et al.
Publicado: (2024)
ManifoldKV: Training-Free KV Cache Compression via Euclidean Outlier Detection
por: Datta, Debajyoti, et al.
Publicado: (2026)
por: Datta, Debajyoti, et al.
Publicado: (2026)
ThinK: Thinner Key Cache by Query-Driven Pruning
por: Xu, Yuhui, et al.
Publicado: (2024)
por: Xu, Yuhui, et al.
Publicado: (2024)
PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling
por: Cai, Zefan, et al.
Publicado: (2024)
por: Cai, Zefan, et al.
Publicado: (2024)
HGMEM: Hypergraph-based Working Memory to Improve Multi-step RAG for Long-Context Complex Relational Modeling
por: Zhou, Chulun, et al.
Publicado: (2025)
por: Zhou, Chulun, et al.
Publicado: (2025)
Unsupervised Information Refinement Training of Large Language Models for Retrieval-Augmented Generation
por: Xu, Shicheng, et al.
Publicado: (2024)
por: Xu, Shicheng, et al.
Publicado: (2024)
DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity
por: Hao, Jitai, et al.
Publicado: (2026)
por: Hao, Jitai, et al.
Publicado: (2026)
Retrieval-Augmented Machine Translation with Unstructured Knowledge
por: Wang, Jiaan, et al.
Publicado: (2024)
por: Wang, Jiaan, et al.
Publicado: (2024)
TEAL: Tokenize and Embed ALL for Multi-modal Large Language Models
por: Yang, Zhen, et al.
Publicado: (2023)
por: Yang, Zhen, et al.
Publicado: (2023)
DRT: Deep Reasoning Translation via Long Chain-of-Thought
por: Wang, Jiaan, et al.
Publicado: (2024)
por: Wang, Jiaan, et al.
Publicado: (2024)
Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference
por: Feng, Yuan, et al.
Publicado: (2024)
por: Feng, Yuan, et al.
Publicado: (2024)
Lossless KV Cache Compression to 2%
por: Yang, Zhen, et al.
Publicado: (2024)
por: Yang, Zhen, et al.
Publicado: (2024)
G-KV: Decoding-Time KV Cache Eviction with Global Attention
por: Liao, Mengqi, et al.
Publicado: (2025)
por: Liao, Mengqi, et al.
Publicado: (2025)
LCS: A Language Converter Strategy for Zero-Shot Neural Machine Translation
por: Sun, Zengkui, et al.
Publicado: (2024)
por: Sun, Zengkui, et al.
Publicado: (2024)
Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction
por: Liu, Yijun, et al.
Publicado: (2025)
por: Liu, Yijun, et al.
Publicado: (2025)
RetentiveKV: State-Space Memory for Uncertainty-Aware Multimodal KV Cache Eviction
por: Liu, Sihao, et al.
Publicado: (2026)
por: Liu, Sihao, et al.
Publicado: (2026)
Training-Free Exponential Context Extension via Cascading KV Cache
por: Willette, Jeffrey, et al.
Publicado: (2024)
por: Willette, Jeffrey, et al.
Publicado: (2024)
KV Cache Steering for Controlling Frozen LLMs
por: Belitsky, Max, et al.
Publicado: (2025)
por: Belitsky, Max, et al.
Publicado: (2025)
TextBind: Multi-turn Interleaved Multimodal Instruction-following in the Wild
por: Li, Huayang, et al.
Publicado: (2023)
por: Li, Huayang, et al.
Publicado: (2023)
DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
por: Chung, Tsz Ting, et al.
Publicado: (2025)
por: Chung, Tsz Ting, et al.
Publicado: (2025)
AhaKV: Adaptive Holistic Attention-Driven KV Cache Eviction for Efficient Inference of Large Language Models
por: Gu, Yifeng, et al.
Publicado: (2025)
por: Gu, Yifeng, et al.
Publicado: (2025)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
por: Zhu, Yuxuan, et al.
Publicado: (2025)
por: Zhu, Yuxuan, et al.
Publicado: (2025)
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
por: Liu, Akide, et al.
Publicado: (2024)
por: Liu, Akide, et al.
Publicado: (2024)
Continuous Autoregressive Language Models
por: Shao, Chenze, et al.
Publicado: (2025)
por: Shao, Chenze, et al.
Publicado: (2025)
General learned delegation by clones
por: Li, Darren, et al.
Publicado: (2026)
por: Li, Darren, et al.
Publicado: (2026)
Q-Filters: Leveraging QK Geometry for Efficient KV Cache Compression
por: Godey, Nathan, et al.
Publicado: (2025)
por: Godey, Nathan, et al.
Publicado: (2025)
Ejemplares similares
-
A Systematic Evaluation of Large Language Models for Natural Language Generation Tasks
por: Ni, Xuanfan, et al.
Publicado: (2024) -
Marco-o1 v2: Towards Widening The Distillation Bottleneck for Reasoning Models
por: Yin, Huifeng, et al.
Publicado: (2025) -
DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference
por: Dehghanighobadi, Zahra, et al.
Publicado: (2026) -
KVzap: Fast, Adaptive, and Faithful KV Cache Pruning
por: Jegou, Simon, et al.
Publicado: (2026) -
FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
por: Liu, Guangda, et al.
Publicado: (2025)