Effectively Compress KV Heads for LLM
Fuente:
arXiv
Guardado en:
| Autores principales: | Yu, Hao, Yang, Zelan, Li, Shen, Li, Yong, Wu, Jianxin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
KV-Compress: Paged KV-Cache Compression with Variable Compression Rates per Attention Head
por: Rehg, Isaac
Publicado: (2024)
por: Rehg, Isaac
Publicado: (2024)
Which Heads Matter for Reasoning? RL-Guided KV Cache Compression
por: Du, Wenjie, et al.
Publicado: (2025)
por: Du, Wenjie, et al.
Publicado: (2025)
EvolKV: Evolutionary KV Cache Compression for LLM Inference
por: Yu, Bohan, et al.
Publicado: (2025)
por: Yu, Bohan, et al.
Publicado: (2025)
ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
por: Liu, Xiang, et al.
Publicado: (2025)
por: Liu, Xiang, et al.
Publicado: (2025)
CompressKV: Semantic Retrieval Heads Know What Tokens are Not Important Before Generation
por: Lin, Xiaolin, et al.
Publicado: (2025)
por: Lin, Xiaolin, et al.
Publicado: (2025)
KeepKV: Achieving Periodic Lossless KV Cache Compression for Efficient LLM Inference
por: Tian, Yuxuan, et al.
Publicado: (2025)
por: Tian, Yuxuan, et al.
Publicado: (2025)
RazorAttention: Efficient KV Cache Compression Through Retrieval Heads
por: Tang, Hanlin, et al.
Publicado: (2024)
por: Tang, Hanlin, et al.
Publicado: (2024)
Not All Heads Matter: A Head-Level KV Cache Compression Method with Integrated Retrieval and Reasoning
por: Fu, Yu, et al.
Publicado: (2024)
por: Fu, Yu, et al.
Publicado: (2024)
DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs
por: Zhou, Xiabin, et al.
Publicado: (2024)
por: Zhou, Xiabin, et al.
Publicado: (2024)
EMS: Adaptive Evict-then-Merge Strategy for Head-wise KV Cache Compression Based on Global-Local Importance
por: Li, Yingxin, et al.
Publicado: (2024)
por: Li, Yingxin, et al.
Publicado: (2024)
AttentionPredictor: Temporal Patterns Matter for KV Cache Compression
por: Yang, Qingyue, et al.
Publicado: (2025)
por: Yang, Qingyue, et al.
Publicado: (2025)
Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity
por: Ma, Da, et al.
Publicado: (2024)
por: Ma, Da, et al.
Publicado: (2024)
DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity
por: Hao, Jitai, et al.
Publicado: (2026)
por: Hao, Jitai, et al.
Publicado: (2026)
RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression
por: Behnam, Payman, et al.
Publicado: (2025)
por: Behnam, Payman, et al.
Publicado: (2025)
FAEDKV: Infinite-Window Fourier Transform for Unbiased KV Cache Compression
por: Li, Runchao, et al.
Publicado: (2025)
por: Li, Runchao, et al.
Publicado: (2025)
CaliDrop: KV Cache Compression with Calibration
por: Su, Yi, et al.
Publicado: (2025)
por: Su, Yi, et al.
Publicado: (2025)
PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference
por: Yang, Dongjie, et al.
Publicado: (2024)
por: Yang, Dongjie, et al.
Publicado: (2024)
QET: Enhancing Quantized LLM Parameters and KV cache Compression through Element Substitution and Residual Clustering
por: Wang, Yanshu, et al.
Publicado: (2024)
por: Wang, Yanshu, et al.
Publicado: (2024)
Lossless KV Cache Compression to 2%
por: Yang, Zhen, et al.
Publicado: (2024)
por: Yang, Zhen, et al.
Publicado: (2024)
A Simple and Effective $L_2$ Norm-Based Strategy for KV Cache Compression
por: Devoto, Alessio, et al.
Publicado: (2024)
por: Devoto, Alessio, et al.
Publicado: (2024)
R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
por: Cai, Zefan, et al.
Publicado: (2025)
por: Cai, Zefan, et al.
Publicado: (2025)
xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction
por: Chang, Chi-Chih, et al.
Publicado: (2025)
por: Chang, Chi-Chih, et al.
Publicado: (2025)
KVShare: An LLM Service System with Efficient and Effective Multi-Tenant KV Cache Reuse
por: Yang, Huan, et al.
Publicado: (2025)
por: Yang, Huan, et al.
Publicado: (2025)
KV-CoRE: Benchmarking Data-Dependent Low-Rank Compressibility of KV-Caches in LLMs
por: Chen, Jian, et al.
Publicado: (2026)
por: Chen, Jian, et al.
Publicado: (2026)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
por: Zhu, Yuxuan, et al.
Publicado: (2025)
por: Zhu, Yuxuan, et al.
Publicado: (2025)
HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference
por: Shi, Zhiyuan, et al.
Publicado: (2026)
por: Shi, Zhiyuan, et al.
Publicado: (2026)
PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling
por: Cai, Zefan, et al.
Publicado: (2024)
por: Cai, Zefan, et al.
Publicado: (2024)
LKV: End-to-End Learning of Head-wise Budgets and Token Selection for LLM KV Cache Eviction
por: Zhou, Enshuai, et al.
Publicado: (2026)
por: Zhou, Enshuai, et al.
Publicado: (2026)
MatryoshkaKV: Adaptive KV Compression via Trainable Orthogonal Projection
por: Lin, Bokai, et al.
Publicado: (2024)
por: Lin, Bokai, et al.
Publicado: (2024)
NestedKV: Nested Memory Routing for Long-Context KV Cache Compression
por: Chen, Hong, et al.
Publicado: (2026)
por: Chen, Hong, et al.
Publicado: (2026)
EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction
por: Ji, Shiyu, et al.
Publicado: (2026)
por: Ji, Shiyu, et al.
Publicado: (2026)
SurfaceLogicKV: Surface and Logic Attention Behaviors are All You Need for Robust KV Cache Compression
por: Li, Mengjie, et al.
Publicado: (2025)
por: Li, Mengjie, et al.
Publicado: (2025)
XQuant: Achieving Ultra-Low Bit KV Cache Quantization with Cross-Layer Compression
por: Yang, Haoqi, et al.
Publicado: (2025)
por: Yang, Haoqi, et al.
Publicado: (2025)
PolyKV: A Shared Asymmetrically-Compressed KV Cache Pool for Multi-Agent LLM Inference
por: Patel, Ishan, et al.
Publicado: (2026)
por: Patel, Ishan, et al.
Publicado: (2026)
Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads
por: He, Xingyang, et al.
Publicado: (2025)
por: He, Xingyang, et al.
Publicado: (2025)
X-EcoMLA: Upcycling Pre-Trained Attention into MLA for Efficient and Extreme KV Compression
por: Li, Guihong, et al.
Publicado: (2025)
por: Li, Guihong, et al.
Publicado: (2025)
GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM
por: Kang, Hao, et al.
Publicado: (2024)
por: Kang, Hao, et al.
Publicado: (2024)
River-LLM: Large Language Model Seamless Exit Based on KV Share
por: Shen, Yingtao, et al.
Publicado: (2026)
por: Shen, Yingtao, et al.
Publicado: (2026)
CodeComp: Structural KV Cache Compression for Agentic Coding
por: Chen, Qiujiang, et al.
Publicado: (2026)
por: Chen, Qiujiang, et al.
Publicado: (2026)
More Tokens, Lower Precision: Towards the Optimal Token-Precision Trade-off in KV Cache Compression
por: Zhang, Jiebin, et al.
Publicado: (2024)
por: Zhang, Jiebin, et al.
Publicado: (2024)
Ejemplares similares
-
KV-Compress: Paged KV-Cache Compression with Variable Compression Rates per Attention Head
por: Rehg, Isaac
Publicado: (2024) -
Which Heads Matter for Reasoning? RL-Guided KV Cache Compression
por: Du, Wenjie, et al.
Publicado: (2025) -
EvolKV: Evolutionary KV Cache Compression for LLM Inference
por: Yu, Bohan, et al.
Publicado: (2025) -
ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
por: Liu, Xiang, et al.
Publicado: (2025) -
CompressKV: Semantic Retrieval Heads Know What Tokens are Not Important Before Generation
por: Lin, Xiaolin, et al.
Publicado: (2025)