PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling
Fuente:
arXiv
Guardado en:
| Autores principales: | Cai, Zefan, Zhang, Yichi, Gao, Bofei, Liu, Yuliang, Li, Yucheng, Liu, Tianyu, Lu, Keming, Xiong, Wayne, Dong, Yue, Hu, Junjie, Xiao, Wen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference
por: Yang, Dongjie, et al.
Publicado: (2024)
por: Yang, Dongjie, et al.
Publicado: (2024)
Not All Heads Matter: A Head-Level KV Cache Compression Method with Integrated Retrieval and Reasoning
por: Fu, Yu, et al.
Publicado: (2024)
por: Fu, Yu, et al.
Publicado: (2024)
R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
por: Cai, Zefan, et al.
Publicado: (2025)
por: Cai, Zefan, et al.
Publicado: (2025)
Pyramid Cache: Layer-Adaptive KV Cache Compression with Signature-Based Cold Storage
por: Sergio dj
Publicado: (2026)
por: Sergio dj
Publicado: (2026)
Pyramid Forcing: Head-Aware Pyramid KV Cache Policy for High-Quality Long Video Generation
por: Chen, Jiayu, et al.
Publicado: (2026)
por: Chen, Jiayu, et al.
Publicado: (2026)
LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression
por: Hu, Lianyu, et al.
Publicado: (2025)
por: Hu, Lianyu, et al.
Publicado: (2025)
ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
por: Liu, Xiang, et al.
Publicado: (2025)
por: Liu, Xiang, et al.
Publicado: (2025)
Unlocking Data-free Low-bit Quantization with Matrix Decomposition for KV Cache Compression
por: Liu, Peiyu, et al.
Publicado: (2024)
por: Liu, Peiyu, et al.
Publicado: (2024)
NestedKV: Nested Memory Routing for Long-Context KV Cache Compression
por: Chen, Hong, et al.
Publicado: (2026)
por: Chen, Hong, et al.
Publicado: (2026)
DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs
por: Zhou, Xiabin, et al.
Publicado: (2024)
por: Zhou, Xiabin, et al.
Publicado: (2024)
The Pitfalls of KV Cache Compression
por: Chen, Alex, et al.
Publicado: (2025)
por: Chen, Alex, et al.
Publicado: (2025)
EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction
por: Ji, Shiyu, et al.
Publicado: (2026)
por: Ji, Shiyu, et al.
Publicado: (2026)
ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression
por: Liu, Guangda, et al.
Publicado: (2024)
por: Liu, Guangda, et al.
Publicado: (2024)
EvolKV: Evolutionary KV Cache Compression for LLM Inference
por: Yu, Bohan, et al.
Publicado: (2025)
por: Yu, Bohan, et al.
Publicado: (2025)
ForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term Contribution
por: Dong, Zican, et al.
Publicado: (2026)
por: Dong, Zican, et al.
Publicado: (2026)
PiKV: KV Cache Management System for Mixture of Experts
por: Liu, Dong, et al.
Publicado: (2025)
por: Liu, Dong, et al.
Publicado: (2025)
xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction
por: Chang, Chi-Chih, et al.
Publicado: (2025)
por: Chang, Chi-Chih, et al.
Publicado: (2025)
KV-CAR: KV Cache Compression using Autoencoders and KV Reuse in Large Language Models
por: Roy, Sourjya, et al.
Publicado: (2025)
por: Roy, Sourjya, et al.
Publicado: (2025)
CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing
por: Wang, Yixuan, et al.
Publicado: (2025)
por: Wang, Yixuan, et al.
Publicado: (2025)
Training Transformers for KV Cache Compressibility
por: Gelberg, Yoav, et al.
Publicado: (2026)
por: Gelberg, Yoav, et al.
Publicado: (2026)
Lossless KV Cache Compression to 2%
por: Yang, Zhen, et al.
Publicado: (2024)
por: Yang, Zhen, et al.
Publicado: (2024)
KVSculpt: KV Cache Compression as Distillation
por: Jiang, Bo, et al.
Publicado: (2026)
por: Jiang, Bo, et al.
Publicado: (2026)
KeepKV: Achieving Periodic Lossless KV Cache Compression for Efficient LLM Inference
por: Tian, Yuxuan, et al.
Publicado: (2025)
por: Tian, Yuxuan, et al.
Publicado: (2025)
KV-Compress: Paged KV-Cache Compression with Variable Compression Rates per Attention Head
por: Rehg, Isaac
Publicado: (2024)
por: Rehg, Isaac
Publicado: (2024)
Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models
por: Ji, Yicheng, et al.
Publicado: (2026)
por: Ji, Yicheng, et al.
Publicado: (2026)
CXL-SpecKV: A Disaggregated FPGA Speculative KV-Cache for Datacenter LLM Serving
por: Liu, Dong, et al.
Publicado: (2025)
por: Liu, Dong, et al.
Publicado: (2025)
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
por: Xiao, Junbin, et al.
Publicado: (2026)
por: Xiao, Junbin, et al.
Publicado: (2026)
PackKV: Reducing KV Cache Memory Footprint through LLM-Aware Lossy Compression
por: Jiang, Bo, et al.
Publicado: (2025)
por: Jiang, Bo, et al.
Publicado: (2025)
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
por: Liu, Akide, et al.
Publicado: (2024)
por: Liu, Akide, et al.
Publicado: (2024)
CodeComp: Structural KV Cache Compression for Agentic Coding
por: Chen, Qiujiang, et al.
Publicado: (2026)
por: Chen, Qiujiang, et al.
Publicado: (2026)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
por: Zhu, Yuxuan, et al.
Publicado: (2025)
por: Zhu, Yuxuan, et al.
Publicado: (2025)
ThinKV: Thought-Adaptive KV Cache Compression for Efficient Reasoning Models
por: Ramachandran, Akshat, et al.
Publicado: (2025)
por: Ramachandran, Akshat, et al.
Publicado: (2025)
StreamKV: Streaming Video Question-Answering with Segment-based KV Cache Retrieval and Compression
por: Chen, Yilong, et al.
Publicado: (2025)
por: Chen, Yilong, et al.
Publicado: (2025)
KV-CoRE: Benchmarking Data-Dependent Low-Rank Compressibility of KV-Caches in LLMs
por: Chen, Jian, et al.
Publicado: (2026)
por: Chen, Jian, et al.
Publicado: (2026)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
por: Wang, Yuxuan, et al.
Publicado: (2026)
por: Wang, Yuxuan, et al.
Publicado: (2026)
KV Cache Compression for Inference Efficiency in LLMs: A Review
por: Liu, Yanyu, et al.
Publicado: (2025)
por: Liu, Yanyu, et al.
Publicado: (2025)
EFIM: Efficient Serving of LLMs for Infilling Tasks with Improved KV Cache Reuse
por: Guo, Tianyu, et al.
Publicado: (2025)
por: Guo, Tianyu, et al.
Publicado: (2025)
ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference
por: Sun, Hanshi, et al.
Publicado: (2024)
por: Sun, Hanshi, et al.
Publicado: (2024)
RetentiveKV: State-Space Memory for Uncertainty-Aware Multimodal KV Cache Eviction
por: Liu, Sihao, et al.
Publicado: (2026)
por: Liu, Sihao, et al.
Publicado: (2026)
Adaptive KV-Cache Compression without Manually Setting Budget
por: Tang, Chenxia, et al.
Publicado: (2025)
por: Tang, Chenxia, et al.
Publicado: (2025)
Ejemplares similares
-
PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference
por: Yang, Dongjie, et al.
Publicado: (2024) -
Not All Heads Matter: A Head-Level KV Cache Compression Method with Integrated Retrieval and Reasoning
por: Fu, Yu, et al.
Publicado: (2024) -
R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
por: Cai, Zefan, et al.
Publicado: (2025) -
Pyramid Cache: Layer-Adaptive KV Cache Compression with Signature-Based Cold Storage
por: Sergio dj
Publicado: (2026) -
Pyramid Forcing: Head-Aware Pyramid KV Cache Policy for High-Quality Long Video Generation
por: Chen, Jiayu, et al.
Publicado: (2026)