EliteKV: Scalable KV Cache Compression via RoPE Frequency Selection and Joint Low-Rank Projection
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Yuhao, Song, Sirui, Liu, Boyang, Xi, Zhiheng, Jin, Senjie, Fan, Xiaoran, Zhang, Zhihao, Li, Wei, Huang, Xuanjing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RAP: KV-Cache Compression via RoPE-Aligned Pruning
di: Xin, Jihao, et al.
Pubblicazione: (2026)
di: Xin, Jihao, et al.
Pubblicazione: (2026)
Palu: Compressing KV-Cache with Low-Rank Projection
di: Chang, Chi-Chih, et al.
Pubblicazione: (2024)
di: Chang, Chi-Chih, et al.
Pubblicazione: (2024)
TurboQuant on Quantized Models: Solving Compound Quantization Error with Pre-RoPE Compression and KV Compaction
di: Gökyıldız, Onur
Pubblicazione: (2026)
di: Gökyıldız, Onur
Pubblicazione: (2026)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
Scaling Laws of RoPE-based Extrapolation
di: Liu, Xiaoran, et al.
Pubblicazione: (2023)
di: Liu, Xiaoran, et al.
Pubblicazione: (2023)
KV-CoRE: Benchmarking Data-Dependent Low-Rank Compressibility of KV-Caches in LLMs
di: Chen, Jian, et al.
Pubblicazione: (2026)
di: Chen, Jian, et al.
Pubblicazione: (2026)
ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration
di: Yan, Xianglong, et al.
Pubblicazione: (2025)
di: Yan, Xianglong, et al.
Pubblicazione: (2025)
Eigen Attention: Attention in Low-Rank Space for KV Cache Compression
di: Saxena, Utkarsh, et al.
Pubblicazione: (2024)
di: Saxena, Utkarsh, et al.
Pubblicazione: (2024)
Quantization Dominates Rank Reduction for KV-Cache Compression
di: Salfati, Samuel
Pubblicazione: (2026)
di: Salfati, Samuel
Pubblicazione: (2026)
RoPE-LIME: RoPE-Space Locality + Sparse-K Sampling for Efficient LLM Attribution
di: Picov, Isaac, et al.
Pubblicazione: (2026)
di: Picov, Isaac, et al.
Pubblicazione: (2026)
ReRoPE: Repurposing RoPE for Relative Camera Control
di: Li, Chunyang, et al.
Pubblicazione: (2026)
di: Li, Chunyang, et al.
Pubblicazione: (2026)
The Pitfalls of KV Cache Compression
di: Chen, Alex, et al.
Pubblicazione: (2025)
di: Chen, Alex, et al.
Pubblicazione: (2025)
LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy
di: Zhang, Rongzhi, et al.
Pubblicazione: (2024)
di: Zhang, Rongzhi, et al.
Pubblicazione: (2024)
EvolKV: Evolutionary KV Cache Compression for LLM Inference
di: Yu, Bohan, et al.
Pubblicazione: (2025)
di: Yu, Bohan, et al.
Pubblicazione: (2025)
Untwisting RoPE: Frequency Control for Shared Attention in DiTs
di: Mikaeili, Aryan, et al.
Pubblicazione: (2026)
di: Mikaeili, Aryan, et al.
Pubblicazione: (2026)
NestedKV: Nested Memory Routing for Long-Context KV Cache Compression
di: Chen, Hong, et al.
Pubblicazione: (2026)
di: Chen, Hong, et al.
Pubblicazione: (2026)
Joint Encoding of KV-Cache Blocks for Scalable LLM Serving
di: Kampeas, Joseph, et al.
Pubblicazione: (2026)
di: Kampeas, Joseph, et al.
Pubblicazione: (2026)
Revisiting Multimodal KV Cache Compression: A Frequency-Domain-Guided Outlier-KV-Aware Approach
di: Yang, Yaoxin, et al.
Pubblicazione: (2025)
di: Yang, Yaoxin, et al.
Pubblicazione: (2025)
RoPeSLR: 3D RoPE-driven Sparse-LowRank Attention for Efficient Diffusion Transformers
di: Liu, Yuxi, et al.
Pubblicazione: (2026)
di: Liu, Yuxi, et al.
Pubblicazione: (2026)
Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models
di: Ji, Yicheng, et al.
Pubblicazione: (2026)
di: Ji, Yicheng, et al.
Pubblicazione: (2026)
KV-CAR: KV Cache Compression using Autoencoders and KV Reuse in Large Language Models
di: Roy, Sourjya, et al.
Pubblicazione: (2025)
di: Roy, Sourjya, et al.
Pubblicazione: (2025)
CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing
di: Wang, Yixuan, et al.
Pubblicazione: (2025)
di: Wang, Yixuan, et al.
Pubblicazione: (2025)
R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
di: Cai, Zefan, et al.
Pubblicazione: (2025)
di: Cai, Zefan, et al.
Pubblicazione: (2025)
Periodic RoPE for Infinite Context LLMs
di: Huo, Simin
Pubblicazione: (2026)
di: Huo, Simin
Pubblicazione: (2026)
Base of RoPE Bounds Context Length
di: Men, Xin, et al.
Pubblicazione: (2024)
di: Men, Xin, et al.
Pubblicazione: (2024)
CoPE: Clipped RoPE as A Scalable Free Lunch for Long Context LLMs
di: Li, Haoran, et al.
Pubblicazione: (2026)
di: Li, Haoran, et al.
Pubblicazione: (2026)
Training Transformers for KV Cache Compressibility
di: Gelberg, Yoav, et al.
Pubblicazione: (2026)
di: Gelberg, Yoav, et al.
Pubblicazione: (2026)
Lossless KV Cache Compression to 2%
di: Yang, Zhen, et al.
Pubblicazione: (2024)
di: Yang, Zhen, et al.
Pubblicazione: (2024)
KVSculpt: KV Cache Compression as Distillation
di: Jiang, Bo, et al.
Pubblicazione: (2026)
di: Jiang, Bo, et al.
Pubblicazione: (2026)
KV-Compress: Paged KV-Cache Compression with Variable Compression Rates per Attention Head
di: Rehg, Isaac
Pubblicazione: (2024)
di: Rehg, Isaac
Pubblicazione: (2024)
EVICPRESS: Joint KV-Cache Compression and Eviction for Efficient LLM Serving
di: Feng, Shaoting, et al.
Pubblicazione: (2025)
di: Feng, Shaoting, et al.
Pubblicazione: (2025)
EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction
di: Ji, Shiyu, et al.
Pubblicazione: (2026)
di: Ji, Shiyu, et al.
Pubblicazione: (2026)
PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling
di: Cai, Zefan, et al.
Pubblicazione: (2024)
di: Cai, Zefan, et al.
Pubblicazione: (2024)
ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression
di: Liu, Guangda, et al.
Pubblicazione: (2024)
di: Liu, Guangda, et al.
Pubblicazione: (2024)
ThinKV: Thought-Adaptive KV Cache Compression for Efficient Reasoning Models
di: Ramachandran, Akshat, et al.
Pubblicazione: (2025)
di: Ramachandran, Akshat, et al.
Pubblicazione: (2025)
On 10x Better Scalability: KV Stores Scale Up KV Cache
di: Yu, Weiping, et al.
Pubblicazione: (2025)
di: Yu, Weiping, et al.
Pubblicazione: (2025)
Demystifying the Slash Pattern in Attention: The Role of RoPE
di: Cheng, Yuan, et al.
Pubblicazione: (2026)
di: Cheng, Yuan, et al.
Pubblicazione: (2026)
CaliDrop: KV Cache Compression with Calibration
di: Su, Yi, et al.
Pubblicazione: (2025)
di: Su, Yi, et al.
Pubblicazione: (2025)
DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs
di: Zhou, Xiabin, et al.
Pubblicazione: (2024)
di: Zhou, Xiabin, et al.
Pubblicazione: (2024)
Moment-KV: Momentum-Based Decode-Time KV Cache Compression for Long Generation
di: Jana, Soumyadeep, et al.
Pubblicazione: (2026)
di: Jana, Soumyadeep, et al.
Pubblicazione: (2026)
Documenti analoghi
-
RAP: KV-Cache Compression via RoPE-Aligned Pruning
di: Xin, Jihao, et al.
Pubblicazione: (2026) -
Palu: Compressing KV-Cache with Low-Rank Projection
di: Chang, Chi-Chih, et al.
Pubblicazione: (2024) -
TurboQuant on Quantized Models: Solving Compound Quantization Error with Pre-RoPE Compression and KV Compaction
di: Gökyıldız, Onur
Pubblicazione: (2026) -
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025) -
Scaling Laws of RoPE-based Extrapolation
di: Liu, Xiaoran, et al.
Pubblicazione: (2023)