ManifoldKV: Training-Free KV Cache Compression via Euclidean Outlier Detection
Fuente:
arXiv
Salvato in:
| Autori principali: | Datta, Debajyoti, Neeraj, Trishala, Paudel, Bibek, Sharma, Vyom, Mukherjee, Subhabrata |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
KVSculpt: KV Cache Compression as Distillation
di: Jiang, Bo, et al.
Pubblicazione: (2026)
di: Jiang, Bo, et al.
Pubblicazione: (2026)
RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations
di: Su, Zunhai, et al.
Pubblicazione: (2025)
di: Su, Zunhai, et al.
Pubblicazione: (2025)
Training-Free Exponential Context Extension via Cascading KV Cache
di: Willette, Jeffrey, et al.
Pubblicazione: (2024)
di: Willette, Jeffrey, et al.
Pubblicazione: (2024)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
di: Liu, Guangda, et al.
Pubblicazione: (2025)
di: Liu, Guangda, et al.
Pubblicazione: (2025)
RaMP: Runtime-Aware Megakernel Polymorphism for Mixture-of-Experts
di: Sharma, Vyom, et al.
Pubblicazione: (2026)
di: Sharma, Vyom, et al.
Pubblicazione: (2026)
KeepKV: Achieving Periodic Lossless KV Cache Compression for Efficient LLM Inference
di: Tian, Yuxuan, et al.
Pubblicazione: (2025)
di: Tian, Yuxuan, et al.
Pubblicazione: (2025)
Quantization Dominates Rank Reduction for KV-Cache Compression
di: Salfati, Samuel
Pubblicazione: (2026)
di: Salfati, Samuel
Pubblicazione: (2026)
EliteKV: Scalable KV Cache Compression via RoPE Frequency Selection and Joint Low-Rank Projection
di: Zhou, Yuhao, et al.
Pubblicazione: (2025)
di: Zhou, Yuhao, et al.
Pubblicazione: (2025)
SWAN: Sparse Winnowed Attention for Reduced Inference Memory via Decompression-Free KV-Cache Compression
di: S, Santhosh G, et al.
Pubblicazione: (2025)
di: S, Santhosh G, et al.
Pubblicazione: (2025)
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
di: Liu, Akide, et al.
Pubblicazione: (2024)
di: Liu, Akide, et al.
Pubblicazione: (2024)
HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs
di: Yang, Dongquan, et al.
Pubblicazione: (2025)
di: Yang, Dongquan, et al.
Pubblicazione: (2025)
SentenceKV: Efficient LLM Inference via Sentence-Level Semantic KV Caching
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
MatryoshkaKV: Adaptive KV Compression via Trainable Orthogonal Projection
di: Lin, Bokai, et al.
Pubblicazione: (2024)
di: Lin, Bokai, et al.
Pubblicazione: (2024)
DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity
di: Hao, Jitai, et al.
Pubblicazione: (2026)
di: Hao, Jitai, et al.
Pubblicazione: (2026)
R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
di: Cai, Zefan, et al.
Pubblicazione: (2025)
di: Cai, Zefan, et al.
Pubblicazione: (2025)
Lossless KV Cache Compression to 2%
di: Yang, Zhen, et al.
Pubblicazione: (2024)
di: Yang, Zhen, et al.
Pubblicazione: (2024)
Eigen Attention: Attention in Low-Rank Space for KV Cache Compression
di: Saxena, Utkarsh, et al.
Pubblicazione: (2024)
di: Saxena, Utkarsh, et al.
Pubblicazione: (2024)
The Pitfalls of KV Cache Compression
di: Chen, Alex, et al.
Pubblicazione: (2025)
di: Chen, Alex, et al.
Pubblicazione: (2025)
Crystal-KV: Efficient KV Cache Management for Chain-of-Thought LLMs via Answer-First Principle
di: Wang, Zihan, et al.
Pubblicazione: (2026)
di: Wang, Zihan, et al.
Pubblicazione: (2026)
PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling
di: Cai, Zefan, et al.
Pubblicazione: (2024)
di: Cai, Zefan, et al.
Pubblicazione: (2024)
RetentiveKV: State-Space Memory for Uncertainty-Aware Multimodal KV Cache Eviction
di: Liu, Sihao, et al.
Pubblicazione: (2026)
di: Liu, Sihao, et al.
Pubblicazione: (2026)
Revisiting Multimodal KV Cache Compression: A Frequency-Domain-Guided Outlier-KV-Aware Approach
di: Yang, Yaoxin, et al.
Pubblicazione: (2025)
di: Yang, Yaoxin, et al.
Pubblicazione: (2025)
KV Cache Offloading for Context-Intensive Tasks
di: Bocharnikov, Andrey, et al.
Pubblicazione: (2026)
di: Bocharnikov, Andrey, et al.
Pubblicazione: (2026)
One Size Does Not Fit All: Token-Wise Adaptive Compression for KV Cache
di: Lu, Liming, et al.
Pubblicazione: (2026)
di: Lu, Liming, et al.
Pubblicazione: (2026)
GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM
di: Kang, Hao, et al.
Pubblicazione: (2024)
di: Kang, Hao, et al.
Pubblicazione: (2024)
CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing
di: Wang, Yixuan, et al.
Pubblicazione: (2025)
di: Wang, Yixuan, et al.
Pubblicazione: (2025)
CSKV: Training-Efficient Channel Shrinking for KV Cache in Long-Context Scenarios
di: Wang, Luning, et al.
Pubblicazione: (2024)
di: Wang, Luning, et al.
Pubblicazione: (2024)
MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference
di: Li, Kunxi, et al.
Pubblicazione: (2025)
di: Li, Kunxi, et al.
Pubblicazione: (2025)
Towards Threshold-Free KV Cache Pruning
di: Ni, Xuanfan, et al.
Pubblicazione: (2025)
di: Ni, Xuanfan, et al.
Pubblicazione: (2025)
More Than a Quick Glance: Overcoming the Greedy Bias in KV-Cache Compression
di: Sood, Aryan, et al.
Pubblicazione: (2026)
di: Sood, Aryan, et al.
Pubblicazione: (2026)
Beyond KV Caching: Shared Attention for Efficient LLMs
di: Liao, Bingli, et al.
Pubblicazione: (2024)
di: Liao, Bingli, et al.
Pubblicazione: (2024)
KVzap: Fast, Adaptive, and Faithful KV Cache Pruning
di: Jegou, Simon, et al.
Pubblicazione: (2026)
di: Jegou, Simon, et al.
Pubblicazione: (2026)
Beyond Speedup -- Utilizing KV Cache for Sampling and Reasoning
di: Xing, Zeyu, et al.
Pubblicazione: (2026)
di: Xing, Zeyu, et al.
Pubblicazione: (2026)
Beyond RAG: Task-Aware KV Cache Compression for Comprehensive Knowledge Reasoning
di: Corallo, Giulio, et al.
Pubblicazione: (2025)
di: Corallo, Giulio, et al.
Pubblicazione: (2025)
Time and Memory Trade-off of KV-Cache Compression in Tensor Transformer Decoding
di: Chen, Yifang, et al.
Pubblicazione: (2025)
di: Chen, Yifang, et al.
Pubblicazione: (2025)
KV Packet: Recomputation-Free Context-Independent KV Caching for LLMs
di: Chen, Chuangtao, et al.
Pubblicazione: (2026)
di: Chen, Chuangtao, et al.
Pubblicazione: (2026)
KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference
di: Nadali, Alireza, et al.
Pubblicazione: (2026)
di: Nadali, Alireza, et al.
Pubblicazione: (2026)
LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy
di: Zhang, Rongzhi, et al.
Pubblicazione: (2024)
di: Zhang, Rongzhi, et al.
Pubblicazione: (2024)
Efficient Long-Horizon GUI Agents via Training-Free KV Cache Compression
di: Zhou, Bowen, et al.
Pubblicazione: (2026)
di: Zhou, Bowen, et al.
Pubblicazione: (2026)
Documenti analoghi
-
KVSculpt: KV Cache Compression as Distillation
di: Jiang, Bo, et al.
Pubblicazione: (2026) -
RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations
di: Su, Zunhai, et al.
Pubblicazione: (2025) -
Training-Free Exponential Context Extension via Cascading KV Cache
di: Willette, Jeffrey, et al.
Pubblicazione: (2024) -
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025) -
FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
di: Liu, Guangda, et al.
Pubblicazione: (2025)