CaliDrop: KV Cache Compression with Calibration
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Su, Yi, Qiu, Quantong, Zhou, Yuechi, Li, Juntao, Xia, Qingrong, Li, Ping, Duan, Xinyu, Wang, Zhefeng, Zhang, Min |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Accurate KV Cache Quantization with Outlier Tokens Tracing
par: Su, Yi, et autres
Publié: (2025)
par: Su, Yi, et autres
Publié: (2025)
$A^3$: Attention-Aware Accurate KV Cache Fusion for Fast Large Language Model Serving
par: Zhou, Yuechi, et autres
Publié: (2025)
par: Zhou, Yuechi, et autres
Publié: (2025)
LongFlow: Efficient KV Cache Compression for Reasoning Models
par: Su, Yi, et autres
Publié: (2026)
par: Su, Yi, et autres
Publié: (2026)
Beware of Calibration Data for Pruning Large Language Models
par: Ji, Yixin, et autres
Publié: (2024)
par: Ji, Yixin, et autres
Publié: (2024)
OPT-Tree: Speculative Decoding with Adaptive Draft Tree Structure
par: Wang, Jikai, et autres
Publié: (2024)
par: Wang, Jikai, et autres
Publié: (2024)
Where Matters More Than What: Decoding-aligned KV Cache Compression via Position-aware Pseudo Queries
par: Tian, Zhenxu, et autres
Publié: (2026)
par: Tian, Zhenxu, et autres
Publié: (2026)
Adaptive Feature-based Low-Rank Compression of Large Language Models via Bayesian Optimization
par: Ji, Yixin, et autres
Publié: (2024)
par: Ji, Yixin, et autres
Publié: (2024)
Alignment-Augmented Speculative Decoding with Alignment Sampling and Conditional Verification
par: Wang, Jikai, et autres
Publié: (2025)
par: Wang, Jikai, et autres
Publié: (2025)
DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs
par: Zhou, Xiabin, et autres
Publié: (2024)
par: Zhou, Xiabin, et autres
Publié: (2024)
Taming the Titans: A Survey of Efficient LLM Inference Serving
par: Zhen, Ranran, et autres
Publié: (2025)
par: Zhen, Ranran, et autres
Publié: (2025)
DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity
par: Hao, Jitai, et autres
Publié: (2026)
par: Hao, Jitai, et autres
Publié: (2026)
R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
par: Cai, Zefan, et autres
Publié: (2025)
par: Cai, Zefan, et autres
Publié: (2025)
LOOM-Scope: a comprehensive and efficient LOng-cOntext Model evaluation framework
par: Tang, Zecheng, et autres
Publié: (2025)
par: Tang, Zecheng, et autres
Publié: (2025)
LongRM: Revealing and Unlocking the Context Boundary of Reward Modeling
par: Tang, Zecheng, et autres
Publié: (2025)
par: Tang, Zecheng, et autres
Publié: (2025)
Flux Attention: Context-Aware Hybrid Attention for Efficient LLMs Inference
par: Qiu, Quantong, et autres
Publié: (2026)
par: Qiu, Quantong, et autres
Publié: (2026)
Lossless KV Cache Compression to 2%
par: Yang, Zhen, et autres
Publié: (2024)
par: Yang, Zhen, et autres
Publié: (2024)
Compactor: Calibrated Query-Agnostic KV Cache Compression with Approximate Leverage Scores
par: Chari, Vivek, et autres
Publié: (2025)
par: Chari, Vivek, et autres
Publié: (2025)
KV-CoRE: Benchmarking Data-Dependent Low-Rank Compressibility of KV-Caches in LLMs
par: Chen, Jian, et autres
Publié: (2026)
par: Chen, Jian, et autres
Publié: (2026)
KV-Compress: Paged KV-Cache Compression with Variable Compression Rates per Attention Head
par: Rehg, Isaac
Publié: (2024)
par: Rehg, Isaac
Publié: (2024)
HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference
par: Shi, Zhiyuan, et autres
Publié: (2026)
par: Shi, Zhiyuan, et autres
Publié: (2026)
PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling
par: Cai, Zefan, et autres
Publié: (2024)
par: Cai, Zefan, et autres
Publié: (2024)
AttentionPredictor: Temporal Patterns Matter for KV Cache Compression
par: Yang, Qingyue, et autres
Publié: (2025)
par: Yang, Qingyue, et autres
Publié: (2025)
ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
par: Liu, Xiang, et autres
Publié: (2025)
par: Liu, Xiang, et autres
Publié: (2025)
Which Heads Matter for Reasoning? RL-Guided KV Cache Compression
par: Du, Wenjie, et autres
Publié: (2025)
par: Du, Wenjie, et autres
Publié: (2025)
EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction
par: Ji, Shiyu, et autres
Publié: (2026)
par: Ji, Shiyu, et autres
Publié: (2026)
FAEDKV: Infinite-Window Fourier Transform for Unbiased KV Cache Compression
par: Li, Runchao, et autres
Publié: (2025)
par: Li, Runchao, et autres
Publié: (2025)
NestedKV: Nested Memory Routing for Long-Context KV Cache Compression
par: Chen, Hong, et autres
Publié: (2026)
par: Chen, Hong, et autres
Publié: (2026)
EMS: Adaptive Evict-then-Merge Strategy for Head-wise KV Cache Compression Based on Global-Local Importance
par: Li, Yingxin, et autres
Publié: (2024)
par: Li, Yingxin, et autres
Publié: (2024)
KeepKV: Achieving Periodic Lossless KV Cache Compression for Efficient LLM Inference
par: Tian, Yuxuan, et autres
Publié: (2025)
par: Tian, Yuxuan, et autres
Publié: (2025)
CommVQ: Commutative Vector Quantization for KV Cache Compression
par: Li, Junyan, et autres
Publié: (2025)
par: Li, Junyan, et autres
Publié: (2025)
Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity
par: Ma, Da, et autres
Publié: (2024)
par: Ma, Da, et autres
Publié: (2024)
KVSculpt: KV Cache Compression as Distillation
par: Jiang, Bo, et autres
Publié: (2026)
par: Jiang, Bo, et autres
Publié: (2026)
One Size Does Not Fit All: Token-Wise Adaptive Compression for KV Cache
par: Lu, Liming, et autres
Publié: (2026)
par: Lu, Liming, et autres
Publié: (2026)
RuPLaR : Efficient Latent Compression of LLM Reasoning Chains with Rule-Based Priors From Multi-Step to One-Step
par: Luo, Xiaocheng, et autres
Publié: (2026)
par: Luo, Xiaocheng, et autres
Publié: (2026)
SpindleKV: A Novel KV Cache Reduction Method Balancing Both Shallow and Deep Layers
par: Tang, Zicong, et autres
Publié: (2025)
par: Tang, Zicong, et autres
Publié: (2025)
Hold Onto That Thought: Assessing KV Cache Compression On Reasoning
par: Liu, Minghui, et autres
Publié: (2025)
par: Liu, Minghui, et autres
Publié: (2025)
KVReviver: Reversible KV Cache Compression with Sketch-Based Token Reconstruction
par: Yuan, Aomufei, et autres
Publié: (2025)
par: Yuan, Aomufei, et autres
Publié: (2025)
Elastic Attention: Test-time Adaptive Sparsity Ratios for Efficient Transformers
par: Tang, Zecheng, et autres
Publié: (2026)
par: Tang, Zecheng, et autres
Publié: (2026)
LLMs Know What to Drop: Self-Attention Guided KV Cache Eviction for Efficient Long-Context Inference
par: Wang, Guangtao, et autres
Publié: (2025)
par: Wang, Guangtao, et autres
Publié: (2025)
EvolKV: Evolutionary KV Cache Compression for LLM Inference
par: Yu, Bohan, et autres
Publié: (2025)
par: Yu, Bohan, et autres
Publié: (2025)
Documents similaires
-
Accurate KV Cache Quantization with Outlier Tokens Tracing
par: Su, Yi, et autres
Publié: (2025) -
$A^3$: Attention-Aware Accurate KV Cache Fusion for Fast Large Language Model Serving
par: Zhou, Yuechi, et autres
Publié: (2025) -
LongFlow: Efficient KV Cache Compression for Reasoning Models
par: Su, Yi, et autres
Publié: (2026) -
Beware of Calibration Data for Pruning Large Language Models
par: Ji, Yixin, et autres
Publié: (2024) -
OPT-Tree: Speculative Decoding with Adaptive Draft Tree Structure
par: Wang, Jikai, et autres
Publié: (2024)