AttentionPredictor: Temporal Patterns Matter for KV Cache Compression
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Qingyue, Wang, Jie, Li, Xing, Wang, Zhihai, Chen, Chen, Chen, Lei, Yu, Xianzhi, Liu, Wulong, Hao, Jianye, Yuan, Mingxuan, Li, Bin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SVDq: 1.25-bit and 410x Key Cache Compression for LLM Attention
di: Yankun, Hong, et al.
Pubblicazione: (2025)
di: Yankun, Hong, et al.
Pubblicazione: (2025)
Why Attention Patterns Exist: A Unifying Temporal Perspective Analysis
di: Yang, Qingyue, et al.
Pubblicazione: (2026)
di: Yang, Qingyue, et al.
Pubblicazione: (2026)
KVTuner: Sensitivity-Aware Layer-Wise Mixed-Precision KV Cache Quantization for Efficient and Nearly Lossless LLM Inference
di: Li, Xing, et al.
Pubblicazione: (2025)
di: Li, Xing, et al.
Pubblicazione: (2025)
Beyond Speedup -- Utilizing KV Cache for Sampling and Reasoning
di: Xing, Zeyu, et al.
Pubblicazione: (2026)
di: Xing, Zeyu, et al.
Pubblicazione: (2026)
Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity
di: Ma, Da, et al.
Pubblicazione: (2024)
di: Ma, Da, et al.
Pubblicazione: (2024)
TrimR: Verifier-based Training-Free Thinking Compression for Efficient Test-Time Scaling
di: Lin, Weizhe, et al.
Pubblicazione: (2025)
di: Lin, Weizhe, et al.
Pubblicazione: (2025)
KV-CoRE: Benchmarking Data-Dependent Low-Rank Compressibility of KV-Caches in LLMs
di: Chen, Jian, et al.
Pubblicazione: (2026)
di: Chen, Jian, et al.
Pubblicazione: (2026)
Which Heads Matter for Reasoning? RL-Guided KV Cache Compression
di: Du, Wenjie, et al.
Pubblicazione: (2025)
di: Du, Wenjie, et al.
Pubblicazione: (2025)
The Pitfalls of KV Cache Compression
di: Chen, Alex, et al.
Pubblicazione: (2025)
di: Chen, Alex, et al.
Pubblicazione: (2025)
Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads
di: He, Xingyang, et al.
Pubblicazione: (2025)
di: He, Xingyang, et al.
Pubblicazione: (2025)
Semantic Integrity Matters: Benchmarking and Preserving High-Density Reasoning in KV Cache Compression
di: Liu, Xiang, et al.
Pubblicazione: (2025)
di: Liu, Xiang, et al.
Pubblicazione: (2025)
Analytical FFN-to-MoE Restructuring via Activation Pattern Analysis
di: Pei, Zehua, et al.
Pubblicazione: (2025)
di: Pei, Zehua, et al.
Pubblicazione: (2025)
Thin Keys, Full Values: Reducing KV Cache via Low-Dimensional Attention Selection
di: Yao, Hengshuai, et al.
Pubblicazione: (2026)
di: Yao, Hengshuai, et al.
Pubblicazione: (2026)
KV-Compress: Paged KV-Cache Compression with Variable Compression Rates per Attention Head
di: Rehg, Isaac
Pubblicazione: (2024)
di: Rehg, Isaac
Pubblicazione: (2024)
DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity
di: Hao, Jitai, et al.
Pubblicazione: (2026)
di: Hao, Jitai, et al.
Pubblicazione: (2026)
What Matters For Safety Alignment?
di: Li, Xing, et al.
Pubblicazione: (2026)
di: Li, Xing, et al.
Pubblicazione: (2026)
CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing
di: Wang, Yixuan, et al.
Pubblicazione: (2025)
di: Wang, Yixuan, et al.
Pubblicazione: (2025)
AKVQ-VL: Attention-Aware KV Cache Adaptive 2-Bit Quantization for Vision-Language Models
di: Su, Zunhai, et al.
Pubblicazione: (2025)
di: Su, Zunhai, et al.
Pubblicazione: (2025)
CaliDrop: KV Cache Compression with Calibration
di: Su, Yi, et al.
Pubblicazione: (2025)
di: Su, Yi, et al.
Pubblicazione: (2025)
NestedKV: Nested Memory Routing for Long-Context KV Cache Compression
di: Chen, Hong, et al.
Pubblicazione: (2026)
di: Chen, Hong, et al.
Pubblicazione: (2026)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
Palu: Compressing KV-Cache with Low-Rank Projection
di: Chang, Chi-Chih, et al.
Pubblicazione: (2024)
di: Chang, Chi-Chih, et al.
Pubblicazione: (2024)
RazorAttention: Efficient KV Cache Compression Through Retrieval Heads
di: Tang, Hanlin, et al.
Pubblicazione: (2024)
di: Tang, Hanlin, et al.
Pubblicazione: (2024)
SurfaceLogicKV: Surface and Logic Attention Behaviors are All You Need for Robust KV Cache Compression
di: Li, Mengjie, et al.
Pubblicazione: (2025)
di: Li, Mengjie, et al.
Pubblicazione: (2025)
Time and Memory Trade-off of KV-Cache Compression in Tensor Transformer Decoding
di: Chen, Yifang, et al.
Pubblicazione: (2025)
di: Chen, Yifang, et al.
Pubblicazione: (2025)
Eigen Attention: Attention in Low-Rank Space for KV Cache Compression
di: Saxena, Utkarsh, et al.
Pubblicazione: (2024)
di: Saxena, Utkarsh, et al.
Pubblicazione: (2024)
EvolKV: Evolutionary KV Cache Compression for LLM Inference
di: Yu, Bohan, et al.
Pubblicazione: (2025)
di: Yu, Bohan, et al.
Pubblicazione: (2025)
Accelerating Large Language Model Reasoning via Speculative Search
di: Wang, Zhihai, et al.
Pubblicazione: (2025)
di: Wang, Zhihai, et al.
Pubblicazione: (2025)
STaR-KV: Spatio-Temporal Adaptive Re-weighting for KV Cache Compression in GUI Vision-Language Models
di: Han, Yuhang, et al.
Pubblicazione: (2026)
di: Han, Yuhang, et al.
Pubblicazione: (2026)
HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference
di: Zeng, Bowen, et al.
Pubblicazione: (2026)
di: Zeng, Bowen, et al.
Pubblicazione: (2026)
PureKV: Plug-and-Play KV Cache Optimization with Spatial-Temporal Sparse Attention for Vision-Language Large Models
di: Jiang, Zhonghua, et al.
Pubblicazione: (2025)
di: Jiang, Zhonghua, et al.
Pubblicazione: (2025)
Enhancing Large Multimodal Models with Adaptive Sparsity and KV Cache Compression
di: Zhang, Te, et al.
Pubblicazione: (2025)
di: Zhang, Te, et al.
Pubblicazione: (2025)
StreamKV: Streaming Video Question-Answering with Segment-based KV Cache Retrieval and Compression
di: Chen, Yilong, et al.
Pubblicazione: (2025)
di: Chen, Yilong, et al.
Pubblicazione: (2025)
Lossless KV Cache Compression to 2%
di: Yang, Zhen, et al.
Pubblicazione: (2024)
di: Yang, Zhen, et al.
Pubblicazione: (2024)
KeepKV: Achieving Periodic Lossless KV Cache Compression for Efficient LLM Inference
di: Tian, Yuxuan, et al.
Pubblicazione: (2025)
di: Tian, Yuxuan, et al.
Pubblicazione: (2025)
Revisiting Multimodal KV Cache Compression: A Frequency-Domain-Guided Outlier-KV-Aware Approach
di: Yang, Yaoxin, et al.
Pubblicazione: (2025)
di: Yang, Yaoxin, et al.
Pubblicazione: (2025)
HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs
di: Yang, Dongquan, et al.
Pubblicazione: (2025)
di: Yang, Dongquan, et al.
Pubblicazione: (2025)
Memory-Efficient Visual Autoregressive Modeling with Scale-Aware KV Cache Compression
di: Li, Kunjun, et al.
Pubblicazione: (2025)
di: Li, Kunjun, et al.
Pubblicazione: (2025)
SABlock: Semantic-Aware KV Cache Eviction with Adaptive Compression Block Size
di: Chen, Jinhan, et al.
Pubblicazione: (2025)
di: Chen, Jinhan, et al.
Pubblicazione: (2025)
HyperTree Planning: Enhancing LLM Reasoning via Hierarchical Thinking
di: Gui, Runquan, et al.
Pubblicazione: (2025)
di: Gui, Runquan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SVDq: 1.25-bit and 410x Key Cache Compression for LLM Attention
di: Yankun, Hong, et al.
Pubblicazione: (2025) -
Why Attention Patterns Exist: A Unifying Temporal Perspective Analysis
di: Yang, Qingyue, et al.
Pubblicazione: (2026) -
KVTuner: Sensitivity-Aware Layer-Wise Mixed-Precision KV Cache Quantization for Efficient and Nearly Lossless LLM Inference
di: Li, Xing, et al.
Pubblicazione: (2025) -
Beyond Speedup -- Utilizing KV Cache for Sampling and Reasoning
di: Xing, Zeyu, et al.
Pubblicazione: (2026) -
Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity
di: Ma, Da, et al.
Pubblicazione: (2024)