Enregistré dans:
| Auteurs principaux: | He, Xingyang, Liu, Jie, Chen, Shaowei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2501.15113 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs
par: Zhou, Xiabin, et autres
Publié: (2024)
par: Zhou, Xiabin, et autres
Publié: (2024)
KV-Compress: Paged KV-Cache Compression with Variable Compression Rates per Attention Head
par: Rehg, Isaac
Publié: (2024)
par: Rehg, Isaac
Publié: (2024)
WindowKV: Task-Adaptive Group-Wise KV Cache Window Selection for Efficient LLM Inference
par: Zuo, Youhui, et autres
Publié: (2025)
par: Zuo, Youhui, et autres
Publié: (2025)
KV Cache Offloading for Context-Intensive Tasks
par: Bocharnikov, Andrey, et autres
Publié: (2026)
par: Bocharnikov, Andrey, et autres
Publié: (2026)
R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
par: Cai, Zefan, et autres
Publié: (2025)
par: Cai, Zefan, et autres
Publié: (2025)
RazorAttention: Efficient KV Cache Compression Through Retrieval Heads
par: Tang, Hanlin, et autres
Publié: (2024)
par: Tang, Hanlin, et autres
Publié: (2024)
KV-Latent: Dimensional-level KV Cache Reduction with Frequency-aware Rotary Positional Embedding
par: Shi, Luohe, et autres
Publié: (2025)
par: Shi, Luohe, et autres
Publié: (2025)
G-KV: Decoding-Time KV Cache Eviction with Global Attention
par: Liao, Mengqi, et autres
Publié: (2025)
par: Liao, Mengqi, et autres
Publié: (2025)
AttentionPredictor: Temporal Patterns Matter for KV Cache Compression
par: Yang, Qingyue, et autres
Publié: (2025)
par: Yang, Qingyue, et autres
Publié: (2025)
ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
par: Liu, Xiang, et autres
Publié: (2025)
par: Liu, Xiang, et autres
Publié: (2025)
EFIM: Efficient Serving of LLMs for Infilling Tasks with Improved KV Cache Reuse
par: Guo, Tianyu, et autres
Publié: (2025)
par: Guo, Tianyu, et autres
Publié: (2025)
SentenceKV: Efficient LLM Inference via Sentence-Level Semantic KV Caching
par: Zhu, Yuxuan, et autres
Publié: (2025)
par: Zhu, Yuxuan, et autres
Publié: (2025)
Beyond Homogeneous Attention: Memory-Efficient LLMs via Fourier-Approximated KV Cache
par: Liu, Xiaoran, et autres
Publié: (2025)
par: Liu, Xiaoran, et autres
Publié: (2025)
EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction
par: Ji, Shiyu, et autres
Publié: (2026)
par: Ji, Shiyu, et autres
Publié: (2026)
TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimization
par: Yao, Dingyu, et autres
Publié: (2025)
par: Yao, Dingyu, et autres
Publié: (2025)
CriticalKV: Optimizing KV Cache Eviction from an Output Perturbation Perspective
par: Feng, Yuan, et autres
Publié: (2025)
par: Feng, Yuan, et autres
Publié: (2025)
SemantiCache: Efficient KV Cache Compression via Semantic Chunking and Clustered Merging
par: Wu, Shunlong, et autres
Publié: (2026)
par: Wu, Shunlong, et autres
Publié: (2026)
Sparse Attention across Multiple-context KV Cache
par: Cao, Ziyi, et autres
Publié: (2025)
par: Cao, Ziyi, et autres
Publié: (2025)
Transactional Attention: Semantic Sponsorship for KV-Cache Retention
par: Basu, Abhinaba
Publié: (2026)
par: Basu, Abhinaba
Publié: (2026)
Which Heads Matter for Reasoning? RL-Guided KV Cache Compression
par: Du, Wenjie, et autres
Publié: (2025)
par: Du, Wenjie, et autres
Publié: (2025)
ForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term Contribution
par: Dong, Zican, et autres
Publié: (2026)
par: Dong, Zican, et autres
Publié: (2026)
DASH-KV: Accelerating Long-Context LLM Inference via Asymmetric KV Cache Hashing
par: Guo, Jinyu, et autres
Publié: (2026)
par: Guo, Jinyu, et autres
Publié: (2026)
In-context KV-Cache Eviction for LLMs via Attention-Gate
par: Zeng, Zihao, et autres
Publié: (2024)
par: Zeng, Zihao, et autres
Publié: (2024)
NestedKV: Nested Memory Routing for Long-Context KV Cache Compression
par: Chen, Hong, et autres
Publié: (2026)
par: Chen, Hong, et autres
Publié: (2026)
Efficient Long-Context LLM Inference via KV Cache Clustering
par: Hu, Jie, et autres
Publié: (2025)
par: Hu, Jie, et autres
Publié: (2025)
GUI-KV: Efficient GUI Agents via KV Cache with Spatio-Temporal Awareness
par: Huang, Kung-Hsiang, et autres
Publié: (2025)
par: Huang, Kung-Hsiang, et autres
Publié: (2025)
KV-CoRE: Benchmarking Data-Dependent Low-Rank Compressibility of KV-Caches in LLMs
par: Chen, Jian, et autres
Publié: (2026)
par: Chen, Jian, et autres
Publié: (2026)
SABlock: Semantic-Aware KV Cache Eviction with Adaptive Compression Block Size
par: Chen, Jinhan, et autres
Publié: (2025)
par: Chen, Jinhan, et autres
Publié: (2025)
EvolKV: Evolutionary KV Cache Compression for LLM Inference
par: Yu, Bohan, et autres
Publié: (2025)
par: Yu, Bohan, et autres
Publié: (2025)
Towards Threshold-Free KV Cache Pruning
par: Ni, Xuanfan, et autres
Publié: (2025)
par: Ni, Xuanfan, et autres
Publié: (2025)
Beyond KV Caching: Shared Attention for Efficient LLMs
par: Liao, Bingli, et autres
Publié: (2024)
par: Liao, Bingli, et autres
Publié: (2024)
PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling
par: Cai, Zefan, et autres
Publié: (2024)
par: Cai, Zefan, et autres
Publié: (2024)
DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity
par: Hao, Jitai, et autres
Publié: (2026)
par: Hao, Jitai, et autres
Publié: (2026)
Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference
par: Feng, Yuan, et autres
Publié: (2024)
par: Feng, Yuan, et autres
Publié: (2024)
FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
par: Liu, Guangda, et autres
Publié: (2025)
par: Liu, Guangda, et autres
Publié: (2025)
ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference
par: Sun, Hanshi, et autres
Publié: (2024)
par: Sun, Hanshi, et autres
Publié: (2024)
Beyond RAG: Task-Aware KV Cache Compression for Comprehensive Knowledge Reasoning
par: Corallo, Giulio, et autres
Publié: (2025)
par: Corallo, Giulio, et autres
Publié: (2025)
RefreshKV: Updating Small KV Cache During Long-form Generation
par: Xu, Fangyuan, et autres
Publié: (2024)
par: Xu, Fangyuan, et autres
Publié: (2024)
SurfaceLogicKV: Surface and Logic Attention Behaviors are All You Need for Robust KV Cache Compression
par: Li, Mengjie, et autres
Publié: (2025)
par: Li, Mengjie, et autres
Publié: (2025)
AhaKV: Adaptive Holistic Attention-Driven KV Cache Eviction for Efficient Inference of Large Language Models
par: Gu, Yifeng, et autres
Publié: (2025)
par: Gu, Yifeng, et autres
Publié: (2025)
Documents similaires
-
DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs
par: Zhou, Xiabin, et autres
Publié: (2024) -
KV-Compress: Paged KV-Cache Compression with Variable Compression Rates per Attention Head
par: Rehg, Isaac
Publié: (2024) -
WindowKV: Task-Adaptive Group-Wise KV Cache Window Selection for Efficient LLM Inference
par: Zuo, Youhui, et autres
Publié: (2025) -
KV Cache Offloading for Context-Intensive Tasks
par: Bocharnikov, Andrey, et autres
Publié: (2026) -
R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
par: Cai, Zefan, et autres
Publié: (2025)