ZigZagkv: Dynamic KV Cache Compression for Long-context Modeling based on Layer Uncertainty
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhong, Meizhi, Liu, Xikai, Zhang, Chen, Lei, Yikun, Gao, Yan, Hu, Yao, Chen, Kehai, Zhang, Min |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Understanding the RoPE Extensions of Long-Context LLMs: An Attention Perspective
par: Zhong, Meizhi, et autres
Publié: (2024)
par: Zhong, Meizhi, et autres
Publié: (2024)
SearchSkill: Teaching LLMs to Use Search Tools with Evolving Skill Banks
par: Hu, Jinchao, et autres
Publié: (2026)
par: Hu, Jinchao, et autres
Publié: (2026)
Agentic Tool Use in Large Language Models
par: Hu, Jinchao, et autres
Publié: (2026)
par: Hu, Jinchao, et autres
Publié: (2026)
Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity
par: Ma, Da, et autres
Publié: (2024)
par: Ma, Da, et autres
Publié: (2024)
DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs
par: Zhou, Xiabin, et autres
Publié: (2024)
par: Zhou, Xiabin, et autres
Publié: (2024)
DecEx-RAG: Boosting Agentic Retrieval-Augmented Generation with Decision and Execution Optimization via Process Supervision
par: Leng, Yongqi, et autres
Publié: (2025)
par: Leng, Yongqi, et autres
Publié: (2025)
PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling
par: Cai, Zefan, et autres
Publié: (2024)
par: Cai, Zefan, et autres
Publié: (2024)
NestedKV: Nested Memory Routing for Long-Context KV Cache Compression
par: Chen, Hong, et autres
Publié: (2026)
par: Chen, Hong, et autres
Publié: (2026)
DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity
par: Hao, Jitai, et autres
Publié: (2026)
par: Hao, Jitai, et autres
Publié: (2026)
Adaptive Inner Speech-Text Alignment for LLM-based Speech Translation
par: Liu, Henglyu, et autres
Publié: (2025)
par: Liu, Henglyu, et autres
Publié: (2025)
LongFlow: Efficient KV Cache Compression for Reasoning Models
par: Su, Yi, et autres
Publié: (2026)
par: Su, Yi, et autres
Publié: (2026)
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
par: Xiao, Junbin, et autres
Publié: (2026)
par: Xiao, Junbin, et autres
Publié: (2026)
PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference
par: Yang, Dongjie, et autres
Publié: (2024)
par: Yang, Dongjie, et autres
Publié: (2024)
On the Hallucination in Simultaneous Machine Translation
par: Zhong, Meizhi, et autres
Publié: (2024)
par: Zhong, Meizhi, et autres
Publié: (2024)
MoDification: Mixture of Depths Made Easy
par: Zhang, Chen, et autres
Publié: (2024)
par: Zhang, Chen, et autres
Publié: (2024)
The Pitfalls of KV Cache Compression
par: Chen, Alex, et autres
Publié: (2025)
par: Chen, Alex, et autres
Publié: (2025)
StreamKV: Streaming Video Question-Answering with Segment-based KV Cache Retrieval and Compression
par: Chen, Yilong, et autres
Publié: (2025)
par: Chen, Yilong, et autres
Publié: (2025)
FIER: Fine-Grained and Efficient KV Cache Retrieval for Long-context LLM Inference
par: Wang, Dongwei, et autres
Publié: (2025)
par: Wang, Dongwei, et autres
Publié: (2025)
XQuant: Achieving Ultra-Low Bit KV Cache Quantization with Cross-Layer Compression
par: Yang, Haoqi, et autres
Publié: (2025)
par: Yang, Haoqi, et autres
Publié: (2025)
CaliDrop: KV Cache Compression with Calibration
par: Su, Yi, et autres
Publié: (2025)
par: Su, Yi, et autres
Publié: (2025)
ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
par: Liu, Xiang, et autres
Publié: (2025)
par: Liu, Xiang, et autres
Publié: (2025)
AttentionPredictor: Temporal Patterns Matter for KV Cache Compression
par: Yang, Qingyue, et autres
Publié: (2025)
par: Yang, Qingyue, et autres
Publié: (2025)
Palu: Compressing KV-Cache with Low-Rank Projection
par: Chang, Chi-Chih, et autres
Publié: (2024)
par: Chang, Chi-Chih, et autres
Publié: (2024)
Pyramid Cache: Layer-Adaptive KV Cache Compression with Signature-Based Cold Storage
par: Sergio dj
Publié: (2026)
par: Sergio dj
Publié: (2026)
Sparse Attention across Multiple-context KV Cache
par: Cao, Ziyi, et autres
Publié: (2025)
par: Cao, Ziyi, et autres
Publié: (2025)
R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
par: Cai, Zefan, et autres
Publié: (2025)
par: Cai, Zefan, et autres
Publié: (2025)
Moment-KV: Momentum-Based Decode-Time KV Cache Compression for Long Generation
par: Jana, Soumyadeep, et autres
Publié: (2026)
par: Jana, Soumyadeep, et autres
Publié: (2026)
Tutti: Making SSD-Backed KV Cache Practical for Long-Context LLM Serving
par: Qiu, Shi, et autres
Publié: (2026)
par: Qiu, Shi, et autres
Publié: (2026)
xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction
par: Chang, Chi-Chih, et autres
Publié: (2025)
par: Chang, Chi-Chih, et autres
Publié: (2025)
Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models
par: Ji, Yicheng, et autres
Publié: (2026)
par: Ji, Yicheng, et autres
Publié: (2026)
HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference
par: Shi, Zhiyuan, et autres
Publié: (2026)
par: Shi, Zhiyuan, et autres
Publié: (2026)
EVICPRESS: Joint KV-Cache Compression and Eviction for Efficient LLM Serving
par: Feng, Shaoting, et autres
Publié: (2025)
par: Feng, Shaoting, et autres
Publié: (2025)
ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration
par: Yan, Xianglong, et autres
Publié: (2025)
par: Yan, Xianglong, et autres
Publié: (2025)
HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference
par: Zeng, Bowen, et autres
Publié: (2026)
par: Zeng, Bowen, et autres
Publié: (2026)
DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference
par: Dehghanighobadi, Zahra, et autres
Publié: (2026)
par: Dehghanighobadi, Zahra, et autres
Publié: (2026)
Hold Onto That Thought: Assessing KV Cache Compression On Reasoning
par: Liu, Minghui, et autres
Publié: (2025)
par: Liu, Minghui, et autres
Publié: (2025)
Streaming Video Question-Answering with In-context Video KV-Cache Retrieval
par: Di, Shangzhe, et autres
Publié: (2025)
par: Di, Shangzhe, et autres
Publié: (2025)
LMCache: An Efficient KV Cache Layer for Enterprise-Scale LLM Inference
par: Liu, Yuhan, et autres
Publié: (2025)
par: Liu, Yuhan, et autres
Publié: (2025)
LayerKV: Optimizing Large Language Model Serving with Layer-wise KV Cache Management
par: Xiong, Yi, et autres
Publié: (2024)
par: Xiong, Yi, et autres
Publié: (2024)
LAVa: Layer-wise KV Cache Eviction with Dynamic Budget Allocation
par: Shen, Yiqun, et autres
Publié: (2025)
par: Shen, Yiqun, et autres
Publié: (2025)
Documents similaires
-
Understanding the RoPE Extensions of Long-Context LLMs: An Attention Perspective
par: Zhong, Meizhi, et autres
Publié: (2024) -
SearchSkill: Teaching LLMs to Use Search Tools with Evolving Skill Banks
par: Hu, Jinchao, et autres
Publié: (2026) -
Agentic Tool Use in Large Language Models
par: Hu, Jinchao, et autres
Publié: (2026) -
Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity
par: Ma, Da, et autres
Publié: (2024) -
DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs
par: Zhou, Xiabin, et autres
Publié: (2024)