ZigZagkv: Dynamic KV Cache Compression for Long-context Modeling based on Layer Uncertainty
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhong, Meizhi, Liu, Xikai, Zhang, Chen, Lei, Yikun, Gao, Yan, Hu, Yao, Chen, Kehai, Zhang, Min |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Understanding the RoPE Extensions of Long-Context LLMs: An Attention Perspective
di: Zhong, Meizhi, et al.
Pubblicazione: (2024)
di: Zhong, Meizhi, et al.
Pubblicazione: (2024)
SearchSkill: Teaching LLMs to Use Search Tools with Evolving Skill Banks
di: Hu, Jinchao, et al.
Pubblicazione: (2026)
di: Hu, Jinchao, et al.
Pubblicazione: (2026)
Agentic Tool Use in Large Language Models
di: Hu, Jinchao, et al.
Pubblicazione: (2026)
di: Hu, Jinchao, et al.
Pubblicazione: (2026)
Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity
di: Ma, Da, et al.
Pubblicazione: (2024)
di: Ma, Da, et al.
Pubblicazione: (2024)
DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs
di: Zhou, Xiabin, et al.
Pubblicazione: (2024)
di: Zhou, Xiabin, et al.
Pubblicazione: (2024)
DecEx-RAG: Boosting Agentic Retrieval-Augmented Generation with Decision and Execution Optimization via Process Supervision
di: Leng, Yongqi, et al.
Pubblicazione: (2025)
di: Leng, Yongqi, et al.
Pubblicazione: (2025)
PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling
di: Cai, Zefan, et al.
Pubblicazione: (2024)
di: Cai, Zefan, et al.
Pubblicazione: (2024)
NestedKV: Nested Memory Routing for Long-Context KV Cache Compression
di: Chen, Hong, et al.
Pubblicazione: (2026)
di: Chen, Hong, et al.
Pubblicazione: (2026)
DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity
di: Hao, Jitai, et al.
Pubblicazione: (2026)
di: Hao, Jitai, et al.
Pubblicazione: (2026)
Adaptive Inner Speech-Text Alignment for LLM-based Speech Translation
di: Liu, Henglyu, et al.
Pubblicazione: (2025)
di: Liu, Henglyu, et al.
Pubblicazione: (2025)
LongFlow: Efficient KV Cache Compression for Reasoning Models
di: Su, Yi, et al.
Pubblicazione: (2026)
di: Su, Yi, et al.
Pubblicazione: (2026)
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
di: Xiao, Junbin, et al.
Pubblicazione: (2026)
di: Xiao, Junbin, et al.
Pubblicazione: (2026)
PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference
di: Yang, Dongjie, et al.
Pubblicazione: (2024)
di: Yang, Dongjie, et al.
Pubblicazione: (2024)
On the Hallucination in Simultaneous Machine Translation
di: Zhong, Meizhi, et al.
Pubblicazione: (2024)
di: Zhong, Meizhi, et al.
Pubblicazione: (2024)
MoDification: Mixture of Depths Made Easy
di: Zhang, Chen, et al.
Pubblicazione: (2024)
di: Zhang, Chen, et al.
Pubblicazione: (2024)
The Pitfalls of KV Cache Compression
di: Chen, Alex, et al.
Pubblicazione: (2025)
di: Chen, Alex, et al.
Pubblicazione: (2025)
StreamKV: Streaming Video Question-Answering with Segment-based KV Cache Retrieval and Compression
di: Chen, Yilong, et al.
Pubblicazione: (2025)
di: Chen, Yilong, et al.
Pubblicazione: (2025)
FIER: Fine-Grained and Efficient KV Cache Retrieval for Long-context LLM Inference
di: Wang, Dongwei, et al.
Pubblicazione: (2025)
di: Wang, Dongwei, et al.
Pubblicazione: (2025)
XQuant: Achieving Ultra-Low Bit KV Cache Quantization with Cross-Layer Compression
di: Yang, Haoqi, et al.
Pubblicazione: (2025)
di: Yang, Haoqi, et al.
Pubblicazione: (2025)
CaliDrop: KV Cache Compression with Calibration
di: Su, Yi, et al.
Pubblicazione: (2025)
di: Su, Yi, et al.
Pubblicazione: (2025)
ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
di: Liu, Xiang, et al.
Pubblicazione: (2025)
di: Liu, Xiang, et al.
Pubblicazione: (2025)
AttentionPredictor: Temporal Patterns Matter for KV Cache Compression
di: Yang, Qingyue, et al.
Pubblicazione: (2025)
di: Yang, Qingyue, et al.
Pubblicazione: (2025)
Palu: Compressing KV-Cache with Low-Rank Projection
di: Chang, Chi-Chih, et al.
Pubblicazione: (2024)
di: Chang, Chi-Chih, et al.
Pubblicazione: (2024)
Pyramid Cache: Layer-Adaptive KV Cache Compression with Signature-Based Cold Storage
di: Sergio dj
Pubblicazione: (2026)
di: Sergio dj
Pubblicazione: (2026)
Sparse Attention across Multiple-context KV Cache
di: Cao, Ziyi, et al.
Pubblicazione: (2025)
di: Cao, Ziyi, et al.
Pubblicazione: (2025)
R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
di: Cai, Zefan, et al.
Pubblicazione: (2025)
di: Cai, Zefan, et al.
Pubblicazione: (2025)
Moment-KV: Momentum-Based Decode-Time KV Cache Compression for Long Generation
di: Jana, Soumyadeep, et al.
Pubblicazione: (2026)
di: Jana, Soumyadeep, et al.
Pubblicazione: (2026)
Tutti: Making SSD-Backed KV Cache Practical for Long-Context LLM Serving
di: Qiu, Shi, et al.
Pubblicazione: (2026)
di: Qiu, Shi, et al.
Pubblicazione: (2026)
xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction
di: Chang, Chi-Chih, et al.
Pubblicazione: (2025)
di: Chang, Chi-Chih, et al.
Pubblicazione: (2025)
Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models
di: Ji, Yicheng, et al.
Pubblicazione: (2026)
di: Ji, Yicheng, et al.
Pubblicazione: (2026)
HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference
di: Shi, Zhiyuan, et al.
Pubblicazione: (2026)
di: Shi, Zhiyuan, et al.
Pubblicazione: (2026)
EVICPRESS: Joint KV-Cache Compression and Eviction for Efficient LLM Serving
di: Feng, Shaoting, et al.
Pubblicazione: (2025)
di: Feng, Shaoting, et al.
Pubblicazione: (2025)
ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration
di: Yan, Xianglong, et al.
Pubblicazione: (2025)
di: Yan, Xianglong, et al.
Pubblicazione: (2025)
HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference
di: Zeng, Bowen, et al.
Pubblicazione: (2026)
di: Zeng, Bowen, et al.
Pubblicazione: (2026)
DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference
di: Dehghanighobadi, Zahra, et al.
Pubblicazione: (2026)
di: Dehghanighobadi, Zahra, et al.
Pubblicazione: (2026)
Hold Onto That Thought: Assessing KV Cache Compression On Reasoning
di: Liu, Minghui, et al.
Pubblicazione: (2025)
di: Liu, Minghui, et al.
Pubblicazione: (2025)
Streaming Video Question-Answering with In-context Video KV-Cache Retrieval
di: Di, Shangzhe, et al.
Pubblicazione: (2025)
di: Di, Shangzhe, et al.
Pubblicazione: (2025)
LMCache: An Efficient KV Cache Layer for Enterprise-Scale LLM Inference
di: Liu, Yuhan, et al.
Pubblicazione: (2025)
di: Liu, Yuhan, et al.
Pubblicazione: (2025)
LayerKV: Optimizing Large Language Model Serving with Layer-wise KV Cache Management
di: Xiong, Yi, et al.
Pubblicazione: (2024)
di: Xiong, Yi, et al.
Pubblicazione: (2024)
LAVa: Layer-wise KV Cache Eviction with Dynamic Budget Allocation
di: Shen, Yiqun, et al.
Pubblicazione: (2025)
di: Shen, Yiqun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Understanding the RoPE Extensions of Long-Context LLMs: An Attention Perspective
di: Zhong, Meizhi, et al.
Pubblicazione: (2024) -
SearchSkill: Teaching LLMs to Use Search Tools with Evolving Skill Banks
di: Hu, Jinchao, et al.
Pubblicazione: (2026) -
Agentic Tool Use in Large Language Models
di: Hu, Jinchao, et al.
Pubblicazione: (2026) -
Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity
di: Ma, Da, et al.
Pubblicazione: (2024) -
DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs
di: Zhou, Xiabin, et al.
Pubblicazione: (2024)