MEDA: Dynamic KV Cache Allocation for Efficient Multimodal Long-Context Inference
Fuente:
arXiv
Guardado en:
| Autores principales: | Wan, Zhongwei, Shen, Hui, Wang, Xin, Liu, Che, Mai, Zheda, Zhang, Mi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference
por: Wan, Zhongwei, et al.
Publicado: (2024)
por: Wan, Zhongwei, et al.
Publicado: (2024)
MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference
por: Li, Kunxi, et al.
Publicado: (2025)
por: Li, Kunxi, et al.
Publicado: (2025)
Reformulating KV Cache Eviction Problem for Long-Context LLM Inference
por: Mai, Tho, et al.
Publicado: (2026)
por: Mai, Tho, et al.
Publicado: (2026)
Efficient Long-Context LLM Inference via KV Cache Clustering
por: Hu, Jie, et al.
Publicado: (2025)
por: Hu, Jie, et al.
Publicado: (2025)
ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
por: Liu, Xiang, et al.
Publicado: (2025)
por: Liu, Xiang, et al.
Publicado: (2025)
DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs
por: Zhou, Xiabin, et al.
Publicado: (2024)
por: Zhou, Xiabin, et al.
Publicado: (2024)
TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimization
por: Yao, Dingyu, et al.
Publicado: (2025)
por: Yao, Dingyu, et al.
Publicado: (2025)
KVDrive: A Holistic Multi-Tier KV Cache Management System for Long-Context LLM Inference
por: Lin, Jian, et al.
Publicado: (2026)
por: Lin, Jian, et al.
Publicado: (2026)
D2O: Dynamic Discriminative Operations for Efficient Long-Context Inference of Large Language Models
por: Wan, Zhongwei, et al.
Publicado: (2024)
por: Wan, Zhongwei, et al.
Publicado: (2024)
ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference
por: Sun, Hanshi, et al.
Publicado: (2024)
por: Sun, Hanshi, et al.
Publicado: (2024)
ZSMerge: Zero-Shot KV Cache Compression for Memory-Efficient Long-Context LLMs
por: Liu, Xin, et al.
Publicado: (2025)
por: Liu, Xin, et al.
Publicado: (2025)
DASH-KV: Accelerating Long-Context LLM Inference via Asymmetric KV Cache Hashing
por: Guo, Jinyu, et al.
Publicado: (2026)
por: Guo, Jinyu, et al.
Publicado: (2026)
HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference
por: Shi, Zhiyuan, et al.
Publicado: (2026)
por: Shi, Zhiyuan, et al.
Publicado: (2026)
FlowMM: Cross-Modal Information Flow Guided KV Cache Merging for Efficient Multimodal Context Inference
por: Li, Kunxi, et al.
Publicado: (2025)
por: Li, Kunxi, et al.
Publicado: (2025)
TokenSelect: Efficient Long-Context Inference and Length Extrapolation for LLMs via Dynamic Token-Level KV Cache Selection
por: Wu, Wei, et al.
Publicado: (2024)
por: Wu, Wei, et al.
Publicado: (2024)
DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference
por: Dehghanighobadi, Zahra, et al.
Publicado: (2026)
por: Dehghanighobadi, Zahra, et al.
Publicado: (2026)
OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference
por: Gu, Yuzhe, et al.
Publicado: (2025)
por: Gu, Yuzhe, et al.
Publicado: (2025)
EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction
por: Ji, Shiyu, et al.
Publicado: (2026)
por: Ji, Shiyu, et al.
Publicado: (2026)
Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference
por: Feng, Yuan, et al.
Publicado: (2024)
por: Feng, Yuan, et al.
Publicado: (2024)
NestedKV: Nested Memory Routing for Long-Context KV Cache Compression
por: Chen, Hong, et al.
Publicado: (2026)
por: Chen, Hong, et al.
Publicado: (2026)
XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference
por: Li, Weizhuo, et al.
Publicado: (2024)
por: Li, Weizhuo, et al.
Publicado: (2024)
Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity
por: Ma, Da, et al.
Publicado: (2024)
por: Ma, Da, et al.
Publicado: (2024)
TTKV: Temporal-Tiered KV Cache for Long-Context LLM Inference
por: Dzikanyanga, Gradwell, et al.
Publicado: (2026)
por: Dzikanyanga, Gradwell, et al.
Publicado: (2026)
FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing
por: Tang, Zihan, et al.
Publicado: (2026)
por: Tang, Zihan, et al.
Publicado: (2026)
KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference
por: Nadali, Alireza, et al.
Publicado: (2026)
por: Nadali, Alireza, et al.
Publicado: (2026)
RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression
por: Behnam, Payman, et al.
Publicado: (2025)
por: Behnam, Payman, et al.
Publicado: (2025)
KeepKV: Achieving Periodic Lossless KV Cache Compression for Efficient LLM Inference
por: Tian, Yuxuan, et al.
Publicado: (2025)
por: Tian, Yuxuan, et al.
Publicado: (2025)
SVD-LLM V2: Optimizing Singular Value Truncation for Large Language Model Compression
por: Wang, Xin, et al.
Publicado: (2025)
por: Wang, Xin, et al.
Publicado: (2025)
Exploring Fine-Tuning for In-Context Retrieval and Efficient KV-Caching in Long-Context Language Models
por: Molfese, Francesco Maria, et al.
Publicado: (2026)
por: Molfese, Francesco Maria, et al.
Publicado: (2026)
IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference
por: Yang, Xintong, et al.
Publicado: (2026)
por: Yang, Xintong, et al.
Publicado: (2026)
LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models
por: Shi, Dachuan, et al.
Publicado: (2025)
por: Shi, Dachuan, et al.
Publicado: (2025)
CSKV: Training-Efficient Channel Shrinking for KV Cache in Long-Context Scenarios
por: Wang, Luning, et al.
Publicado: (2024)
por: Wang, Luning, et al.
Publicado: (2024)
WindowKV: Task-Adaptive Group-Wise KV Cache Window Selection for Efficient LLM Inference
por: Zuo, Youhui, et al.
Publicado: (2025)
por: Zuo, Youhui, et al.
Publicado: (2025)
LLMs Know What to Drop: Self-Attention Guided KV Cache Eviction for Efficient Long-Context Inference
por: Wang, Guangtao, et al.
Publicado: (2025)
por: Wang, Guangtao, et al.
Publicado: (2025)
MEIT: Multimodal Electrocardiogram Instruction Tuning on Large Language Models for Report Generation
por: Wan, Zhongwei, et al.
Publicado: (2024)
por: Wan, Zhongwei, et al.
Publicado: (2024)
FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
por: Liu, Guangda, et al.
Publicado: (2025)
por: Liu, Guangda, et al.
Publicado: (2025)
ParisKV: Fast and Drift-Robust KV-Cache Retrieval for Long-Context LLMs
por: Qi, Yanlin, et al.
Publicado: (2026)
por: Qi, Yanlin, et al.
Publicado: (2026)
DynSplit-KV: Dynamic Semantic Splitting for KVCache Compression in Efficient Long-Context LLM Inference
por: Ye, Jiancai, et al.
Publicado: (2026)
por: Ye, Jiancai, et al.
Publicado: (2026)
SCBench: A KV Cache-Centric Analysis of Long-Context Methods
por: Li, Yucheng, et al.
Publicado: (2024)
por: Li, Yucheng, et al.
Publicado: (2024)
When Hidden States Drift: Can KV Caches Rescue Long-Range Speculative Decoding?
por: Liu, Tianyu, et al.
Publicado: (2026)
por: Liu, Tianyu, et al.
Publicado: (2026)
Ejemplares similares
-
LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference
por: Wan, Zhongwei, et al.
Publicado: (2024) -
MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference
por: Li, Kunxi, et al.
Publicado: (2025) -
Reformulating KV Cache Eviction Problem for Long-Context LLM Inference
por: Mai, Tho, et al.
Publicado: (2026) -
Efficient Long-Context LLM Inference via KV Cache Clustering
por: Hu, Jie, et al.
Publicado: (2025) -
ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
por: Liu, Xiang, et al.
Publicado: (2025)