MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Li, Kunxi, Jiang, Zhonghua, Shen, Zhouzhou, Wang, Zhaode, Lv, Chengfei, Zhang, Shengyu, Wu, Fan, Wu, Fei
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866911013154062336
author Li, Kunxi
Jiang, Zhonghua
Shen, Zhouzhou
Wang, Zhaode
Lv, Chengfei
Zhang, Shengyu
Wu, Fan
Wu, Fei
author_facet Li, Kunxi
Jiang, Zhonghua
Shen, Zhouzhou
Wang, Zhaode
Lv, Chengfei
Zhang, Shengyu
Wu, Fan
Wu, Fei
contents This paper introduces MadaKV, a modality-adaptive key-value (KV) cache eviction strategy designed to enhance the efficiency of multimodal large language models (MLLMs) in long-context inference. In multimodal scenarios, attention heads exhibit varying preferences for different modalities, resulting in significant disparities in modality importance across attention heads. Traditional KV cache eviction methods, which are tailored for unimodal settings, fail to capture modality-specific information, thereby yielding suboptimal performance. MadaKV addresses these challenges through two key components: modality preference adaptation and hierarchical compression compensation. By dynamically sensing modality information within attention heads and adaptively retaining critical tokens, MadaKV achieves substantial reductions in KV cache memory footprint and model inference decoding latency (1.3 to 1.5 times improvement) while maintaining high accuracy across various multimodal long-context tasks. Extensive experiments on representative MLLMs and the MileBench benchmark demonstrate the effectiveness of MadaKV compared to existing KV cache eviction methods.
format Preprint
id arxiv_https___arxiv_org_abs_2506_15724
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference
Li, Kunxi
Jiang, Zhonghua
Shen, Zhouzhou
Wang, Zhaode
Lv, Chengfei
Zhang, Shengyu
Wu, Fan
Wu, Fei
Machine Learning
Artificial Intelligence
Computation and Language
This paper introduces MadaKV, a modality-adaptive key-value (KV) cache eviction strategy designed to enhance the efficiency of multimodal large language models (MLLMs) in long-context inference. In multimodal scenarios, attention heads exhibit varying preferences for different modalities, resulting in significant disparities in modality importance across attention heads. Traditional KV cache eviction methods, which are tailored for unimodal settings, fail to capture modality-specific information, thereby yielding suboptimal performance. MadaKV addresses these challenges through two key components: modality preference adaptation and hierarchical compression compensation. By dynamically sensing modality information within attention heads and adaptively retaining critical tokens, MadaKV achieves substantial reductions in KV cache memory footprint and model inference decoding latency (1.3 to 1.5 times improvement) while maintaining high accuracy across various multimodal long-context tasks. Extensive experiments on representative MLLMs and the MileBench benchmark demonstrate the effectiveness of MadaKV compared to existing KV cache eviction methods.
title MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference
topic Machine Learning
Artificial Intelligence
Computation and Language
url https://arxiv.org/abs/2506.15724