Guardado en:
| Autores principales: | Liang, Manlai, Zhang, JiaMing, Li, Xiong, Li, Jinlong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2504.04704 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
por: Zhang, Haowei, et al.
Publicado: (2026)
por: Zhang, Haowei, et al.
Publicado: (2026)
Lag-Relative Sparse Attention In Long Context Training
por: Liang, Manlai, et al.
Publicado: (2025)
por: Liang, Manlai, et al.
Publicado: (2025)
VL-Cache: Sparsity and Modality-Aware KV Cache Compression for Vision-Language Model Inference Acceleration
por: Tu, Dezhan, et al.
Publicado: (2024)
por: Tu, Dezhan, et al.
Publicado: (2024)
Revisiting Multimodal KV Cache Compression: A Frequency-Domain-Guided Outlier-KV-Aware Approach
por: Yang, Yaoxin, et al.
Publicado: (2025)
por: Yang, Yaoxin, et al.
Publicado: (2025)
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
por: Xiao, Junbin, et al.
Publicado: (2026)
por: Xiao, Junbin, et al.
Publicado: (2026)
KV-Efficient VLA: A Method to Speed up Vision Language Models with RNN-Gated Chunked KV Cache
por: Xu, Wanshun, et al.
Publicado: (2025)
por: Xu, Wanshun, et al.
Publicado: (2025)
STaR-KV: Spatio-Temporal Adaptive Re-weighting for KV Cache Compression in GUI Vision-Language Models
por: Han, Yuhang, et al.
Publicado: (2026)
por: Han, Yuhang, et al.
Publicado: (2026)
Cross-Self KV Cache Pruning for Efficient Vision-Language Inference
por: Pei, Xiaohuan, et al.
Publicado: (2024)
por: Pei, Xiaohuan, et al.
Publicado: (2024)
Make Your LVLM KV Cache More Lightweight
por: Chen, Xihao, et al.
Publicado: (2026)
por: Chen, Xihao, et al.
Publicado: (2026)
StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding
por: Yang, Yanlai, et al.
Publicado: (2025)
por: Yang, Yanlai, et al.
Publicado: (2025)
KVCapsule: Efficient Sequential KV Cache Compression for Vision-Language Models with Asymmetric Redundancy
por: Huang, Yingbing, et al.
Publicado: (2026)
por: Huang, Yingbing, et al.
Publicado: (2026)
AirCache: Activating Inter-modal Relevancy KV Cache Compression for Efficient Large Vision-Language Model Inference
por: Huang, Kai, et al.
Publicado: (2025)
por: Huang, Kai, et al.
Publicado: (2025)
Efficient Long-Horizon GUI Agents via Training-Free KV Cache Compression
por: Zhou, Bowen, et al.
Publicado: (2026)
por: Zhou, Bowen, et al.
Publicado: (2026)
VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion
por: Yesiltepe, Hidir, et al.
Publicado: (2026)
por: Yesiltepe, Hidir, et al.
Publicado: (2026)
PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling
por: Cai, Zefan, et al.
Publicado: (2024)
por: Cai, Zefan, et al.
Publicado: (2024)
PruneHal: Reducing Hallucinations in Multi-modal Large Language Models through Adaptive KV Cache Pruning
por: Sun, Fengyuan, et al.
Publicado: (2025)
por: Sun, Fengyuan, et al.
Publicado: (2025)
LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference
por: Wan, Zhongwei, et al.
Publicado: (2024)
por: Wan, Zhongwei, et al.
Publicado: (2024)
TurboRAG: Accelerating Retrieval-Augmented Generation with Precomputed KV Caches for Chunked Text
por: Lu, Songshuo, et al.
Publicado: (2024)
por: Lu, Songshuo, et al.
Publicado: (2024)
Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models
por: Li, Zhang, et al.
Publicado: (2023)
por: Li, Zhang, et al.
Publicado: (2023)
WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization
por: Tao, Wei, et al.
Publicado: (2026)
por: Tao, Wei, et al.
Publicado: (2026)
AMS-KV: Adaptive KV Caching in Multi-Scale Visual Autoregressive Transformers
por: Xu, Boxun, et al.
Publicado: (2025)
por: Xu, Boxun, et al.
Publicado: (2025)
CompressKV: Semantic Retrieval Heads Know What Tokens are Not Important Before Generation
por: Lin, Xiaolin, et al.
Publicado: (2025)
por: Lin, Xiaolin, et al.
Publicado: (2025)
FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing
por: Tang, Zihan, et al.
Publicado: (2026)
por: Tang, Zihan, et al.
Publicado: (2026)
LFTR: Learning-Free Token Reduction for Multimodal Large Language Models
por: Zhao, Zihui, et al.
Publicado: (2025)
por: Zhao, Zihui, et al.
Publicado: (2025)
R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
por: Cai, Zefan, et al.
Publicado: (2025)
por: Cai, Zefan, et al.
Publicado: (2025)
Improving Diffusion Posterior Samplers with Lagged Temporal Corrections for Image Restoration
por: Evangelista, Davide, et al.
Publicado: (2026)
por: Evangelista, Davide, et al.
Publicado: (2026)
Test-Time Training with KV Binding Is Secretly Linear Attention
por: Liu, Junchen, et al.
Publicado: (2026)
por: Liu, Junchen, et al.
Publicado: (2026)
Where is the multimodal goal post? On the Ability of Foundation Models to Recognize Contextually Important Moments
por: Surikuchi, Aditya K, et al.
Publicado: (2026)
por: Surikuchi, Aditya K, et al.
Publicado: (2026)
Tell, Don't Show!: Language Guidance Eases Transfer Across Domains in Images and Videos
por: Kalluri, Tarun, et al.
Publicado: (2024)
por: Kalluri, Tarun, et al.
Publicado: (2024)
On the Limits of Token Reduction for Efficient Unified Vision Language Training
por: Chen, Siyi, et al.
Publicado: (2026)
por: Chen, Siyi, et al.
Publicado: (2026)
Dual-Signal Adaptive KV-Cache Optimization for Long-Form Video Understanding in Vision-Language Models
por: Sai, Vishnu, et al.
Publicado: (2026)
por: Sai, Vishnu, et al.
Publicado: (2026)
StreamKV: Streaming Video Question-Answering with Segment-based KV Cache Retrieval and Compression
por: Chen, Yilong, et al.
Publicado: (2025)
por: Chen, Yilong, et al.
Publicado: (2025)
Task-Aware KV Compression For Cost-Effective Long Video Understanding
por: Qin, Minghao, et al.
Publicado: (2025)
por: Qin, Minghao, et al.
Publicado: (2025)
Text or Image? What is More Important in Cross-Domain Generalization Capabilities of Hate Meme Detection Models?
por: Aggarwal, Piush, et al.
Publicado: (2024)
por: Aggarwal, Piush, et al.
Publicado: (2024)
AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning
por: Zhong, Yiwu, et al.
Publicado: (2024)
por: Zhong, Yiwu, et al.
Publicado: (2024)
Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models
por: Ji, Yicheng, et al.
Publicado: (2026)
por: Ji, Yicheng, et al.
Publicado: (2026)
Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification
por: Qin, Minghao, et al.
Publicado: (2025)
por: Qin, Minghao, et al.
Publicado: (2025)
From Pixels to Tokens: Byte-Pair Encoding on Quantized Visual Modalities
por: Zhang, Wanpeng, et al.
Publicado: (2024)
por: Zhang, Wanpeng, et al.
Publicado: (2024)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
por: Tang, Zicong, et al.
Publicado: (2025)
por: Tang, Zicong, et al.
Publicado: (2025)
LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression
por: Hu, Lianyu, et al.
Publicado: (2025)
por: Hu, Lianyu, et al.
Publicado: (2025)
Ejemplares similares
-
HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
por: Zhang, Haowei, et al.
Publicado: (2026) -
Lag-Relative Sparse Attention In Long Context Training
por: Liang, Manlai, et al.
Publicado: (2025) -
VL-Cache: Sparsity and Modality-Aware KV Cache Compression for Vision-Language Model Inference Acceleration
por: Tu, Dezhan, et al.
Publicado: (2024) -
Revisiting Multimodal KV Cache Compression: A Frequency-Domain-Guided Outlier-KV-Aware Approach
por: Yang, Yaoxin, et al.
Publicado: (2025) -
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
por: Xiao, Junbin, et al.
Publicado: (2026)