Dual-Signal Adaptive KV-Cache Optimization for Long-Form Video Understanding in Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sai, Vishnu, Sai, Dheeraj, B, Srinath, Varma, Girish, Shukla, Priyesh |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VL-Cache: Sparsity and Modality-Aware KV Cache Compression for Vision-Language Model Inference Acceleration
par: Tu, Dezhan, et autres
Publié: (2024)
par: Tu, Dezhan, et autres
Publié: (2024)
PEVLM: Parallel Encoding for Vision-Language Models
par: Kang, Letian, et autres
Publié: (2025)
par: Kang, Letian, et autres
Publié: (2025)
ProfilingAgent: Profiling-Guided Agentic Reasoning for Adaptive Model Optimization
par: Jafari, Sadegh, et autres
Publié: (2025)
par: Jafari, Sadegh, et autres
Publié: (2025)
Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models
par: Cheng, Hao, et autres
Publié: (2024)
par: Cheng, Hao, et autres
Publié: (2024)
Decouple and Cache: KV Cache Construction for Streaming Video Understanding
par: Pang, Zhanzhong, et autres
Publié: (2026)
par: Pang, Zhanzhong, et autres
Publié: (2026)
StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding
par: Yang, Yanlai, et autres
Publié: (2025)
par: Yang, Yanlai, et autres
Publié: (2025)
Polymorph: Energy-Efficient Multi-Label Classification for Video Streams on Embedded Devices
par: Ghafouri, Saeid, et autres
Publié: (2025)
par: Ghafouri, Saeid, et autres
Publié: (2025)
FastCache: Fast Caching for Diffusion Transformer Through Learnable Linear Approximation
par: Liu, Dong, et autres
Publié: (2025)
par: Liu, Dong, et autres
Publié: (2025)
CPU Optimization of a Monocular 3D Biomechanics Pipeline for Low-Resource Deployment
par: Zhang, Yan, et autres
Publié: (2026)
par: Zhang, Yan, et autres
Publié: (2026)
GPU-Accelerated INT8 Quantization for KV Cache Compression in Large Language Models
par: Taneja, Maanas, et autres
Publié: (2026)
par: Taneja, Maanas, et autres
Publié: (2026)
TideGS: Scalable Training of Over One Billion 3D Gaussian Splatting Primitives via Out-of-Core Optimization
par: Zhong, Chonghao, et autres
Publié: (2026)
par: Zhong, Chonghao, et autres
Publié: (2026)
VLM in a flash: I/O-Efficient Sparsification of Vision-Language Model via Neuron Chunking
par: Yang, Kichang, et autres
Publié: (2025)
par: Yang, Kichang, et autres
Publié: (2025)
Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models
par: Liu, Xuyang, et autres
Publié: (2025)
par: Liu, Xuyang, et autres
Publié: (2025)
STaR-KV: Spatio-Temporal Adaptive Re-weighting for KV Cache Compression in GUI Vision-Language Models
par: Han, Yuhang, et autres
Publié: (2026)
par: Han, Yuhang, et autres
Publié: (2026)
PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation
par: Wang, Ao, et autres
Publié: (2024)
par: Wang, Ao, et autres
Publié: (2024)
CacheFlow: Compressive Streaming Memory for Efficient Long-Form Video Understanding
par: Patel, Shrenik, et autres
Publié: (2025)
par: Patel, Shrenik, et autres
Publié: (2025)
Semantic-Guided 3D Gaussian Splatting for Transient Object Removal
par: Prabakaran, Aditi, et autres
Publié: (2026)
par: Prabakaran, Aditi, et autres
Publié: (2026)
Neural Architecture Search of Hybrid Models for NPU-CIM Heterogeneous AR/VR Devices
par: Zhao, Yiwei, et autres
Publié: (2024)
par: Zhao, Yiwei, et autres
Publié: (2024)
A Hitchhiker's Guide to Understanding Performances of Two-Class Classifiers
par: Halin, Anaïs, et autres
Publié: (2024)
par: Halin, Anaïs, et autres
Publié: (2024)
Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models
par: Ma, Martin Q., et autres
Publié: (2026)
par: Ma, Martin Q., et autres
Publié: (2026)
A Study on Inference Latency for Vision Transformers on Mobile Devices
par: Li, Zhuojin, et autres
Publié: (2025)
par: Li, Zhuojin, et autres
Publié: (2025)
CRAM: Large-scale Video Continual Learning with Bootstrapped Compression
par: Mall, Shivani, et autres
Publié: (2025)
par: Mall, Shivani, et autres
Publié: (2025)
ALISA: Accelerating Large Language Model Inference via Sparsity-Aware KV Caching
par: Zhao, Youpeng, et autres
Publié: (2024)
par: Zhao, Youpeng, et autres
Publié: (2024)
SparseX: Efficient Segment-Level KV Cache Sharing for Interleaved LLM Serving
par: Zhang, Quqing, et autres
Publié: (2026)
par: Zhang, Quqing, et autres
Publié: (2026)
Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models
par: Ji, Yicheng, et autres
Publié: (2026)
par: Ji, Yicheng, et autres
Publié: (2026)
AccKV: Towards Efficient Audio-Video LLMs Inference via Adaptive-Focusing and Cross-Calibration KV Cache Optimization
par: Jiang, Zhonghua, et autres
Publié: (2025)
par: Jiang, Zhonghua, et autres
Publié: (2025)
ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression
par: Liu, Guangda, et autres
Publié: (2024)
par: Liu, Guangda, et autres
Publié: (2024)
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
par: Xiao, Junbin, et autres
Publié: (2026)
par: Xiao, Junbin, et autres
Publié: (2026)
Optimizing Methane Detection On Board Satellites: Speed, Accuracy, and Low-Power Solutions for Resource-Constrained Hardware
par: Herec, Jonáš, et autres
Publié: (2025)
par: Herec, Jonáš, et autres
Publié: (2025)
Performance is not All You Need: Sustainability Considerations for Algorithms
par: Li, Xiang, et autres
Publié: (2025)
par: Li, Xiang, et autres
Publié: (2025)
A Methodology to Evaluate Strategies Predicting Rankings on Unseen Domains
par: Piérard, Sébastien, et autres
Publié: (2025)
par: Piérard, Sébastien, et autres
Publié: (2025)
Enhancing Traffic Sign Recognition On The Performance Based On Yolov8
par: Ibrahim, Baba, et autres
Publié: (2025)
par: Ibrahim, Baba, et autres
Publié: (2025)
A Diffusion-Based Framework for Configurable and Realistic Multi-Storage Trace Generation
par: Kim, Seohyun, et autres
Publié: (2025)
par: Kim, Seohyun, et autres
Publié: (2025)
Resource-Efficient RGB-Only Action Recognition for Edge Deployment
par: Yoon, Dongsik, et autres
Publié: (2026)
par: Yoon, Dongsik, et autres
Publié: (2026)
Towards Efficient Multi-Scale Deformable Attention on NPU
par: Huang, Chenghuan, et autres
Publié: (2025)
par: Huang, Chenghuan, et autres
Publié: (2025)
TakuNet: an Energy-Efficient CNN for Real-Time Inference on Embedded UAV systems in Emergency Response Scenarios
par: Rossi, Daniel, et autres
Publié: (2025)
par: Rossi, Daniel, et autres
Publié: (2025)
ConvBench: A Comprehensive Benchmark for 2D Convolution Primitive Evaluation
par: Alvarenga, Lucas, et autres
Publié: (2024)
par: Alvarenga, Lucas, et autres
Publié: (2024)
AMS-KV: Adaptive KV Caching in Multi-Scale Visual Autoregressive Transformers
par: Xu, Boxun, et autres
Publié: (2025)
par: Xu, Boxun, et autres
Publié: (2025)
Class Confidence Aware Reweighting for Long Tailed Learning
par: Jagati, Brainard Philemon, et autres
Publié: (2026)
par: Jagati, Brainard Philemon, et autres
Publié: (2026)
HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
par: Zhang, Haowei, et autres
Publié: (2026)
par: Zhang, Haowei, et autres
Publié: (2026)
Documents similaires
-
VL-Cache: Sparsity and Modality-Aware KV Cache Compression for Vision-Language Model Inference Acceleration
par: Tu, Dezhan, et autres
Publié: (2024) -
PEVLM: Parallel Encoding for Vision-Language Models
par: Kang, Letian, et autres
Publié: (2025) -
ProfilingAgent: Profiling-Guided Agentic Reasoning for Adaptive Model Optimization
par: Jafari, Sadegh, et autres
Publié: (2025) -
Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models
par: Cheng, Hao, et autres
Publié: (2024) -
Decouple and Cache: KV Cache Construction for Streaming Video Understanding
par: Pang, Zhanzhong, et autres
Publié: (2026)