LVC: A Lightweight Compression Framework for Enhancing VLMs in Long Video Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Ziyi, Wu, Haoran, Rong, Yiming, Jiang, Deyang, Zhang, Yixin, Zhao, Yunlong, Xu, Shuang, XU, Bo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Linear Scaling Video VLMs for Long Video Understanding
por: Eyzaguirre, Cristobal, et al.
Publicado: (2026)
por: Eyzaguirre, Cristobal, et al.
Publicado: (2026)
Speech-Aware Long Context Pruning and Integration for Contextualized Automatic Speech Recognition
por: Rong, Yiming, et al.
Publicado: (2025)
por: Rong, Yiming, et al.
Publicado: (2025)
LVC-LGMC: Joint Local and Global Motion Compensation for Learned Video Compression
por: Jiang, Wei, et al.
Publicado: (2024)
por: Jiang, Wei, et al.
Publicado: (2024)
Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding
por: Liu, Xiangrui, et al.
Publicado: (2025)
por: Liu, Xiangrui, et al.
Publicado: (2025)
LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
por: Shen, Xiaoqian, et al.
Publicado: (2024)
por: Shen, Xiaoqian, et al.
Publicado: (2024)
NeuralLVC: Neural Lossless Video Compression via Masked Diffusion with Temporal Conditioning
por: Uricchio, Tiberio, et al.
Publicado: (2026)
por: Uricchio, Tiberio, et al.
Publicado: (2026)
Uni-LVC: A Unified Method for Intra- and Inter-Mode Learned Video Compression
por: Zhang, Yichi, et al.
Publicado: (2026)
por: Zhang, Yichi, et al.
Publicado: (2026)
Video-QTR: Query-Driven Temporal Reasoning Framework for Lightweight Video Understanding
por: Zhao, Xinkui, et al.
Publicado: (2025)
por: Zhao, Xinkui, et al.
Publicado: (2025)
Task-Aware KV Compression For Cost-Effective Long Video Understanding
por: Qin, Minghao, et al.
Publicado: (2025)
por: Qin, Minghao, et al.
Publicado: (2025)
FiLA-Video: Spatio-Temporal Compression for Fine-Grained Long Video Understanding
por: Guo, Yanan, et al.
Publicado: (2025)
por: Guo, Yanan, et al.
Publicado: (2025)
Enhancing Long Video Understanding via Hierarchical Event-Based Memory
por: Cheng, Dingxin, et al.
Publicado: (2024)
por: Cheng, Dingxin, et al.
Publicado: (2024)
LightZeroNav: Zero-Shot Vision Language Navigation in Continuous Environments Based on Lightweight VLMs
por: Luo, Kun, et al.
Publicado: (2026)
por: Luo, Kun, et al.
Publicado: (2026)
Stateful Token Reduction for Long-Video Hybrid VLMs
por: Jiang, Jindong, et al.
Publicado: (2026)
por: Jiang, Jindong, et al.
Publicado: (2026)
Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding
por: Wang, Zheng, et al.
Publicado: (2026)
por: Wang, Zheng, et al.
Publicado: (2026)
Long Story Short: Disentangling Compositionality and Long-Caption Understanding in Contrastive VLMs
por: Salazar, Israfel, et al.
Publicado: (2025)
por: Salazar, Israfel, et al.
Publicado: (2025)
EEA: Exploration-Exploitation Agent for Long Video Understanding
por: Yang, Te, et al.
Publicado: (2025)
por: Yang, Te, et al.
Publicado: (2025)
LoViC: Efficient Long Video Generation with Context Compression
por: Jiang, Jiaxiu, et al.
Publicado: (2025)
por: Jiang, Jiaxiu, et al.
Publicado: (2025)
VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation
por: Ma, Wentao, et al.
Publicado: (2025)
por: Ma, Wentao, et al.
Publicado: (2025)
OmniVid: A Generative Framework for Universal Video Understanding
por: Wang, Junke, et al.
Publicado: (2024)
por: Wang, Junke, et al.
Publicado: (2024)
A Unified Framework for Human-centric Point Cloud Video Understanding
por: Xu, Yiteng, et al.
Publicado: (2024)
por: Xu, Yiteng, et al.
Publicado: (2024)
StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding
por: Wang, Junxi, et al.
Publicado: (2026)
por: Wang, Junxi, et al.
Publicado: (2026)
Question-guided Visual Compression with Memory Feedback for Long-Term Video Understanding
por: Yamao, Sosuke, et al.
Publicado: (2026)
por: Yamao, Sosuke, et al.
Publicado: (2026)
CacheFlow: Compressive Streaming Memory for Efficient Long-Form Video Understanding
por: Patel, Shrenik, et al.
Publicado: (2025)
por: Patel, Shrenik, et al.
Publicado: (2025)
Towards Lossless Ultimate Vision Token Compression for VLMs
por: Zheng, Dehua, et al.
Publicado: (2025)
por: Zheng, Dehua, et al.
Publicado: (2025)
Brick-Diffusion: Generating Long Videos with Brick-to-Wall Denoising
por: Yuan, Yunlong, et al.
Publicado: (2025)
por: Yuan, Yunlong, et al.
Publicado: (2025)
FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding
por: Xie, Yiweng, et al.
Publicado: (2026)
por: Xie, Yiweng, et al.
Publicado: (2026)
Benchmarking and Enhancing VLM for Compressed Image Understanding
por: Zhang, Zifu, et al.
Publicado: (2025)
por: Zhang, Zifu, et al.
Publicado: (2025)
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
por: Lan, Xiaohan, et al.
Publicado: (2024)
por: Lan, Xiaohan, et al.
Publicado: (2024)
Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding
por: Shu, Yan, et al.
Publicado: (2024)
por: Shu, Yan, et al.
Publicado: (2024)
Towards Event-oriented Long Video Understanding
por: Du, Yifan, et al.
Publicado: (2024)
por: Du, Yifan, et al.
Publicado: (2024)
Controllable Generative Video Compression
por: Ding, Ding, et al.
Publicado: (2026)
por: Ding, Ding, et al.
Publicado: (2026)
VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement Learning
por: Zhang, Xuanyu, et al.
Publicado: (2025)
por: Zhang, Xuanyu, et al.
Publicado: (2025)
METok: Multi-Stage Event-based Token Compression for Efficient Long Video Understanding
por: Wang, Mengyue, et al.
Publicado: (2025)
por: Wang, Mengyue, et al.
Publicado: (2025)
SAVEn-Vid: Synergistic Audio-Visual Integration for Enhanced Understanding in Long Video Context
por: Li, Jungang, et al.
Publicado: (2024)
por: Li, Jungang, et al.
Publicado: (2024)
E-VRAG: Enhancing Long Video Understanding with Resource-Efficient Retrieval Augmented Generation
por: Xu, Zeyu, et al.
Publicado: (2025)
por: Xu, Zeyu, et al.
Publicado: (2025)
VideoASMR-Bench: Can AI-Generated ASMR Videos Fool VLMs and Humans?
por: Wang, Jiaqi, et al.
Publicado: (2025)
por: Wang, Jiaqi, et al.
Publicado: (2025)
MLVU: Benchmarking Multi-task Long Video Understanding
por: Zhou, Junjie, et al.
Publicado: (2024)
por: Zhou, Junjie, et al.
Publicado: (2024)
Generative Frame Sampler for Long Video Understanding
por: Yao, Linli, et al.
Publicado: (2025)
por: Yao, Linli, et al.
Publicado: (2025)
TAR-TVG: Enhancing VLMs with Timestamp Anchor-Constrained Reasoning for Temporal Video Grounding
por: Guo, Chaohong, et al.
Publicado: (2025)
por: Guo, Chaohong, et al.
Publicado: (2025)
UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation
por: Wang, Ziyi, et al.
Publicado: (2026)
por: Wang, Ziyi, et al.
Publicado: (2026)
Ejemplares similares
-
Linear Scaling Video VLMs for Long Video Understanding
por: Eyzaguirre, Cristobal, et al.
Publicado: (2026) -
Speech-Aware Long Context Pruning and Integration for Contextualized Automatic Speech Recognition
por: Rong, Yiming, et al.
Publicado: (2025) -
LVC-LGMC: Joint Local and Global Motion Compensation for Learned Video Compression
por: Jiang, Wei, et al.
Publicado: (2024) -
Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding
por: Liu, Xiangrui, et al.
Publicado: (2025) -
LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
por: Shen, Xiaoqian, et al.
Publicado: (2024)