Linear Scaling Video VLMs for Long Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Eyzaguirre, Cristobal, Wu, Jiajun, Niebles, Juan Carlos |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Understanding Complexity in VideoQA via Visual Program Generation
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2025)
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2025)
T*: Re-thinking Temporal Search for Long-Form Video Understanding
di: Ye, Jinhui, et al.
Pubblicazione: (2025)
di: Ye, Jinhui, et al.
Pubblicazione: (2025)
Streaming Detection of Queried Event Start
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2024)
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2024)
IKEA Manuals at Work: 4D Grounding of Assembly Instructions on Internet Videos
di: Liu, Yunong, et al.
Pubblicazione: (2024)
di: Liu, Yunong, et al.
Pubblicazione: (2024)
HourVideo: 1-Hour Video-Language Understanding
di: Chandrasegaran, Keshigeyan, et al.
Pubblicazione: (2024)
di: Chandrasegaran, Keshigeyan, et al.
Pubblicazione: (2024)
LVC: A Lightweight Compression Framework for Enhancing VLMs in Long Video Understanding
di: Wang, Ziyi, et al.
Pubblicazione: (2025)
di: Wang, Ziyi, et al.
Pubblicazione: (2025)
Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding
di: Wang, Ziyang, et al.
Pubblicazione: (2025)
di: Wang, Ziyang, et al.
Pubblicazione: (2025)
AdaVid: Adaptive Video-Language Pretraining
di: Patel, Chaitanya, et al.
Pubblicazione: (2025)
di: Patel, Chaitanya, et al.
Pubblicazione: (2025)
Unleashing Hour-Scale Video Training for Long Video-Language Understanding
di: Lin, Jingyang, et al.
Pubblicazione: (2025)
di: Lin, Jingyang, et al.
Pubblicazione: (2025)
SurfPhase: 3D Interfacial Dynamics in Two-Phase Flows from Sparse Videos
di: Gao, Yue, et al.
Pubblicazione: (2026)
di: Gao, Yue, et al.
Pubblicazione: (2026)
Autoregressive Flow Matching for Motion Prediction
di: Xie, Johnathan, et al.
Pubblicazione: (2025)
di: Xie, Johnathan, et al.
Pubblicazione: (2025)
Taming generative video models for zero-shot optical flow extraction
di: Kim, Seungwoo, et al.
Pubblicazione: (2025)
di: Kim, Seungwoo, et al.
Pubblicazione: (2025)
VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
di: Yin, Yufei, et al.
Pubblicazione: (2025)
di: Yin, Yufei, et al.
Pubblicazione: (2025)
Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding
di: Shu, Yan, et al.
Pubblicazione: (2024)
di: Shu, Yan, et al.
Pubblicazione: (2024)
Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos
di: Fei, Jiajun, et al.
Pubblicazione: (2024)
di: Fei, Jiajun, et al.
Pubblicazione: (2024)
Stateful Token Reduction for Long-Video Hybrid VLMs
di: Jiang, Jindong, et al.
Pubblicazione: (2026)
di: Jiang, Jindong, et al.
Pubblicazione: (2026)
ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding
di: Ma, David, et al.
Pubblicazione: (2025)
di: Ma, David, et al.
Pubblicazione: (2025)
Video Token Merging for Long-form Video Understanding
di: Lee, Seon-Ho, et al.
Pubblicazione: (2024)
di: Lee, Seon-Ho, et al.
Pubblicazione: (2024)
VideoASMR-Bench: Can AI-Generated ASMR Videos Fool VLMs and Humans?
di: Wang, Jiaqi, et al.
Pubblicazione: (2025)
di: Wang, Jiaqi, et al.
Pubblicazione: (2025)
VideoPro: Adaptive Program Reasoning for Long Video Understanding
di: Li, Chenglin, et al.
Pubblicazione: (2025)
di: Li, Chenglin, et al.
Pubblicazione: (2025)
Long Video Understanding with Learnable Retrieval in Video-Language Models
di: Xu, Jiaqi, et al.
Pubblicazione: (2023)
di: Xu, Jiaqi, et al.
Pubblicazione: (2023)
VideoLucy: Deep Memory Backtracking for Long Video Understanding
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
DrVideo: Document Retrieval Based Long Video Understanding
di: Ma, Ziyu, et al.
Pubblicazione: (2024)
di: Ma, Ziyu, et al.
Pubblicazione: (2024)
MR. Video: "MapReduce" is the Principle for Long Video Understanding
di: Pang, Ziqi, et al.
Pubblicazione: (2025)
di: Pang, Ziqi, et al.
Pubblicazione: (2025)
Clapper: Compact Learning and Video Representation in VLMs
di: Kong, Lingyu, et al.
Pubblicazione: (2025)
di: Kong, Lingyu, et al.
Pubblicazione: (2025)
Video Panels for Long Video Understanding
di: Doorenbos, Lars, et al.
Pubblicazione: (2025)
di: Doorenbos, Lars, et al.
Pubblicazione: (2025)
xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs
di: Ryoo, Michael S., et al.
Pubblicazione: (2024)
di: Ryoo, Michael S., et al.
Pubblicazione: (2024)
Language Repository for Long Video Understanding
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
MS-Temba: Multi-Scale Temporal Mamba for Understanding Long Untrimmed Videos
di: Sinha, Arkaprava, et al.
Pubblicazione: (2025)
di: Sinha, Arkaprava, et al.
Pubblicazione: (2025)
LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding
di: Qiu, Jihao, et al.
Pubblicazione: (2026)
di: Qiu, Jihao, et al.
Pubblicazione: (2026)
Progressive Video Condensation with MLLM Agent for Long-form Video Understanding
di: Yin, Yufei, et al.
Pubblicazione: (2026)
di: Yin, Yufei, et al.
Pubblicazione: (2026)
VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation
di: Ma, Wentao, et al.
Pubblicazione: (2025)
di: Ma, Wentao, et al.
Pubblicazione: (2025)
Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding
di: Xie, Yuan, et al.
Pubblicazione: (2025)
di: Xie, Yuan, et al.
Pubblicazione: (2025)
Zero-Shot Long-Form Video Understanding through Screenplay
di: Wu, Yongliang, et al.
Pubblicazione: (2024)
di: Wu, Yongliang, et al.
Pubblicazione: (2024)
Generative Frame Sampler for Long Video Understanding
di: Yao, Linli, et al.
Pubblicazione: (2025)
di: Yao, Linli, et al.
Pubblicazione: (2025)
InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
di: Wang, Yi, et al.
Pubblicazione: (2024)
di: Wang, Yi, et al.
Pubblicazione: (2024)
VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding
di: Yang, Ruoliu, et al.
Pubblicazione: (2026)
di: Yang, Ruoliu, et al.
Pubblicazione: (2026)
LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
di: Shen, Xiaoqian, et al.
Pubblicazione: (2024)
di: Shen, Xiaoqian, et al.
Pubblicazione: (2024)
Understanding Long Videos with Multimodal Language Models
di: Ranasinghe, Kanchana, et al.
Pubblicazione: (2024)
di: Ranasinghe, Kanchana, et al.
Pubblicazione: (2024)
Long Story Short: Disentangling Compositionality and Long-Caption Understanding in Contrastive VLMs
di: Salazar, Israfel, et al.
Pubblicazione: (2025)
di: Salazar, Israfel, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Understanding Complexity in VideoQA via Visual Program Generation
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2025) -
T*: Re-thinking Temporal Search for Long-Form Video Understanding
di: Ye, Jinhui, et al.
Pubblicazione: (2025) -
Streaming Detection of Queried Event Start
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2024) -
IKEA Manuals at Work: 4D Grounding of Assembly Instructions on Internet Videos
di: Liu, Yunong, et al.
Pubblicazione: (2024) -
HourVideo: 1-Hour Video-Language Understanding
di: Chandrasegaran, Keshigeyan, et al.
Pubblicazione: (2024)