Long-VMNet: Accelerating Long-Form Video Understanding via Fixed Memory
Fuente:
arXiv
Salvato in:
| Autori principali: | Gurukar, Saket, Kadav, Asim |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CacheFlow: Compressive Streaming Memory for Efficient Long-Form Video Understanding
di: Patel, Shrenik, et al.
Pubblicazione: (2025)
di: Patel, Shrenik, et al.
Pubblicazione: (2025)
VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
di: Yin, Yufei, et al.
Pubblicazione: (2025)
di: Yin, Yufei, et al.
Pubblicazione: (2025)
Text-Conditioned Resampler For Long Form Video Understanding
di: Korbar, Bruno, et al.
Pubblicazione: (2023)
di: Korbar, Bruno, et al.
Pubblicazione: (2023)
Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding
di: Wang, Yun, et al.
Pubblicazione: (2025)
di: Wang, Yun, et al.
Pubblicazione: (2025)
VideoLucy: Deep Memory Backtracking for Long Video Understanding
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
T*: Re-thinking Temporal Search for Long-Form Video Understanding
di: Ye, Jinhui, et al.
Pubblicazione: (2025)
di: Ye, Jinhui, et al.
Pubblicazione: (2025)
Zero-Shot Long-Form Video Understanding through Screenplay
di: Wu, Yongliang, et al.
Pubblicazione: (2024)
di: Wu, Yongliang, et al.
Pubblicazione: (2024)
VideoMem: Enhancing Ultra-Long Video Understanding via Adaptive Memory Management
di: Jin, Hongbo, et al.
Pubblicazione: (2025)
di: Jin, Hongbo, et al.
Pubblicazione: (2025)
Memory Consolidation Enables Long-Context Video Understanding
di: Balažević, Ivana, et al.
Pubblicazione: (2024)
di: Balažević, Ivana, et al.
Pubblicazione: (2024)
LongViTU: Instruction Tuning for Long-Form Video Understanding
di: Wu, Rujie, et al.
Pubblicazione: (2025)
di: Wu, Rujie, et al.
Pubblicazione: (2025)
Memory-enhanced Retrieval Augmentation for Long Video Understanding
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
Prompt2LVideos: Exploring Prompts for Understanding Long-Form Multimodal Videos
di: Jahagirdar, Soumya Shamarao, et al.
Pubblicazione: (2025)
di: Jahagirdar, Soumya Shamarao, et al.
Pubblicazione: (2025)
GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
Enhancing Long Video Understanding via Hierarchical Event-Based Memory
di: Cheng, Dingxin, et al.
Pubblicazione: (2024)
di: Cheng, Dingxin, et al.
Pubblicazione: (2024)
MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
di: Fang, Xinyu, et al.
Pubblicazione: (2024)
di: Fang, Xinyu, et al.
Pubblicazione: (2024)
LongVLM: Efficient Long Video Understanding via Large Language Models
di: Weng, Yuetian, et al.
Pubblicazione: (2024)
di: Weng, Yuetian, et al.
Pubblicazione: (2024)
VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding
di: Tan, Wenhui, et al.
Pubblicazione: (2026)
di: Tan, Wenhui, et al.
Pubblicazione: (2026)
Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models
di: Ma, Martin Q., et al.
Pubblicazione: (2026)
di: Ma, Martin Q., et al.
Pubblicazione: (2026)
Question-guided Visual Compression with Memory Feedback for Long-Term Video Understanding
di: Yamao, Sosuke, et al.
Pubblicazione: (2026)
di: Yamao, Sosuke, et al.
Pubblicazione: (2026)
MovieChat: From Dense Token to Sparse Memory for Long Video Understanding
di: Song, Enxin, et al.
Pubblicazione: (2023)
di: Song, Enxin, et al.
Pubblicazione: (2023)
Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams
di: Zhang, Haoji, et al.
Pubblicazione: (2024)
di: Zhang, Haoji, et al.
Pubblicazione: (2024)
Hierarchical Memory for Long Video QA
di: Wang, Yiqin, et al.
Pubblicazione: (2024)
di: Wang, Yiqin, et al.
Pubblicazione: (2024)
NeuS-QA: Grounding Long-Form Video Understanding in Temporal Logic and Neuro-Symbolic Reasoning
di: Shah, Sahil, et al.
Pubblicazione: (2025)
di: Shah, Sahil, et al.
Pubblicazione: (2025)
REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding
di: Li, Jiaze, et al.
Pubblicazione: (2025)
di: Li, Jiaze, et al.
Pubblicazione: (2025)
ReWind: Understanding Long Videos with Instructed Learnable Memory
di: Diko, Anxhelo, et al.
Pubblicazione: (2024)
di: Diko, Anxhelo, et al.
Pubblicazione: (2024)
MA-LMM: Memory-Augmented Large Multimodal Model for Long-Term Video Understanding
di: He, Bo, et al.
Pubblicazione: (2024)
di: He, Bo, et al.
Pubblicazione: (2024)
Language Repository for Long Video Understanding
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
Towards Long-Form Spatio-Temporal Video Grounding
di: Gu, Xin, et al.
Pubblicazione: (2026)
di: Gu, Xin, et al.
Pubblicazione: (2026)
Narrative Aligned Long Form Video Question Answering
di: Jain, Rahul, et al.
Pubblicazione: (2026)
di: Jain, Rahul, et al.
Pubblicazione: (2026)
LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding
di: Qiu, Jihao, et al.
Pubblicazione: (2026)
di: Qiu, Jihao, et al.
Pubblicazione: (2026)
VideoAgent2: Enhancing the LLM-Based Agent System for Long-Form Video Understanding by Uncertainty-Aware CoT
di: Zhi, Zhuo, et al.
Pubblicazione: (2025)
di: Zhi, Zhuo, et al.
Pubblicazione: (2025)
Towards Long Video Understanding via Fine-detailed Video Story Generation
di: You, Zeng, et al.
Pubblicazione: (2024)
di: You, Zeng, et al.
Pubblicazione: (2024)
Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos
di: Chen, Qirui, et al.
Pubblicazione: (2024)
di: Chen, Qirui, et al.
Pubblicazione: (2024)
From Frames to Clips: Training-free Adaptive Key Clip Selection for Long-Form Video Understanding
di: Sun, Guangyu, et al.
Pubblicazione: (2025)
di: Sun, Guangyu, et al.
Pubblicazione: (2025)
LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
di: Shen, Xiaoqian, et al.
Pubblicazione: (2024)
di: Shen, Xiaoqian, et al.
Pubblicazione: (2024)
Linear Scaling Video VLMs for Long Video Understanding
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2026)
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2026)
Video Token Merging for Long-form Video Understanding
di: Lee, Seon-Ho, et al.
Pubblicazione: (2024)
di: Lee, Seon-Ho, et al.
Pubblicazione: (2024)
StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding
di: Wang, Junxi, et al.
Pubblicazione: (2026)
di: Wang, Junxi, et al.
Pubblicazione: (2026)
LongVPO: From Anchored Cues to Self-Reasoning for Long-Form Video Preference Optimization
di: Huang, Zhenpeng, et al.
Pubblicazione: (2026)
di: Huang, Zhenpeng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
CacheFlow: Compressive Streaming Memory for Efficient Long-Form Video Understanding
di: Patel, Shrenik, et al.
Pubblicazione: (2025) -
VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
di: Yin, Yufei, et al.
Pubblicazione: (2025) -
Text-Conditioned Resampler For Long Form Video Understanding
di: Korbar, Bruno, et al.
Pubblicazione: (2023) -
Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding
di: Wang, Yun, et al.
Pubblicazione: (2025) -
VideoLucy: Deep Memory Backtracking for Long Video Understanding
di: Zuo, Jialong, et al.
Pubblicazione: (2025)