Enhancing Long Video Understanding via Hierarchical Event-Based Memory
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Cheng, Dingxin, Li, Mingda, Liu, Jingyu, Guo, Yongxin, Jiang, Bin, Liu, Qingbin, Chen, Xi, Zhao, Bo |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TRACE: Temporal Grounding Video LLM via Causal Event Modeling
von: Guo, Yongxin, et al.
Veröffentlicht: (2024)
von: Guo, Yongxin, et al.
Veröffentlicht: (2024)
VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal Grounding
von: Guo, Yongxin, et al.
Veröffentlicht: (2024)
von: Guo, Yongxin, et al.
Veröffentlicht: (2024)
TC-LLaVA: Rethinking the Transfer from Image to Video Understanding with Temporal Considerations
von: Gao, Mingze, et al.
Veröffentlicht: (2024)
von: Gao, Mingze, et al.
Veröffentlicht: (2024)
VideoMem: Enhancing Ultra-Long Video Understanding via Adaptive Memory Management
von: Jin, Hongbo, et al.
Veröffentlicht: (2025)
von: Jin, Hongbo, et al.
Veröffentlicht: (2025)
Hierarchical Memory for Long Video QA
von: Wang, Yiqin, et al.
Veröffentlicht: (2024)
von: Wang, Yiqin, et al.
Veröffentlicht: (2024)
EventMemAgent: Hierarchical Event-Centric Memory for Online Video Understanding with Adaptive Tool Use
von: Wen, Siwei, et al.
Veröffentlicht: (2026)
von: Wen, Siwei, et al.
Veröffentlicht: (2026)
Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding
von: Wang, Yun, et al.
Veröffentlicht: (2025)
von: Wang, Yun, et al.
Veröffentlicht: (2025)
Event-VStream: Event-Driven Real-Time Understanding for Long Video Streams
von: Guo, Zhenghui, et al.
Veröffentlicht: (2026)
von: Guo, Zhenghui, et al.
Veröffentlicht: (2026)
HiAR: Efficient Autoregressive Long Video Generation via Hierarchical Denoising
von: Zou, Kai, et al.
Veröffentlicht: (2026)
von: Zou, Kai, et al.
Veröffentlicht: (2026)
Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding
von: Liu, Xiangrui, et al.
Veröffentlicht: (2025)
von: Liu, Xiangrui, et al.
Veröffentlicht: (2025)
Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams
von: Zhang, Haoji, et al.
Veröffentlicht: (2024)
von: Zhang, Haoji, et al.
Veröffentlicht: (2024)
Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding
von: Zheng, Minghang, et al.
Veröffentlicht: (2025)
von: Zheng, Minghang, et al.
Veröffentlicht: (2025)
VideoLucy: Deep Memory Backtracking for Long Video Understanding
von: Zuo, Jialong, et al.
Veröffentlicht: (2025)
von: Zuo, Jialong, et al.
Veröffentlicht: (2025)
Memory Helps, but Confabulation Misleads: Understanding Streaming Events in Videos with MLLMs
von: Zhang, Gengyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Gengyuan, et al.
Veröffentlicht: (2025)
LVC: A Lightweight Compression Framework for Enhancing VLMs in Long Video Understanding
von: Wang, Ziyi, et al.
Veröffentlicht: (2025)
von: Wang, Ziyi, et al.
Veröffentlicht: (2025)
Long-VMNet: Accelerating Long-Form Video Understanding via Fixed Memory
von: Gurukar, Saket, et al.
Veröffentlicht: (2025)
von: Gurukar, Saket, et al.
Veröffentlicht: (2025)
VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
von: Yin, Yufei, et al.
Veröffentlicht: (2025)
von: Yin, Yufei, et al.
Veröffentlicht: (2025)
OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning
von: Liang, Zhijia, et al.
Veröffentlicht: (2026)
von: Liang, Zhijia, et al.
Veröffentlicht: (2026)
FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding
von: Xie, Yiweng, et al.
Veröffentlicht: (2026)
von: Xie, Yiweng, et al.
Veröffentlicht: (2026)
Visual Agentic Memory: Enabling Online Long Video Understanding via Online Indexing, Hierarchical Memory, and Agentic Retrieval
von: Li, Aiden Yiliu, et al.
Veröffentlicht: (2026)
von: Li, Aiden Yiliu, et al.
Veröffentlicht: (2026)
AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding
von: Li, Handong, et al.
Veröffentlicht: (2026)
von: Li, Handong, et al.
Veröffentlicht: (2026)
Memory-enhanced Retrieval Augmentation for Long Video Understanding
von: Yuan, Huaying, et al.
Veröffentlicht: (2025)
von: Yuan, Huaying, et al.
Veröffentlicht: (2025)
StreamForest: Efficient Online Video Understanding with Persistent Event Memory
von: Zeng, Xiangyu, et al.
Veröffentlicht: (2025)
von: Zeng, Xiangyu, et al.
Veröffentlicht: (2025)
DrVideo: Document Retrieval Based Long Video Understanding
von: Ma, Ziyu, et al.
Veröffentlicht: (2024)
von: Ma, Ziyu, et al.
Veröffentlicht: (2024)
Towards Event-oriented Long Video Understanding
von: Du, Yifan, et al.
Veröffentlicht: (2024)
von: Du, Yifan, et al.
Veröffentlicht: (2024)
Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory
von: Liu, Jinzhuo, et al.
Veröffentlicht: (2026)
von: Liu, Jinzhuo, et al.
Veröffentlicht: (2026)
Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding
von: Shu, Yan, et al.
Veröffentlicht: (2024)
von: Shu, Yan, et al.
Veröffentlicht: (2024)
Memory Consolidation Enables Long-Context Video Understanding
von: Balažević, Ivana, et al.
Veröffentlicht: (2024)
von: Balažević, Ivana, et al.
Veröffentlicht: (2024)
VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges
von: Wang, Yuxuan, et al.
Veröffentlicht: (2024)
von: Wang, Yuxuan, et al.
Veröffentlicht: (2024)
Event-Anchored Frame Selection for Effective Long-Video Understanding
von: Chen, Wang, et al.
Veröffentlicht: (2026)
von: Chen, Wang, et al.
Veröffentlicht: (2026)
EEA: Exploration-Exploitation Agent for Long Video Understanding
von: Yang, Te, et al.
Veröffentlicht: (2025)
von: Yang, Te, et al.
Veröffentlicht: (2025)
MA-LMM: Memory-Augmented Large Multimodal Model for Long-Term Video Understanding
von: He, Bo, et al.
Veröffentlicht: (2024)
von: He, Bo, et al.
Veröffentlicht: (2024)
Fragile Reconstruction: Adversarial Vulnerability of Reconstruction-Based Detectors for Diffusion-Generated Images
von: Jiang, Haoyang, et al.
Veröffentlicht: (2026)
von: Jiang, Haoyang, et al.
Veröffentlicht: (2026)
MovieChat: From Dense Token to Sparse Memory for Long Video Understanding
von: Song, Enxin, et al.
Veröffentlicht: (2023)
von: Song, Enxin, et al.
Veröffentlicht: (2023)
MLVU: Benchmarking Multi-task Long Video Understanding
von: Zhou, Junjie, et al.
Veröffentlicht: (2024)
von: Zhou, Junjie, et al.
Veröffentlicht: (2024)
GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory
von: Yeo, Jeong Hun, et al.
Veröffentlicht: (2025)
von: Yeo, Jeong Hun, et al.
Veröffentlicht: (2025)
MemFlow: Flowing Adaptive Memory for Consistent and Efficient Long Video Narratives
von: Ji, Sihui, et al.
Veröffentlicht: (2025)
von: Ji, Sihui, et al.
Veröffentlicht: (2025)
FIS-DiT: Breaking the Few-Step Video Inference Barrier via Training-Free Frame Interleaved Sparsity
von: Tang, Jian, et al.
Veröffentlicht: (2026)
von: Tang, Jian, et al.
Veröffentlicht: (2026)
Embodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene Understanding
von: Fan, Yue, et al.
Veröffentlicht: (2024)
von: Fan, Yue, et al.
Veröffentlicht: (2024)
E-VRAG: Enhancing Long Video Understanding with Resource-Efficient Retrieval Augmented Generation
von: Xu, Zeyu, et al.
Veröffentlicht: (2025)
von: Xu, Zeyu, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
TRACE: Temporal Grounding Video LLM via Causal Event Modeling
von: Guo, Yongxin, et al.
Veröffentlicht: (2024) -
VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal Grounding
von: Guo, Yongxin, et al.
Veröffentlicht: (2024) -
TC-LLaVA: Rethinking the Transfer from Image to Video Understanding with Temporal Considerations
von: Gao, Mingze, et al.
Veröffentlicht: (2024) -
VideoMem: Enhancing Ultra-Long Video Understanding via Adaptive Memory Management
von: Jin, Hongbo, et al.
Veröffentlicht: (2025) -
Hierarchical Memory for Long Video QA
von: Wang, Yiqin, et al.
Veröffentlicht: (2024)