Hierarchical Memory for Long Video QA
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Yiqin, Zhang, Haoji, Tang, Yansong, Liu, Yong, Feng, Jiashi, Dai, Jifeng, Jin, Xiaojie |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams
von: Zhang, Haoji, et al.
Veröffentlicht: (2024)
von: Zhang, Haoji, et al.
Veröffentlicht: (2024)
Flash-VStream: Efficient Real-Time Understanding for Long Video Streams
von: Zhang, Haoji, et al.
Veröffentlicht: (2025)
von: Zhang, Haoji, et al.
Veröffentlicht: (2025)
Ponder & Press: Advancing Visual GUI Agent towards General Computer Control
von: Wang, Yiqin, et al.
Veröffentlicht: (2024)
von: Wang, Yiqin, et al.
Veröffentlicht: (2024)
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
von: Zhang, Haoji, et al.
Veröffentlicht: (2025)
von: Zhang, Haoji, et al.
Veröffentlicht: (2025)
VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning
von: Wang, Yuji, et al.
Veröffentlicht: (2025)
von: Wang, Yuji, et al.
Veröffentlicht: (2025)
Vista-LLaMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens
von: Ma, Fan, et al.
Veröffentlicht: (2023)
von: Ma, Fan, et al.
Veröffentlicht: (2023)
VideoWorld: Exploring Knowledge Learning from Unlabeled Videos
von: Ren, Zhongwei, et al.
Veröffentlicht: (2025)
von: Ren, Zhongwei, et al.
Veröffentlicht: (2025)
Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning
von: Wang, Chendong, et al.
Veröffentlicht: (2025)
von: Wang, Chendong, et al.
Veröffentlicht: (2025)
Self-Calibrated CLIP for Training-Free Open-Vocabulary Segmentation
von: Bai, Sule, et al.
Veröffentlicht: (2024)
von: Bai, Sule, et al.
Veröffentlicht: (2024)
MV-Adapter: Multimodal Video Transfer Learning for Video Text Retrieval
von: Jin, Xiaojie, et al.
Veröffentlicht: (2023)
von: Jin, Xiaojie, et al.
Veröffentlicht: (2023)
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning
von: Bai, Sule, et al.
Veröffentlicht: (2025)
von: Bai, Sule, et al.
Veröffentlicht: (2025)
VideoWorld 2: Learning Transferable Knowledge from Real-world Videos
von: Ren, Zhongwei, et al.
Veröffentlicht: (2026)
von: Ren, Zhongwei, et al.
Veröffentlicht: (2026)
LOGO: A Long-Form Video Dataset for Group Action Quality Assessment
von: Zhang, Shiyi, et al.
Veröffentlicht: (2024)
von: Zhang, Shiyi, et al.
Veröffentlicht: (2024)
VideoMem: Enhancing Ultra-Long Video Understanding via Adaptive Memory Management
von: Jin, Hongbo, et al.
Veröffentlicht: (2025)
von: Jin, Hongbo, et al.
Veröffentlicht: (2025)
StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation
von: Zhou, Yupeng, et al.
Veröffentlicht: (2024)
von: Zhou, Yupeng, et al.
Veröffentlicht: (2024)
Loong: Generating Minute-level Long Videos with Autoregressive Language Models
von: Wang, Yuqing, et al.
Veröffentlicht: (2024)
von: Wang, Yuqing, et al.
Veröffentlicht: (2024)
Memorize-and-Generate: Towards Long-Term Consistency in Real-Time Video Generation
von: Zhu, Tianrui, et al.
Veröffentlicht: (2025)
von: Zhu, Tianrui, et al.
Veröffentlicht: (2025)
SpatialMem: Metric-Aligned Long-Horizon Video Memory for Language Grounding and QA
von: Zheng, Xinyi, et al.
Veröffentlicht: (2026)
von: Zheng, Xinyi, et al.
Veröffentlicht: (2026)
CoMemo: LVLMs Need Image Context with Image Memory
von: Liu, Shi, et al.
Veröffentlicht: (2025)
von: Liu, Shi, et al.
Veröffentlicht: (2025)
WorldQA: Multimodal World Knowledge in Videos through Long-Chain Reasoning
von: Zhang, Yuanhan, et al.
Veröffentlicht: (2024)
von: Zhang, Yuanhan, et al.
Veröffentlicht: (2024)
Video Depth Anything: Consistent Depth Estimation for Super-Long Videos
von: Chen, Sili, et al.
Veröffentlicht: (2025)
von: Chen, Sili, et al.
Veröffentlicht: (2025)
Fully Aligned Network for Referring Image Segmentation
von: Liu, Yong, et al.
Veröffentlicht: (2024)
von: Liu, Yong, et al.
Veröffentlicht: (2024)
FDDet: Achieving Data-Efficient Food Defect Detection Under Real-World Scenarios
von: Xu, Ruihao, et al.
Veröffentlicht: (2026)
von: Xu, Ruihao, et al.
Veröffentlicht: (2026)
VideoLucy: Deep Memory Backtracking for Long Video Understanding
von: Zuo, Jialong, et al.
Veröffentlicht: (2025)
von: Zuo, Jialong, et al.
Veröffentlicht: (2025)
Long-Video Audio Synthesis with Multi-Agent Collaboration
von: Zhang, Yehang, et al.
Veröffentlicht: (2025)
von: Zhang, Yehang, et al.
Veröffentlicht: (2025)
PixelLM: Pixel Reasoning with Large Multimodal Model
von: Ren, Zhongwei, et al.
Veröffentlicht: (2023)
von: Ren, Zhongwei, et al.
Veröffentlicht: (2023)
Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos
von: Chen, Qirui, et al.
Veröffentlicht: (2024)
von: Chen, Qirui, et al.
Veröffentlicht: (2024)
Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory
von: Liu, Jinzhuo, et al.
Veröffentlicht: (2026)
von: Liu, Jinzhuo, et al.
Veröffentlicht: (2026)
Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval
von: Yu, Jiwen, et al.
Veröffentlicht: (2025)
von: Yu, Jiwen, et al.
Veröffentlicht: (2025)
Enhancing Long Video Understanding via Hierarchical Event-Based Memory
von: Cheng, Dingxin, et al.
Veröffentlicht: (2024)
von: Cheng, Dingxin, et al.
Veröffentlicht: (2024)
VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
von: Yin, Yufei, et al.
Veröffentlicht: (2025)
von: Yin, Yufei, et al.
Veröffentlicht: (2025)
ChatUMM: Robust Context Tracking for Conversational Interleaved Generation
von: Dai, Wenxun, et al.
Veröffentlicht: (2026)
von: Dai, Wenxun, et al.
Veröffentlicht: (2026)
LVD-2M: A Long-take Video Dataset with Temporally Dense Captions
von: Xiong, Tianwei, et al.
Veröffentlicht: (2024)
von: Xiong, Tianwei, et al.
Veröffentlicht: (2024)
Training-Free Hierarchical Scene Understanding for Gaussian Splatting with Superpoint Graphs
von: Dai, Shaohui, et al.
Veröffentlicht: (2025)
von: Dai, Shaohui, et al.
Veröffentlicht: (2025)
Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models
von: Cao, Meng, et al.
Veröffentlicht: (2025)
von: Cao, Meng, et al.
Veröffentlicht: (2025)
Contrastive Masked Autoencoders are Stronger Vision Learners
von: Huang, Zhicheng, et al.
Veröffentlicht: (2022)
von: Huang, Zhicheng, et al.
Veröffentlicht: (2022)
MovieBench: A Hierarchical Movie Level Dataset for Long Video Generation
von: Wu, Weijia, et al.
Veröffentlicht: (2024)
von: Wu, Weijia, et al.
Veröffentlicht: (2024)
Universal Segmentation at Arbitrary Granularity with Language Instruction
von: Liu, Yong, et al.
Veröffentlicht: (2023)
von: Liu, Yong, et al.
Veröffentlicht: (2023)
Neural-Symbolic VideoQA: Learning Compositional Spatio-Temporal Reasoning for Real-world Video Question Answering
von: Liang, Lili, et al.
Veröffentlicht: (2024)
von: Liang, Lili, et al.
Veröffentlicht: (2024)
Trace Anything: Representing Any Video in 4D via Trajectory Fields
von: Liu, Xinhang, et al.
Veröffentlicht: (2025)
von: Liu, Xinhang, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams
von: Zhang, Haoji, et al.
Veröffentlicht: (2024) -
Flash-VStream: Efficient Real-Time Understanding for Long Video Streams
von: Zhang, Haoji, et al.
Veröffentlicht: (2025) -
Ponder & Press: Advancing Visual GUI Agent towards General Computer Control
von: Wang, Yiqin, et al.
Veröffentlicht: (2024) -
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
von: Zhang, Haoji, et al.
Veröffentlicht: (2025) -
VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning
von: Wang, Yuji, et al.
Veröffentlicht: (2025)