Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Luo, Yongdong, Zheng, Xiawu, Li, Guilin, Yin, Shukang, Lin, Haojia, Fu, Chaoyou, Huang, Jinfa, Ji, Jiayi, Chao, Fei, Luo, Jiebo, Ji, Rongrong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension
par: Luo, Yongdong, et autres
Publié: (2025)
par: Luo, Yongdong, et autres
Publié: (2025)
Event-Anchored Frame Selection for Effective Long-Video Understanding
par: Chen, Wang, et autres
Publié: (2026)
par: Chen, Wang, et autres
Publié: (2026)
SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning
par: Huang, Haoyu, et autres
Publié: (2026)
par: Huang, Haoyu, et autres
Publié: (2026)
Rethinking 3D Dense Caption and Visual Grounding in A Unified Framework through Prompt-based Localization
par: Luo, Yongdong, et autres
Publié: (2024)
par: Luo, Yongdong, et autres
Publié: (2024)
Sparrow: Data-Efficient Video-LLM with Text-to-Image Augmentation
par: Yin, Shukang, et autres
Publié: (2024)
par: Yin, Shukang, et autres
Publié: (2024)
Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding
par: Chen, Wang, et autres
Publié: (2026)
par: Chen, Wang, et autres
Publié: (2026)
HASTE: Training-Free Video Diffusion Acceleration via Head-Wise Adaptive Sparse Attention
par: Zheng, Xuzhe, et autres
Publié: (2026)
par: Zheng, Xuzhe, et autres
Publié: (2026)
Tango: Taming Visual Signals for Efficient Video Large Language Models
par: Yin, Shukang, et autres
Publié: (2026)
par: Yin, Shukang, et autres
Publié: (2026)
SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models
par: Xie, Tianyu, et autres
Publié: (2026)
par: Xie, Tianyu, et autres
Publié: (2026)
VideoRAG: Retrieval-Augmented Generation with Extreme Long-Context Videos
par: Ren, Xubin, et autres
Publié: (2025)
par: Ren, Xubin, et autres
Publié: (2025)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
par: Zhou, Chenyu, et autres
Publié: (2024)
par: Zhou, Chenyu, et autres
Publié: (2024)
Towards Efficient Automatic Self-Pruning of Large Language Models
par: Huang, Weizhong, et autres
Publié: (2025)
par: Huang, Weizhong, et autres
Publié: (2025)
Determining Layer-wise Sparsity for Large Language Models Through a Theoretical Perspective
par: Huang, Weizhong, et autres
Publié: (2025)
par: Huang, Weizhong, et autres
Publié: (2025)
Multi-branch Collaborative Learning Network for 3D Visual Grounding
par: Qian, Zhipeng, et autres
Publié: (2024)
par: Qian, Zhipeng, et autres
Publié: (2024)
Motion-Aware Caching for Efficient Autoregressive Video Generation
par: Xu, Jing, et autres
Publié: (2026)
par: Xu, Jing, et autres
Publié: (2026)
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
par: Fu, Chaoyou, et autres
Publié: (2024)
par: Fu, Chaoyou, et autres
Publié: (2024)
DACL-RAG: Data Augmentation Strategy with Curriculum Learning for Retrieval-Augmented Generation
par: Wang, Shaohan, et autres
Publié: (2025)
par: Wang, Shaohan, et autres
Publié: (2025)
Memory-enhanced Retrieval Augmentation for Long Video Understanding
par: Yuan, Huaying, et autres
Publié: (2025)
par: Yuan, Huaying, et autres
Publié: (2025)
Benchmarking Abstract and Reasoning Abilities Through A Theoretical Perspective
par: Ma, Qingchuan, et autres
Publié: (2025)
par: Ma, Qingchuan, et autres
Publié: (2025)
Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models
par: Luo, Gen, et autres
Publié: (2024)
par: Luo, Gen, et autres
Publié: (2024)
Identity-Preserving Text-to-Video Generation by Frequency Decomposition
par: Yuan, Shenghai, et autres
Publié: (2024)
par: Yuan, Shenghai, et autres
Publié: (2024)
Instance Brownian Bridge as Texts for Open-vocabulary Video Instance Segmentation
par: Cheng, Zesen, et autres
Publié: (2024)
par: Cheng, Zesen, et autres
Publié: (2024)
AdaVideoRAG: Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video Understanding
par: Xue, Zhucun, et autres
Publié: (2025)
par: Xue, Zhucun, et autres
Publié: (2025)
ALGOGEN: Tool-Generated Verifiable Traces for Reliable Algorithm Visualization
par: Liao, Kunpeng, et autres
Publié: (2026)
par: Liao, Kunpeng, et autres
Publié: (2026)
VideoRAG: Retrieval-Augmented Generation over Video Corpus
par: Jeong, Soyeong, et autres
Publié: (2025)
par: Jeong, Soyeong, et autres
Publié: (2025)
Polybasic Speculative Decoding Through a Theoretical Perspective
par: Wang, Ruilin, et autres
Publié: (2025)
par: Wang, Ruilin, et autres
Publié: (2025)
SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding
par: Zeng, Nianbo, et autres
Publié: (2025)
par: Zeng, Nianbo, et autres
Publié: (2025)
Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios
par: Yan, Peizheng, et autres
Publié: (2026)
par: Yan, Peizheng, et autres
Publié: (2026)
VideoXum: Cross-modal Visual and Textural Summarization of Videos
par: Lin, Jingyang, et autres
Publié: (2023)
par: Lin, Jingyang, et autres
Publié: (2023)
VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding
par: Yang, Ruoliu, et autres
Publié: (2026)
par: Yang, Ruoliu, et autres
Publié: (2026)
OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation
par: Yuan, Shenghai, et autres
Publié: (2025)
par: Yuan, Shenghai, et autres
Publié: (2025)
Latent-Reframe: Enabling Camera Control for Video Diffusion Model without Training
par: Zhou, Zhenghong, et autres
Publié: (2024)
par: Zhou, Zhenghong, et autres
Publié: (2024)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
par: Chen, Tao, et autres
Publié: (2026)
par: Chen, Tao, et autres
Publié: (2026)
End-to-end Open-vocabulary Video Visual Relationship Detection using Multi-modal Prompting
par: Wang, Yongqi, et autres
Publié: (2024)
par: Wang, Yongqi, et autres
Publié: (2024)
SpeechParaling-Bench: A Comprehensive Benchmark for Paralinguistic-Aware Speech Generation
par: Liu, Ruohan, et autres
Publié: (2026)
par: Liu, Ruohan, et autres
Publié: (2026)
MagicTime: Time-lapse Video Generation Models as Metamorphic Simulators
par: Yuan, Shenghai, et autres
Publié: (2024)
par: Yuan, Shenghai, et autres
Publié: (2024)
JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization
par: Liu, Kai, et autres
Publié: (2025)
par: Liu, Kai, et autres
Publié: (2025)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
par: Fu, Chaoyou, et autres
Publié: (2023)
par: Fu, Chaoyou, et autres
Publié: (2023)
Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs
par: Li, Xudong, et autres
Publié: (2025)
par: Li, Xudong, et autres
Publié: (2025)
Evolver: Chain-of-Evolution Prompting to Boost Large Multimodal Models for Hateful Meme Detection
par: Huang, Jinfa, et autres
Publié: (2024)
par: Huang, Jinfa, et autres
Publié: (2024)
Documents similaires
-
QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension
par: Luo, Yongdong, et autres
Publié: (2025) -
Event-Anchored Frame Selection for Effective Long-Video Understanding
par: Chen, Wang, et autres
Publié: (2026) -
SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning
par: Huang, Haoyu, et autres
Publié: (2026) -
Rethinking 3D Dense Caption and Visual Grounding in A Unified Framework through Prompt-based Localization
par: Luo, Yongdong, et autres
Publié: (2024) -
Sparrow: Data-Efficient Video-LLM with Text-to-Image Augmentation
par: Yin, Shukang, et autres
Publié: (2024)