AdaVideoRAG: Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Xue, Zhucun, Zhang, Jiangning, Xie, Xurong, Cai, Yuxuan, Liu, Yong, Li, Xiangtai, Tao, Dacheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions
di: Xue, Zhucun, et al.
Pubblicazione: (2025)
di: Xue, Zhucun, et al.
Pubblicazione: (2025)
SPIKE: An Adaptive Dual Controller Framework for Cost-Efficient Long-Horizon Game Agents
di: Jiang, Wencan, et al.
Pubblicazione: (2026)
di: Jiang, Wencan, et al.
Pubblicazione: (2026)
Learning Feature Inversion for Multi-class Anomaly Detection under General-purpose COCO-AD Benchmark
di: Zhang, Jiangning, et al.
Pubblicazione: (2024)
di: Zhang, Jiangning, et al.
Pubblicazione: (2024)
AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding
di: Li, Handong, et al.
Pubblicazione: (2026)
di: Li, Handong, et al.
Pubblicazione: (2026)
EMOv2: Pushing 5M Vision Model Frontier
di: Zhang, Jiangning, et al.
Pubblicazione: (2024)
di: Zhang, Jiangning, et al.
Pubblicazione: (2024)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory
di: Liu, Jinzhuo, et al.
Pubblicazione: (2026)
di: Liu, Jinzhuo, et al.
Pubblicazione: (2026)
Evolution of Video Generative Foundations
di: Hu, Teng, et al.
Pubblicazione: (2026)
di: Hu, Teng, et al.
Pubblicazione: (2026)
InstanceV: Instance-Level Video Generation
di: Chen, Yuheng, et al.
Pubblicazione: (2025)
di: Chen, Yuheng, et al.
Pubblicazione: (2025)
Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
di: Luo, Yongdong, et al.
Pubblicazione: (2024)
di: Luo, Yongdong, et al.
Pubblicazione: (2024)
OmniMem: Scalable and Adaptive Memory Retrieval for Long Video Generation
di: Zhao, Lin, et al.
Pubblicazione: (2026)
di: Zhao, Lin, et al.
Pubblicazione: (2026)
UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy
di: Xu, Yicheng, et al.
Pubblicazione: (2026)
di: Xu, Yicheng, et al.
Pubblicazione: (2026)
VideoRAG: Retrieval-Augmented Generation with Extreme Long-Context Videos
di: Ren, Xubin, et al.
Pubblicazione: (2025)
di: Ren, Xubin, et al.
Pubblicazione: (2025)
VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning
di: Gao, Zhe, et al.
Pubblicazione: (2026)
di: Gao, Zhe, et al.
Pubblicazione: (2026)
O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding
di: Wu, Peiran, et al.
Pubblicazione: (2026)
di: Wu, Peiran, et al.
Pubblicazione: (2026)
OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-Guided Video Editing
di: He, Haoyang, et al.
Pubblicazione: (2025)
di: He, Haoyang, et al.
Pubblicazione: (2025)
SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding
di: Zeng, Nianbo, et al.
Pubblicazione: (2025)
di: Zeng, Nianbo, et al.
Pubblicazione: (2025)
Memory-enhanced Retrieval Augmentation for Long Video Understanding
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
Long Video Understanding with Learnable Retrieval in Video-Language Models
di: Xu, Jiaqi, et al.
Pubblicazione: (2023)
di: Xu, Jiaqi, et al.
Pubblicazione: (2023)
DrVideo: Document Retrieval Based Long Video Understanding
di: Ma, Ziyu, et al.
Pubblicazione: (2024)
di: Ma, Ziyu, et al.
Pubblicazione: (2024)
E-VRAG: Enhancing Long Video Understanding with Resource-Efficient Retrieval Augmented Generation
di: Xu, Zeyu, et al.
Pubblicazione: (2025)
di: Xu, Zeyu, et al.
Pubblicazione: (2025)
TV-RAG: A Temporal-aware and Semantic Entropy-Weighted Framework for Long Video Retrieval and Understanding
di: Cao, Zongsheng, et al.
Pubblicazione: (2025)
di: Cao, Zongsheng, et al.
Pubblicazione: (2025)
RAG-Adapter: A Plug-and-Play RAG-enhanced Framework for Long Video Understanding
di: Tan, Xichen, et al.
Pubblicazione: (2025)
di: Tan, Xichen, et al.
Pubblicazione: (2025)
AdaFocus: Adaptive Relevance-Diversity Sampling with Zero-Cache Look-back for Efficient Long Video Understanding
di: Yang, Xiao, et al.
Pubblicazione: (2026)
di: Yang, Xiao, et al.
Pubblicazione: (2026)
IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment
di: Chen, Yinan, et al.
Pubblicazione: (2025)
di: Chen, Yinan, et al.
Pubblicazione: (2025)
TIMotion: Temporal and Interactive Framework for Efficient Human-Human Motion Generation
di: Wang, Yabiao, et al.
Pubblicazione: (2024)
di: Wang, Yabiao, et al.
Pubblicazione: (2024)
AdaFlow: Efficient Long Video Editing via Adaptive Attention Slimming And Keyframe Selection
di: Zhang, Shuheng, et al.
Pubblicazione: (2025)
di: Zhang, Shuheng, et al.
Pubblicazione: (2025)
VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding
di: He, Haichen, et al.
Pubblicazione: (2026)
di: He, Haichen, et al.
Pubblicazione: (2026)
Disco-RAG: Discourse-Aware Retrieval-Augmented Generation
di: Liu, Dongqi, et al.
Pubblicazione: (2026)
di: Liu, Dongqi, et al.
Pubblicazione: (2026)
Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios
di: Yan, Peizheng, et al.
Pubblicazione: (2026)
di: Yan, Peizheng, et al.
Pubblicazione: (2026)
A Comprehensive Library for Benchmarking Multi-class Visual Anomaly Detection
di: Zhang, Jiangning, et al.
Pubblicazione: (2024)
di: Zhang, Jiangning, et al.
Pubblicazione: (2024)
VideoPro: Adaptive Program Reasoning for Long Video Understanding
di: Li, Chenglin, et al.
Pubblicazione: (2025)
di: Li, Chenglin, et al.
Pubblicazione: (2025)
MotionRAG: Motion Retrieval-Augmented Image-to-Video Generation
di: Zhu, Chenhui, et al.
Pubblicazione: (2025)
di: Zhu, Chenhui, et al.
Pubblicazione: (2025)
Omni-Video: Democratizing Unified Video Understanding and Generation
di: Tan, Zhiyu, et al.
Pubblicazione: (2025)
di: Tan, Zhiyu, et al.
Pubblicazione: (2025)
EATFormer: Improving Vision Transformer Inspired by Evolutionary Algorithm
di: Zhang, Jiangning, et al.
Pubblicazione: (2022)
di: Zhang, Jiangning, et al.
Pubblicazione: (2022)
VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG
di: Fu, Honghao, et al.
Pubblicazione: (2026)
di: Fu, Honghao, et al.
Pubblicazione: (2026)
Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding
di: Shen, Xiaoqian, et al.
Pubblicazione: (2025)
di: Shen, Xiaoqian, et al.
Pubblicazione: (2025)
VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction
di: Man, Yuanbin, et al.
Pubblicazione: (2024)
di: Man, Yuanbin, et al.
Pubblicazione: (2024)
Retrieval-Augmented Perception: High-Resolution Image Perception Meets Visual RAG
di: Wang, Wenbin, et al.
Pubblicazione: (2025)
di: Wang, Wenbin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions
di: Xue, Zhucun, et al.
Pubblicazione: (2025) -
SPIKE: An Adaptive Dual Controller Framework for Cost-Efficient Long-Horizon Game Agents
di: Jiang, Wencan, et al.
Pubblicazione: (2026) -
Learning Feature Inversion for Multi-class Anomaly Detection under General-purpose COCO-AD Benchmark
di: Zhang, Jiangning, et al.
Pubblicazione: (2024) -
AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding
di: Li, Handong, et al.
Pubblicazione: (2026) -
EMOv2: Pushing 5M Vision Model Frontier
di: Zhang, Jiangning, et al.
Pubblicazione: (2024)