OmniRAG-Agent: Agentic Omnimodal Reasoning for Low-Resource Long Audio-Video Question Answering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Yifan, Mu, Xinyu, Feng, Tao, Ou, Zhonghong, Gong, Yuning, Luo, Haoran |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Active Perception Agent for Omnimodal Audio-Video Understanding
par: Tao, Keda, et autres
Publié: (2025)
par: Tao, Keda, et autres
Publié: (2025)
Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning
par: Zhang, Zhicheng, et autres
Publié: (2026)
par: Zhang, Zhicheng, et autres
Publié: (2026)
KBQA-o1: Agentic Knowledge Base Question Answering with Monte Carlo Tree Search
par: Luo, Haoran, et autres
Publié: (2025)
par: Luo, Haoran, et autres
Publié: (2025)
LongAudio-RAG: Event-Grounded Question Answering over Multi-Hour Long Audio
par: Vakada, Naveen, et autres
Publié: (2026)
par: Vakada, Naveen, et autres
Publié: (2026)
ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models
par: Xue, Kaiwen, et autres
Publié: (2026)
par: Xue, Kaiwen, et autres
Publié: (2026)
LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs
par: Tao, Keda, et autres
Publié: (2026)
par: Tao, Keda, et autres
Publié: (2026)
OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models
par: Tao, Keda, et autres
Publié: (2025)
par: Tao, Keda, et autres
Publié: (2025)
From RAG to Agentic RAG for Faithful Islamic Question Answering
par: Bhatia, Gagan, et autres
Publié: (2026)
par: Bhatia, Gagan, et autres
Publié: (2026)
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation
par: Ying, Kaining, et autres
Publié: (2025)
par: Ying, Kaining, et autres
Publié: (2025)
Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization
par: Oh, Yeongtak, et autres
Publié: (2026)
par: Oh, Yeongtak, et autres
Publié: (2026)
Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration
par: Zhong, Hao, et autres
Publié: (2025)
par: Zhong, Hao, et autres
Publié: (2025)
MHier-RAG: Multi-Modal RAG for Visual-Rich Document Question-Answering via Hierarchical and Multi-Granularity Reasoning
par: Gong, Ziyu, et autres
Publié: (2025)
par: Gong, Ziyu, et autres
Publié: (2025)
MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
par: Dang, Jisheng, et autres
Publié: (2025)
par: Dang, Jisheng, et autres
Publié: (2025)
Agentic Keyframe Search for Video Question Answering
par: Fan, Sunqi, et autres
Publié: (2025)
par: Fan, Sunqi, et autres
Publié: (2025)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Tri-VQA: Triangular Reasoning Medical Visual Question Answering for Multi-Attribute Analysis
par: Fan, Lin, et autres
Publié: (2024)
par: Fan, Lin, et autres
Publié: (2024)
Dynin-Omni: Omnimodal Unified Large Diffusion Language Model
par: Kim, Jaeik, et autres
Publié: (2026)
par: Kim, Jaeik, et autres
Publié: (2026)
A Benchmark and Agentic Framework for Omni-Modal Reasoning and Tool Use in Long Videos
par: Kurpath, Mohammed Irfan, et autres
Publié: (2025)
par: Kurpath, Mohammed Irfan, et autres
Publié: (2025)
AdaVideoRAG: Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video Understanding
par: Xue, Zhucun, et autres
Publié: (2025)
par: Xue, Zhucun, et autres
Publié: (2025)
OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models
par: Deng, Yuchen, et autres
Publié: (2026)
par: Deng, Yuchen, et autres
Publié: (2026)
GlobalRAG: Enhancing Global Reasoning in Multi-hop Question Answering via Reinforcement Learning
par: Luo, Jinchang, et autres
Publié: (2025)
par: Luo, Jinchang, et autres
Publié: (2025)
DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression
par: Li, Bingzhou, et autres
Publié: (2026)
par: Li, Bingzhou, et autres
Publié: (2026)
OmniMem: Scalable and Adaptive Memory Retrieval for Long Video Generation
par: Zhao, Lin, et autres
Publié: (2026)
par: Zhao, Lin, et autres
Publié: (2026)
Open-Ended Multi-Modal Relational Reasoning for Video Question Answering
par: Luo, Haozheng, et autres
Publié: (2020)
par: Luo, Haozheng, et autres
Publié: (2020)
An Entity Linking Agent for Question Answering
par: Luo, Yajie, et autres
Publié: (2025)
par: Luo, Yajie, et autres
Publié: (2025)
Agentic Active Omni-Modal Perception for Multi-Hop Audio-Visual Reasoning
par: Xu, Ke, et autres
Publié: (2026)
par: Xu, Ke, et autres
Publié: (2026)
PAR$^2$-RAG: Planned Active Retrieval and Reasoning for Multi-Hop Question Answering
par: Li, Xingyu, et autres
Publié: (2026)
par: Li, Xingyu, et autres
Publié: (2026)
Decomposing Retrieval Failures in RAG for Long-Document Financial Question Answering
par: Kobeissi, Amine, et autres
Publié: (2026)
par: Kobeissi, Amine, et autres
Publié: (2026)
Spatial Audio Question Answering and Reasoning on Dynamic Source Movements
par: Sridhar, Arvind Krishna, et autres
Publié: (2026)
par: Sridhar, Arvind Krishna, et autres
Publié: (2026)
Grounded Question-Answering in Long Egocentric Videos
par: Di, Shangzhe, et autres
Publié: (2023)
par: Di, Shangzhe, et autres
Publié: (2023)
Efficient Multimodal Planning Agent for Visual Question-Answering
par: Chen, Zhuo, et autres
Publié: (2026)
par: Chen, Zhuo, et autres
Publié: (2026)
Structured RAG for Answering Aggregative Questions
par: Koshorek, Omri, et autres
Publié: (2025)
par: Koshorek, Omri, et autres
Publié: (2025)
OmniAudio: Generating Spatial Audio from 360-Degree Video
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
Extending Embodied Question Answering from Perception to Decision
par: Gong, Xicheng, et autres
Publié: (2026)
par: Gong, Xicheng, et autres
Publié: (2026)
GROUNDEDKG-RAG: Grounded Knowledge Graph Index for Long-document Question Answering
par: Zhang, Tianyi, et autres
Publié: (2026)
par: Zhang, Tianyi, et autres
Publié: (2026)
Towards Agentic RAG with Deep Reasoning: A Survey of RAG-Reasoning Systems in LLMs
par: Li, Yangning, et autres
Publié: (2025)
par: Li, Yangning, et autres
Publié: (2025)
FoRAG: Factuality-optimized Retrieval Augmented Generation for Web-enhanced Long-form Question Answering
par: Cai, Tianchi, et autres
Publié: (2024)
par: Cai, Tianchi, et autres
Publié: (2024)
Narrative Aligned Long Form Video Question Answering
par: Jain, Rahul, et autres
Publié: (2026)
par: Jain, Rahul, et autres
Publié: (2026)
TSVC:Tripartite Learning with Semantic Variation Consistency for Robust Image-Text Retrieval
par: Lyu, Shuai, et autres
Publié: (2025)
par: Lyu, Shuai, et autres
Publié: (2025)
Traceable Cross-Source RAG for Chinese Tibetan Medicine Question Answering
par: Chen, Fengxian, et autres
Publié: (2026)
par: Chen, Fengxian, et autres
Publié: (2026)
Documents similaires
-
Active Perception Agent for Omnimodal Audio-Video Understanding
par: Tao, Keda, et autres
Publié: (2025) -
Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning
par: Zhang, Zhicheng, et autres
Publié: (2026) -
KBQA-o1: Agentic Knowledge Base Question Answering with Monte Carlo Tree Search
par: Luo, Haoran, et autres
Publié: (2025) -
LongAudio-RAG: Event-Grounded Question Answering over Multi-Hour Long Audio
par: Vakada, Naveen, et autres
Publié: (2026) -
ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models
par: Xue, Kaiwen, et autres
Publié: (2026)