VISOR: Agentic Visual Retrieval-Augmented Generation via Iterative Search and Over-horizon Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shen, Yucheng, Wu, Jiulong, Huang, Jizhou, Yin, Dawei, Yan, Lingyong, Cao, Min |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Facial-R1: Aligning Reasoning and Recognition for Facial Emotion Analysis
par: Wu, Jiulong, et autres
Publié: (2025)
par: Wu, Jiulong, et autres
Publié: (2025)
Mitigating Hallucinations in Large Vision-Language Models via Entity-Centric Multimodal Preference Optimization
par: Wu, Jiulong, et autres
Publié: (2025)
par: Wu, Jiulong, et autres
Publié: (2025)
MAO-ARAG: Multi-Agent Orchestration for Adaptive Retrieval-Augmented Generation
par: Chen, Yiqun, et autres
Publié: (2025)
par: Chen, Yiqun, et autres
Publié: (2025)
Adversarial Yet Cooperative: Multi-Perspective Reasoning in Retrieved-Augmented Language Models
par: Xu, Can, et autres
Publié: (2026)
par: Xu, Can, et autres
Publié: (2026)
Beyond End-to-End Video Models: An LLM-Based Multi-Agent System for Educational Video Generation
par: Yan, Lingyong, et autres
Publié: (2026)
par: Yan, Lingyong, et autres
Publié: (2026)
MAIR: A Massive Benchmark for Evaluating Instructed Retrieval
par: Sun, Weiwei, et autres
Publié: (2024)
par: Sun, Weiwei, et autres
Publié: (2024)
ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents
par: Wang, Qiuchen, et autres
Publié: (2025)
par: Wang, Qiuchen, et autres
Publié: (2025)
GRAF: Multi-turn Jailbreaking via Global Refinement and Active Fabrication
par: Tang, Hua, et autres
Publié: (2025)
par: Tang, Hua, et autres
Publié: (2025)
ATM: Adversarial Tuning Multi-agent System Makes a Robust Retrieval-Augmented Generator
par: Zhu, Junda, et autres
Publié: (2024)
par: Zhu, Junda, et autres
Publié: (2024)
Towards Long-horizon Agentic Multimodal Search
par: Du, Yifan, et autres
Publié: (2026)
par: Du, Yifan, et autres
Publié: (2026)
Iterative Self-Incentivization Empowers Large Language Models as Agentic Searchers
par: Shi, Zhengliang, et autres
Publié: (2025)
par: Shi, Zhengliang, et autres
Publié: (2025)
VISOR: VIsual Spatial Object Reasoning for Language-driven Object Navigation
par: Taioli, Francesco, et autres
Publié: (2026)
par: Taioli, Francesco, et autres
Publié: (2026)
VISOR++: Universal Visual Inputs based Steering for Large Vision Language Models
par: Balakrishnan, Ravikumar, et autres
Publié: (2025)
par: Balakrishnan, Ravikumar, et autres
Publié: (2025)
VISOR: Visual Input-based Steering for Output Redirection in Vision-Language Models
par: Phute, Mansi, et autres
Publié: (2025)
par: Phute, Mansi, et autres
Publié: (2025)
QualiRAG: Retrieval-Augmented Generation for Visual Quality Understanding
par: Cao, Linhan, et autres
Publié: (2026)
par: Cao, Linhan, et autres
Publié: (2026)
VideoRAG: Retrieval-Augmented Generation with Extreme Long-Context Videos
par: Ren, Xubin, et autres
Publié: (2025)
par: Ren, Xubin, et autres
Publié: (2025)
ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning
par: Liu, Shifeng, et autres
Publié: (2026)
par: Liu, Shifeng, et autres
Publié: (2026)
Enhancing Image Quality Assessment Ability of LMMs via Retrieval-Augmented Generation
par: Fu, Kang, et autres
Publié: (2026)
par: Fu, Kang, et autres
Publié: (2026)
Visual-RAG: Benchmarking Text-to-Image Retrieval Augmented Generation for Visual Knowledge Intensive Queries
par: Wu, Yin, et autres
Publié: (2025)
par: Wu, Yin, et autres
Publié: (2025)
Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation
par: Liu, Peiyang, et autres
Publié: (2026)
par: Liu, Peiyang, et autres
Publié: (2026)
ProCrit: Self-Elicited Multi-Perspective Reasoning with Critic-Guided Revision for Multimodal Sarcasm Detection
par: Xu, Yingjia, et autres
Publié: (2026)
par: Xu, Yingjia, et autres
Publié: (2026)
AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning
par: Xue, Junxiao, et autres
Publié: (2026)
par: Xue, Junxiao, et autres
Publié: (2026)
GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization
par: Wang, Yikun, et autres
Publié: (2025)
par: Wang, Yikun, et autres
Publié: (2025)
Patho-AgenticRAG: Towards Multimodal Agentic Retrieval-Augmented Generation for Pathology VLMs via Reinforcement Learning
par: Zhang, Wenchuan, et autres
Publié: (2025)
par: Zhang, Wenchuan, et autres
Publié: (2025)
Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic Search
par: Chen, Yiqun, et autres
Publié: (2026)
par: Chen, Yiqun, et autres
Publié: (2026)
Mind-Brush: Integrating Agentic Cognitive Search and Reasoning into Image Generation
par: He, Jun, et autres
Publié: (2026)
par: He, Jun, et autres
Publié: (2026)
MIRROR: Multimodal Iterative Reasoning via Reflection on Visual Regions
par: Zhang, Haoyu, et autres
Publié: (2026)
par: Zhang, Haoyu, et autres
Publié: (2026)
Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding
par: Shen, Xiaoqian, et autres
Publié: (2025)
par: Shen, Xiaoqian, et autres
Publié: (2025)
Retrieval-Augmented Visual Question Answering via Built-in Autoregressive Search Engines
par: Long, Xinwei, et autres
Publié: (2025)
par: Long, Xinwei, et autres
Publié: (2025)
Improving Retrieval-Augmented Generation through Multi-Agent Reinforcement Learning
par: Chen, Yiqun, et autres
Publié: (2025)
par: Chen, Yiqun, et autres
Publié: (2025)
VisRAG 2.0: Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation
par: Sun, Yubo, et autres
Publié: (2025)
par: Sun, Yubo, et autres
Publié: (2025)
Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation
par: Xu, Quanxing, et autres
Publié: (2026)
par: Xu, Quanxing, et autres
Publié: (2026)
Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios
par: Yan, Peizheng, et autres
Publié: (2026)
par: Yan, Peizheng, et autres
Publié: (2026)
Agentic-R: Learning to Retrieve for Agentic Search
par: Liu, Wenhan, et autres
Publié: (2026)
par: Liu, Wenhan, et autres
Publié: (2026)
Reasoning-to-Defend: Safety-Aware Reasoning Can Defend Large Language Models from Jailbreaking
par: Zhu, Junda, et autres
Publié: (2025)
par: Zhu, Junda, et autres
Publié: (2025)
Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering
par: Lim, Su Hyeon, et autres
Publié: (2024)
par: Lim, Su Hyeon, et autres
Publié: (2024)
Retrieval Augmented Recipe Generation
par: Liu, Guoshan, et autres
Publié: (2024)
par: Liu, Guoshan, et autres
Publié: (2024)
Beyond Pixels: Visual Metaphor Transfer via Schema-Driven Agentic Reasoning
par: Xu, Yu, et autres
Publié: (2026)
par: Xu, Yu, et autres
Publié: (2026)
SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning
par: Chng, Yong Xien, et autres
Publié: (2025)
par: Chng, Yong Xien, et autres
Publié: (2025)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
par: Zhou, Yucheng, et autres
Publié: (2024)
par: Zhou, Yucheng, et autres
Publié: (2024)
Documents similaires
-
Facial-R1: Aligning Reasoning and Recognition for Facial Emotion Analysis
par: Wu, Jiulong, et autres
Publié: (2025) -
Mitigating Hallucinations in Large Vision-Language Models via Entity-Centric Multimodal Preference Optimization
par: Wu, Jiulong, et autres
Publié: (2025) -
MAO-ARAG: Multi-Agent Orchestration for Adaptive Retrieval-Augmented Generation
par: Chen, Yiqun, et autres
Publié: (2025) -
Adversarial Yet Cooperative: Multi-Perspective Reasoning in Retrieved-Augmented Language Models
par: Xu, Can, et autres
Publié: (2026) -
Beyond End-to-End Video Models: An LLM-Based Multi-Agent System for Educational Video Generation
par: Yan, Lingyong, et autres
Publié: (2026)