DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Shengqin, Yan, Wentao, Zhou, Huichi, Chen, Yihang, Shao, Kun, Zhang, Zhizhong, Xie, Yuan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards
von: Yan, Wentao, et al.
Veröffentlicht: (2026)
von: Yan, Wentao, et al.
Veröffentlicht: (2026)
DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search
von: Narayan, Kartik, et al.
Veröffentlicht: (2025)
von: Narayan, Kartik, et al.
Veröffentlicht: (2025)
MMSearch-R1: Incentivizing LMMs to Search
von: Wu, Jinming, et al.
Veröffentlicht: (2025)
von: Wu, Jinming, et al.
Veröffentlicht: (2025)
MTA-Agent: An Open Recipe for Multimodal Deep Search Agents
von: Peng, Xiangyu, et al.
Veröffentlicht: (2026)
von: Peng, Xiangyu, et al.
Veröffentlicht: (2026)
GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning
von: Jiang, Kaixun, et al.
Veröffentlicht: (2026)
von: Jiang, Kaixun, et al.
Veröffentlicht: (2026)
Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory
von: Long, Lin, et al.
Veröffentlicht: (2025)
von: Long, Lin, et al.
Veröffentlicht: (2025)
MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences
von: Wang, Shijian, et al.
Veröffentlicht: (2026)
von: Wang, Shijian, et al.
Veröffentlicht: (2026)
MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines
von: Jiang, Dongzhi, et al.
Veröffentlicht: (2024)
von: Jiang, Dongzhi, et al.
Veröffentlicht: (2024)
CiQi-Agent: Aligning Vision, Tools and Aesthetics in Multimodal Agent for Cultural Reasoning on Chinese Porcelains
von: Wang, Wenhan, et al.
Veröffentlicht: (2026)
von: Wang, Wenhan, et al.
Veröffentlicht: (2026)
OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents
von: Chen, Shuang, et al.
Veröffentlicht: (2026)
von: Chen, Shuang, et al.
Veröffentlicht: (2026)
DEMOS: Dynamic Environment Motion Synthesis in 3D Scenes via Local Spherical-BEV Perception
von: Gong, Jingyu, et al.
Veröffentlicht: (2024)
von: Gong, Jingyu, et al.
Veröffentlicht: (2024)
AffectAgent: Collaborative Multi-Agent Reasoning for Retrieval-Augmented Multimodal Emotion Recognition
von: Wang, Zeheng, et al.
Veröffentlicht: (2026)
von: Wang, Zeheng, et al.
Veröffentlicht: (2026)
OracleAgent: A Multimodal Reasoning Agent for Oracle Bone Script Research
von: Li, Caoshuo, et al.
Veröffentlicht: (2025)
von: Li, Caoshuo, et al.
Veröffentlicht: (2025)
HiconAgent: History Context-aware Policy Optimization for GUI Agents
von: Zhou, Xurui, et al.
Veröffentlicht: (2025)
von: Zhou, Xurui, et al.
Veröffentlicht: (2025)
Towards Top-Down Reasoning: An Explainable Multi-Agent Approach for Visual Question Answering
von: Wang, Zeqing, et al.
Veröffentlicht: (2023)
von: Wang, Zeqing, et al.
Veröffentlicht: (2023)
VSearcher: Long-Horizon Multimodal Search Agent via Reinforcement Learning
von: Zhang, Ruiyang, et al.
Veröffentlicht: (2026)
von: Zhang, Ruiyang, et al.
Veröffentlicht: (2026)
PresentAgent: Multimodal Agent for Presentation Video Generation
von: Shi, Jingwei, et al.
Veröffentlicht: (2025)
von: Shi, Jingwei, et al.
Veröffentlicht: (2025)
UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist
von: Liang, Zhengyang, et al.
Veröffentlicht: (2025)
von: Liang, Zhengyang, et al.
Veröffentlicht: (2025)
Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks
von: Jin, Jing, et al.
Veröffentlicht: (2026)
von: Jin, Jing, et al.
Veröffentlicht: (2026)
MIRA: Multimodal Iterative Reasoning Agent for Image Editing
von: Zeng, Ziyun, et al.
Veröffentlicht: (2025)
von: Zeng, Ziyun, et al.
Veröffentlicht: (2025)
VisBrowse-Bench: Benchmarking Visual-Native Search for Multimodal Browsing Agents
von: Zhang, Zhengbo, et al.
Veröffentlicht: (2026)
von: Zhang, Zhengbo, et al.
Veröffentlicht: (2026)
Geometrically-Constrained Agent for Spatial Reasoning
von: Chen, Zeren, et al.
Veröffentlicht: (2025)
von: Chen, Zeren, et al.
Veröffentlicht: (2025)
EvoEmpirBench: Dynamic Spatial Reasoning with Agent-ExpVer
von: Zhao, Pukun, et al.
Veröffentlicht: (2025)
von: Zhao, Pukun, et al.
Veröffentlicht: (2025)
Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation
von: Shi, Yudi, et al.
Veröffentlicht: (2024)
von: Shi, Yudi, et al.
Veröffentlicht: (2024)
VideoAgent2: Enhancing the LLM-Based Agent System for Long-Form Video Understanding by Uncertainty-Aware CoT
von: Zhi, Zhuo, et al.
Veröffentlicht: (2025)
von: Zhi, Zhuo, et al.
Veröffentlicht: (2025)
HATS: Hardness-Aware Trajectory Synthesis for GUI Agents
von: Shao, Rui, et al.
Veröffentlicht: (2026)
von: Shao, Rui, et al.
Veröffentlicht: (2026)
Task-Focused Memorization for Multimodal Agents
von: Zou, Tao, et al.
Veröffentlicht: (2026)
von: Zou, Tao, et al.
Veröffentlicht: (2026)
A Multi-Agent Framework with Structured Reasoning and Reflective Refinement for Multimodal Empathetic Response Generation
von: Wang, Liping, et al.
Veröffentlicht: (2026)
von: Wang, Liping, et al.
Veröffentlicht: (2026)
MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning
von: Gao, Tianhong, et al.
Veröffentlicht: (2025)
von: Gao, Tianhong, et al.
Veröffentlicht: (2025)
DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories
von: Deng, Chenlong, et al.
Veröffentlicht: (2026)
von: Deng, Chenlong, et al.
Veröffentlicht: (2026)
Beyond the Label Itself: Latent Labels Enhance Semi-supervised Point Cloud Panoptic Segmentation
von: Chen, Yujun, et al.
Veröffentlicht: (2023)
von: Chen, Yujun, et al.
Veröffentlicht: (2023)
MSRAMIE: Multimodal Structured Reasoning Agent for Multi-instruction Image Editing
von: Qiu, Zhaoyuan, et al.
Veröffentlicht: (2026)
von: Qiu, Zhaoyuan, et al.
Veröffentlicht: (2026)
Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis
von: Chen, Shuang, et al.
Veröffentlicht: (2026)
von: Chen, Shuang, et al.
Veröffentlicht: (2026)
Unlocking the Potential of Difficulty Prior in RL-based Multimodal Reasoning
von: Chen, Mingrui, et al.
Veröffentlicht: (2025)
von: Chen, Mingrui, et al.
Veröffentlicht: (2025)
MMA: Multimodal Memory Agent
von: Lu, Yihao, et al.
Veröffentlicht: (2026)
von: Lu, Yihao, et al.
Veröffentlicht: (2026)
TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents
von: Zhang, Bofei, et al.
Veröffentlicht: (2025)
von: Zhang, Bofei, et al.
Veröffentlicht: (2025)
Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models
von: Zhou, Andy, et al.
Veröffentlicht: (2023)
von: Zhou, Andy, et al.
Veröffentlicht: (2023)
DR$^2$Seg: Decomposed Two-Stage Rollouts for Efficient Reasoning Segmentation in Multimodal Large Language Models
von: He, Yulin, et al.
Veröffentlicht: (2026)
von: He, Yulin, et al.
Veröffentlicht: (2026)
Large Multimodal Agents: A Survey
von: Xie, Junlin, et al.
Veröffentlicht: (2024)
von: Xie, Junlin, et al.
Veröffentlicht: (2024)
FineQuest: Adaptive Knowledge-Assisted Sports Video Understanding via Agent-of-Thoughts Reasoning
von: Chen, Haodong, et al.
Veröffentlicht: (2025)
von: Chen, Haodong, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards
von: Yan, Wentao, et al.
Veröffentlicht: (2026) -
DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search
von: Narayan, Kartik, et al.
Veröffentlicht: (2025) -
MMSearch-R1: Incentivizing LMMs to Search
von: Wu, Jinming, et al.
Veröffentlicht: (2025) -
MTA-Agent: An Open Recipe for Multimodal Deep Search Agents
von: Peng, Xiangyu, et al.
Veröffentlicht: (2026) -
GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning
von: Jiang, Kaixun, et al.
Veröffentlicht: (2026)