ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards
Fuente:
arXiv
Saved in:
| Main Authors: | Yan, Wentao, Wang, Shengqin, Zhou, Huichi, Chen, Yihang, Shao, Kun, Xie, Yuan, Zhang, Zhizhong |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents
by: Wang, Shengqin, et al.
Published: (2026)
by: Wang, Shengqin, et al.
Published: (2026)
DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search
by: Narayan, Kartik, et al.
Published: (2025)
by: Narayan, Kartik, et al.
Published: (2025)
MMSearch-R1: Incentivizing LMMs to Search
by: Wu, Jinming, et al.
Published: (2025)
by: Wu, Jinming, et al.
Published: (2025)
MTA-Agent: An Open Recipe for Multimodal Deep Search Agents
by: Peng, Xiangyu, et al.
Published: (2026)
by: Peng, Xiangyu, et al.
Published: (2026)
MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines
by: Jiang, Dongzhi, et al.
Published: (2024)
by: Jiang, Dongzhi, et al.
Published: (2024)
POINTS-Seeker: Towards Training a Multimodal Agentic Search Model from Scratch
by: Liu, Yikun, et al.
Published: (2026)
by: Liu, Yikun, et al.
Published: (2026)
OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents
by: Chen, Shuang, et al.
Published: (2026)
by: Chen, Shuang, et al.
Published: (2026)
Generalizable Object Re-Identification via Visual In-Context Prompting
by: Huang, Zhizhong, et al.
Published: (2025)
by: Huang, Zhizhong, et al.
Published: (2025)
Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory
by: Long, Lin, et al.
Published: (2025)
by: Long, Lin, et al.
Published: (2025)
ProGuard: Towards Proactive Multimodal Safeguard
by: Yu, Shaohan, et al.
Published: (2025)
by: Yu, Shaohan, et al.
Published: (2025)
ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
by: Zhou, Yiyang, et al.
Published: (2025)
by: Zhou, Yiyang, et al.
Published: (2025)
HiconAgent: History Context-aware Policy Optimization for GUI Agents
by: Zhou, Xurui, et al.
Published: (2025)
by: Zhou, Xurui, et al.
Published: (2025)
VideoAgent2: Enhancing the LLM-Based Agent System for Long-Form Video Understanding by Uncertainty-Aware CoT
by: Zhi, Zhuo, et al.
Published: (2025)
by: Zhi, Zhuo, et al.
Published: (2025)
Task-Focused Memorization for Multimodal Agents
by: Zou, Tao, et al.
Published: (2026)
by: Zou, Tao, et al.
Published: (2026)
VSearcher: Long-Horizon Multimodal Search Agent via Reinforcement Learning
by: Zhang, Ruiyang, et al.
Published: (2026)
by: Zhang, Ruiyang, et al.
Published: (2026)
RubricRL: Simple Generalizable Rewards for Text-to-Image Generation
by: Feng, Xuelu, et al.
Published: (2025)
by: Feng, Xuelu, et al.
Published: (2025)
Building a Strong Pre-Training Baseline for Universal 3D Large-Scale Perception
by: Chen, Haoming, et al.
Published: (2024)
by: Chen, Haoming, et al.
Published: (2024)
DEMOS: Dynamic Environment Motion Synthesis in 3D Scenes via Local Spherical-BEV Perception
by: Gong, Jingyu, et al.
Published: (2024)
by: Gong, Jingyu, et al.
Published: (2024)
VisBrowse-Bench: Benchmarking Visual-Native Search for Multimodal Browsing Agents
by: Zhang, Zhengbo, et al.
Published: (2026)
by: Zhang, Zhengbo, et al.
Published: (2026)
Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning
by: Wang, Xiaokun, et al.
Published: (2025)
by: Wang, Xiaokun, et al.
Published: (2025)
TIR-Agent: Training an Explorative and Efficient Agent for Image Restoration
by: Zhang, Yisheng, et al.
Published: (2026)
by: Zhang, Yisheng, et al.
Published: (2026)
UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist
by: Liang, Zhengyang, et al.
Published: (2025)
by: Liang, Zhengyang, et al.
Published: (2025)
PresentAgent: Multimodal Agent for Presentation Video Generation
by: Shi, Jingwei, et al.
Published: (2025)
by: Shi, Jingwei, et al.
Published: (2025)
Generalizable and Explainable Deep Learning for Medical Image Computing: An Overview
by: Chaddad, Ahmad, et al.
Published: (2025)
by: Chaddad, Ahmad, et al.
Published: (2025)
MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences
by: Wang, Shijian, et al.
Published: (2026)
by: Wang, Shijian, et al.
Published: (2026)
ReaSon: Reinforced Causal Search with Information Bottleneck for Video Understanding
by: Zhou, Yuan, et al.
Published: (2025)
by: Zhou, Yuan, et al.
Published: (2025)
MMA: Multimodal Memory Agent
by: Lu, Yihao, et al.
Published: (2026)
by: Lu, Yihao, et al.
Published: (2026)
GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning
by: Jiang, Kaixun, et al.
Published: (2026)
by: Jiang, Kaixun, et al.
Published: (2026)
HATS: Hardness-Aware Trajectory Synthesis for GUI Agents
by: Shao, Rui, et al.
Published: (2026)
by: Shao, Rui, et al.
Published: (2026)
GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping
by: Ma, Teli, et al.
Published: (2024)
by: Ma, Teli, et al.
Published: (2024)
Distilling LLM Prior to Flow Model for Generalizable Agent's Imagination in Object Goal Navigation
by: Li, Badi, et al.
Published: (2025)
by: Li, Badi, et al.
Published: (2025)
CiQi-Agent: Aligning Vision, Tools and Aesthetics in Multimodal Agent for Cultural Reasoning on Chinese Porcelains
by: Wang, Wenhan, et al.
Published: (2026)
by: Wang, Wenhan, et al.
Published: (2026)
RoboScape-R: Unified Reward-Observation World Models for Generalizable Robotics Training via RL
by: Tang, Yinzhou, et al.
Published: (2025)
by: Tang, Yinzhou, et al.
Published: (2025)
DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories
by: Deng, Chenlong, et al.
Published: (2026)
by: Deng, Chenlong, et al.
Published: (2026)
SynAgent: Generalizable Cooperative Humanoid Manipulation via Solo-to-Cooperative Agent Synergy
by: Yao, Wei, et al.
Published: (2026)
by: Yao, Wei, et al.
Published: (2026)
VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding
by: Fan, Yue, et al.
Published: (2024)
by: Fan, Yue, et al.
Published: (2024)
OmniGaze: Reward-inspired Generalizable Gaze Estimation In The Wild
by: Qu, Hongyu, et al.
Published: (2025)
by: Qu, Hongyu, et al.
Published: (2025)
Improving Vision-language Models with Perception-centric Process Reward Models
by: Min, Yingqian, et al.
Published: (2026)
by: Min, Yingqian, et al.
Published: (2026)
Style-Pro: Style-Guided Prompt Learning for Generalizable Vision-Language Models
by: Talemi, Niloufar Alipour, et al.
Published: (2024)
by: Talemi, Niloufar Alipour, et al.
Published: (2024)
Generalizable Dense Reward for Long-Horizon Robotic Tasks
by: Yong, Silong, et al.
Published: (2026)
by: Yong, Silong, et al.
Published: (2026)
Similar Items
-
DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents
by: Wang, Shengqin, et al.
Published: (2026) -
DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search
by: Narayan, Kartik, et al.
Published: (2025) -
MMSearch-R1: Incentivizing LMMs to Search
by: Wu, Jinming, et al.
Published: (2025) -
MTA-Agent: An Open Recipe for Multimodal Deep Search Agents
by: Peng, Xiangyu, et al.
Published: (2026) -
MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines
by: Jiang, Dongzhi, et al.
Published: (2024)