Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Huang, Shijue, Guo, Hangyu, Li, Chenxin, Lu, Junting, Geng, Xinyu, Su, Zhaochen, Li, Zhenyu, Chen, Shuang, Wang, Hongru, Fung, Yi R. |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios
von: Su, Zhaochen, et al.
Veröffentlicht: (2026)
von: Su, Zhaochen, et al.
Veröffentlicht: (2026)
AdaCtrl: Towards Adaptive and Controllable Reasoning via Difficulty-Aware Budgeting
von: Huang, Shijue, et al.
Veröffentlicht: (2025)
von: Huang, Shijue, et al.
Veröffentlicht: (2025)
XSkill: Continual Learning from Experience and Skills in Multimodal Agents
von: Jiang, Guanyu, et al.
Veröffentlicht: (2026)
von: Jiang, Guanyu, et al.
Veröffentlicht: (2026)
CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents
von: Liu, Jiayu, et al.
Veröffentlicht: (2025)
von: Liu, Jiayu, et al.
Veröffentlicht: (2025)
VisBrowse-Bench: Benchmarking Visual-Native Search for Multimodal Browsing Agents
von: Zhang, Zhengbo, et al.
Veröffentlicht: (2026)
von: Zhang, Zhengbo, et al.
Veröffentlicht: (2026)
Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers
von: Su, Zhaochen, et al.
Veröffentlicht: (2025)
von: Su, Zhaochen, et al.
Veröffentlicht: (2025)
Efficient Multimodal Planning Agent for Visual Question-Answering
von: Chen, Zhuo, et al.
Veröffentlicht: (2026)
von: Chen, Zhuo, et al.
Veröffentlicht: (2026)
SELF-REDRAFT: Eliciting Intrinsic Exploration-Exploitation Balance in Test-Time Scaling for Code Generation
von: Chen, Yixiang, et al.
Veröffentlicht: (2025)
von: Chen, Yixiang, et al.
Veröffentlicht: (2025)
GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents
von: V Team, et al.
Veröffentlicht: (2026)
von: V Team, et al.
Veröffentlicht: (2026)
SDIF-DA: A Shallow-to-Deep Interaction Framework with Data Augmentation for Multi-modal Intent Detection
von: Huang, Shijue, et al.
Veröffentlicht: (2023)
von: Huang, Shijue, et al.
Veröffentlicht: (2023)
CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception
von: Li, Liupeng, et al.
Veröffentlicht: (2026)
von: Li, Liupeng, et al.
Veröffentlicht: (2026)
Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows
von: Li, Chenxin, et al.
Veröffentlicht: (2026)
von: Li, Chenxin, et al.
Veröffentlicht: (2026)
ARES: Multimodal Adaptive Reasoning via Difficulty-Aware Token-Level Entropy Shaping
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
Towards General Multimodal Visual Tracking
von: Lu, Andong, et al.
Veröffentlicht: (2025)
von: Lu, Andong, et al.
Veröffentlicht: (2025)
MMSkills: Towards Multimodal Skills for General Visual Agents
von: Zhang, Kangning, et al.
Veröffentlicht: (2026)
von: Zhang, Kangning, et al.
Veröffentlicht: (2026)
DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RL
von: Lu, Rui, et al.
Veröffentlicht: (2025)
von: Lu, Rui, et al.
Veröffentlicht: (2025)
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
von: Li, Yifan, et al.
Veröffentlicht: (2024)
von: Li, Yifan, et al.
Veröffentlicht: (2024)
Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
"Less is More": Reducing Cognitive Load and Task Drift in Real-Time Multimodal Assistive Agents for the Visually Impaired
von: Zhao, Yi, et al.
Veröffentlicht: (2025)
von: Zhao, Yi, et al.
Veröffentlicht: (2025)
Towards Trustworthy Multimodal Moderation via Policy-Aligned Reasoning and Hierarchical Labeling
von: Li, Anqi, et al.
Veröffentlicht: (2025)
von: Li, Anqi, et al.
Veröffentlicht: (2025)
Toward Native Multimodal Modeling: A Roadmap
von: An, Siyu, et al.
Veröffentlicht: (2026)
von: An, Siyu, et al.
Veröffentlicht: (2026)
LEMMA: Towards LVLM-Enhanced Multimodal Misinformation Detection with External Knowledge Augmentation
von: Xuan, Keyang, et al.
Veröffentlicht: (2024)
von: Xuan, Keyang, et al.
Veröffentlicht: (2024)
GEMS: Agent-Native Multimodal Generation with Memory and Skills
von: He, Zefeng, et al.
Veröffentlicht: (2026)
von: He, Zefeng, et al.
Veröffentlicht: (2026)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
TreeRL: LLM Reinforcement Learning with On-Policy Tree Search
von: Hou, Zhenyu, et al.
Veröffentlicht: (2025)
von: Hou, Zhenyu, et al.
Veröffentlicht: (2025)
HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents
von: Li, Guankai, et al.
Veröffentlicht: (2026)
von: Li, Guankai, et al.
Veröffentlicht: (2026)
Code Evolution for Control: Synthesizing Policies via LLM-Driven Evolutionary Search
von: Guo, Ping, et al.
Veröffentlicht: (2026)
von: Guo, Ping, et al.
Veröffentlicht: (2026)
MTA-Agent: An Open Recipe for Multimodal Deep Search Agents
von: Peng, Xiangyu, et al.
Veröffentlicht: (2026)
von: Peng, Xiangyu, et al.
Veröffentlicht: (2026)
DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories
von: Deng, Chenlong, et al.
Veröffentlicht: (2026)
von: Deng, Chenlong, et al.
Veröffentlicht: (2026)
Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence
von: Dong, Guanting, et al.
Veröffentlicht: (2026)
von: Dong, Guanting, et al.
Veröffentlicht: (2026)
Multimodal Policy Internalization for Conversational Agents
von: Wang, Zhenhailong, et al.
Veröffentlicht: (2025)
von: Wang, Zhenhailong, et al.
Veröffentlicht: (2025)
OmniGAIA: Towards Native Omni-Modal AI Agents
von: Li, Xiaoxi, et al.
Veröffentlicht: (2026)
von: Li, Xiaoxi, et al.
Veröffentlicht: (2026)
Towards Multimodal Query-Based Spatial Audio Source Extraction
von: Yu, Chenxin, et al.
Veröffentlicht: (2025)
von: Yu, Chenxin, et al.
Veröffentlicht: (2025)
MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents
von: Tao, Xijia, et al.
Veröffentlicht: (2025)
von: Tao, Xijia, et al.
Veröffentlicht: (2025)
On Group Relative Policy Optimization Collapse in Agent Search: The Lazy Likelihood-Displacement
von: Deng, Wenlong, et al.
Veröffentlicht: (2025)
von: Deng, Wenlong, et al.
Veröffentlicht: (2025)
Environment Scaling for Interactive Agentic Experience Collection: A Survey
von: Huang, Yuchen, et al.
Veröffentlicht: (2025)
von: Huang, Yuchen, et al.
Veröffentlicht: (2025)
UI-TARS: Pioneering Automated GUI Interaction with Native Agents
von: Qin, Yujia, et al.
Veröffentlicht: (2025)
von: Qin, Yujia, et al.
Veröffentlicht: (2025)
OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents
von: Chen, Shuang, et al.
Veröffentlicht: (2026)
von: Chen, Shuang, et al.
Veröffentlicht: (2026)
GenArtist: Multimodal LLM as an Agent for Unified Image Generation and Editing
von: Wang, Zhenyu, et al.
Veröffentlicht: (2024)
von: Wang, Zhenyu, et al.
Veröffentlicht: (2024)
Disentangling Homophily and Heterophily in Multimodal Graph Clustering
von: Guo, Zhaochen, et al.
Veröffentlicht: (2025)
von: Guo, Zhaochen, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios
von: Su, Zhaochen, et al.
Veröffentlicht: (2026) -
AdaCtrl: Towards Adaptive and Controllable Reasoning via Difficulty-Aware Budgeting
von: Huang, Shijue, et al.
Veröffentlicht: (2025) -
XSkill: Continual Learning from Experience and Skills in Multimodal Agents
von: Jiang, Guanyu, et al.
Veröffentlicht: (2026) -
CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents
von: Liu, Jiayu, et al.
Veröffentlicht: (2025) -
VisBrowse-Bench: Benchmarking Visual-Native Search for Multimodal Browsing Agents
von: Zhang, Zhengbo, et al.
Veröffentlicht: (2026)