OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Shuang, Feng, Kaituo, Chen, Hangting, Huang, Wenxuan, Dai, Dasen, Shou, Quanxin, Lin, Yunlong, Yue, Xiangyu, Gao, Shenghua, Pang, Tianyu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MTA-Agent: An Open Recipe for Multimodal Deep Search Agents
par: Peng, Xiangyu, et autres
Publié: (2026)
par: Peng, Xiangyu, et autres
Publié: (2026)
Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis
par: Chen, Shuang, et autres
Publié: (2026)
par: Chen, Shuang, et autres
Publié: (2026)
Plug Your Users into Library Resources with OpenSearch Plug-Ins
par: Baker, Nicholas C.
Publié: (2007)
par: Baker, Nicholas C.
Publié: (2007)
OpenSearch-SQL: Enhancing Text-to-SQL with Dynamic Few-shot and Consistency Alignment
par: Xie, Xiangjin, et autres
Publié: (2025)
par: Xie, Xiangjin, et autres
Publié: (2025)
A Cloud-Native Architecture for Human-in-Control LLM-Assisted OpenSearch in Investigative Settings
par: Puhani, Benjamin, et autres
Publié: (2026)
par: Puhani, Benjamin, et autres
Publié: (2026)
Gen-Searcher: Reinforcing Agentic Search for Image Generation
par: Feng, Kaituo, et autres
Publié: (2026)
par: Feng, Kaituo, et autres
Publié: (2026)
OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe
par: Zhang, Kaichen, et autres
Publié: (2025)
par: Zhang, Kaichen, et autres
Publié: (2025)
SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward
par: Fan, Kaixuan, et autres
Publié: (2025)
par: Fan, Kaixuan, et autres
Publié: (2025)
InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models
par: Zhu, Jinguo, et autres
Publié: (2025)
par: Zhu, Jinguo, et autres
Publié: (2025)
OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data
par: Du, Yuwen, et autres
Publié: (2026)
par: Du, Yuwen, et autres
Publié: (2026)
From Web to Pixels: Bringing Agentic Search into Visual Perception
par: Yang, Bokang, et autres
Publié: (2026)
par: Yang, Bokang, et autres
Publié: (2026)
Open Deep Search: Democratizing Search with Open-source Reasoning Agents
par: Alzubi, Salaheddin, et autres
Publié: (2025)
par: Alzubi, Salaheddin, et autres
Publié: (2025)
OpenGame: Open Agentic Coding for Games
par: Jiang, Yilei, et autres
Publié: (2026)
par: Jiang, Yilei, et autres
Publié: (2026)
NVLM: Open Frontier-Class Multimodal LLMs
par: Dai, Wenliang, et autres
Publié: (2024)
par: Dai, Wenliang, et autres
Publié: (2024)
Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines
par: Zhang, Zhixin, et autres
Publié: (2024)
par: Zhang, Zhixin, et autres
Publié: (2024)
Lumine: An Open Recipe for Building Generalist Agents in 3D Open Worlds
par: Tan, Weihao, et autres
Publié: (2025)
par: Tan, Weihao, et autres
Publié: (2025)
InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
par: Wang, Weiyun, et autres
Publié: (2025)
par: Wang, Weiyun, et autres
Publié: (2025)
Flow-OPD: On-Policy Distillation for Flow Matching Models
par: Fang, Zhen, et autres
Publié: (2026)
par: Fang, Zhen, et autres
Publié: (2026)
Exploring Reasoning Reward Model for Agents
par: Fan, Kaixuan, et autres
Publié: (2026)
par: Fan, Kaixuan, et autres
Publié: (2026)
Advancing the Search Frontier with AI Agents
par: White, Ryen W.
Publié: (2023)
par: White, Ryen W.
Publié: (2023)
DeepDiver: Adaptive Search Intensity Scaling via Open-Web Reinforcement Learning
par: Shi, Wenxuan, et autres
Publié: (2025)
par: Shi, Wenxuan, et autres
Publié: (2025)
A Survey on Open Dataset Search in the LLM Era: Retrospectives and Perspectives
par: Li, Pengyue, et autres
Publié: (2025)
par: Li, Pengyue, et autres
Publié: (2025)
Open-Qwen2VL: Compute-Efficient Pre-Training of Fully-Open Multimodal LLMs on Academic Resources
par: Wang, Weizhi, et autres
Publié: (2025)
par: Wang, Weizhi, et autres
Publié: (2025)
CodeScout: An Effective Recipe for Reinforcement Learning of Code Search Agents
par: Sutawika, Lintang, et autres
Publié: (2026)
par: Sutawika, Lintang, et autres
Publié: (2026)
Vero: An Open RL Recipe for General Visual Reasoning
par: Sarch, Gabriel, et autres
Publié: (2026)
par: Sarch, Gabriel, et autres
Publié: (2026)
Pailitao-VL: Unified Embedding and Reranker for Real-Time Multi-Modal Industrial Search
par: Chen, Lei, et autres
Publié: (2026)
par: Chen, Lei, et autres
Publié: (2026)
O$^2$-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question Answering
par: Mei, Jianbiao, et autres
Publié: (2025)
par: Mei, Jianbiao, et autres
Publié: (2025)
OpenThoughts: Data Recipes for Reasoning Models
par: Guha, Etash, et autres
Publié: (2025)
par: Guha, Etash, et autres
Publié: (2025)
LitSearch: A Retrieval Benchmark for Scientific Literature Search
par: Ajith, Anirudh, et autres
Publié: (2024)
par: Ajith, Anirudh, et autres
Publié: (2024)
Search Self-play: Pushing the Frontier of Agent Capability without Supervision
par: Lu, Hongliang, et autres
Publié: (2025)
par: Lu, Hongliang, et autres
Publié: (2025)
OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories
par: Du, Yuwen, et autres
Publié: (2026)
par: Du, Yuwen, et autres
Publié: (2026)
Fleming-VL: Towards Universal Medical Visual Reasoning with Multimodal LLMs
par: Shu, Yan, et autres
Publié: (2025)
par: Shu, Yan, et autres
Publié: (2025)
Digital Collections Explorer: An Open-Source, Multimodal Viewer for Searching Digital Collections
par: Huang, Ying-Hsiang, et autres
Publié: (2025)
par: Huang, Ying-Hsiang, et autres
Publié: (2025)
ManuSearch: Democratizing Deep Search in Large Language Models with a Transparent and Open Multi-Agent Framework
par: Huang, Lisheng, et autres
Publié: (2025)
par: Huang, Lisheng, et autres
Publié: (2025)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
par: Ye, Jiacheng, et autres
Publié: (2025)
par: Ye, Jiacheng, et autres
Publié: (2025)
DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents
par: Wang, Shengqin, et autres
Publié: (2026)
par: Wang, Shengqin, et autres
Publié: (2026)
Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents
par: Huang, Shijue, et autres
Publié: (2026)
par: Huang, Shijue, et autres
Publié: (2026)
Plan Before Search: Search Agents Need Plan
par: Qian, Zhipeng, et autres
Publié: (2026)
par: Qian, Zhipeng, et autres
Publié: (2026)
Open, to What End? A Capability-Theoretic Perspective on Open Search
par: Neophytou, Nicola, et autres
Publié: (2026)
par: Neophytou, Nicola, et autres
Publié: (2026)
ThinkDial: An Open Recipe for Controlling Reasoning Effort in Large Language Models
par: He, Qianyu, et autres
Publié: (2025)
par: He, Qianyu, et autres
Publié: (2025)
Documents similaires
-
MTA-Agent: An Open Recipe for Multimodal Deep Search Agents
par: Peng, Xiangyu, et autres
Publié: (2026) -
Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis
par: Chen, Shuang, et autres
Publié: (2026) -
Plug Your Users into Library Resources with OpenSearch Plug-Ins
par: Baker, Nicholas C.
Publié: (2007) -
OpenSearch-SQL: Enhancing Text-to-SQL with Dynamic Few-shot and Consistency Alignment
par: Xie, Xiangjin, et autres
Publié: (2025) -
A Cloud-Native Architecture for Human-in-Control LLM-Assisted OpenSearch in Investigative Settings
par: Puhani, Benjamin, et autres
Publié: (2026)