MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Shilong, Bu, Xingyuan, Wang, Wenjie, Liu, Jiaheng, Dong, Jun, He, Haoyang, Lu, Hao, Zhang, Haozhe, Jing, Chenchen, Li, Zhen, Li, Chuanhao, Tian, Jiayi, Zhang, Chenchen, Peng, Tianhao, He, Yancheng, Gu, Jihao, Zhang, Yuanxing, Yang, Jian, Zhang, Ge, Huang, Wenhao, Zhou, Wangchunshu, Zhang, Zhaoxiang, Ding, Ruizhe, Wen, Shilei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
BrowseComp-$V^3$: A Visual, Vertical, and Verifiable Benchmark for Multimodal Browsing Agents
by: Zhang, Huanyao, et al.
Published: (2026)
by: Zhang, Huanyao, et al.
Published: (2026)
BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents
by: Wei, Jason, et al.
Published: (2025)
by: Wei, Jason, et al.
Published: (2025)
BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese
by: Zhou, Peilin, et al.
Published: (2025)
by: Zhou, Peilin, et al.
Published: (2025)
K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts
by: Lee, Nahyun, et al.
Published: (2026)
by: Lee, Nahyun, et al.
Published: (2026)
BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent
by: Chen, Zijian, et al.
Published: (2025)
by: Chen, Zijian, et al.
Published: (2025)
VisBrowse-Bench: Benchmarking Visual-Native Search for Multimodal Browsing Agents
by: Zhang, Zhengbo, et al.
Published: (2026)
by: Zhang, Zhengbo, et al.
Published: (2026)
Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning?
by: He, Yancheng, et al.
Published: (2025)
by: He, Yancheng, et al.
Published: (2025)
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
by: Li, Shilong, et al.
Published: (2024)
by: Li, Shilong, et al.
Published: (2024)
DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models
by: Liu, Jianyu, et al.
Published: (2025)
by: Liu, Jianyu, et al.
Published: (2025)
MedBrowseComp: Benchmarking Medical Deep Research and Computer Use
by: Chen, Shan, et al.
Published: (2025)
by: Chen, Shan, et al.
Published: (2025)
Characterizing Unintended Consequences in Human-GUI Agent Collaboration for Web Browsing
by: Zhang, Shuning, et al.
Published: (2025)
by: Zhang, Shuning, et al.
Published: (2025)
From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models
by: Zhang, Chenchen
Published: (2026)
by: Zhang, Chenchen
Published: (2026)
Reinforcement Learning for LLM-based Multi-Agent Systems through Orchestration Traces
by: Zhang, Chenchen
Published: (2026)
by: Zhang, Chenchen
Published: (2026)
BrowseConf: Confidence-Guided Test-Time Scaling for Web Agents
by: Ou, Litu, et al.
Published: (2025)
by: Ou, Litu, et al.
Published: (2025)
Browsing Rooms Redivivus
by: Marks, Susan
Published: (1976)
by: Marks, Susan
Published: (1976)
Search Theory and Browsing
by: Morse, Philip M.
Published: (1970)
by: Morse, Philip M.
Published: (1970)
BrowseSafe: Understanding and Preventing Prompt Injection Within AI Browser Agents
by: Zhang, Kaiyuan, et al.
Published: (2025)
by: Zhang, Kaiyuan, et al.
Published: (2025)
LiveBrowseComp: Are Search Agents Searching, or Just Verifying What They Already Know?
by: Fan, HuiMing, et al.
Published: (2026)
by: Fan, HuiMing, et al.
Published: (2026)
ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
by: Li, Yuhang, et al.
Published: (2025)
by: Li, Yuhang, et al.
Published: (2025)
The Household Impact of Generative AI: Evidence from Internet Browsing Behavior
by: Blank, Michael, et al.
Published: (2026)
by: Blank, Michael, et al.
Published: (2026)
CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models
by: Zhang, Alexander, et al.
Published: (2025)
by: Zhang, Alexander, et al.
Published: (2025)
ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models
by: Wu, Yanan, et al.
Published: (2024)
by: Wu, Yanan, et al.
Published: (2024)
OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-Guided Video Editing
by: He, Haoyang, et al.
Published: (2025)
by: He, Haoyang, et al.
Published: (2025)
Browsing: A Multidimensional Framework.
by: Chang, Shan-Ju, et al.
Published: (1993)
by: Chang, Shan-Ju, et al.
Published: (1993)
Browsing by Numbers and Reading for Points
by: Cregar, Elyse
Published: (2011)
by: Cregar, Elyse
Published: (2011)
BrowseMaster: Towards Scalable Web Browsing via Tool-Augmented Programmatic Agent Pair
by: Pang, Xianghe, et al.
Published: (2025)
by: Pang, Xianghe, et al.
Published: (2025)
MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents
by: Tao, Xijia, et al.
Published: (2025)
by: Tao, Xijia, et al.
Published: (2025)
Branch-and-Browse: Efficient and Controllable Web Exploration with Tree-Structured Reasoning and Action Memory
by: He, Shiqi, et al.
Published: (2025)
by: He, Shiqi, et al.
Published: (2025)
Coding Agents with Multimodal Browsing are Generalist Problem Solvers
by: Soni, Aditya Bharat, et al.
Published: (2025)
by: Soni, Aditya Bharat, et al.
Published: (2025)
Browse and Concentrate: Comprehending Multimodal Content via prior-LLM Context Fusion
by: Wang, Ziyue, et al.
Published: (2024)
by: Wang, Ziyue, et al.
Published: (2024)
A Tool to Facilitate Web-Browsing
by: Kelly, Christopher, et al.
Published: (2024)
by: Kelly, Christopher, et al.
Published: (2024)
The Hidden Dangers of Browsing AI Agents
by: Mudryi, Mykyta, et al.
Published: (2025)
by: Mudryi, Mykyta, et al.
Published: (2025)
Browsing behavior exposes identities on the Web
by: Oliveira, Marcos, et al.
Published: (2023)
by: Oliveira, Marcos, et al.
Published: (2023)
Browsing of E-Journals by Engineering Faculty
by: Bennett, Denise Beaubien, et al.
Published: (2010)
by: Bennett, Denise Beaubien, et al.
Published: (2010)
Browsing through Public Access Catalogs.
by: Beheshti, Jamshid
Published: (1992)
by: Beheshti, Jamshid
Published: (1992)
Observations of Browsing Behavior in an Academic Library.
by: Ross, Johanna
Published: (1983)
by: Ross, Johanna
Published: (1983)
Token Preference Optimization with Self-Calibrated Visual-Anchored Rewards for Hallucination Mitigation
by: Gu, Jihao, et al.
Published: (2024)
by: Gu, Jihao, et al.
Published: (2024)
Vibe AIGC: A New Paradigm for Content Generation via Agentic Orchestration
by: Liu, Jiaheng, et al.
Published: (2026)
by: Liu, Jiaheng, et al.
Published: (2026)
Preprint: Poster: Did I Just Browse A Website Written by LLMs?
by: He, Sichang Steven, et al.
Published: (2025)
by: He, Sichang Steven, et al.
Published: (2025)
Lycorine: From Extraction and Synthesis to Formulation Development—Research Challenges and Advances in Pharmacological Mechanisms and Clinical Translation
by: Cong Zhang, et al.
Published: (2026)
by: Cong Zhang, et al.
Published: (2026)
Similar Items
-
BrowseComp-$V^3$: A Visual, Vertical, and Verifiable Benchmark for Multimodal Browsing Agents
by: Zhang, Huanyao, et al.
Published: (2026) -
BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents
by: Wei, Jason, et al.
Published: (2025) -
BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese
by: Zhou, Peilin, et al.
Published: (2025) -
K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts
by: Lee, Nahyun, et al.
Published: (2026) -
BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent
by: Chen, Zijian, et al.
Published: (2025)