AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios
Fuente:
arXiv
Salvato in:
| Autori principali: | Su, Zhaochen, Gao, Jincheng, Guo, Hangyu, Liu, Zhenhua, Zhang, Lueyang, Geng, Xinyu, Huang, Shijue, Xia, Peng, Jiang, Guanyu, Wang, Cheng, Zhang, Yue, Fung, Yi R., He, Junxian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents
di: Huang, Shijue, et al.
Pubblicazione: (2026)
di: Huang, Shijue, et al.
Pubblicazione: (2026)
XSkill: Continual Learning from Experience and Skills in Multimodal Agents
di: Jiang, Guanyu, et al.
Pubblicazione: (2026)
di: Jiang, Guanyu, et al.
Pubblicazione: (2026)
CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents
di: Liu, Jiayu, et al.
Pubblicazione: (2025)
di: Liu, Jiayu, et al.
Pubblicazione: (2025)
The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
di: Li, Junlong, et al.
Pubblicazione: (2025)
di: Li, Junlong, et al.
Pubblicazione: (2025)
Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers
di: Su, Zhaochen, et al.
Pubblicazione: (2025)
di: Su, Zhaochen, et al.
Pubblicazione: (2025)
Efficient Multimodal Planning Agent for Visual Question-Answering
di: Chen, Zhuo, et al.
Pubblicazione: (2026)
di: Chen, Zhuo, et al.
Pubblicazione: (2026)
AdaCtrl: Towards Adaptive and Controllable Reasoning via Difficulty-Aware Budgeting
di: Huang, Shijue, et al.
Pubblicazione: (2025)
di: Huang, Shijue, et al.
Pubblicazione: (2025)
UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon Scenarios
di: Luo, Haotian, et al.
Pubblicazione: (2025)
di: Luo, Haotian, et al.
Pubblicazione: (2025)
VistaScenario: Interaction Scenario Engineering for Vehicles with Intelligent Systems for Transport Automation
di: Chang, Cheng, et al.
Pubblicazione: (2024)
di: Chang, Cheng, et al.
Pubblicazione: (2024)
VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
NeuroAgent: LLM Agents for Multimodal Neuroimaging Analysis and Research
di: Zhong, Lujia, et al.
Pubblicazione: (2026)
di: Zhong, Lujia, et al.
Pubblicazione: (2026)
Mixture of Finite Mixtures Model for Basket Trial
di: Geng, Junxian, et al.
Pubblicazione: (2020)
di: Geng, Junxian, et al.
Pubblicazione: (2020)
MathChat: Converse to Tackle Challenging Math Problems with LLM Agents
di: Wu, Yiran, et al.
Pubblicazione: (2023)
di: Wu, Yiran, et al.
Pubblicazione: (2023)
Drone Behavior Inspired Optimization: A Multi-Agent Search Algorithm with Local Reconnaissance, Global Collaboration, and Environmental Perturbation
di: Zhang, Jincheng
Pubblicazione: (2025)
di: Zhang, Jincheng
Pubblicazione: (2025)
TrajTok: Technical Report for 2025 Waymo Open Sim Agents Challenge
di: Zhang, Zhiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Zhiyuan, et al.
Pubblicazione: (2025)
Insight Agents: An LLM-Based Multi-Agent System for Data Insights
di: Bai, Jincheng, et al.
Pubblicazione: (2026)
di: Bai, Jincheng, et al.
Pubblicazione: (2026)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
di: Liu, Xiao, et al.
Pubblicazione: (2024)
di: Liu, Xiao, et al.
Pubblicazione: (2024)
DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios
di: Meng, Jinxiang, et al.
Pubblicazione: (2026)
di: Meng, Jinxiang, et al.
Pubblicazione: (2026)
WebGym: Scaling Training Environments for Visual Web Agents with Realistic Tasks
di: Bai, Hao, et al.
Pubblicazione: (2026)
di: Bai, Hao, et al.
Pubblicazione: (2026)
VisBrowse-Bench: Benchmarking Visual-Native Search for Multimodal Browsing Agents
di: Zhang, Zhengbo, et al.
Pubblicazione: (2026)
di: Zhang, Zhengbo, et al.
Pubblicazione: (2026)
Scaling Lifelong Multi-Agent Path Finding to More Realistic Settings: Research Challenges and Opportunities
di: Jiang, He, et al.
Pubblicazione: (2024)
di: Jiang, He, et al.
Pubblicazione: (2024)
GeoVista: Visually Grounded Active Perception for Ultra-High-Resolution Remote Sensing Understanding
di: Zhu, Jiashun, et al.
Pubblicazione: (2026)
di: Zhu, Jiashun, et al.
Pubblicazione: (2026)
MedAgentBench: A Realistic Virtual EHR Environment to Benchmark Medical LLM Agents
di: Jiang, Yixing, et al.
Pubblicazione: (2025)
di: Jiang, Yixing, et al.
Pubblicazione: (2025)
ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows
di: Sun, Qiushi, et al.
Pubblicazione: (2025)
di: Sun, Qiushi, et al.
Pubblicazione: (2025)
MMSkills: Towards Multimodal Skills for General Visual Agents
di: Zhang, Kangning, et al.
Pubblicazione: (2026)
di: Zhang, Kangning, et al.
Pubblicazione: (2026)
Dive into the Agent Matrix: A Realistic Evaluation of Self-Replication Risk in LLM Agents
di: Zhang, Boxuan, et al.
Pubblicazione: (2025)
di: Zhang, Boxuan, et al.
Pubblicazione: (2025)
MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
di: Xia, Peng, et al.
Pubblicazione: (2025)
di: Xia, Peng, et al.
Pubblicazione: (2025)
Grounding Emotion Recognition with Visual Prototypes: VEGA -- Revisiting CLIP in MERC
di: Hu, Guanyu, et al.
Pubblicazione: (2025)
di: Hu, Guanyu, et al.
Pubblicazione: (2025)
EduAgent: Generative Student Agents in Learning
di: Xu, Songlin, et al.
Pubblicazione: (2024)
di: Xu, Songlin, et al.
Pubblicazione: (2024)
LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts
di: Xiao, Yijia, et al.
Pubblicazione: (2024)
di: Xiao, Yijia, et al.
Pubblicazione: (2024)
COVR:Collaborative Optimization of VLMs and RL Agent for Visual-Based Control
di: Xia, Canming, et al.
Pubblicazione: (2026)
di: Xia, Canming, et al.
Pubblicazione: (2026)
SELF-REDRAFT: Eliciting Intrinsic Exploration-Exploitation Balance in Test-Time Scaling for Code Generation
di: Chen, Yixiang, et al.
Pubblicazione: (2025)
di: Chen, Yixiang, et al.
Pubblicazione: (2025)
Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows
di: Yao, Yilun, et al.
Pubblicazione: (2026)
di: Yao, Yilun, et al.
Pubblicazione: (2026)
Jenius Agent: Towards Experience-Driven Accuracy Optimization in Real-World Scenarios
di: Xia, Defei, et al.
Pubblicazione: (2026)
di: Xia, Defei, et al.
Pubblicazione: (2026)
CP-AgentNet: Autonomous and Explainable Communication Protocol Design Using Generative Agents
di: Kwon, Dae Cheol, et al.
Pubblicazione: (2025)
di: Kwon, Dae Cheol, et al.
Pubblicazione: (2025)
Agent Discovery in Internet of Agents: Challenges and Solutions
di: Guo, Shaolong, et al.
Pubblicazione: (2025)
di: Guo, Shaolong, et al.
Pubblicazione: (2025)
Visual Watermarking in the Era of Diffusion Models: Advances and Challenges
di: Duan, Junxian, et al.
Pubblicazione: (2025)
di: Duan, Junxian, et al.
Pubblicazione: (2025)
Targeting the GDF15 Signalling for Obesity Treatment: Recent Advances and Emerging Challenges
di: Jincheng Zhang, et al.
Pubblicazione: (2024)
di: Jincheng Zhang, et al.
Pubblicazione: (2024)
TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity
di: Yang, Zheyuan, et al.
Pubblicazione: (2026)
di: Yang, Zheyuan, et al.
Pubblicazione: (2026)
Check Field Detection Agent (CFD-Agent) using Multimodal Large Language and Vision Language Models
di: Halder, Sourav, et al.
Pubblicazione: (2025)
di: Halder, Sourav, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents
di: Huang, Shijue, et al.
Pubblicazione: (2026) -
XSkill: Continual Learning from Experience and Skills in Multimodal Agents
di: Jiang, Guanyu, et al.
Pubblicazione: (2026) -
CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents
di: Liu, Jiayu, et al.
Pubblicazione: (2025) -
The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
di: Li, Junlong, et al.
Pubblicazione: (2025) -
Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers
di: Su, Zhaochen, et al.
Pubblicazione: (2025)