Gespeichert in:
| Hauptverfasser: | Su, Zhaochen, Gao, Jincheng, Guo, Hangyu, Liu, Zhenhua, Zhang, Lueyang, Geng, Xinyu, Huang, Shijue, Xia, Peng, Jiang, Guanyu, Wang, Cheng, Zhang, Yue, Fung, Yi R., He, Junxian |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2602.23166 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents
von: Huang, Shijue, et al.
Veröffentlicht: (2026)
von: Huang, Shijue, et al.
Veröffentlicht: (2026)
XSkill: Continual Learning from Experience and Skills in Multimodal Agents
von: Jiang, Guanyu, et al.
Veröffentlicht: (2026)
von: Jiang, Guanyu, et al.
Veröffentlicht: (2026)
CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents
von: Liu, Jiayu, et al.
Veröffentlicht: (2025)
von: Liu, Jiayu, et al.
Veröffentlicht: (2025)
The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
von: Li, Junlong, et al.
Veröffentlicht: (2025)
von: Li, Junlong, et al.
Veröffentlicht: (2025)
Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers
von: Su, Zhaochen, et al.
Veröffentlicht: (2025)
von: Su, Zhaochen, et al.
Veröffentlicht: (2025)
AdaCtrl: Towards Adaptive and Controllable Reasoning via Difficulty-Aware Budgeting
von: Huang, Shijue, et al.
Veröffentlicht: (2025)
von: Huang, Shijue, et al.
Veröffentlicht: (2025)
Efficient Multimodal Planning Agent for Visual Question-Answering
von: Chen, Zhuo, et al.
Veröffentlicht: (2026)
von: Chen, Zhuo, et al.
Veröffentlicht: (2026)
VistaScenario: Interaction Scenario Engineering for Vehicles with Intelligent Systems for Transport Automation
von: Chang, Cheng, et al.
Veröffentlicht: (2024)
von: Chang, Cheng, et al.
Veröffentlicht: (2024)
UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon Scenarios
von: Luo, Haotian, et al.
Veröffentlicht: (2025)
von: Luo, Haotian, et al.
Veröffentlicht: (2025)
Mixture of Finite Mixtures Model for Basket Trial
von: Geng, Junxian, et al.
Veröffentlicht: (2020)
von: Geng, Junxian, et al.
Veröffentlicht: (2020)
VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks
von: Koh, Jing Yu, et al.
Veröffentlicht: (2024)
von: Koh, Jing Yu, et al.
Veröffentlicht: (2024)
NeuroAgent: LLM Agents for Multimodal Neuroimaging Analysis and Research
von: Zhong, Lujia, et al.
Veröffentlicht: (2026)
von: Zhong, Lujia, et al.
Veröffentlicht: (2026)
MathChat: Converse to Tackle Challenging Math Problems with LLM Agents
von: Wu, Yiran, et al.
Veröffentlicht: (2023)
von: Wu, Yiran, et al.
Veröffentlicht: (2023)
TrajTok: Technical Report for 2025 Waymo Open Sim Agents Challenge
von: Zhang, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Zhiyuan, et al.
Veröffentlicht: (2025)
Insight Agents: An LLM-Based Multi-Agent System for Data Insights
von: Bai, Jincheng, et al.
Veröffentlicht: (2026)
von: Bai, Jincheng, et al.
Veröffentlicht: (2026)
Drone Behavior Inspired Optimization: A Multi-Agent Search Algorithm with Local Reconnaissance, Global Collaboration, and Environmental Perturbation
von: Zhang, Jincheng
Veröffentlicht: (2025)
von: Zhang, Jincheng
Veröffentlicht: (2025)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios
von: Meng, Jinxiang, et al.
Veröffentlicht: (2026)
von: Meng, Jinxiang, et al.
Veröffentlicht: (2026)
WebGym: Scaling Training Environments for Visual Web Agents with Realistic Tasks
von: Bai, Hao, et al.
Veröffentlicht: (2026)
von: Bai, Hao, et al.
Veröffentlicht: (2026)
SELF-REDRAFT: Eliciting Intrinsic Exploration-Exploitation Balance in Test-Time Scaling for Code Generation
von: Chen, Yixiang, et al.
Veröffentlicht: (2025)
von: Chen, Yixiang, et al.
Veröffentlicht: (2025)
GeoVista: Visually Grounded Active Perception for Ultra-High-Resolution Remote Sensing Understanding
von: Zhu, Jiashun, et al.
Veröffentlicht: (2026)
von: Zhu, Jiashun, et al.
Veröffentlicht: (2026)
VisBrowse-Bench: Benchmarking Visual-Native Search for Multimodal Browsing Agents
von: Zhang, Zhengbo, et al.
Veröffentlicht: (2026)
von: Zhang, Zhengbo, et al.
Veröffentlicht: (2026)
Grounding Emotion Recognition with Visual Prototypes: VEGA -- Revisiting CLIP in MERC
von: Hu, Guanyu, et al.
Veröffentlicht: (2025)
von: Hu, Guanyu, et al.
Veröffentlicht: (2025)
Scaling Lifelong Multi-Agent Path Finding to More Realistic Settings: Research Challenges and Opportunities
von: Jiang, He, et al.
Veröffentlicht: (2024)
von: Jiang, He, et al.
Veröffentlicht: (2024)
LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts
von: Xiao, Yijia, et al.
Veröffentlicht: (2024)
von: Xiao, Yijia, et al.
Veröffentlicht: (2024)
MedAgentBench: A Realistic Virtual EHR Environment to Benchmark Medical LLM Agents
von: Jiang, Yixing, et al.
Veröffentlicht: (2025)
von: Jiang, Yixing, et al.
Veröffentlicht: (2025)
MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
von: Xia, Peng, et al.
Veröffentlicht: (2025)
von: Xia, Peng, et al.
Veröffentlicht: (2025)
ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows
von: Sun, Qiushi, et al.
Veröffentlicht: (2025)
von: Sun, Qiushi, et al.
Veröffentlicht: (2025)
EduAgent: Generative Student Agents in Learning
von: Xu, Songlin, et al.
Veröffentlicht: (2024)
von: Xu, Songlin, et al.
Veröffentlicht: (2024)
ARES: Multimodal Adaptive Reasoning via Difficulty-Aware Token-Level Entropy Shaping
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
Dive into the Agent Matrix: A Realistic Evaluation of Self-Replication Risk in LLM Agents
von: Zhang, Boxuan, et al.
Veröffentlicht: (2025)
von: Zhang, Boxuan, et al.
Veröffentlicht: (2025)
TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity
von: Yang, Zheyuan, et al.
Veröffentlicht: (2026)
von: Yang, Zheyuan, et al.
Veröffentlicht: (2026)
MMSkills: Towards Multimodal Skills for General Visual Agents
von: Zhang, Kangning, et al.
Veröffentlicht: (2026)
von: Zhang, Kangning, et al.
Veröffentlicht: (2026)
Optimization and Experimental Study of Intelligent Spindle Liquid Integrated Balancing Terminal
von: Xianhong Zhang, et al.
Veröffentlicht: (2025)
von: Xianhong Zhang, et al.
Veröffentlicht: (2025)
Targeting the GDF15 Signalling for Obesity Treatment: Recent Advances and Emerging Challenges
von: Jincheng Zhang, et al.
Veröffentlicht: (2024)
von: Jincheng Zhang, et al.
Veröffentlicht: (2024)
COVR:Collaborative Optimization of VLMs and RL Agent for Visual-Based Control
von: Xia, Canming, et al.
Veröffentlicht: (2026)
von: Xia, Canming, et al.
Veröffentlicht: (2026)
Visual Watermarking in the Era of Diffusion Models: Advances and Challenges
von: Duan, Junxian, et al.
Veröffentlicht: (2025)
von: Duan, Junxian, et al.
Veröffentlicht: (2025)
SDIF-DA: A Shallow-to-Deep Interaction Framework with Data Augmentation for Multi-modal Intent Detection
von: Huang, Shijue, et al.
Veröffentlicht: (2023)
von: Huang, Shijue, et al.
Veröffentlicht: (2023)
VideoVista: A Versatile Benchmark for Video Understanding and Reasoning
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows
von: Yao, Yilun, et al.
Veröffentlicht: (2026)
von: Yao, Yilun, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents
von: Huang, Shijue, et al.
Veröffentlicht: (2026) -
XSkill: Continual Learning from Experience and Skills in Multimodal Agents
von: Jiang, Guanyu, et al.
Veröffentlicht: (2026) -
CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents
von: Liu, Jiayu, et al.
Veröffentlicht: (2025) -
The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
von: Li, Junlong, et al.
Veröffentlicht: (2025) -
Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers
von: Su, Zhaochen, et al.
Veröffentlicht: (2025)