CRAB: Cross-environment Agent Benchmark for Multimodal Language Model Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Tianqi, Chen, Linyao, Wu, Dai-Jie, Chen, Yanjun, Zhang, Zecheng, Yao, Xiang, Xie, Zhiqiang, Chen, Yongchao, Liu, Shilong, Qian, Bochen, Yang, Anjie, Jin, Zhaoxuan, Deng, Jianbo, Torr, Philip, Ghanem, Bernard, Li, Guohao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AVA: Attentive VLM Agent for Mastering StarCraft II
di: Ma, Weiyu, et al.
Pubblicazione: (2025)
di: Ma, Weiyu, et al.
Pubblicazione: (2025)
MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents
di: Aichberger, Lukas, et al.
Pubblicazione: (2025)
di: Aichberger, Lukas, et al.
Pubblicazione: (2025)
SkillTester: Benchmarking Utility and Security of Agent Skills
di: Wang, Leye, et al.
Pubblicazione: (2026)
di: Wang, Leye, et al.
Pubblicazione: (2026)
BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding
di: Liu, Shuming, et al.
Pubblicazione: (2025)
di: Liu, Shuming, et al.
Pubblicazione: (2025)
Can an Individual Manipulate the Collective Decisions of Multi-Agents?
di: Liu, Fengyuan, et al.
Pubblicazione: (2025)
di: Liu, Fengyuan, et al.
Pubblicazione: (2025)
Can Large Language Model Agents Simulate Human Trust Behavior?
di: Xie, Chengxing, et al.
Pubblicazione: (2024)
di: Xie, Chengxing, et al.
Pubblicazione: (2024)
Purifying Task Vectors in Knowledge-Aware Subspace for Model Merging
di: An, Bang, et al.
Pubblicazione: (2025)
di: An, Bang, et al.
Pubblicazione: (2025)
Multimodal Safety Evaluation in Generative Agent Social Simulations
di: Vera, Alhim, et al.
Pubblicazione: (2025)
di: Vera, Alhim, et al.
Pubblicazione: (2025)
OWL: Optimized Workforce Learning for General Multi-Agent Assistance in Real-World Task Automation
di: Hu, Mengkang, et al.
Pubblicazione: (2025)
di: Hu, Mengkang, et al.
Pubblicazione: (2025)
Exploring Advanced LLM Multi-Agent Systems Based on Blackboard Architecture
di: Han, Bochen, et al.
Pubblicazione: (2025)
di: Han, Bochen, et al.
Pubblicazione: (2025)
OASIS: Open Agent Social Interaction Simulations with One Million Agents
di: Yang, Ziyi, et al.
Pubblicazione: (2024)
di: Yang, Ziyi, et al.
Pubblicazione: (2024)
MMInA: Benchmarking Multihop Multimodal Internet Agents
di: Tian, Shulin, et al.
Pubblicazione: (2024)
di: Tian, Shulin, et al.
Pubblicazione: (2024)
EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering
di: Li, Yanjun, et al.
Pubblicazione: (2025)
di: Li, Yanjun, et al.
Pubblicazione: (2025)
CRAB: A Benchmark for Evaluating Curation of Retrieval-Augmented LLMs in Biomedicine
di: Zhong, Hanmeng, et al.
Pubblicazione: (2025)
di: Zhong, Hanmeng, et al.
Pubblicazione: (2025)
Automotive-ENV: Benchmarking Multimodal Agents in Vehicle Interface Systems
di: Yan, Junfeng, et al.
Pubblicazione: (2025)
di: Yan, Junfeng, et al.
Pubblicazione: (2025)
ProjGuard: Safety Monitoring for Computer-Use Agents via Low-Dimensional Projections
di: Contreras, Kebin, et al.
Pubblicazione: (2026)
di: Contreras, Kebin, et al.
Pubblicazione: (2026)
COMMA: A Communicative Multimodal Multi-Agent Benchmark
di: Ossowski, Timothy, et al.
Pubblicazione: (2024)
di: Ossowski, Timothy, et al.
Pubblicazione: (2024)
MobileAgentBench: An Efficient and User-Friendly Benchmark for Mobile LLM Agents
di: Wang, Luyuan, et al.
Pubblicazione: (2024)
di: Wang, Luyuan, et al.
Pubblicazione: (2024)
Graph-of-Agents: A Graph-based Framework for Multi-Agent LLM Collaboration
di: Yun, Sukwon, et al.
Pubblicazione: (2026)
di: Yun, Sukwon, et al.
Pubblicazione: (2026)
Video Self-Stitching Graph Network for Temporal Action Localization
di: Zhao, Chen, et al.
Pubblicazione: (2020)
di: Zhao, Chen, et al.
Pubblicazione: (2020)
Benchmarking In-the-wild Multimodal Disease Recognition and A Versatile Baseline
di: Wei, Tianqi, et al.
Pubblicazione: (2024)
di: Wei, Tianqi, et al.
Pubblicazione: (2024)
LLM Agents Are the Antidote to Walled Gardens
di: Marro, Samuele, et al.
Pubblicazione: (2025)
di: Marro, Samuele, et al.
Pubblicazione: (2025)
Cooperation on the Fly: Exploring Language Agents for Ad Hoc Teamwork in the Avalon Game
di: Shi, Zijing, et al.
Pubblicazione: (2023)
di: Shi, Zijing, et al.
Pubblicazione: (2023)
Fourier frames on smooth surfaces with nonvanishing Gaussian curvature
di: Chen, Xinyu, et al.
Pubblicazione: (2025)
di: Chen, Xinyu, et al.
Pubblicazione: (2025)
Fourier frames on smooth surfaces with nonvanishing Gaussian curvature
di: Xinyu Chen, et al.
Pubblicazione: (2025)
di: Xinyu Chen, et al.
Pubblicazione: (2025)
AI Agents in Engineering Design: A Multi-Agent Framework for Aesthetic and Aerodynamic Car Design
di: Elrefaie, Mohamed, et al.
Pubblicazione: (2025)
di: Elrefaie, Mohamed, et al.
Pubblicazione: (2025)
EMOS: Embodiment-aware Heterogeneous Multi-robot Operating System with LLM Agents
di: Chen, Junting, et al.
Pubblicazione: (2024)
di: Chen, Junting, et al.
Pubblicazione: (2024)
Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents
di: Bei, Yuanchen, et al.
Pubblicazione: (2026)
di: Bei, Yuanchen, et al.
Pubblicazione: (2026)
It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents
di: Korgul, Karolina, et al.
Pubblicazione: (2025)
di: Korgul, Karolina, et al.
Pubblicazione: (2025)
MMAC-Copilot: Multi-modal Agent Collaboration Operating Copilot
di: Song, Zirui, et al.
Pubblicazione: (2024)
di: Song, Zirui, et al.
Pubblicazione: (2024)
Breaking the Bulkhead: Demystifying Cross-Namespace Reference Vulnerabilities in Kubernetes Operators
di: Chen, Andong, et al.
Pubblicazione: (2025)
di: Chen, Andong, et al.
Pubblicazione: (2025)
OmniCode: A Benchmark for Evaluating Software Engineering Agents
di: Sonwane, Atharv, et al.
Pubblicazione: (2026)
di: Sonwane, Atharv, et al.
Pubblicazione: (2026)
Credential Leakage in LLM Agent Skills: A Large-Scale Empirical Study
di: Chen, Zhihao, et al.
Pubblicazione: (2026)
di: Chen, Zhihao, et al.
Pubblicazione: (2026)
1550 Nm Optical Coherence Tomography for In Vivo Deep Brain Cerebral Blood Flow Imaging
di: Wei Chen, et al.
Pubblicazione: (2024)
di: Wei Chen, et al.
Pubblicazione: (2024)
CharacterEval: A Chinese Benchmark for Role-Playing Conversational Agent Evaluation
di: Tu, Quan, et al.
Pubblicazione: (2024)
di: Tu, Quan, et al.
Pubblicazione: (2024)
End-to-End Temporal Action Detection with 1B Parameters Across 1000 Frames
di: Liu, Shuming, et al.
Pubblicazione: (2023)
di: Liu, Shuming, et al.
Pubblicazione: (2023)
MLA-Trust: Benchmarking Trustworthiness of Multimodal LLM Agents in GUI Environments
di: Yang, Xiao, et al.
Pubblicazione: (2025)
di: Yang, Xiao, et al.
Pubblicazione: (2025)
VaseVQA: Multimodal Agent and Benchmark for Ancient Greek Pottery
di: Ge, Jinchao, et al.
Pubblicazione: (2025)
di: Ge, Jinchao, et al.
Pubblicazione: (2025)
MedMASLab: A Unified Orchestration Framework for Benchmarking Multimodal Medical Multi-Agent Systems
di: Qian, Yunhang, et al.
Pubblicazione: (2026)
di: Qian, Yunhang, et al.
Pubblicazione: (2026)
Exploring Missing Modality in Multimodal Egocentric Datasets
di: Ramazanova, Merey, et al.
Pubblicazione: (2024)
di: Ramazanova, Merey, et al.
Pubblicazione: (2024)
Documenti analoghi
-
AVA: Attentive VLM Agent for Mastering StarCraft II
di: Ma, Weiyu, et al.
Pubblicazione: (2025) -
MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents
di: Aichberger, Lukas, et al.
Pubblicazione: (2025) -
SkillTester: Benchmarking Utility and Security of Agent Skills
di: Wang, Leye, et al.
Pubblicazione: (2026) -
BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding
di: Liu, Shuming, et al.
Pubblicazione: (2025) -
Can an Individual Manipulate the Collective Decisions of Multi-Agents?
di: Liu, Fengyuan, et al.
Pubblicazione: (2025)