BattleAgentBench: A Benchmark for Evaluating Cooperation and Competition Capabilities of Language Models in Multi-Agent Systems
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Wei, Zhang, Dan, Feng, Tao, Wang, Boyan, Tang, Jie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MultiAgentBench: Evaluating the Collaboration and Competition of LLM agents
di: Zhu, Kunlun, et al.
Pubblicazione: (2025)
di: Zhu, Kunlun, et al.
Pubblicazione: (2025)
MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents
di: Wang, Shouju, et al.
Pubblicazione: (2026)
di: Wang, Shouju, et al.
Pubblicazione: (2026)
X-WebAgentBench: A Multilingual Interactive Web Benchmark for Evaluating Global Agentic System
di: Wang, Peng, et al.
Pubblicazione: (2025)
di: Wang, Peng, et al.
Pubblicazione: (2025)
DataSciBench: An LLM Agent Benchmark for Data Science
di: Zhang, Dan, et al.
Pubblicazione: (2025)
di: Zhang, Dan, et al.
Pubblicazione: (2025)
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
di: Deng, Shihan, et al.
Pubblicazione: (2024)
di: Deng, Shihan, et al.
Pubblicazione: (2024)
BenchAgents: Multi-Agent Systems for Structured Benchmark Creation
di: Butt, Natasha, et al.
Pubblicazione: (2024)
di: Butt, Natasha, et al.
Pubblicazione: (2024)
Mixture-of-Agents Enhances Large Language Model Capabilities
di: Wang, Junlin, et al.
Pubblicazione: (2024)
di: Wang, Junlin, et al.
Pubblicazione: (2024)
SeedBench: A Multi-task Benchmark for Evaluating Large Language Models in Seed Science
di: Ying, Jie, et al.
Pubblicazione: (2025)
di: Ying, Jie, et al.
Pubblicazione: (2025)
MASLegalBench: Benchmarking Multi-Agent Systems in Deductive Legal Reasoning
di: Jing, Huihao, et al.
Pubblicazione: (2025)
di: Jing, Huihao, et al.
Pubblicazione: (2025)
Agent-SafetyBench: Evaluating the Safety of LLM Agents
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents
di: Ding, Jinru, et al.
Pubblicazione: (2025)
di: Ding, Jinru, et al.
Pubblicazione: (2025)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
di: Yang, Rui, et al.
Pubblicazione: (2025)
di: Yang, Rui, et al.
Pubblicazione: (2025)
AgentBench: Evaluating LLMs as Agents
di: Liu, Xiao, et al.
Pubblicazione: (2023)
di: Liu, Xiao, et al.
Pubblicazione: (2023)
CO-Bench: Benchmarking Language Model Agents in Algorithm Search for Combinatorial Optimization
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
di: Feng, Jie, et al.
Pubblicazione: (2024)
di: Feng, Jie, et al.
Pubblicazione: (2024)
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
di: Ding, Shuangrui, et al.
Pubblicazione: (2026)
di: Ding, Shuangrui, et al.
Pubblicazione: (2026)
Evaluating Accounting Reasoning Capabilities of Large Language Models
di: Zhou, Jie, et al.
Pubblicazione: (2026)
di: Zhou, Jie, et al.
Pubblicazione: (2026)
OfficeBench: Benchmarking Language Agents across Multiple Applications for Office Automation
di: Wang, Zilong, et al.
Pubblicazione: (2024)
di: Wang, Zilong, et al.
Pubblicazione: (2024)
ProBench: Benchmarking Large Language Models in Competitive Programming
di: Yang, Lei, et al.
Pubblicazione: (2025)
di: Yang, Lei, et al.
Pubblicazione: (2025)
RAD-Bench: Evaluating Large Language Models Capabilities in Retrieval Augmented Dialogues
di: Kuo, Tzu-Lin, et al.
Pubblicazione: (2024)
di: Kuo, Tzu-Lin, et al.
Pubblicazione: (2024)
LLMArena: Assessing Capabilities of Large Language Models in Dynamic Multi-Agent Environments
di: Chen, Junzhe, et al.
Pubblicazione: (2024)
di: Chen, Junzhe, et al.
Pubblicazione: (2024)
DefenderBench: A Toolkit for Evaluating Language Agents in Cybersecurity Environments
di: Zhang, Chiyu, et al.
Pubblicazione: (2025)
di: Zhang, Chiyu, et al.
Pubblicazione: (2025)
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
di: Cao, Hongye, et al.
Pubblicazione: (2025)
di: Cao, Hongye, et al.
Pubblicazione: (2025)
TurnBench-MS: A Benchmark for Evaluating Multi-Turn, Multi-Step Reasoning in Large Language Models
di: Zhang, Yiran, et al.
Pubblicazione: (2025)
di: Zhang, Yiran, et al.
Pubblicazione: (2025)
Auto-Arena: Automating LLM Evaluations with Agent Peer Battles and Committee Discussions
di: Zhao, Ruochen, et al.
Pubblicazione: (2024)
di: Zhao, Ruochen, et al.
Pubblicazione: (2024)
The Hunger Game Debate: On the Emergence of Over-Competition in Multi-Agent Systems
di: Ma, Xinbei, et al.
Pubblicazione: (2025)
di: Ma, Xinbei, et al.
Pubblicazione: (2025)
TritonBench: Benchmarking Large Language Model Capabilities for Generating Triton Operators
di: Li, Jianling, et al.
Pubblicazione: (2025)
di: Li, Jianling, et al.
Pubblicazione: (2025)
GroupMemBench: Benchmarking LLM Agent Memory in Multi-Party Conversations
di: Yang, Jingbo, et al.
Pubblicazione: (2026)
di: Yang, Jingbo, et al.
Pubblicazione: (2026)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
Debt Collection Negotiations with Large Language Models: An Evaluation System and Optimizing Decision Making with Multi-Agent
di: Wang, Xiaofeng, et al.
Pubblicazione: (2025)
di: Wang, Xiaofeng, et al.
Pubblicazione: (2025)
HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models
di: Que, Haoran, et al.
Pubblicazione: (2024)
di: Que, Haoran, et al.
Pubblicazione: (2024)
MentalBench: A DSM-Grounded Benchmark for Evaluating Psychiatric Diagnostic Capability of Large Language Models
di: Song, Hoyun, et al.
Pubblicazione: (2026)
di: Song, Hoyun, et al.
Pubblicazione: (2026)
ShoppingBench: A Real-World Intent-Grounded Shopping Benchmark for LLM-based Agents
di: Wang, Jiangyuan, et al.
Pubblicazione: (2025)
di: Wang, Jiangyuan, et al.
Pubblicazione: (2025)
BattleAgent: Multi-modal Dynamic Emulation on Historical Battles to Complement Historical Analysis
di: Lin, Shuhang, et al.
Pubblicazione: (2024)
di: Lin, Shuhang, et al.
Pubblicazione: (2024)
FactBench: A Dynamic Benchmark for In-the-Wild Language Model Factuality Evaluation
di: Bayat, Farima Fatahi, et al.
Pubblicazione: (2024)
di: Bayat, Farima Fatahi, et al.
Pubblicazione: (2024)
LieCraft: A Multi-Agent Framework for Evaluating Deceptive Capabilities in Language Models
di: Olson, Matthew Lyle, et al.
Pubblicazione: (2026)
di: Olson, Matthew Lyle, et al.
Pubblicazione: (2026)
Benchmark Self-Evolving: A Multi-Agent Framework for Dynamic LLM Evaluation
di: Wang, Siyuan, et al.
Pubblicazione: (2024)
di: Wang, Siyuan, et al.
Pubblicazione: (2024)
CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency
di: Guo, Jiacheng, et al.
Pubblicazione: (2025)
di: Guo, Jiacheng, et al.
Pubblicazione: (2025)
HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing
di: Feng, Andrew Zhuoer, et al.
Pubblicazione: (2026)
di: Feng, Andrew Zhuoer, et al.
Pubblicazione: (2026)
Documenti analoghi
-
MultiAgentBench: Evaluating the Collaboration and Competition of LLM agents
di: Zhu, Kunlun, et al.
Pubblicazione: (2025) -
MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents
di: Wang, Shouju, et al.
Pubblicazione: (2026) -
X-WebAgentBench: A Multilingual Interactive Web Benchmark for Evaluating Global Agentic System
di: Wang, Peng, et al.
Pubblicazione: (2025) -
DataSciBench: An LLM Agent Benchmark for Data Science
di: Zhang, Dan, et al.
Pubblicazione: (2025) -
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
di: Hu, Jiliang, et al.
Pubblicazione: (2025)