BattleAgentBench: A Benchmark for Evaluating Cooperation and Competition Capabilities of Language Models in Multi-Agent Systems
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Wei, Zhang, Dan, Feng, Tao, Wang, Boyan, Tang, Jie |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MultiAgentBench: Evaluating the Collaboration and Competition of LLM agents
par: Zhu, Kunlun, et autres
Publié: (2025)
par: Zhu, Kunlun, et autres
Publié: (2025)
MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents
par: Wang, Shouju, et autres
Publié: (2026)
par: Wang, Shouju, et autres
Publié: (2026)
X-WebAgentBench: A Multilingual Interactive Web Benchmark for Evaluating Global Agentic System
par: Wang, Peng, et autres
Publié: (2025)
par: Wang, Peng, et autres
Publié: (2025)
DataSciBench: An LLM Agent Benchmark for Data Science
par: Zhang, Dan, et autres
Publié: (2025)
par: Zhang, Dan, et autres
Publié: (2025)
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
par: Hu, Jiliang, et autres
Publié: (2025)
par: Hu, Jiliang, et autres
Publié: (2025)
Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
par: Deng, Shihan, et autres
Publié: (2024)
par: Deng, Shihan, et autres
Publié: (2024)
BenchAgents: Multi-Agent Systems for Structured Benchmark Creation
par: Butt, Natasha, et autres
Publié: (2024)
par: Butt, Natasha, et autres
Publié: (2024)
Mixture-of-Agents Enhances Large Language Model Capabilities
par: Wang, Junlin, et autres
Publié: (2024)
par: Wang, Junlin, et autres
Publié: (2024)
SeedBench: A Multi-task Benchmark for Evaluating Large Language Models in Seed Science
par: Ying, Jie, et autres
Publié: (2025)
par: Ying, Jie, et autres
Publié: (2025)
MASLegalBench: Benchmarking Multi-Agent Systems in Deductive Legal Reasoning
par: Jing, Huihao, et autres
Publié: (2025)
par: Jing, Huihao, et autres
Publié: (2025)
Agent-SafetyBench: Evaluating the Safety of LLM Agents
par: Zhang, Zhexin, et autres
Publié: (2024)
par: Zhang, Zhexin, et autres
Publié: (2024)
MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents
par: Ding, Jinru, et autres
Publié: (2025)
par: Ding, Jinru, et autres
Publié: (2025)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
par: Yang, Rui, et autres
Publié: (2025)
par: Yang, Rui, et autres
Publié: (2025)
AgentBench: Evaluating LLMs as Agents
par: Liu, Xiao, et autres
Publié: (2023)
par: Liu, Xiao, et autres
Publié: (2023)
CO-Bench: Benchmarking Language Model Agents in Algorithm Search for Combinatorial Optimization
par: Sun, Weiwei, et autres
Publié: (2025)
par: Sun, Weiwei, et autres
Publié: (2025)
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
par: Feng, Jie, et autres
Publié: (2024)
par: Feng, Jie, et autres
Publié: (2024)
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
par: Ding, Shuangrui, et autres
Publié: (2026)
par: Ding, Shuangrui, et autres
Publié: (2026)
Evaluating Accounting Reasoning Capabilities of Large Language Models
par: Zhou, Jie, et autres
Publié: (2026)
par: Zhou, Jie, et autres
Publié: (2026)
OfficeBench: Benchmarking Language Agents across Multiple Applications for Office Automation
par: Wang, Zilong, et autres
Publié: (2024)
par: Wang, Zilong, et autres
Publié: (2024)
ProBench: Benchmarking Large Language Models in Competitive Programming
par: Yang, Lei, et autres
Publié: (2025)
par: Yang, Lei, et autres
Publié: (2025)
RAD-Bench: Evaluating Large Language Models Capabilities in Retrieval Augmented Dialogues
par: Kuo, Tzu-Lin, et autres
Publié: (2024)
par: Kuo, Tzu-Lin, et autres
Publié: (2024)
LLMArena: Assessing Capabilities of Large Language Models in Dynamic Multi-Agent Environments
par: Chen, Junzhe, et autres
Publié: (2024)
par: Chen, Junzhe, et autres
Publié: (2024)
DefenderBench: A Toolkit for Evaluating Language Agents in Cybersecurity Environments
par: Zhang, Chiyu, et autres
Publié: (2025)
par: Zhang, Chiyu, et autres
Publié: (2025)
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
par: Cao, Hongye, et autres
Publié: (2025)
par: Cao, Hongye, et autres
Publié: (2025)
TurnBench-MS: A Benchmark for Evaluating Multi-Turn, Multi-Step Reasoning in Large Language Models
par: Zhang, Yiran, et autres
Publié: (2025)
par: Zhang, Yiran, et autres
Publié: (2025)
Auto-Arena: Automating LLM Evaluations with Agent Peer Battles and Committee Discussions
par: Zhao, Ruochen, et autres
Publié: (2024)
par: Zhao, Ruochen, et autres
Publié: (2024)
The Hunger Game Debate: On the Emergence of Over-Competition in Multi-Agent Systems
par: Ma, Xinbei, et autres
Publié: (2025)
par: Ma, Xinbei, et autres
Publié: (2025)
TritonBench: Benchmarking Large Language Model Capabilities for Generating Triton Operators
par: Li, Jianling, et autres
Publié: (2025)
par: Li, Jianling, et autres
Publié: (2025)
GroupMemBench: Benchmarking LLM Agent Memory in Multi-Party Conversations
par: Yang, Jingbo, et autres
Publié: (2026)
par: Yang, Jingbo, et autres
Publié: (2026)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
par: Tang, Xiangru, et autres
Publié: (2025)
par: Tang, Xiangru, et autres
Publié: (2025)
Debt Collection Negotiations with Large Language Models: An Evaluation System and Optimizing Decision Making with Multi-Agent
par: Wang, Xiaofeng, et autres
Publié: (2025)
par: Wang, Xiaofeng, et autres
Publié: (2025)
HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models
par: Que, Haoran, et autres
Publié: (2024)
par: Que, Haoran, et autres
Publié: (2024)
MentalBench: A DSM-Grounded Benchmark for Evaluating Psychiatric Diagnostic Capability of Large Language Models
par: Song, Hoyun, et autres
Publié: (2026)
par: Song, Hoyun, et autres
Publié: (2026)
ShoppingBench: A Real-World Intent-Grounded Shopping Benchmark for LLM-based Agents
par: Wang, Jiangyuan, et autres
Publié: (2025)
par: Wang, Jiangyuan, et autres
Publié: (2025)
BattleAgent: Multi-modal Dynamic Emulation on Historical Battles to Complement Historical Analysis
par: Lin, Shuhang, et autres
Publié: (2024)
par: Lin, Shuhang, et autres
Publié: (2024)
FactBench: A Dynamic Benchmark for In-the-Wild Language Model Factuality Evaluation
par: Bayat, Farima Fatahi, et autres
Publié: (2024)
par: Bayat, Farima Fatahi, et autres
Publié: (2024)
LieCraft: A Multi-Agent Framework for Evaluating Deceptive Capabilities in Language Models
par: Olson, Matthew Lyle, et autres
Publié: (2026)
par: Olson, Matthew Lyle, et autres
Publié: (2026)
Benchmark Self-Evolving: A Multi-Agent Framework for Dynamic LLM Evaluation
par: Wang, Siyuan, et autres
Publié: (2024)
par: Wang, Siyuan, et autres
Publié: (2024)
CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency
par: Guo, Jiacheng, et autres
Publié: (2025)
par: Guo, Jiacheng, et autres
Publié: (2025)
HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing
par: Feng, Andrew Zhuoer, et autres
Publié: (2026)
par: Feng, Andrew Zhuoer, et autres
Publié: (2026)
Documents similaires
-
MultiAgentBench: Evaluating the Collaboration and Competition of LLM agents
par: Zhu, Kunlun, et autres
Publié: (2025) -
MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents
par: Wang, Shouju, et autres
Publié: (2026) -
X-WebAgentBench: A Multilingual Interactive Web Benchmark for Evaluating Global Agentic System
par: Wang, Peng, et autres
Publié: (2025) -
DataSciBench: An LLM Agent Benchmark for Data Science
par: Zhang, Dan, et autres
Publié: (2025) -
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
par: Hu, Jiliang, et autres
Publié: (2025)