CivBench: Progress-Based Evaluation for LLMs' Strategic Decision-Making in Civilization V
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, John, Cheng, Sihan, Gurkan, Can, Lin, Mingyi |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CivRealm: A Learning and Reasoning Odyssey in Civilization for Decision-Making Agents
by: Qi, Siyuan, et al.
Published: (2024)
by: Qi, Siyuan, et al.
Published: (2024)
Vox Deorum: A Hybrid LLM Architecture for 4X / Grand Strategy Game AI -- Lessons from Civilization V
by: Chen, John, et al.
Published: (2025)
by: Chen, John, et al.
Published: (2025)
ClinDet-Bench: Beyond Abstention, Evaluating Judgment Determinability of LLMs in Clinical Decision-Making
by: Watanabe, Yusuke, et al.
Published: (2026)
by: Watanabe, Yusuke, et al.
Published: (2026)
DM-Bench: Benchmarking LLMs for Personalized Decision Making in Diabetes Management
by: Cardei, Maria Ana, et al.
Published: (2025)
by: Cardei, Maria Ana, et al.
Published: (2025)
SPIN-Bench: How Well Do LLMs Plan Strategically and Reason Socially?
by: Yao, Jianzhu, et al.
Published: (2025)
by: Yao, Jianzhu, et al.
Published: (2025)
Adversarial Testing in LLMs: Insights into Decision-Making Vulnerabilities
by: Zhang, Lili, et al.
Published: (2025)
by: Zhang, Lili, et al.
Published: (2025)
DSGBench: A Diverse Strategic Game Benchmark for Evaluating LLM-based Agents in Complex Decision-Making Environments
by: Tang, Wenjie, et al.
Published: (2025)
by: Tang, Wenjie, et al.
Published: (2025)
Evaluating LLMs for Police Decision-Making: A Framework Based on Police Action Scenarios
by: Lee, Sangyub, et al.
Published: (2026)
by: Lee, Sangyub, et al.
Published: (2026)
GameBench: Evaluating Strategic Reasoning Abilities of LLM Agents
by: Costarelli, Anthony, et al.
Published: (2024)
by: Costarelli, Anthony, et al.
Published: (2024)
STRIDE: Strategic Iterative Decision-Making for Retrieval-Augmented Multi-Hop Question Answering
by: Chen, Wei, et al.
Published: (2026)
by: Chen, Wei, et al.
Published: (2026)
Beyond Scaling: Assessing Strategic Reasoning and Rapid Decision-Making Capability of LLMs in Zero-sum Environments
by: Li, Yang, et al.
Published: (2026)
by: Li, Yang, et al.
Published: (2026)
VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments
by: Xu, Zelai, et al.
Published: (2025)
by: Xu, Zelai, et al.
Published: (2025)
KellyBench: A Benchmark for Long-Horizon Sequential Decision Making
by: Grady, Thomas, et al.
Published: (2026)
by: Grady, Thomas, et al.
Published: (2026)
How Far Are We on the Decision-Making of LLMs? Evaluating LLMs' Gaming Ability in Multi-Agent Environments
by: Huang, Jen-tse, et al.
Published: (2024)
by: Huang, Jen-tse, et al.
Published: (2024)
StarBench: A Turn-Based RPG Benchmark for Agentic Multimodal Decision-Making and Information Seeking
by: Zhang, Haoran, et al.
Published: (2025)
by: Zhang, Haoran, et al.
Published: (2025)
WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making
by: Li, Zongjie, et al.
Published: (2026)
by: Li, Zongjie, et al.
Published: (2026)
MoralBench: Moral Evaluation of LLMs
by: Ji, Jianchao, et al.
Published: (2024)
by: Ji, Jianchao, et al.
Published: (2024)
The Sample Complexity of Online Strategic Decision Making with Information Asymmetry and Knowledge Transportability
by: Hu, Jiachen, et al.
Published: (2025)
by: Hu, Jiachen, et al.
Published: (2025)
Cognitive Bias in Decision-Making with LLMs
by: Echterhoff, Jessica, et al.
Published: (2024)
by: Echterhoff, Jessica, et al.
Published: (2024)
RetailBench: Evaluating Long-Horizon Autonomous Decision-Making and Strategy Stability of LLM Agents in Realistic Retail Environments
by: Zhang, Linghua, et al.
Published: (2026)
by: Zhang, Linghua, et al.
Published: (2026)
Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning
by: Hu, Zican, et al.
Published: (2025)
by: Hu, Zican, et al.
Published: (2025)
AIM-Bench: Evaluating Decision-making Biases of Agentic LLM as Inventory Manager
by: Zhao, Xuhua, et al.
Published: (2025)
by: Zhao, Xuhua, et al.
Published: (2025)
LLMs for Explainable Business Decision-Making: A Reinforcement Learning Fine-Tuning Approach
by: Cheng, Xiang, et al.
Published: (2025)
by: Cheng, Xiang, et al.
Published: (2025)
CliBench: A Multifaceted and Multigranular Evaluation of Large Language Models for Clinical Decision Making
by: Ma, Mingyu Derek, et al.
Published: (2024)
by: Ma, Mingyu Derek, et al.
Published: (2024)
ToMPO: Training LLM Strategic Decision Making from a Multi-Agent Perspective
by: Zhang, Yiwen, et al.
Published: (2025)
by: Zhang, Yiwen, et al.
Published: (2025)
The Alignment Tax: Response Homogenization in Aligned LLMs and Its Implications for Uncertainty Estimation
by: Liu, Mingyi
Published: (2026)
by: Liu, Mingyi
Published: (2026)
Rethinking Prospect Theory for LLMs: Revealing the Instability of Decision-Making under Epistemic Uncertainty
by: Wang, Rui, et al.
Published: (2025)
by: Wang, Rui, et al.
Published: (2025)
Post-Training LLMs as Better Decision-Making Agents: A Regret-Minimization Approach
by: Park, Chanwoo, et al.
Published: (2025)
by: Park, Chanwoo, et al.
Published: (2025)
NomicLaw: Emergent Trust and Strategic Argumentation in LLMs During Collaborative Law-Making
by: Hota, Asutosh, et al.
Published: (2025)
by: Hota, Asutosh, et al.
Published: (2025)
Problem Solved? Information Extraction Design Space for Layout-Rich Documents using LLMs
by: Colakoglu, Gaye, et al.
Published: (2025)
by: Colakoglu, Gaye, et al.
Published: (2025)
MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs
by: Wang, Kevin, et al.
Published: (2026)
by: Wang, Kevin, et al.
Published: (2026)
SOLID: a Framework of Synergizing Optimization and LLMs for Intelligent Decision-Making
by: Wang, Yinsheng, et al.
Published: (2025)
by: Wang, Yinsheng, et al.
Published: (2025)
LLM-Based World Models Can Make Decisions Solely, But Rigorous Evaluations are Needed
by: Yang, Chang, et al.
Published: (2024)
by: Yang, Chang, et al.
Published: (2024)
Can LLMs Make (Personalized) Access Control Decisions?
by: Groschupp, Friederike, et al.
Published: (2025)
by: Groschupp, Friederike, et al.
Published: (2025)
SkillGen: Learning Domain Skills for In-Context Sequential Decision Making
by: Ding, Ruomeng, et al.
Published: (2025)
by: Ding, Ruomeng, et al.
Published: (2025)
FullStack Bench: Evaluating LLMs as Full Stack Coders
by: Bytedance-Seed-Foundation-Code-Team, et al.
Published: (2024)
by: Bytedance-Seed-Foundation-Code-Team, et al.
Published: (2024)
R-ConstraintBench: Evaluating LLMs on NP-Complete Scheduling
by: Jain, Raj, et al.
Published: (2025)
by: Jain, Raj, et al.
Published: (2025)
Decision-Making Behavior Evaluation Framework for LLMs under Uncertain Context
by: Jia, Jingru, et al.
Published: (2024)
by: Jia, Jingru, et al.
Published: (2024)
Tracing LLM Reasoning Processes with Strategic Games: A Framework for Planning, Revision, and Resource-Constrained Decision Making
by: Yuan, Xiaopeng, et al.
Published: (2025)
by: Yuan, Xiaopeng, et al.
Published: (2025)
PIANIST: Learning Partially Observable World Models with LLMs for Multi-Agent Decision Making
by: Light, Jonathan, et al.
Published: (2024)
by: Light, Jonathan, et al.
Published: (2024)
Similar Items
-
CivRealm: A Learning and Reasoning Odyssey in Civilization for Decision-Making Agents
by: Qi, Siyuan, et al.
Published: (2024) -
Vox Deorum: A Hybrid LLM Architecture for 4X / Grand Strategy Game AI -- Lessons from Civilization V
by: Chen, John, et al.
Published: (2025) -
ClinDet-Bench: Beyond Abstention, Evaluating Judgment Determinability of LLMs in Clinical Decision-Making
by: Watanabe, Yusuke, et al.
Published: (2026) -
DM-Bench: Benchmarking LLMs for Personalized Decision Making in Diabetes Management
by: Cardei, Maria Ana, et al.
Published: (2025) -
SPIN-Bench: How Well Do LLMs Plan Strategically and Reason Socially?
by: Yao, Jianzhu, et al.
Published: (2025)