CivBench: Progress-Based Evaluation for LLMs' Strategic Decision-Making in Civilization V
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, John, Cheng, Sihan, Gurkan, Can, Lin, Mingyi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CivRealm: A Learning and Reasoning Odyssey in Civilization for Decision-Making Agents
di: Qi, Siyuan, et al.
Pubblicazione: (2024)
di: Qi, Siyuan, et al.
Pubblicazione: (2024)
Vox Deorum: A Hybrid LLM Architecture for 4X / Grand Strategy Game AI -- Lessons from Civilization V
di: Chen, John, et al.
Pubblicazione: (2025)
di: Chen, John, et al.
Pubblicazione: (2025)
ClinDet-Bench: Beyond Abstention, Evaluating Judgment Determinability of LLMs in Clinical Decision-Making
di: Watanabe, Yusuke, et al.
Pubblicazione: (2026)
di: Watanabe, Yusuke, et al.
Pubblicazione: (2026)
DM-Bench: Benchmarking LLMs for Personalized Decision Making in Diabetes Management
di: Cardei, Maria Ana, et al.
Pubblicazione: (2025)
di: Cardei, Maria Ana, et al.
Pubblicazione: (2025)
SPIN-Bench: How Well Do LLMs Plan Strategically and Reason Socially?
di: Yao, Jianzhu, et al.
Pubblicazione: (2025)
di: Yao, Jianzhu, et al.
Pubblicazione: (2025)
Adversarial Testing in LLMs: Insights into Decision-Making Vulnerabilities
di: Zhang, Lili, et al.
Pubblicazione: (2025)
di: Zhang, Lili, et al.
Pubblicazione: (2025)
DSGBench: A Diverse Strategic Game Benchmark for Evaluating LLM-based Agents in Complex Decision-Making Environments
di: Tang, Wenjie, et al.
Pubblicazione: (2025)
di: Tang, Wenjie, et al.
Pubblicazione: (2025)
Evaluating LLMs for Police Decision-Making: A Framework Based on Police Action Scenarios
di: Lee, Sangyub, et al.
Pubblicazione: (2026)
di: Lee, Sangyub, et al.
Pubblicazione: (2026)
GameBench: Evaluating Strategic Reasoning Abilities of LLM Agents
di: Costarelli, Anthony, et al.
Pubblicazione: (2024)
di: Costarelli, Anthony, et al.
Pubblicazione: (2024)
STRIDE: Strategic Iterative Decision-Making for Retrieval-Augmented Multi-Hop Question Answering
di: Chen, Wei, et al.
Pubblicazione: (2026)
di: Chen, Wei, et al.
Pubblicazione: (2026)
Beyond Scaling: Assessing Strategic Reasoning and Rapid Decision-Making Capability of LLMs in Zero-sum Environments
di: Li, Yang, et al.
Pubblicazione: (2026)
di: Li, Yang, et al.
Pubblicazione: (2026)
VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments
di: Xu, Zelai, et al.
Pubblicazione: (2025)
di: Xu, Zelai, et al.
Pubblicazione: (2025)
KellyBench: A Benchmark for Long-Horizon Sequential Decision Making
di: Grady, Thomas, et al.
Pubblicazione: (2026)
di: Grady, Thomas, et al.
Pubblicazione: (2026)
How Far Are We on the Decision-Making of LLMs? Evaluating LLMs' Gaming Ability in Multi-Agent Environments
di: Huang, Jen-tse, et al.
Pubblicazione: (2024)
di: Huang, Jen-tse, et al.
Pubblicazione: (2024)
StarBench: A Turn-Based RPG Benchmark for Agentic Multimodal Decision-Making and Information Seeking
di: Zhang, Haoran, et al.
Pubblicazione: (2025)
di: Zhang, Haoran, et al.
Pubblicazione: (2025)
WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making
di: Li, Zongjie, et al.
Pubblicazione: (2026)
di: Li, Zongjie, et al.
Pubblicazione: (2026)
MoralBench: Moral Evaluation of LLMs
di: Ji, Jianchao, et al.
Pubblicazione: (2024)
di: Ji, Jianchao, et al.
Pubblicazione: (2024)
The Sample Complexity of Online Strategic Decision Making with Information Asymmetry and Knowledge Transportability
di: Hu, Jiachen, et al.
Pubblicazione: (2025)
di: Hu, Jiachen, et al.
Pubblicazione: (2025)
Cognitive Bias in Decision-Making with LLMs
di: Echterhoff, Jessica, et al.
Pubblicazione: (2024)
di: Echterhoff, Jessica, et al.
Pubblicazione: (2024)
RetailBench: Evaluating Long-Horizon Autonomous Decision-Making and Strategy Stability of LLM Agents in Realistic Retail Environments
di: Zhang, Linghua, et al.
Pubblicazione: (2026)
di: Zhang, Linghua, et al.
Pubblicazione: (2026)
Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning
di: Hu, Zican, et al.
Pubblicazione: (2025)
di: Hu, Zican, et al.
Pubblicazione: (2025)
AIM-Bench: Evaluating Decision-making Biases of Agentic LLM as Inventory Manager
di: Zhao, Xuhua, et al.
Pubblicazione: (2025)
di: Zhao, Xuhua, et al.
Pubblicazione: (2025)
LLMs for Explainable Business Decision-Making: A Reinforcement Learning Fine-Tuning Approach
di: Cheng, Xiang, et al.
Pubblicazione: (2025)
di: Cheng, Xiang, et al.
Pubblicazione: (2025)
CliBench: A Multifaceted and Multigranular Evaluation of Large Language Models for Clinical Decision Making
di: Ma, Mingyu Derek, et al.
Pubblicazione: (2024)
di: Ma, Mingyu Derek, et al.
Pubblicazione: (2024)
ToMPO: Training LLM Strategic Decision Making from a Multi-Agent Perspective
di: Zhang, Yiwen, et al.
Pubblicazione: (2025)
di: Zhang, Yiwen, et al.
Pubblicazione: (2025)
The Alignment Tax: Response Homogenization in Aligned LLMs and Its Implications for Uncertainty Estimation
di: Liu, Mingyi
Pubblicazione: (2026)
di: Liu, Mingyi
Pubblicazione: (2026)
Rethinking Prospect Theory for LLMs: Revealing the Instability of Decision-Making under Epistemic Uncertainty
di: Wang, Rui, et al.
Pubblicazione: (2025)
di: Wang, Rui, et al.
Pubblicazione: (2025)
Post-Training LLMs as Better Decision-Making Agents: A Regret-Minimization Approach
di: Park, Chanwoo, et al.
Pubblicazione: (2025)
di: Park, Chanwoo, et al.
Pubblicazione: (2025)
NomicLaw: Emergent Trust and Strategic Argumentation in LLMs During Collaborative Law-Making
di: Hota, Asutosh, et al.
Pubblicazione: (2025)
di: Hota, Asutosh, et al.
Pubblicazione: (2025)
Problem Solved? Information Extraction Design Space for Layout-Rich Documents using LLMs
di: Colakoglu, Gaye, et al.
Pubblicazione: (2025)
di: Colakoglu, Gaye, et al.
Pubblicazione: (2025)
MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs
di: Wang, Kevin, et al.
Pubblicazione: (2026)
di: Wang, Kevin, et al.
Pubblicazione: (2026)
SOLID: a Framework of Synergizing Optimization and LLMs for Intelligent Decision-Making
di: Wang, Yinsheng, et al.
Pubblicazione: (2025)
di: Wang, Yinsheng, et al.
Pubblicazione: (2025)
LLM-Based World Models Can Make Decisions Solely, But Rigorous Evaluations are Needed
di: Yang, Chang, et al.
Pubblicazione: (2024)
di: Yang, Chang, et al.
Pubblicazione: (2024)
Can LLMs Make (Personalized) Access Control Decisions?
di: Groschupp, Friederike, et al.
Pubblicazione: (2025)
di: Groschupp, Friederike, et al.
Pubblicazione: (2025)
SkillGen: Learning Domain Skills for In-Context Sequential Decision Making
di: Ding, Ruomeng, et al.
Pubblicazione: (2025)
di: Ding, Ruomeng, et al.
Pubblicazione: (2025)
FullStack Bench: Evaluating LLMs as Full Stack Coders
di: Bytedance-Seed-Foundation-Code-Team, et al.
Pubblicazione: (2024)
di: Bytedance-Seed-Foundation-Code-Team, et al.
Pubblicazione: (2024)
R-ConstraintBench: Evaluating LLMs on NP-Complete Scheduling
di: Jain, Raj, et al.
Pubblicazione: (2025)
di: Jain, Raj, et al.
Pubblicazione: (2025)
Decision-Making Behavior Evaluation Framework for LLMs under Uncertain Context
di: Jia, Jingru, et al.
Pubblicazione: (2024)
di: Jia, Jingru, et al.
Pubblicazione: (2024)
Tracing LLM Reasoning Processes with Strategic Games: A Framework for Planning, Revision, and Resource-Constrained Decision Making
di: Yuan, Xiaopeng, et al.
Pubblicazione: (2025)
di: Yuan, Xiaopeng, et al.
Pubblicazione: (2025)
PIANIST: Learning Partially Observable World Models with LLMs for Multi-Agent Decision Making
di: Light, Jonathan, et al.
Pubblicazione: (2024)
di: Light, Jonathan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
CivRealm: A Learning and Reasoning Odyssey in Civilization for Decision-Making Agents
di: Qi, Siyuan, et al.
Pubblicazione: (2024) -
Vox Deorum: A Hybrid LLM Architecture for 4X / Grand Strategy Game AI -- Lessons from Civilization V
di: Chen, John, et al.
Pubblicazione: (2025) -
ClinDet-Bench: Beyond Abstention, Evaluating Judgment Determinability of LLMs in Clinical Decision-Making
di: Watanabe, Yusuke, et al.
Pubblicazione: (2026) -
DM-Bench: Benchmarking LLMs for Personalized Decision Making in Diabetes Management
di: Cardei, Maria Ana, et al.
Pubblicazione: (2025) -
SPIN-Bench: How Well Do LLMs Plan Strategically and Reason Socially?
di: Yao, Jianzhu, et al.
Pubblicazione: (2025)