Crisis-Bench: Benchmarking Strategic Ambiguity and Reputation Management in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Lin, Cooper, Ran, Maohao, Zhang, Yanting, Wan, Zhenglin, Fan, Hongwei, Xu, Yibo, Guo, Yike, Xue, Wei, Song, Jun |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Reinforcement Learning of Large Language Models for Interpretable Credit Card Fraud Detection
by: Lin, Cooper, et al.
Published: (2026)
by: Lin, Cooper, et al.
Published: (2026)
Bottom-Up Reputation Promotes Cooperation with Multi-Agent Reinforcement Learning
by: Ren, Tianyu, et al.
Published: (2025)
by: Ren, Tianyu, et al.
Published: (2025)
Computational Foundations for Strategic Coopetition: Formalizing Trust and Reputation Dynamics
by: Pant, Vik, et al.
Published: (2025)
by: Pant, Vik, et al.
Published: (2025)
MedPriv-Bench: Benchmarking the Privacy-Utility Trade-off of Large Language Models in Medical Open-End Question Answering
by: Guan, Shaowei, et al.
Published: (2026)
by: Guan, Shaowei, et al.
Published: (2026)
AgentWebBench: Benchmarking Multi-Agent Coordination in Agentic Web
by: Zhong, Shanshan, et al.
Published: (2026)
by: Zhong, Shanshan, et al.
Published: (2026)
Strategic Communication and Language Bias in Multi-Agent LLM Coordination
by: Buscemi, Alessio, et al.
Published: (2025)
by: Buscemi, Alessio, et al.
Published: (2025)
Dissociative Identity: Language Model Agents Lack Grounding for Reputation Mechanisms
by: Hu, Botao Amber, et al.
Published: (2026)
by: Hu, Botao Amber, et al.
Published: (2026)
WorldView-Bench: A Benchmark for Evaluating Global Cultural Perspectives in Large Language Models
by: Mushtaq, Abdullah, et al.
Published: (2025)
by: Mushtaq, Abdullah, et al.
Published: (2025)
Reputation as a Solution to Cooperation Collapse in LLM-based MASs
by: Ren, Siyue, et al.
Published: (2025)
by: Ren, Siyue, et al.
Published: (2025)
AssetOpsBench: Benchmarking AI Agents for Task Automation in Industrial Asset Operations and Maintenance
by: Patel, Dhaval, et al.
Published: (2025)
by: Patel, Dhaval, et al.
Published: (2025)
Agents on the Bench: Large Language Model Based Multi Agent Framework for Trustworthy Digital Justice
by: Jiang, Cong, et al.
Published: (2024)
by: Jiang, Cong, et al.
Published: (2024)
LLM-based Multi-Agent System for Simulating Strategic and Goal-Oriented Data Marketplaces
by: Sashihara, Jun, et al.
Published: (2025)
by: Sashihara, Jun, et al.
Published: (2025)
SpecBench: Evaluating Specification-Level Reasoning for Software Engineering LLM Agents
by: Hamblin, Grant, et al.
Published: (2026)
by: Hamblin, Grant, et al.
Published: (2026)
How Collective Intelligence Emerges in a Crowd of People Through Learned Division of Labor: A Case Study
by: Wang, Dekun, et al.
Published: (2025)
by: Wang, Dekun, et al.
Published: (2025)
Safe Multi-Agent Behavior Must Be Maintained, Not Merely Asserted: Constraint Drift in LLM-Based Multi-Agent Systems
by: Li, Tianxiao, et al.
Published: (2026)
by: Li, Tianxiao, et al.
Published: (2026)
FedLLM-Bench: Realistic Benchmarks for Federated Learning of Large Language Models
by: Ye, Rui, et al.
Published: (2024)
by: Ye, Rui, et al.
Published: (2024)
LongCLI-Bench: A Preliminary Benchmark and Study for Long-horizon Agentic Programming in Command-Line Interfaces
by: Feng, Yukang, et al.
Published: (2026)
by: Feng, Yukang, et al.
Published: (2026)
BenchMARL: Benchmarking Multi-Agent Reinforcement Learning
by: Bettini, Matteo, et al.
Published: (2023)
by: Bettini, Matteo, et al.
Published: (2023)
KramaBench: A Benchmark for AI Systems on Data-to-Insight Pipelines over Data Lakes
by: Lai, Eugenie, et al.
Published: (2025)
by: Lai, Eugenie, et al.
Published: (2025)
Strategic Concealment of Environment Representations in Competitive Games
by: Guan, Yue, et al.
Published: (2025)
by: Guan, Yue, et al.
Published: (2025)
Cognitive Agents Powered by Large Language Models for Agile Software Project Management
by: Cinkusz, Konrad, et al.
Published: (2025)
by: Cinkusz, Konrad, et al.
Published: (2025)
LingxiDiagBench: A Multi-Agent Framework for Benchmarking LLMs in Chinese Psychiatric Consultation and Diagnosis
by: Xu, Shihao, et al.
Published: (2026)
by: Xu, Shihao, et al.
Published: (2026)
ToMPO: Training LLM Strategic Decision Making from a Multi-Agent Perspective
by: Zhang, Yiwen, et al.
Published: (2025)
by: Zhang, Yiwen, et al.
Published: (2025)
Mesh Memory Protocol: Semantic Infrastructure for Multi-Agent LLM Systems
by: Xu, Hongwei
Published: (2026)
by: Xu, Hongwei
Published: (2026)
Symbolic-Vector Attention Fusion for Collective Intelligence
by: Xu, Hongwei
Published: (2026)
by: Xu, Hongwei
Published: (2026)
Analyzing Collision Rates in Large-Scale Mixed Traffic Control via Multi-Agent Reinforcement Learning
by: Fan, Muyang
Published: (2025)
by: Fan, Muyang
Published: (2025)
Think How Your Teammates Think: Active Inference Can Benefit Decentralized Execution
by: Wu, Hao, et al.
Published: (2025)
by: Wu, Hao, et al.
Published: (2025)
Distributed Online Life-Long Learning (DOL3) for Multi-agent Trust and Reputation Assessment in E-commerce
by: Ramamoorthy, Hariprasauth, et al.
Published: (2024)
by: Ramamoorthy, Hariprasauth, et al.
Published: (2024)
AgentSearchBench: A Benchmark for AI Agent Search in the Wild
by: Wu, Bin, et al.
Published: (2026)
by: Wu, Bin, et al.
Published: (2026)
Large Language Model for Participatory Urban Planning
by: Zhou, Zhilun, et al.
Published: (2024)
by: Zhou, Zhilun, et al.
Published: (2024)
Stop Wasting Your Tokens: Towards Efficient Runtime Multi-Agent Systems
by: Lin, Fulin, et al.
Published: (2025)
by: Lin, Fulin, et al.
Published: (2025)
When KV Cache Reuse Fails in Multi-Agent Systems: Cross-Candidate Interaction is Crucial for LLM Judges
by: Liang, Sichu, et al.
Published: (2026)
by: Liang, Sichu, et al.
Published: (2026)
WorkBench: a Benchmark Dataset for Agents in a Realistic Workplace Setting
by: Styles, Olly, et al.
Published: (2024)
by: Styles, Olly, et al.
Published: (2024)
SciReplicate-Bench: Benchmarking LLMs in Agent-driven Algorithmic Reproduction from Research Papers
by: Xiang, Yanzheng, et al.
Published: (2025)
by: Xiang, Yanzheng, et al.
Published: (2025)
MeloTune: On-Device Arousal Learning and Peer-to-Peer Mood Coupling for Proactive Music Curation
by: Xu, Hongwei
Published: (2026)
by: Xu, Hongwei
Published: (2026)
Strategic Infrastructure Design via Multi-Agent Congestion Games with Joint Placement and Pricing
by: Aminikalibar, Niloofar, et al.
Published: (2026)
by: Aminikalibar, Niloofar, et al.
Published: (2026)
Emergent Coordinated Behaviors in Networked LLM Agents: Modeling the Strategic Dynamics of Information Operations
by: Orlando, Gian Marco, et al.
Published: (2025)
by: Orlando, Gian Marco, et al.
Published: (2025)
Collab-Overcooked: Benchmarking and Evaluating Large Language Models as Collaborative Agents
by: Sun, Haochen, et al.
Published: (2025)
by: Sun, Haochen, et al.
Published: (2025)
LLM-Coordination: Evaluating and Analyzing Multi-agent Coordination Abilities in Large Language Models
by: Agashe, Saaket, et al.
Published: (2023)
by: Agashe, Saaket, et al.
Published: (2023)
Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning
by: Yan, Sikuan, et al.
Published: (2025)
by: Yan, Sikuan, et al.
Published: (2025)
Similar Items
-
Reinforcement Learning of Large Language Models for Interpretable Credit Card Fraud Detection
by: Lin, Cooper, et al.
Published: (2026) -
Bottom-Up Reputation Promotes Cooperation with Multi-Agent Reinforcement Learning
by: Ren, Tianyu, et al.
Published: (2025) -
Computational Foundations for Strategic Coopetition: Formalizing Trust and Reputation Dynamics
by: Pant, Vik, et al.
Published: (2025) -
MedPriv-Bench: Benchmarking the Privacy-Utility Trade-off of Large Language Models in Medical Open-End Question Answering
by: Guan, Shaowei, et al.
Published: (2026) -
AgentWebBench: Benchmarking Multi-Agent Coordination in Agentic Web
by: Zhong, Shanshan, et al.
Published: (2026)