WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Zongjie, Wang, Chaozheng, Xie, Yuchong, Ma, Pingchuan, Wang, Shuai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Split and Merge: Aligning Position Biases in LLM-based Evaluators
por: Li, Zongjie, et al.
Publicado: (2023)
por: Li, Zongjie, et al.
Publicado: (2023)
ClinBench-HPB: A Clinical Benchmark for Evaluating LLMs in Hepato-Pancreato-Biliary Diseases
por: Li, Yuchong, et al.
Publicado: (2025)
por: Li, Yuchong, et al.
Publicado: (2025)
Digital Simulations to Enhance Military Medical Evacuation Decision-Making
por: Fischer, Jeremy, et al.
Publicado: (2025)
por: Fischer, Jeremy, et al.
Publicado: (2025)
Measuring Free-Form Decision-Making Inconsistency of Language Models in Military Crisis Simulations
por: Shrivastava, Aryan, et al.
Publicado: (2024)
por: Shrivastava, Aryan, et al.
Publicado: (2024)
Escalation Risks from Language Models in Military and Diplomatic Decision-Making
por: Rivera, Juan-Pablo, et al.
Publicado: (2024)
por: Rivera, Juan-Pablo, et al.
Publicado: (2024)
DM-Bench: Benchmarking LLMs for Personalized Decision Making in Diabetes Management
por: Cardei, Maria Ana, et al.
Publicado: (2025)
por: Cardei, Maria Ana, et al.
Publicado: (2025)
Red Lines and Grey Zones in the Fog of War: Benchmarking Legal Risk, Moral Harm, and Regional Bias in Large Language Model Military Decision-Making
por: Drinkall, Toby
Publicado: (2025)
por: Drinkall, Toby
Publicado: (2025)
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
por: Wang, Xunguang, et al.
Publicado: (2025)
por: Wang, Xunguang, et al.
Publicado: (2025)
Testing and Understanding Erroneous Planning in LLM Agents through Synthesized User Inputs
por: Ji, Zhenlan, et al.
Publicado: (2024)
por: Ji, Zhenlan, et al.
Publicado: (2024)
Decision-Making Behavior Evaluation Framework for LLMs under Uncertain Context
por: Jia, Jingru, et al.
Publicado: (2024)
por: Jia, Jingru, et al.
Publicado: (2024)
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
por: Shi, Yuzhen, et al.
Publicado: (2026)
por: Shi, Yuzhen, et al.
Publicado: (2026)
Aligning AI with Public Values: Deliberation and Decision-Making for Governing Multimodal LLMs in Political Video Analysis
por: Sharma, Tanusree, et al.
Publicado: (2024)
por: Sharma, Tanusree, et al.
Publicado: (2024)
DeCoDe: Defer-and-Complement Decision-Making via Decoupled Concept Bottleneck Models
por: He, Chengbo, et al.
Publicado: (2025)
por: He, Chengbo, et al.
Publicado: (2025)
Persuadability and LLMs as Legal Decision Tools
por: Suttle, Oisin, et al.
Publicado: (2026)
por: Suttle, Oisin, et al.
Publicado: (2026)
Making Effective Decisions: Machine Learning and the Ecogame in 1970
por: Mason, Catherine
Publicado: (2025)
por: Mason, Catherine
Publicado: (2025)
Fairness in Healthcare Processes: A Quantitative Analysis of Decision Making in Triage
por: Andreswari, Rachmadita, et al.
Publicado: (2026)
por: Andreswari, Rachmadita, et al.
Publicado: (2026)
Measuring and Augmenting Large Language Models for Solving Capture-the-Flag Challenges
por: Ji, Zimo, et al.
Publicado: (2025)
por: Ji, Zimo, et al.
Publicado: (2025)
XCR-Bench: A Multi-Task Benchmark for Evaluating Cultural Reasoning in LLMs
por: Kabir, Mohsinul, et al.
Publicado: (2026)
por: Kabir, Mohsinul, et al.
Publicado: (2026)
Trustworthy human-centric based Automated Decision-Making Systems
por: Cabrera, Marcelino, et al.
Publicado: (2023)
por: Cabrera, Marcelino, et al.
Publicado: (2023)
The Controllability Trap: A Governance Framework for Military AI Agents
por: Sahoo, Subramanyam
Publicado: (2026)
por: Sahoo, Subramanyam
Publicado: (2026)
The Consistency-Acceptability Divergence of LLMs in Judicial Decision-Making: Task and Stakeholder Dimensions
por: MingDa, Zhang, et al.
Publicado: (2025)
por: MingDa, Zhang, et al.
Publicado: (2025)
Can LLMs Think Like Consumers? Benchmarking Crowd-Level Reaction Reconstruction with ConsumerSimBench
por: Wang, Tianyu, et al.
Publicado: (2026)
por: Wang, Tianyu, et al.
Publicado: (2026)
Effective Monitoring of Online Decision-Making Algorithms in Digital Intervention Implementation
por: Trella, Anna L., et al.
Publicado: (2024)
por: Trella, Anna L., et al.
Publicado: (2024)
An Empirical Study on Large Language Models in Accuracy and Robustness under Chinese Industrial Scenarios
por: Li, Zongjie, et al.
Publicado: (2024)
por: Li, Zongjie, et al.
Publicado: (2024)
MDK12-Bench: A Comprehensive Evaluation of Multimodal Large Language Models on Multidisciplinary Exams
por: Zhou, Pengfei, et al.
Publicado: (2025)
por: Zhou, Pengfei, et al.
Publicado: (2025)
RoleConflictBench: A Benchmark of Role Conflict Scenarios for Evaluating LLMs' Contextual Sensitivity
por: Shin, Jisu, et al.
Publicado: (2025)
por: Shin, Jisu, et al.
Publicado: (2025)
Bias in Decision-Making for AI's Ethical Dilemmas: A Comparative Study of ChatGPT and Claude
por: Xu, Wentao, et al.
Publicado: (2025)
por: Xu, Wentao, et al.
Publicado: (2025)
Addressing Moral Uncertainty using Large Language Models for Ethical Decision-Making
por: Dubey, Rohit K., et al.
Publicado: (2025)
por: Dubey, Rohit K., et al.
Publicado: (2025)
Assessing AI Utility: The Random Guesser Test for Sequential Decision-Making Systems
por: Ide, Shun, et al.
Publicado: (2024)
por: Ide, Shun, et al.
Publicado: (2024)
The Prompt War: How AI Decides on a Military Intervention
por: Chupilkin, Maxim
Publicado: (2025)
por: Chupilkin, Maxim
Publicado: (2025)
MoPHES:Leveraging on-device LLMs as Agent for Mobile Psychological Health Evaluation and Support
por: Wei, Xun, et al.
Publicado: (2025)
por: Wei, Xun, et al.
Publicado: (2025)
From Perceptions to Decisions: Wildfire Evacuation Decision Prediction with Behavioral Theory-informed LLMs
por: Chen, Ruxiao, et al.
Publicado: (2025)
por: Chen, Ruxiao, et al.
Publicado: (2025)
Basic Research, Lethal Effects: Military AI Research Funding as Enlistment
por: Widder, David Gray, et al.
Publicado: (2024)
por: Widder, David Gray, et al.
Publicado: (2024)
Computational Basis of LLM's Decision Making in Social Simulation
por: Ma, Ji
Publicado: (2025)
por: Ma, Ji
Publicado: (2025)
Preserving Decision Sovereignty in Military AI: A Trade-Secret-Safe Architectural Framework for Model Replaceability, Human Authority, and State Control
por: Wei, Peng, et al.
Publicado: (2026)
por: Wei, Peng, et al.
Publicado: (2026)
Building Interpretable Models for Moral Decision-Making
por: Goel, Mayank, et al.
Publicado: (2026)
por: Goel, Mayank, et al.
Publicado: (2026)
Structured AI Decision-Making in Disaster Management
por: Dcruz, Julian Gerald, et al.
Publicado: (2025)
por: Dcruz, Julian Gerald, et al.
Publicado: (2025)
Comprehensive Framework for Evaluating Conversational AI Chatbots
por: Gupta, Shailja, et al.
Publicado: (2025)
por: Gupta, Shailja, et al.
Publicado: (2025)
Can AI Model the Complexities of Human Moral Decision-Making? A Qualitative Study of Kidney Allocation Decisions
por: Keswani, Vijay, et al.
Publicado: (2025)
por: Keswani, Vijay, et al.
Publicado: (2025)
InterveneBench: Benchmarking LLMs for Intervention Reasoning and Causal Study Design in Real Social Systems
por: Shi, Shaojie, et al.
Publicado: (2026)
por: Shi, Shaojie, et al.
Publicado: (2026)
Ejemplares similares
-
Split and Merge: Aligning Position Biases in LLM-based Evaluators
por: Li, Zongjie, et al.
Publicado: (2023) -
ClinBench-HPB: A Clinical Benchmark for Evaluating LLMs in Hepato-Pancreato-Biliary Diseases
por: Li, Yuchong, et al.
Publicado: (2025) -
Digital Simulations to Enhance Military Medical Evacuation Decision-Making
por: Fischer, Jeremy, et al.
Publicado: (2025) -
Measuring Free-Form Decision-Making Inconsistency of Language Models in Military Crisis Simulations
por: Shrivastava, Aryan, et al.
Publicado: (2024) -
Escalation Risks from Language Models in Military and Diplomatic Decision-Making
por: Rivera, Juan-Pablo, et al.
Publicado: (2024)