Measuring Free-Form Decision-Making Inconsistency of Language Models in Military Crisis Simulations
Fuente:
arXiv
Saved in:
| Main Authors: | Shrivastava, Aryan, Hullman, Jessica, Lamparth, Max |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Escalation Risks from Language Models in Military and Diplomatic Decision-Making
by: Rivera, Juan-Pablo, et al.
Published: (2024)
by: Rivera, Juan-Pablo, et al.
Published: (2024)
Risks from Language Models for Automated Mental Healthcare: Ethics and Structure for Implementation
by: Grabb, Declan, et al.
Published: (2024)
by: Grabb, Declan, et al.
Published: (2024)
Human vs. Machine: Behavioral Differences Between Expert Humans and Language Models in Wargame Simulations
by: Lamparth, Max, et al.
Published: (2024)
by: Lamparth, Max, et al.
Published: (2024)
Red Lines and Grey Zones in the Fog of War: Benchmarking Legal Risk, Moral Harm, and Regional Bias in Large Language Model Military Decision-Making
by: Drinkall, Toby
Published: (2025)
by: Drinkall, Toby
Published: (2025)
Analyzing And Editing Inner Mechanisms Of Backdoored Language Models
by: Lamparth, Max, et al.
Published: (2023)
by: Lamparth, Max, et al.
Published: (2023)
Linearly Decoding Refused Knowledge in Aligned Language Models
by: Shrivastava, Aryan, et al.
Published: (2025)
by: Shrivastava, Aryan, et al.
Published: (2025)
Know Thyself? On the Incapability and Implications of AI Self-Recognition
by: Bai, Xiaoyan, et al.
Published: (2025)
by: Bai, Xiaoyan, et al.
Published: (2025)
Semantic Sensitivities and Inconsistent Predictions: Measuring the Fragility of NLI Models
by: Arakelyan, Erik, et al.
Published: (2024)
by: Arakelyan, Erik, et al.
Published: (2024)
Digital Simulations to Enhance Military Medical Evacuation Decision-Making
by: Fischer, Jeremy, et al.
Published: (2025)
by: Fischer, Jeremy, et al.
Published: (2025)
Language Agents as Digital Representatives in Collective Decision-Making
by: Jarrett, Daniel, et al.
Published: (2025)
by: Jarrett, Daniel, et al.
Published: (2025)
WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making
by: Li, Zongjie, et al.
Published: (2026)
by: Li, Zongjie, et al.
Published: (2026)
Towards Next-Generation Medical Agent: How o1 is Reshaping Decision-Making in Medical Scenarios
by: Xu, Shaochen, et al.
Published: (2024)
by: Xu, Shaochen, et al.
Published: (2024)
An analysis of AI Decision under Risk: Prospect theory emerges in Large Language Models
by: Payne, Kenneth
Published: (2025)
by: Payne, Kenneth
Published: (2025)
One Bias After Another: Mechanistic Reward Shaping and Persistent Biases in Language Reward Models
by: Fein, Daniel, et al.
Published: (2026)
by: Fein, Daniel, et al.
Published: (2026)
Training-Free Cultural Alignment of Large Language Models via Persona Disagreement
by: Kiet, Huynh Trung, et al.
Published: (2026)
by: Kiet, Huynh Trung, et al.
Published: (2026)
Large Language Models Can Infer Personality from Free-Form User Interactions
by: Peters, Heinrich, et al.
Published: (2024)
by: Peters, Heinrich, et al.
Published: (2024)
Fine-Grained Behavior Simulation with Role-Playing Large Language Model on Social Media
by: Li, Kun, et al.
Published: (2024)
by: Li, Kun, et al.
Published: (2024)
Self-Alignment of Large Language Models via Monopolylogue-based Social Scene Simulation
by: Pang, Xianghe, et al.
Published: (2024)
by: Pang, Xianghe, et al.
Published: (2024)
Self-Blinding and Counterfactual Self-Simulation Mitigate Biases and Sycophancy in Large Language Models
by: Christian, Brian, et al.
Published: (2026)
by: Christian, Brian, et al.
Published: (2026)
Teaching Language Models How to Code Like Learners: Conversational Serialization for Student Simulation
by: Koutcheme, Charles, et al.
Published: (2026)
by: Koutcheme, Charles, et al.
Published: (2026)
Simulating Students with Large Language Models: A Review of Architecture, Mechanisms, and Role Modelling in Education with Generative AI
by: Marquez-Carpintero, Luis, et al.
Published: (2025)
by: Marquez-Carpintero, Luis, et al.
Published: (2025)
Position: The Current AI Conference Model is Unsustainable! Diagnosing the Crisis of Centralized AI Conference
by: Chen, Nuo, et al.
Published: (2025)
by: Chen, Nuo, et al.
Published: (2025)
Do GPT Language Models Suffer From Split Personality Disorder? The Advent Of Substrate-Free Psychometrics
by: Romero, Peter, et al.
Published: (2024)
by: Romero, Peter, et al.
Published: (2024)
Measuring and Eliminating Refusals in Military Large Language Models
by: FitzGerald, Jack, et al.
Published: (2026)
by: FitzGerald, Jack, et al.
Published: (2026)
War and Peace (WarAgent): Large Language Model-based Multi-Agent Simulation of World Wars
by: Hua, Wenyue, et al.
Published: (2023)
by: Hua, Wenyue, et al.
Published: (2023)
Ask LLMs Directly, "What shapes your bias?": Measuring Social Bias in Large Language Models
by: Shin, Jisu, et al.
Published: (2024)
by: Shin, Jisu, et al.
Published: (2024)
No Free Lunch in Language Model Bias Mitigation? Targeted Bias Reduction Can Exacerbate Unmitigated LLM Biases
by: Chand, Shireen, et al.
Published: (2025)
by: Chand, Shireen, et al.
Published: (2025)
Hanging in the Balance: Pivotal Moments in Crisis Counseling Conversations
by: Nguyen, Vivian, et al.
Published: (2025)
by: Nguyen, Vivian, et al.
Published: (2025)
AIn't Nothing But a Survey? Using Large Language Models for Coding German Open-Ended Survey Responses on Survey Motivation
by: von der Heyde, Leah, et al.
Published: (2025)
by: von der Heyde, Leah, et al.
Published: (2025)
Implicit Behavioral Alignment of Language Agents in High-Stakes Crowd Simulations
by: Wang, Yunzhe, et al.
Published: (2025)
by: Wang, Yunzhe, et al.
Published: (2025)
SafeTalkCoach: Diversity-Driven Multi-Agent Simulation for Parent-Teen Health Conversations
by: Tabarsi, Benyamin, et al.
Published: (2026)
by: Tabarsi, Benyamin, et al.
Published: (2026)
Can Large Language Models Simulate Human Responses? A Case Study of Stated Preference Experiments in the Context of Heating-related Choices
by: Wang, Han, et al.
Published: (2025)
by: Wang, Han, et al.
Published: (2025)
Large Language Models Can Be a Viable Substitute for Expert Political Surveys When a Shock Disrupts Traditional Measurement Approaches
by: Wu, Patrick Y.
Published: (2025)
by: Wu, Patrick Y.
Published: (2025)
Towards Measuring and Modeling "Culture" in LLMs: A Survey
by: Adilazuarda, Muhammad Farid, et al.
Published: (2024)
by: Adilazuarda, Muhammad Farid, et al.
Published: (2024)
LLMs as Debate Partners: Utilizing Genetic Algorithms and Adversarial Search for Adaptive Arguments
by: Aryan, Prakash
Published: (2024)
by: Aryan, Prakash
Published: (2024)
The Algorithmic Caricature: Auditing LLM-Generated Political Discourse Across Crisis Events
by: Gunjan, et al.
Published: (2026)
by: Gunjan, et al.
Published: (2026)
Are Large Language Models Chameleons? An Attempt to Simulate Social Surveys
by: Geng, Mingmeng, et al.
Published: (2024)
by: Geng, Mingmeng, et al.
Published: (2024)
Large Language Models as Psychological Simulators: A Methodological Guide
by: Lin, Zhicheng
Published: (2025)
by: Lin, Zhicheng
Published: (2025)
Cross-Language Bias Examination in Large Language Models
by: Liang, Yuxuan, et al.
Published: (2025)
by: Liang, Yuxuan, et al.
Published: (2025)
Pareidolic Illusions of Meaning: ChatGPT, Pseudolaw and the Triumph of Form over Substance
by: McIntyre, Joe
Published: (2025)
by: McIntyre, Joe
Published: (2025)
Similar Items
-
Escalation Risks from Language Models in Military and Diplomatic Decision-Making
by: Rivera, Juan-Pablo, et al.
Published: (2024) -
Risks from Language Models for Automated Mental Healthcare: Ethics and Structure for Implementation
by: Grabb, Declan, et al.
Published: (2024) -
Human vs. Machine: Behavioral Differences Between Expert Humans and Language Models in Wargame Simulations
by: Lamparth, Max, et al.
Published: (2024) -
Red Lines and Grey Zones in the Fog of War: Benchmarking Legal Risk, Moral Harm, and Regional Bias in Large Language Model Military Decision-Making
by: Drinkall, Toby
Published: (2025) -
Analyzing And Editing Inner Mechanisms Of Backdoored Language Models
by: Lamparth, Max, et al.
Published: (2023)