SycoEval-EM: Sycophancy Evaluation of Large Language Models in Simulated Clinical Encounters for Emergency Care
Fuente:
arXiv
Saved in:
| Main Authors: | Peng, Dongshen, Wang, Yi, Schoeffler, Austin, Preiksaitis, Carl, Rose, Christian |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Intersectional Sycophancy: How Perceived User Demographics Shape False Validation in Large Language Models
by: Maltbie, Benjamin, et al.
Published: (2026)
by: Maltbie, Benjamin, et al.
Published: (2026)
Accounting for Sycophancy in Language Model Uncertainty Estimation
by: Sicilia, Anthony, et al.
Published: (2024)
by: Sicilia, Anthony, et al.
Published: (2024)
The Illusion of Agreement with ChatGPT: Sycophancy and Beyond
by: Noshin, Kazi, et al.
Published: (2026)
by: Noshin, Kazi, et al.
Published: (2026)
Interaction Context Often Increases Sycophancy in LLMs
by: Jain, Shomik, et al.
Published: (2025)
by: Jain, Shomik, et al.
Published: (2025)
Sycophancy is an Educational Safety Risk: Why LLM Tutors Need Sycophancy Benchmarks
by: Kasneci, Enkelejda, et al.
Published: (2026)
by: Kasneci, Enkelejda, et al.
Published: (2026)
MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models
by: Lee, Suhyun, et al.
Published: (2026)
by: Lee, Suhyun, et al.
Published: (2026)
Perceived Safety of Workers in Encounters with Large Industrial AGVs
by: Howey, Ansgar, et al.
Published: (2026)
by: Howey, Ansgar, et al.
Published: (2026)
The Social Sycophancy Scale: A psychometrically validated measure of sycophancy
by: Rehani, Jean, et al.
Published: (2026)
by: Rehani, Jean, et al.
Published: (2026)
Be Friendly, Not Friends: How LLM Sycophancy Shapes User Trust
by: Sun, Yuan, et al.
Published: (2025)
by: Sun, Yuan, et al.
Published: (2025)
The RealHumanEval: Evaluating Large Language Models' Abilities to Support Programmers
by: Mozannar, Hussein, et al.
Published: (2024)
by: Mozannar, Hussein, et al.
Published: (2024)
PALLM: Evaluating and Enhancing PALLiative Care Conversations with Large Language Models
by: Wang, Zhiyuan, et al.
Published: (2024)
by: Wang, Zhiyuan, et al.
Published: (2024)
EvalLM: Interactive Evaluation of Large Language Model Prompts on User-Defined Criteria
by: Kim, Tae Soo, et al.
Published: (2023)
by: Kim, Tae Soo, et al.
Published: (2023)
The Engagement-Prolonging Designs Teens Encounter on Very Large Online Platforms
by: Chen, Yixin, et al.
Published: (2024)
by: Chen, Yixin, et al.
Published: (2024)
VisEval: A Benchmark for Data Visualization in the Era of Large Language Models
by: Chen, Nan, et al.
Published: (2024)
by: Chen, Nan, et al.
Published: (2024)
"When I lost it, they dragged me out": How Care Encounters Empower Marginalized Young Adults' Aspiration and Mental Health Care-Seeking
by: Liu, Jiaying, et al.
Published: (2025)
by: Liu, Jiaying, et al.
Published: (2025)
LalaEval: A Holistic Human Evaluation Framework for Domain-Specific Large Language Models
by: Sun, Chongyan, et al.
Published: (2024)
by: Sun, Chongyan, et al.
Published: (2024)
Alignment Without Understanding: A Message- and Conversation-Centered Approach to Understanding AI Sycophancy
by: Du, Lihua, et al.
Published: (2025)
by: Du, Lihua, et al.
Published: (2025)
Evaluating the Efficacy of Large Language Models for Generating Fine-Grained Visual Privacy Policies in Homes
by: Zhang, Shuning, et al.
Published: (2025)
by: Zhang, Shuning, et al.
Published: (2025)
Visualization Generation with Large Language Models: An Evaluation
by: Wang, Xinyu, et al.
Published: (2024)
by: Wang, Xinyu, et al.
Published: (2024)
InjectLab: A Tactical Framework for Adversarial Threat Modeling Against Large Language Models
by: Howard, Austin
Published: (2025)
by: Howard, Austin
Published: (2025)
Simulating Novice Students Using Machine Unlearning and Relearning in Large Language Models
by: Song, Jiajia, et al.
Published: (2026)
by: Song, Jiajia, et al.
Published: (2026)
MultEval: Supporting Collaborative Alignment for LLM-as-a-Judge Evaluation Criteria
by: Chiang, Charles, et al.
Published: (2026)
by: Chiang, Charles, et al.
Published: (2026)
Exploring Implicit Perspectives on Autism in Large Language Models Through Multi-Agent Simulations
by: Park, Sohyeon, et al.
Published: (2026)
by: Park, Sohyeon, et al.
Published: (2026)
Card Sorting Simulator: Augmenting Design of Logical Information Architectures with Large Language Models
by: Kuric, Eduard, et al.
Published: (2025)
by: Kuric, Eduard, et al.
Published: (2025)
Revolutionizing Mental Health Care through LangChain: A Journey with a Large Language Model
by: Singh, Aditi, et al.
Published: (2024)
by: Singh, Aditi, et al.
Published: (2024)
To Rely or Not to Rely? Evaluating Interventions for Appropriate Reliance on Large Language Models
by: Bo, Jessica Y., et al.
Published: (2024)
by: Bo, Jessica Y., et al.
Published: (2024)
Exploring Large Language Models for Specialist-level Oncology Care
by: Palepu, Anil, et al.
Published: (2024)
by: Palepu, Anil, et al.
Published: (2024)
Natural Language but Omitted? On the Ineffectiveness of Large Language Models' privacy policy from End-users' Perspective
by: Zhang, Shuning, et al.
Published: (2024)
by: Zhang, Shuning, et al.
Published: (2024)
Towards Valid Student Simulation with Large Language Models
by: Yuan, Zhihao, et al.
Published: (2026)
by: Yuan, Zhihao, et al.
Published: (2026)
AffectGPT: A New Dataset, Model, and Benchmark for Emotion Understanding with Multimodal Large Language Models
by: Lian, Zheng, et al.
Published: (2025)
by: Lian, Zheng, et al.
Published: (2025)
Towards Modeling Situational Awareness Through Visual Attention in Clinical Simulations
by: Gao, Haoting, et al.
Published: (2026)
by: Gao, Haoting, et al.
Published: (2026)
An Efficient Interaction Human-AI Synergy System Bridging Visual Awareness and Large Language Model for Intensive Care Units
by: Zhao, Yibowen, et al.
Published: (2025)
by: Zhao, Yibowen, et al.
Published: (2025)
Encountering Robotic Art: The Social, Material, and Temporal Processes of Creation with Machines
by: Qin, Yigang, et al.
Published: (2025)
by: Qin, Yigang, et al.
Published: (2025)
Large Language Models have Chain-of-Affect
by: Xu, Junjie, et al.
Published: (2025)
by: Xu, Junjie, et al.
Published: (2025)
Developing Authentic Simulated Learners for Mathematics Teacher Learning: Insights from Three Approaches with Large Language Models
by: Cao, Jie, et al.
Published: (2026)
by: Cao, Jie, et al.
Published: (2026)
From Promising Capability to Pervasive Bias: Assessing Large Language Models for Emergency Department Triage
by: Lee, Joseph, et al.
Published: (2025)
by: Lee, Joseph, et al.
Published: (2025)
Experimental Interface for Multimodal and Large Language Model Based Explanations of Educational Recommender Systems
by: Abu-Rasheed, Hasan, et al.
Published: (2024)
by: Abu-Rasheed, Hasan, et al.
Published: (2024)
Large Language Model Agent Personality and Response Appropriateness: Evaluation by Human Linguistic Experts, LLM-as-Judge, and Natural Language Processing Model
by: Jayakumar, Eswari, et al.
Published: (2025)
by: Jayakumar, Eswari, et al.
Published: (2025)
FlowEval: Reference-based Evaluation of Generated User Interfaces
by: Wu, Jason, et al.
Published: (2026)
by: Wu, Jason, et al.
Published: (2026)
Towards Dataset-scale and Feature-oriented Evaluation of Text Summarization in Large Language Model Prompts
by: Lee, Sam Yu-Te, et al.
Published: (2024)
by: Lee, Sam Yu-Te, et al.
Published: (2024)
Similar Items
-
Intersectional Sycophancy: How Perceived User Demographics Shape False Validation in Large Language Models
by: Maltbie, Benjamin, et al.
Published: (2026) -
Accounting for Sycophancy in Language Model Uncertainty Estimation
by: Sicilia, Anthony, et al.
Published: (2024) -
The Illusion of Agreement with ChatGPT: Sycophancy and Beyond
by: Noshin, Kazi, et al.
Published: (2026) -
Interaction Context Often Increases Sycophancy in LLMs
by: Jain, Shomik, et al.
Published: (2025) -
Sycophancy is an Educational Safety Risk: Why LLM Tutors Need Sycophancy Benchmarks
by: Kasneci, Enkelejda, et al.
Published: (2026)