Not Your Typical Sycophant: The Elusive Nature of Sycophancy in Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Natan, Shahar Ben, Tsur, Oren |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Blinding and Counterfactual Self-Simulation Mitigate Biases and Sycophancy in Large Language Models
par: Christian, Brian, et autres
Publié: (2026)
par: Christian, Brian, et autres
Publié: (2026)
Sycophancy in Large Language Models: Causes and Mitigations
par: Malmqvist, Lars
Publié: (2024)
par: Malmqvist, Lars
Publié: (2024)
Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models
par: Denison, Carson, et autres
Publié: (2024)
par: Denison, Carson, et autres
Publié: (2024)
Accounting for Sycophancy in Language Model Uncertainty Estimation
par: Sicilia, Anthony, et autres
Publié: (2024)
par: Sicilia, Anthony, et autres
Publié: (2024)
Beacon: Single-Turn Diagnosis and Mitigation of Latent Sycophancy in Large Language Models
par: Pandey, Sanskar, et autres
Publié: (2025)
par: Pandey, Sanskar, et autres
Publié: (2025)
Sycophancy Hides Linearly in the Attention Heads
par: Genadi, Rifo, et autres
Publié: (2026)
par: Genadi, Rifo, et autres
Publié: (2026)
BASIL: Bayesian Assessment of Sycophancy in LLMs
par: Atwell, Katherine, et autres
Publié: (2025)
par: Atwell, Katherine, et autres
Publié: (2025)
Sycophancy Claims about Language Models: The Missing Human-in-the-Loop
par: Batzner, Jan, et autres
Publié: (2025)
par: Batzner, Jan, et autres
Publié: (2025)
Towards Understanding Sycophancy in Language Models
par: Sharma, Mrinank, et autres
Publié: (2023)
par: Sharma, Mrinank, et autres
Publié: (2023)
MONICA: Real-Time Monitoring and Calibration of Chain-of-Thought Sycophancy in Large Reasoning Models
par: Hu, Jingyu, et autres
Publié: (2025)
par: Hu, Jingyu, et autres
Publié: (2025)
Sycophancy in Vision-Language Models: A Systematic Analysis and an Inference-Time Mitigation Framework
par: Zhao, Yunpu, et autres
Publié: (2024)
par: Zhao, Yunpu, et autres
Publié: (2024)
Too Nice to Tell the Truth: Quantifying Agreeableness-Driven Sycophancy in Role-Playing Language Models
par: Shah, Arya, et autres
Publié: (2026)
par: Shah, Arya, et autres
Publié: (2026)
Reasoning Isn't Enough: Examining Truth-Bias and Sycophancy in LLMs
par: Barkett, Emilio, et autres
Publié: (2025)
par: Barkett, Emilio, et autres
Publié: (2025)
Internal Reasoning vs. External Control: A Thermodynamic Analysis of Sycophancy in Large Language Models
par: Chang, Edward Y.
Publié: (2025)
par: Chang, Edward Y.
Publié: (2025)
Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs
par: Zhou, Wenrui, et autres
Publié: (2025)
par: Zhou, Wenrui, et autres
Publié: (2025)
From Sycophancy to Sensemaking: Premise Governance for Human-AI Decision Making
par: Jain, Raunak
Publié: (2026)
par: Jain, Raunak
Publié: (2026)
GermanPartiesQA: Benchmarking Commercial Large Language Models and AI Companions for Political Alignment and Sycophancy
par: Batzner, Jan, et autres
Publié: (2024)
par: Batzner, Jan, et autres
Publié: (2024)
SWAY: A Counterfactual Computational Linguistic Approach to Measuring and Mitigating Sycophancy
par: Bhalla, Joy, et autres
Publié: (2026)
par: Bhalla, Joy, et autres
Publié: (2026)
"Check My Work?": Measuring Sycophancy in a Simulated Educational Context
par: Arvin, Chuck
Publié: (2025)
par: Arvin, Chuck
Publié: (2025)
BrokenMath: A Benchmark for Sycophancy in Theorem Proving with LLMs
par: Petrov, Ivo, et autres
Publié: (2025)
par: Petrov, Ivo, et autres
Publié: (2025)
Acting Flatterers via LLMs Sycophancy: Combating Clickbait with LLMs Opposing-Stance Reasoning
par: Zhang, Chaowei, et autres
Publié: (2026)
par: Zhang, Chaowei, et autres
Publié: (2026)
The Hidden Cost of Contextual Sycophancy: an AI Literacy Intervention in Human-AI Collaboration
par: Koyuturk, Cansu, et autres
Publié: (2026)
par: Koyuturk, Cansu, et autres
Publié: (2026)
Too Polite to Disagree: Understanding Sycophancy Propagation in Multi-Agent Systems
par: Kasprova, Vira, et autres
Publié: (2026)
par: Kasprova, Vira, et autres
Publié: (2026)
It's Not Always Sycophancy: Measuring LLM Conformity as a Function of Epistemic Uncertainty
par: Guo, Kevin H., et autres
Publié: (2026)
par: Guo, Kevin H., et autres
Publié: (2026)
Have the VLMs Lost Confidence? A Study of Sycophancy in VLMs
par: Li, Shuo, et autres
Publié: (2024)
par: Li, Shuo, et autres
Publié: (2024)
Auditing Stealth Sycophancy in Mental-Health Dialogue: Structured Clinical-State Diagnostics and Clean Matched Benchmarks
par: Han, Tianze, et autres
Publié: (2026)
par: Han, Tianze, et autres
Publié: (2026)
Sycophancy is an Educational Safety Risk: Why LLM Tutors Need Sycophancy Benchmarks
par: Kasneci, Enkelejda, et autres
Publié: (2026)
par: Kasneci, Enkelejda, et autres
Publié: (2026)
Sycophancy as compositions of Atomic Psychometric Traits
par: Jain, Shreyans, et autres
Publié: (2025)
par: Jain, Shreyans, et autres
Publié: (2025)
On the Creativity of Large Language Models
par: Franceschelli, Giorgio, et autres
Publié: (2023)
par: Franceschelli, Giorgio, et autres
Publié: (2023)
EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
par: Yuan, Botai, et autres
Publié: (2025)
par: Yuan, Botai, et autres
Publié: (2025)
Cross-Language Bias Examination in Large Language Models
par: Liang, Yuxuan, et autres
Publié: (2025)
par: Liang, Yuxuan, et autres
Publié: (2025)
Benchmarking and Mitigating Sycophancy in Medical Vision Language Models
par: Xu, Juangui, et autres
Publié: (2025)
par: Xu, Juangui, et autres
Publié: (2025)
Evaluation of Large Language Models in Legal Applications: Challenges, Methods, and Future Directions
par: Hu, Yiran, et autres
Publié: (2026)
par: Hu, Yiran, et autres
Publié: (2026)
Anticipating Innovation Using Large Language Models
par: Fenoaltea, Enrico Maria, et autres
Publié: (2026)
par: Fenoaltea, Enrico Maria, et autres
Publié: (2026)
Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models
par: Dahl, Matthew, et autres
Publié: (2024)
par: Dahl, Matthew, et autres
Publié: (2024)
Evaluating Large Language Models for Detecting Antisemitism
par: Patel, Jay, et autres
Publié: (2025)
par: Patel, Jay, et autres
Publié: (2025)
Open-Ended Wargames with Large Language Models
par: Hogan, Daniel P., et autres
Publié: (2024)
par: Hogan, Daniel P., et autres
Publié: (2024)
Large Language Models for Education: A Survey
par: Xu, Hanyi, et autres
Publié: (2024)
par: Xu, Hanyi, et autres
Publié: (2024)
How Large Language Models are Designed to Hallucinate
par: Ackermann, Richard, et autres
Publié: (2025)
par: Ackermann, Richard, et autres
Publié: (2025)
Large Language Models as Misleading Assistants in Conversation
par: Hou, Betty Li, et autres
Publié: (2024)
par: Hou, Betty Li, et autres
Publié: (2024)
Documents similaires
-
Self-Blinding and Counterfactual Self-Simulation Mitigate Biases and Sycophancy in Large Language Models
par: Christian, Brian, et autres
Publié: (2026) -
Sycophancy in Large Language Models: Causes and Mitigations
par: Malmqvist, Lars
Publié: (2024) -
Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models
par: Denison, Carson, et autres
Publié: (2024) -
Accounting for Sycophancy in Language Model Uncertainty Estimation
par: Sicilia, Anthony, et autres
Publié: (2024) -
Beacon: Single-Turn Diagnosis and Mitigation of Latent Sycophancy in Large Language Models
par: Pandey, Sanskar, et autres
Publié: (2025)