When Truth Is Overridden: Uncovering the Internal Origins of Sycophancy in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Keyu, Li, Jin, Yang, Shu, Zhang, Zhuoran, Wang, Di |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
From Yes-Men to Truth-Tellers: Addressing Sycophancy in Large Language Models with Pinpoint Tuning
por: Chen, Wei, et al.
Publicado: (2024)
por: Chen, Wei, et al.
Publicado: (2024)
MONICA: Real-Time Monitoring and Calibration of Chain-of-Thought Sycophancy in Large Reasoning Models
por: Hu, Jingyu, et al.
Publicado: (2025)
por: Hu, Jingyu, et al.
Publicado: (2025)
Not Your Typical Sycophant: The Elusive Nature of Sycophancy in Large Language Models
por: Natan, Shahar Ben, et al.
Publicado: (2026)
por: Natan, Shahar Ben, et al.
Publicado: (2026)
Measuring Sycophancy of Language Models in Multi-turn Dialogues
por: Hong, Jiseung, et al.
Publicado: (2025)
por: Hong, Jiseung, et al.
Publicado: (2025)
Sycophancy in Large Language Models: Causes and Mitigations
por: Malmqvist, Lars
Publicado: (2024)
por: Malmqvist, Lars
Publicado: (2024)
Too Nice to Tell the Truth: Quantifying Agreeableness-Driven Sycophancy in Role-Playing Language Models
por: Shah, Arya, et al.
Publicado: (2026)
por: Shah, Arya, et al.
Publicado: (2026)
Internal Reasoning vs. External Control: A Thermodynamic Analysis of Sycophancy in Large Language Models
por: Chang, Edward Y.
Publicado: (2025)
por: Chang, Edward Y.
Publicado: (2025)
Uncovering Overfitting in Large Language Model Editing
por: Zhang, Mengqi, et al.
Publicado: (2024)
por: Zhang, Mengqi, et al.
Publicado: (2024)
Reasoning Isn't Enough: Examining Truth-Bias and Sycophancy in LLMs
por: Barkett, Emilio, et al.
Publicado: (2025)
por: Barkett, Emilio, et al.
Publicado: (2025)
Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs
por: Zhou, Wenrui, et al.
Publicado: (2025)
por: Zhou, Wenrui, et al.
Publicado: (2025)
Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models
por: Denison, Carson, et al.
Publicado: (2024)
por: Denison, Carson, et al.
Publicado: (2024)
Do LLMs Know What Is Private Internally? Probing and Steering Contextual Privacy Norms in Large Language Model Representations
por: Wang, Haoran, et al.
Publicado: (2026)
por: Wang, Haoran, et al.
Publicado: (2026)
Truth as a Trajectory: What Internal Representations Reveal About Large Language Model Reasoning
por: Damirchi, Hamed, et al.
Publicado: (2026)
por: Damirchi, Hamed, et al.
Publicado: (2026)
NILE: Internal Consistency Alignment in Large Language Models
por: Hu, Minda, et al.
Publicado: (2024)
por: Hu, Minda, et al.
Publicado: (2024)
Truth Forest: Toward Multi-Scale Truthfulness in Large Language Models through Intervention without Tuning
por: Chen, Zhongzhi, et al.
Publicado: (2023)
por: Chen, Zhongzhi, et al.
Publicado: (2023)
Word Recovery in Large Language Models Enables Character-Level Tokenization Robustness
por: Yang, Zhipeng, et al.
Publicado: (2026)
por: Yang, Zhipeng, et al.
Publicado: (2026)
Large Language Models Are Involuntary Truth-Tellers: Exploiting Fallacy Failure for Jailbreak Attacks
por: Zhou, Yue, et al.
Publicado: (2024)
por: Zhou, Yue, et al.
Publicado: (2024)
Large Language Models Help Humans Verify Truthfulness -- Except When They Are Convincingly Wrong
por: Si, Chenglei, et al.
Publicado: (2023)
por: Si, Chenglei, et al.
Publicado: (2023)
TruthX: Alleviating Hallucinations by Editing Large Language Models in Truthful Space
por: Zhang, Shaolei, et al.
Publicado: (2024)
por: Zhang, Shaolei, et al.
Publicado: (2024)
Logical Closed Loop: Uncovering Object Hallucinations in Large Vision-Language Models
por: Wu, Junfei, et al.
Publicado: (2024)
por: Wu, Junfei, et al.
Publicado: (2024)
Beacon: Single-Turn Diagnosis and Mitigation of Latent Sycophancy in Large Language Models
por: Pandey, Sanskar, et al.
Publicado: (2025)
por: Pandey, Sanskar, et al.
Publicado: (2025)
Improving Factuality in Large Language Models via Decoding-Time Hallucinatory and Truthful Comparators
por: Yang, Dingkang, et al.
Publicado: (2024)
por: Yang, Dingkang, et al.
Publicado: (2024)
Accounting for Sycophancy in Language Model Uncertainty Estimation
por: Sicilia, Anthony, et al.
Publicado: (2024)
por: Sicilia, Anthony, et al.
Publicado: (2024)
TRUTH DECAY: Quantifying Multi-Turn Sycophancy in Language Models
por: Liu, Joshua, et al.
Publicado: (2025)
por: Liu, Joshua, et al.
Publicado: (2025)
Internal Consistency and Self-Feedback in Large Language Models: A Survey
por: Liang, Xun, et al.
Publicado: (2024)
por: Liang, Xun, et al.
Publicado: (2024)
Sycophancy Claims about Language Models: The Missing Human-in-the-Loop
por: Batzner, Jan, et al.
Publicado: (2025)
por: Batzner, Jan, et al.
Publicado: (2025)
Understanding and Mitigating Political Stance Cross-topic Generalization in Large Language Models
por: Zhang, Jiayi, et al.
Publicado: (2025)
por: Zhang, Jiayi, et al.
Publicado: (2025)
CoT is Not the Chain of Truth: An Empirical Internal Analysis of Reasoning LLMs for Fake News Generation
por: Tong, Zhao, et al.
Publicado: (2026)
por: Tong, Zhao, et al.
Publicado: (2026)
Self-Blinding and Counterfactual Self-Simulation Mitigate Biases and Sycophancy in Large Language Models
por: Christian, Brian, et al.
Publicado: (2026)
por: Christian, Brian, et al.
Publicado: (2026)
A Dynamic Knowledge Update-Driven Model with Large Language Models for Fake News Detection
por: Jin, Di, et al.
Publicado: (2025)
por: Jin, Di, et al.
Publicado: (2025)
The Facade of Truth: Uncovering and Mitigating LLM Susceptibility to Deceptive Evidence
por: Wan, Herun, et al.
Publicado: (2026)
por: Wan, Herun, et al.
Publicado: (2026)
TInR: Exploring Tool-Internalized Reasoning in Large Language Models
por: Xu, Qiancheng, et al.
Publicado: (2026)
por: Xu, Qiancheng, et al.
Publicado: (2026)
Can Large Language Models Understand DL-Lite Ontologies? An Empirical Study
por: Wang, Keyu, et al.
Publicado: (2024)
por: Wang, Keyu, et al.
Publicado: (2024)
Understanding the Repeat Curse in Large Language Models from a Feature Perspective
por: Yao, Junchi, et al.
Publicado: (2025)
por: Yao, Junchi, et al.
Publicado: (2025)
Faithful-Patchscopes: Understanding and Mitigating Model Bias in Hidden Representations Explanation of Large Language Models
por: Gong, Xilin, et al.
Publicado: (2026)
por: Gong, Xilin, et al.
Publicado: (2026)
Towards Understanding Sycophancy in Language Models
por: Sharma, Mrinank, et al.
Publicado: (2023)
por: Sharma, Mrinank, et al.
Publicado: (2023)
Representational and Behavioral Stability of Truth in Large Language Models
por: Dies, Samantha, et al.
Publicado: (2025)
por: Dies, Samantha, et al.
Publicado: (2025)
Uncovering Implicit Bias in Large Language Models with Concept Learning Dataset
por: Wang, Leroy Z.
Publicado: (2025)
por: Wang, Leroy Z.
Publicado: (2025)
Truth-Aware Context Selection: Mitigating Hallucinations of Large Language Models Being Misled by Untruthful Contexts
por: Yu, Tian, et al.
Publicado: (2024)
por: Yu, Tian, et al.
Publicado: (2024)
Uncovering Safety Risks of Large Language Models through Concept Activation Vector
por: Xu, Zhihao, et al.
Publicado: (2024)
por: Xu, Zhihao, et al.
Publicado: (2024)
Ejemplares similares
-
From Yes-Men to Truth-Tellers: Addressing Sycophancy in Large Language Models with Pinpoint Tuning
por: Chen, Wei, et al.
Publicado: (2024) -
MONICA: Real-Time Monitoring and Calibration of Chain-of-Thought Sycophancy in Large Reasoning Models
por: Hu, Jingyu, et al.
Publicado: (2025) -
Not Your Typical Sycophant: The Elusive Nature of Sycophancy in Large Language Models
por: Natan, Shahar Ben, et al.
Publicado: (2026) -
Measuring Sycophancy of Language Models in Multi-turn Dialogues
por: Hong, Jiseung, et al.
Publicado: (2025) -
Sycophancy in Large Language Models: Causes and Mitigations
por: Malmqvist, Lars
Publicado: (2024)