Mitigating Sycophancy in Decoder-Only Transformer Architectures: Synthetic Data Intervention
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Wang, Libo |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Sycophancy in Large Language Models: Causes and Mitigations
par: Malmqvist, Lars
Publié: (2024)
par: Malmqvist, Lars
Publié: (2024)
Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectories
par: Beigi, Mohammad, et autres
Publié: (2025)
par: Beigi, Mohammad, et autres
Publié: (2025)
Benchmarking and Mitigating Sycophancy in Medical Vision Language Models
par: Xu, Juangui, et autres
Publié: (2025)
par: Xu, Juangui, et autres
Publié: (2025)
Diagnosing and Mitigating Sycophancy and Skepticism in LLM Causal Judgment
par: Chang, Edward Y.
Publié: (2026)
par: Chang, Edward Y.
Publié: (2026)
EDIT: Enhancing Vision Transformers by Mitigating Attention Sink through an Encoder-Decoder Architecture
par: Feng, Wenfeng, et autres
Publié: (2025)
par: Feng, Wenfeng, et autres
Publié: (2025)
Towards Humanoid Robot Autonomy: A Dynamic Architecture Integrating Continuous thought Machines (CTM) and Model Context Protocol (MCP)
par: Wang, Libo
Publié: (2025)
par: Wang, Libo
Publié: (2025)
Beacon: Single-Turn Diagnosis and Mitigation of Latent Sycophancy in Large Language Models
par: Pandey, Sanskar, et autres
Publié: (2025)
par: Pandey, Sanskar, et autres
Publié: (2025)
How RLHF Amplifies Sycophancy
par: Shapira, Itai, et autres
Publié: (2026)
par: Shapira, Itai, et autres
Publié: (2026)
Sycophancy in Vision-Language Models: A Systematic Analysis and an Inference-Time Mitigation Framework
par: Zhao, Yunpu, et autres
Publié: (2024)
par: Zhao, Yunpu, et autres
Publié: (2024)
Transforming Decoder-Only Transformers for Accurate WiFi-Telemetry Based Indoor Localization
par: Bhatia, Nayan Sanjay, et autres
Publié: (2025)
par: Bhatia, Nayan Sanjay, et autres
Publié: (2025)
Moral Sycophancy in Vision Language Models
par: Rabby, Shadman, et autres
Publié: (2026)
par: Rabby, Shadman, et autres
Publié: (2026)
SycEval: Evaluating LLM Sycophancy
par: Fanous, Aaron, et autres
Publié: (2025)
par: Fanous, Aaron, et autres
Publié: (2025)
Sycophancy is an Educational Safety Risk: Why LLM Tutors Need Sycophancy Benchmarks
par: Kasneci, Enkelejda, et autres
Publié: (2026)
par: Kasneci, Enkelejda, et autres
Publié: (2026)
Not Your Typical Sycophant: The Elusive Nature of Sycophancy in Large Language Models
par: Natan, Shahar Ben, et autres
Publié: (2026)
par: Natan, Shahar Ben, et autres
Publié: (2026)
Mapping the Edge of Chaos: Fractal-Like Boundaries in The Trainability of Decoder-Only Transformer Models
par: Torkamandi, Bahman
Publié: (2025)
par: Torkamandi, Bahman
Publié: (2025)
Linear Probe Penalties Reduce LLM Sycophancy
par: Papadatos, Henry, et autres
Publié: (2024)
par: Papadatos, Henry, et autres
Publié: (2024)
When Helpfulness Becomes Sycophancy: Sycophancy is a Boundary Failure Between Social Alignment and Epistemic Integrity in Large Language Models
par: Li, Jiechen, et autres
Publié: (2026)
par: Li, Jiechen, et autres
Publié: (2026)
Self-Blinding and Counterfactual Self-Simulation Mitigate Biases and Sycophancy in Large Language Models
par: Christian, Brian, et autres
Publié: (2026)
par: Christian, Brian, et autres
Publié: (2026)
Indoor Localization using Compact, Telemetry-Agnostic, Transfer-Learning Enabled Decoder-Only Transformer
par: Bhatia, Nayan Sanjay, et autres
Publié: (2025)
par: Bhatia, Nayan Sanjay, et autres
Publié: (2025)
BASIL: Bayesian Assessment of Sycophancy in LLMs
par: Atwell, Katherine, et autres
Publié: (2025)
par: Atwell, Katherine, et autres
Publié: (2025)
Sycophancy Hides Linearly in the Attention Heads
par: Genadi, Rifo, et autres
Publié: (2026)
par: Genadi, Rifo, et autres
Publié: (2026)
The Hidden Cost of Contextual Sycophancy: an AI Literacy Intervention in Human-AI Collaboration
par: Koyuturk, Cansu, et autres
Publié: (2026)
par: Koyuturk, Cansu, et autres
Publié: (2026)
Task Decoding based on Eye Movements using Synthetic Data Augmentation
par: Sadhu, Shanmuka, et autres
Publié: (2025)
par: Sadhu, Shanmuka, et autres
Publié: (2025)
On the Effectiveness of Acoustic BPE in Decoder-Only TTS
par: Li, Bohan, et autres
Publié: (2024)
par: Li, Bohan, et autres
Publié: (2024)
SynEHRgy: Synthesizing Mixed-Type Structured Electronic Health Records using Decoder-Only Transformers
par: Karami, Hojjat, et autres
Publié: (2024)
par: Karami, Hojjat, et autres
Publié: (2024)
Political Bias Audits of LLMs Capture Sycophancy to the Inferred Auditor
par: Törnberg, Petter, et autres
Publié: (2026)
par: Törnberg, Petter, et autres
Publié: (2026)
Consistency Training Helps Stop Sycophancy and Jailbreaks
par: Irpan, Alex, et autres
Publié: (2025)
par: Irpan, Alex, et autres
Publié: (2025)
Trained Persistent Memory for Frozen Decoder-Only LLMs
par: Jeong, Hong
Publié: (2026)
par: Jeong, Hong
Publié: (2026)
Towards Better Code Understanding in Decoder-Only Models with Contrastive Learning
par: Lin, Jiayi, et autres
Publié: (2024)
par: Lin, Jiayi, et autres
Publié: (2024)
Synthetic4Health: Generating Annotated Synthetic Clinical Letters
par: Ren, Libo, et autres
Publié: (2024)
par: Ren, Libo, et autres
Publié: (2024)
PENDULUM: A Benchmark for Assessing Sycophancy in Multimodal Large Language Models
par: Rahman, A. B. M. Ashikur, et autres
Publié: (2025)
par: Rahman, A. B. M. Ashikur, et autres
Publié: (2025)
Equilibrium Dynamics and Mitigation of Gender Bias in Synthetically Generated Data
par: Kattamuri, Ashish, et autres
Publié: (2025)
par: Kattamuri, Ashish, et autres
Publié: (2025)
Multi-Scenario Reasoning: Unlocking Cognitive Autonomy in Humanoid Robots for Multimodal Understanding
par: Wang, Libo
Publié: (2024)
par: Wang, Libo
Publié: (2024)
Outcome-Based RL Provably Leads Transformers to Reason, but Only With the Right Data
par: Ran-Milo, Yuval, et autres
Publié: (2026)
par: Ran-Milo, Yuval, et autres
Publié: (2026)
Pressure, What Pressure? Sycophancy Disentanglement in Language Models via Reward Decomposition
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2026)
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2026)
Set Transformer Architectures and Synthetic Data Generation for Flow-Guided Nanoscale Localization
par: Hube, Mika Leo, et autres
Publié: (2025)
par: Hube, Mika Leo, et autres
Publié: (2025)
Dynamic Chain-of-Thought: Towards Adaptive Deep Reasoning
par: Wang, Libo
Publié: (2025)
par: Wang, Libo
Publié: (2025)
Scaling Laws of Decoder-Only Models on the Multilingual Machine Translation Task
par: Caillaut, Gaëtan, et autres
Publié: (2024)
par: Caillaut, Gaëtan, et autres
Publié: (2024)
Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models
par: Denison, Carson, et autres
Publié: (2024)
par: Denison, Carson, et autres
Publié: (2024)
The Price of Agreement: Measuring LLM Sycophancy in Agentic Financial Applications
par: Zhao, Zhenyu, et autres
Publié: (2026)
par: Zhao, Zhenyu, et autres
Publié: (2026)
Documents similaires
-
Sycophancy in Large Language Models: Causes and Mitigations
par: Malmqvist, Lars
Publié: (2024) -
Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectories
par: Beigi, Mohammad, et autres
Publié: (2025) -
Benchmarking and Mitigating Sycophancy in Medical Vision Language Models
par: Xu, Juangui, et autres
Publié: (2025) -
Diagnosing and Mitigating Sycophancy and Skepticism in LLM Causal Judgment
par: Chang, Edward Y.
Publié: (2026) -
EDIT: Enhancing Vision Transformers by Mitigating Attention Sink through an Encoder-Decoder Architecture
par: Feng, Wenfeng, et autres
Publié: (2025)