Pressure, What Pressure? Sycophancy Disentanglement in Language Models via Reward Decomposition
Fuente:
arXiv
Saved in:
| Main Authors: | Mohsin, Muhammad Ahmed, Bilal, Ahsan, Umer, Muhammad, Fox, Emily |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
$S^3$: Stratified Scaling Search for Test-Time in Diffusion Language Models
by: Bilal, Ahsan, et al.
Published: (2026)
by: Bilal, Ahsan, et al.
Published: (2026)
Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey
by: Bilal, Ahsan, et al.
Published: (2025)
by: Bilal, Ahsan, et al.
Published: (2025)
Continuous-Utility Direct Preference Optimization
by: Mohsin, Muhammad Ahmed, et al.
Published: (2026)
by: Mohsin, Muhammad Ahmed, et al.
Published: (2026)
Epistemic Uncertainty for Test-Time Discovery
by: Riaz, Kainat, et al.
Published: (2026)
by: Riaz, Kainat, et al.
Published: (2026)
Meta-Reinforcement Learning for Fast and Data-Efficient Spectrum Allocation in Dynamic Wireless Networks
by: Giwa, Oluwaseyi, et al.
Published: (2025)
by: Giwa, Oluwaseyi, et al.
Published: (2025)
Resource Allocation for RIS-Assisted CoMP-NOMA Networks using Reinforcement Learning
by: Umer, Muhammad, et al.
Published: (2025)
by: Umer, Muhammad, et al.
Published: (2025)
Task and Perception-aware Distributed Source Coding for Correlated Speech under Bandwidth-constrained Channels
by: Bhattacharya, Sagnik, et al.
Published: (2025)
by: Bhattacharya, Sagnik, et al.
Published: (2025)
Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models
by: Denison, Carson, et al.
Published: (2024)
by: Denison, Carson, et al.
Published: (2024)
Canonical Optimization for MIMO MAC Design
by: Umer, Muhammad, et al.
Published: (2026)
by: Umer, Muhammad, et al.
Published: (2026)
Neural Gaussian Radio Fields for Channel Estimation
by: Umer, Muhammad, et al.
Published: (2025)
by: Umer, Muhammad, et al.
Published: (2025)
PENDULUM: A Benchmark for Assessing Sycophancy in Multimodal Large Language Models
by: Rahman, A. B. M. Ashikur, et al.
Published: (2025)
by: Rahman, A. B. M. Ashikur, et al.
Published: (2025)
Moral Sycophancy in Vision Language Models
by: Rabby, Shadman, et al.
Published: (2026)
by: Rabby, Shadman, et al.
Published: (2026)
What If We Allocate Test-Time Compute Adaptively?
by: Bilal, Ahsan, et al.
Published: (2026)
by: Bilal, Ahsan, et al.
Published: (2026)
Under Pressure: Emotional Framing Induces Measurable Behavioral Shifts and Structured Internal Geometry in Small Language Models
by: Usman, Rana Muhammad
Published: (2026)
by: Usman, Rana Muhammad
Published: (2026)
Continual Learning for Wireless Channel Prediction
by: Mohsin, Muhammad Ahmed, et al.
Published: (2025)
by: Mohsin, Muhammad Ahmed, et al.
Published: (2025)
General Preference Reinforcement Learning
by: Umer, Muhammad, et al.
Published: (2026)
by: Umer, Muhammad, et al.
Published: (2026)
Not Your Typical Sycophant: The Elusive Nature of Sycophancy in Large Language Models
by: Natan, Shahar Ben, et al.
Published: (2026)
by: Natan, Shahar Ben, et al.
Published: (2026)
Utilizing AI and Machine Learning for Predictive Analysis of Post-Treatment Cancer Recurrence
by: Qayyum, Muhammad Umer, et al.
Published: (2025)
by: Qayyum, Muhammad Umer, et al.
Published: (2025)
Sycophancy in Large Language Models: Causes and Mitigations
by: Malmqvist, Lars
Published: (2024)
by: Malmqvist, Lars
Published: (2024)
When Helpfulness Becomes Sycophancy: Sycophancy is a Boundary Failure Between Social Alignment and Epistemic Integrity in Large Language Models
by: Li, Jiechen, et al.
Published: (2026)
by: Li, Jiechen, et al.
Published: (2026)
An Overlooked Role of Context-Sensitive Dendrites
by: Raza, Mohsin, et al.
Published: (2024)
by: Raza, Mohsin, et al.
Published: (2024)
Reward Bias Substitution: Single-Axis Bias Mitigations Redirect Optimization Pressure
by: Lamparth, Max, et al.
Published: (2026)
by: Lamparth, Max, et al.
Published: (2026)
Sacred or Secular? Religious Bias in AI-Generated Financial Advice
by: Khan, Muhammad Salar, et al.
Published: (2025)
by: Khan, Muhammad Salar, et al.
Published: (2025)
Hierarchical Deep Reinforcement Learning for Adaptive Resource Management in Integrated Terrestrial and Non-Terrestrial Networks
by: Mohsin, Muhammad Ahmed, et al.
Published: (2025)
by: Mohsin, Muhammad Ahmed, et al.
Published: (2025)
Accounting for Sycophancy in Language Model Uncertainty Estimation
by: Sicilia, Anthony, et al.
Published: (2024)
by: Sicilia, Anthony, et al.
Published: (2024)
Towards Understanding Sycophancy in Language Models
by: Sharma, Mrinank, et al.
Published: (2023)
by: Sharma, Mrinank, et al.
Published: (2023)
Context-sensitive neocortical neurons transform the effectiveness and efficiency of neural information processing
by: Ahmed, Khubaib, et al.
Published: (2022)
by: Ahmed, Khubaib, et al.
Published: (2022)
Scalable Machines with Intrinsic Higher Mental-State Dynamics
by: Adeel, Ahsan, et al.
Published: (2026)
by: Adeel, Ahsan, et al.
Published: (2026)
OnRL-RAG: Real-Time Personalized Mental Health Dialogue System
by: Bilal, Ahsan, et al.
Published: (2025)
by: Bilal, Ahsan, et al.
Published: (2025)
On the Fundamental Limits of LLMs at Scale
by: Mohsin, Muhammad Ahmed, et al.
Published: (2025)
by: Mohsin, Muhammad Ahmed, et al.
Published: (2025)
Benchmarking and Mitigating Sycophancy in Medical Vision Language Models
by: Xu, Juangui, et al.
Published: (2025)
by: Xu, Juangui, et al.
Published: (2025)
Natural Language Processing for Analyzing Electronic Health Records and Clinical Notes in Cancer Research: A Review
by: Bilal, Muhammad, et al.
Published: (2024)
by: Bilal, Muhammad, et al.
Published: (2024)
What Counts as AI Sycophancy? A Taxonomy and Expert Survey of a Fragmented Construct
by: Ye, Meryl, et al.
Published: (2026)
by: Ye, Meryl, et al.
Published: (2026)
How RLHF Amplifies Sycophancy
by: Shapira, Itai, et al.
Published: (2026)
by: Shapira, Itai, et al.
Published: (2026)
6G Twin: Hybrid Gaussian Radio Fields for Channel Estimation and Non-Linear Precoder Design for Radio Access Networks
by: Mohsin, Muhammad Ahmed, et al.
Published: (2025)
by: Mohsin, Muhammad Ahmed, et al.
Published: (2025)
An Ensemble Learning Approach towards Waste Segmentation in Cluttered Environment
by: Jafar, Maimoona, et al.
Published: (2026)
by: Jafar, Maimoona, et al.
Published: (2026)
Mitigating Hallucinations Using Ensemble of Knowledge Graph and Vector Store in Large Language Models to Enhance Mental Health Support
by: Muqtadir, Abdul, et al.
Published: (2024)
by: Muqtadir, Abdul, et al.
Published: (2024)
Conditional Prior-based Non-stationary Channel Estimation Using Accelerated Diffusion Models
by: Mohsin, Muhammad Ahmed, et al.
Published: (2025)
by: Mohsin, Muhammad Ahmed, et al.
Published: (2025)
Qalb: Largest State-of-the-Art Urdu Large Language Model for 230M Speakers with Systematic Continued Pre-training
by: Hassan, Muhammad Taimoor, et al.
Published: (2026)
by: Hassan, Muhammad Taimoor, et al.
Published: (2026)
Beacon: Single-Turn Diagnosis and Mitigation of Latent Sycophancy in Large Language Models
by: Pandey, Sanskar, et al.
Published: (2025)
by: Pandey, Sanskar, et al.
Published: (2025)
Similar Items
-
$S^3$: Stratified Scaling Search for Test-Time in Diffusion Language Models
by: Bilal, Ahsan, et al.
Published: (2026) -
Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey
by: Bilal, Ahsan, et al.
Published: (2025) -
Continuous-Utility Direct Preference Optimization
by: Mohsin, Muhammad Ahmed, et al.
Published: (2026) -
Epistemic Uncertainty for Test-Time Discovery
by: Riaz, Kainat, et al.
Published: (2026) -
Meta-Reinforcement Learning for Fast and Data-Efficient Spectrum Allocation in Dynamic Wireless Networks
by: Giwa, Oluwaseyi, et al.
Published: (2025)