Sycophancy in Vision-Language Models: A Systematic Analysis and an Inference-Time Mitigation Framework
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Yunpu, Zhang, Rui, Xiao, Junbin, Ke, Changxin, Hou, Ruibo, Hao, Yifan, Li, Ling |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Object-Level Verbalized Confidence Calibration in Vision-Language Models via Semantic Perturbation
par: Zhao, Yunpu, et autres
Publié: (2025)
par: Zhao, Yunpu, et autres
Publié: (2025)
Sycophancy in Large Language Models: Causes and Mitigations
par: Malmqvist, Lars
Publié: (2024)
par: Malmqvist, Lars
Publié: (2024)
Beacon: Single-Turn Diagnosis and Mitigation of Latent Sycophancy in Large Language Models
par: Pandey, Sanskar, et autres
Publié: (2025)
par: Pandey, Sanskar, et autres
Publié: (2025)
Not Your Typical Sycophant: The Elusive Nature of Sycophancy in Large Language Models
par: Natan, Shahar Ben, et autres
Publié: (2026)
par: Natan, Shahar Ben, et autres
Publié: (2026)
Assessing and Understanding Creativity in Large Language Models
par: Zhao, Yunpu, et autres
Publié: (2024)
par: Zhao, Yunpu, et autres
Publié: (2024)
Self-Blinding and Counterfactual Self-Simulation Mitigate Biases and Sycophancy in Large Language Models
par: Christian, Brian, et autres
Publié: (2026)
par: Christian, Brian, et autres
Publié: (2026)
Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models
par: Denison, Carson, et autres
Publié: (2024)
par: Denison, Carson, et autres
Publié: (2024)
Benchmarking and Mitigating Sycophancy in Medical Vision Language Models
par: Xu, Juangui, et autres
Publié: (2025)
par: Xu, Juangui, et autres
Publié: (2025)
Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
par: Zhang, Yichi, et autres
Publié: (2025)
par: Zhang, Yichi, et autres
Publié: (2025)
Accounting for Sycophancy in Language Model Uncertainty Estimation
par: Sicilia, Anthony, et autres
Publié: (2024)
par: Sicilia, Anthony, et autres
Publié: (2024)
MONICA: Real-Time Monitoring and Calibration of Chain-of-Thought Sycophancy in Large Reasoning Models
par: Hu, Jingyu, et autres
Publié: (2025)
par: Hu, Jingyu, et autres
Publié: (2025)
Towards Understanding Sycophancy in Language Models
par: Sharma, Mrinank, et autres
Publié: (2023)
par: Sharma, Mrinank, et autres
Publié: (2023)
Moral Sycophancy in Vision Language Models
par: Rabby, Shadman, et autres
Publié: (2026)
par: Rabby, Shadman, et autres
Publié: (2026)
Too Nice to Tell the Truth: Quantifying Agreeableness-Driven Sycophancy in Role-Playing Language Models
par: Shah, Arya, et autres
Publié: (2026)
par: Shah, Arya, et autres
Publié: (2026)
BASIL: Bayesian Assessment of Sycophancy in LLMs
par: Atwell, Katherine, et autres
Publié: (2025)
par: Atwell, Katherine, et autres
Publié: (2025)
Sycophancy Hides Linearly in the Attention Heads
par: Genadi, Rifo, et autres
Publié: (2026)
par: Genadi, Rifo, et autres
Publié: (2026)
Internal Reasoning vs. External Control: A Thermodynamic Analysis of Sycophancy in Large Language Models
par: Chang, Edward Y.
Publié: (2025)
par: Chang, Edward Y.
Publié: (2025)
Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy
par: Jiang, Eric Hanchen, et autres
Publié: (2025)
par: Jiang, Eric Hanchen, et autres
Publié: (2025)
Unraveling and Mitigating Safety Alignment Degradation of Vision-Language Models
par: Liu, Qin, et autres
Publié: (2024)
par: Liu, Qin, et autres
Publié: (2024)
Fake News Detection and Manipulation Reasoning via Large Vision-Language Models
par: Jin, Ruihan, et autres
Publié: (2024)
par: Jin, Ruihan, et autres
Publié: (2024)
Improving LLM Reasoning through Interpretable Role-Playing Steering
par: Wang, Anyi, et autres
Publié: (2025)
par: Wang, Anyi, et autres
Publié: (2025)
Defining and Evaluating Decision and Composite Risk in Language Models Applied to Natural Language Inference
par: Shen, Ke, et autres
Publié: (2024)
par: Shen, Ke, et autres
Publié: (2024)
A Systematic Analysis of Biases in Large Language Models
par: Zhang, Xulang, et autres
Publié: (2025)
par: Zhang, Xulang, et autres
Publié: (2025)
TimeSense:Making Large Language Models Proficient in Time-Series Analysis
par: Zhang, Zhirui, et autres
Publié: (2025)
par: Zhang, Zhirui, et autres
Publié: (2025)
A Systematic Study of Compositional Syntactic Transformer Language Models
par: Zhao, Yida, et autres
Publié: (2025)
par: Zhao, Yida, et autres
Publié: (2025)
Augmented Vision-Language Models: A Systematic Review
par: Davis, Anthony C, et autres
Publié: (2025)
par: Davis, Anthony C, et autres
Publié: (2025)
Unraveling and Mitigating Retriever Inconsistencies in Retrieval-Augmented Large Language Models
par: Li, Mingda, et autres
Publié: (2024)
par: Li, Mingda, et autres
Publié: (2024)
Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models
par: Van, Minh-Hao, et autres
Publié: (2025)
par: Van, Minh-Hao, et autres
Publié: (2025)
TDBench: A Benchmark for Top-Down Image Understanding with Reliability Analysis of Vision-Language Models
par: Hou, Kaiyuan, et autres
Publié: (2025)
par: Hou, Kaiyuan, et autres
Publié: (2025)
Reasoning Isn't Enough: Examining Truth-Bias and Sycophancy in LLMs
par: Barkett, Emilio, et autres
Publié: (2025)
par: Barkett, Emilio, et autres
Publié: (2025)
Can Vision-Language Models Solve Visual Math Equations?
par: Choudhury, Monjoy Narayan, et autres
Publié: (2025)
par: Choudhury, Monjoy Narayan, et autres
Publié: (2025)
A Markov Categorical Framework for Language Modeling
par: Zhang, Yifan
Publié: (2025)
par: Zhang, Yifan
Publié: (2025)
TrueBrief: Faithful Summarization through Small Language Models
par: Lakara, Kumud, et autres
Publié: (2025)
par: Lakara, Kumud, et autres
Publié: (2025)
dInfer: An Efficient Inference Framework for Diffusion Language Models
par: Ma, Yuxin, et autres
Publié: (2025)
par: Ma, Yuxin, et autres
Publié: (2025)
High-Quality Data Augmentation for Low-Resource NMT: Combining a Translation Memory, a GAN Generator, and Filtering
par: Liu, Hengjie, et autres
Publié: (2024)
par: Liu, Hengjie, et autres
Publié: (2024)
CRANE: Causal Relevance Analysis of Language-Specific Neurons in Multilingual Large Language Models
par: Le, Yifan, et autres
Publié: (2026)
par: Le, Yifan, et autres
Publié: (2026)
Unplug and Play Language Models: Decomposing Experts in Language Models at Inference Time
par: Yang, Nakyeong, et autres
Publié: (2024)
par: Yang, Nakyeong, et autres
Publié: (2024)
Comparing Uncertainty Measurement and Mitigation Methods for Large Language Models: A Systematic Review
par: Abbasli, Toghrul, et autres
Publié: (2025)
par: Abbasli, Toghrul, et autres
Publié: (2025)
From Sycophancy to Sensemaking: Premise Governance for Human-AI Decision Making
par: Jain, Raunak
Publié: (2026)
par: Jain, Raunak
Publié: (2026)
GenTKG: Generative Forecasting on Temporal Knowledge Graph with Large Language Models
par: Liao, Ruotong, et autres
Publié: (2023)
par: Liao, Ruotong, et autres
Publié: (2023)
Documents similaires
-
Object-Level Verbalized Confidence Calibration in Vision-Language Models via Semantic Perturbation
par: Zhao, Yunpu, et autres
Publié: (2025) -
Sycophancy in Large Language Models: Causes and Mitigations
par: Malmqvist, Lars
Publié: (2024) -
Beacon: Single-Turn Diagnosis and Mitigation of Latent Sycophancy in Large Language Models
par: Pandey, Sanskar, et autres
Publié: (2025) -
Not Your Typical Sycophant: The Elusive Nature of Sycophancy in Large Language Models
par: Natan, Shahar Ben, et autres
Publié: (2026) -
Assessing and Understanding Creativity in Large Language Models
par: Zhao, Yunpu, et autres
Publié: (2024)