Sycophancy in Vision-Language Models: A Systematic Analysis and an Inference-Time Mitigation Framework
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Yunpu, Zhang, Rui, Xiao, Junbin, Ke, Changxin, Hou, Ruibo, Hao, Yifan, Li, Ling |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Object-Level Verbalized Confidence Calibration in Vision-Language Models via Semantic Perturbation
di: Zhao, Yunpu, et al.
Pubblicazione: (2025)
di: Zhao, Yunpu, et al.
Pubblicazione: (2025)
Sycophancy in Large Language Models: Causes and Mitigations
di: Malmqvist, Lars
Pubblicazione: (2024)
di: Malmqvist, Lars
Pubblicazione: (2024)
Beacon: Single-Turn Diagnosis and Mitigation of Latent Sycophancy in Large Language Models
di: Pandey, Sanskar, et al.
Pubblicazione: (2025)
di: Pandey, Sanskar, et al.
Pubblicazione: (2025)
Not Your Typical Sycophant: The Elusive Nature of Sycophancy in Large Language Models
di: Natan, Shahar Ben, et al.
Pubblicazione: (2026)
di: Natan, Shahar Ben, et al.
Pubblicazione: (2026)
Assessing and Understanding Creativity in Large Language Models
di: Zhao, Yunpu, et al.
Pubblicazione: (2024)
di: Zhao, Yunpu, et al.
Pubblicazione: (2024)
Self-Blinding and Counterfactual Self-Simulation Mitigate Biases and Sycophancy in Large Language Models
di: Christian, Brian, et al.
Pubblicazione: (2026)
di: Christian, Brian, et al.
Pubblicazione: (2026)
Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models
di: Denison, Carson, et al.
Pubblicazione: (2024)
di: Denison, Carson, et al.
Pubblicazione: (2024)
Benchmarking and Mitigating Sycophancy in Medical Vision Language Models
di: Xu, Juangui, et al.
Pubblicazione: (2025)
di: Xu, Juangui, et al.
Pubblicazione: (2025)
Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
Accounting for Sycophancy in Language Model Uncertainty Estimation
di: Sicilia, Anthony, et al.
Pubblicazione: (2024)
di: Sicilia, Anthony, et al.
Pubblicazione: (2024)
MONICA: Real-Time Monitoring and Calibration of Chain-of-Thought Sycophancy in Large Reasoning Models
di: Hu, Jingyu, et al.
Pubblicazione: (2025)
di: Hu, Jingyu, et al.
Pubblicazione: (2025)
Towards Understanding Sycophancy in Language Models
di: Sharma, Mrinank, et al.
Pubblicazione: (2023)
di: Sharma, Mrinank, et al.
Pubblicazione: (2023)
Moral Sycophancy in Vision Language Models
di: Rabby, Shadman, et al.
Pubblicazione: (2026)
di: Rabby, Shadman, et al.
Pubblicazione: (2026)
Too Nice to Tell the Truth: Quantifying Agreeableness-Driven Sycophancy in Role-Playing Language Models
di: Shah, Arya, et al.
Pubblicazione: (2026)
di: Shah, Arya, et al.
Pubblicazione: (2026)
BASIL: Bayesian Assessment of Sycophancy in LLMs
di: Atwell, Katherine, et al.
Pubblicazione: (2025)
di: Atwell, Katherine, et al.
Pubblicazione: (2025)
Sycophancy Hides Linearly in the Attention Heads
di: Genadi, Rifo, et al.
Pubblicazione: (2026)
di: Genadi, Rifo, et al.
Pubblicazione: (2026)
Internal Reasoning vs. External Control: A Thermodynamic Analysis of Sycophancy in Large Language Models
di: Chang, Edward Y.
Pubblicazione: (2025)
di: Chang, Edward Y.
Pubblicazione: (2025)
Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy
di: Jiang, Eric Hanchen, et al.
Pubblicazione: (2025)
di: Jiang, Eric Hanchen, et al.
Pubblicazione: (2025)
Unraveling and Mitigating Safety Alignment Degradation of Vision-Language Models
di: Liu, Qin, et al.
Pubblicazione: (2024)
di: Liu, Qin, et al.
Pubblicazione: (2024)
Fake News Detection and Manipulation Reasoning via Large Vision-Language Models
di: Jin, Ruihan, et al.
Pubblicazione: (2024)
di: Jin, Ruihan, et al.
Pubblicazione: (2024)
Improving LLM Reasoning through Interpretable Role-Playing Steering
di: Wang, Anyi, et al.
Pubblicazione: (2025)
di: Wang, Anyi, et al.
Pubblicazione: (2025)
Defining and Evaluating Decision and Composite Risk in Language Models Applied to Natural Language Inference
di: Shen, Ke, et al.
Pubblicazione: (2024)
di: Shen, Ke, et al.
Pubblicazione: (2024)
A Systematic Analysis of Biases in Large Language Models
di: Zhang, Xulang, et al.
Pubblicazione: (2025)
di: Zhang, Xulang, et al.
Pubblicazione: (2025)
TimeSense:Making Large Language Models Proficient in Time-Series Analysis
di: Zhang, Zhirui, et al.
Pubblicazione: (2025)
di: Zhang, Zhirui, et al.
Pubblicazione: (2025)
A Systematic Study of Compositional Syntactic Transformer Language Models
di: Zhao, Yida, et al.
Pubblicazione: (2025)
di: Zhao, Yida, et al.
Pubblicazione: (2025)
Augmented Vision-Language Models: A Systematic Review
di: Davis, Anthony C, et al.
Pubblicazione: (2025)
di: Davis, Anthony C, et al.
Pubblicazione: (2025)
Unraveling and Mitigating Retriever Inconsistencies in Retrieval-Augmented Large Language Models
di: Li, Mingda, et al.
Pubblicazione: (2024)
di: Li, Mingda, et al.
Pubblicazione: (2024)
Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models
di: Van, Minh-Hao, et al.
Pubblicazione: (2025)
di: Van, Minh-Hao, et al.
Pubblicazione: (2025)
TDBench: A Benchmark for Top-Down Image Understanding with Reliability Analysis of Vision-Language Models
di: Hou, Kaiyuan, et al.
Pubblicazione: (2025)
di: Hou, Kaiyuan, et al.
Pubblicazione: (2025)
Reasoning Isn't Enough: Examining Truth-Bias and Sycophancy in LLMs
di: Barkett, Emilio, et al.
Pubblicazione: (2025)
di: Barkett, Emilio, et al.
Pubblicazione: (2025)
Can Vision-Language Models Solve Visual Math Equations?
di: Choudhury, Monjoy Narayan, et al.
Pubblicazione: (2025)
di: Choudhury, Monjoy Narayan, et al.
Pubblicazione: (2025)
A Markov Categorical Framework for Language Modeling
di: Zhang, Yifan
Pubblicazione: (2025)
di: Zhang, Yifan
Pubblicazione: (2025)
TrueBrief: Faithful Summarization through Small Language Models
di: Lakara, Kumud, et al.
Pubblicazione: (2025)
di: Lakara, Kumud, et al.
Pubblicazione: (2025)
dInfer: An Efficient Inference Framework for Diffusion Language Models
di: Ma, Yuxin, et al.
Pubblicazione: (2025)
di: Ma, Yuxin, et al.
Pubblicazione: (2025)
High-Quality Data Augmentation for Low-Resource NMT: Combining a Translation Memory, a GAN Generator, and Filtering
di: Liu, Hengjie, et al.
Pubblicazione: (2024)
di: Liu, Hengjie, et al.
Pubblicazione: (2024)
CRANE: Causal Relevance Analysis of Language-Specific Neurons in Multilingual Large Language Models
di: Le, Yifan, et al.
Pubblicazione: (2026)
di: Le, Yifan, et al.
Pubblicazione: (2026)
Unplug and Play Language Models: Decomposing Experts in Language Models at Inference Time
di: Yang, Nakyeong, et al.
Pubblicazione: (2024)
di: Yang, Nakyeong, et al.
Pubblicazione: (2024)
Comparing Uncertainty Measurement and Mitigation Methods for Large Language Models: A Systematic Review
di: Abbasli, Toghrul, et al.
Pubblicazione: (2025)
di: Abbasli, Toghrul, et al.
Pubblicazione: (2025)
From Sycophancy to Sensemaking: Premise Governance for Human-AI Decision Making
di: Jain, Raunak
Pubblicazione: (2026)
di: Jain, Raunak
Pubblicazione: (2026)
GenTKG: Generative Forecasting on Temporal Knowledge Graph with Large Language Models
di: Liao, Ruotong, et al.
Pubblicazione: (2023)
di: Liao, Ruotong, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Object-Level Verbalized Confidence Calibration in Vision-Language Models via Semantic Perturbation
di: Zhao, Yunpu, et al.
Pubblicazione: (2025) -
Sycophancy in Large Language Models: Causes and Mitigations
di: Malmqvist, Lars
Pubblicazione: (2024) -
Beacon: Single-Turn Diagnosis and Mitigation of Latent Sycophancy in Large Language Models
di: Pandey, Sanskar, et al.
Pubblicazione: (2025) -
Not Your Typical Sycophant: The Elusive Nature of Sycophancy in Large Language Models
di: Natan, Shahar Ben, et al.
Pubblicazione: (2026) -
Assessing and Understanding Creativity in Large Language Models
di: Zhao, Yunpu, et al.
Pubblicazione: (2024)