From Yes-Men to Truth-Tellers: Addressing Sycophancy in Large Language Models with Pinpoint Tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Wei, Huang, Zhen, Xie, Liang, Lin, Binbin, Li, Houqiang, Lu, Le, Tian, Xinmei, Cai, Deng, Zhang, Yonggang, Wang, Wenxiao, Shen, Xu, Ye, Jieping |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Leveraging Submodule Linearity Enhances Task Arithmetic Performance in LLMs
di: Dai, Rui, et al.
Pubblicazione: (2025)
di: Dai, Rui, et al.
Pubblicazione: (2025)
Interpreting and Improving Large Language Models in Arithmetic Calculation
di: Zhang, Wei, et al.
Pubblicazione: (2024)
di: Zhang, Wei, et al.
Pubblicazione: (2024)
Delving into the Reversal Curse: How Far Can Large Language Models Generalize?
di: Lin, Zhengkai, et al.
Pubblicazione: (2024)
di: Lin, Zhengkai, et al.
Pubblicazione: (2024)
Enhancing Multiple Dimensions of Trustworthiness in LLMs via Sparse Activation Control
di: Xiao, Yuxin, et al.
Pubblicazione: (2024)
di: Xiao, Yuxin, et al.
Pubblicazione: (2024)
Don't Take Things Out of Context: Attention Intervention for Enhancing Chain-of-Thought Reasoning in Large Language Models
di: Yan, Shaotian, et al.
Pubblicazione: (2025)
di: Yan, Shaotian, et al.
Pubblicazione: (2025)
Concise and Organized Perception Facilitates Reasoning in Large Language Models
di: Liu, Junjie, et al.
Pubblicazione: (2023)
di: Liu, Junjie, et al.
Pubblicazione: (2023)
GeoCAD: Local Geometry-Controllable CAD Generation with Large Language Models
di: Zhang, Zhanwei, et al.
Pubblicazione: (2025)
di: Zhang, Zhanwei, et al.
Pubblicazione: (2025)
AddressVLM: Cross-view Alignment Tuning for Image Address Localization using Large Vision-Language Models
di: Xu, Shixiong, et al.
Pubblicazione: (2025)
di: Xu, Shixiong, et al.
Pubblicazione: (2025)
SciPIP: An LLM-based Scientific Paper Idea Proposer
di: Wang, Wenxiao, et al.
Pubblicazione: (2024)
di: Wang, Wenxiao, et al.
Pubblicazione: (2024)
Enhancing Chain-of-Thought Reasoning with Critical Representation Fine-tuning
di: Huang, Chenxi, et al.
Pubblicazione: (2025)
di: Huang, Chenxi, et al.
Pubblicazione: (2025)
When Truth Is Overridden: Uncovering the Internal Origins of Sycophancy in Large Language Models
di: Wang, Keyu, et al.
Pubblicazione: (2025)
di: Wang, Keyu, et al.
Pubblicazione: (2025)
Controlling Thinking Speed in Reasoning Models
di: Lin, Zhengkai, et al.
Pubblicazione: (2025)
di: Lin, Zhengkai, et al.
Pubblicazione: (2025)
From Redundancy to Relevance: Information Flow in LVLMs Across Reasoning Tasks
di: Zhang, Xiaofeng, et al.
Pubblicazione: (2024)
di: Zhang, Xiaofeng, et al.
Pubblicazione: (2024)
Reasoning Isn't Enough: Examining Truth-Bias and Sycophancy in LLMs
di: Barkett, Emilio, et al.
Pubblicazione: (2025)
di: Barkett, Emilio, et al.
Pubblicazione: (2025)
Career Aspirations of MLS Students; Yes, the Women Are as Ambitious as the Men.
di: Harris, Roma M.
Pubblicazione: (1986)
di: Harris, Roma M.
Pubblicazione: (1986)
Digital Yes‐Men: How to Deal With Sycophantic Military AI ?
di: Jonathan Kwik
Pubblicazione: (2025)
di: Jonathan Kwik
Pubblicazione: (2025)
Enhancing Spatial Reasoning through Visual and Textual Thinking
di: Liang, Xun, et al.
Pubblicazione: (2025)
di: Liang, Xun, et al.
Pubblicazione: (2025)
Instance-adaptive Zero-shot Chain-of-Thought Prompting
di: Yuan, Xiaosong, et al.
Pubblicazione: (2024)
di: Yuan, Xiaosong, et al.
Pubblicazione: (2024)
Large Language Models Are Involuntary Truth-Tellers: Exploiting Fallacy Failure for Jailbreak Attacks
di: Zhou, Yue, et al.
Pubblicazione: (2024)
di: Zhou, Yue, et al.
Pubblicazione: (2024)
Not Your Typical Sycophant: The Elusive Nature of Sycophancy in Large Language Models
di: Natan, Shahar Ben, et al.
Pubblicazione: (2026)
di: Natan, Shahar Ben, et al.
Pubblicazione: (2026)
Should the Internet Be Censored? Yes! Yes! Yes! Yes!
di: Taylor, Bruce
Pubblicazione: (1998)
di: Taylor, Bruce
Pubblicazione: (1998)
Enhancing Target-unspecific Tasks through a Features Matrix
di: Cui, Fangming, et al.
Pubblicazione: (2025)
di: Cui, Fangming, et al.
Pubblicazione: (2025)
Towards Quantum Accelerated Large-scale Topology Optimization
di: Ye, Zisheng, et al.
Pubblicazione: (2025)
di: Ye, Zisheng, et al.
Pubblicazione: (2025)
OBMO: One Bounding Box Multiple Objects for Monocular 3D Object Detection
di: Huang, Chenxi, et al.
Pubblicazione: (2022)
di: Huang, Chenxi, et al.
Pubblicazione: (2022)
Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow
di: Zhang, Chengsheng, et al.
Pubblicazione: (2026)
di: Zhang, Chengsheng, et al.
Pubblicazione: (2026)
AddressCLIP: Empowering Vision-Language Models for City-wide Image Address Localization
di: Xu, Shixiong, et al.
Pubblicazione: (2024)
di: Xu, Shixiong, et al.
Pubblicazione: (2024)
Improving Complex Reasoning with Dynamic Prompt Corruption: A soft prompt Optimization Approach
di: Fan, Sinan, et al.
Pubblicazione: (2025)
di: Fan, Sinan, et al.
Pubblicazione: (2025)
TokenSqueeze: Performance-Preserving Compression for Reasoning LLMs
di: Zhang, Yuxiang, et al.
Pubblicazione: (2025)
di: Zhang, Yuxiang, et al.
Pubblicazione: (2025)
Too Nice to Tell the Truth: Quantifying Agreeableness-Driven Sycophancy in Role-Playing Language Models
di: Shah, Arya, et al.
Pubblicazione: (2026)
di: Shah, Arya, et al.
Pubblicazione: (2026)
PARROT: Persuasion and Agreement Robustness Rating of Output Truth -- A Sycophancy Robustness Benchmark for LLMs
di: Çelebi, Yusuf, et al.
Pubblicazione: (2025)
di: Çelebi, Yusuf, et al.
Pubblicazione: (2025)
Model Compression and Efficient Inference for Large Language Models: A Survey
di: Wang, Wenxiao, et al.
Pubblicazione: (2024)
di: Wang, Wenxiao, et al.
Pubblicazione: (2024)
EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
di: Yuan, Botai, et al.
Pubblicazione: (2025)
di: Yuan, Botai, et al.
Pubblicazione: (2025)
Robust Training of Federated Models with Extremely Label Deficiency
di: Zhang, Yonggang, et al.
Pubblicazione: (2024)
di: Zhang, Yonggang, et al.
Pubblicazione: (2024)
Detecting Generated Images by Fitting Natural Image Distributions
di: Zhang, Yonggang, et al.
Pubblicazione: (2025)
di: Zhang, Yonggang, et al.
Pubblicazione: (2025)
G2LTraj: A Global-to-Local Generation Approach for Trajectory Prediction
di: Zhang, Zhanwei, et al.
Pubblicazione: (2024)
di: Zhang, Zhanwei, et al.
Pubblicazione: (2024)
Sycophancy in Large Language Models: Causes and Mitigations
di: Malmqvist, Lars
Pubblicazione: (2024)
di: Malmqvist, Lars
Pubblicazione: (2024)
Do Women Legislators Legislate Differently Than Men on Gun‐Related Policy? A Suggestive Yes
di: Patrick Cunha Silva, et al.
Pubblicazione: (2026)
di: Patrick Cunha Silva, et al.
Pubblicazione: (2026)
MOSS: Self-Evolution through Source-Level Rewriting in Autonomous Agent Systems
di: Cai, Qianshu, et al.
Pubblicazione: (2026)
di: Cai, Qianshu, et al.
Pubblicazione: (2026)
Pinpointing Plastic Water Lines
di: Marc Bracken, et al.
Pubblicazione: (2026)
di: Marc Bracken, et al.
Pubblicazione: (2026)
Pinpointing when and how of teledermatology
di: Paola Pasquali, et al.
Pubblicazione: (2025)
di: Paola Pasquali, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Leveraging Submodule Linearity Enhances Task Arithmetic Performance in LLMs
di: Dai, Rui, et al.
Pubblicazione: (2025) -
Interpreting and Improving Large Language Models in Arithmetic Calculation
di: Zhang, Wei, et al.
Pubblicazione: (2024) -
Delving into the Reversal Curse: How Far Can Large Language Models Generalize?
di: Lin, Zhengkai, et al.
Pubblicazione: (2024) -
Enhancing Multiple Dimensions of Trustworthiness in LLMs via Sparse Activation Control
di: Xiao, Yuxin, et al.
Pubblicazione: (2024) -
Don't Take Things Out of Context: Attention Intervention for Enhancing Chain-of-Thought Reasoning in Large Language Models
di: Yan, Shaotian, et al.
Pubblicazione: (2025)