Measuring Sycophancy of Language Models in Multi-turn Dialogues
Fuente:
arXiv
Saved in:
| Main Authors: | Hong, Jiseung, Byun, Grace, Kim, Seungone, Shu, Kai, Choi, Jinho D. |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
D-GEN: Automatic Distractor Generation and Evaluation for Reliable Assessment of Generative Model
by: Byun, Grace, et al.
Published: (2025)
by: Byun, Grace, et al.
Published: (2025)
LLM-as-a-Grader: Practical Insights from Large Language Model for Short-Answer and Report Evaluation
by: Byun, Grace, et al.
Published: (2025)
by: Byun, Grace, et al.
Published: (2025)
Secure Multifaceted-RAG for Enterprise: Hybrid Knowledge Retrieval with Security Filtering
by: Byun, Grace, et al.
Published: (2025)
by: Byun, Grace, et al.
Published: (2025)
CRADLE Bench: A Clinician-Annotated Benchmark for Multi-Faceted Mental Health Crisis and Safety Risk Detection
by: Byun, Grace, et al.
Published: (2025)
by: Byun, Grace, et al.
Published: (2025)
Leveraging Explicit Reasoning for Inference Integration in Commonsense-Augmented Dialogue Models
by: Finch, Sarah E., et al.
Published: (2024)
by: Finch, Sarah E., et al.
Published: (2024)
Can Language Models Evaluate Human Written Text? Case Study on Korean Student Writing for Education
by: Kim, Seungyoon, et al.
Published: (2024)
by: Kim, Seungyoon, et al.
Published: (2024)
Diverse and Effective Synthetic Data Generation for Adaptable Zero-Shot Dialogue State Tracking
by: Finch, James D., et al.
Published: (2024)
by: Finch, James D., et al.
Published: (2024)
DYCP: Dynamic Context Pruning for Long-Form Dialogue with LLMs
by: Choi, Nayoung, et al.
Published: (2026)
by: Choi, Nayoung, et al.
Published: (2026)
Transforming Slot Schema Induction with Generative Dialogue State Inference
by: Finch, James D., et al.
Published: (2024)
by: Finch, James D., et al.
Published: (2024)
Generative Induction of Dialogue Task Schemas with Streaming Refinement and Simulated Interactions
by: Finch, James D., et al.
Published: (2025)
by: Finch, James D., et al.
Published: (2025)
ToolDial: Multi-turn Dialogue Generation Method for Tool-Augmented Language Models
by: Shim, Jeonghoon, et al.
Published: (2025)
by: Shim, Jeonghoon, et al.
Published: (2025)
PersonaKit (PK): A Plug-and-Play Platform for User Testing Diverse Roles in Full-Duplex Dialogue
by: Jeon, Hyunbae, et al.
Published: (2026)
by: Jeon, Hyunbae, et al.
Published: (2026)
TRUTH DECAY: Quantifying Multi-Turn Sycophancy in Language Models
by: Liu, Joshua, et al.
Published: (2025)
by: Liu, Joshua, et al.
Published: (2025)
What is Your Favorite Gender, MLM? Gender Bias Evaluation in Multilingual Masked Language Models
by: Yu, Jeongrok, et al.
Published: (2024)
by: Yu, Jeongrok, et al.
Published: (2024)
Not Your Typical Sycophant: The Elusive Nature of Sycophancy in Large Language Models
by: Natan, Shahar Ben, et al.
Published: (2026)
by: Natan, Shahar Ben, et al.
Published: (2026)
Multi-Task Inference: Can Large Language Models Follow Multiple Instructions at Once?
by: Son, Guijin, et al.
Published: (2024)
by: Son, Guijin, et al.
Published: (2024)
KMMLU: Measuring Massive Multitask Language Understanding in Korean
by: Son, Guijin, et al.
Published: (2024)
by: Son, Guijin, et al.
Published: (2024)
Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue
by: Zhou, Zhenhong, et al.
Published: (2024)
by: Zhou, Zhenhong, et al.
Published: (2024)
When Truth Is Overridden: Uncovering the Internal Origins of Sycophancy in Large Language Models
by: Wang, Keyu, et al.
Published: (2025)
by: Wang, Keyu, et al.
Published: (2025)
Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL
by: Abdulhai, Marwa, et al.
Published: (2025)
by: Abdulhai, Marwa, et al.
Published: (2025)
TRUST: An LLM-Based Dialogue System for Trauma Understanding and Structured Assessments
by: Tu, Sichang, et al.
Published: (2025)
by: Tu, Sichang, et al.
Published: (2025)
SpeakerSleuth: Can Large Audio-Language Models Judge Speaker Consistency across Multi-turn Dialogues?
by: Lee, Jonggeun, et al.
Published: (2026)
by: Lee, Jonggeun, et al.
Published: (2026)
Improving Factuality in LLMs via Inference-Time Knowledge Graph Construction
by: Wu, Shanglin, et al.
Published: (2025)
by: Wu, Shanglin, et al.
Published: (2025)
Self-Explore: Enhancing Mathematical Reasoning in Language Models with Fine-grained Rewards
by: Hwang, Hyeonbin, et al.
Published: (2024)
by: Hwang, Hyeonbin, et al.
Published: (2024)
Data Selection for Multi-turn Dialogue Instruction Tuning
by: Li, Bo, et al.
Published: (2026)
by: Li, Bo, et al.
Published: (2026)
Beyond Single-User Dialogue: Assessing Multi-User Dialogue State Tracking Capabilities of Large Language Models
by: Song, Sangmin, et al.
Published: (2025)
by: Song, Sangmin, et al.
Published: (2025)
Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models
by: Wu, Peilin, et al.
Published: (2025)
by: Wu, Peilin, et al.
Published: (2025)
Prometheus-Vision: Vision-Language Model as a Judge for Fine-Grained Evaluation
by: Lee, Seongyun, et al.
Published: (2024)
by: Lee, Seongyun, et al.
Published: (2024)
Sycophancy in Large Language Models: Causes and Mitigations
by: Malmqvist, Lars
Published: (2024)
by: Malmqvist, Lars
Published: (2024)
Improving Multi-turn Dialogue Consistency with Self-Recall Thinking
by: Pang, Renning, et al.
Published: (2026)
by: Pang, Renning, et al.
Published: (2026)
NormGenesis: Multicultural Dialogue Generation via Exemplar-Guided Social Norm Modeling and Violation Recovery
by: Hong, Minki, et al.
Published: (2025)
by: Hong, Minki, et al.
Published: (2025)
Accounting for Sycophancy in Language Model Uncertainty Estimation
by: Sicilia, Anthony, et al.
Published: (2024)
by: Sicilia, Anthony, et al.
Published: (2024)
ReSURE: Regularizing Supervision Unreliability for Multi-turn Dialogue Fine-tuning
by: Du, Yiming, et al.
Published: (2025)
by: Du, Yiming, et al.
Published: (2025)
FairMT-Bench: Benchmarking Fairness for Multi-turn Dialogue in Conversational LLMs
by: Fan, Zhiting, et al.
Published: (2024)
by: Fan, Zhiting, et al.
Published: (2024)
Sycophancy Claims about Language Models: The Missing Human-in-the-Loop
by: Batzner, Jan, et al.
Published: (2025)
by: Batzner, Jan, et al.
Published: (2025)
SEADialogues: A Multilingual Culturally Grounded Multi-turn Dialogue Dataset on Southeast Asian Languages
by: Kautsar, Muhammad Dehan Al, et al.
Published: (2025)
by: Kautsar, Muhammad Dehan Al, et al.
Published: (2025)
Sycophancy under Pressure: Evaluating and Mitigating Sycophantic Bias via Adversarial Dialogues in Scientific QA
by: Zhang, Kaiwei, et al.
Published: (2025)
by: Zhang, Kaiwei, et al.
Published: (2025)
Measuring Opinion Bias and Sycophancy via LLM-based Persuasion
by: Nogueira, Rodrigo, et al.
Published: (2026)
by: Nogueira, Rodrigo, et al.
Published: (2026)
MORTAR: Multi-turn Metamorphic Testing for LLM-based Dialogue Systems
by: Guo, Guoxiang, et al.
Published: (2024)
by: Guo, Guoxiang, et al.
Published: (2024)
Crisp: Cognitive Restructuring of Negative Thoughts through Multi-turn Supportive Dialogues
by: Zhou, Jinfeng, et al.
Published: (2025)
by: Zhou, Jinfeng, et al.
Published: (2025)
Similar Items
-
D-GEN: Automatic Distractor Generation and Evaluation for Reliable Assessment of Generative Model
by: Byun, Grace, et al.
Published: (2025) -
LLM-as-a-Grader: Practical Insights from Large Language Model for Short-Answer and Report Evaluation
by: Byun, Grace, et al.
Published: (2025) -
Secure Multifaceted-RAG for Enterprise: Hybrid Knowledge Retrieval with Security Filtering
by: Byun, Grace, et al.
Published: (2025) -
CRADLE Bench: A Clinician-Annotated Benchmark for Multi-Faceted Mental Health Crisis and Safety Risk Detection
by: Byun, Grace, et al.
Published: (2025) -
Leveraging Explicit Reasoning for Inference Integration in Commonsense-Augmented Dialogue Models
by: Finch, Sarah E., et al.
Published: (2024)