Sycophantic Anchors: Localizing and Quantifying User Agreement in Reasoning Models
Fuente:
arXiv
Salvato in:
| Autore principale: | Duszenko, Jacek |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Quantifying and Understanding Uncertainty in Large Reasoning Models
di: Li, Yangyi, et al.
Pubblicazione: (2026)
di: Li, Yangyi, et al.
Pubblicazione: (2026)
Model Agreement via Anchoring
di: Eaton, Eric, et al.
Pubblicazione: (2026)
di: Eaton, Eric, et al.
Pubblicazione: (2026)
Norm Anchors Make Model Edits Last
di: Liu, Mingda, et al.
Pubblicazione: (2026)
di: Liu, Mingda, et al.
Pubblicazione: (2026)
Simulating Students or Sycophantic Problem Solving? On Misconception Faithfulness of LLM Simulators
di: Do, Heejin, et al.
Pubblicazione: (2026)
di: Do, Heejin, et al.
Pubblicazione: (2026)
Thought Anchors: Which LLM Reasoning Steps Matter?
di: Bogdan, Paul C., et al.
Pubblicazione: (2025)
di: Bogdan, Paul C., et al.
Pubblicazione: (2025)
AdvAnchor: Enhancing Diffusion Model Unlearning with Adversarial Anchors
di: Zhao, Mengnan, et al.
Pubblicazione: (2024)
di: Zhao, Mengnan, et al.
Pubblicazione: (2024)
Incoherence in Goal-Conditioned Autoregressive Models
di: Karwowski, Jacek, et al.
Pubblicazione: (2025)
di: Karwowski, Jacek, et al.
Pubblicazione: (2025)
Thinking in Latents: Adaptive Anchor Refinement for Implicit Reasoning in LLMs
di: Sheshanarayana, Disha, et al.
Pubblicazione: (2026)
di: Sheshanarayana, Disha, et al.
Pubblicazione: (2026)
One Self-Configurable Model to Solve Many Abstract Visual Reasoning Problems
di: Małkiński, Mikołaj, et al.
Pubblicazione: (2023)
di: Małkiński, Mikołaj, et al.
Pubblicazione: (2023)
Significativity Indices for Agreement Values
di: Casagrande, Alberto, et al.
Pubblicazione: (2025)
di: Casagrande, Alberto, et al.
Pubblicazione: (2025)
How Much Thinking is Enough? Quantifying and Understanding Redundancy in LLM Reasoning
di: Zhai, Zhiyuan, et al.
Pubblicazione: (2026)
di: Zhai, Zhiyuan, et al.
Pubblicazione: (2026)
Bolek: A Multimodal Language Model for Molecular Reasoning
di: Grabowski, Frederic, et al.
Pubblicazione: (2026)
di: Grabowski, Frederic, et al.
Pubblicazione: (2026)
Overcoming Data and Model Heterogeneities in Decentralized Federated Learning via Synthetic Anchors
di: Huang, Chun-Yin, et al.
Pubblicazione: (2024)
di: Huang, Chun-Yin, et al.
Pubblicazione: (2024)
Mind The Gap: Quantifying Mechanistic Gaps in Algorithmic Reasoning via Neural Compilation
di: Saldyt, Lucas, et al.
Pubblicazione: (2025)
di: Saldyt, Lucas, et al.
Pubblicazione: (2025)
To See or To Read: User Behavior Reasoning in Multimodal LLMs
di: Dong, Tianning, et al.
Pubblicazione: (2025)
di: Dong, Tianning, et al.
Pubblicazione: (2025)
From Sycophantic Consensus to Pluralistic Repair: Why AI Alignment Must Surface Disagreement
di: Vishwarupe, Varad, et al.
Pubblicazione: (2026)
di: Vishwarupe, Varad, et al.
Pubblicazione: (2026)
Quantifying Epistemic Uncertainty in Diffusion Models
di: Gupta, Aditi, et al.
Pubblicazione: (2026)
di: Gupta, Aditi, et al.
Pubblicazione: (2026)
Towards Quantifying Commonsense Reasoning with Mechanistic Insights
di: Joshi, Abhinav, et al.
Pubblicazione: (2025)
di: Joshi, Abhinav, et al.
Pubblicazione: (2025)
A Unified View of Abstract Visual Reasoning Problems
di: Małkiński, Mikołaj, et al.
Pubblicazione: (2024)
di: Małkiński, Mikołaj, et al.
Pubblicazione: (2024)
Multi-Label Contrastive Learning for Abstract Visual Reasoning
di: Małkiński, Mikołaj, et al.
Pubblicazione: (2020)
di: Małkiński, Mikołaj, et al.
Pubblicazione: (2020)
Discriminative Anchor Learning for Efficient Multi-view Clustering
di: Qin, Yalan, et al.
Pubblicazione: (2024)
di: Qin, Yalan, et al.
Pubblicazione: (2024)
Towards Learnable Anchor for Deep Multi-View Clustering
di: Wang, Bocheng, et al.
Pubblicazione: (2025)
di: Wang, Bocheng, et al.
Pubblicazione: (2025)
Reasoning Limitations of Multimodal Large Language Models. A Case Study of Bongard Problems
di: Małkiński, Mikołaj, et al.
Pubblicazione: (2024)
di: Małkiński, Mikołaj, et al.
Pubblicazione: (2024)
Advancing Generalization Across a Variety of Abstract Visual Reasoning Tasks
di: Małkiński, Mikołaj, et al.
Pubblicazione: (2025)
di: Małkiński, Mikołaj, et al.
Pubblicazione: (2025)
Interaction Locality in Hierarchical Recursive Reasoning
di: Miyanishi, Yosuke, et al.
Pubblicazione: (2026)
di: Miyanishi, Yosuke, et al.
Pubblicazione: (2026)
Constraining Sequential Model Editing with Editing Anchor Compression
di: Xu, Hao-Xiang, et al.
Pubblicazione: (2025)
di: Xu, Hao-Xiang, et al.
Pubblicazione: (2025)
Laying Anchors: Semantically Priming Numerals in Language Modeling
di: Sharma, Mandar, et al.
Pubblicazione: (2024)
di: Sharma, Mandar, et al.
Pubblicazione: (2024)
A General Anchor-Based Framework for Scalable Fair Clustering
di: Wei, Shengfei, et al.
Pubblicazione: (2025)
di: Wei, Shengfei, et al.
Pubblicazione: (2025)
Where Paths Split: Localized, Calibrated Control of Moral Reasoning in Large Language Models
di: Yuan, Chenchen, et al.
Pubblicazione: (2026)
di: Yuan, Chenchen, et al.
Pubblicazione: (2026)
A-I-RAVEN and I-RAVEN-Mesh: Two New Benchmarks for Abstract Visual Reasoning
di: Małkiński, Mikołaj, et al.
Pubblicazione: (2024)
di: Małkiński, Mikołaj, et al.
Pubblicazione: (2024)
Quantifying Representation Reliability in Self-Supervised Learning Models
di: Park, Young-Jin, et al.
Pubblicazione: (2023)
di: Park, Young-Jin, et al.
Pubblicazione: (2023)
The Price of Agreement: Measuring LLM Sycophancy in Agentic Financial Applications
di: Zhao, Zhenyu, et al.
Pubblicazione: (2026)
di: Zhao, Zhenyu, et al.
Pubblicazione: (2026)
Test-Time Adaptation Induces Stronger Accuracy and Agreement-on-the-Line
di: Kim, Eungyeup, et al.
Pubblicazione: (2023)
di: Kim, Eungyeup, et al.
Pubblicazione: (2023)
MAnchors: Memorization-Based Acceleration of Anchors via Rule Reuse and Transformation
di: Yu, Haonan, et al.
Pubblicazione: (2025)
di: Yu, Haonan, et al.
Pubblicazione: (2025)
Reinforcement Learning with Rubric Anchors
di: Huang, Zenan, et al.
Pubblicazione: (2025)
di: Huang, Zenan, et al.
Pubblicazione: (2025)
The Signal is in the Steps: Local Scoring for Reasoning Data Selection
di: Just, Hoang Anh, et al.
Pubblicazione: (2025)
di: Just, Hoang Anh, et al.
Pubblicazione: (2025)
Anchor-based oversampling for imbalanced tabular data via contrastive and adversarial learning
di: Mohammadi, Hadi, et al.
Pubblicazione: (2025)
di: Mohammadi, Hadi, et al.
Pubblicazione: (2025)
Quantifying the Accuracy-Interpretability Trade-Off in Concept-Based Sidechannel Models
di: Debot, David, et al.
Pubblicazione: (2025)
di: Debot, David, et al.
Pubblicazione: (2025)
Quantifying Variance in Evaluation Benchmarks
di: Madaan, Lovish, et al.
Pubblicazione: (2024)
di: Madaan, Lovish, et al.
Pubblicazione: (2024)
Quantifying Generalisation in Imitation Learning
di: Gavenski, Nathan, et al.
Pubblicazione: (2025)
di: Gavenski, Nathan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Quantifying and Understanding Uncertainty in Large Reasoning Models
di: Li, Yangyi, et al.
Pubblicazione: (2026) -
Model Agreement via Anchoring
di: Eaton, Eric, et al.
Pubblicazione: (2026) -
Norm Anchors Make Model Edits Last
di: Liu, Mingda, et al.
Pubblicazione: (2026) -
Simulating Students or Sycophantic Problem Solving? On Misconception Faithfulness of LLM Simulators
di: Do, Heejin, et al.
Pubblicazione: (2026) -
Thought Anchors: Which LLM Reasoning Steps Matter?
di: Bogdan, Paul C., et al.
Pubblicazione: (2025)