The Hypocrisy Gap: Quantifying Divergence Between Internal Belief and Chain-of-Thought Explanation via Sparse Autoencoders
Fuente:
arXiv
Salvato in:
| Autori principali: | Shiromani, Shikhar, Chaudhury, Archie, Kunda, Sri Pranav |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Alignment is Localized: A Causal Probe into Preference Layers
di: Chaudhury, Archie
Pubblicazione: (2025)
di: Chaudhury, Archie
Pubblicazione: (2025)
How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding
di: Chen, Xi, et al.
Pubblicazione: (2025)
di: Chen, Xi, et al.
Pubblicazione: (2025)
Beyond Next Word Prediction: Developing Comprehensive Evaluation Frameworks for measuring LLM performance on real world applications
di: Agrawal, Vishakha, et al.
Pubblicazione: (2025)
di: Agrawal, Vishakha, et al.
Pubblicazione: (2025)
Chain of Thought Explanation for Dialogue State Tracking
di: Xu, Lin, et al.
Pubblicazione: (2024)
di: Xu, Lin, et al.
Pubblicazione: (2024)
COMPASS: Context-Modulated PID Attention Steering System for Hallucination Mitigation
di: Sahay, Kenji, et al.
Pubblicazione: (2025)
di: Sahay, Kenji, et al.
Pubblicazione: (2025)
Unlocking the Capabilities of Thought: A Reasoning Boundary Framework to Quantify and Optimize Chain-of-Thought
di: Chen, Qiguang, et al.
Pubblicazione: (2024)
di: Chen, Qiguang, et al.
Pubblicazione: (2024)
Interpreting and Steering LLMs with Mutual Information-based Explanations on Sparse Autoencoders
di: Wu, Xuansheng, et al.
Pubblicazione: (2025)
di: Wu, Xuansheng, et al.
Pubblicazione: (2025)
Mind the Gap: Bridging Thought Leap for Improved Chain-of-Thought Tuning
di: Xu, Haolei, et al.
Pubblicazione: (2025)
di: Xu, Haolei, et al.
Pubblicazione: (2025)
ProMoral-Bench: Evaluating Prompting Strategies for Moral Reasoning and Safety in LLMs
di: Thomas, Rohan Subramanian, et al.
Pubblicazione: (2026)
di: Thomas, Rohan Subramanian, et al.
Pubblicazione: (2026)
Critical or Compliant? The Double-Edged Sword of Reasoning in Chain-of-Thought Explanations
di: Park, Eunkyu, et al.
Pubblicazione: (2025)
di: Park, Eunkyu, et al.
Pubblicazione: (2025)
Reasoning Theater: Disentangling Model Beliefs from Chain-of-Thought
di: Boppana, Siddharth, et al.
Pubblicazione: (2026)
di: Boppana, Siddharth, et al.
Pubblicazione: (2026)
Sparse-Autoencoder-Guided Internal Representation Unlearning for Large Language Models
di: Yamashita, Tomoya, et al.
Pubblicazione: (2025)
di: Yamashita, Tomoya, et al.
Pubblicazione: (2025)
Internalizing ASR with Implicit Chain of Thought for Efficient Speech-to-Speech Conversational LLM
di: Yuen, Robin Shing-Hei, et al.
Pubblicazione: (2024)
di: Yuen, Robin Shing-Hei, et al.
Pubblicazione: (2024)
Quantifying Feature Space Universality Across Large Language Models via Sparse Autoencoders
di: Lan, Michael, et al.
Pubblicazione: (2024)
di: Lan, Michael, et al.
Pubblicazione: (2024)
Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings
di: Rose, Daniel, et al.
Pubblicazione: (2023)
di: Rose, Daniel, et al.
Pubblicazione: (2023)
A Formal Comparison Between Chain of Thought and Latent Thought
di: Xu, Kevin, et al.
Pubblicazione: (2025)
di: Xu, Kevin, et al.
Pubblicazione: (2025)
Mind the Gap: The Divergence Between Human and LLM-Generated Tasks
di: Lu, Yi-Long, et al.
Pubblicazione: (2025)
di: Lu, Yi-Long, et al.
Pubblicazione: (2025)
Mitigating Spurious Correlations Between Question and Answer via Chain-of-Thought Correctness Perception Distillation
di: Xie, Hongyan, et al.
Pubblicazione: (2025)
di: Xie, Hongyan, et al.
Pubblicazione: (2025)
Internal Chain-of-Thought: Empirical Evidence for Layer-wise Subtask Scheduling in LLMs
di: Yang, Zhipeng, et al.
Pubblicazione: (2025)
di: Yang, Zhipeng, et al.
Pubblicazione: (2025)
How a Bilingual LM Becomes Bilingual: Tracing Internal Representations with Sparse Autoencoders
di: Inaba, Tatsuro, et al.
Pubblicazione: (2025)
di: Inaba, Tatsuro, et al.
Pubblicazione: (2025)
Efficient Reasoning via Chain of Unconscious Thought
di: Gong, Ruihan, et al.
Pubblicazione: (2025)
di: Gong, Ruihan, et al.
Pubblicazione: (2025)
A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models
di: Shu, Dong, et al.
Pubblicazione: (2025)
di: Shu, Dong, et al.
Pubblicazione: (2025)
GRACE: Generative Recommendation via Journey-Aware Sparse Attention on Chain-of-Thought Tokenization
di: Ma, Luyi, et al.
Pubblicazione: (2025)
di: Ma, Luyi, et al.
Pubblicazione: (2025)
From Sparse Dependence to Sparse Attention: Unveiling How Chain-of-Thought Enhances Transformer Sample Efficiency
di: Wen, Kaiyue, et al.
Pubblicazione: (2024)
di: Wen, Kaiyue, et al.
Pubblicazione: (2024)
Detecting Hallucinations in Large Language Models via Internal Attention Divergence Signals
di: van Dijk, Gijs
Pubblicazione: (2026)
di: van Dijk, Gijs
Pubblicazione: (2026)
Faithful Logical Reasoning via Symbolic Chain-of-Thought
di: Xu, Jundong, et al.
Pubblicazione: (2024)
di: Xu, Jundong, et al.
Pubblicazione: (2024)
Rethinking Dense Sequential Chains: Reasoning Language Models Can Extract Answers from Sparse, Order-Shuffling Chain-of-Thoughts
di: Chen, Yi-Chang, et al.
Pubblicazione: (2026)
di: Chen, Yi-Chang, et al.
Pubblicazione: (2026)
SteerRM: Debiasing Reward Models via Sparse Autoencoders
di: Sun, Mengyuan, et al.
Pubblicazione: (2026)
di: Sun, Mengyuan, et al.
Pubblicazione: (2026)
Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders
di: Jing, Yi, et al.
Pubblicazione: (2026)
di: Jing, Yi, et al.
Pubblicazione: (2026)
Clause-Internal or Clause-External? Testing Turkish Reflexive Binding in Adapted versus Chain of Thought Large Language Models
di: Karakaş, Sercan
Pubblicazione: (2026)
di: Karakaş, Sercan
Pubblicazione: (2026)
State-of-the-Art Arabic Language Modeling with Sparse MoE Fine-Tuning and Chain-of-Thought Distillation
di: Singh, Navan Preet, et al.
Pubblicazione: (2026)
di: Singh, Navan Preet, et al.
Pubblicazione: (2026)
Belief Attribution as Mental Explanation: The Role of Accuracy, Informativity, and Causality
di: Ying, Lance, et al.
Pubblicazione: (2025)
di: Ying, Lance, et al.
Pubblicazione: (2025)
Probing the Lack of Stable Internal Beliefs in LLMs
di: Luo, Yifan, et al.
Pubblicazione: (2026)
di: Luo, Yifan, et al.
Pubblicazione: (2026)
Reliable Chain-of-Thought via Prefix Consistency
di: Iwase, Naoto, et al.
Pubblicazione: (2026)
di: Iwase, Naoto, et al.
Pubblicazione: (2026)
Self-Harmonized Chain of Thought
di: Jin, Ziqi, et al.
Pubblicazione: (2024)
di: Jin, Ziqi, et al.
Pubblicazione: (2024)
Sparse Autoencoder Insights on Voice Embeddings
di: Pluth, Daniel, et al.
Pubblicazione: (2025)
di: Pluth, Daniel, et al.
Pubblicazione: (2025)
Enhancing Uncertainty Estimation in LLMs with Expectation of Aggregated Internal Belief
di: Xiao, Zeguan, et al.
Pubblicazione: (2025)
di: Xiao, Zeguan, et al.
Pubblicazione: (2025)
Improving Chain-of-Thought Reasoning via Quasi-Symbolic Abstractions
di: Ranaldi, Leonardo, et al.
Pubblicazione: (2025)
di: Ranaldi, Leonardo, et al.
Pubblicazione: (2025)
Revisiting the Capacity Gap in Chain-of-Thought Distillation from a Practical Perspective
di: Kajitsuka, Tokio, et al.
Pubblicazione: (2026)
di: Kajitsuka, Tokio, et al.
Pubblicazione: (2026)
Upfront Chain-of-Thought: A Cooperative Framework for Chain-of-Thought Compression
di: Li, Chengzhengxu, et al.
Pubblicazione: (2025)
di: Li, Chengzhengxu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Alignment is Localized: A Causal Probe into Preference Layers
di: Chaudhury, Archie
Pubblicazione: (2025) -
How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding
di: Chen, Xi, et al.
Pubblicazione: (2025) -
Beyond Next Word Prediction: Developing Comprehensive Evaluation Frameworks for measuring LLM performance on real world applications
di: Agrawal, Vishakha, et al.
Pubblicazione: (2025) -
Chain of Thought Explanation for Dialogue State Tracking
di: Xu, Lin, et al.
Pubblicazione: (2024) -
COMPASS: Context-Modulated PID Attention Steering System for Hallucination Mitigation
di: Sahay, Kenji, et al.
Pubblicazione: (2025)