Detecting Unfaithful Chain-of-Thought via Circuit-Guided Internal-External Discrepancy
Fuente:
arXiv
Guardado en:
| Autores principales: | Shen, Xu, Tan, Zhen, Wang, Song, Hong, Pingjun, Miao, Rui, Wang, Xin, Chen, Tianlong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FaithCoT-Bench: Benchmarking Instance-Level Faithfulness of Chain-of-Thought Reasoning
por: Shen, Xu, et al.
Publicado: (2025)
por: Shen, Xu, et al.
Publicado: (2025)
Chain-of-Thought Unfaithfulness as Disguised Accuracy
por: Bentham, Oliver, et al.
Publicado: (2024)
por: Bentham, Oliver, et al.
Publicado: (2024)
Analysing Chain of Thought Dynamics: Active Guidance or Unfaithful Post-hoc Rationalisation?
por: Lewis-Lim, Samuel, et al.
Publicado: (2025)
por: Lewis-Lim, Samuel, et al.
Publicado: (2025)
Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation
por: Khalifa, Muhammad, et al.
Publicado: (2026)
por: Khalifa, Muhammad, et al.
Publicado: (2026)
Multi-Agent Debate for LLM Judges with Adaptive Stability Detection
por: Hu, Tianyu, et al.
Publicado: (2025)
por: Hu, Tianyu, et al.
Publicado: (2025)
Beyond Redundancy: Diverse and Specialized Multi-Expert Sparse Autoencoder
por: Xu, Zhen, et al.
Publicado: (2025)
por: Xu, Zhen, et al.
Publicado: (2025)
AnyMAC: Cascading Flexible Multi-Agent Collaboration via Next-Agent Prediction
por: Wang, Song, et al.
Publicado: (2025)
por: Wang, Song, et al.
Publicado: (2025)
Symbolic Analysis of Grover Search Algorithm via Chain-of-Thought Reasoning and Quantum-Native Tokenization
por: Chen, Min, et al.
Publicado: (2025)
por: Chen, Min, et al.
Publicado: (2025)
Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution Reconstruction
por: Shen, Xu, et al.
Publicado: (2025)
por: Shen, Xu, et al.
Publicado: (2025)
The Gray Zone of Faithfulness: Taming Ambiguity in Unfaithfulness Detection
por: Ding, Qiang, et al.
Publicado: (2025)
por: Ding, Qiang, et al.
Publicado: (2025)
Reconsidering Overthinking: Penalizing Internal and External Redundancy in CoT Reasoning
por: Hong, Jialiang, et al.
Publicado: (2025)
por: Hong, Jialiang, et al.
Publicado: (2025)
Understanding Reasoning in Chain-of-Thought from the Hopfieldian View
por: Hu, Lijie, et al.
Publicado: (2024)
por: Hu, Lijie, et al.
Publicado: (2024)
RationAnomaly: Log Anomaly Detection with Rationality via Chain-of-Thought and Reinforcement Learning
por: Xu, Song, et al.
Publicado: (2025)
por: Xu, Song, et al.
Publicado: (2025)
EntroCoT: Enhancing Chain-of-Thought via Adaptive Entropy-Guided Segmentation
por: Li, Zihang, et al.
Publicado: (2026)
por: Li, Zihang, et al.
Publicado: (2026)
GRACE: Discriminator-Guided Chain-of-Thought Reasoning
por: Khalifa, Muhammad, et al.
Publicado: (2023)
por: Khalifa, Muhammad, et al.
Publicado: (2023)
Thought Manipulation: External Thought Can Be Efficient for Large Reasoning Models
por: Liu, Yule, et al.
Publicado: (2025)
por: Liu, Yule, et al.
Publicado: (2025)
Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models
por: Yang, Yankai, et al.
Publicado: (2026)
por: Yang, Yankai, et al.
Publicado: (2026)
Dissociation of Faithful and Unfaithful Reasoning in LLMs
por: Yee, Evelyn, et al.
Publicado: (2024)
por: Yee, Evelyn, et al.
Publicado: (2024)
ALERT: Zero-shot LLM Jailbreak Detection via Internal Discrepancy Amplification
por: Lin, Xiao, et al.
Publicado: (2026)
por: Lin, Xiao, et al.
Publicado: (2026)
Probing to Refine: Reinforcement Distillation of LLMs via Explanatory Inversion
por: Tan, Zhen, et al.
Publicado: (2026)
por: Tan, Zhen, et al.
Publicado: (2026)
DICE: Structured Reasoning in LLMs through SLM-Guided Chain-of-Thought Correction
por: Li, Yiqi, et al.
Publicado: (2025)
por: Li, Yiqi, et al.
Publicado: (2025)
Beyond Chain-of-Thought: A Survey of Chain-of-X Paradigms for LLMs
por: Xia, Yu, et al.
Publicado: (2024)
por: Xia, Yu, et al.
Publicado: (2024)
Understanding Chain-of-Thought in Large Language Models via Topological Data Analysis
por: Li, Chenghao, et al.
Publicado: (2025)
por: Li, Chenghao, et al.
Publicado: (2025)
OR-R1: Automating Modeling and Solving of Operations Research Optimization Problem via Test-Time Reinforcement Learning
por: Ding, Zezhen, et al.
Publicado: (2025)
por: Ding, Zezhen, et al.
Publicado: (2025)
Learning Modal-Mixed Chain-of-Thought Reasoning with Latent Embeddings
por: Shao, Yifei, et al.
Publicado: (2026)
por: Shao, Yifei, et al.
Publicado: (2026)
HGOE: Hybrid External and Internal Graph Outlier Exposure for Graph Out-of-Distribution Detection
por: He, Junwei, et al.
Publicado: (2024)
por: He, Junwei, et al.
Publicado: (2024)
Streaming Hallucination Detection in Long Chain-of-Thought Reasoning
por: Lu, Haolang, et al.
Publicado: (2026)
por: Lu, Haolang, et al.
Publicado: (2026)
LLM Reasoning Is Latent, Not the Chain of Thought
por: Wang, Wenshuo
Publicado: (2026)
por: Wang, Wenshuo
Publicado: (2026)
Mind the Gap: Bridging Thought Leap for Improved Chain-of-Thought Tuning
por: Xu, Haolei, et al.
Publicado: (2025)
por: Xu, Haolei, et al.
Publicado: (2025)
NUMCoT: Numerals and Units of Measurement in Chain-of-Thought Reasoning using Large Language Models
por: Xu, Ancheng, et al.
Publicado: (2024)
por: Xu, Ancheng, et al.
Publicado: (2024)
Deep Hidden Cognition Facilitates Reliable Chain-of-Thought Reasoning
por: Chen, Zijun, et al.
Publicado: (2025)
por: Chen, Zijun, et al.
Publicado: (2025)
GraphRCG: Self-Conditioned Graph Generation
por: Wang, Song, et al.
Publicado: (2024)
por: Wang, Song, et al.
Publicado: (2024)
Teaching AI Stepwise Diagnostic Reasoning with Report-Guided Chain-of-Thought Learning
por: Luo, Yihong, et al.
Publicado: (2025)
por: Luo, Yihong, et al.
Publicado: (2025)
Scalable Chain of Thoughts via Elastic Reasoning
por: Xu, Yuhui, et al.
Publicado: (2025)
por: Xu, Yuhui, et al.
Publicado: (2025)
Learning to Maximize Mutual Information for Chain-of-Thought Distillation
por: Chen, Xin, et al.
Publicado: (2024)
por: Chen, Xin, et al.
Publicado: (2024)
Guess What I am Thinking: A Benchmark for Inner Thought Reasoning of Role-Playing Language Agents
por: Xu, Rui, et al.
Publicado: (2025)
por: Xu, Rui, et al.
Publicado: (2025)
CoT-X: An Adaptive Framework for Cross-Model Chain-of-Thought Transfer and Optimization
por: Bi, Ziqian, et al.
Publicado: (2025)
por: Bi, Ziqian, et al.
Publicado: (2025)
Upfront Chain-of-Thought: A Cooperative Framework for Chain-of-Thought Compression
por: Li, Chengzhengxu, et al.
Publicado: (2025)
por: Li, Chengzhengxu, et al.
Publicado: (2025)
Value-Guided Search for Efficient Chain-of-Thought Reasoning
por: Wang, Kaiwen, et al.
Publicado: (2025)
por: Wang, Kaiwen, et al.
Publicado: (2025)
UniMo: Unified Motion Generation and Understanding with Chain of Thought
por: Wang, Guocun, et al.
Publicado: (2026)
por: Wang, Guocun, et al.
Publicado: (2026)
Ejemplares similares
-
FaithCoT-Bench: Benchmarking Instance-Level Faithfulness of Chain-of-Thought Reasoning
por: Shen, Xu, et al.
Publicado: (2025) -
Chain-of-Thought Unfaithfulness as Disguised Accuracy
por: Bentham, Oliver, et al.
Publicado: (2024) -
Analysing Chain of Thought Dynamics: Active Guidance or Unfaithful Post-hoc Rationalisation?
por: Lewis-Lim, Samuel, et al.
Publicado: (2025) -
Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation
por: Khalifa, Muhammad, et al.
Publicado: (2026) -
Multi-Agent Debate for LLM Judges with Adaptive Stability Detection
por: Hu, Tianyu, et al.
Publicado: (2025)