When Chain of Thought is Necessary, Language Models Struggle to Evade Monitors
Fuente:
arXiv
Salvato in:
| Autori principali: | Emmons, Scott, Jenner, Erik, Elson, David K., Saurous, Rif A., Rajamanoharan, Senthooran, Chen, Heng, Shafkat, Irhum, Shah, Rohin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Pragmatic Way to Measure Chain-of-Thought Monitorability
di: Emmons, Scott, et al.
Pubblicazione: (2025)
di: Emmons, Scott, et al.
Pubblicazione: (2025)
Chain-of-Thought Reasoning In The Wild Is Not Always Faithful
di: Arcuschin, Iván, et al.
Pubblicazione: (2025)
di: Arcuschin, Iván, et al.
Pubblicazione: (2025)
Thought Branches: Interpreting LLM Reasoning Requires Resampling
di: Macar, Uzay, et al.
Pubblicazione: (2025)
di: Macar, Uzay, et al.
Pubblicazione: (2025)
Do I Know This Entity? Knowledge Awareness and Hallucinations in Language Models
di: Ferrando, Javier, et al.
Pubblicazione: (2024)
di: Ferrando, Javier, et al.
Pubblicazione: (2024)
RL-Obfuscation: Can Language Models Learn to Evade Latent-Space Monitors?
di: Gupta, Rohan, et al.
Pubblicazione: (2025)
di: Gupta, Rohan, et al.
Pubblicazione: (2025)
Emergent Misalignment is Easy, Narrow Misalignment is Hard
di: Soligo, Anna, et al.
Pubblicazione: (2026)
di: Soligo, Anna, et al.
Pubblicazione: (2026)
Can Confidence Estimates Decide When Chain-of-Thought Is Necessary for LLMs?
di: Lewis-Lim, Samuel, et al.
Pubblicazione: (2025)
di: Lewis-Lim, Samuel, et al.
Pubblicazione: (2025)
Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2
di: Lieberum, Tom, et al.
Pubblicazione: (2024)
di: Lieberum, Tom, et al.
Pubblicazione: (2024)
Aligned, Orthogonal or In-conflict: When can we safely optimize Chain-of-Thought?
di: Kaufmann, Max, et al.
Pubblicazione: (2026)
di: Kaufmann, Max, et al.
Pubblicazione: (2026)
Simple Mechanistic Explanations for Out-Of-Context Reasoning
di: Wang, Atticus, et al.
Pubblicazione: (2025)
di: Wang, Atticus, et al.
Pubblicazione: (2025)
All Random Features Representations are Equivalent
di: Sernau, Luke, et al.
Pubblicazione: (2024)
di: Sernau, Luke, et al.
Pubblicazione: (2024)
Steering Out-of-Distribution Generalization with Concept Ablation Fine-Tuning
di: Casademunt, Helena, et al.
Pubblicazione: (2025)
di: Casademunt, Helena, et al.
Pubblicazione: (2025)
Quantifying the Necessity of Chain of Thought through Opaque Serial Depth
di: Brown-Cohen, Jonah, et al.
Pubblicazione: (2026)
di: Brown-Cohen, Jonah, et al.
Pubblicazione: (2026)
Can Reasoning Models Obfuscate Reasoning? Stress-Testing Chain-of-Thought Monitorability
di: Zolkowski, Artur, et al.
Pubblicazione: (2025)
di: Zolkowski, Artur, et al.
Pubblicazione: (2025)
How Well Do Models Follow Their Constitutions?
di: Jakkli, Arya, et al.
Pubblicazione: (2026)
di: Jakkli, Arya, et al.
Pubblicazione: (2026)
Improving Dictionary Learning with Gated Sparse Autoencoders
di: Rajamanoharan, Senthooran, et al.
Pubblicazione: (2024)
di: Rajamanoharan, Senthooran, et al.
Pubblicazione: (2024)
Dense SAE Latents Are Features, Not Bugs
di: Sun, Xiaoqing, et al.
Pubblicazione: (2025)
di: Sun, Xiaoqing, et al.
Pubblicazione: (2025)
Uncovering Latent Chain of Thought Vectors in Language Models
di: Zhang, Jason, et al.
Pubblicazione: (2024)
di: Zhang, Jason, et al.
Pubblicazione: (2024)
When Your AIs Deceive You: Challenges of Partial Observability in Reinforcement Learning from Human Feedback
di: Lang, Leon, et al.
Pubblicazione: (2024)
di: Lang, Leon, et al.
Pubblicazione: (2024)
The Fragility of Chain-of-Thought Monitoring Across Typologically Diverse Languages
di: Onyame, Eric, et al.
Pubblicazione: (2026)
di: Onyame, Eric, et al.
Pubblicazione: (2026)
When Chain-of-Thought Backfires: Evaluating Prompt Sensitivity in Medical Language Models
di: Sadanandan, Binesh, et al.
Pubblicazione: (2026)
di: Sadanandan, Binesh, et al.
Pubblicazione: (2026)
ALMANACS: A Simulatability Benchmark for Language Model Explainability
di: Mills, Edmund, et al.
Pubblicazione: (2023)
di: Mills, Edmund, et al.
Pubblicazione: (2023)
All Code, No Thought: Current Language Models Struggle to Reason in Ciphered Language
di: Guo, Shiyuan, et al.
Pubblicazione: (2025)
di: Guo, Shiyuan, et al.
Pubblicazione: (2025)
Neural Chameleons: Language Models Can Learn to Hide Their Thoughts from Unseen Activation Monitors
di: McGuinness, Max, et al.
Pubblicazione: (2025)
di: McGuinness, Max, et al.
Pubblicazione: (2025)
Towards eliciting latent knowledge from LLMs with mechanistic interpretability
di: Cywiński, Bartosz, et al.
Pubblicazione: (2025)
di: Cywiński, Bartosz, et al.
Pubblicazione: (2025)
Convergent Linear Representations of Emergent Misalignment
di: Soligo, Anna, et al.
Pubblicazione: (2025)
di: Soligo, Anna, et al.
Pubblicazione: (2025)
Stop When Enough: Adaptive Early-Stopping for Chain-of-Thought Reasoning
di: Sun, Renliang, et al.
Pubblicazione: (2025)
di: Sun, Renliang, et al.
Pubblicazione: (2025)
Fine-Tuned Thoughts: Leveraging Chain-of-Thought Reasoning for Industrial Asset Health Monitoring
di: Lin, Shuxin, et al.
Pubblicazione: (2025)
di: Lin, Shuxin, et al.
Pubblicazione: (2025)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
di: Chen, Yangyi, et al.
Pubblicazione: (2023)
di: Chen, Yangyi, et al.
Pubblicazione: (2023)
When LLMs Struggle: Reference-less Translation Evaluation for Low-resource Languages
di: Sindhujan, Archchana, et al.
Pubblicazione: (2025)
di: Sindhujan, Archchana, et al.
Pubblicazione: (2025)
Measuring Chain-of-Thought Monitorability Through Faithfulness and Verbosity
di: Meek, Austin, et al.
Pubblicazione: (2025)
di: Meek, Austin, et al.
Pubblicazione: (2025)
Steering When Necessary: Flexible Steering Large Language Models with Backtracking
di: Cheng, Zifeng, et al.
Pubblicazione: (2025)
di: Cheng, Zifeng, et al.
Pubblicazione: (2025)
Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety
di: Korbak, Tomek, et al.
Pubblicazione: (2025)
di: Korbak, Tomek, et al.
Pubblicazione: (2025)
Beyond Chain-of-Thought, Effective Graph-of-Thought Reasoning in Language Models
di: Yao, Yao, et al.
Pubblicazione: (2023)
di: Yao, Yao, et al.
Pubblicazione: (2023)
Scheherazade: Evaluating Chain-of-Thought Math Reasoning in LLMs with Chain-of-Problems
di: Miner, Stephen, et al.
Pubblicazione: (2024)
di: Miner, Stephen, et al.
Pubblicazione: (2024)
When More is Less: Understanding Chain-of-Thought Length in LLMs
di: Wu, Yuyang, et al.
Pubblicazione: (2025)
di: Wu, Yuyang, et al.
Pubblicazione: (2025)
When Chain-of-Thought Fails, the Solution Hides in the Hidden States
di: Mehrafarin, Houman, et al.
Pubblicazione: (2026)
di: Mehrafarin, Houman, et al.
Pubblicazione: (2026)
Is Reference Necessary in the Evaluation of NLG Systems? When and Where?
di: Sheng, Shuqian, et al.
Pubblicazione: (2024)
di: Sheng, Shuqian, et al.
Pubblicazione: (2024)
AtP*: An efficient and scalable method for localizing LLM behaviour to components
di: Kramár, János, et al.
Pubblicazione: (2024)
di: Kramár, János, et al.
Pubblicazione: (2024)
On the Representational Capacity of Neural Language Models with Chain-of-Thought Reasoning
di: Nowak, Franz, et al.
Pubblicazione: (2024)
di: Nowak, Franz, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Pragmatic Way to Measure Chain-of-Thought Monitorability
di: Emmons, Scott, et al.
Pubblicazione: (2025) -
Chain-of-Thought Reasoning In The Wild Is Not Always Faithful
di: Arcuschin, Iván, et al.
Pubblicazione: (2025) -
Thought Branches: Interpreting LLM Reasoning Requires Resampling
di: Macar, Uzay, et al.
Pubblicazione: (2025) -
Do I Know This Entity? Knowledge Awareness and Hallucinations in Language Models
di: Ferrando, Javier, et al.
Pubblicazione: (2024) -
RL-Obfuscation: Can Language Models Learn to Evade Latent-Space Monitors?
di: Gupta, Rohan, et al.
Pubblicazione: (2025)