How Well Do Models Follow Their Constitutions?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jakkli, Arya, Rajamanoharan, Senthooran, Nanda, Neel |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Do I Know This Entity? Knowledge Awareness and Hallucinations in Language Models
par: Ferrando, Javier, et autres
Publié: (2024)
par: Ferrando, Javier, et autres
Publié: (2024)
Emergent Misalignment is Easy, Narrow Misalignment is Hard
par: Soligo, Anna, et autres
Publié: (2026)
par: Soligo, Anna, et autres
Publié: (2026)
Convergent Linear Representations of Emergent Misalignment
par: Soligo, Anna, et autres
Publié: (2025)
par: Soligo, Anna, et autres
Publié: (2025)
Model Organisms for Emergent Misalignment
par: Turner, Edward, et autres
Publié: (2025)
par: Turner, Edward, et autres
Publié: (2025)
Subliminal Learning Is Steering Vector Distillation
par: Blank, Camila, et autres
Publié: (2026)
par: Blank, Camila, et autres
Publié: (2026)
Thought Branches: Interpreting LLM Reasoning Requires Resampling
par: Macar, Uzay, et autres
Publié: (2025)
par: Macar, Uzay, et autres
Publié: (2025)
Are Sparse Autoencoders Useful? A Case Study in Sparse Probing
par: Kantamneni, Subhash, et autres
Publié: (2025)
par: Kantamneni, Subhash, et autres
Publié: (2025)
Steering Out-of-Distribution Generalization with Concept Ablation Fine-Tuning
par: Casademunt, Helena, et autres
Publié: (2025)
par: Casademunt, Helena, et autres
Publié: (2025)
Chain-of-Thought Reasoning In The Wild Is Not Always Faithful
par: Arcuschin, Iván, et autres
Publié: (2025)
par: Arcuschin, Iván, et autres
Publié: (2025)
Censored LLMs as a Natural Testbed for Secret Knowledge Elicitation
par: Casademunt, Helena, et autres
Publié: (2026)
par: Casademunt, Helena, et autres
Publié: (2026)
Improving Dictionary Learning with Gated Sparse Autoencoders
par: Rajamanoharan, Senthooran, et autres
Publié: (2024)
par: Rajamanoharan, Senthooran, et autres
Publié: (2024)
Towards eliciting latent knowledge from LLMs with mechanistic interpretability
par: Cywiński, Bartosz, et autres
Publié: (2025)
par: Cywiński, Bartosz, et autres
Publié: (2025)
Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2
par: Lieberum, Tom, et autres
Publié: (2024)
par: Lieberum, Tom, et autres
Publié: (2024)
Simple Mechanistic Explanations for Out-Of-Context Reasoning
par: Wang, Atticus, et autres
Publié: (2025)
par: Wang, Atticus, et autres
Publié: (2025)
Explorations of Self-Repair in Language Models
par: Rushing, Cody, et autres
Publié: (2024)
par: Rushing, Cody, et autres
Publié: (2024)
Towards Best Practices of Activation Patching in Language Models: Metrics and Methods
par: Zhang, Fred, et autres
Publié: (2023)
par: Zhang, Fred, et autres
Publié: (2023)
Base Models Know How to Reason, Thinking Models Learn When
par: Venhoff, Constantin, et autres
Publié: (2025)
par: Venhoff, Constantin, et autres
Publié: (2025)
Dense SAE Latents Are Features, Not Bugs
par: Sun, Xiaoqing, et autres
Publié: (2025)
par: Sun, Xiaoqing, et autres
Publié: (2025)
When Chain of Thought is Necessary, Language Models Struggle to Evade Monitors
par: Emmons, Scott, et autres
Publié: (2025)
par: Emmons, Scott, et autres
Publié: (2025)
One Instruction Does Not Fit All: How Well Do Embeddings Align Personas and Instructions in Low-Resource Indian Languages?
par: Shah, Arya, et autres
Publié: (2026)
par: Shah, Arya, et autres
Publié: (2026)
Eliciting Secret Knowledge from Language Models
par: Cywiński, Bartosz, et autres
Publié: (2025)
par: Cywiński, Bartosz, et autres
Publié: (2025)
BatchTopK Sparse Autoencoders
par: Bussmann, Bart, et autres
Publié: (2024)
par: Bussmann, Bart, et autres
Publié: (2024)
Steering Evaluation-Aware Language Models to Act Like They Are Deployed
par: Hua, Tim Tian, et autres
Publié: (2025)
par: Hua, Tim Tian, et autres
Publié: (2025)
Jumping Ahead: Improving Reconstruction Fidelity with JumpReLU Sparse Autoencoders
par: Rajamanoharan, Senthooran, et autres
Publié: (2024)
par: Rajamanoharan, Senthooran, et autres
Publié: (2024)
How Well Do Multimodal Models Reason on ECG Signals?
par: Xu, Maxwell A., et autres
Publié: (2026)
par: Xu, Maxwell A., et autres
Publié: (2026)
How Well Do Large Language Models Truly Ground?
par: Lee, Hyunji, et autres
Publié: (2023)
par: Lee, Hyunji, et autres
Publié: (2023)
Understanding Reasoning in Thinking Language Models via Steering Vectors
par: Venhoff, Constantin, et autres
Publié: (2025)
par: Venhoff, Constantin, et autres
Publié: (2025)
Learning Multi-Level Features with Matryoshka Sparse Autoencoders
par: Bussmann, Bart, et autres
Publié: (2025)
par: Bussmann, Bart, et autres
Publié: (2025)
Sparse Autoencoders Do Not Find Canonical Units of Analysis
par: Leask, Patrick, et autres
Publié: (2025)
par: Leask, Patrick, et autres
Publié: (2025)
How Well Do LLMs Understand Tunisian Arabic?
par: Mahdi, Mohamed
Publié: (2025)
par: Mahdi, Mohamed
Publié: (2025)
Because we have LLMs, we Can and Should Pursue Agentic Interpretability
par: Kim, Been, et autres
Publié: (2025)
par: Kim, Been, et autres
Publié: (2025)
SPIN-Bench: How Well Do LLMs Plan Strategically and Reason Socially?
par: Yao, Jianzhu, et autres
Publié: (2025)
par: Yao, Jianzhu, et autres
Publié: (2025)
Lost in the Pipeline: How Well Do Large Language Models Handle Data Preparation?
par: Spreafico, Matteo, et autres
Publié: (2025)
par: Spreafico, Matteo, et autres
Publié: (2025)
How Well Do Deep Learning Models Capture Human Concepts? The Case of the Typicality Effect
par: Vemuri, Siddhartha K., et autres
Publié: (2024)
par: Vemuri, Siddhartha K., et autres
Publié: (2024)
Interpretable Embeddings with Sparse Autoencoders: A Data Analysis Toolkit
par: Jiang, Nick, et autres
Publié: (2025)
par: Jiang, Nick, et autres
Publié: (2025)
Thought Anchors: Which LLM Reasoning Steps Matter?
par: Bogdan, Paul C., et autres
Publié: (2025)
par: Bogdan, Paul C., et autres
Publié: (2025)
CountQA: How Well Do MLLMs Count in the Wild?
par: Tamarapalli, Jayant Sravan, et autres
Publié: (2025)
par: Tamarapalli, Jayant Sravan, et autres
Publié: (2025)
How Well Can AI Build SD Models?
par: Schoenberg, William, et autres
Publié: (2025)
par: Schoenberg, William, et autres
Publié: (2025)
Privacy Issues in Large Language Models: A Survey
par: Neel, Seth, et autres
Publié: (2023)
par: Neel, Seth, et autres
Publié: (2023)
What's the plan? Metrics for implicit planning in LLMs and their application to rhyme generation and question answering
par: Maar, Jim, et autres
Publié: (2026)
par: Maar, Jim, et autres
Publié: (2026)
Documents similaires
-
Do I Know This Entity? Knowledge Awareness and Hallucinations in Language Models
par: Ferrando, Javier, et autres
Publié: (2024) -
Emergent Misalignment is Easy, Narrow Misalignment is Hard
par: Soligo, Anna, et autres
Publié: (2026) -
Convergent Linear Representations of Emergent Misalignment
par: Soligo, Anna, et autres
Publié: (2025) -
Model Organisms for Emergent Misalignment
par: Turner, Edward, et autres
Publié: (2025) -
Subliminal Learning Is Steering Vector Distillation
par: Blank, Camila, et autres
Publié: (2026)