Towards eliciting latent knowledge from LLMs with mechanistic interpretability
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cywiński, Bartosz, Ryd, Emil, Rajamanoharan, Senthooran, Nanda, Neel |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Eliciting Secret Knowledge from Language Models
par: Cywiński, Bartosz, et autres
Publié: (2025)
par: Cywiński, Bartosz, et autres
Publié: (2025)
Convergent Linear Representations of Emergent Misalignment
par: Soligo, Anna, et autres
Publié: (2025)
par: Soligo, Anna, et autres
Publié: (2025)
Do I Know This Entity? Knowledge Awareness and Hallucinations in Language Models
par: Ferrando, Javier, et autres
Publié: (2024)
par: Ferrando, Javier, et autres
Publié: (2024)
Thought Branches: Interpreting LLM Reasoning Requires Resampling
par: Macar, Uzay, et autres
Publié: (2025)
par: Macar, Uzay, et autres
Publié: (2025)
Model Organisms for Emergent Misalignment
par: Turner, Edward, et autres
Publié: (2025)
par: Turner, Edward, et autres
Publié: (2025)
Are Sparse Autoencoders Useful? A Case Study in Sparse Probing
par: Kantamneni, Subhash, et autres
Publié: (2025)
par: Kantamneni, Subhash, et autres
Publié: (2025)
Simple Mechanistic Explanations for Out-Of-Context Reasoning
par: Wang, Atticus, et autres
Publié: (2025)
par: Wang, Atticus, et autres
Publié: (2025)
Steering Out-of-Distribution Generalization with Concept Ablation Fine-Tuning
par: Casademunt, Helena, et autres
Publié: (2025)
par: Casademunt, Helena, et autres
Publié: (2025)
Chain-of-Thought Reasoning In The Wild Is Not Always Faithful
par: Arcuschin, Iván, et autres
Publié: (2025)
par: Arcuschin, Iván, et autres
Publié: (2025)
Jumping Ahead: Improving Reconstruction Fidelity with JumpReLU Sparse Autoencoders
par: Rajamanoharan, Senthooran, et autres
Publié: (2024)
par: Rajamanoharan, Senthooran, et autres
Publié: (2024)
How Well Do Models Follow Their Constitutions?
par: Jakkli, Arya, et autres
Publié: (2026)
par: Jakkli, Arya, et autres
Publié: (2026)
Censored LLMs as a Natural Testbed for Secret Knowledge Elicitation
par: Casademunt, Helena, et autres
Publié: (2026)
par: Casademunt, Helena, et autres
Publié: (2026)
Simple LLM Baselines are Competitive for Model Diffing
par: Kempf, Elias, et autres
Publié: (2026)
par: Kempf, Elias, et autres
Publié: (2026)
Improving Dictionary Learning with Gated Sparse Autoencoders
par: Rajamanoharan, Senthooran, et autres
Publié: (2024)
par: Rajamanoharan, Senthooran, et autres
Publié: (2024)
How to use and interpret activation patching
par: Heimersheim, Stefan, et autres
Publié: (2024)
par: Heimersheim, Stefan, et autres
Publié: (2024)
Emergent Misalignment is Easy, Narrow Misalignment is Hard
par: Soligo, Anna, et autres
Publié: (2026)
par: Soligo, Anna, et autres
Publié: (2026)
Fine Flood Forecasts: Incorporating local data into global models through fine-tuning
par: Ryd, Emil, et autres
Publié: (2025)
par: Ryd, Emil, et autres
Publié: (2025)
SAeUron: Interpretable Concept Unlearning in Diffusion Models with Sparse Autoencoders
par: Cywiński, Bartosz, et autres
Publié: (2025)
par: Cywiński, Bartosz, et autres
Publié: (2025)
Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2
par: Lieberum, Tom, et autres
Publié: (2024)
par: Lieberum, Tom, et autres
Publié: (2024)
Removing Sandbagging in LLMs by Training with Weak Supervision
par: Ryd, Emil, et autres
Publié: (2026)
par: Ryd, Emil, et autres
Publié: (2026)
Subliminal Learning Is Steering Vector Distillation
par: Blank, Camila, et autres
Publié: (2026)
par: Blank, Camila, et autres
Publié: (2026)
Towards Principled Evaluations of Sparse Autoencoders for Interpretability and Control
par: Makelov, Aleksandar, et autres
Publié: (2024)
par: Makelov, Aleksandar, et autres
Publié: (2024)
Towards Best Practices of Activation Patching in Language Models: Metrics and Methods
par: Zhang, Fred, et autres
Publié: (2023)
par: Zhang, Fred, et autres
Publié: (2023)
Summing Up the Facts: Additive Mechanisms Behind Factual Recall in LLMs
par: Chughtai, Bilal, et autres
Publié: (2024)
par: Chughtai, Bilal, et autres
Publié: (2024)
GUIDE: Guidance-based Incremental Learning with Diffusion Models
par: Cywiński, Bartosz, et autres
Publié: (2024)
par: Cywiński, Bartosz, et autres
Publié: (2024)
Dense SAE Latents Are Features, Not Bugs
par: Sun, Xiaoqing, et autres
Publié: (2025)
par: Sun, Xiaoqing, et autres
Publié: (2025)
Bilinear MLPs enable weight-based mechanistic interpretability
par: Pearce, Michael T., et autres
Publié: (2024)
par: Pearce, Michael T., et autres
Publié: (2024)
An introduction to graphical tensor notation for mechanistic interpretability
par: Taylor, Jordan K.
Publié: (2024)
par: Taylor, Jordan K.
Publié: (2024)
Explorations of Self-Repair in Language Models
par: Rushing, Cody, et autres
Publié: (2024)
par: Rushing, Cody, et autres
Publié: (2024)
A mechanistically interpretable neural network for regulatory genomics
par: Tseng, Alex M., et autres
Publié: (2024)
par: Tseng, Alex M., et autres
Publié: (2024)
Difficulties with Evaluating a Deception Detector for AIs
par: Smith, Lewis, et autres
Publié: (2025)
par: Smith, Lewis, et autres
Publié: (2025)
Opening the AI black box: program synthesis via mechanistic interpretability
par: Michaud, Eric J., et autres
Publié: (2024)
par: Michaud, Eric J., et autres
Publié: (2024)
Inference-Time Decomposition of Activations (ITDA): A Scalable Approach to Interpreting Large Language Models
par: Leask, Patrick, et autres
Publié: (2025)
par: Leask, Patrick, et autres
Publié: (2025)
BatchTopK Sparse Autoencoders
par: Bussmann, Bart, et autres
Publié: (2024)
par: Bussmann, Bart, et autres
Publié: (2024)
Transcoders Find Interpretable LLM Feature Circuits
par: Dunefsky, Jacob, et autres
Publié: (2024)
par: Dunefsky, Jacob, et autres
Publié: (2024)
Inoculation Prompting: Instructing LLMs to misbehave at train-time improves test-time alignment
par: Wichers, Nevan, et autres
Publié: (2025)
par: Wichers, Nevan, et autres
Publié: (2025)
How Visual Representations Map to Language Feature Space in Multimodal LLMs
par: Venhoff, Constantin, et autres
Publié: (2025)
par: Venhoff, Constantin, et autres
Publié: (2025)
What's the plan? Metrics for implicit planning in LLMs and their application to rhyme generation and question answering
par: Maar, Jim, et autres
Publié: (2026)
par: Maar, Jim, et autres
Publié: (2026)
Reasoning-Finetuning Repurposes Latent Representations in Base Models
par: Ward, Jake, et autres
Publié: (2025)
par: Ward, Jake, et autres
Publié: (2025)
RelP: Faithful and Efficient Circuit Discovery in Language Models via Relevance Patching
par: Jafari, Farnoush Rezaei, et autres
Publié: (2025)
par: Jafari, Farnoush Rezaei, et autres
Publié: (2025)
Documents similaires
-
Eliciting Secret Knowledge from Language Models
par: Cywiński, Bartosz, et autres
Publié: (2025) -
Convergent Linear Representations of Emergent Misalignment
par: Soligo, Anna, et autres
Publié: (2025) -
Do I Know This Entity? Knowledge Awareness and Hallucinations in Language Models
par: Ferrando, Javier, et autres
Publié: (2024) -
Thought Branches: Interpreting LLM Reasoning Requires Resampling
par: Macar, Uzay, et autres
Publié: (2025) -
Model Organisms for Emergent Misalignment
par: Turner, Edward, et autres
Publié: (2025)