Model Organisms for Emergent Misalignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Turner, Edward, Soligo, Anna, Taylor, Mia, Rajamanoharan, Senthooran, Nanda, Neel |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Convergent Linear Representations of Emergent Misalignment
por: Soligo, Anna, et al.
Publicado: (2025)
por: Soligo, Anna, et al.
Publicado: (2025)
Emergent Misalignment is Easy, Narrow Misalignment is Hard
por: Soligo, Anna, et al.
Publicado: (2026)
por: Soligo, Anna, et al.
Publicado: (2026)
Do I Know This Entity? Knowledge Awareness and Hallucinations in Language Models
por: Ferrando, Javier, et al.
Publicado: (2024)
por: Ferrando, Javier, et al.
Publicado: (2024)
Are Sparse Autoencoders Useful? A Case Study in Sparse Probing
por: Kantamneni, Subhash, et al.
Publicado: (2025)
por: Kantamneni, Subhash, et al.
Publicado: (2025)
Thought Branches: Interpreting LLM Reasoning Requires Resampling
por: Macar, Uzay, et al.
Publicado: (2025)
por: Macar, Uzay, et al.
Publicado: (2025)
How Well Do Models Follow Their Constitutions?
por: Jakkli, Arya, et al.
Publicado: (2026)
por: Jakkli, Arya, et al.
Publicado: (2026)
Steering Out-of-Distribution Generalization with Concept Ablation Fine-Tuning
por: Casademunt, Helena, et al.
Publicado: (2025)
por: Casademunt, Helena, et al.
Publicado: (2025)
Chain-of-Thought Reasoning In The Wild Is Not Always Faithful
por: Arcuschin, Iván, et al.
Publicado: (2025)
por: Arcuschin, Iván, et al.
Publicado: (2025)
Improving Dictionary Learning with Gated Sparse Autoencoders
por: Rajamanoharan, Senthooran, et al.
Publicado: (2024)
por: Rajamanoharan, Senthooran, et al.
Publicado: (2024)
Towards eliciting latent knowledge from LLMs with mechanistic interpretability
por: Cywiński, Bartosz, et al.
Publicado: (2025)
por: Cywiński, Bartosz, et al.
Publicado: (2025)
Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models
por: Chua, James, et al.
Publicado: (2025)
por: Chua, James, et al.
Publicado: (2025)
Subliminal Learning Is Steering Vector Distillation
por: Blank, Camila, et al.
Publicado: (2026)
por: Blank, Camila, et al.
Publicado: (2026)
Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2
por: Lieberum, Tom, et al.
Publicado: (2024)
por: Lieberum, Tom, et al.
Publicado: (2024)
Simple Mechanistic Explanations for Out-Of-Context Reasoning
por: Wang, Atticus, et al.
Publicado: (2025)
por: Wang, Atticus, et al.
Publicado: (2025)
Explorations of Self-Repair in Language Models
por: Rushing, Cody, et al.
Publicado: (2024)
por: Rushing, Cody, et al.
Publicado: (2024)
Eliciting Secret Knowledge from Language Models
por: Cywiński, Bartosz, et al.
Publicado: (2025)
por: Cywiński, Bartosz, et al.
Publicado: (2025)
Towards Best Practices of Activation Patching in Language Models: Metrics and Methods
por: Zhang, Fred, et al.
Publicado: (2023)
por: Zhang, Fred, et al.
Publicado: (2023)
In-Training Defenses against Emergent Misalignment in Language Models
por: Kaczér, David, et al.
Publicado: (2025)
por: Kaczér, David, et al.
Publicado: (2025)
Inducing, Detecting and Characterising Neural Modules: A Pipeline for Functional Interpretability in Reinforcement Learning
por: Soligo, Anna, et al.
Publicado: (2025)
por: Soligo, Anna, et al.
Publicado: (2025)
Dense SAE Latents Are Features, Not Bugs
por: Sun, Xiaoqing, et al.
Publicado: (2025)
por: Sun, Xiaoqing, et al.
Publicado: (2025)
Jumping Ahead: Improving Reconstruction Fidelity with JumpReLU Sparse Autoencoders
por: Rajamanoharan, Senthooran, et al.
Publicado: (2024)
por: Rajamanoharan, Senthooran, et al.
Publicado: (2024)
BatchTopK Sparse Autoencoders
por: Bussmann, Bart, et al.
Publicado: (2024)
por: Bussmann, Bart, et al.
Publicado: (2024)
Understanding Emergent Misalignment via Feature Superposition Geometry
por: Minegishi, Gouki, et al.
Publicado: (2026)
por: Minegishi, Gouki, et al.
Publicado: (2026)
Persona-Model Collapse in Emergent Misalignment
por: Costa, Davi Bastos, et al.
Publicado: (2026)
por: Costa, Davi Bastos, et al.
Publicado: (2026)
Base Models Know How to Reason, Thinking Models Learn When
por: Venhoff, Constantin, et al.
Publicado: (2025)
por: Venhoff, Constantin, et al.
Publicado: (2025)
Understanding Reasoning in Thinking Language Models via Steering Vectors
por: Venhoff, Constantin, et al.
Publicado: (2025)
por: Venhoff, Constantin, et al.
Publicado: (2025)
Shared Parameter Subspaces and Cross-Task Linearity in Emergently Misaligned Behavior
por: Arturi, Daniel Aarao Reis, et al.
Publicado: (2025)
por: Arturi, Daniel Aarao Reis, et al.
Publicado: (2025)
Decomposing Behavioral Phase Transitions in LLMs: Order Parameters for Emergent Misalignment
por: Arnold, Julian, et al.
Publicado: (2025)
por: Arnold, Julian, et al.
Publicado: (2025)
From Narrow Unlearning to Emergent Misalignment: Causes, Consequences, and Containment in LLMs
por: Mushtaq, Erum, et al.
Publicado: (2025)
por: Mushtaq, Erum, et al.
Publicado: (2025)
Learning Multi-Level Features with Matryoshka Sparse Autoencoders
por: Bussmann, Bart, et al.
Publicado: (2025)
por: Bussmann, Bart, et al.
Publicado: (2025)
Emergent and Subliminal Misalignment Through the Lens of Data-Mediated Transfer
por: Askin, Baris, et al.
Publicado: (2026)
por: Askin, Baris, et al.
Publicado: (2026)
Interpretable Embeddings with Sparse Autoencoders: A Data Analysis Toolkit
por: Jiang, Nick, et al.
Publicado: (2025)
por: Jiang, Nick, et al.
Publicado: (2025)
Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs
por: Betley, Jan, et al.
Publicado: (2025)
por: Betley, Jan, et al.
Publicado: (2025)
The Devil in the Details: Emergent Misalignment, Format and Coherence in Open-Weights LLMs
por: Dickson, Craig
Publicado: (2025)
por: Dickson, Craig
Publicado: (2025)
Large Language Models as Model Organisms for Human Associative Learning
por: Kolling, Camila, et al.
Publicado: (2025)
por: Kolling, Camila, et al.
Publicado: (2025)
Persona Features Control Emergent Misalignment
por: Wang, Miles, et al.
Publicado: (2025)
por: Wang, Miles, et al.
Publicado: (2025)
Thought Anchors: Which LLM Reasoning Steps Matter?
por: Bogdan, Paul C., et al.
Publicado: (2025)
por: Bogdan, Paul C., et al.
Publicado: (2025)
Overtrained, Not Misaligned
por: Schreiber, Joel, et al.
Publicado: (2026)
por: Schreiber, Joel, et al.
Publicado: (2026)
Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs
por: Giordani, Jeremiah
Publicado: (2025)
por: Giordani, Jeremiah
Publicado: (2025)
Scaling sparse feature circuit finding for in-context learning
por: Kharlapenko, Dmitrii, et al.
Publicado: (2025)
por: Kharlapenko, Dmitrii, et al.
Publicado: (2025)
Ejemplares similares
-
Convergent Linear Representations of Emergent Misalignment
por: Soligo, Anna, et al.
Publicado: (2025) -
Emergent Misalignment is Easy, Narrow Misalignment is Hard
por: Soligo, Anna, et al.
Publicado: (2026) -
Do I Know This Entity? Knowledge Awareness and Hallucinations in Language Models
por: Ferrando, Javier, et al.
Publicado: (2024) -
Are Sparse Autoencoders Useful? A Case Study in Sparse Probing
por: Kantamneni, Subhash, et al.
Publicado: (2025) -
Thought Branches: Interpreting LLM Reasoning Requires Resampling
por: Macar, Uzay, et al.
Publicado: (2025)