Emergent Misalignment is Easy, Narrow Misalignment is Hard
Fuente:
arXiv
Salvato in:
| Autori principali: | Soligo, Anna, Turner, Edward, Rajamanoharan, Senthooran, Nanda, Neel |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Convergent Linear Representations of Emergent Misalignment
di: Soligo, Anna, et al.
Pubblicazione: (2025)
di: Soligo, Anna, et al.
Pubblicazione: (2025)
Model Organisms for Emergent Misalignment
di: Turner, Edward, et al.
Pubblicazione: (2025)
di: Turner, Edward, et al.
Pubblicazione: (2025)
Do I Know This Entity? Knowledge Awareness and Hallucinations in Language Models
di: Ferrando, Javier, et al.
Pubblicazione: (2024)
di: Ferrando, Javier, et al.
Pubblicazione: (2024)
Thought Branches: Interpreting LLM Reasoning Requires Resampling
di: Macar, Uzay, et al.
Pubblicazione: (2025)
di: Macar, Uzay, et al.
Pubblicazione: (2025)
How Well Do Models Follow Their Constitutions?
di: Jakkli, Arya, et al.
Pubblicazione: (2026)
di: Jakkli, Arya, et al.
Pubblicazione: (2026)
Steering Out-of-Distribution Generalization with Concept Ablation Fine-Tuning
di: Casademunt, Helena, et al.
Pubblicazione: (2025)
di: Casademunt, Helena, et al.
Pubblicazione: (2025)
Chain-of-Thought Reasoning In The Wild Is Not Always Faithful
di: Arcuschin, Iván, et al.
Pubblicazione: (2025)
di: Arcuschin, Iván, et al.
Pubblicazione: (2025)
Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs
di: Betley, Jan, et al.
Pubblicazione: (2025)
di: Betley, Jan, et al.
Pubblicazione: (2025)
Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs
di: Giordani, Jeremiah
Pubblicazione: (2025)
di: Giordani, Jeremiah
Pubblicazione: (2025)
Semantic Containment as a Fundamental Property of Emergent Misalignment
di: Saxena, Rohan
Pubblicazione: (2026)
di: Saxena, Rohan
Pubblicazione: (2026)
LLMs Deceive Unintentionally: Emergent Misalignment in Dishonesty from Misaligned Samples to Biased Human-AI Interactions
di: Hu, Xuhao, et al.
Pubblicazione: (2025)
di: Hu, Xuhao, et al.
Pubblicazione: (2025)
Persona-Model Collapse in Emergent Misalignment
di: Costa, Davi Bastos, et al.
Pubblicazione: (2026)
di: Costa, Davi Bastos, et al.
Pubblicazione: (2026)
Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models
di: Chua, James, et al.
Pubblicazione: (2025)
di: Chua, James, et al.
Pubblicazione: (2025)
Subliminal Learning Is Steering Vector Distillation
di: Blank, Camila, et al.
Pubblicazione: (2026)
di: Blank, Camila, et al.
Pubblicazione: (2026)
Intrinsic Guardrails: How Semantic Geometry of Personality Interacts with Emergent Misalignment in LLMs
di: Aneja, Krishak, et al.
Pubblicazione: (2026)
di: Aneja, Krishak, et al.
Pubblicazione: (2026)
Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2
di: Lieberum, Tom, et al.
Pubblicazione: (2024)
di: Lieberum, Tom, et al.
Pubblicazione: (2024)
Emergent and Subliminal Misalignment Through the Lens of Data-Mediated Transfer
di: Askin, Baris, et al.
Pubblicazione: (2026)
di: Askin, Baris, et al.
Pubblicazione: (2026)
Are Sparse Autoencoders Useful? A Case Study in Sparse Probing
di: Kantamneni, Subhash, et al.
Pubblicazione: (2025)
di: Kantamneni, Subhash, et al.
Pubblicazione: (2025)
Eliciting and Analyzing Emergent Misalignment in State-of-the-Art Large Language Models
di: Panpatil, Siddhant, et al.
Pubblicazione: (2025)
di: Panpatil, Siddhant, et al.
Pubblicazione: (2025)
The Devil in the Details: Emergent Misalignment, Format and Coherence in Open-Weights LLMs
di: Dickson, Craig
Pubblicazione: (2025)
di: Dickson, Craig
Pubblicazione: (2025)
"Dark Triad" Model Organisms of Misalignment: Narrow Fine-Tuning Mirrors Human Antisocial Behavior
di: Lulla, Roshni, et al.
Pubblicazione: (2026)
di: Lulla, Roshni, et al.
Pubblicazione: (2026)
Simple Mechanistic Explanations for Out-Of-Context Reasoning
di: Wang, Atticus, et al.
Pubblicazione: (2025)
di: Wang, Atticus, et al.
Pubblicazione: (2025)
Mitigating Misalignment Contagion by Steering with Implicit Traits
di: Chang, Maria, et al.
Pubblicazione: (2026)
di: Chang, Maria, et al.
Pubblicazione: (2026)
Narrow Finetuning Leaves Clearly Readable Traces in Activation Differences
di: Minder, Julian, et al.
Pubblicazione: (2025)
di: Minder, Julian, et al.
Pubblicazione: (2025)
Emergent misalignment as prompt sensitivity: A research note
di: Wyse, Tim, et al.
Pubblicazione: (2025)
di: Wyse, Tim, et al.
Pubblicazione: (2025)
Preemptive Detection and Correction of Misaligned Actions in LLM Agents
di: Fang, Haishuo, et al.
Pubblicazione: (2024)
di: Fang, Haishuo, et al.
Pubblicazione: (2024)
Rethinking DPO: The Role of Rejected Responses in Preference Misalignment
di: Cho, Jay Hyeon, et al.
Pubblicazione: (2025)
di: Cho, Jay Hyeon, et al.
Pubblicazione: (2025)
Misaligned by Reward: Socially Undesirable Preferences in LLMs
di: Ghazaryan, Gayane, et al.
Pubblicazione: (2026)
di: Ghazaryan, Gayane, et al.
Pubblicazione: (2026)
Assessing Domain-Level Susceptibility to Emergent Misalignment from Narrow Finetuning
di: Mishra, Abhishek, et al.
Pubblicazione: (2026)
di: Mishra, Abhishek, et al.
Pubblicazione: (2026)
An Investigation into Value Misalignment in LLM-Generated Texts for Cultural Heritage
di: Bu, Fan, et al.
Pubblicazione: (2025)
di: Bu, Fan, et al.
Pubblicazione: (2025)
RLHS: Mitigating Misalignment in RLHF with Hindsight Simulation
di: Liang, Kaiqu, et al.
Pubblicazione: (2025)
di: Liang, Kaiqu, et al.
Pubblicazione: (2025)
Dense SAE Latents Are Features, Not Bugs
di: Sun, Xiaoqing, et al.
Pubblicazione: (2025)
di: Sun, Xiaoqing, et al.
Pubblicazione: (2025)
Residual Connections and the Causal Shift: Uncovering a Structural Misalignment in Transformers
di: Lys, Jonathan, et al.
Pubblicazione: (2026)
di: Lys, Jonathan, et al.
Pubblicazione: (2026)
Bridging Draft Policy Misalignment: Group Tree Optimization for Speculative Decoding
di: Hu, Shijing, et al.
Pubblicazione: (2025)
di: Hu, Shijing, et al.
Pubblicazione: (2025)
Lost in Translation: Latent Concept Misalignment in Text-to-Image Diffusion Models
di: Zhao, Juntu, et al.
Pubblicazione: (2024)
di: Zhao, Juntu, et al.
Pubblicazione: (2024)
Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures
di: Su, Yanghao, et al.
Pubblicazione: (2026)
di: Su, Yanghao, et al.
Pubblicazione: (2026)
From Narrow Unlearning to Emergent Misalignment: Causes, Consequences, and Containment in LLMs
di: Mushtaq, Erum, et al.
Pubblicazione: (2025)
di: Mushtaq, Erum, et al.
Pubblicazione: (2025)
Explorations of Self-Repair in Language Models
di: Rushing, Cody, et al.
Pubblicazione: (2024)
di: Rushing, Cody, et al.
Pubblicazione: (2024)
Towards Best Practices of Activation Patching in Language Models: Metrics and Methods
di: Zhang, Fred, et al.
Pubblicazione: (2023)
di: Zhang, Fred, et al.
Pubblicazione: (2023)
Epistemic Traps: Rational Misalignment Driven by Model Misspecification
di: Xu, Xingcheng, et al.
Pubblicazione: (2026)
di: Xu, Xingcheng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Convergent Linear Representations of Emergent Misalignment
di: Soligo, Anna, et al.
Pubblicazione: (2025) -
Model Organisms for Emergent Misalignment
di: Turner, Edward, et al.
Pubblicazione: (2025) -
Do I Know This Entity? Knowledge Awareness and Hallucinations in Language Models
di: Ferrando, Javier, et al.
Pubblicazione: (2024) -
Thought Branches: Interpreting LLM Reasoning Requires Resampling
di: Macar, Uzay, et al.
Pubblicazione: (2025) -
How Well Do Models Follow Their Constitutions?
di: Jakkli, Arya, et al.
Pubblicazione: (2026)