Assessing Domain-Level Susceptibility to Emergent Misalignment from Narrow Finetuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Mishra, Abhishek, Arulvanan, Mugilan, Ashok, Reshma, Petrova, Polina, Suranjandass, Deepesh, Winkelmann, Donnie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Emergent Misalignment is Easy, Narrow Misalignment is Hard
por: Soligo, Anna, et al.
Publicado: (2026)
por: Soligo, Anna, et al.
Publicado: (2026)
From Narrow Unlearning to Emergent Misalignment: Causes, Consequences, and Containment in LLMs
por: Mushtaq, Erum, et al.
Publicado: (2025)
por: Mushtaq, Erum, et al.
Publicado: (2025)
Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs
por: Betley, Jan, et al.
Publicado: (2025)
por: Betley, Jan, et al.
Publicado: (2025)
Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs
por: Giordani, Jeremiah
Publicado: (2025)
por: Giordani, Jeremiah
Publicado: (2025)
Characterizing the Consistency of the Emergent Misalignment Persona
por: Weckauff, Anietta, et al.
Publicado: (2026)
por: Weckauff, Anietta, et al.
Publicado: (2026)
Model Organisms for Emergent Misalignment
por: Turner, Edward, et al.
Publicado: (2025)
por: Turner, Edward, et al.
Publicado: (2025)
Convergent Linear Representations of Emergent Misalignment
por: Soligo, Anna, et al.
Publicado: (2025)
por: Soligo, Anna, et al.
Publicado: (2025)
Narrow Finetuning Leaves Clearly Readable Traces in Activation Differences
por: Minder, Julian, et al.
Publicado: (2025)
por: Minder, Julian, et al.
Publicado: (2025)
Natural Emergent Misalignment from Reward Hacking in Production RL
por: MacDiarmid, Monte, et al.
Publicado: (2025)
por: MacDiarmid, Monte, et al.
Publicado: (2025)
Semantic Containment as a Fundamental Property of Emergent Misalignment
por: Saxena, Rohan
Publicado: (2026)
por: Saxena, Rohan
Publicado: (2026)
Understanding Emergent Misalignment via Feature Superposition Geometry
por: Minegishi, Gouki, et al.
Publicado: (2026)
por: Minegishi, Gouki, et al.
Publicado: (2026)
In-Training Defenses against Emergent Misalignment in Language Models
por: Kaczér, David, et al.
Publicado: (2025)
por: Kaczér, David, et al.
Publicado: (2025)
Persona-Model Collapse in Emergent Misalignment
por: Costa, Davi Bastos, et al.
Publicado: (2026)
por: Costa, Davi Bastos, et al.
Publicado: (2026)
LLMs Deceive Unintentionally: Emergent Misalignment in Dishonesty from Misaligned Samples to Biased Human-AI Interactions
por: Hu, Xuhao, et al.
Publicado: (2025)
por: Hu, Xuhao, et al.
Publicado: (2025)
Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models
por: Chua, James, et al.
Publicado: (2025)
por: Chua, James, et al.
Publicado: (2025)
Persona Features Control Emergent Misalignment
por: Wang, Miles, et al.
Publicado: (2025)
por: Wang, Miles, et al.
Publicado: (2025)
Shared Parameter Subspaces and Cross-Task Linearity in Emergently Misaligned Behavior
por: Arturi, Daniel Aarao Reis, et al.
Publicado: (2025)
por: Arturi, Daniel Aarao Reis, et al.
Publicado: (2025)
Decomposing Behavioral Phase Transitions in LLMs: Order Parameters for Emergent Misalignment
por: Arnold, Julian, et al.
Publicado: (2025)
por: Arnold, Julian, et al.
Publicado: (2025)
Emergent and Subliminal Misalignment Through the Lens of Data-Mediated Transfer
por: Askin, Baris, et al.
Publicado: (2026)
por: Askin, Baris, et al.
Publicado: (2026)
Intrinsic Guardrails: How Semantic Geometry of Personality Interacts with Emergent Misalignment in LLMs
por: Aneja, Krishak, et al.
Publicado: (2026)
por: Aneja, Krishak, et al.
Publicado: (2026)
Eliciting and Analyzing Emergent Misalignment in State-of-the-Art Large Language Models
por: Panpatil, Siddhant, et al.
Publicado: (2025)
por: Panpatil, Siddhant, et al.
Publicado: (2025)
The Devil in the Details: Emergent Misalignment, Format and Coherence in Open-Weights LLMs
por: Dickson, Craig
Publicado: (2025)
por: Dickson, Craig
Publicado: (2025)
The Subject of Emergent Misalignment in Superintelligence: An Anthropological, Cognitive Neuropsychological, Machine-Learning, and Ontological Perspective
por: Imran, Muhammad Osama, et al.
Publicado: (2025)
por: Imran, Muhammad Osama, et al.
Publicado: (2025)
"Dark Triad" Model Organisms of Misalignment: Narrow Fine-Tuning Mirrors Human Antisocial Behavior
por: Lulla, Roshni, et al.
Publicado: (2026)
por: Lulla, Roshni, et al.
Publicado: (2026)
Moloch's Bargain: Emergent Misalignment When LLMs Compete for Audiences
por: El, Batu, et al.
Publicado: (2025)
por: El, Batu, et al.
Publicado: (2025)
BLOCK-EM: Preventing Emergent Misalignment via Latent Blocking
por: Ustaomeroglu, Muhammed, et al.
Publicado: (2026)
por: Ustaomeroglu, Muhammed, et al.
Publicado: (2026)
How to Assess AI Literacy: Misalignment Between Self-Reported and Objective-Based Measures
por: Zhang, Shan, et al.
Publicado: (2026)
por: Zhang, Shan, et al.
Publicado: (2026)
TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning
por: Hong, Matthew M., et al.
Publicado: (2026)
por: Hong, Matthew M., et al.
Publicado: (2026)
Architecting AgentOS: From Token-Level Context to Emergent System-Level Intelligence
por: Li, ChengYou, et al.
Publicado: (2026)
por: Li, ChengYou, et al.
Publicado: (2026)
Assessing the Portability of Parameter Matrices Trained by Parameter-Efficient Finetuning Methods
por: Sabry, Mohammed, et al.
Publicado: (2024)
por: Sabry, Mohammed, et al.
Publicado: (2024)
Overtrained, Not Misaligned
por: Schreiber, Joel, et al.
Publicado: (2026)
por: Schreiber, Joel, et al.
Publicado: (2026)
Boundary Matters: A Bi-Level Active Finetuning Framework
por: Lu, Han, et al.
Publicado: (2024)
por: Lu, Han, et al.
Publicado: (2024)
Pressure Reveals Character: Behavioural Alignment Evaluation at Depth
por: Petrova, Nora, et al.
Publicado: (2026)
por: Petrova, Nora, et al.
Publicado: (2026)
Generalizable and Stable Finetuning of Pretrained Language Models on Low-Resource Texts
por: Somayajula, Sai Ashish, et al.
Publicado: (2024)
por: Somayajula, Sai Ashish, et al.
Publicado: (2024)
Iterative Finetuning is Mostly Idempotent
por: Roe, Zephaniah, et al.
Publicado: (2026)
por: Roe, Zephaniah, et al.
Publicado: (2026)
SelectiveFinetuning: Enhancing Transfer Learning in Sleep Staging through Selective Domain Alignment
por: Zhao, Siyuan, et al.
Publicado: (2025)
por: Zhao, Siyuan, et al.
Publicado: (2025)
Finetune Once: Decoupling General & Domain Learning with Dynamic Boosted Annealing
por: Tang, Yang, et al.
Publicado: (2025)
por: Tang, Yang, et al.
Publicado: (2025)
Silent Inconsistency in Data-Parallel Full Fine-Tuning: Diagnosing Worker-Level Optimization Misalignment
por: Li, Hong, et al.
Publicado: (2026)
por: Li, Hong, et al.
Publicado: (2026)
Misalignment from Treating Means as Ends
por: Marklund, Henrik, et al.
Publicado: (2025)
por: Marklund, Henrik, et al.
Publicado: (2025)
FineScope : SAE-guided Data Selection Enables Domain Specific LLM Pruning and Finetuning
por: Bhattacharyya, Chaitali, et al.
Publicado: (2025)
por: Bhattacharyya, Chaitali, et al.
Publicado: (2025)
Ejemplares similares
-
Emergent Misalignment is Easy, Narrow Misalignment is Hard
por: Soligo, Anna, et al.
Publicado: (2026) -
From Narrow Unlearning to Emergent Misalignment: Causes, Consequences, and Containment in LLMs
por: Mushtaq, Erum, et al.
Publicado: (2025) -
Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs
por: Betley, Jan, et al.
Publicado: (2025) -
Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs
por: Giordani, Jeremiah
Publicado: (2025) -
Characterizing the Consistency of the Emergent Misalignment Persona
por: Weckauff, Anietta, et al.
Publicado: (2026)