Shared Parameter Subspaces and Cross-Task Linearity in Emergently Misaligned Behavior
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Arturi, Daniel Aarao Reis, Zhang, Eric, Ansah, Andrew, Zhu, Kevin, Panda, Ashwinee, Balwani, Aishwarya |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LoRI: Reducing Cross-Task Interference in Multi-Task Low-Rank Adaptation
par: Zhang, Juzheng, et autres
Publié: (2025)
par: Zhang, Juzheng, et autres
Publié: (2025)
Decomposing Behavioral Phase Transitions in LLMs: Order Parameters for Emergent Misalignment
par: Arnold, Julian, et autres
Publié: (2025)
par: Arnold, Julian, et autres
Publié: (2025)
Convergent Linear Representations of Emergent Misalignment
par: Soligo, Anna, et autres
Publié: (2025)
par: Soligo, Anna, et autres
Publié: (2025)
A New Linear Scaling Rule for Private Adaptive Hyperparameter Optimization
par: Panda, Ashwinee, et autres
Publié: (2022)
par: Panda, Ashwinee, et autres
Publié: (2022)
Model Organisms for Emergent Misalignment
par: Turner, Edward, et autres
Publié: (2025)
par: Turner, Edward, et autres
Publié: (2025)
Amortized Latent Steering: Low-Cost Alternative to Test-Time Optimization
par: Egbuna, Nathan, et autres
Publié: (2025)
par: Egbuna, Nathan, et autres
Publié: (2025)
Speculating Experts Accelerates Inference for Mixture-of-Experts
par: Madan, Vivan, et autres
Publié: (2026)
par: Madan, Vivan, et autres
Publié: (2026)
Understanding Emergent Misalignment via Feature Superposition Geometry
par: Minegishi, Gouki, et autres
Publié: (2026)
par: Minegishi, Gouki, et autres
Publié: (2026)
In-Training Defenses against Emergent Misalignment in Language Models
par: Kaczér, David, et autres
Publié: (2025)
par: Kaczér, David, et autres
Publié: (2025)
Peek-a-Boo Reasoning: Contrastive Region Masking in MLLMs
par: Chaturvedi, Isha, et autres
Publié: (2025)
par: Chaturvedi, Isha, et autres
Publié: (2025)
CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing
par: Wang, Yixuan, et autres
Publié: (2025)
par: Wang, Yixuan, et autres
Publié: (2025)
Alignment-Constrained Dynamic Pruning for LLMs: Identifying and Preserving Alignment-Critical Circuits
par: Patel, Dev, et autres
Publié: (2025)
par: Patel, Dev, et autres
Publié: (2025)
From Narrow Unlearning to Emergent Misalignment: Causes, Consequences, and Containment in LLMs
par: Mushtaq, Erum, et autres
Publié: (2025)
par: Mushtaq, Erum, et autres
Publié: (2025)
Persona-Model Collapse in Emergent Misalignment
par: Costa, Davi Bastos, et autres
Publié: (2026)
par: Costa, Davi Bastos, et autres
Publié: (2026)
Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models
par: Chua, James, et autres
Publié: (2025)
par: Chua, James, et autres
Publié: (2025)
FRIT: Using Causal Importance to Improve Chain-of-Thought Faithfulness
par: Swaroop, Anand, et autres
Publié: (2025)
par: Swaroop, Anand, et autres
Publié: (2025)
Shared Lexical Task Representations Explain Behavioral Variability In LLMs
par: Yang, Zhuonan, et autres
Publié: (2026)
par: Yang, Zhuonan, et autres
Publié: (2026)
Emergent and Subliminal Misalignment Through the Lens of Data-Mediated Transfer
par: Askin, Baris, et autres
Publié: (2026)
par: Askin, Baris, et autres
Publié: (2026)
Persona Features Control Emergent Misalignment
par: Wang, Miles, et autres
Publié: (2025)
par: Wang, Miles, et autres
Publié: (2025)
Dense Backpropagation Improves Training for Sparse Mixture-of-Experts
par: Panda, Ashwinee, et autres
Publié: (2025)
par: Panda, Ashwinee, et autres
Publié: (2025)
The Devil in the Details: Emergent Misalignment, Format and Coherence in Open-Weights LLMs
par: Dickson, Craig
Publié: (2025)
par: Dickson, Craig
Publié: (2025)
The Master Key Hypothesis: Unlocking Cross-Model Capability Transfer via Linear Subspace Alignment
par: Balasubramanian, Rishab, et autres
Publié: (2026)
par: Balasubramanian, Rishab, et autres
Publié: (2026)
Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs
par: Betley, Jan, et autres
Publié: (2025)
par: Betley, Jan, et autres
Publié: (2025)
Privacy Auditing of Large Language Models
par: Panda, Ashwinee, et autres
Publié: (2025)
par: Panda, Ashwinee, et autres
Publié: (2025)
Distilling Linearized Behavior into Non-Linear Fine-Tuning for Effective Task Arithmetic
par: Sommariva, Thomas, et autres
Publié: (2026)
par: Sommariva, Thomas, et autres
Publié: (2026)
On the Emergence of Cross-Task Linearity in the Pretraining-Finetuning Paradigm
par: Zhou, Zhanpeng, et autres
Publié: (2024)
par: Zhou, Zhanpeng, et autres
Publié: (2024)
ROGUE: Misaligned Agent Behavior Arising from Ordinary Computer Use
par: Tien, Jeremy, et autres
Publié: (2026)
par: Tien, Jeremy, et autres
Publié: (2026)
Emergent Misalignment is Easy, Narrow Misalignment is Hard
par: Soligo, Anna, et autres
Publié: (2026)
par: Soligo, Anna, et autres
Publié: (2026)
QMP: Q-switch Mixture of Policies for Multi-Task Behavior Sharing
par: Zhang, Grace, et autres
Publié: (2023)
par: Zhang, Grace, et autres
Publié: (2023)
SALT: Steering Activations towards Leakage-free Thinking in Chain of Thought
par: Batra, Shourya, et autres
Publié: (2025)
par: Batra, Shourya, et autres
Publié: (2025)
PASs-MoE: Mitigating Misaligned Co-drift among Router and Experts via Pathway Activation Subspaces for Continual Learning
par: Hou, Zhiyan, et autres
Publié: (2026)
par: Hou, Zhiyan, et autres
Publié: (2026)
CoPS: Empowering LLM Agents with Provable Cross-Task Experience Sharing
par: Yang, Chen, et autres
Publié: (2024)
par: Yang, Chen, et autres
Publié: (2024)
Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs
par: Giordani, Jeremiah
Publié: (2025)
par: Giordani, Jeremiah
Publié: (2025)
Moloch's Bargain: Emergent Misalignment When LLMs Compete for Audiences
par: El, Batu, et autres
Publié: (2025)
par: El, Batu, et autres
Publié: (2025)
Teach LLMs to Phish: Stealing Private Information from Language Models
par: Panda, Ashwinee, et autres
Publié: (2024)
par: Panda, Ashwinee, et autres
Publié: (2024)
Overtrained, Not Misaligned
par: Schreiber, Joel, et autres
Publié: (2026)
par: Schreiber, Joel, et autres
Publié: (2026)
Characterizing the Consistency of the Emergent Misalignment Persona
par: Weckauff, Anietta, et autres
Publié: (2026)
par: Weckauff, Anietta, et autres
Publié: (2026)
Gemstones: A Model Suite for Multi-Faceted Scaling Laws
par: McLeish, Sean, et autres
Publié: (2025)
par: McLeish, Sean, et autres
Publié: (2025)
BLOCK-EM: Preventing Emergent Misalignment via Latent Blocking
par: Ustaomeroglu, Muhammed, et autres
Publié: (2026)
par: Ustaomeroglu, Muhammed, et autres
Publié: (2026)
The Latent Color Subspace: Emergent Order in High-Dimensional Chaos
par: Pach, Mateusz, et autres
Publié: (2026)
par: Pach, Mateusz, et autres
Publié: (2026)
Documents similaires
-
LoRI: Reducing Cross-Task Interference in Multi-Task Low-Rank Adaptation
par: Zhang, Juzheng, et autres
Publié: (2025) -
Decomposing Behavioral Phase Transitions in LLMs: Order Parameters for Emergent Misalignment
par: Arnold, Julian, et autres
Publié: (2025) -
Convergent Linear Representations of Emergent Misalignment
par: Soligo, Anna, et autres
Publié: (2025) -
A New Linear Scaling Rule for Private Adaptive Hyperparameter Optimization
par: Panda, Ashwinee, et autres
Publié: (2022) -
Model Organisms for Emergent Misalignment
par: Turner, Edward, et autres
Publié: (2025)