Shared Parameter Subspaces and Cross-Task Linearity in Emergently Misaligned Behavior
Fuente:
arXiv
Salvato in:
| Autori principali: | Arturi, Daniel Aarao Reis, Zhang, Eric, Ansah, Andrew, Zhu, Kevin, Panda, Ashwinee, Balwani, Aishwarya |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LoRI: Reducing Cross-Task Interference in Multi-Task Low-Rank Adaptation
di: Zhang, Juzheng, et al.
Pubblicazione: (2025)
di: Zhang, Juzheng, et al.
Pubblicazione: (2025)
Decomposing Behavioral Phase Transitions in LLMs: Order Parameters for Emergent Misalignment
di: Arnold, Julian, et al.
Pubblicazione: (2025)
di: Arnold, Julian, et al.
Pubblicazione: (2025)
Convergent Linear Representations of Emergent Misalignment
di: Soligo, Anna, et al.
Pubblicazione: (2025)
di: Soligo, Anna, et al.
Pubblicazione: (2025)
A New Linear Scaling Rule for Private Adaptive Hyperparameter Optimization
di: Panda, Ashwinee, et al.
Pubblicazione: (2022)
di: Panda, Ashwinee, et al.
Pubblicazione: (2022)
Model Organisms for Emergent Misalignment
di: Turner, Edward, et al.
Pubblicazione: (2025)
di: Turner, Edward, et al.
Pubblicazione: (2025)
Amortized Latent Steering: Low-Cost Alternative to Test-Time Optimization
di: Egbuna, Nathan, et al.
Pubblicazione: (2025)
di: Egbuna, Nathan, et al.
Pubblicazione: (2025)
Speculating Experts Accelerates Inference for Mixture-of-Experts
di: Madan, Vivan, et al.
Pubblicazione: (2026)
di: Madan, Vivan, et al.
Pubblicazione: (2026)
Understanding Emergent Misalignment via Feature Superposition Geometry
di: Minegishi, Gouki, et al.
Pubblicazione: (2026)
di: Minegishi, Gouki, et al.
Pubblicazione: (2026)
In-Training Defenses against Emergent Misalignment in Language Models
di: Kaczér, David, et al.
Pubblicazione: (2025)
di: Kaczér, David, et al.
Pubblicazione: (2025)
Peek-a-Boo Reasoning: Contrastive Region Masking in MLLMs
di: Chaturvedi, Isha, et al.
Pubblicazione: (2025)
di: Chaturvedi, Isha, et al.
Pubblicazione: (2025)
CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing
di: Wang, Yixuan, et al.
Pubblicazione: (2025)
di: Wang, Yixuan, et al.
Pubblicazione: (2025)
Alignment-Constrained Dynamic Pruning for LLMs: Identifying and Preserving Alignment-Critical Circuits
di: Patel, Dev, et al.
Pubblicazione: (2025)
di: Patel, Dev, et al.
Pubblicazione: (2025)
From Narrow Unlearning to Emergent Misalignment: Causes, Consequences, and Containment in LLMs
di: Mushtaq, Erum, et al.
Pubblicazione: (2025)
di: Mushtaq, Erum, et al.
Pubblicazione: (2025)
Persona-Model Collapse in Emergent Misalignment
di: Costa, Davi Bastos, et al.
Pubblicazione: (2026)
di: Costa, Davi Bastos, et al.
Pubblicazione: (2026)
Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models
di: Chua, James, et al.
Pubblicazione: (2025)
di: Chua, James, et al.
Pubblicazione: (2025)
FRIT: Using Causal Importance to Improve Chain-of-Thought Faithfulness
di: Swaroop, Anand, et al.
Pubblicazione: (2025)
di: Swaroop, Anand, et al.
Pubblicazione: (2025)
Shared Lexical Task Representations Explain Behavioral Variability In LLMs
di: Yang, Zhuonan, et al.
Pubblicazione: (2026)
di: Yang, Zhuonan, et al.
Pubblicazione: (2026)
Emergent and Subliminal Misalignment Through the Lens of Data-Mediated Transfer
di: Askin, Baris, et al.
Pubblicazione: (2026)
di: Askin, Baris, et al.
Pubblicazione: (2026)
Persona Features Control Emergent Misalignment
di: Wang, Miles, et al.
Pubblicazione: (2025)
di: Wang, Miles, et al.
Pubblicazione: (2025)
Dense Backpropagation Improves Training for Sparse Mixture-of-Experts
di: Panda, Ashwinee, et al.
Pubblicazione: (2025)
di: Panda, Ashwinee, et al.
Pubblicazione: (2025)
The Devil in the Details: Emergent Misalignment, Format and Coherence in Open-Weights LLMs
di: Dickson, Craig
Pubblicazione: (2025)
di: Dickson, Craig
Pubblicazione: (2025)
The Master Key Hypothesis: Unlocking Cross-Model Capability Transfer via Linear Subspace Alignment
di: Balasubramanian, Rishab, et al.
Pubblicazione: (2026)
di: Balasubramanian, Rishab, et al.
Pubblicazione: (2026)
Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs
di: Betley, Jan, et al.
Pubblicazione: (2025)
di: Betley, Jan, et al.
Pubblicazione: (2025)
Privacy Auditing of Large Language Models
di: Panda, Ashwinee, et al.
Pubblicazione: (2025)
di: Panda, Ashwinee, et al.
Pubblicazione: (2025)
Distilling Linearized Behavior into Non-Linear Fine-Tuning for Effective Task Arithmetic
di: Sommariva, Thomas, et al.
Pubblicazione: (2026)
di: Sommariva, Thomas, et al.
Pubblicazione: (2026)
On the Emergence of Cross-Task Linearity in the Pretraining-Finetuning Paradigm
di: Zhou, Zhanpeng, et al.
Pubblicazione: (2024)
di: Zhou, Zhanpeng, et al.
Pubblicazione: (2024)
ROGUE: Misaligned Agent Behavior Arising from Ordinary Computer Use
di: Tien, Jeremy, et al.
Pubblicazione: (2026)
di: Tien, Jeremy, et al.
Pubblicazione: (2026)
Emergent Misalignment is Easy, Narrow Misalignment is Hard
di: Soligo, Anna, et al.
Pubblicazione: (2026)
di: Soligo, Anna, et al.
Pubblicazione: (2026)
QMP: Q-switch Mixture of Policies for Multi-Task Behavior Sharing
di: Zhang, Grace, et al.
Pubblicazione: (2023)
di: Zhang, Grace, et al.
Pubblicazione: (2023)
SALT: Steering Activations towards Leakage-free Thinking in Chain of Thought
di: Batra, Shourya, et al.
Pubblicazione: (2025)
di: Batra, Shourya, et al.
Pubblicazione: (2025)
PASs-MoE: Mitigating Misaligned Co-drift among Router and Experts via Pathway Activation Subspaces for Continual Learning
di: Hou, Zhiyan, et al.
Pubblicazione: (2026)
di: Hou, Zhiyan, et al.
Pubblicazione: (2026)
CoPS: Empowering LLM Agents with Provable Cross-Task Experience Sharing
di: Yang, Chen, et al.
Pubblicazione: (2024)
di: Yang, Chen, et al.
Pubblicazione: (2024)
Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs
di: Giordani, Jeremiah
Pubblicazione: (2025)
di: Giordani, Jeremiah
Pubblicazione: (2025)
Moloch's Bargain: Emergent Misalignment When LLMs Compete for Audiences
di: El, Batu, et al.
Pubblicazione: (2025)
di: El, Batu, et al.
Pubblicazione: (2025)
Teach LLMs to Phish: Stealing Private Information from Language Models
di: Panda, Ashwinee, et al.
Pubblicazione: (2024)
di: Panda, Ashwinee, et al.
Pubblicazione: (2024)
Overtrained, Not Misaligned
di: Schreiber, Joel, et al.
Pubblicazione: (2026)
di: Schreiber, Joel, et al.
Pubblicazione: (2026)
Characterizing the Consistency of the Emergent Misalignment Persona
di: Weckauff, Anietta, et al.
Pubblicazione: (2026)
di: Weckauff, Anietta, et al.
Pubblicazione: (2026)
Gemstones: A Model Suite for Multi-Faceted Scaling Laws
di: McLeish, Sean, et al.
Pubblicazione: (2025)
di: McLeish, Sean, et al.
Pubblicazione: (2025)
BLOCK-EM: Preventing Emergent Misalignment via Latent Blocking
di: Ustaomeroglu, Muhammed, et al.
Pubblicazione: (2026)
di: Ustaomeroglu, Muhammed, et al.
Pubblicazione: (2026)
The Latent Color Subspace: Emergent Order in High-Dimensional Chaos
di: Pach, Mateusz, et al.
Pubblicazione: (2026)
di: Pach, Mateusz, et al.
Pubblicazione: (2026)
Documenti analoghi
-
LoRI: Reducing Cross-Task Interference in Multi-Task Low-Rank Adaptation
di: Zhang, Juzheng, et al.
Pubblicazione: (2025) -
Decomposing Behavioral Phase Transitions in LLMs: Order Parameters for Emergent Misalignment
di: Arnold, Julian, et al.
Pubblicazione: (2025) -
Convergent Linear Representations of Emergent Misalignment
di: Soligo, Anna, et al.
Pubblicazione: (2025) -
A New Linear Scaling Rule for Private Adaptive Hyperparameter Optimization
di: Panda, Ashwinee, et al.
Pubblicazione: (2022) -
Model Organisms for Emergent Misalignment
di: Turner, Edward, et al.
Pubblicazione: (2025)