Guardado en:
| Autores principales: | Arturi, Daniel Aarao Reis, Zhang, Eric, Ansah, Andrew, Zhu, Kevin, Panda, Ashwinee, Balwani, Aishwarya |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2511.02022 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LoRI: Reducing Cross-Task Interference in Multi-Task Low-Rank Adaptation
por: Zhang, Juzheng, et al.
Publicado: (2025)
por: Zhang, Juzheng, et al.
Publicado: (2025)
Decomposing Behavioral Phase Transitions in LLMs: Order Parameters for Emergent Misalignment
por: Arnold, Julian, et al.
Publicado: (2025)
por: Arnold, Julian, et al.
Publicado: (2025)
Convergent Linear Representations of Emergent Misalignment
por: Soligo, Anna, et al.
Publicado: (2025)
por: Soligo, Anna, et al.
Publicado: (2025)
A New Linear Scaling Rule for Private Adaptive Hyperparameter Optimization
por: Panda, Ashwinee, et al.
Publicado: (2022)
por: Panda, Ashwinee, et al.
Publicado: (2022)
Model Organisms for Emergent Misalignment
por: Turner, Edward, et al.
Publicado: (2025)
por: Turner, Edward, et al.
Publicado: (2025)
Amortized Latent Steering: Low-Cost Alternative to Test-Time Optimization
por: Egbuna, Nathan, et al.
Publicado: (2025)
por: Egbuna, Nathan, et al.
Publicado: (2025)
Speculating Experts Accelerates Inference for Mixture-of-Experts
por: Madan, Vivan, et al.
Publicado: (2026)
por: Madan, Vivan, et al.
Publicado: (2026)
Peek-a-Boo Reasoning: Contrastive Region Masking in MLLMs
por: Chaturvedi, Isha, et al.
Publicado: (2025)
por: Chaturvedi, Isha, et al.
Publicado: (2025)
Alignment-Constrained Dynamic Pruning for LLMs: Identifying and Preserving Alignment-Critical Circuits
por: Patel, Dev, et al.
Publicado: (2025)
por: Patel, Dev, et al.
Publicado: (2025)
Understanding Emergent Misalignment via Feature Superposition Geometry
por: Minegishi, Gouki, et al.
Publicado: (2026)
por: Minegishi, Gouki, et al.
Publicado: (2026)
In-Training Defenses against Emergent Misalignment in Language Models
por: Kaczér, David, et al.
Publicado: (2025)
por: Kaczér, David, et al.
Publicado: (2025)
FRIT: Using Causal Importance to Improve Chain-of-Thought Faithfulness
por: Swaroop, Anand, et al.
Publicado: (2025)
por: Swaroop, Anand, et al.
Publicado: (2025)
Persona-Model Collapse in Emergent Misalignment
por: Costa, Davi Bastos, et al.
Publicado: (2026)
por: Costa, Davi Bastos, et al.
Publicado: (2026)
CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing
por: Wang, Yixuan, et al.
Publicado: (2025)
por: Wang, Yixuan, et al.
Publicado: (2025)
Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models
por: Chua, James, et al.
Publicado: (2025)
por: Chua, James, et al.
Publicado: (2025)
Privacy Auditing of Large Language Models
por: Panda, Ashwinee, et al.
Publicado: (2025)
por: Panda, Ashwinee, et al.
Publicado: (2025)
Dense Backpropagation Improves Training for Sparse Mixture-of-Experts
por: Panda, Ashwinee, et al.
Publicado: (2025)
por: Panda, Ashwinee, et al.
Publicado: (2025)
From Narrow Unlearning to Emergent Misalignment: Causes, Consequences, and Containment in LLMs
por: Mushtaq, Erum, et al.
Publicado: (2025)
por: Mushtaq, Erum, et al.
Publicado: (2025)
Persona Features Control Emergent Misalignment
por: Wang, Miles, et al.
Publicado: (2025)
por: Wang, Miles, et al.
Publicado: (2025)
Shared Lexical Task Representations Explain Behavioral Variability In LLMs
por: Yang, Zhuonan, et al.
Publicado: (2026)
por: Yang, Zhuonan, et al.
Publicado: (2026)
SALT: Steering Activations towards Leakage-free Thinking in Chain of Thought
por: Batra, Shourya, et al.
Publicado: (2025)
por: Batra, Shourya, et al.
Publicado: (2025)
Emergent and Subliminal Misalignment Through the Lens of Data-Mediated Transfer
por: Askin, Baris, et al.
Publicado: (2026)
por: Askin, Baris, et al.
Publicado: (2026)
Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs
por: Betley, Jan, et al.
Publicado: (2025)
por: Betley, Jan, et al.
Publicado: (2025)
Teach LLMs to Phish: Stealing Private Information from Language Models
por: Panda, Ashwinee, et al.
Publicado: (2024)
por: Panda, Ashwinee, et al.
Publicado: (2024)
The Devil in the Details: Emergent Misalignment, Format and Coherence in Open-Weights LLMs
por: Dickson, Craig
Publicado: (2025)
por: Dickson, Craig
Publicado: (2025)
The Master Key Hypothesis: Unlocking Cross-Model Capability Transfer via Linear Subspace Alignment
por: Balasubramanian, Rishab, et al.
Publicado: (2026)
por: Balasubramanian, Rishab, et al.
Publicado: (2026)
Distilling Linearized Behavior into Non-Linear Fine-Tuning for Effective Task Arithmetic
por: Sommariva, Thomas, et al.
Publicado: (2026)
por: Sommariva, Thomas, et al.
Publicado: (2026)
Gemstones: A Model Suite for Multi-Faceted Scaling Laws
por: McLeish, Sean, et al.
Publicado: (2025)
por: McLeish, Sean, et al.
Publicado: (2025)
Moloch's Bargain: Emergent Misalignment When LLMs Compete for Audiences
por: El, Batu, et al.
Publicado: (2025)
por: El, Batu, et al.
Publicado: (2025)
Emergent Misalignment is Easy, Narrow Misalignment is Hard
por: Soligo, Anna, et al.
Publicado: (2026)
por: Soligo, Anna, et al.
Publicado: (2026)
Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs
por: Giordani, Jeremiah
Publicado: (2025)
por: Giordani, Jeremiah
Publicado: (2025)
ROGUE: Misaligned Agent Behavior Arising from Ordinary Computer Use
por: Tien, Jeremy, et al.
Publicado: (2026)
por: Tien, Jeremy, et al.
Publicado: (2026)
On the Emergence of Cross-Task Linearity in the Pretraining-Finetuning Paradigm
por: Zhou, Zhanpeng, et al.
Publicado: (2024)
por: Zhou, Zhanpeng, et al.
Publicado: (2024)
QMP: Q-switch Mixture of Policies for Multi-Task Behavior Sharing
por: Zhang, Grace, et al.
Publicado: (2023)
por: Zhang, Grace, et al.
Publicado: (2023)
PASs-MoE: Mitigating Misaligned Co-drift among Router and Experts via Pathway Activation Subspaces for Continual Learning
por: Hou, Zhiyan, et al.
Publicado: (2026)
por: Hou, Zhiyan, et al.
Publicado: (2026)
BLOCK-EM: Preventing Emergent Misalignment via Latent Blocking
por: Ustaomeroglu, Muhammed, et al.
Publicado: (2026)
por: Ustaomeroglu, Muhammed, et al.
Publicado: (2026)
CoPS: Empowering LLM Agents with Provable Cross-Task Experience Sharing
por: Yang, Chen, et al.
Publicado: (2024)
por: Yang, Chen, et al.
Publicado: (2024)
Overtrained, Not Misaligned
por: Schreiber, Joel, et al.
Publicado: (2026)
por: Schreiber, Joel, et al.
Publicado: (2026)
The Latent Color Subspace: Emergent Order in High-Dimensional Chaos
por: Pach, Mateusz, et al.
Publicado: (2026)
por: Pach, Mateusz, et al.
Publicado: (2026)
Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion
por: Mistretta, Marco, et al.
Publicado: (2025)
por: Mistretta, Marco, et al.
Publicado: (2025)
Ejemplares similares
-
LoRI: Reducing Cross-Task Interference in Multi-Task Low-Rank Adaptation
por: Zhang, Juzheng, et al.
Publicado: (2025) -
Decomposing Behavioral Phase Transitions in LLMs: Order Parameters for Emergent Misalignment
por: Arnold, Julian, et al.
Publicado: (2025) -
Convergent Linear Representations of Emergent Misalignment
por: Soligo, Anna, et al.
Publicado: (2025) -
A New Linear Scaling Rule for Private Adaptive Hyperparameter Optimization
por: Panda, Ashwinee, et al.
Publicado: (2022) -
Model Organisms for Emergent Misalignment
por: Turner, Edward, et al.
Publicado: (2025)