Narrow Fine-Tuning Erodes Safety Alignment in Vision-Language Agents
Fuente:
arXiv
Guardado en:
| Autores principales: | Gulati, Idhant, Raval, Shivam |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs
por: Giordani, Jeremiah
Publicado: (2025)
por: Giordani, Jeremiah
Publicado: (2025)
Intersectional Sycophancy: How Perceived User Demographics Shape False Validation in Large Language Models
por: Maltbie, Benjamin, et al.
Publicado: (2026)
por: Maltbie, Benjamin, et al.
Publicado: (2026)
MoE Lens -- An Expert Is All You Need
por: Chaudhari, Marmik, et al.
Publicado: (2026)
por: Chaudhari, Marmik, et al.
Publicado: (2026)
The Geometry of Alignment Collapse: When Fine-Tuning Breaks Safety
por: Springer, Max, et al.
Publicado: (2026)
por: Springer, Max, et al.
Publicado: (2026)
SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning
por: Hossain, Saad, et al.
Publicado: (2025)
por: Hossain, Saad, et al.
Publicado: (2025)
Caught in the Act: a mechanistic approach to detecting deception
por: Boxo, Gerard, et al.
Publicado: (2025)
por: Boxo, Gerard, et al.
Publicado: (2025)
Linear probes rely on textual evidence: Results from leakage mitigation studies in language models
por: Boxo, Gerard, et al.
Publicado: (2025)
por: Boxo, Gerard, et al.
Publicado: (2025)
The Missing Red Line: How Commercial Pressure Erodes AI Safety Boundaries
por: Petrova, Nora, et al.
Publicado: (2026)
por: Petrova, Nora, et al.
Publicado: (2026)
PREFINE: Preference-Based Implicit Reward and Cost Fine-Tuning for Safety Alignment
por: Verma, Richa, et al.
Publicado: (2026)
por: Verma, Richa, et al.
Publicado: (2026)
H-Probes: Extracting Hierarchical Structures From Latent Representations of Language Models
por: Dawes, Cutter, et al.
Publicado: (2026)
por: Dawes, Cutter, et al.
Publicado: (2026)
Safety-Aware Fine-Tuning of Large Language Models
por: Choi, Hyeong Kyu, et al.
Publicado: (2024)
por: Choi, Hyeong Kyu, et al.
Publicado: (2024)
Safety Alignment for Vision Language Models
por: Liu, Zhendong, et al.
Publicado: (2024)
por: Liu, Zhendong, et al.
Publicado: (2024)
Delta-Crosscoder: Robust Crosscoder Model Diffing in Narrow Fine-Tuning Regimes
por: Kassem, Aly, et al.
Publicado: (2026)
por: Kassem, Aly, et al.
Publicado: (2026)
Efficiency vs. Alignment: Investigating Safety and Fairness Risks in Parameter-Efficient Fine-Tuning of LLMs
por: Taraghi, Mina, et al.
Publicado: (2025)
por: Taraghi, Mina, et al.
Publicado: (2025)
Defending MoE LLMs against Harmful Fine-Tuning via Safety Routing Alignment
por: Kim, Jaehan, et al.
Publicado: (2025)
por: Kim, Jaehan, et al.
Publicado: (2025)
FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies
por: Hu, Xintong, et al.
Publicado: (2026)
por: Hu, Xintong, et al.
Publicado: (2026)
Alignment Dynamics in LLM Fine-Tuning
por: Huang, Yuhan, et al.
Publicado: (2026)
por: Huang, Yuhan, et al.
Publicado: (2026)
SafeMERGE: Preserving Safety Alignment in Fine-Tuned Large Language Models via Selective Layer-Wise Model Merging
por: Djuhera, Aladin, et al.
Publicado: (2025)
por: Djuhera, Aladin, et al.
Publicado: (2025)
Scaling Data Diversity for Fine-Tuning Language Models in Human Alignment
por: Song, Feifan, et al.
Publicado: (2024)
por: Song, Feifan, et al.
Publicado: (2024)
Scaling Up Biomedical Vision-Language Models: Fine-Tuning, Instruction Tuning, and Multi-Modal Learning
por: Peng, Cheng, et al.
Publicado: (2025)
por: Peng, Cheng, et al.
Publicado: (2025)
NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs
por: Pan, Birong, et al.
Publicado: (2025)
por: Pan, Birong, et al.
Publicado: (2025)
Hierarchy-Aware Fine-Tuning of Vision-Language Models
por: Li, Jiayu, et al.
Publicado: (2025)
por: Li, Jiayu, et al.
Publicado: (2025)
Remodeling Semantic Relationships in Vision-Language Fine-Tuning
por: Wu, Xiangyang, et al.
Publicado: (2025)
por: Wu, Xiangyang, et al.
Publicado: (2025)
Understanding and Preserving Safety in Fine-Tuned LLMs
por: Zhang, Jiawen, et al.
Publicado: (2026)
por: Zhang, Jiawen, et al.
Publicado: (2026)
Tuning Vision-Language Models with Candidate Labels by Prompt Alignment
por: Zhang, Zhifang, et al.
Publicado: (2024)
por: Zhang, Zhifang, et al.
Publicado: (2024)
Unraveling and Mitigating Safety Alignment Degradation of Vision-Language Models
por: Liu, Qin, et al.
Publicado: (2024)
por: Liu, Qin, et al.
Publicado: (2024)
Schema on the Inside: A Two-Phase Fine-Tuning Method for High-Efficiency Text-to-SQL at Scale
por: Soni, Chinmay, et al.
Publicado: (2026)
por: Soni, Chinmay, et al.
Publicado: (2026)
FT-Dojo: Towards Autonomous LLM Fine-Tuning with Language Agents
por: Li, Qizheng, et al.
Publicado: (2026)
por: Li, Qizheng, et al.
Publicado: (2026)
Towards Calibrated Robust Fine-Tuning of Vision-Language Models
por: Oh, Changdae, et al.
Publicado: (2023)
por: Oh, Changdae, et al.
Publicado: (2023)
Fine-Tuning Vision-Language Models for Visual Navigation Assistance
por: Li, Xiao, et al.
Publicado: (2025)
por: Li, Xiao, et al.
Publicado: (2025)
Don't Just Fine-tune the Agent, Tune the Environment
por: Lu, Siyuan, et al.
Publicado: (2025)
por: Lu, Siyuan, et al.
Publicado: (2025)
Beyond QA Pairs: Assessing Parameter-Efficient Fine-Tuning for Fact Embedding in LLMs
por: Ratnakar, Shivam, et al.
Publicado: (2025)
por: Ratnakar, Shivam, et al.
Publicado: (2025)
Hierarchical Alignment: Surgical Fine-Tuning via Functional Layer Specialization in Large Language Models
por: Zhang, Yukun, et al.
Publicado: (2025)
por: Zhang, Yukun, et al.
Publicado: (2025)
Self-Mined Hardness for Safety Fine-Tuning
por: Gupta, Prakhar, et al.
Publicado: (2026)
por: Gupta, Prakhar, et al.
Publicado: (2026)
AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models
por: Cui, Yubo, et al.
Publicado: (2026)
por: Cui, Yubo, et al.
Publicado: (2026)
Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining
por: Han, Bing, et al.
Publicado: (2025)
por: Han, Bing, et al.
Publicado: (2025)
SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
por: Zhang, Borong, et al.
Publicado: (2025)
por: Zhang, Borong, et al.
Publicado: (2025)
"Dark Triad" Model Organisms of Misalignment: Narrow Fine-Tuning Mirrors Human Antisocial Behavior
por: Lulla, Roshni, et al.
Publicado: (2026)
por: Lulla, Roshni, et al.
Publicado: (2026)
Language Models are Homer Simpson! Safety Re-Alignment of Fine-tuned Language Models through Task Arithmetic
por: Bhardwaj, Rishabh, et al.
Publicado: (2024)
por: Bhardwaj, Rishabh, et al.
Publicado: (2024)
Decomposed Vision-Language Alignment for Fine-Grained Open-Vocabulary Segmentation
por: Wang, Chenhao, et al.
Publicado: (2026)
por: Wang, Chenhao, et al.
Publicado: (2026)
Ejemplares similares
-
Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs
por: Giordani, Jeremiah
Publicado: (2025) -
Intersectional Sycophancy: How Perceived User Demographics Shape False Validation in Large Language Models
por: Maltbie, Benjamin, et al.
Publicado: (2026) -
MoE Lens -- An Expert Is All You Need
por: Chaudhari, Marmik, et al.
Publicado: (2026) -
The Geometry of Alignment Collapse: When Fine-Tuning Breaks Safety
por: Springer, Max, et al.
Publicado: (2026) -
SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning
por: Hossain, Saad, et al.
Publicado: (2025)