Language Models are Homer Simpson! Safety Re-Alignment of Fine-tuned Language Models through Task Arithmetic
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Bhardwaj, Rishabh, Anh, Do Duc, Poria, Soujanya |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Towards Robust Instruction Tuning on Multimodal Large Language Models
von: Han, Wei, et al.
Veröffentlicht: (2024)
von: Han, Wei, et al.
Veröffentlicht: (2024)
WalledEval: A Comprehensive Safety Evaluation Toolkit for Large Language Models
von: Gupta, Prannaya, et al.
Veröffentlicht: (2024)
von: Gupta, Prannaya, et al.
Veröffentlicht: (2024)
Safety Arithmetic: A Framework for Test-time Safety Alignment of Language Models by Steering Parameters and Activations
von: Hazra, Rima, et al.
Veröffentlicht: (2024)
von: Hazra, Rima, et al.
Veröffentlicht: (2024)
DELLA-Merging: Reducing Interference in Model Merging through Magnitude-Based Sampling
von: Deep, Pala Tej, et al.
Veröffentlicht: (2024)
von: Deep, Pala Tej, et al.
Veröffentlicht: (2024)
Large Language Models for Automated Open-domain Scientific Hypotheses Discovery
von: Yang, Zonglin, et al.
Veröffentlicht: (2023)
von: Yang, Zonglin, et al.
Veröffentlicht: (2023)
Post Reasoning: Improving the Performance of Non-Thinking Models at No Cost
von: Xuan, Richmond Sin Jing, et al.
Veröffentlicht: (2026)
von: Xuan, Richmond Sin Jing, et al.
Veröffentlicht: (2026)
Federated Fine-tuning of Large Language Models under Heterogeneous Tasks and Client Resources
von: Bai, Jiamu, et al.
Veröffentlicht: (2024)
von: Bai, Jiamu, et al.
Veröffentlicht: (2024)
Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision
von: Pala, Tej Deep, et al.
Veröffentlicht: (2025)
von: Pala, Tej Deep, et al.
Veröffentlicht: (2025)
Stacked from One: Multi-Scale Self-Injection for Context Window Extension
von: Han, Wei, et al.
Veröffentlicht: (2026)
von: Han, Wei, et al.
Veröffentlicht: (2026)
Fundamental Safety-Capability Trade-offs in Fine-tuning Large Language Models
von: Chen, Pin-Yu, et al.
Veröffentlicht: (2025)
von: Chen, Pin-Yu, et al.
Veröffentlicht: (2025)
Semi-supervised Fine-tuning for Large Language Models
von: Luo, Junyu, et al.
Veröffentlicht: (2024)
von: Luo, Junyu, et al.
Veröffentlicht: (2024)
Ruby Teaming: Improving Quality Diversity Search with Memory for Automated Red Teaming
von: Han, Vernon Toh Yan, et al.
Veröffentlicht: (2024)
von: Han, Vernon Toh Yan, et al.
Veröffentlicht: (2024)
Bias Vector: Mitigating Biases in Language Models with Task Arithmetic Approach
von: Shirafuji, Daiki, et al.
Veröffentlicht: (2024)
von: Shirafuji, Daiki, et al.
Veröffentlicht: (2024)
Fine-tuning Transformer-based Encoder for Turkish Language Understanding Tasks
von: Yildirim, Savas
Veröffentlicht: (2024)
von: Yildirim, Savas
Veröffentlicht: (2024)
Language Models Do Hard Arithmetic Tasks Easily and Hardly Do Easy Arithmetic Tasks
von: Gambardella, Andrew, et al.
Veröffentlicht: (2024)
von: Gambardella, Andrew, et al.
Veröffentlicht: (2024)
Plug-in and Fine-tuning: Bridging the Gap between Small Language Models and Large Language Models
von: Kim, Kyeonghyun, et al.
Veröffentlicht: (2025)
von: Kim, Kyeonghyun, et al.
Veröffentlicht: (2025)
Small Language Models Fine-tuned to Coordinate Larger Language Models improve Complex Reasoning
von: Juneja, Gurusha, et al.
Veröffentlicht: (2023)
von: Juneja, Gurusha, et al.
Veröffentlicht: (2023)
Advancing Single and Multi-task Text Classification through Large Language Model Fine-tuning
von: Zhao, Hang, et al.
Veröffentlicht: (2024)
von: Zhao, Hang, et al.
Veröffentlicht: (2024)
Sensitivity of Small Language Models to Fine-tuning Data Contamination
von: Scaria, Nicy, et al.
Veröffentlicht: (2025)
von: Scaria, Nicy, et al.
Veröffentlicht: (2025)
Toward Robust Multimodal Learning using Multimodal Foundational Models
von: Zhao, Xianbing, et al.
Veröffentlicht: (2024)
von: Zhao, Xianbing, et al.
Veröffentlicht: (2024)
Exploring Memorization in Fine-tuned Language Models
von: Zeng, Shenglai, et al.
Veröffentlicht: (2023)
von: Zeng, Shenglai, et al.
Veröffentlicht: (2023)
SC-Phi2: A Fine-tuned Small Language Model for StarCraft II Macromanagement Tasks
von: Khan, Muhammad Junaid, et al.
Veröffentlicht: (2024)
von: Khan, Muhammad Junaid, et al.
Veröffentlicht: (2024)
Self-Adaptive Sampling for Efficient Video Question-Answering on Image--Text Models
von: Han, Wei, et al.
Veröffentlicht: (2023)
von: Han, Wei, et al.
Veröffentlicht: (2023)
MOOSE-Chem: Large Language Models for Rediscovering Unseen Chemistry Scientific Hypotheses
von: Yang, Zonglin, et al.
Veröffentlicht: (2024)
von: Yang, Zonglin, et al.
Veröffentlicht: (2024)
Can-Do! A Dataset and Neuro-Symbolic Grounded Framework for Embodied Planning with Large Multimodal Models
von: Chia, Yew Ken, et al.
Veröffentlicht: (2024)
von: Chia, Yew Ken, et al.
Veröffentlicht: (2024)
KnowTuning: Knowledge-aware Fine-tuning for Large Language Models
von: Lyu, Yougang, et al.
Veröffentlicht: (2024)
von: Lyu, Yougang, et al.
Veröffentlicht: (2024)
Progtuning: Progressive Fine-tuning Framework for Transformer-based Language Models
von: Ji, Xiaoshuang, et al.
Veröffentlicht: (2025)
von: Ji, Xiaoshuang, et al.
Veröffentlicht: (2025)
JudgeLM: Fine-tuned Large Language Models are Scalable Judges
von: Zhu, Lianghui, et al.
Veröffentlicht: (2023)
von: Zhu, Lianghui, et al.
Veröffentlicht: (2023)
Dhati+: Fine-tuned Large Language Models for Arabic Subjectivity Evaluation
von: Bellaouar, Slimane, et al.
Veröffentlicht: (2025)
von: Bellaouar, Slimane, et al.
Veröffentlicht: (2025)
Compositional Subspace Representation Fine-tuning for Adaptive Large Language Models
von: Zhou, Andy
Veröffentlicht: (2025)
von: Zhou, Andy
Veröffentlicht: (2025)
OffTopicEval: When Large Language Models Enter the Wrong Chat, Almost Always!
von: Lei, Jingdi, et al.
Veröffentlicht: (2025)
von: Lei, Jingdi, et al.
Veröffentlicht: (2025)
Task Arithmetic for Language Expansion in Speech Translation
von: Cheng, Yao-Fei, et al.
Veröffentlicht: (2024)
von: Cheng, Yao-Fei, et al.
Veröffentlicht: (2024)
Fine-tuning Language Models with Generative Adversarial Reward Modelling
von: Yu, Zhang Ze, et al.
Veröffentlicht: (2023)
von: Yu, Zhang Ze, et al.
Veröffentlicht: (2023)
Safety-Aware Fine-Tuning of Large Language Models
von: Choi, Hyeong Kyu, et al.
Veröffentlicht: (2024)
von: Choi, Hyeong Kyu, et al.
Veröffentlicht: (2024)
Using Large Language Models for education managements in Vietnamese with low resources
von: Minh, Duc Do, et al.
Veröffentlicht: (2025)
von: Minh, Duc Do, et al.
Veröffentlicht: (2025)
Probing for Arithmetic Errors in Language Models
von: Sun, Yucheng, et al.
Veröffentlicht: (2025)
von: Sun, Yucheng, et al.
Veröffentlicht: (2025)
Two are better than one: Context window extension with multi-grained self-injection
von: Han, Wei, et al.
Veröffentlicht: (2024)
von: Han, Wei, et al.
Veröffentlicht: (2024)
Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
von: Wang, Yibo, et al.
Veröffentlicht: (2025)
von: Wang, Yibo, et al.
Veröffentlicht: (2025)
Information Guided Regularization for Fine-tuning Language Models
von: Sharma, Mandar, et al.
Veröffentlicht: (2024)
von: Sharma, Mandar, et al.
Veröffentlicht: (2024)
SafeMERGE: Preserving Safety Alignment in Fine-Tuned Large Language Models via Selective Layer-Wise Model Merging
von: Djuhera, Aladin, et al.
Veröffentlicht: (2025)
von: Djuhera, Aladin, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Towards Robust Instruction Tuning on Multimodal Large Language Models
von: Han, Wei, et al.
Veröffentlicht: (2024) -
WalledEval: A Comprehensive Safety Evaluation Toolkit for Large Language Models
von: Gupta, Prannaya, et al.
Veröffentlicht: (2024) -
Safety Arithmetic: A Framework for Test-time Safety Alignment of Language Models by Steering Parameters and Activations
von: Hazra, Rima, et al.
Veröffentlicht: (2024) -
DELLA-Merging: Reducing Interference in Model Merging through Magnitude-Based Sampling
von: Deep, Pala Tej, et al.
Veröffentlicht: (2024) -
Large Language Models for Automated Open-domain Scientific Hypotheses Discovery
von: Yang, Zonglin, et al.
Veröffentlicht: (2023)