Separate the Wheat from the Chaff: A Post-Hoc Approach to Safety Re-Alignment for Fine-Tuned Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Di, Lu, Xin, Zhao, Yanyan, Qin, Bing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules
di: Wu, Di, et al.
Pubblicazione: (2026)
di: Wu, Di, et al.
Pubblicazione: (2026)
Separate the Wheat from the Chaff: Model Deficiency Unlearning via Parameter-Efficient Module Operation
di: Hu, Xinshuo, et al.
Pubblicazione: (2023)
di: Hu, Xinshuo, et al.
Pubblicazione: (2023)
Towards Comprehensive Post Safety Alignment of Large Language Models via Safety Patching
di: Zhao, Weixiang, et al.
Pubblicazione: (2024)
di: Zhao, Weixiang, et al.
Pubblicazione: (2024)
Separating the Wheat from the Chaff: Understanding (In-)Completeness of Proof Mechanisms for Separation Logic with Inductive Definitions
di: Elad, Neta, et al.
Pubblicazione: (2025)
di: Elad, Neta, et al.
Pubblicazione: (2025)
Separate the Wheat from the Chaff: Winnowing Down Divergent Views in Retrieval Augmented Generation
di: Wang, Song, et al.
Pubblicazione: (2025)
di: Wang, Song, et al.
Pubblicazione: (2025)
Separating the Wheat from the Chaff
di: Hörner, Johannes, et al.
Pubblicazione: (2026)
di: Hörner, Johannes, et al.
Pubblicazione: (2026)
Beware of Your Po! Measuring and Mitigating AI Safety Risks in Role-Play Fine-Tuning of LLMs
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models
di: Ding, Yi, et al.
Pubblicazione: (2025)
di: Ding, Yi, et al.
Pubblicazione: (2025)
Improving the Downstream Performance of Mixture-of-Experts Transformers via Weak Vanilla Transformers
di: Lu, Xin, et al.
Pubblicazione: (2024)
di: Lu, Xin, et al.
Pubblicazione: (2024)
How does Architecture Influence the Base Capabilities of Pre-trained Language Models? A Case Study Based on FFN-Wider and MoE Transformers
di: Lu, Xin, et al.
Pubblicazione: (2024)
di: Lu, Xin, et al.
Pubblicazione: (2024)
How Does Sequence Modeling Architecture Influence Base Capabilities of Pre-trained Language Models? Exploring Key Architecture Design Principles to Avoid Base Capabilities Degradation
di: Lu, Xin, et al.
Pubblicazione: (2025)
di: Lu, Xin, et al.
Pubblicazione: (2025)
MPO: Multilingual Safety Alignment via Reward Gap Optimization
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
Teaching Language Models to Evolve with Users: Dynamic Profile Modeling for Personalized Alignment
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs
di: Giordani, Jeremiah
Pubblicazione: (2025)
di: Giordani, Jeremiah
Pubblicazione: (2025)
Language Models are Homer Simpson! Safety Re-Alignment of Fine-tuned Language Models through Task Arithmetic
di: Bhardwaj, Rishabh, et al.
Pubblicazione: (2024)
di: Bhardwaj, Rishabh, et al.
Pubblicazione: (2024)
Separating the Wheat from the Chaff: Internet Quality.
di: Skov, Annette
Pubblicazione: (1998)
di: Skov, Annette
Pubblicazione: (1998)
Fine-Tuning Language Models for Ethical Ambiguity: A Comparative Study of Alignment with Human Responses
di: Senthilkumar, Pranav, et al.
Pubblicazione: (2024)
di: Senthilkumar, Pranav, et al.
Pubblicazione: (2024)
DeepSight: Bridging Depth Maps and Language with a Depth-Driven Multimodal Model
di: Yang, Hao, et al.
Pubblicazione: (2026)
di: Yang, Hao, et al.
Pubblicazione: (2026)
Decomposition-Enhanced Training for Post-Hoc Attributions In Language Models
di: Balasubramanian, Sriram, et al.
Pubblicazione: (2025)
di: Balasubramanian, Sriram, et al.
Pubblicazione: (2025)
Safety-Aware Fine-Tuning of Large Language Models
di: Choi, Hyeong Kyu, et al.
Pubblicazione: (2024)
di: Choi, Hyeong Kyu, et al.
Pubblicazione: (2024)
Toward Secure Tuning: Mitigating Security Risks from Instruction Fine-Tuning
di: Du, Yanrui, et al.
Pubblicazione: (2024)
di: Du, Yanrui, et al.
Pubblicazione: (2024)
NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning
di: Yi, Xin, et al.
Pubblicazione: (2024)
di: Yi, Xin, et al.
Pubblicazione: (2024)
RKLD: Reverse KL-Divergence-based Knowledge Distillation for Unlearning Personal Information in Large Language Models
di: Wang, Bichen, et al.
Pubblicazione: (2024)
di: Wang, Bichen, et al.
Pubblicazione: (2024)
GR-SAP: Generative Replay for Safety Alignment Preservation during Fine-Tuning
di: Fang, Zhouxiang, et al.
Pubblicazione: (2026)
di: Fang, Zhouxiang, et al.
Pubblicazione: (2026)
How Good is Post-Hoc Watermarking With Language Model Rephrasing?
di: Fernandez, Pierre, et al.
Pubblicazione: (2025)
di: Fernandez, Pierre, et al.
Pubblicazione: (2025)
LangGPS: Language Separability Guided Data Pre-Selection for Joint Multilingual Instruction Tuning
di: Ye, Yangfan, et al.
Pubblicazione: (2025)
di: Ye, Yangfan, et al.
Pubblicazione: (2025)
SafeMERGE: Preserving Safety Alignment in Fine-Tuned Large Language Models via Selective Layer-Wise Model Merging
di: Djuhera, Aladin, et al.
Pubblicazione: (2025)
di: Djuhera, Aladin, et al.
Pubblicazione: (2025)
Safety Alignment of Large Language Models via Contrasting Safe and Harmful Distributions
di: Zhang, Xiaoyun, et al.
Pubblicazione: (2024)
di: Zhang, Xiaoyun, et al.
Pubblicazione: (2024)
EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
di: Wu, Jialin, et al.
Pubblicazione: (2025)
di: Wu, Jialin, et al.
Pubblicazione: (2025)
Scaling Data Diversity for Fine-Tuning Language Models in Human Alignment
di: Song, Feifan, et al.
Pubblicazione: (2024)
di: Song, Feifan, et al.
Pubblicazione: (2024)
Lifelong Safety Alignment for Language Models
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
Safeguard Fine-Tuned LLMs Through Pre- and Post-Tuning Model Merging
di: Farn, Hua, et al.
Pubblicazione: (2024)
di: Farn, Hua, et al.
Pubblicazione: (2024)
Rethinking Experience Utilization in Self-Evolving Language Model Agents
di: Zhao, Weixiang, et al.
Pubblicazione: (2026)
di: Zhao, Weixiang, et al.
Pubblicazione: (2026)
Enhancing Non-English Capabilities of English-Centric Large Language Models through Deep Supervision Fine-Tuning
di: Huo, Wenshuai, et al.
Pubblicazione: (2025)
di: Huo, Wenshuai, et al.
Pubblicazione: (2025)
LegiLM: A Fine-Tuned Legal Language Model for Data Compliance
di: Zhu, Linkai, et al.
Pubblicazione: (2024)
di: Zhu, Linkai, et al.
Pubblicazione: (2024)
AlignTune: Modular Toolkit for Post-Training Alignment of Large Language Models
di: Lyngkhoi, R E Zera Marveen, et al.
Pubblicazione: (2026)
di: Lyngkhoi, R E Zera Marveen, et al.
Pubblicazione: (2026)
EdgeFlowerTune: Evaluating Federated LLM Fine-Tuning Under Realistic Edge System Constraints
di: Geng, Jiaxiang, et al.
Pubblicazione: (2026)
di: Geng, Jiaxiang, et al.
Pubblicazione: (2026)
ReFT: Reasoning with Reinforced Fine-Tuning
di: Luong, Trung Quoc, et al.
Pubblicazione: (2024)
di: Luong, Trung Quoc, et al.
Pubblicazione: (2024)
Large Language Model Agents Are Not Always Faithful Self-Evolvers
di: Zhao, Weixiang, et al.
Pubblicazione: (2026)
di: Zhao, Weixiang, et al.
Pubblicazione: (2026)
Self-AMPLIFY: Improving Small Language Models with Self Post Hoc Explanations
di: Bhan, Milan, et al.
Pubblicazione: (2024)
di: Bhan, Milan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules
di: Wu, Di, et al.
Pubblicazione: (2026) -
Separate the Wheat from the Chaff: Model Deficiency Unlearning via Parameter-Efficient Module Operation
di: Hu, Xinshuo, et al.
Pubblicazione: (2023) -
Towards Comprehensive Post Safety Alignment of Large Language Models via Safety Patching
di: Zhao, Weixiang, et al.
Pubblicazione: (2024) -
Separating the Wheat from the Chaff: Understanding (In-)Completeness of Proof Mechanisms for Separation Logic with Inductive Definitions
di: Elad, Neta, et al.
Pubblicazione: (2025) -
Separate the Wheat from the Chaff: Winnowing Down Divergent Views in Retrieval Augmented Generation
di: Wang, Song, et al.
Pubblicazione: (2025)