Safeguard Fine-Tuned LLMs Through Pre- and Post-Tuning Model Merging
Fuente:
arXiv
Saved in:
| Main Authors: | Farn, Hua, Su, Hsuan, Kumar, Shachi H, Sahay, Saurav, Chen, Shang-Tse, Lee, Hung-yi |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Task Arithmetic can Mitigate Synthetic-to-Real Gap in Automatic Speech Recognition
by: Su, Hsuan, et al.
Published: (2024)
by: Su, Hsuan, et al.
Published: (2024)
Decoding Biases: Automated Methods and LLM Judges for Gender Bias Detection in Language Models
by: Kumar, Shachi H, et al.
Published: (2024)
by: Kumar, Shachi H, et al.
Published: (2024)
Speech-FT: Merging Pre-trained And Fine-Tuned Speech Representation Models For Cross-Task Generalization
by: Lin, Tzu-Quan, et al.
Published: (2025)
by: Lin, Tzu-Quan, et al.
Published: (2025)
Systematic Analysis for Pretrained Language Model Priming for Parameter-Efficient Fine-tuning
by: Huang, Shih-Cheng, et al.
Published: (2022)
by: Huang, Shih-Cheng, et al.
Published: (2022)
Tracking Universal Features Through Fine-Tuning and Model Merging
by: Horn, Niels, et al.
Published: (2024)
by: Horn, Niels, et al.
Published: (2024)
Mitigating Forgetting in LLM Fine-Tuning via Low-Perplexity Token Learning
by: Wu, Chao-Chung, et al.
Published: (2025)
by: Wu, Chao-Chung, et al.
Published: (2025)
TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
by: Tseng, Liang-Hsuan, et al.
Published: (2026)
by: Tseng, Liang-Hsuan, et al.
Published: (2026)
Accidental Vulnerability: Factors in Fine-Tuning that Shift Model Safeguards
by: Pandey, Punya Syon, et al.
Published: (2025)
by: Pandey, Punya Syon, et al.
Published: (2025)
Extend Model Merging from Fine-Tuned to Pre-Trained Large Language Models via Weight Disentanglement
by: Yu, Le, et al.
Published: (2024)
by: Yu, Le, et al.
Published: (2024)
DogeRM: Equipping Reward Models with Domain Knowledge through Model Merging
by: Lin, Tzu-Han, et al.
Published: (2024)
by: Lin, Tzu-Han, et al.
Published: (2024)
Pseudo2Real: Task Arithmetic for Pseudo-Label Correction in Automatic Speech Recognition
by: Lin, Yi-Cheng, et al.
Published: (2025)
by: Lin, Yi-Cheng, et al.
Published: (2025)
Non-instructional Fine-tuning: Enabling Instruction-Following Capabilities in Pre-trained Language Models without Instruction-Following Data
by: Xie, Juncheng, et al.
Published: (2024)
by: Xie, Juncheng, et al.
Published: (2024)
Merging Facts, Crafting Fallacies: Evaluating the Contradictory Nature of Aggregated Factual Claims in Long-Form Generations
by: Chiang, Cheng-Han, et al.
Published: (2024)
by: Chiang, Cheng-Han, et al.
Published: (2024)
Eliciting Harmful Capabilities by Fine-Tuning On Safeguarded Outputs
by: Kaunismaa, Jackson, et al.
Published: (2026)
by: Kaunismaa, Jackson, et al.
Published: (2026)
QEFT: Quantization for Efficient Fine-Tuning of LLMs
by: Lee, Changhun, et al.
Published: (2024)
by: Lee, Changhun, et al.
Published: (2024)
Unleashing the Reasoning Potential of Pre-trained LLMs by Critique Fine-Tuning on One Problem
by: Wang, Yubo, et al.
Published: (2025)
by: Wang, Yubo, et al.
Published: (2025)
GIFT: Guided Fine-Tuning and Transfer for Enhancing Instruction-Tuned Language Models
by: Ruan, Zhiwen, et al.
Published: (2026)
by: Ruan, Zhiwen, et al.
Published: (2026)
Fine-Tuning Language Models on Multiple Datasets for Citation Intention Classification
by: Shui, Zeren, et al.
Published: (2024)
by: Shui, Zeren, et al.
Published: (2024)
CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
by: Yi, Biao, et al.
Published: (2025)
by: Yi, Biao, et al.
Published: (2025)
Balancing Continuous Pre-Training and Instruction Fine-Tuning: Optimizing Instruction-Following in LLMs
by: Jindal, Ishan, et al.
Published: (2024)
by: Jindal, Ishan, et al.
Published: (2024)
Can LLMs Understand the Implication of Emphasized Sentences in Dialogue?
by: Lin, Guan-Ting, et al.
Published: (2024)
by: Lin, Guan-Ting, et al.
Published: (2024)
Prompt-Based One-Shot Exact Length-Controlled Generation with LLMs
by: Xie, Juncheng, et al.
Published: (2025)
by: Xie, Juncheng, et al.
Published: (2025)
Fine-Tuned LLMs are "Time Capsules" for Tracking Societal Bias Through Books
by: Madhusudan, Sangmitra, et al.
Published: (2025)
by: Madhusudan, Sangmitra, et al.
Published: (2025)
Transferring Textual Preferences to Vision-Language Understanding through Model Merging
by: Li, Chen-An, et al.
Published: (2025)
by: Li, Chen-An, et al.
Published: (2025)
LLMem: Estimating GPU Memory Usage for Fine-Tuning Pre-Trained LLMs
by: Kim, Taeho, et al.
Published: (2024)
by: Kim, Taeho, et al.
Published: (2024)
Jailbreaking with Universal Multi-Prompts
by: Hsu, Yu-Ling, et al.
Published: (2025)
by: Hsu, Yu-Ling, et al.
Published: (2025)
Anchored Supervised Fine-Tuning
by: Zhu, He, et al.
Published: (2025)
by: Zhu, He, et al.
Published: (2025)
Upcycling Instruction Tuning from Dense to Mixture-of-Experts via Parameter Merging
by: Hui, Tingfeng, et al.
Published: (2024)
by: Hui, Tingfeng, et al.
Published: (2024)
HFT: Half Fine-Tuning for Large Language Models
by: Hui, Tingfeng, et al.
Published: (2024)
by: Hui, Tingfeng, et al.
Published: (2024)
Team Trifecta at Factify5WQA: Setting the Standard in Fact Verification with Fine-Tuning
by: Chiang, Shang-Hsuan, et al.
Published: (2024)
by: Chiang, Shang-Hsuan, et al.
Published: (2024)
Recovering the Pre-Fine-Tuning Weights of Generative Models
by: Horwitz, Eliahu, et al.
Published: (2024)
by: Horwitz, Eliahu, et al.
Published: (2024)
Fine-Tuning Pre-Trained Code Models for AI-Generated Code Detection
by: Ispas, Jany-Gabriel, et al.
Published: (2026)
by: Ispas, Jany-Gabriel, et al.
Published: (2026)
Learning Mechanism Underlying NLP Pre-Training and Fine-Tuning
by: Tzach, Yarden, et al.
Published: (2025)
by: Tzach, Yarden, et al.
Published: (2025)
Phased Instruction Fine-Tuning for Large Language Models
by: Pang, Wei, et al.
Published: (2024)
by: Pang, Wei, et al.
Published: (2024)
Augmented Fine-Tuned LLMs for Enhanced Recruitment Automation
by: Younes, Mohamed T., et al.
Published: (2025)
by: Younes, Mohamed T., et al.
Published: (2025)
Merging Triggers, Breaking Backdoors: Defensive Poisoning for Instruction-Tuned Language Models
by: Kim, San, et al.
Published: (2026)
by: Kim, San, et al.
Published: (2026)
Direct Alignment of Draft Model for Speculative Decoding with Chat-Fine-Tuned LLMs
by: Goel, Raghavv, et al.
Published: (2024)
by: Goel, Raghavv, et al.
Published: (2024)
TRACT: Regression-Aware Fine-tuning Meets Chain-of-Thought Reasoning for LLM-as-a-Judge
by: Chiang, Cheng-Han, et al.
Published: (2025)
by: Chiang, Cheng-Han, et al.
Published: (2025)
InstructionCP: A fast approach to transfer Large Language Models into target language
by: Chen, Kuang-Ming, et al.
Published: (2024)
by: Chen, Kuang-Ming, et al.
Published: (2024)
Fine-Tuning Pre-trained Language Models to Detect In-Game Trash Talks
by: Fesalbon, Daniel, et al.
Published: (2024)
by: Fesalbon, Daniel, et al.
Published: (2024)
Similar Items
-
Task Arithmetic can Mitigate Synthetic-to-Real Gap in Automatic Speech Recognition
by: Su, Hsuan, et al.
Published: (2024) -
Decoding Biases: Automated Methods and LLM Judges for Gender Bias Detection in Language Models
by: Kumar, Shachi H, et al.
Published: (2024) -
Speech-FT: Merging Pre-trained And Fine-Tuned Speech Representation Models For Cross-Task Generalization
by: Lin, Tzu-Quan, et al.
Published: (2025) -
Systematic Analysis for Pretrained Language Model Priming for Parameter-Efficient Fine-tuning
by: Huang, Shih-Cheng, et al.
Published: (2022) -
Tracking Universal Features Through Fine-Tuning and Model Merging
by: Horn, Niels, et al.
Published: (2024)