Gradient Surgery for Safe LLM Fine-Tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Yi, Biao, Li, Jiahao, Zhang, Baolei, Nie, Lihai, Li, Tong, Huang, Tiansheng, Liu, Zheli |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
di: Yi, Biao, et al.
Pubblicazione: (2025)
di: Yi, Biao, et al.
Pubblicazione: (2025)
BadReasoner: Planting Tunable Overthinking Backdoors into Large Reasoning Models for Fun or Profit
di: Yi, Biao, et al.
Pubblicazione: (2025)
di: Yi, Biao, et al.
Pubblicazione: (2025)
Prompt-Guided Internal States for Hallucination Detection of Large Language Models
di: Zhang, Fujie, et al.
Pubblicazione: (2024)
di: Zhang, Fujie, et al.
Pubblicazione: (2024)
BadActs: A Universal Backdoor Defense in the Activation Space
di: Yi, Biao, et al.
Pubblicazione: (2024)
di: Yi, Biao, et al.
Pubblicazione: (2024)
Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models
di: Yi, Biao, et al.
Pubblicazione: (2025)
di: Yi, Biao, et al.
Pubblicazione: (2025)
Who Taught the Lie? Responsibility Attribution for Poisoned Knowledge in Retrieval-Augmented Generation
di: Zhang, Baolei, et al.
Pubblicazione: (2025)
di: Zhang, Baolei, et al.
Pubblicazione: (2025)
Hiding in Plain Sight: A Steganographic Approach to Stealthy LLM Jailbreaks
di: Geng, Jianing, et al.
Pubblicazione: (2025)
di: Geng, Jianing, et al.
Pubblicazione: (2025)
Practical Poisoning Attacks against Retrieval-Augmented Generation
di: Zhang, Baolei, et al.
Pubblicazione: (2025)
di: Zhang, Baolei, et al.
Pubblicazione: (2025)
Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
Token-level Data Selection for Safe LLM Fine-tuning
di: Li, Yanping, et al.
Pubblicazione: (2026)
di: Li, Yanping, et al.
Pubblicazione: (2026)
Practical Framework for Privacy-Preserving and Byzantine-robust Federated Learning
di: Zhang, Baolei, et al.
Pubblicazione: (2025)
di: Zhang, Baolei, et al.
Pubblicazione: (2025)
Benchmarking Poisoning Attacks against Retrieval-Augmented Generation
di: Zhang, Baolei, et al.
Pubblicazione: (2025)
di: Zhang, Baolei, et al.
Pubblicazione: (2025)
Beyond LoRA vs. Full Fine-Tuning: Gradient-Guided Optimizer Routing for LLM Adaptation
di: Tang, Haozhan, et al.
Pubblicazione: (2026)
di: Tang, Haozhan, et al.
Pubblicazione: (2026)
Your Semantic-Independent Watermark is Fragile: A Semantic Perturbation Attack against EaaS Watermark
di: Fei, Zekun, et al.
Pubblicazione: (2024)
di: Fei, Zekun, et al.
Pubblicazione: (2024)
Detection Method for Prompt Injection by Integrating Pre-trained Model and Heuristic Feature Engineering
di: Ji, Yi, et al.
Pubblicazione: (2025)
di: Ji, Yi, et al.
Pubblicazione: (2025)
I Learn Better If You Speak My Language: Understanding the Superior Performance of Fine-Tuning Large Language Models with LLM-Generated Responses
di: Ren, Xuan, et al.
Pubblicazione: (2024)
di: Ren, Xuan, et al.
Pubblicazione: (2024)
LLM-TOPLA: Efficient LLM Ensemble by Maximising Diversity
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2024)
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2024)
Intention-Adaptive LLM Fine-Tuning for Text Revision Generation
di: Liu, Zhexiong, et al.
Pubblicazione: (2026)
di: Liu, Zhexiong, et al.
Pubblicazione: (2026)
HiFT: A Hierarchical Full Parameter Fine-Tuning Strategy
di: Liu, Yongkang, et al.
Pubblicazione: (2024)
di: Liu, Yongkang, et al.
Pubblicazione: (2024)
A Survey on Data Selection for LLM Instruction Tuning
di: Zhang, Bolin, et al.
Pubblicazione: (2024)
di: Zhang, Bolin, et al.
Pubblicazione: (2024)
Traceback of Poisoning Attacks to Retrieval-Augmented Generation
di: Zhang, Baolei, et al.
Pubblicazione: (2025)
di: Zhang, Baolei, et al.
Pubblicazione: (2025)
Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking
di: Dai, Ziqi, et al.
Pubblicazione: (2025)
di: Dai, Ziqi, et al.
Pubblicazione: (2025)
Propulsion: Steering LLM with Tiny Fine-Tuning
di: Kowsher, Md, et al.
Pubblicazione: (2024)
di: Kowsher, Md, et al.
Pubblicazione: (2024)
From Instance Selection to Fixed-Pool Data Recipe Search for Supervised Fine-Tuning
di: Wu, Haodong, et al.
Pubblicazione: (2026)
di: Wu, Haodong, et al.
Pubblicazione: (2026)
From Personal to Collective: On the Role of Local and Global Memory in LLM Personalization
di: Wang, Zehong, et al.
Pubblicazione: (2025)
di: Wang, Zehong, et al.
Pubblicazione: (2025)
Selection of LLM Fine-Tuning Data based on Orthogonal Rules
di: Li, Xiaomin, et al.
Pubblicazione: (2024)
di: Li, Xiaomin, et al.
Pubblicazione: (2024)
From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery
di: Zhang, Lingzhe, et al.
Pubblicazione: (2026)
di: Zhang, Lingzhe, et al.
Pubblicazione: (2026)
Revisiting Zeroth-Order Optimization for Memory-Efficient LLM Fine-Tuning: A Benchmark
di: Zhang, Yihua, et al.
Pubblicazione: (2024)
di: Zhang, Yihua, et al.
Pubblicazione: (2024)
InstructDiff: Domain-Adaptive Data Selection via Differential Entropy for Efficient LLM Fine-Tuning
di: Su, Junyou, et al.
Pubblicazione: (2026)
di: Su, Junyou, et al.
Pubblicazione: (2026)
PokeLLMon: A Human-Parity Agent for Pokemon Battles with Large Language Models
di: Hu, Sihao, et al.
Pubblicazione: (2024)
di: Hu, Sihao, et al.
Pubblicazione: (2024)
From Tags to Trees: Structuring Fine-Grained Knowledge for Controllable Data Selection in LLM Instruction Tuning
di: Niu, Zihan, et al.
Pubblicazione: (2026)
di: Niu, Zihan, et al.
Pubblicazione: (2026)
System Report for CCL25-Eval Task 10: SRAG-MAV for Fine-Grained Chinese Hate Speech Recognition
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
Know the Unknown: An Uncertainty-Sensitive Method for LLM Instruction Tuning
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
Directional Gradient Projection for Robust Fine-Tuning of Foundation Models
di: Huang, Chengyue, et al.
Pubblicazione: (2025)
di: Huang, Chengyue, et al.
Pubblicazione: (2025)
Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
di: Wang, Yibo, et al.
Pubblicazione: (2025)
di: Wang, Yibo, et al.
Pubblicazione: (2025)
Towards Better Understanding of Contrastive Sentence Representation Learning: A Unified Paradigm for Gradient
di: Li, Mingxin, et al.
Pubblicazione: (2024)
di: Li, Mingxin, et al.
Pubblicazione: (2024)
Token Cleaning: Fine-Grained Data Selection for LLM Supervised Fine-Tuning
di: Pang, Jinlong, et al.
Pubblicazione: (2025)
di: Pang, Jinlong, et al.
Pubblicazione: (2025)
LUNE: Efficient LLM Unlearning via LoRA Fine-Tuning with Negative Examples
di: Liu, Yezi, et al.
Pubblicazione: (2025)
di: Liu, Yezi, et al.
Pubblicazione: (2025)
GradPruner: Gradient-Guided Layer Pruning Enabling Efficient Fine-Tuning and Inference for LLMs
di: Huang, Wei, et al.
Pubblicazione: (2026)
di: Huang, Wei, et al.
Pubblicazione: (2026)
Documenti analoghi
-
CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
di: Yi, Biao, et al.
Pubblicazione: (2025) -
BadReasoner: Planting Tunable Overthinking Backdoors into Large Reasoning Models for Fun or Profit
di: Yi, Biao, et al.
Pubblicazione: (2025) -
Prompt-Guided Internal States for Hallucination Detection of Large Language Models
di: Zhang, Fujie, et al.
Pubblicazione: (2024) -
BadActs: A Universal Backdoor Defense in the Activation Space
di: Yi, Biao, et al.
Pubblicazione: (2024) -
Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models
di: Yi, Biao, et al.
Pubblicazione: (2025)