Do as I do (Safely): Mitigating Task-Specific Fine-tuning Risks in Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Eiras, Francisco, Petrov, Aleksandar, Torr, Philip H. S., Kumar, M. Pawan, Bibi, Adel |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
When Do Prompting and Prefix-Tuning Work? A Theory of Capabilities and Limitations
von: Petrov, Aleksandar, et al.
Veröffentlicht: (2023)
von: Petrov, Aleksandar, et al.
Veröffentlicht: (2023)
Universal In-Context Approximation By Prompting Fully Recurrent Models
von: Petrov, Aleksandar, et al.
Veröffentlicht: (2024)
von: Petrov, Aleksandar, et al.
Veröffentlicht: (2024)
Prompting a Pretrained Transformer Can Be a Universal Approximator
von: Petrov, Aleksandar, et al.
Veröffentlicht: (2024)
von: Petrov, Aleksandar, et al.
Veröffentlicht: (2024)
Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models
von: Zhang, Wenxuan, et al.
Veröffentlicht: (2024)
von: Zhang, Wenxuan, et al.
Veröffentlicht: (2024)
Efficient Error Certification for Physics-Informed Neural Networks
von: Eiras, Francisco, et al.
Veröffentlicht: (2023)
von: Eiras, Francisco, et al.
Veröffentlicht: (2023)
On the Coexistence and Ensembling of Watermarks
von: Petrov, Aleksandar, et al.
Veröffentlicht: (2025)
von: Petrov, Aleksandar, et al.
Veröffentlicht: (2025)
Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
von: Alssum, Lama, et al.
Veröffentlicht: (2025)
von: Alssum, Lama, et al.
Veröffentlicht: (2025)
Segment, Select, Correct: A Framework for Weakly-Supervised Referring Segmentation
von: Eiras, Francisco, et al.
Veröffentlicht: (2023)
von: Eiras, Francisco, et al.
Veröffentlicht: (2023)
Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
von: Wang, Yibo, et al.
Veröffentlicht: (2025)
von: Wang, Yibo, et al.
Veröffentlicht: (2025)
Federated Fine-tuning of Large Language Models under Heterogeneous Tasks and Client Resources
von: Bai, Jiamu, et al.
Veröffentlicht: (2024)
von: Bai, Jiamu, et al.
Veröffentlicht: (2024)
EpilepsyLLM: Domain-Specific Large Language Model Fine-tuned with Epilepsy Medical Knowledge
von: Zhao, Xuyang, et al.
Veröffentlicht: (2024)
von: Zhao, Xuyang, et al.
Veröffentlicht: (2024)
AIDE: Attribute-Guided MultI-Hop Data Expansion for Data Scarcity in Task-Specific Fine-tuning
von: Li, Jiayu, et al.
Veröffentlicht: (2024)
von: Li, Jiayu, et al.
Veröffentlicht: (2024)
Rethinking Safety in LLM Fine-tuning: An Optimization Perspective
von: Kim, Minseon, et al.
Veröffentlicht: (2025)
von: Kim, Minseon, et al.
Veröffentlicht: (2025)
Fine-tuning Large Language Models with Sequential Instructions
von: Hu, Hanxu, et al.
Veröffentlicht: (2024)
von: Hu, Hanxu, et al.
Veröffentlicht: (2024)
Sparse Matrix in Large Language Model Fine-tuning
von: He, Haoze, et al.
Veröffentlicht: (2024)
von: He, Haoze, et al.
Veröffentlicht: (2024)
What Makes and Breaks Safety Fine-tuning? A Mechanistic Study
von: Jain, Samyak, et al.
Veröffentlicht: (2024)
von: Jain, Samyak, et al.
Veröffentlicht: (2024)
CRE-LLM: A Domain-Specific Chinese Relation Extraction Framework with Fine-tuned Large Language Model
von: Shi, Zhengpeng, et al.
Veröffentlicht: (2024)
von: Shi, Zhengpeng, et al.
Veröffentlicht: (2024)
Model Merging and Safety Alignment: One Bad Model Spoils the Bunch
von: Hammoud, Hasan Abed Al Kader, et al.
Veröffentlicht: (2024)
von: Hammoud, Hasan Abed Al Kader, et al.
Veröffentlicht: (2024)
Assessing and Mitigating Data Memorization Risks in Fine-Tuned Large Language Models
von: Ramakrishnan, Badrinath, et al.
Veröffentlicht: (2025)
von: Ramakrishnan, Badrinath, et al.
Veröffentlicht: (2025)
No "Zero-Shot" Without Exponential Data: Pretraining Concept Frequency Determines Multimodal Model Performance
von: Udandarao, Vishaal, et al.
Veröffentlicht: (2024)
von: Udandarao, Vishaal, et al.
Veröffentlicht: (2024)
Semi-supervised Fine-tuning for Large Language Models
von: Luo, Junyu, et al.
Veröffentlicht: (2024)
von: Luo, Junyu, et al.
Veröffentlicht: (2024)
Dial-insight: Fine-tuning Large Language Models with High-Quality Domain-Specific Data Preventing Capability Collapse
von: Sun, Jianwei, et al.
Veröffentlicht: (2024)
von: Sun, Jianwei, et al.
Veröffentlicht: (2024)
BiasBusters: Uncovering and Mitigating Tool Selection Bias in Large Language Models
von: Blankenstein, Thierry, et al.
Veröffentlicht: (2025)
von: Blankenstein, Thierry, et al.
Veröffentlicht: (2025)
Towards Interpretable Sequence Continuation: Analyzing Shared Circuits in Large Language Models
von: Lan, Michael, et al.
Veröffentlicht: (2023)
von: Lan, Michael, et al.
Veröffentlicht: (2023)
From Superficial Patterns to Semantic Understanding: Fine-Tuning Language Models on Contrast Sets
von: Petrov, Daniel
Veröffentlicht: (2025)
von: Petrov, Daniel
Veröffentlicht: (2025)
Can Large Language Model Agents Simulate Human Trust Behavior?
von: Xie, Chengxing, et al.
Veröffentlicht: (2024)
von: Xie, Chengxing, et al.
Veröffentlicht: (2024)
Beyond Linear Probes: Dynamic Safety Monitoring for Language Models
von: Oldfield, James, et al.
Veröffentlicht: (2025)
von: Oldfield, James, et al.
Veröffentlicht: (2025)
Full Parameter Fine-tuning for Large Language Models with Limited Resources
von: Lv, Kai, et al.
Veröffentlicht: (2023)
von: Lv, Kai, et al.
Veröffentlicht: (2023)
Detecting Bias in Large Language Models: Fine-tuned KcBERT
von: Lee, J. K., et al.
Veröffentlicht: (2024)
von: Lee, J. K., et al.
Veröffentlicht: (2024)
Range Algebra for Safe Array Splits
von: Perisic, Aleksandar
Veröffentlicht: (2014)
von: Perisic, Aleksandar
Veröffentlicht: (2014)
Mixture of Experts Made Intrinsically Interpretable
von: Yang, Xingyi, et al.
Veröffentlicht: (2025)
von: Yang, Xingyi, et al.
Veröffentlicht: (2025)
Exploring the Limits of Pruning: Task-Specific Neurons, Model Collapse, and Recovery in Task-Specific Large Language Models
von: Siam, M. K. Khalidi, et al.
Veröffentlicht: (2026)
von: Siam, M. K. Khalidi, et al.
Veröffentlicht: (2026)
Birbal: An efficient 7B instruct-model fine-tuned with curated datasets
von: Jindal, Ashvini Kumar, et al.
Veröffentlicht: (2024)
von: Jindal, Ashvini Kumar, et al.
Veröffentlicht: (2024)
Vision-Language Models Do Not Understand Negation
von: Alhamoud, Kumail, et al.
Veröffentlicht: (2025)
von: Alhamoud, Kumail, et al.
Veröffentlicht: (2025)
Fine-tuning Large Language Models for Improving Factuality in Legal Question Answering
von: Hu, Yinghao, et al.
Veröffentlicht: (2025)
von: Hu, Yinghao, et al.
Veröffentlicht: (2025)
Democratizing Large Language Models via Personalized Parameter-Efficient Fine-tuning
von: Tan, Zhaoxuan, et al.
Veröffentlicht: (2024)
von: Tan, Zhaoxuan, et al.
Veröffentlicht: (2024)
Step-by-Step Unmasking for Parameter-Efficient Fine-tuning of Large Language Models
von: Agarwal, Aradhye, et al.
Veröffentlicht: (2024)
von: Agarwal, Aradhye, et al.
Veröffentlicht: (2024)
Dynamic Adaptation of LoRA Fine-Tuning for Efficient and Task-Specific Optimization of Large Language Models
von: Liao, Xiaoxuan, et al.
Veröffentlicht: (2025)
von: Liao, Xiaoxuan, et al.
Veröffentlicht: (2025)
Do Multilingual Large Language Models Mitigate Stereotype Bias?
von: Nie, Shangrui, et al.
Veröffentlicht: (2024)
von: Nie, Shangrui, et al.
Veröffentlicht: (2024)
KnowTuning: Knowledge-aware Fine-tuning for Large Language Models
von: Lyu, Yougang, et al.
Veröffentlicht: (2024)
von: Lyu, Yougang, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
When Do Prompting and Prefix-Tuning Work? A Theory of Capabilities and Limitations
von: Petrov, Aleksandar, et al.
Veröffentlicht: (2023) -
Universal In-Context Approximation By Prompting Fully Recurrent Models
von: Petrov, Aleksandar, et al.
Veröffentlicht: (2024) -
Prompting a Pretrained Transformer Can Be a Universal Approximator
von: Petrov, Aleksandar, et al.
Veröffentlicht: (2024) -
Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models
von: Zhang, Wenxuan, et al.
Veröffentlicht: (2024) -
Efficient Error Certification for Physics-Informed Neural Networks
von: Eiras, Francisco, et al.
Veröffentlicht: (2023)