Colluding LoRA: A Compositional Vulnerability in LLM Safety Alignment
Fuente:
arXiv
Salvato in:
| Autore principale: | Ding, Sihao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LoRAShield: Data-Free Editing Alignment for Secure Personalized LoRA Sharing
di: Chen, Jiahao, et al.
Pubblicazione: (2025)
di: Chen, Jiahao, et al.
Pubblicazione: (2025)
ZKLoRA: Efficient Zero-Knowledge Proofs for LoRA Verification
di: Roy, Bidhan, et al.
Pubblicazione: (2025)
di: Roy, Bidhan, et al.
Pubblicazione: (2025)
Private LoRA Fine-tuning of Open-Source LLMs with Homomorphic Encryption
di: Frery, Jordan, et al.
Pubblicazione: (2025)
di: Frery, Jordan, et al.
Pubblicazione: (2025)
Improving LoRA in Privacy-preserving Federated Learning
di: Sun, Youbang, et al.
Pubblicazione: (2024)
di: Sun, Youbang, et al.
Pubblicazione: (2024)
LoBAM: LoRA-Based Backdoor Attack on Model Merging
di: Yin, Ming, et al.
Pubblicazione: (2024)
di: Yin, Ming, et al.
Pubblicazione: (2024)
Leaner Training, Lower Leakage: Revisiting Memorization in LLM Fine-Tuning with LoRA
di: Wang, Fei, et al.
Pubblicazione: (2025)
di: Wang, Fei, et al.
Pubblicazione: (2025)
MOLM: Mixture of LoRA Markers
di: Fares, Samar, et al.
Pubblicazione: (2025)
di: Fares, Samar, et al.
Pubblicazione: (2025)
Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment
di: Li, Yuxi, et al.
Pubblicazione: (2024)
di: Li, Yuxi, et al.
Pubblicazione: (2024)
Promoting Data and Model Privacy in Federated Learning through Quantized LoRA
di: Zhu, JianHao, et al.
Pubblicazione: (2024)
di: Zhu, JianHao, et al.
Pubblicazione: (2024)
Weight space Detection of Backdoors in LoRA Adapters
di: Merenciano, David Puertolas, et al.
Pubblicazione: (2026)
di: Merenciano, David Puertolas, et al.
Pubblicazione: (2026)
LoRAGuard: An Effective Black-box Watermarking Approach for LoRAs
di: Lv, Peizhuo, et al.
Pubblicazione: (2025)
di: Lv, Peizhuo, et al.
Pubblicazione: (2025)
Rapid LoRA Aggregation for Wireless Channel Adaptation in Open-Set Radio Frequency Fingerprinting
di: Zhang, Mingxi, et al.
Pubblicazione: (2026)
di: Zhang, Mingxi, et al.
Pubblicazione: (2026)
Pencil: Private and Extensible Collaborative Learning without the Non-Colluding Assumption
di: Liu, Xuanqi, et al.
Pubblicazione: (2024)
di: Liu, Xuanqi, et al.
Pubblicazione: (2024)
LoREnc: Low-Rank Encryption for Securing Foundation Models and LoRA Adapters
di: Ahn, Beomjin, et al.
Pubblicazione: (2026)
di: Ahn, Beomjin, et al.
Pubblicazione: (2026)
Risks When Sharing LoRA Fine-Tuned Diffusion Model Weights
di: Yao, Dixi
Pubblicazione: (2024)
di: Yao, Dixi
Pubblicazione: (2024)
Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
LoRA-Key: User-Centric LoRA Watermarking for Text-to-Image Diffusion Models
di: Wang, Yaopeng, et al.
Pubblicazione: (2026)
di: Wang, Yaopeng, et al.
Pubblicazione: (2026)
LoRA as Oracle
di: Arazzi, Marco, et al.
Pubblicazione: (2026)
di: Arazzi, Marco, et al.
Pubblicazione: (2026)
Improving LLM Safety Alignment with Dual-Objective Optimization
di: Zhao, Xuandong, et al.
Pubblicazione: (2025)
di: Zhao, Xuandong, et al.
Pubblicazione: (2025)
AuthenLoRA: Entangling Stylization with Imperceptible Watermarks for Copyright-Secure LoRA Adapters
di: Shi, Fangming, et al.
Pubblicazione: (2025)
di: Shi, Fangming, et al.
Pubblicazione: (2025)
Attention Eclipse: Manipulating Attention to Bypass LLM Safety-Alignment
di: Zaree, Pedram, et al.
Pubblicazione: (2025)
di: Zaree, Pedram, et al.
Pubblicazione: (2025)
A Systematic Study of Code Obfuscation Against LLM-based Vulnerability Detection
di: Li, Xiao, et al.
Pubblicazione: (2025)
di: Li, Xiao, et al.
Pubblicazione: (2025)
EASE: Practical and Efficient Safety Alignment for Small Language Models
di: Shi, Haonan, et al.
Pubblicazione: (2025)
di: Shi, Haonan, et al.
Pubblicazione: (2025)
Dissecting the Black Box: Circuit-Level Analysis of LLM Vulnerability Detection
di: Atiiq, Syafiq Al, et al.
Pubblicazione: (2026)
di: Atiiq, Syafiq Al, et al.
Pubblicazione: (2026)
Insights and Current Gaps in Open-Source LLM Vulnerability Scanners: A Comparative Analysis
di: Brokman, Jonathan, et al.
Pubblicazione: (2024)
di: Brokman, Jonathan, et al.
Pubblicazione: (2024)
deepSURF: Detecting Memory Safety Vulnerabilities in Rust Through Fuzzing LLM-Augmented Harnesses
di: Androutsopoulos, Georgios, et al.
Pubblicazione: (2025)
di: Androutsopoulos, Georgios, et al.
Pubblicazione: (2025)
SHE-LoRA: Selective Homomorphic Encryption for Federated Tuning with Heterogeneous LoRA
di: Liu, Jianmin, et al.
Pubblicazione: (2025)
di: Liu, Jianmin, et al.
Pubblicazione: (2025)
Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift
di: Yuan, Shuai, et al.
Pubblicazione: (2025)
di: Yuan, Shuai, et al.
Pubblicazione: (2025)
MELT: A Behavioral Trace Dataset for High-Risk Memecoin Launch Detection
di: Hu, Sihao, et al.
Pubblicazione: (2026)
di: Hu, Sihao, et al.
Pubblicazione: (2026)
AquaLoRA: Toward White-box Protection for Customized Stable Diffusion Models via Watermark LoRA
di: Feng, Weitao, et al.
Pubblicazione: (2024)
di: Feng, Weitao, et al.
Pubblicazione: (2024)
NeST: Neuron Selective Tuning for LLM Safety
di: Behrouzi, Sasha, et al.
Pubblicazione: (2026)
di: Behrouzi, Sasha, et al.
Pubblicazione: (2026)
LoRA-Leak: Membership Inference Attacks Against LoRA Fine-tuned Language Models
di: Ran, Delong, et al.
Pubblicazione: (2025)
di: Ran, Delong, et al.
Pubblicazione: (2025)
MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment
di: Halloran, John
Pubblicazione: (2025)
di: Halloran, John
Pubblicazione: (2025)
LLM Security and Safety: Insights from Homotopy-Inspired Prompt Obfuscation
di: Lazo, Luis, et al.
Pubblicazione: (2026)
di: Lazo, Luis, et al.
Pubblicazione: (2026)
Know Thy Judge: On the Robustness Meta-Evaluation of LLM Safety Judges
di: Eiras, Francisco, et al.
Pubblicazione: (2025)
di: Eiras, Francisco, et al.
Pubblicazione: (2025)
HumorReject: Decoupling LLM Safety from Refusal Prefix via A Little Humor
di: Wu, Zihui, et al.
Pubblicazione: (2025)
di: Wu, Zihui, et al.
Pubblicazione: (2025)
N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety Evaluator
di: Lin, Zheyu, et al.
Pubblicazione: (2025)
di: Lin, Zheyu, et al.
Pubblicazione: (2025)
Differentiated Directional Intervention A Framework for Evading LLM Safety Alignment
di: Zhang, Peng, et al.
Pubblicazione: (2025)
di: Zhang, Peng, et al.
Pubblicazione: (2025)
In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement
di: Shetty, Anudeex, et al.
Pubblicazione: (2026)
di: Shetty, Anudeex, et al.
Pubblicazione: (2026)
Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets
di: Hsiung, Lei, et al.
Pubblicazione: (2025)
di: Hsiung, Lei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
LoRAShield: Data-Free Editing Alignment for Secure Personalized LoRA Sharing
di: Chen, Jiahao, et al.
Pubblicazione: (2025) -
ZKLoRA: Efficient Zero-Knowledge Proofs for LoRA Verification
di: Roy, Bidhan, et al.
Pubblicazione: (2025) -
Private LoRA Fine-tuning of Open-Source LLMs with Homomorphic Encryption
di: Frery, Jordan, et al.
Pubblicazione: (2025) -
Improving LoRA in Privacy-preserving Federated Learning
di: Sun, Youbang, et al.
Pubblicazione: (2024) -
LoBAM: LoRA-Based Backdoor Attack on Model Merging
di: Yin, Ming, et al.
Pubblicazione: (2024)