MEUV: Achieving Fine-Grained Capability Activation in Large Language Models via Mutually Exclusive Unlock Vectors
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tong, Xin, Lin, Zhi, Wang, Jingya, Han, Meng, Jin, Bo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
par: Yi, Biao, et autres
Publié: (2025)
par: Yi, Biao, et autres
Publié: (2025)
Eguard: Defending LLM Embeddings Against Inversion Attacks via Text Mutual Information Optimization
par: Liu, Tiantian, et autres
Publié: (2024)
par: Liu, Tiantian, et autres
Publié: (2024)
Fingerprint Vector: Enabling Scalable and Efficient Model Fingerprint Transfer via Vector Addition
par: Xu, Zhenhua, et autres
Publié: (2024)
par: Xu, Zhenhua, et autres
Publié: (2024)
Privacy-Preserving Parameter-Efficient Fine-Tuning for Large Language Model Services
par: Li, Yansong, et autres
Publié: (2023)
par: Li, Yansong, et autres
Publié: (2023)
EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
par: Wu, Jialin, et autres
Publié: (2025)
par: Wu, Jialin, et autres
Publié: (2025)
Can Reinforcement Learning Unlock the Hidden Dangers in Aligned Large Language Models?
par: Karkevandi, Mohammad Bahrami, et autres
Publié: (2024)
par: Karkevandi, Mohammad Bahrami, et autres
Publié: (2024)
Bileve: Securing Text Provenance in Large Language Models Against Spoofing with Bi-level Signature
par: Zhou, Tong, et autres
Publié: (2024)
par: Zhou, Tong, et autres
Publié: (2024)
Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors
par: Yin, Rui, et autres
Publié: (2026)
par: Yin, Rui, et autres
Publié: (2026)
Confidence Elicitation: A New Attack Vector for Large Language Models
par: Formento, Brian, et autres
Publié: (2025)
par: Formento, Brian, et autres
Publié: (2025)
BadActs: A Universal Backdoor Defense in the Activation Space
par: Yi, Biao, et autres
Publié: (2024)
par: Yi, Biao, et autres
Publié: (2024)
Quantifying Association Capabilities of Large Language Models and Its Implications on Privacy Leakage
par: Shao, Hanyin, et autres
Publié: (2023)
par: Shao, Hanyin, et autres
Publié: (2023)
InfoFlood: Jailbreaking Large Language Models with Information Overload
par: Yadav, Advait, et autres
Publié: (2025)
par: Yadav, Advait, et autres
Publié: (2025)
LMO-DP: Optimizing the Randomization Mechanism for Differentially Private Fine-Tuning (Large) Language Models
par: Yang, Qin, et autres
Publié: (2024)
par: Yang, Qin, et autres
Publié: (2024)
Unlocking the Effectiveness of LoRA-FP for Seamless Transfer Implantation of Fingerprints in Downstream Models
par: Xu, Zhenhua, et autres
Publié: (2025)
par: Xu, Zhenhua, et autres
Publié: (2025)
Trojan Activation Attack: Red-Teaming Large Language Models using Activation Steering for Safety-Alignment
par: Wang, Haoran, et autres
Publié: (2023)
par: Wang, Haoran, et autres
Publié: (2023)
ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models
par: Zhao, Yunhan, et autres
Publié: (2026)
par: Zhao, Yunhan, et autres
Publié: (2026)
Resource Consumption Red-Teaming for Large Vision-Language Models
par: Gao, Haoran, et autres
Publié: (2025)
par: Gao, Haoran, et autres
Publié: (2025)
GenBreak: Red Teaming Text-to-Image Generators Using Large Language Models
par: Wang, Zilong, et autres
Publié: (2025)
par: Wang, Zilong, et autres
Publié: (2025)
Safely Learning with Private Data: A Federated Learning Framework for Large Language Model
par: Zheng, JiaYing, et autres
Publié: (2024)
par: Zheng, JiaYing, et autres
Publié: (2024)
Lightweight Yet Secure: Secure Scripting Language Generation via Lightweight LLMs
par: Zhang, Keyang, et autres
Publié: (2026)
par: Zhang, Keyang, et autres
Publié: (2026)
Practical Membership Inference Attacks against Fine-tuned Large Language Models via Self-prompt Calibration
par: Fu, Wenjie, et autres
Publié: (2023)
par: Fu, Wenjie, et autres
Publié: (2023)
Denial-of-Service Poisoning Attacks against Large Language Models
par: Gao, Kuofeng, et autres
Publié: (2024)
par: Gao, Kuofeng, et autres
Publié: (2024)
Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models
par: Yi, Biao, et autres
Publié: (2025)
par: Yi, Biao, et autres
Publié: (2025)
Understanding and Mitigating Over-refusal for Large Language Models via Safety Representation
par: Zhang, Junbo, et autres
Publié: (2025)
par: Zhang, Junbo, et autres
Publié: (2025)
Private Fine-tuning of Large Language Models with Zeroth-order Optimization
par: Tang, Xinyu, et autres
Publié: (2024)
par: Tang, Xinyu, et autres
Publié: (2024)
Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
par: Yang, Guangyu, et autres
Publié: (2025)
par: Yang, Guangyu, et autres
Publié: (2025)
One Trigger Token Is Enough: A Defense Strategy for Balancing Safety and Usability in Large Language Models
par: Gu, Haoran, et autres
Publié: (2025)
par: Gu, Haoran, et autres
Publié: (2025)
Unlocking Memorization in Large Language Models with Dynamic Soft Prompting
par: Wang, Zhepeng, et autres
Publié: (2024)
par: Wang, Zhepeng, et autres
Publié: (2024)
Sugar-Coated Poison: Benign Generation Unlocks LLM Jailbreaking
par: Wu, Yu-Hang, et autres
Publié: (2025)
par: Wu, Yu-Hang, et autres
Publié: (2025)
Privately Learning from Graphs with Applications in Fine-tuning Large Language Models
par: Yin, Haoteng, et autres
Publié: (2024)
par: Yin, Haoteng, et autres
Publié: (2024)
GoldCoin: Grounding Large Language Models in Privacy Laws via Contextual Integrity Theory
par: Fan, Wei, et autres
Publié: (2024)
par: Fan, Wei, et autres
Publié: (2024)
Analysing the Safety Pitfalls of Steering Vectors
par: Li, Yuxiao, et autres
Publié: (2026)
par: Li, Yuxiao, et autres
Publié: (2026)
SCOUT: A Defense Against Data Poisoning Attacks in Fine-Tuned Language Models
par: Afane, Mohamed, et autres
Publié: (2025)
par: Afane, Mohamed, et autres
Publié: (2025)
StructuralSleight: Automated Jailbreak Attacks on Large Language Models Utilizing Uncommon Text-Organization Structures
par: Li, Bangxin, et autres
Publié: (2024)
par: Li, Bangxin, et autres
Publié: (2024)
Federated Domain-Specific Knowledge Transfer on Large Language Models Using Synthetic Data
par: Li, Haoran, et autres
Publié: (2024)
par: Li, Haoran, et autres
Publié: (2024)
Jailbreak Antidote: Runtime Safety-Utility Balance via Sparse Representation Adjustment in Large Language Models
par: Shen, Guobin, et autres
Publié: (2024)
par: Shen, Guobin, et autres
Publié: (2024)
$PD^3F$: A Pluggable and Dynamic DoS-Defense Framework Against Resource Consumption Attacks Targeting Large Language Models
par: Zhang, Yuanhe, et autres
Publié: (2025)
par: Zhang, Yuanhe, et autres
Publié: (2025)
Window-based Membership Inference Attacks Against Fine-tuned Large Language Models
par: Chen, Yuetian, et autres
Publié: (2026)
par: Chen, Yuetian, et autres
Publié: (2026)
Safety is Not Only About Refusal: Reasoning-Enhanced Fine-tuning for Interpretable LLM Safety
par: Zhang, Yuyou, et autres
Publié: (2025)
par: Zhang, Yuyou, et autres
Publié: (2025)
Copyright Traps for Large Language Models
par: Meeus, Matthieu, et autres
Publié: (2024)
par: Meeus, Matthieu, et autres
Publié: (2024)
Documents similaires
-
CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
par: Yi, Biao, et autres
Publié: (2025) -
Eguard: Defending LLM Embeddings Against Inversion Attacks via Text Mutual Information Optimization
par: Liu, Tiantian, et autres
Publié: (2024) -
Fingerprint Vector: Enabling Scalable and Efficient Model Fingerprint Transfer via Vector Addition
par: Xu, Zhenhua, et autres
Publié: (2024) -
Privacy-Preserving Parameter-Efficient Fine-Tuning for Large Language Model Services
par: Li, Yansong, et autres
Publié: (2023) -
EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
par: Wu, Jialin, et autres
Publié: (2025)