Layer-Aware Representation Filtering: Purifying Finetuning Data to Preserve LLM Safety Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Hao, Li, Lijun, Lu, Zhenghao, Wei, Xianyi, Li, Rui, Shao, Jing, Sha, Lei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment
par: Liu, Yuexiao, et autres
Publié: (2025)
par: Liu, Yuexiao, et autres
Publié: (2025)
Be Your Own Red Teamer: Safety Alignment via Self-Play and Reflective Experience Replay
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
Collaborative Shadows: Distributed Backdoor Attacks in LLM-Based Multi-Agent Systems
par: Zhu, Pengyu, et autres
Publié: (2025)
par: Zhu, Pengyu, et autres
Publié: (2025)
Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization
par: Li, Xurui, et autres
Publié: (2025)
par: Li, Xurui, et autres
Publié: (2025)
Safety Layers in Aligned Large Language Models: The Key to LLM Security
par: Li, Shen, et autres
Publié: (2024)
par: Li, Shen, et autres
Publié: (2024)
Safety Context Injection: Inference-Time Safety Alignment via Static Filtering and Agentic Analysis
par: Xu, Zhenhao, et autres
Publié: (2026)
par: Xu, Zhenhao, et autres
Publié: (2026)
Purified and Unified Steganographic Network
par: Li, Guobiao, et autres
Publié: (2024)
par: Li, Guobiao, et autres
Publié: (2024)
Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models
par: Ding, Yi, et autres
Publié: (2025)
par: Ding, Yi, et autres
Publié: (2025)
When Safety Becomes a Vulnerability: Exploiting LLM Alignment Homogeneity for Transferable Blocking in RAG
par: Li, Junchen, et autres
Publié: (2026)
par: Li, Junchen, et autres
Publié: (2026)
GSPR: Aligning LLM Safeguards as Generalizable Safety Policy Reasoners
par: Li, Haoran, et autres
Publié: (2025)
par: Li, Haoran, et autres
Publié: (2025)
Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment
par: Li, Yuxi, et autres
Publié: (2024)
par: Li, Yuxi, et autres
Publié: (2024)
Agent Safety Alignment via Reinforcement Learning
par: Sha, Zeyang, et autres
Publié: (2025)
par: Sha, Zeyang, et autres
Publié: (2025)
Self-adaptive Dataset Construction for Real-World Multimodal Safety Scenarios
par: Qu, Jingen, et autres
Publié: (2025)
par: Qu, Jingen, et autres
Publié: (2025)
GraphAttack: Exploiting Representational Blindspots in LLM Safety Mechanisms
par: He, Sinan, et autres
Publié: (2025)
par: He, Sinan, et autres
Publié: (2025)
Contextual Image Attack: How Visual Context Exposes Multimodal Safety Vulnerabilities
par: Xiong, Yuan, et autres
Publié: (2025)
par: Xiong, Yuan, et autres
Publié: (2025)
Reimagining Safety Alignment with An Image
par: Xia, Yifan, et autres
Publié: (2025)
par: Xia, Yifan, et autres
Publié: (2025)
USCSA: Evolution-Aware Security Analysis for Proxy-Based Upgradeable Smart Contracts
par: Li, Xiaoqi, et autres
Publié: (2025)
par: Li, Xiaoqi, et autres
Publié: (2025)
Adversary-Aware DPO: Enhancing Safety Alignment in Vision Language Models via Adversarial Training
par: Weng, Fenghua, et autres
Publié: (2025)
par: Weng, Fenghua, et autres
Publié: (2025)
Rethinking Fraud Safety Evaluation: Multi-Round Attacks Reveal Safety-Utility Tradeoffs in Graph-Context LLM Defenders
par: Jiang, Laura, et autres
Publié: (2026)
par: Jiang, Laura, et autres
Publié: (2026)
OpenClaw PRISM: A Zero-Fork, Defense-in-Depth Runtime Security Layer for Tool-Augmented LLM Agents
par: Li, Frank
Publié: (2026)
par: Li, Frank
Publié: (2026)
Towards Privacy-Preserving Range Queries with Secure Learned Spatial Index over Encrypted Data
par: Wang, Zuan, et autres
Publié: (2025)
par: Wang, Zuan, et autres
Publié: (2025)
PsySafe: A Comprehensive Framework for Psychological-based Attack, Defense, and Evaluation of Multi-agent System Safety
par: Zhang, Zaibin, et autres
Publié: (2024)
par: Zhang, Zaibin, et autres
Publié: (2024)
FedTDP: A Privacy-Preserving and Unified Framework for Trajectory Data Preparation via Federated Learning
par: Zeng, Zhihao, et autres
Publié: (2025)
par: Zeng, Zhihao, et autres
Publié: (2025)
DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning
par: Zhang, Junbo, et autres
Publié: (2026)
par: Zhang, Junbo, et autres
Publié: (2026)
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
par: Wang, Jiongxiao, et autres
Publié: (2024)
par: Wang, Jiongxiao, et autres
Publié: (2024)
TeleAI-Safety: A comprehensive LLM jailbreaking benchmark towards attacks, defenses, and evaluations
par: Chen, Xiuyuan, et autres
Publié: (2025)
par: Chen, Xiuyuan, et autres
Publié: (2025)
DPBloomfilter: Securing Bloom Filters with Differential Privacy
par: Ke, Yekun, et autres
Publié: (2025)
par: Ke, Yekun, et autres
Publié: (2025)
MTSA: Multi-turn Safety Alignment for LLMs through Multi-round Red-teaming
par: Guo, Weiyang, et autres
Publié: (2025)
par: Guo, Weiyang, et autres
Publié: (2025)
The Communication-Friendly Privacy-Preserving Machine Learning against Malicious Adversaries
par: Lu, Tianpei, et autres
Publié: (2024)
par: Lu, Tianpei, et autres
Publié: (2024)
VisuoAlign: Safety Alignment of LVLMs with Multimodal Tree Search
par: Li, MingSheng, et autres
Publié: (2025)
par: Li, MingSheng, et autres
Publié: (2025)
FreakOut-LLM: The Effect of Emotional Stimuli on Safety Alignment
par: Kuznetsov, Daniel, et autres
Publié: (2026)
par: Kuznetsov, Daniel, et autres
Publié: (2026)
WAPITI: A Watermark for Finetuned Open-Source LLMs
par: Chen, Lingjie, et autres
Publié: (2024)
par: Chen, Lingjie, et autres
Publié: (2024)
Fundamental Limitations in Pointwise Defences of LLM Finetuning APIs
par: Davies, Xander, et autres
Publié: (2025)
par: Davies, Xander, et autres
Publié: (2025)
Feedback-Driven Execution for LLM-Based Binary Analysis
par: Zhang, XiangRui, et autres
Publié: (2026)
par: Zhang, XiangRui, et autres
Publié: (2026)
Purifying Generative LLMs from Backdoors without Prior Knowledge or Clean Reference
par: Li, Jianwei, et autres
Publié: (2026)
par: Li, Jianwei, et autres
Publié: (2026)
CodePurify: Defend Backdoor Attacks on Neural Code Models via Entropy-based Purification
par: Mu, Fangwen, et autres
Publié: (2024)
par: Mu, Fangwen, et autres
Publié: (2024)
Privacy-Preserving Redaction of Diagnosis Data through Source Code Analysis
par: Zhou, Lixi, et autres
Publié: (2024)
par: Zhou, Lixi, et autres
Publié: (2024)
"No Matter What You Do": Purifying GNN Models via Backdoor Unlearning
par: Zhang, Jiale, et autres
Publié: (2024)
par: Zhang, Jiale, et autres
Publié: (2024)
LLM-SmartAudit: Advanced Smart Contract Vulnerability Detection
par: Wei, Zhiyuan, et autres
Publié: (2024)
par: Wei, Zhiyuan, et autres
Publié: (2024)
EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
par: Wu, Jialin, et autres
Publié: (2025)
par: Wu, Jialin, et autres
Publié: (2025)
Documents similaires
-
HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment
par: Liu, Yuexiao, et autres
Publié: (2025) -
Be Your Own Red Teamer: Safety Alignment via Self-Play and Reflective Experience Replay
par: Wang, Hao, et autres
Publié: (2026) -
Collaborative Shadows: Distributed Backdoor Attacks in LLM-Based Multi-Agent Systems
par: Zhu, Pengyu, et autres
Publié: (2025) -
Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization
par: Li, Xurui, et autres
Publié: (2025) -
Safety Layers in Aligned Large Language Models: The Key to LLM Security
par: Li, Shen, et autres
Publié: (2024)