SafeRedir: Prompt Embedding Redirection for Robust Unlearning in Image Generation Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Renyang, Chen, Kangjie, Qiu, Han, Zhang, Jie, Lam, Kwok-Yan, Zhang, Tianwei, Ng, See-Kiong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Image Can Bring Your Memory Back: A Novel Multi-Modal Guided Attack against Image Generation Model Unlearning
par: Liu, Renyang, et autres
Publié: (2025)
par: Liu, Renyang, et autres
Publié: (2025)
Rethinking Machine Unlearning in Image Generation Models
par: Liu, Renyang, et autres
Publié: (2025)
par: Liu, Renyang, et autres
Publié: (2025)
DECEIVE-AFC: Adversarial Claim Attacks against Search-Enabled LLM-based Fact-Checking Systems
par: Ou, Haoran, et autres
Publié: (2026)
par: Ou, Haoran, et autres
Publié: (2026)
Towards Effective Prompt Stealing Attack against Text-to-Image Diffusion Models
par: Zhao, Shiqian, et autres
Publié: (2025)
par: Zhao, Shiqian, et autres
Publié: (2025)
ART: Automatic Red-teaming for Text-to-Image Models to Protect Benign Users
par: Li, Guanlin, et autres
Publié: (2024)
par: Li, Guanlin, et autres
Publié: (2024)
Safe Text-to-Image Generation: Simply Sanitize the Prompt Embedding
par: Qiu, Huming, et autres
Publié: (2024)
par: Qiu, Huming, et autres
Publié: (2024)
When Search Goes Wrong: Red-Teaming Web-Augmented Large Language Models
par: Ou, Haoran, et autres
Publié: (2025)
par: Ou, Haoran, et autres
Publié: (2025)
CAAP: Capture-Aware Adversarial Patch Attacks on Palmprint Recognition Models
par: Liu, Renyang, et autres
Publié: (2026)
par: Liu, Renyang, et autres
Publié: (2026)
ObfusBFA: A Holistic Approach to Safeguarding DNNs from Different Types of Bit-Flip Attacks
par: Yan, Xiaobei, et autres
Publié: (2025)
par: Yan, Xiaobei, et autres
Publié: (2025)
Robust-Wide: Robust Watermarking against Instruction-driven Image Editing
par: Hu, Runyi, et autres
Publié: (2024)
par: Hu, Runyi, et autres
Publié: (2024)
Guaranteeing Data Privacy in Federated Unlearning with Dynamic User Participation
par: Liu, Ziyao, et autres
Publié: (2024)
par: Liu, Ziyao, et autres
Publié: (2024)
Privacy-Preserving Federated Unlearning with Certified Client Removal
par: Liu, Ziyao, et autres
Publié: (2024)
par: Liu, Ziyao, et autres
Publié: (2024)
A Survey on Federated Unlearning: Challenges, Methods, and Future Directions
par: Liu, Ziyao, et autres
Publié: (2023)
par: Liu, Ziyao, et autres
Publié: (2023)
BURN: Backdoor Unlearning via Adversarial Boundary Analysis
par: Su, Yanghao, et autres
Publié: (2025)
par: Su, Yanghao, et autres
Publié: (2025)
Threats, Attacks, and Defenses in Machine Unlearning: A Survey
par: Liu, Ziyao, et autres
Publié: (2024)
par: Liu, Ziyao, et autres
Publié: (2024)
Confidence Elicitation: A New Attack Vector for Large Language Models
par: Formento, Brian, et autres
Publié: (2025)
par: Formento, Brian, et autres
Publié: (2025)
Certifying the Right to Be Forgotten: Primal-Dual Optimization for Sample and Label Unlearning in Vertical Federated Learning
par: Jiang, Yu, et autres
Publié: (2025)
par: Jiang, Yu, et autres
Publié: (2025)
Towards Action Hijacking of Large Language Model-based Agent
par: Zhang, Yuyang, et autres
Publié: (2024)
par: Zhang, Yuyang, et autres
Publié: (2024)
Efficient Federated Unlearning with Adaptive Differential Privacy Preservation
par: Jiang, Yu, et autres
Publié: (2024)
par: Jiang, Yu, et autres
Publié: (2024)
The Trojan Example: Jailbreaking LLMs through Template Filling and Unsafety Reasoning
par: Liu, Mingrui, et autres
Publié: (2025)
par: Liu, Mingrui, et autres
Publié: (2025)
SafeRedirect: Defeating Internal Safety Collapse via Task-Completion Redirection in Frontier LLMs
par: Pan, Chao, et autres
Publié: (2026)
par: Pan, Chao, et autres
Publié: (2026)
RedVisor: Reasoning-Aware Prompt Injection Defense via Zero-Copy KV Cache Reuse
par: Liu, Mingrui, et autres
Publié: (2026)
par: Liu, Mingrui, et autres
Publié: (2026)
Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward Model
par: Wu, Tianyi, et autres
Publié: (2026)
par: Wu, Tianyi, et autres
Publié: (2026)
Geneshift: Impact of different scenario shift on Jailbreaking LLM
par: Wu, Tianyi, et autres
Publié: (2025)
par: Wu, Tianyi, et autres
Publié: (2025)
An Engorgio Prompt Makes Large Language Model Babble on
par: Dong, Jianshuo, et autres
Publié: (2024)
par: Dong, Jianshuo, et autres
Publié: (2024)
BitHydra: Towards Bit-flip Inference Cost Attack against Large Language Models
par: Yan, Xiaobei, et autres
Publié: (2025)
par: Yan, Xiaobei, et autres
Publié: (2025)
SafeGuider: Robust and Practical Content Safety Control for Text-to-Image Models
par: Qi, Peigui, et autres
Publié: (2025)
par: Qi, Peigui, et autres
Publié: (2025)
PoseGuard: Pose-Guided Generation with Safety Guardrails
par: Wang, Kongxin, et autres
Publié: (2025)
par: Wang, Kongxin, et autres
Publié: (2025)
LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge
par: Li, Songze, et autres
Publié: (2025)
par: Li, Songze, et autres
Publié: (2025)
Efficient Privacy-Preserving Retrieval Augmented Generation with Distance-Preserving Encryption
par: Ye, Huanyi, et autres
Publié: (2026)
par: Ye, Huanyi, et autres
Publié: (2026)
REFORGE: Multi-modal Attacks Reveal Vulnerable Concept Unlearning in Image Generation Models
par: Zou, Yong, et autres
Publié: (2026)
par: Zou, Yong, et autres
Publié: (2026)
State-Dependent Safety Failures in Multi-Turn Language Model Interaction
par: Li, Pengcheng, et autres
Publié: (2026)
par: Li, Pengcheng, et autres
Publié: (2026)
BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
BadEdit: Backdooring large language models by model editing
par: Li, Yanzhou, et autres
Publié: (2024)
par: Li, Yanzhou, et autres
Publié: (2024)
Robust Reversible Watermarking in Encrypted Images Based on Dual-MSBs Spiral Embedding
par: Shen, Haoyu, et autres
Publié: (2026)
par: Shen, Haoyu, et autres
Publié: (2026)
ForgetMark: Stealthy Fingerprint Embedding via Targeted Unlearning in Language Models
par: Xu, Zhenhua, et autres
Publié: (2026)
par: Xu, Zhenhua, et autres
Publié: (2026)
DeepSweep: An Evaluation Framework for Mitigating DNN Backdoor Attacks using Data Augmentation
par: Qiu, Han, et autres
Publié: (2020)
par: Qiu, Han, et autres
Publié: (2020)
On the Proactive Generation of Unsafe Images From Text-To-Image Models Using Benign Prompts
par: Wu, Yixin, et autres
Publié: (2023)
par: Wu, Yixin, et autres
Publié: (2023)
Really Unlearned? Verifying Machine Unlearning via Influential Sample Pairs
par: Xu, Heng, et autres
Publié: (2024)
par: Xu, Heng, et autres
Publié: (2024)
What Makes a Good LLM Agent for Real-world Penetration Testing?
par: Deng, Gelei, et autres
Publié: (2026)
par: Deng, Gelei, et autres
Publié: (2026)
Documents similaires
-
Image Can Bring Your Memory Back: A Novel Multi-Modal Guided Attack against Image Generation Model Unlearning
par: Liu, Renyang, et autres
Publié: (2025) -
Rethinking Machine Unlearning in Image Generation Models
par: Liu, Renyang, et autres
Publié: (2025) -
DECEIVE-AFC: Adversarial Claim Attacks against Search-Enabled LLM-based Fact-Checking Systems
par: Ou, Haoran, et autres
Publié: (2026) -
Towards Effective Prompt Stealing Attack against Text-to-Image Diffusion Models
par: Zhao, Shiqian, et autres
Publié: (2025) -
ART: Automatic Red-teaming for Text-to-Image Models to Protect Benign Users
par: Li, Guanlin, et autres
Publié: (2024)