Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ma, Yingzi, Wang, Jiongxiao, Wang, Fei, Ma, Siyuan, Li, Jiazhao, Pan, Jinsheng, Li, Xiujun, Huang, Furong, Sun, Lichao, Li, Bo, Choi, Yejin, Chen, Muhao, Xiao, Chaowei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FATH: Authentication-based Test-time Defense against Indirect Prompt Injection Attacks
par: Wang, Jiongxiao, et autres
Publié: (2024)
par: Wang, Jiongxiao, et autres
Publié: (2024)
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
par: Wang, Jiongxiao, et autres
Publié: (2024)
par: Wang, Jiongxiao, et autres
Publié: (2024)
RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models
par: Wang, Jiongxiao, et autres
Publié: (2023)
par: Wang, Jiongxiao, et autres
Publié: (2023)
PEBench: A Fictitious Dataset to Benchmark Machine Unlearning for Multimodal Large Language Models
par: Xu, Zhaopan, et autres
Publié: (2025)
par: Xu, Zhaopan, et autres
Publié: (2025)
Consistency Purification: Effective and Efficient Diffusion Purification towards Certified Robustness
par: Li, Yiquan, et autres
Publié: (2024)
par: Li, Yiquan, et autres
Publié: (2024)
Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors
par: Sun, Jiachen, et autres
Publié: (2024)
par: Sun, Jiachen, et autres
Publié: (2024)
SafeGen-Bench: Benchmarking Safety in Image-Conditioned Text-to-Video Generation
par: Ma, Yingzi, et autres
Publié: (2026)
par: Ma, Yingzi, et autres
Publié: (2026)
VLM-Guard: Safeguarding Vision-Language Models via Fulfilling Safety Alignment Gap
par: Liu, Qin, et autres
Publié: (2025)
par: Liu, Qin, et autres
Publié: (2025)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
par: Xu, Jiashu, et autres
Publié: (2023)
par: Xu, Jiashu, et autres
Publié: (2023)
Test-time Backdoor Mitigation for Black-Box Large Language Models with Defensive Demonstrations
par: Mo, Wenjie, et autres
Publié: (2023)
par: Mo, Wenjie, et autres
Publié: (2023)
SudoLM: Learning Access Control of Parametric Knowledge with Authorization Alignment
par: Liu, Qin, et autres
Publié: (2024)
par: Liu, Qin, et autres
Publié: (2024)
From Shortcuts to Triggers: Backdoor Defense with Denoised PoE
par: Liu, Qin, et autres
Publié: (2023)
par: Liu, Qin, et autres
Publié: (2023)
TOFU: A Task of Fictitious Unlearning for LLMs
par: Maini, Pratyush, et autres
Publié: (2024)
par: Maini, Pratyush, et autres
Publié: (2024)
When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
par: Liu, Xiaogeng, et autres
Publié: (2026)
par: Liu, Xiaogeng, et autres
Publié: (2026)
OET: Optimization-based prompt injection Evaluation Toolkit
par: Pan, Jinsheng, et autres
Publié: (2025)
par: Pan, Jinsheng, et autres
Publié: (2025)
Preference Poisoning Attacks on Reward Model Learning
par: Wu, Junlin, et autres
Publié: (2024)
par: Wu, Junlin, et autres
Publié: (2024)
AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompting
par: Wang, Yu, et autres
Publié: (2024)
par: Wang, Yu, et autres
Publié: (2024)
Cognitive Overload: Jailbreaking Large Language Models with Overloaded Logical Thinking
par: Xu, Nan, et autres
Publié: (2023)
par: Xu, Nan, et autres
Publié: (2023)
Instructional Fingerprinting of Large Language Models
par: Xu, Jiashu, et autres
Publié: (2024)
par: Xu, Jiashu, et autres
Publié: (2024)
Text as Images: Can Multimodal Large Language Models Follow Printed Instructions in Pixels?
par: Li, Xiujun, et autres
Publié: (2023)
par: Li, Xiujun, et autres
Publié: (2023)
3D Motion Perception of Binocular Vision Target with PID-CNN
par: Shi, Jiazhao, et autres
Publié: (2025)
par: Shi, Jiazhao, et autres
Publié: (2025)
dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning
par: Ma, Yingzi, et autres
Publié: (2025)
par: Ma, Yingzi, et autres
Publié: (2025)
JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks
par: Luo, Weidi, et autres
Publié: (2024)
par: Luo, Weidi, et autres
Publié: (2024)
Offset Unlearning for Large Language Models
par: Huang, James Y., et autres
Publié: (2024)
par: Huang, James Y., et autres
Publié: (2024)
Efficient Manifold-Constrained Neural ODE for High-Dimensional Datasets
par: Guo, Muhao, et autres
Publié: (2025)
par: Guo, Muhao, et autres
Publié: (2025)
Can LLMs Reason with Rules? Logic Scaffolding for Stress-Testing and Improving LLMs
par: Wang, Siyuan, et autres
Publié: (2024)
par: Wang, Siyuan, et autres
Publié: (2024)
Symbolic Working Memory Enhances Language Models for Complex Rule Application
par: Wang, Siyuan, et autres
Publié: (2024)
par: Wang, Siyuan, et autres
Publié: (2024)
Crafter: Facial Feature Crafting against Inversion-based Identity Theft on Deep Models
par: Wang, Shiming, et autres
Publié: (2024)
par: Wang, Shiming, et autres
Publié: (2024)
ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning
par: Zhao, Zhengyue, et autres
Publié: (2025)
par: Zhao, Zhengyue, et autres
Publié: (2025)
EmojiDiff: Advanced Facial Expression Control with High Identity Preservation in Portrait Generation
par: Jiang, Liangwei, et autres
Publié: (2024)
par: Jiang, Liangwei, et autres
Publié: (2024)
SafeVision: Efficient Image Guardrail with Robust Policy Adherence and Explainability
par: Xu, Peiyang, et autres
Publié: (2025)
par: Xu, Peiyang, et autres
Publié: (2025)
CXPMRG-Bench: Pre-training and Benchmarking for X-ray Medical Report Generation on CheXpert Plus Dataset
par: Wang, Xiao, et autres
Publié: (2024)
par: Wang, Xiao, et autres
Publié: (2024)
FaceBench: A Multi-View Multi-Level Facial Attribute VQA Dataset for Benchmarking Face Perception MLLMs
par: Wang, Xiaoqin, et autres
Publié: (2025)
par: Wang, Xiaoqin, et autres
Publié: (2025)
Benchmarking Unlearning for Vision Transformers
par: Zhao, Kairan, et autres
Publié: (2026)
par: Zhao, Kairan, et autres
Publié: (2026)
AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models
par: Liu, Xiaogeng, et autres
Publié: (2023)
par: Liu, Xiaogeng, et autres
Publié: (2023)
CVLUE: A New Benchmark Dataset for Chinese Vision-Language Understanding Evaluation
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
Fourteen Undescribed Sesquiterpenoids and Lignans With Potent Anti‐Inflammatory and Antioxidant Properties Isolated From Syringa oblata Lindl.
par: Xiujun Lai, et autres
Publié: (2026)
par: Xiujun Lai, et autres
Publié: (2026)
Mitigating Backdoor Threats to Large Language Models: Advancement and Challenges
par: Liu, Qin, et autres
Publié: (2024)
par: Liu, Qin, et autres
Publié: (2024)
FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation
par: Wang, Yuanzhi, et autres
Publié: (2026)
par: Wang, Yuanzhi, et autres
Publié: (2026)
Langevin Unlearning: A New Perspective of Noisy Gradient Descent for Machine Unlearning
par: Chien, Eli, et autres
Publié: (2024)
par: Chien, Eli, et autres
Publié: (2024)
Documents similaires
-
FATH: Authentication-based Test-time Defense against Indirect Prompt Injection Attacks
par: Wang, Jiongxiao, et autres
Publié: (2024) -
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
par: Wang, Jiongxiao, et autres
Publié: (2024) -
RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models
par: Wang, Jiongxiao, et autres
Publié: (2023) -
PEBench: A Fictitious Dataset to Benchmark Machine Unlearning for Multimodal Large Language Models
par: Xu, Zhaopan, et autres
Publié: (2025) -
Consistency Purification: Effective and Efficient Diffusion Purification towards Certified Robustness
par: Li, Yiquan, et autres
Publié: (2024)