Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset
Fuente:
arXiv
Guardado en:
| Autores principales: | Ma, Yingzi, Wang, Jiongxiao, Wang, Fei, Ma, Siyuan, Li, Jiazhao, Pan, Jinsheng, Li, Xiujun, Huang, Furong, Sun, Lichao, Li, Bo, Choi, Yejin, Chen, Muhao, Xiao, Chaowei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FATH: Authentication-based Test-time Defense against Indirect Prompt Injection Attacks
por: Wang, Jiongxiao, et al.
Publicado: (2024)
por: Wang, Jiongxiao, et al.
Publicado: (2024)
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
por: Wang, Jiongxiao, et al.
Publicado: (2024)
por: Wang, Jiongxiao, et al.
Publicado: (2024)
RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models
por: Wang, Jiongxiao, et al.
Publicado: (2023)
por: Wang, Jiongxiao, et al.
Publicado: (2023)
PEBench: A Fictitious Dataset to Benchmark Machine Unlearning for Multimodal Large Language Models
por: Xu, Zhaopan, et al.
Publicado: (2025)
por: Xu, Zhaopan, et al.
Publicado: (2025)
Consistency Purification: Effective and Efficient Diffusion Purification towards Certified Robustness
por: Li, Yiquan, et al.
Publicado: (2024)
por: Li, Yiquan, et al.
Publicado: (2024)
Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors
por: Sun, Jiachen, et al.
Publicado: (2024)
por: Sun, Jiachen, et al.
Publicado: (2024)
SafeGen-Bench: Benchmarking Safety in Image-Conditioned Text-to-Video Generation
por: Ma, Yingzi, et al.
Publicado: (2026)
por: Ma, Yingzi, et al.
Publicado: (2026)
VLM-Guard: Safeguarding Vision-Language Models via Fulfilling Safety Alignment Gap
por: Liu, Qin, et al.
Publicado: (2025)
por: Liu, Qin, et al.
Publicado: (2025)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
por: Xu, Jiashu, et al.
Publicado: (2023)
por: Xu, Jiashu, et al.
Publicado: (2023)
Test-time Backdoor Mitigation for Black-Box Large Language Models with Defensive Demonstrations
por: Mo, Wenjie, et al.
Publicado: (2023)
por: Mo, Wenjie, et al.
Publicado: (2023)
SudoLM: Learning Access Control of Parametric Knowledge with Authorization Alignment
por: Liu, Qin, et al.
Publicado: (2024)
por: Liu, Qin, et al.
Publicado: (2024)
From Shortcuts to Triggers: Backdoor Defense with Denoised PoE
por: Liu, Qin, et al.
Publicado: (2023)
por: Liu, Qin, et al.
Publicado: (2023)
TOFU: A Task of Fictitious Unlearning for LLMs
por: Maini, Pratyush, et al.
Publicado: (2024)
por: Maini, Pratyush, et al.
Publicado: (2024)
When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
por: Liu, Xiaogeng, et al.
Publicado: (2026)
por: Liu, Xiaogeng, et al.
Publicado: (2026)
OET: Optimization-based prompt injection Evaluation Toolkit
por: Pan, Jinsheng, et al.
Publicado: (2025)
por: Pan, Jinsheng, et al.
Publicado: (2025)
Preference Poisoning Attacks on Reward Model Learning
por: Wu, Junlin, et al.
Publicado: (2024)
por: Wu, Junlin, et al.
Publicado: (2024)
AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompting
por: Wang, Yu, et al.
Publicado: (2024)
por: Wang, Yu, et al.
Publicado: (2024)
Cognitive Overload: Jailbreaking Large Language Models with Overloaded Logical Thinking
por: Xu, Nan, et al.
Publicado: (2023)
por: Xu, Nan, et al.
Publicado: (2023)
Instructional Fingerprinting of Large Language Models
por: Xu, Jiashu, et al.
Publicado: (2024)
por: Xu, Jiashu, et al.
Publicado: (2024)
Text as Images: Can Multimodal Large Language Models Follow Printed Instructions in Pixels?
por: Li, Xiujun, et al.
Publicado: (2023)
por: Li, Xiujun, et al.
Publicado: (2023)
3D Motion Perception of Binocular Vision Target with PID-CNN
por: Shi, Jiazhao, et al.
Publicado: (2025)
por: Shi, Jiazhao, et al.
Publicado: (2025)
dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning
por: Ma, Yingzi, et al.
Publicado: (2025)
por: Ma, Yingzi, et al.
Publicado: (2025)
JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks
por: Luo, Weidi, et al.
Publicado: (2024)
por: Luo, Weidi, et al.
Publicado: (2024)
Offset Unlearning for Large Language Models
por: Huang, James Y., et al.
Publicado: (2024)
por: Huang, James Y., et al.
Publicado: (2024)
Efficient Manifold-Constrained Neural ODE for High-Dimensional Datasets
por: Guo, Muhao, et al.
Publicado: (2025)
por: Guo, Muhao, et al.
Publicado: (2025)
Can LLMs Reason with Rules? Logic Scaffolding for Stress-Testing and Improving LLMs
por: Wang, Siyuan, et al.
Publicado: (2024)
por: Wang, Siyuan, et al.
Publicado: (2024)
Symbolic Working Memory Enhances Language Models for Complex Rule Application
por: Wang, Siyuan, et al.
Publicado: (2024)
por: Wang, Siyuan, et al.
Publicado: (2024)
Crafter: Facial Feature Crafting against Inversion-based Identity Theft on Deep Models
por: Wang, Shiming, et al.
Publicado: (2024)
por: Wang, Shiming, et al.
Publicado: (2024)
ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning
por: Zhao, Zhengyue, et al.
Publicado: (2025)
por: Zhao, Zhengyue, et al.
Publicado: (2025)
EmojiDiff: Advanced Facial Expression Control with High Identity Preservation in Portrait Generation
por: Jiang, Liangwei, et al.
Publicado: (2024)
por: Jiang, Liangwei, et al.
Publicado: (2024)
SafeVision: Efficient Image Guardrail with Robust Policy Adherence and Explainability
por: Xu, Peiyang, et al.
Publicado: (2025)
por: Xu, Peiyang, et al.
Publicado: (2025)
CXPMRG-Bench: Pre-training and Benchmarking for X-ray Medical Report Generation on CheXpert Plus Dataset
por: Wang, Xiao, et al.
Publicado: (2024)
por: Wang, Xiao, et al.
Publicado: (2024)
FaceBench: A Multi-View Multi-Level Facial Attribute VQA Dataset for Benchmarking Face Perception MLLMs
por: Wang, Xiaoqin, et al.
Publicado: (2025)
por: Wang, Xiaoqin, et al.
Publicado: (2025)
Benchmarking Unlearning for Vision Transformers
por: Zhao, Kairan, et al.
Publicado: (2026)
por: Zhao, Kairan, et al.
Publicado: (2026)
AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models
por: Liu, Xiaogeng, et al.
Publicado: (2023)
por: Liu, Xiaogeng, et al.
Publicado: (2023)
CVLUE: A New Benchmark Dataset for Chinese Vision-Language Understanding Evaluation
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
Fourteen Undescribed Sesquiterpenoids and Lignans With Potent Anti‐Inflammatory and Antioxidant Properties Isolated From Syringa oblata Lindl.
por: Xiujun Lai, et al.
Publicado: (2026)
por: Xiujun Lai, et al.
Publicado: (2026)
Mitigating Backdoor Threats to Large Language Models: Advancement and Challenges
por: Liu, Qin, et al.
Publicado: (2024)
por: Liu, Qin, et al.
Publicado: (2024)
FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation
por: Wang, Yuanzhi, et al.
Publicado: (2026)
por: Wang, Yuanzhi, et al.
Publicado: (2026)
Langevin Unlearning: A New Perspective of Noisy Gradient Descent for Machine Unlearning
por: Chien, Eli, et al.
Publicado: (2024)
por: Chien, Eli, et al.
Publicado: (2024)
Ejemplares similares
-
FATH: Authentication-based Test-time Defense against Indirect Prompt Injection Attacks
por: Wang, Jiongxiao, et al.
Publicado: (2024) -
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
por: Wang, Jiongxiao, et al.
Publicado: (2024) -
RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models
por: Wang, Jiongxiao, et al.
Publicado: (2023) -
PEBench: A Fictitious Dataset to Benchmark Machine Unlearning for Multimodal Large Language Models
por: Xu, Zhaopan, et al.
Publicado: (2025) -
Consistency Purification: Effective and Efficient Diffusion Purification towards Certified Robustness
por: Li, Yiquan, et al.
Publicado: (2024)