ProGuard: Towards Proactive Multimodal Safeguard
Fuente:
arXiv
Guardado en:
| Autores principales: | Yu, Shaohan, Li, Lijun, Si, Chenyang, Sheng, Lu, Shao, Jing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task
por: Lu, Xiaoya, et al.
Publicado: (2026)
por: Lu, Xiaoya, et al.
Publicado: (2026)
GuardDoor: Safeguarding Against Malicious Diffusion Editing via Protective Backdoors
por: Zeng, Yaopei, et al.
Publicado: (2025)
por: Zeng, Yaopei, et al.
Publicado: (2025)
OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding
por: Zhao, Ruixiang, et al.
Publicado: (2026)
por: Zhao, Ruixiang, et al.
Publicado: (2026)
Assessment of Multimodal Large Language Models in Alignment with Human Values
por: Shi, Zhelun, et al.
Publicado: (2024)
por: Shi, Zhelun, et al.
Publicado: (2024)
ConceptGuard: Proactive Safety in Text-and-Image-to-Video Generation through Multimodal Risk Detection
por: Ma, Ruize, et al.
Publicado: (2025)
por: Ma, Ruize, et al.
Publicado: (2025)
ProMark: Proactive Diffusion Watermarking for Causal Attribution
por: Asnani, Vishal, et al.
Publicado: (2024)
por: Asnani, Vishal, et al.
Publicado: (2024)
Llama Guard 3 Vision: Safeguarding Human-AI Image Understanding Conversations
por: Chi, Jianfeng, et al.
Publicado: (2024)
por: Chi, Jianfeng, et al.
Publicado: (2024)
ProReason: Multi-Modal Proactive Reasoning with Decoupled Eyesight and Wisdom
por: Zhou, Jingqi, et al.
Publicado: (2024)
por: Zhou, Jingqi, et al.
Publicado: (2024)
ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models
por: De Min, Thomas, et al.
Publicado: (2026)
por: De Min, Thomas, et al.
Publicado: (2026)
ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation
por: Xue, Wei, et al.
Publicado: (2026)
por: Xue, Wei, et al.
Publicado: (2026)
EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams
por: Ran, Dongchuan, et al.
Publicado: (2026)
por: Ran, Dongchuan, et al.
Publicado: (2026)
LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models
por: Huang, Guolei, et al.
Publicado: (2025)
por: Huang, Guolei, et al.
Publicado: (2025)
WorldSimBench: Towards Video Generation Models as World Simulators
por: Qin, Yiran, et al.
Publicado: (2024)
por: Qin, Yiran, et al.
Publicado: (2024)
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
por: Wu, Jianzong, et al.
Publicado: (2024)
por: Wu, Jianzong, et al.
Publicado: (2024)
TreeTeaming: Autonomous Red-Teaming of Vision-Language Models via Hierarchical Strategy Exploration
por: Li, Chunxiao, et al.
Publicado: (2026)
por: Li, Chunxiao, et al.
Publicado: (2026)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
por: Wu, Xun, et al.
Publicado: (2024)
por: Wu, Xun, et al.
Publicado: (2024)
Self-adaptive Dataset Construction for Real-World Multimodal Safety Scenarios
por: Qu, Jingen, et al.
Publicado: (2025)
por: Qu, Jingen, et al.
Publicado: (2025)
StreamPro: From Reactive Perception to Proactive Decision-Making in Streaming Video
por: Li, Ao, et al.
Publicado: (2026)
por: Li, Ao, et al.
Publicado: (2026)
Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models
por: Wang, Lehan, et al.
Publicado: (2025)
por: Wang, Lehan, et al.
Publicado: (2025)
ProDehaze: Prompting Diffusion Models Toward Faithful Image Dehazing
por: Zhou, Tianwen, et al.
Publicado: (2025)
por: Zhou, Tianwen, et al.
Publicado: (2025)
LlavaGuard: An Open VLM-based Framework for Safeguarding Vision Datasets and Models
por: Helff, Lukas, et al.
Publicado: (2024)
por: Helff, Lukas, et al.
Publicado: (2024)
Contextual Image Attack: How Visual Context Exposes Multimodal Safety Vulnerabilities
por: Xiong, Yuan, et al.
Publicado: (2025)
por: Xiong, Yuan, et al.
Publicado: (2025)
FaceSwapGuard: Safeguarding Facial Privacy from DeepFake Threats through Identity Obfuscation
por: Wang, Li, et al.
Publicado: (2025)
por: Wang, Li, et al.
Publicado: (2025)
LongVie: Multimodal-Guided Controllable Ultra-Long Video Generation
por: Gao, Jianxiong, et al.
Publicado: (2025)
por: Gao, Jianxiong, et al.
Publicado: (2025)
BLM-Guard: Explainable Multimodal Ad Moderation with Chain-of-Thought and Policy-Aligned Rewards
por: Yang, Yiran, et al.
Publicado: (2026)
por: Yang, Yiran, et al.
Publicado: (2026)
EvoGuard: An Extensible Agentic RL-based Framework for Practical and Evolving AI-Generated Image Detection
por: Zhu, Chenyang, et al.
Publicado: (2026)
por: Zhu, Chenyang, et al.
Publicado: (2026)
Efficient Detection of Long Consistent Cycles and its Application to Distributed Synchronization
por: Li, Shaohan, et al.
Publicado: (2024)
por: Li, Shaohan, et al.
Publicado: (2024)
ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards
por: Yan, Wentao, et al.
Publicado: (2026)
por: Yan, Wentao, et al.
Publicado: (2026)
FontGuard: A Robust Font Watermarking Approach Leveraging Deep Font Knowledge
por: Wong, Kahim, et al.
Publicado: (2025)
por: Wong, Kahim, et al.
Publicado: (2025)
VLM-Guard: Safeguarding Vision-Language Models via Fulfilling Safety Alignment Gap
por: Liu, Qin, et al.
Publicado: (2025)
por: Liu, Qin, et al.
Publicado: (2025)
PosterCopilot: Toward Layout Reasoning and Controllable Editing for Professional Graphic Design
por: Wei, Jiazhe, et al.
Publicado: (2025)
por: Wei, Jiazhe, et al.
Publicado: (2025)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
por: Pan, Xichen, et al.
Publicado: (2023)
por: Pan, Xichen, et al.
Publicado: (2023)
ProAct: A Dual-System Framework for Proactive Embodied Social Agents
por: Zhang, Zeyi, et al.
Publicado: (2026)
por: Zhang, Zeyi, et al.
Publicado: (2026)
StableGuard: Towards Unified Copyright Protection and Tamper Localization in Latent Diffusion Models
por: Yang, Haoxin, et al.
Publicado: (2025)
por: Yang, Haoxin, et al.
Publicado: (2025)
Towards Generalized Proactive Defense against Face Swapping with Contour-Hybrid Watermark
por: Xia, Ruiyang, et al.
Publicado: (2025)
por: Xia, Ruiyang, et al.
Publicado: (2025)
Rethinking Cross-Modal Interaction in Multimodal Diffusion Transformers
por: Lv, Zhengyao, et al.
Publicado: (2025)
por: Lv, Zhengyao, et al.
Publicado: (2025)
OmniVL-Guard Pro: A Tool-Augmented Agent for Omnibus Vision-Language Forensics
por: Shen, Jinjie, et al.
Publicado: (2026)
por: Shen, Jinjie, et al.
Publicado: (2026)
LongVie 2: Multimodal Controllable Ultra-Long Video World Model
por: Gao, Jianxiong, et al.
Publicado: (2025)
por: Gao, Jianxiong, et al.
Publicado: (2025)
BetterCheck: Towards Safeguarding VLMs for Automotive Perception Systems
por: Dona, Malsha Ashani Mahawatta, et al.
Publicado: (2025)
por: Dona, Malsha Ashani Mahawatta, et al.
Publicado: (2025)
RH20T-P: A Primitive-Level Robotic Dataset Towards Composable Generalization Agents
por: Chen, Zeren, et al.
Publicado: (2024)
por: Chen, Zeren, et al.
Publicado: (2024)
Ejemplares similares
-
HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task
por: Lu, Xiaoya, et al.
Publicado: (2026) -
GuardDoor: Safeguarding Against Malicious Diffusion Editing via Protective Backdoors
por: Zeng, Yaopei, et al.
Publicado: (2025) -
OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding
por: Zhao, Ruixiang, et al.
Publicado: (2026) -
Assessment of Multimodal Large Language Models in Alignment with Human Values
por: Shi, Zhelun, et al.
Publicado: (2024) -
ConceptGuard: Proactive Safety in Text-and-Image-to-Video Generation through Multimodal Risk Detection
por: Ma, Ruize, et al.
Publicado: (2025)