GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Yue, Zhai, Shengfang, Du, Mingzhe, Chen, Yulin, Cao, Tri, Gao, Hongcheng, Wang, Cheng, Li, Xinfeng, Wang, Kun, Fang, Junfeng, Zhang, Jiaheng, Hooi, Bryan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GuardReasoner: Towards Reasoning-based LLM Safeguards
por: Liu, Yue, et al.
Publicado: (2025)
por: Liu, Yue, et al.
Publicado: (2025)
GuardReasoner-Omni: A Reasoning-based Multi-modal Guardrail for Text, Image, Video, and Audio
por: Zhu, Zhenhao, et al.
Publicado: (2026)
por: Zhu, Zhenhao, et al.
Publicado: (2026)
WebAgentGuard: A Reasoning-Driven Guard Model for Detecting Prompt Injection Attacks in Web Agents
por: Chen, Yulin, et al.
Publicado: (2026)
por: Chen, Yulin, et al.
Publicado: (2026)
AliMark: Enhancing Robustness of Sentence-Level Watermarking Against Text Paraphrasing
por: Li, Yuexin, et al.
Publicado: (2026)
por: Li, Yuexin, et al.
Publicado: (2026)
Visual CoT Makes VLMs Smarter but More Fragile
por: Xu, Chunxue, et al.
Publicado: (2025)
por: Xu, Chunxue, et al.
Publicado: (2025)
Securing LLM Agents Need Intent-to-Execution Integrity
por: Qu, Wenjie, et al.
Publicado: (2026)
por: Qu, Wenjie, et al.
Publicado: (2026)
GSPR: Aligning LLM Safeguards as Generalizable Safety Policy Reasoners
por: Li, Haoran, et al.
Publicado: (2025)
por: Li, Haoran, et al.
Publicado: (2025)
GuardTrace-VL: Detecting Unsafe Multimodel Reasoning via Iterative Safety Supervision
por: Xiang, Yuxiao, et al.
Publicado: (2025)
por: Xiang, Yuxiao, et al.
Publicado: (2025)
Automated Phishing Detection Using URLs and Webpages
por: Wang, Huilin, et al.
Publicado: (2024)
por: Wang, Huilin, et al.
Publicado: (2024)
PhishAgent: A Robust Multimodal Agent for Phishing Webpage Detection
por: Cao, Tri, et al.
Publicado: (2024)
por: Cao, Tri, et al.
Publicado: (2024)
Silent Leaks: Implicit Knowledge Extraction Attack on RAG Systems through Benign Queries
por: Wang, Yuhao, et al.
Publicado: (2025)
por: Wang, Yuhao, et al.
Publicado: (2025)
TopicAttack: An Indirect Prompt Injection Attack via Topic Transition
por: Chen, Yulin, et al.
Publicado: (2025)
por: Chen, Yulin, et al.
Publicado: (2025)
WARD: Adversarially Robust Defense of Web Agents Against Prompt Injections
por: Cao, Tri, et al.
Publicado: (2026)
por: Cao, Tri, et al.
Publicado: (2026)
MemPot: Defending Against Memory Extraction Attack with Optimized Honeypots
por: Wang, Yuhao, et al.
Publicado: (2026)
por: Wang, Yuhao, et al.
Publicado: (2026)
Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense
por: Hao, Shuyang, et al.
Publicado: (2025)
por: Hao, Shuyang, et al.
Publicado: (2025)
ExplainableGuard: Interpretable Adversarial Defense for Large Language Models Using Chain-of-Thought Reasoning
por: Guan, Shaowei, et al.
Publicado: (2025)
por: Guan, Shaowei, et al.
Publicado: (2025)
Backdoor-Powered Prompt Injection Attacks Nullify Defense Methods
por: Chen, Yulin, et al.
Publicado: (2025)
por: Chen, Yulin, et al.
Publicado: (2025)
Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection
por: Lin, Lixing, et al.
Publicado: (2026)
por: Lin, Lixing, et al.
Publicado: (2026)
ExtendAttack: Attacking Servers of LRMs via Extending Reasoning
por: Zhu, Zhenhao, et al.
Publicado: (2025)
por: Zhu, Zhenhao, et al.
Publicado: (2025)
MIRAGE: Multimodal Immersive Reasoning and Guided Exploration for Red-Team Jailbreak Attacks
por: You, Wenhao, et al.
Publicado: (2025)
por: You, Wenhao, et al.
Publicado: (2025)
Can Indirect Prompt Injection Attacks Be Detected and Removed?
por: Chen, Yulin, et al.
Publicado: (2025)
por: Chen, Yulin, et al.
Publicado: (2025)
Meta-Reasoner: Dynamic Guidance for Optimized Inference-time Reasoning in Large Language Models
por: Sui, Yuan, et al.
Publicado: (2025)
por: Sui, Yuan, et al.
Publicado: (2025)
BadDLM: Backdooring Diffusion Language Models with Diverse Targets
por: Zhai, Shengfang, et al.
Publicado: (2026)
por: Zhai, Shengfang, et al.
Publicado: (2026)
GLiGuard: Schema-Conditioned Classification for LLM Safeguard
por: Zaratiana, Urchade, et al.
Publicado: (2026)
por: Zaratiana, Urchade, et al.
Publicado: (2026)
SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models
por: Fang, Junfeng, et al.
Publicado: (2025)
por: Fang, Junfeng, et al.
Publicado: (2025)
Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward Model
por: Wu, Tianyi, et al.
Publicado: (2026)
por: Wu, Tianyi, et al.
Publicado: (2026)
TransLinkGuard: Safeguarding Transformer Models Against Model Stealing in Edge Deployment
por: Li, Qinfeng, et al.
Publicado: (2024)
por: Li, Qinfeng, et al.
Publicado: (2024)
Geneshift: Impact of different scenario shift on Jailbreaking LLM
por: Wu, Tianyi, et al.
Publicado: (2025)
por: Wu, Tianyi, et al.
Publicado: (2025)
Defense Against Prompt Injection Attack by Leveraging Attack Techniques
por: Chen, Yulin, et al.
Publicado: (2024)
por: Chen, Yulin, et al.
Publicado: (2024)
BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger
por: Chen, Yulin, et al.
Publicado: (2024)
por: Chen, Yulin, et al.
Publicado: (2024)
DMark: Order-Agnostic Watermarking for Diffusion Large Language Models
por: Wu, Linyu, et al.
Publicado: (2025)
por: Wu, Linyu, et al.
Publicado: (2025)
Efficient Input-level Backdoor Defense on Text-to-Image Synthesis via Neuron Activation Variation
por: Zhai, Shengfang, et al.
Publicado: (2025)
por: Zhai, Shengfang, et al.
Publicado: (2025)
Efficient Reasoning via Chain of Unconscious Thought
por: Gong, Ruihan, et al.
Publicado: (2025)
por: Gong, Ruihan, et al.
Publicado: (2025)
IMMACULATE: A Practical LLM Auditing Framework via Verifiable Computation
por: Guo, Yanpei, et al.
Publicado: (2026)
por: Guo, Yanpei, et al.
Publicado: (2026)
FlipAttack: Jailbreak LLMs via Flipping
por: Liu, Yue, et al.
Publicado: (2024)
por: Liu, Yue, et al.
Publicado: (2024)
Tricking Retrievers with Influential Tokens: An Efficient Black-Box Corpus Poisoning Attack
por: Wang, Cheng, et al.
Publicado: (2025)
por: Wang, Cheng, et al.
Publicado: (2025)
VPI-Bench: Visual Prompt Injection Attacks for Computer-Use Agents
por: Cao, Tri, et al.
Publicado: (2025)
por: Cao, Tri, et al.
Publicado: (2025)
CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks
por: Zhang, Xu, et al.
Publicado: (2025)
por: Zhang, Xu, et al.
Publicado: (2025)
VLM-Guard: Safeguarding Vision-Language Models via Fulfilling Safety Alignment Gap
por: Liu, Qin, et al.
Publicado: (2025)
por: Liu, Qin, et al.
Publicado: (2025)
TrinityGuard: A Unified Framework for Safeguarding Multi-Agent Systems
por: Wang, Kai, et al.
Publicado: (2026)
por: Wang, Kai, et al.
Publicado: (2026)
Ejemplares similares
-
GuardReasoner: Towards Reasoning-based LLM Safeguards
por: Liu, Yue, et al.
Publicado: (2025) -
GuardReasoner-Omni: A Reasoning-based Multi-modal Guardrail for Text, Image, Video, and Audio
por: Zhu, Zhenhao, et al.
Publicado: (2026) -
WebAgentGuard: A Reasoning-Driven Guard Model for Detecting Prompt Injection Attacks in Web Agents
por: Chen, Yulin, et al.
Publicado: (2026) -
AliMark: Enhancing Robustness of Sentence-Level Watermarking Against Text Paraphrasing
por: Li, Yuexin, et al.
Publicado: (2026) -
Visual CoT Makes VLMs Smarter but More Fragile
por: Xu, Chunxue, et al.
Publicado: (2025)