GuardReasoner-Omni: A Reasoning-based Multi-modal Guardrail for Text, Image, Video, and Audio
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Zhenhao, Liu, Yue, Guo, Yanpei, Qu, Wenjie, Chen, Cancan, He, Yufei, Li, Yibo, Chen, Yulin, Wu, Tianyi, Xu, Huiying, Zhu, Xinzhong, Zhang, Jiaheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GuardReasoner: Towards Reasoning-based LLM Safeguards
di: Liu, Yue, et al.
Pubblicazione: (2025)
di: Liu, Yue, et al.
Pubblicazione: (2025)
GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning
di: Liu, Yue, et al.
Pubblicazione: (2025)
di: Liu, Yue, et al.
Pubblicazione: (2025)
ExtendAttack: Attacking Servers of LRMs via Extending Reasoning
di: Zhu, Zhenhao, et al.
Pubblicazione: (2025)
di: Zhu, Zhenhao, et al.
Pubblicazione: (2025)
OmniGuard: Unified Omni-Modal Guardrails with Deliberate Reasoning
di: Zhu, Boyu, et al.
Pubblicazione: (2025)
di: Zhu, Boyu, et al.
Pubblicazione: (2025)
WebAgentGuard: A Reasoning-Driven Guard Model for Detecting Prompt Injection Attacks in Web Agents
di: Chen, Yulin, et al.
Pubblicazione: (2026)
di: Chen, Yulin, et al.
Pubblicazione: (2026)
ThinkGuard: Deliberative Slow Thinking Leads to Cautious Guardrails
di: Wen, Xiaofei, et al.
Pubblicazione: (2025)
di: Wen, Xiaofei, et al.
Pubblicazione: (2025)
AliMark: Enhancing Robustness of Sentence-Level Watermarking Against Text Paraphrasing
di: Li, Yuexin, et al.
Pubblicazione: (2026)
di: Li, Yuexin, et al.
Pubblicazione: (2026)
Bag of Tricks for Subverting Reasoning-based Safety Guardrails
di: Chen, Shuo, et al.
Pubblicazione: (2025)
di: Chen, Shuo, et al.
Pubblicazione: (2025)
PoseGuard: Pose-Guided Generation with Safety Guardrails
di: Wang, Kongxin, et al.
Pubblicazione: (2025)
di: Wang, Kongxin, et al.
Pubblicazione: (2025)
Poly-Guard: Massive Multi-Domain Safety Policy-Grounded Guardrail Dataset
di: Kang, Mintong, et al.
Pubblicazione: (2025)
di: Kang, Mintong, et al.
Pubblicazione: (2025)
Triaging Threats to Specialized Guardrails
di: Mo, Wenjie Jacky, et al.
Pubblicazione: (2026)
di: Mo, Wenjie Jacky, et al.
Pubblicazione: (2026)
Echoes within the Reasoning: Stealthy and Effective Watermarking via Chain of Thought
di: Lu, Jiacheng, et al.
Pubblicazione: (2026)
di: Lu, Jiacheng, et al.
Pubblicazione: (2026)
SAMark: A Self-Anchored Text Watermarking with Paragraph-Level Paraphrase Robustness
di: Huo, Jiahao, et al.
Pubblicazione: (2026)
di: Huo, Jiahao, et al.
Pubblicazione: (2026)
ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models
di: Zhao, Yunhan, et al.
Pubblicazione: (2026)
di: Zhao, Yunhan, et al.
Pubblicazione: (2026)
From Thinking to Output: Chain-of-Thought and Text Generation Characteristics in Reasoning Language Models
di: Liu, Junhao, et al.
Pubblicazione: (2025)
di: Liu, Junhao, et al.
Pubblicazione: (2025)
Efficient Input-level Backdoor Defense on Text-to-Image Synthesis via Neuron Activation Variation
di: Zhai, Shengfang, et al.
Pubblicazione: (2025)
di: Zhai, Shengfang, et al.
Pubblicazione: (2025)
LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails
di: Li, Nanxi, et al.
Pubblicazione: (2026)
di: Li, Nanxi, et al.
Pubblicazione: (2026)
IMMACULATE: A Practical LLM Auditing Framework via Verifiable Computation
di: Guo, Yanpei, et al.
Pubblicazione: (2026)
di: Guo, Yanpei, et al.
Pubblicazione: (2026)
PSRT: Accelerating LRM-based Guard Models via Prefilled Safe Reasoning Traces
di: Zhao, Jiawei, et al.
Pubblicazione: (2025)
di: Zhao, Jiawei, et al.
Pubblicazione: (2025)
InjecGuard: Benchmarking and Mitigating Over-defense in Prompt Injection Guardrail Models
di: Li, Hao, et al.
Pubblicazione: (2024)
di: Li, Hao, et al.
Pubblicazione: (2024)
Efficient Reasoning via Chain of Unconscious Thought
di: Gong, Ruihan, et al.
Pubblicazione: (2025)
di: Gong, Ruihan, et al.
Pubblicazione: (2025)
Provably Robust Multi-bit Watermarking for AI-generated Text
di: Qu, Wenjie, et al.
Pubblicazione: (2024)
di: Qu, Wenjie, et al.
Pubblicazione: (2024)
SpatialJB: How Text Distribution Art Becomes the "Jailbreak Key" for LLM Guardrails
di: Mou, Zhiyi, et al.
Pubblicazione: (2026)
di: Mou, Zhiyi, et al.
Pubblicazione: (2026)
Self-Sovereign Agent
di: Qu, Wenjie, et al.
Pubblicazione: (2026)
di: Qu, Wenjie, et al.
Pubblicazione: (2026)
TraceGuard: Process-Guided Firewall against Reasoning Backdoors in Large Language Models
di: Guo, Zhen, et al.
Pubblicazione: (2026)
di: Guo, Zhen, et al.
Pubblicazione: (2026)
Provably Secure Agent Guardrail
di: Wu, Benlong, et al.
Pubblicazione: (2026)
di: Wu, Benlong, et al.
Pubblicazione: (2026)
Securing LLM Agents Need Intent-to-Execution Integrity
di: Qu, Wenjie, et al.
Pubblicazione: (2026)
di: Qu, Wenjie, et al.
Pubblicazione: (2026)
Can Indirect Prompt Injection Attacks Be Detected and Removed?
di: Chen, Yulin, et al.
Pubblicazione: (2025)
di: Chen, Yulin, et al.
Pubblicazione: (2025)
ALMGuard: Safety Shortcuts and Where to Find Them as Guardrails for Audio-Language Models
di: Jin, Weifei, et al.
Pubblicazione: (2025)
di: Jin, Weifei, et al.
Pubblicazione: (2025)
GSPR: Aligning LLM Safeguards as Generalizable Safety Policy Reasoners
di: Li, Haoran, et al.
Pubblicazione: (2025)
di: Li, Haoran, et al.
Pubblicazione: (2025)
GuardTrace-VL: Detecting Unsafe Multimodel Reasoning via Iterative Safety Supervision
di: Xiang, Yuxiao, et al.
Pubblicazione: (2025)
di: Xiang, Yuxiao, et al.
Pubblicazione: (2025)
AIRGuard: Guarding Agent Actions with Runtime Authority Control
di: Qin, Suliu, et al.
Pubblicazione: (2026)
di: Qin, Suliu, et al.
Pubblicazione: (2026)
Guarding the Gate: ConceptGuard Battles Concept-Level Backdoors in Concept Bottleneck Models
di: Lai, Songning, et al.
Pubblicazione: (2024)
di: Lai, Songning, et al.
Pubblicazione: (2024)
Prompt Inversion Attack against Collaborative Inference of Large Language Models
di: Qu, Wenjie, et al.
Pubblicazione: (2025)
di: Qu, Wenjie, et al.
Pubblicazione: (2025)
ExplainableGuard: Interpretable Adversarial Defense for Large Language Models Using Chain-of-Thought Reasoning
di: Guan, Shaowei, et al.
Pubblicazione: (2025)
di: Guan, Shaowei, et al.
Pubblicazione: (2025)
T2VSafetyBench: Evaluating the Safety of Text-to-Video Generative Models
di: Miao, Yibo, et al.
Pubblicazione: (2024)
di: Miao, Yibo, et al.
Pubblicazione: (2024)
Safety Context Injection: Inference-Time Safety Alignment via Static Filtering and Agentic Analysis
di: Xu, Zhenhao, et al.
Pubblicazione: (2026)
di: Xu, Zhenhao, et al.
Pubblicazione: (2026)
Silent Leaks: Implicit Knowledge Extraction Attack on RAG Systems through Benign Queries
di: Wang, Yuhao, et al.
Pubblicazione: (2025)
di: Wang, Yuhao, et al.
Pubblicazione: (2025)
WARD: Adversarially Robust Defense of Web Agents Against Prompt Injections
di: Cao, Tri, et al.
Pubblicazione: (2026)
di: Cao, Tri, et al.
Pubblicazione: (2026)
SyncGuard: Robust Audio Watermarking Capable of Countering Desynchronization Attacks
di: Gan, Zhenliang, et al.
Pubblicazione: (2025)
di: Gan, Zhenliang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
GuardReasoner: Towards Reasoning-based LLM Safeguards
di: Liu, Yue, et al.
Pubblicazione: (2025) -
GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning
di: Liu, Yue, et al.
Pubblicazione: (2025) -
ExtendAttack: Attacking Servers of LRMs via Extending Reasoning
di: Zhu, Zhenhao, et al.
Pubblicazione: (2025) -
OmniGuard: Unified Omni-Modal Guardrails with Deliberate Reasoning
di: Zhu, Boyu, et al.
Pubblicazione: (2025) -
WebAgentGuard: A Reasoning-Driven Guard Model for Detecting Prompt Injection Attacks in Web Agents
di: Chen, Yulin, et al.
Pubblicazione: (2026)