PSRT: Accelerating LRM-based Guard Models via Prefilled Safe Reasoning Traces
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Jiawei, Qi, Yuang, Zhang, Weiming, Yu, Nenghai, Chen, Kejiang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Silent Guardian: Protecting Text from Malicious Exploitation by Large Language Models
par: Zhao, Jiawei, et autres
Publié: (2023)
par: Zhao, Jiawei, et autres
Publié: (2023)
SQL Injection Jailbreak: A Structural Disaster of Large Language Models
par: Zhao, Jiawei, et autres
Publié: (2024)
par: Zhao, Jiawei, et autres
Publié: (2024)
Provably Secure Disambiguating Neural Linguistic Steganography
par: Qi, Yuang, et autres
Publié: (2024)
par: Qi, Yuang, et autres
Publié: (2024)
STEAD: Robust Provably Secure Linguistic Steganography with Diffusion Language Model
par: Qi, Yuang, et autres
Publié: (2026)
par: Qi, Yuang, et autres
Publié: (2026)
Performance-lossless Black-box Model Watermarking
par: Zhao, Na, et autres
Publié: (2023)
par: Zhao, Na, et autres
Publié: (2023)
GIFDL: Generated Image Fluctuation Distortion Learning for Enhancing Steganographic Security
par: Wang, Xiangkun, et autres
Publié: (2025)
par: Wang, Xiangkun, et autres
Publié: (2025)
InferDPT: Privacy-Preserving Inference for Closed-box Large Language Model
par: Tong, Meng, et autres
Publié: (2023)
par: Tong, Meng, et autres
Publié: (2023)
A high-capacity linguistic steganography based on entropy-driven rank-token mapping
par: Jiang, Jun, et autres
Publié: (2025)
par: Jiang, Jun, et autres
Publié: (2025)
Provably Secure Public-Key Steganography Based on Admissible Encoding
par: Zhang, Xin, et autres
Publié: (2025)
par: Zhang, Xin, et autres
Publié: (2025)
Turning Your Strength into Watermark: Watermarking Large Language Model via Knowledge Injection
par: Li, Shuai, et autres
Publié: (2023)
par: Li, Shuai, et autres
Publié: (2023)
EditMark: Watermarking Large Language Models based on Model Editing
par: Li, Shuai, et autres
Publié: (2025)
par: Li, Shuai, et autres
Publié: (2025)
Provably Secure Agent Guardrail
par: Wu, Benlong, et autres
Publié: (2026)
par: Wu, Benlong, et autres
Publié: (2026)
Provably Secure Robust Image Steganography via Cross-Modal Error Correction
par: Qi, Yuang, et autres
Publié: (2024)
par: Qi, Yuang, et autres
Publié: (2024)
On the Vulnerability of Text Sanitization
par: Tong, Meng, et autres
Publié: (2024)
par: Tong, Meng, et autres
Publié: (2024)
Natias: Neuron Attribution based Transferable Image Adversarial Steganography
par: Fan, Zexin, et autres
Publié: (2024)
par: Fan, Zexin, et autres
Publié: (2024)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
par: Zhao, Jiawei, et autres
Publié: (2024)
par: Zhao, Jiawei, et autres
Publié: (2024)
Gaussian Shading: Provable Performance-Lossless Image Watermarking for Diffusion Models
par: Yang, Zijin, et autres
Publié: (2024)
par: Yang, Zijin, et autres
Publié: (2024)
GuardTrace-VL: Detecting Unsafe Multimodel Reasoning via Iterative Safety Supervision
par: Xiang, Yuxiao, et autres
Publié: (2025)
par: Xiang, Yuxiao, et autres
Publié: (2025)
WavInWav: Time-domain Speech Hiding via Invertible Neural Network
par: Fan, Wei, et autres
Publié: (2025)
par: Fan, Wei, et autres
Publié: (2025)
LiteUpdate: A Lightweight Framework for Updating AI-Generated Image Detectors
par: Lu, Jiajie, et autres
Publié: (2025)
par: Lu, Jiajie, et autres
Publié: (2025)
De-AntiFake: Rethinking the Protective Perturbations Against Voice Cloning Attacks
par: Fan, Wei, et autres
Publié: (2025)
par: Fan, Wei, et autres
Publié: (2025)
AutoPT: How Far Are We from the End2End Automated Web Penetration Testing?
par: Wu, Benlong, et autres
Publié: (2024)
par: Wu, Benlong, et autres
Publié: (2024)
SemBind: Binding Diffusion Watermarks to Semantics Against Black-Box Forgery Attacks
par: Zhang, Xin, et autres
Publié: (2026)
par: Zhang, Xin, et autres
Publié: (2026)
Gaussian Shading++: Rethinking the Realistic Deployment Challenge of Performance-Lossless Image Watermark for Diffusion Models
par: Yang, Zijin, et autres
Publié: (2025)
par: Yang, Zijin, et autres
Publié: (2025)
TraceGuard: Process-Guided Firewall against Reasoning Backdoors in Large Language Models
par: Guo, Zhen, et autres
Publié: (2026)
par: Guo, Zhen, et autres
Publié: (2026)
Membership Inference Attacks on Tokenizers of Large Language Models
par: Tong, Meng, et autres
Publié: (2025)
par: Tong, Meng, et autres
Publié: (2025)
Model X-ray:Detecting Backdoored Models via Decision Boundary
par: Su, Yanghao, et autres
Publié: (2024)
par: Su, Yanghao, et autres
Publié: (2024)
AquaLoRA: Toward White-box Protection for Customized Stable Diffusion Models via Watermark LoRA
par: Feng, Weitao, et autres
Publié: (2024)
par: Feng, Weitao, et autres
Publié: (2024)
FoC: Figure out the Cryptographic Functions in Stripped Binaries with LLMs
par: Shang, Xiuwei, et autres
Publié: (2024)
par: Shang, Xiuwei, et autres
Publié: (2024)
BURN: Backdoor Unlearning via Adversarial Boundary Analysis
par: Su, Yanghao, et autres
Publié: (2025)
par: Su, Yanghao, et autres
Publié: (2025)
SafeGuider: Robust and Practical Content Safety Control for Text-to-Image Models
par: Qi, Peigui, et autres
Publié: (2025)
par: Qi, Peigui, et autres
Publié: (2025)
GuardReasoner-Omni: A Reasoning-based Multi-modal Guardrail for Text, Image, Video, and Audio
par: Zhu, Zhenhao, et autres
Publié: (2026)
par: Zhu, Zhenhao, et autres
Publié: (2026)
WebAgentGuard: A Reasoning-Driven Guard Model for Detecting Prompt Injection Attacks in Web Agents
par: Chen, Yulin, et autres
Publié: (2026)
par: Chen, Yulin, et autres
Publié: (2026)
GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning
par: Liu, Yue, et autres
Publié: (2025)
par: Liu, Yue, et autres
Publié: (2025)
Beyond the Edge of Function: Unraveling the Patterns of Type Recovery in Binary Code
par: Li, Gangyang, et autres
Publié: (2025)
par: Li, Gangyang, et autres
Publié: (2025)
ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning
par: Zhao, Zhengyue, et autres
Publié: (2025)
par: Zhao, Zhengyue, et autres
Publié: (2025)
An Empirical Study on the Effectiveness of Large Language Models for Binary Code Understanding
par: Shang, Xiuwei, et autres
Publié: (2025)
par: Shang, Xiuwei, et autres
Publié: (2025)
State-Dependent Safety Failures in Multi-Turn Language Model Interaction
par: Li, Pengcheng, et autres
Publié: (2026)
par: Li, Pengcheng, et autres
Publié: (2026)
How Far Have We Gone in Binary Code Understanding Using Large Language Models
par: Shang, Xiuwei, et autres
Publié: (2024)
par: Shang, Xiuwei, et autres
Publié: (2024)
Poly-Guard: Massive Multi-Domain Safety Policy-Grounded Guardrail Dataset
par: Kang, Mintong, et autres
Publié: (2025)
par: Kang, Mintong, et autres
Publié: (2025)
Documents similaires
-
Silent Guardian: Protecting Text from Malicious Exploitation by Large Language Models
par: Zhao, Jiawei, et autres
Publié: (2023) -
SQL Injection Jailbreak: A Structural Disaster of Large Language Models
par: Zhao, Jiawei, et autres
Publié: (2024) -
Provably Secure Disambiguating Neural Linguistic Steganography
par: Qi, Yuang, et autres
Publié: (2024) -
STEAD: Robust Provably Secure Linguistic Steganography with Diffusion Language Model
par: Qi, Yuang, et autres
Publié: (2026) -
Performance-lossless Black-box Model Watermarking
par: Zhao, Na, et autres
Publié: (2023)