RigorLLM: Resilient Guardrails for Large Language Models against Undesired Content
Fuente:
arXiv
Salvato in:
| Autori principali: | Yuan, Zhuowen, Xiong, Zidi, Zeng, Yi, Yu, Ning, Jia, Ruoxi, Song, Dawn, Li, Bo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models
di: Zeng, Yi, et al.
Pubblicazione: (2024)
di: Zeng, Yi, et al.
Pubblicazione: (2024)
CBD: A Certified Backdoor Detector Based on Local Dominant Probability
di: Xiang, Zhen, et al.
Pubblicazione: (2023)
di: Xiang, Zhen, et al.
Pubblicazione: (2023)
BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models
di: Xiang, Zhen, et al.
Pubblicazione: (2024)
di: Xiang, Zhen, et al.
Pubblicazione: (2024)
Peering Behind the Shield: Guardrail Identification in Large Language Models
di: Yang, Ziqing, et al.
Pubblicazione: (2025)
di: Yang, Ziqing, et al.
Pubblicazione: (2025)
ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models
di: Zhao, Yunhan, et al.
Pubblicazione: (2026)
di: Zhao, Yunhan, et al.
Pubblicazione: (2026)
OpenGuardrails: A Configurable, Unified, and Scalable Guardrails Platform for Large Language Models
di: Wang, Thomas, et al.
Pubblicazione: (2025)
di: Wang, Thomas, et al.
Pubblicazione: (2025)
SpatialJB: How Text Distribution Art Becomes the "Jailbreak Key" for LLM Guardrails
di: Mou, Zhiyi, et al.
Pubblicazione: (2026)
di: Mou, Zhiyi, et al.
Pubblicazione: (2026)
Active Honeypot Guardrail System: Probing and Confirming Multi-Turn LLM Jailbreaks
di: Wu, ChenYu, et al.
Pubblicazione: (2025)
di: Wu, ChenYu, et al.
Pubblicazione: (2025)
MalTool: Malicious Tool Attacks on LLM Agents
di: Hu, Yuepeng, et al.
Pubblicazione: (2026)
di: Hu, Yuepeng, et al.
Pubblicazione: (2026)
Decompiling Smart Contracts with a Large Language Model
di: David, Isaac, et al.
Pubblicazione: (2025)
di: David, Isaac, et al.
Pubblicazione: (2025)
SoK: Evaluating Jailbreak Guardrails for Large Language Models
di: Wang, Xunguang, et al.
Pubblicazione: (2025)
di: Wang, Xunguang, et al.
Pubblicazione: (2025)
Guardrails for trust, safety, and ethical development and deployment of Large Language Models (LLM)
di: Biswas, Anjanava, et al.
Pubblicazione: (2026)
di: Biswas, Anjanava, et al.
Pubblicazione: (2026)
A Critical Evaluation of Defenses against Prompt Injection Attacks
di: Jia, Yuqi, et al.
Pubblicazione: (2025)
di: Jia, Yuqi, et al.
Pubblicazione: (2025)
Poly-Guard: Massive Multi-Domain Safety Policy-Grounded Guardrail Dataset
di: Kang, Mintong, et al.
Pubblicazione: (2025)
di: Kang, Mintong, et al.
Pubblicazione: (2025)
The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search
di: Wei, Rongzhe, et al.
Pubblicazione: (2025)
di: Wei, Rongzhe, et al.
Pubblicazione: (2025)
LLM-PBE: Assessing Data Privacy in Large Language Models
di: Li, Qinbin, et al.
Pubblicazione: (2024)
di: Li, Qinbin, et al.
Pubblicazione: (2024)
Interpretable LLM Guardrails via Sparse Representation Steering
di: He, Zeqing, et al.
Pubblicazione: (2025)
di: He, Zeqing, et al.
Pubblicazione: (2025)
Memory-Induced Tool-Drift in LLM Agents
di: Dabas, Mahavir, et al.
Pubblicazione: (2026)
di: Dabas, Mahavir, et al.
Pubblicazione: (2026)
TraceGuard: Process-Guided Firewall against Reasoning Backdoors in Large Language Models
di: Guo, Zhen, et al.
Pubblicazione: (2026)
di: Guo, Zhen, et al.
Pubblicazione: (2026)
Prompt Inversion Attack against Collaborative Inference of Large Language Models
di: Qu, Wenjie, et al.
Pubblicazione: (2025)
di: Qu, Wenjie, et al.
Pubblicazione: (2025)
Rotated Robustness: A Training-Free Defense against Bit-Flip Attacks on Large Language Models
di: Liu, Deng, et al.
Pubblicazione: (2026)
di: Liu, Deng, et al.
Pubblicazione: (2026)
Provably Secure Agent Guardrail
di: Wu, Benlong, et al.
Pubblicazione: (2026)
di: Wu, Benlong, et al.
Pubblicazione: (2026)
AutoIoT: Automated IoT Platform Using Large Language Models
di: Cheng, Ye, et al.
Pubblicazione: (2024)
di: Cheng, Ye, et al.
Pubblicazione: (2024)
Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
di: Xiong, Chen, et al.
Pubblicazione: (2024)
di: Xiong, Chen, et al.
Pubblicazione: (2024)
SGuard-v1: Safety Guardrail for Large Language Models
di: Lee, JoonHo, et al.
Pubblicazione: (2025)
di: Lee, JoonHo, et al.
Pubblicazione: (2025)
Evaluating the Robustness of Large Language Model Safety Guardrails Against Adversarial Attacks
di: Young, Richard J.
Pubblicazione: (2025)
di: Young, Richard J.
Pubblicazione: (2025)
Bones of Contention: Exploring Query-Efficient Attacks against Skeleton Recognition Systems
di: Cao, Yuxin, et al.
Pubblicazione: (2025)
di: Cao, Yuxin, et al.
Pubblicazione: (2025)
MMDT: Decoding the Trustworthiness and Safety of Multimodal Foundation Models
di: Xu, Chejian, et al.
Pubblicazione: (2025)
di: Xu, Chejian, et al.
Pubblicazione: (2025)
Leakage-Resilient and Carbon-Neutral Aggregation Featuring the Federated AI-enabled Critical Infrastructure
di: Deng, Zehang, et al.
Pubblicazione: (2024)
di: Deng, Zehang, et al.
Pubblicazione: (2024)
Cachemir: Fully Homomorphic Encrypted Inference of Generative Large Language Model with KV Cache
di: Yu, Ye, et al.
Pubblicazione: (2026)
di: Yu, Ye, et al.
Pubblicazione: (2026)
Securing LLM Agents Need Intent-to-Execution Integrity
di: Qu, Wenjie, et al.
Pubblicazione: (2026)
di: Qu, Wenjie, et al.
Pubblicazione: (2026)
PoseGuard: Pose-Guided Generation with Safety Guardrails
di: Wang, Kongxin, et al.
Pubblicazione: (2025)
di: Wang, Kongxin, et al.
Pubblicazione: (2025)
Under-confidence Backdoors Are Resilient and Stealthy Backdoors
di: Peng, Minlong, et al.
Pubblicazione: (2022)
di: Peng, Minlong, et al.
Pubblicazione: (2022)
DiffAttack: Evasion Attacks Against Diffusion-Based Adversarial Purification
di: Kang, Mintong, et al.
Pubblicazione: (2023)
di: Kang, Mintong, et al.
Pubblicazione: (2023)
No Free Lunch with Guardrails
di: Kumar, Divyanshu, et al.
Pubblicazione: (2025)
di: Kumar, Divyanshu, et al.
Pubblicazione: (2025)
OneShield -- the Next Generation of LLM Guardrails
di: DeLuca, Chad, et al.
Pubblicazione: (2025)
di: DeLuca, Chad, et al.
Pubblicazione: (2025)
Auto-Tuning Safety Guardrails for Black-Box Large Language Models
di: Abdulkadir, Perry
Pubblicazione: (2025)
di: Abdulkadir, Perry
Pubblicazione: (2025)
External Data Extraction Attacks against Retrieval-Augmented Large Language Models
di: He, Yu, et al.
Pubblicazione: (2025)
di: He, Yu, et al.
Pubblicazione: (2025)
Sticky Fingers: Resilience of Satellite Fingerprinting against Jamming Attacks
di: Smailes, Joshua, et al.
Pubblicazione: (2024)
di: Smailes, Joshua, et al.
Pubblicazione: (2024)
TWGuard: A Case Study of LLM Safety Guardrails for Localized Linguistic Contexts
di: Chu, Hua-Rong, et al.
Pubblicazione: (2026)
di: Chu, Hua-Rong, et al.
Pubblicazione: (2026)
Documenti analoghi
-
BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models
di: Zeng, Yi, et al.
Pubblicazione: (2024) -
CBD: A Certified Backdoor Detector Based on Local Dominant Probability
di: Xiang, Zhen, et al.
Pubblicazione: (2023) -
BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models
di: Xiang, Zhen, et al.
Pubblicazione: (2024) -
Peering Behind the Shield: Guardrail Identification in Large Language Models
di: Yang, Ziqing, et al.
Pubblicazione: (2025) -
ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models
di: Zhao, Yunhan, et al.
Pubblicazione: (2026)