Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhuang, Jun, Jin, Haibo, Zhang, Ye, Kang, Zhengjian, Zhang, Wenbin, Dagher, Gaby G., Wang, Haohan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters
par: Jin, Haibo, et autres
Publié: (2024)
par: Jin, Haibo, et autres
Publié: (2024)
Now You Hear Me: Audio Narrative Attacks Against Large Audio-Language Models
par: Yu, Ye, et autres
Publié: (2026)
par: Yu, Ye, et autres
Publié: (2026)
InfoFlood: Jailbreaking Large Language Models with Information Overload
par: Yadav, Advait, et autres
Publié: (2025)
par: Yadav, Advait, et autres
Publié: (2025)
Learning to Conceal Risk: Controllable Multi-turn Red Teaming for LLMs in the Financial Domain
par: Cheng, Gang, et autres
Publié: (2025)
par: Cheng, Gang, et autres
Publié: (2025)
From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models
par: Jin, Haibo, et autres
Publié: (2025)
par: Jin, Haibo, et autres
Publié: (2025)
GuardVal: Dynamic Large Language Model Jailbreak Evaluation for Comprehensive Safety Testing
par: Zhang, Peiyan, et autres
Publié: (2025)
par: Zhang, Peiyan, et autres
Publié: (2025)
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
par: Jin, Haibo, et autres
Publié: (2024)
par: Jin, Haibo, et autres
Publié: (2024)
Reasoning Can Hurt the Inductive Abilities of Large Language Models
par: Jin, Haibo, et autres
Publié: (2025)
par: Jin, Haibo, et autres
Publié: (2025)
LoRA-Guard: Parameter-Efficient Guardrail Adaptation for Content Moderation of Large Language Models
par: Elesedy, Hayder, et autres
Publié: (2024)
par: Elesedy, Hayder, et autres
Publié: (2024)
Probing Causality Manipulation of Large Language Models
par: Zhang, Chenyang, et autres
Publié: (2024)
par: Zhang, Chenyang, et autres
Publié: (2024)
Blockchain for Large Language Model Security and Safety: A Holistic Survey
par: Geren, Caleb, et autres
Publié: (2024)
par: Geren, Caleb, et autres
Publié: (2024)
GUARD: Role-playing to Generate Natural-language Jailbreakings to Test Guideline Adherence of Large Language Models
par: Jin, Haibo, et autres
Publié: (2024)
par: Jin, Haibo, et autres
Publié: (2024)
Building Guardrails for Large Language Models
par: Dong, Yi, et autres
Publié: (2024)
par: Dong, Yi, et autres
Publié: (2024)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
par: Huang, Tiansheng, et autres
Publié: (2025)
par: Huang, Tiansheng, et autres
Publié: (2025)
The Unappreciated Role of Intent in Algorithmic Moderation of Social Media Content
par: Wang, Xinyu, et autres
Publié: (2024)
par: Wang, Xinyu, et autres
Publié: (2024)
RigorLLM: Resilient Guardrails for Large Language Models against Undesired Content
par: Yuan, Zhuowen, et autres
Publié: (2024)
par: Yuan, Zhuowen, et autres
Publié: (2024)
OpenGuardrails: A Configurable, Unified, and Scalable Guardrails Platform for Large Language Models
par: Wang, Thomas, et autres
Publié: (2025)
par: Wang, Thomas, et autres
Publié: (2025)
A Causal Explainable Guardrails for Large Language Models
par: Chu, Zhixuan, et autres
Publié: (2024)
par: Chu, Zhixuan, et autres
Publié: (2024)
Adaptive Honeypot Allocation in Multi-Attacker Networks via Bayesian Stackelberg Games
par: Park, Dongyoung, et autres
Publié: (2025)
par: Park, Dongyoung, et autres
Publié: (2025)
SGuard-v1: Safety Guardrail for Large Language Models
par: Lee, JoonHo, et autres
Publié: (2025)
par: Lee, JoonHo, et autres
Publié: (2025)
Legilimens: Practical and Unified Content Moderation for Large Language Model Services
par: Wu, Jialin, et autres
Publié: (2024)
par: Wu, Jialin, et autres
Publié: (2024)
A Non-Zero-Sum Game Model for Optimal Cyber Defense Strategies
par: Park, Dongyoung, et autres
Publié: (2025)
par: Park, Dongyoung, et autres
Publié: (2025)
SafeRoute: Adaptive Model Selection for Efficient and Accurate Safety Guardrails in Large Language Models
par: Lee, Seanie, et autres
Publié: (2025)
par: Lee, Seanie, et autres
Publié: (2025)
Trust-Oriented Adaptive Guardrails for Large Language Models
par: Hu, Jinwei, et autres
Publié: (2024)
par: Hu, Jinwei, et autres
Publié: (2024)
Wi-Chat: Large Language Model Powered Wi-Fi Sensing
par: Zhang, Haopeng, et autres
Publié: (2025)
par: Zhang, Haopeng, et autres
Publié: (2025)
Learning to Communicate: Toward End-to-End Optimization of Multi-Agent Language Systems
par: Yu, Ye, et autres
Publié: (2026)
par: Yu, Ye, et autres
Publié: (2026)
Break Me If You Can: Self-Jailbreaking of Aligned LLMs via Lexical Insertion Prompting
par: Kulshreshtha, Devang, et autres
Publié: (2026)
par: Kulshreshtha, Devang, et autres
Publié: (2026)
SentGuard: Sentence-Level Streaming Guardrails for Large Language Models
par: Yu, Jiaqi, et autres
Publié: (2026)
par: Yu, Jiaqi, et autres
Publié: (2026)
ChallengeMe: An Adversarial Learning-enabled Text Summarization Framework
par: Deng, Xiaoyu, et autres
Publié: (2025)
par: Deng, Xiaoyu, et autres
Publié: (2025)
IntentGPT: Few-shot Intent Discovery with Large Language Models
par: Rodriguez, Juan A., et autres
Publié: (2024)
par: Rodriguez, Juan A., et autres
Publié: (2024)
Agent Primitives: Reusable Latent Building Blocks for Multi-Agent Systems
par: Jin, Haibo, et autres
Publié: (2026)
par: Jin, Haibo, et autres
Publié: (2026)
Semi-Supervised Learning for Large Language Models Safety and Content Moderation
par: Dinuta, Eduard Stefan, et autres
Publié: (2025)
par: Dinuta, Eduard Stefan, et autres
Publié: (2025)
Fake News Detection and Manipulation Reasoning via Large Vision-Language Models
par: Jin, Ruihan, et autres
Publié: (2024)
par: Jin, Ruihan, et autres
Publié: (2024)
Unlocking the Future: Exploring Look-Ahead Planning Mechanistic Interpretability in Large Language Models
par: Men, Tianyi, et autres
Publié: (2024)
par: Men, Tianyi, et autres
Publié: (2024)
Query Performance Explanation through Large Language Model for HTAP Systems
par: Xiu, Haibo, et autres
Publié: (2024)
par: Xiu, Haibo, et autres
Publié: (2024)
Large Language Models are Vulnerable to Bait-and-Switch Attacks for Generating Harmful Content
par: Bianchi, Federico, et autres
Publié: (2024)
par: Bianchi, Federico, et autres
Publié: (2024)
TextReg: Mitigating Prompt Distributional Overfitting via Regularized Text-Space Optimization
par: Fu, Lucheng, et autres
Publié: (2026)
par: Fu, Lucheng, et autres
Publié: (2026)
Fairness in Large Language Models: A Taxonomic Survey
par: Chu, Zhibo, et autres
Publié: (2024)
par: Chu, Zhibo, et autres
Publié: (2024)
Watch Your Language: Investigating Content Moderation with Large Language Models
par: Kumar, Deepak, et autres
Publié: (2023)
par: Kumar, Deepak, et autres
Publié: (2023)
Capsule Network-Based Semantic Intent Modeling for Human-Computer Interaction
par: Wang, Shixiao, et autres
Publié: (2025)
par: Wang, Shixiao, et autres
Publié: (2025)
Documents similaires
-
Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters
par: Jin, Haibo, et autres
Publié: (2024) -
Now You Hear Me: Audio Narrative Attacks Against Large Audio-Language Models
par: Yu, Ye, et autres
Publié: (2026) -
InfoFlood: Jailbreaking Large Language Models with Information Overload
par: Yadav, Advait, et autres
Publié: (2025) -
Learning to Conceal Risk: Controllable Multi-turn Red Teaming for LLMs in the Financial Domain
par: Cheng, Gang, et autres
Publié: (2025) -
From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models
par: Jin, Haibo, et autres
Publié: (2025)