Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhuang, Jun, Jin, Haibo, Zhang, Ye, Kang, Zhengjian, Zhang, Wenbin, Dagher, Gaby G., Wang, Haohan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters
por: Jin, Haibo, et al.
Publicado: (2024)
por: Jin, Haibo, et al.
Publicado: (2024)
Now You Hear Me: Audio Narrative Attacks Against Large Audio-Language Models
por: Yu, Ye, et al.
Publicado: (2026)
por: Yu, Ye, et al.
Publicado: (2026)
InfoFlood: Jailbreaking Large Language Models with Information Overload
por: Yadav, Advait, et al.
Publicado: (2025)
por: Yadav, Advait, et al.
Publicado: (2025)
Learning to Conceal Risk: Controllable Multi-turn Red Teaming for LLMs in the Financial Domain
por: Cheng, Gang, et al.
Publicado: (2025)
por: Cheng, Gang, et al.
Publicado: (2025)
From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models
por: Jin, Haibo, et al.
Publicado: (2025)
por: Jin, Haibo, et al.
Publicado: (2025)
GuardVal: Dynamic Large Language Model Jailbreak Evaluation for Comprehensive Safety Testing
por: Zhang, Peiyan, et al.
Publicado: (2025)
por: Zhang, Peiyan, et al.
Publicado: (2025)
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
por: Jin, Haibo, et al.
Publicado: (2024)
por: Jin, Haibo, et al.
Publicado: (2024)
Reasoning Can Hurt the Inductive Abilities of Large Language Models
por: Jin, Haibo, et al.
Publicado: (2025)
por: Jin, Haibo, et al.
Publicado: (2025)
LoRA-Guard: Parameter-Efficient Guardrail Adaptation for Content Moderation of Large Language Models
por: Elesedy, Hayder, et al.
Publicado: (2024)
por: Elesedy, Hayder, et al.
Publicado: (2024)
Probing Causality Manipulation of Large Language Models
por: Zhang, Chenyang, et al.
Publicado: (2024)
por: Zhang, Chenyang, et al.
Publicado: (2024)
Blockchain for Large Language Model Security and Safety: A Holistic Survey
por: Geren, Caleb, et al.
Publicado: (2024)
por: Geren, Caleb, et al.
Publicado: (2024)
GUARD: Role-playing to Generate Natural-language Jailbreakings to Test Guideline Adherence of Large Language Models
por: Jin, Haibo, et al.
Publicado: (2024)
por: Jin, Haibo, et al.
Publicado: (2024)
Building Guardrails for Large Language Models
por: Dong, Yi, et al.
Publicado: (2024)
por: Dong, Yi, et al.
Publicado: (2024)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
por: Huang, Tiansheng, et al.
Publicado: (2025)
por: Huang, Tiansheng, et al.
Publicado: (2025)
The Unappreciated Role of Intent in Algorithmic Moderation of Social Media Content
por: Wang, Xinyu, et al.
Publicado: (2024)
por: Wang, Xinyu, et al.
Publicado: (2024)
RigorLLM: Resilient Guardrails for Large Language Models against Undesired Content
por: Yuan, Zhuowen, et al.
Publicado: (2024)
por: Yuan, Zhuowen, et al.
Publicado: (2024)
OpenGuardrails: A Configurable, Unified, and Scalable Guardrails Platform for Large Language Models
por: Wang, Thomas, et al.
Publicado: (2025)
por: Wang, Thomas, et al.
Publicado: (2025)
A Causal Explainable Guardrails for Large Language Models
por: Chu, Zhixuan, et al.
Publicado: (2024)
por: Chu, Zhixuan, et al.
Publicado: (2024)
Adaptive Honeypot Allocation in Multi-Attacker Networks via Bayesian Stackelberg Games
por: Park, Dongyoung, et al.
Publicado: (2025)
por: Park, Dongyoung, et al.
Publicado: (2025)
SGuard-v1: Safety Guardrail for Large Language Models
por: Lee, JoonHo, et al.
Publicado: (2025)
por: Lee, JoonHo, et al.
Publicado: (2025)
Legilimens: Practical and Unified Content Moderation for Large Language Model Services
por: Wu, Jialin, et al.
Publicado: (2024)
por: Wu, Jialin, et al.
Publicado: (2024)
A Non-Zero-Sum Game Model for Optimal Cyber Defense Strategies
por: Park, Dongyoung, et al.
Publicado: (2025)
por: Park, Dongyoung, et al.
Publicado: (2025)
SafeRoute: Adaptive Model Selection for Efficient and Accurate Safety Guardrails in Large Language Models
por: Lee, Seanie, et al.
Publicado: (2025)
por: Lee, Seanie, et al.
Publicado: (2025)
Trust-Oriented Adaptive Guardrails for Large Language Models
por: Hu, Jinwei, et al.
Publicado: (2024)
por: Hu, Jinwei, et al.
Publicado: (2024)
Wi-Chat: Large Language Model Powered Wi-Fi Sensing
por: Zhang, Haopeng, et al.
Publicado: (2025)
por: Zhang, Haopeng, et al.
Publicado: (2025)
Learning to Communicate: Toward End-to-End Optimization of Multi-Agent Language Systems
por: Yu, Ye, et al.
Publicado: (2026)
por: Yu, Ye, et al.
Publicado: (2026)
Break Me If You Can: Self-Jailbreaking of Aligned LLMs via Lexical Insertion Prompting
por: Kulshreshtha, Devang, et al.
Publicado: (2026)
por: Kulshreshtha, Devang, et al.
Publicado: (2026)
SentGuard: Sentence-Level Streaming Guardrails for Large Language Models
por: Yu, Jiaqi, et al.
Publicado: (2026)
por: Yu, Jiaqi, et al.
Publicado: (2026)
ChallengeMe: An Adversarial Learning-enabled Text Summarization Framework
por: Deng, Xiaoyu, et al.
Publicado: (2025)
por: Deng, Xiaoyu, et al.
Publicado: (2025)
IntentGPT: Few-shot Intent Discovery with Large Language Models
por: Rodriguez, Juan A., et al.
Publicado: (2024)
por: Rodriguez, Juan A., et al.
Publicado: (2024)
Agent Primitives: Reusable Latent Building Blocks for Multi-Agent Systems
por: Jin, Haibo, et al.
Publicado: (2026)
por: Jin, Haibo, et al.
Publicado: (2026)
Semi-Supervised Learning for Large Language Models Safety and Content Moderation
por: Dinuta, Eduard Stefan, et al.
Publicado: (2025)
por: Dinuta, Eduard Stefan, et al.
Publicado: (2025)
Fake News Detection and Manipulation Reasoning via Large Vision-Language Models
por: Jin, Ruihan, et al.
Publicado: (2024)
por: Jin, Ruihan, et al.
Publicado: (2024)
Unlocking the Future: Exploring Look-Ahead Planning Mechanistic Interpretability in Large Language Models
por: Men, Tianyi, et al.
Publicado: (2024)
por: Men, Tianyi, et al.
Publicado: (2024)
Query Performance Explanation through Large Language Model for HTAP Systems
por: Xiu, Haibo, et al.
Publicado: (2024)
por: Xiu, Haibo, et al.
Publicado: (2024)
Large Language Models are Vulnerable to Bait-and-Switch Attacks for Generating Harmful Content
por: Bianchi, Federico, et al.
Publicado: (2024)
por: Bianchi, Federico, et al.
Publicado: (2024)
TextReg: Mitigating Prompt Distributional Overfitting via Regularized Text-Space Optimization
por: Fu, Lucheng, et al.
Publicado: (2026)
por: Fu, Lucheng, et al.
Publicado: (2026)
Fairness in Large Language Models: A Taxonomic Survey
por: Chu, Zhibo, et al.
Publicado: (2024)
por: Chu, Zhibo, et al.
Publicado: (2024)
Watch Your Language: Investigating Content Moderation with Large Language Models
por: Kumar, Deepak, et al.
Publicado: (2023)
por: Kumar, Deepak, et al.
Publicado: (2023)
Capsule Network-Based Semantic Intent Modeling for Human-Computer Interaction
por: Wang, Shixiao, et al.
Publicado: (2025)
por: Wang, Shixiao, et al.
Publicado: (2025)
Ejemplares similares
-
Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters
por: Jin, Haibo, et al.
Publicado: (2024) -
Now You Hear Me: Audio Narrative Attacks Against Large Audio-Language Models
por: Yu, Ye, et al.
Publicado: (2026) -
InfoFlood: Jailbreaking Large Language Models with Information Overload
por: Yadav, Advait, et al.
Publicado: (2025) -
Learning to Conceal Risk: Controllable Multi-turn Red Teaming for LLMs in the Financial Domain
por: Cheng, Gang, et al.
Publicado: (2025) -
From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models
por: Jin, Haibo, et al.
Publicado: (2025)