Legilimens: Practical and Unified Content Moderation for Large Language Model Services
Fuente:
arXiv
Saved in:
| Main Authors: | Wu, Jialin, Deng, Jiangyi, Pang, Shengyuan, Chen, Yanjiao, Xu, Jiayang, Li, Xinfeng, Xu, Wenyuan |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SafeGen: Mitigating Sexually Explicit Content Generation in Text-to-Image Models
by: Li, Xinfeng, et al.
Published: (2024)
by: Li, Xinfeng, et al.
Published: (2024)
Patronus: Safeguarding Text-to-Image Models against White-Box Adversaries
by: Li, Xinfeng, et al.
Published: (2025)
by: Li, Xinfeng, et al.
Published: (2025)
Protego: Detecting Adversarial Examples for Vision Transformers via Intrinsic Capabilities
by: Wu, Jialin, et al.
Published: (2025)
by: Wu, Jialin, et al.
Published: (2025)
EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
by: Wu, Jialin, et al.
Published: (2025)
by: Wu, Jialin, et al.
Published: (2025)
SOPHON: Non-Fine-Tunable Learning to Restrain Task Transferability For Pre-trained Models
by: Deng, Jiangyi, et al.
Published: (2024)
by: Deng, Jiangyi, et al.
Published: (2024)
RACONTEUR: A Knowledgeable, Insightful, and Portable LLM-Powered Shell Command Explainer
by: Deng, Jiangyi, et al.
Published: (2024)
by: Deng, Jiangyi, et al.
Published: (2024)
Large Language Models for Education: A Survey
by: Xu, Hanyi, et al.
Published: (2024)
by: Xu, Hanyi, et al.
Published: (2024)
Enhancing Content-based Recommendation via Large Language Model
by: Xu, Wentao, et al.
Published: (2024)
by: Xu, Wentao, et al.
Published: (2024)
ICM-Assistant: Instruction-tuning Multimodal Large Language Models for Rule-based Explainable Image Content Moderation
by: Wu, Mengyang, et al.
Published: (2024)
by: Wu, Mengyang, et al.
Published: (2024)
Multilingual Jailbreak Challenges in Large Language Models
by: Deng, Yue, et al.
Published: (2023)
by: Deng, Yue, et al.
Published: (2023)
SLM-Mod: Small Language Models Surpass LLMs at Content Moderation
by: Zhan, Xianyang, et al.
Published: (2024)
by: Zhan, Xianyang, et al.
Published: (2024)
Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy
by: Jiang, Eric Hanchen, et al.
Published: (2025)
by: Jiang, Eric Hanchen, et al.
Published: (2025)
Semi-Supervised Learning for Large Language Models Safety and Content Moderation
by: Dinuta, Eduard Stefan, et al.
Published: (2025)
by: Dinuta, Eduard Stefan, et al.
Published: (2025)
Beyond Surface Reasoning: Unveiling the True Long Chain-of-Thought Capacity of Diffusion Large Language Models
by: Chen, Qiguang, et al.
Published: (2025)
by: Chen, Qiguang, et al.
Published: (2025)
Watch Your Language: Investigating Content Moderation with Large Language Models
by: Kumar, Deepak, et al.
Published: (2023)
by: Kumar, Deepak, et al.
Published: (2023)
RAGLAB: A Modular and Research-Oriented Unified Framework for Retrieval-Augmented Generation
by: Zhang, Xuanwang, et al.
Published: (2024)
by: Zhang, Xuanwang, et al.
Published: (2024)
Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation
by: Zhuang, Jun, et al.
Published: (2025)
by: Zhuang, Jun, et al.
Published: (2025)
STAND-Guard: A Small Task-Adaptive Content Moderation Model
by: Wang, Minjia, et al.
Published: (2024)
by: Wang, Minjia, et al.
Published: (2024)
Digger: Detecting Copyright Content Mis-usage in Large Language Model Training
by: Li, Haodong, et al.
Published: (2024)
by: Li, Haodong, et al.
Published: (2024)
UniChange: Unifying Change Detection with Multimodal Large Language Model
by: Zhang, Xu, et al.
Published: (2025)
by: Zhang, Xu, et al.
Published: (2025)
Evaluating Character Understanding of Large Language Models via Character Profiling from Fictional Works
by: Yuan, Xinfeng, et al.
Published: (2024)
by: Yuan, Xinfeng, et al.
Published: (2024)
Attention is All You Need to Defend Against Indirect Prompt Injection Attacks in LLMs
by: Zhong, Yinan, et al.
Published: (2025)
by: Zhong, Yinan, et al.
Published: (2025)
How Controllable Are Large Language Models? A Unified Evaluation across Behavioral Granularities
by: Xu, Ziwen, et al.
Published: (2026)
by: Xu, Ziwen, et al.
Published: (2026)
Entity Alignment with Noisy Annotations from Large Language Models
by: Chen, Shengyuan, et al.
Published: (2024)
by: Chen, Shengyuan, et al.
Published: (2024)
Like a Good Nearest Neighbor: Practical Content Moderation and Text Classification
by: Bates, Luke, et al.
Published: (2023)
by: Bates, Luke, et al.
Published: (2023)
Large Language Models Know What Makes Exemplary Contexts
by: Long, Quanyu, et al.
Published: (2024)
by: Long, Quanyu, et al.
Published: (2024)
What Large Language Models Do Not Talk About: An Empirical Study of Moderation and Censorship Practices
by: Noels, Sander, et al.
Published: (2025)
by: Noels, Sander, et al.
Published: (2025)
UnifiedMLLM: Enabling Unified Representation for Multi-modal Multi-tasks With Large Language Model
by: Li, Zhaowei, et al.
Published: (2024)
by: Li, Zhaowei, et al.
Published: (2024)
Structure Guided Large Language Model for SQL Generation
by: Zhang, Qinggang, et al.
Published: (2024)
by: Zhang, Qinggang, et al.
Published: (2024)
LoRA-Guard: Parameter-Efficient Guardrail Adaptation for Content Moderation of Large Language Models
by: Elesedy, Hayder, et al.
Published: (2024)
by: Elesedy, Hayder, et al.
Published: (2024)
Stable Knowledge Editing in Large Language Models
by: Wei, Zihao, et al.
Published: (2024)
by: Wei, Zihao, et al.
Published: (2024)
Denial-of-Service Poisoning Attacks against Large Language Models
by: Gao, Kuofeng, et al.
Published: (2024)
by: Gao, Kuofeng, et al.
Published: (2024)
Lightweight Stylistic Consistency Profiling: Robust Detection of LLM-Generated Textual Content for Multimedia Moderation
by: Li, Siyuan, et al.
Published: (2026)
by: Li, Siyuan, et al.
Published: (2026)
Unifying Large Language Models and Knowledge Graphs: A Roadmap
by: Pan, Shirui, et al.
Published: (2023)
by: Pan, Shirui, et al.
Published: (2023)
S-GRPO: Unified Post-Training for Large Vision-Language Models
by: Yan, Yuming, et al.
Published: (2026)
by: Yan, Yuming, et al.
Published: (2026)
Look Before You Leap: An Exploratory Study of Uncertainty Measurement for Large Language Models
by: Huang, Yuheng, et al.
Published: (2023)
by: Huang, Yuheng, et al.
Published: (2023)
Redefining Machine Translation on Social Network Services with Large Language Models
by: Guo, Hongcheng, et al.
Published: (2025)
by: Guo, Hongcheng, et al.
Published: (2025)
Hit the Sweet Spot! Span-Level Ensemble for Large Language Models
by: Xu, Yangyifan, et al.
Published: (2024)
by: Xu, Yangyifan, et al.
Published: (2024)
Ideology-Based LLMs for Content Moderation
by: Civelli, Stefano, et al.
Published: (2025)
by: Civelli, Stefano, et al.
Published: (2025)
Learning to Rank Chain-of-Thought: Using a Small Model
by: Jiang, Eric Hanchen, et al.
Published: (2025)
by: Jiang, Eric Hanchen, et al.
Published: (2025)
Similar Items
-
SafeGen: Mitigating Sexually Explicit Content Generation in Text-to-Image Models
by: Li, Xinfeng, et al.
Published: (2024) -
Patronus: Safeguarding Text-to-Image Models against White-Box Adversaries
by: Li, Xinfeng, et al.
Published: (2025) -
Protego: Detecting Adversarial Examples for Vision Transformers via Intrinsic Capabilities
by: Wu, Jialin, et al.
Published: (2025) -
EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
by: Wu, Jialin, et al.
Published: (2025) -
SOPHON: Non-Fine-Tunable Learning to Restrain Task Transferability For Pre-trained Models
by: Deng, Jiangyi, et al.
Published: (2024)