GMP: A Benchmark for Content Moderation under Co-occurring Violations and Dynamic Rules
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dong, Houde, She, Yifei, Ye, Kai, Su, Liangcai, Qian, Chenxiong, Hao, Jie |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ImportSnare: Directed "Code Manual" Hijacking in Retrieval-Augmented Code Generation
par: Ye, Kai, et autres
Publié: (2025)
par: Ye, Kai, et autres
Publié: (2025)
How Far Are We from True Unlearnability?
par: Ye, Kai, et autres
Publié: (2025)
par: Ye, Kai, et autres
Publié: (2025)
R1-Fuzz: Specializing Language Models for Textual Fuzzing via Reinforcement Learning
par: Lin, Jiayi, et autres
Publié: (2025)
par: Lin, Jiayi, et autres
Publié: (2025)
CONGRA: Benchmarking Automatic Conflict Resolution
par: Zhang, Qingyu, et autres
Publié: (2024)
par: Zhang, Qingyu, et autres
Publié: (2024)
CodeFuse-CommitEval: Towards Benchmarking LLM's Power on Commit Message and Code Change Inconsistency Detection
par: Zhang, Qingyu, et autres
Publié: (2025)
par: Zhang, Qingyu, et autres
Publié: (2025)
RuleSafe-VL: Evaluating Rule-Conditioned Decision Reasoning in Vision-Language Content Moderation
par: Lu, Zhifeng, et autres
Publié: (2026)
par: Lu, Zhifeng, et autres
Publié: (2026)
PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media
par: Kachwala, Zoher, et autres
Publié: (2026)
par: Kachwala, Zoher, et autres
Publié: (2026)
Rover: Context-aware Conflict Resolution with LLM
par: Zhang, Qingyu, et autres
Publié: (2026)
par: Zhang, Qingyu, et autres
Publié: (2026)
NoisyHate: Mining Online Human-Written Perturbations for Realistic Robustness Benchmarking of Content Moderation Models
par: Ye, Yiran, et autres
Publié: (2023)
par: Ye, Yiran, et autres
Publié: (2023)
Fusion to Enhance: Fusion Visual Encoder to Enhance Multimodal Language Model
par: She, Yifei, et autres
Publié: (2025)
par: She, Yifei, et autres
Publié: (2025)
Asking For It: Question-Answering for Predicting Rule Infractions in Online Content Moderation
par: Samory, Mattia, et autres
Publié: (2025)
par: Samory, Mattia, et autres
Publié: (2025)
GMPilot: An Expert AI Agent For FDA cGMP Compliance
par: Wang, Xiaohan, et autres
Publié: (2026)
par: Wang, Xiaohan, et autres
Publié: (2026)
CJEval: A Benchmark for Assessing Large Language Models Using Chinese Junior High School Exam Data
par: Zhang, Qian-Wen, et autres
Publié: (2024)
par: Zhang, Qian-Wen, et autres
Publié: (2024)
A Multi-Level Strategy for Deepfake Content Moderation under EU Regulation
par: Förster, Max-Paul, et autres
Publié: (2025)
par: Förster, Max-Paul, et autres
Publié: (2025)
IPS: In-Prompt Process Supervision for Short Video Content Moderation
par: Liu, Mingchao, et autres
Publié: (2024)
par: Liu, Mingchao, et autres
Publié: (2024)
CARO: Chain-of-Analogy Reasoning Optimization for Robust Content Moderation
par: Wu, Bingzhe, et autres
Publié: (2026)
par: Wu, Bingzhe, et autres
Publié: (2026)
Scaling Reinforcement Learning for Content Moderation with Large Language Models
par: Firooz, Hamed, et autres
Publié: (2025)
par: Firooz, Hamed, et autres
Publié: (2025)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
par: Gui, Jiayi, et autres
Publié: (2024)
par: Gui, Jiayi, et autres
Publié: (2024)
Which Contributions Deserve Credit? Perceptions of Attribution in Human-AI Co-Creation
par: He, Jessica, et autres
Publié: (2025)
par: He, Jessica, et autres
Publié: (2025)
PolitNuggets: Benchmarking Agentic Discovery of Long-Tail Political Facts
par: Zhu, Yifei
Publié: (2026)
par: Zhu, Yifei
Publié: (2026)
Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation
par: Zhuang, Jun, et autres
Publié: (2025)
par: Zhuang, Jun, et autres
Publié: (2025)
SketchRef: a Multi-Task Evaluation Benchmark for Sketch Synthesis
par: Lin, Xingyue, et autres
Publié: (2024)
par: Lin, Xingyue, et autres
Publié: (2024)
PRIOR: Perceptive Learning for Humanoid Locomotion with Reference Gait Priors
par: Han, Chenxi, et autres
Publié: (2026)
par: Han, Chenxi, et autres
Publié: (2026)
Context-Aware Content Moderation for German Newspaper Comments
par: Krejca, Felix, et autres
Publié: (2025)
par: Krejca, Felix, et autres
Publié: (2025)
X-Guard: Multilingual Guard Agent for Content Moderation
par: Upadhayay, Bibek, et autres
Publié: (2025)
par: Upadhayay, Bibek, et autres
Publié: (2025)
Rule Learning for Knowledge Graph Reasoning under Agnostic Distribution Shift
par: Liu, Shixuan, et autres
Publié: (2025)
par: Liu, Shixuan, et autres
Publié: (2025)
A Benchmark for Evaluating Outcome-Driven Constraint Violations in Autonomous AI Agents
par: Li, Miles Q., et autres
Publié: (2025)
par: Li, Miles Q., et autres
Publié: (2025)
Crucible: Quantifying the Potential of Control Algorithms through LLM Agents
par: Jia, Lianchen, et autres
Publié: (2025)
par: Jia, Lianchen, et autres
Publié: (2025)
EmoMM: Benchmarking and Steering MLLM for Multimodal Emotion Recognition under Conflict and Missingness
par: Sun, Yueru, et autres
Publié: (2026)
par: Sun, Yueru, et autres
Publié: (2026)
Majority Rules: LLM Ensemble is a Winning Approach for Content Categorization
par: Kamen, Ariel, et autres
Publié: (2025)
par: Kamen, Ariel, et autres
Publié: (2025)
Dynamic Content Moderation in Livestreams: Combining Supervised Classification with MLLM-Boosted Similarity Matching
par: Yew, Wei Chee, et autres
Publié: (2025)
par: Yew, Wei Chee, et autres
Publié: (2025)
Distribution Preference Optimization: A Fine-grained Perspective for LLM Unlearning
par: Qin, Kai, et autres
Publié: (2025)
par: Qin, Kai, et autres
Publié: (2025)
GMP-AR: Granularity Message Passing and Adaptive Reconciliation for Temporal Hierarchy Forecasting
par: Zhou, Fan, et autres
Publié: (2024)
par: Zhou, Fan, et autres
Publié: (2024)
AgentSwing: Adaptive Parallel Context Management Routing for Long-Horizon Web Agents
par: Feng, Zhaopeng, et autres
Publié: (2026)
par: Feng, Zhaopeng, et autres
Publié: (2026)
Advancing Embodied Agent Security: From Safety Benchmarks to Input Moderation
par: Wang, Ning, et autres
Publié: (2025)
par: Wang, Ning, et autres
Publié: (2025)
Metamorphic Testing for Audio Content Moderation Software
par: Wang, Wenxuan, et autres
Publié: (2025)
par: Wang, Wenxuan, et autres
Publié: (2025)
Class-RAG: Real-Time Content Moderation with Retrieval Augmented Generation
par: Chen, Jianfa, et autres
Publié: (2024)
par: Chen, Jianfa, et autres
Publié: (2024)
Socio-Culturally Aware Evaluation Framework for LLM-Based Content Moderation
par: Kumar, Shanu, et autres
Publié: (2024)
par: Kumar, Shanu, et autres
Publié: (2024)
Learned-Rule-Augmented Large Language Model Evaluators
par: Meng, Jie, et autres
Publié: (2025)
par: Meng, Jie, et autres
Publié: (2025)
Rule-based Classifier Models
par: Di Florio, Cecilia, et autres
Publié: (2025)
par: Di Florio, Cecilia, et autres
Publié: (2025)
Documents similaires
-
ImportSnare: Directed "Code Manual" Hijacking in Retrieval-Augmented Code Generation
par: Ye, Kai, et autres
Publié: (2025) -
How Far Are We from True Unlearnability?
par: Ye, Kai, et autres
Publié: (2025) -
R1-Fuzz: Specializing Language Models for Textual Fuzzing via Reinforcement Learning
par: Lin, Jiayi, et autres
Publié: (2025) -
CONGRA: Benchmarking Automatic Conflict Resolution
par: Zhang, Qingyu, et autres
Publié: (2024) -
CodeFuse-CommitEval: Towards Benchmarking LLM's Power on Commit Message and Code Change Inconsistency Detection
par: Zhang, Qingyu, et autres
Publié: (2025)