SoftHateBench: Evaluating Moderation Models Against Reasoning-Driven, Policy-Compliant Hostility
Fuente:
arXiv
Saved in:
| Main Authors: | Su, Xuanyu, Inkpen, Diana, Japkowicz, Nathalie |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
HateSieve: A Contrastive Learning Framework for Detecting and Segmenting Hateful Content in Multimodal Memes
by: Su, Xuanyu, et al.
Published: (2024)
by: Su, Xuanyu, et al.
Published: (2024)
uOttawa at LegalLens-2024: Transformer-based Classification Experiments
by: Meghdadi, Nima, et al.
Published: (2024)
by: Meghdadi, Nima, et al.
Published: (2024)
Robust Infidelity: When Faithfulness Measures on Masked Language Models Are Misleading
by: Crothers, Evan, et al.
Published: (2023)
by: Crothers, Evan, et al.
Published: (2023)
HateModerate: Testing Hate Speech Detectors against Content Moderation Policies
by: Zheng, Jiangrui, et al.
Published: (2023)
by: Zheng, Jiangrui, et al.
Published: (2023)
Let's CONFER: A Dataset for Evaluating Natural Language Inference Models on CONditional InFERence and Presupposition
by: Azin, Tara, et al.
Published: (2025)
by: Azin, Tara, et al.
Published: (2025)
Monitoring the evolution of antisemitic discourse on extremist social media using BERT
by: Mustafa, Raza Ul, et al.
Published: (2024)
by: Mustafa, Raza Ul, et al.
Published: (2024)
Do Language Models Know Theo Has a Wife? Investigating the Proviso Problem
by: Azin, Tara, et al.
Published: (2026)
by: Azin, Tara, et al.
Published: (2026)
The Enforcement and Feasibility of Hate Speech Moderation on Twitter
by: Tonneau, Manuel, et al.
Published: (2026)
by: Tonneau, Manuel, et al.
Published: (2026)
Moderating New Waves of Online Hate with Chain-of-Thought Reasoning in Large Language Models
by: Vishwamitra, Nishant, et al.
Published: (2023)
by: Vishwamitra, Nishant, et al.
Published: (2023)
Recent Advances in Hate Speech Moderation: Multimodality and the Role of Large Models
by: Hee, Ming Shan, et al.
Published: (2024)
by: Hee, Ming Shan, et al.
Published: (2024)
Evaluating Simple Debiasing Techniques in RoBERTa-based Hate Speech Detection Models
by: Iftimie, Diana, et al.
Published: (2025)
by: Iftimie, Diana, et al.
Published: (2025)
HateXScore: A Metric Suite for Evaluating Reasoning Quality in Hate Speech Explanations
by: Hu, Yujia, et al.
Published: (2026)
by: Hu, Yujia, et al.
Published: (2026)
SafetyBench: Evaluating the Safety of Large Language Models
by: Zhang, Zhexin, et al.
Published: (2023)
by: Zhang, Zhexin, et al.
Published: (2023)
Hostility Detection in UK Politics: A Dataset on Online Abuse Targeting MPs
by: Pandya, Mugdha, et al.
Published: (2024)
by: Pandya, Mugdha, et al.
Published: (2024)
Beyond Hate: Differentiating Uncivil and Intolerant Speech in Multimodal Content Moderation
by: Herrmann, Nils A., et al.
Published: (2026)
by: Herrmann, Nils A., et al.
Published: (2026)
Lost in Moderation: How Commercial Content Moderation APIs Over- and Under-Moderate Group-Targeted Hate Speech and Linguistic Variations
by: Hartmann, David, et al.
Published: (2025)
by: Hartmann, David, et al.
Published: (2025)
Explainability and Hate Speech: Structured Explanations Make Social Media Moderators Faster
by: Calabrese, Agostina, et al.
Published: (2024)
by: Calabrese, Agostina, et al.
Published: (2024)
"Is Hate Lost in Translation?": Evaluation of Multilingual LGBTQIA+ Hate Speech Detection
by: Chan, Fai Leui, et al.
Published: (2024)
by: Chan, Fai Leui, et al.
Published: (2024)
HatePRISM: Policies, Platforms, and Research Integration. Advancing NLP for Hate Speech Proactive Mitigation
by: Rizwan, Naquee, et al.
Published: (2025)
by: Rizwan, Naquee, et al.
Published: (2025)
E-CaTCH: Event-Centric Cross-Modal Attention with Temporal Consistency and Class-Imbalance Handling for Misinformation Detection
by: Mousavi, Ahmad, et al.
Published: (2025)
by: Mousavi, Ahmad, et al.
Published: (2025)
CARE: Privacy-Compliant Agentic Reasoning with Evidence Discordance
by: Liu, Haochen, et al.
Published: (2026)
by: Liu, Haochen, et al.
Published: (2026)
Hateful Person or Hateful Model? Investigating the Role of Personas in Hate Speech Detection by Large Language Models
by: Yuan, Shuzhou, et al.
Published: (2025)
by: Yuan, Shuzhou, et al.
Published: (2025)
CounterBench: Evaluating and Improving Counterfactual Reasoning in Large Language Models
by: Chen, Yuefei, et al.
Published: (2025)
by: Chen, Yuefei, et al.
Published: (2025)
PsychEthicsBench: Evaluating Large Language Models Against Australian Mental Health Ethics
by: Shen, Yaling, et al.
Published: (2026)
by: Shen, Yaling, et al.
Published: (2026)
Silencing Empowerment, Allowing Bigotry: Auditing the Moderation of Hate Speech on Twitch
by: Shukla, Prarabdh, et al.
Published: (2025)
by: Shukla, Prarabdh, et al.
Published: (2025)
Decoding Hate: Exploring Language Models' Reactions to Hate Speech
by: Piot, Paloma, et al.
Published: (2024)
by: Piot, Paloma, et al.
Published: (2024)
NaijaHate: Evaluating Hate Speech Detection on Nigerian Twitter Using Representative Data
by: Tonneau, Manuel, et al.
Published: (2024)
by: Tonneau, Manuel, et al.
Published: (2024)
EffiReason-Bench: A Unified Benchmark for Evaluating and Advancing Efficient Reasoning in Large Language Models
by: Huang, Junquan, et al.
Published: (2025)
by: Huang, Junquan, et al.
Published: (2025)
THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models
by: Li, Zhiyuan, et al.
Published: (2025)
by: Li, Zhiyuan, et al.
Published: (2025)
MET-Bench: Multimodal Entity Tracking for Evaluating the Limitations of Vision-Language and Reasoning Models
by: Cohen, Vanya, et al.
Published: (2025)
by: Cohen, Vanya, et al.
Published: (2025)
L0-Reasoning Bench: Evaluating Procedural Correctness in Language Models via Simple Program Execution
by: Sun, Simeng, et al.
Published: (2025)
by: Sun, Simeng, et al.
Published: (2025)
Deciphering Hate: Identifying Hateful Memes and Their Targets
by: Hossain, Eftekhar, et al.
Published: (2024)
by: Hossain, Eftekhar, et al.
Published: (2024)
NoisyHate: Mining Online Human-Written Perturbations for Realistic Robustness Benchmarking of Content Moderation Models
by: Ye, Yiran, et al.
Published: (2023)
by: Ye, Yiran, et al.
Published: (2023)
See, Explain, and Intervene: A Few-Shot Multimodal Agent Framework for Hateful Meme Moderation
by: Rizwan, Naquee, et al.
Published: (2026)
by: Rizwan, Naquee, et al.
Published: (2026)
Critical or Compliant? The Double-Edged Sword of Reasoning in Chain-of-Thought Explanations
by: Park, Eunkyu, et al.
Published: (2025)
by: Park, Eunkyu, et al.
Published: (2025)
LLMsAgainstHate @ NLU of Devanagari Script Languages 2025: Hate Speech Detection and Target Identification in Devanagari Languages via Parameter Efficient Fine-Tuning of LLMs
by: Sidibomma, Rushendra, et al.
Published: (2024)
by: Sidibomma, Rushendra, et al.
Published: (2024)
Towards Trustworthy Multimodal Moderation via Policy-Aligned Reasoning and Hierarchical Labeling
by: Li, Anqi, et al.
Published: (2025)
by: Li, Anqi, et al.
Published: (2025)
HateDebias: On the Diversity and Variability of Hate Speech Debiasing
by: Wu, Hongyan, et al.
Published: (2024)
by: Wu, Hongyan, et al.
Published: (2024)
MFTCXplain: A Multilingual Benchmark Dataset for Evaluating the Moral Reasoning of LLMs through Multi-hop Hate Speech Explanation
by: Trager, Jackson, et al.
Published: (2025)
by: Trager, Jackson, et al.
Published: (2025)
Demystifying Hateful Content: Leveraging Large Multimodal Models for Hateful Meme Detection with Explainable Decisions
by: Hee, Ming Shan, et al.
Published: (2025)
by: Hee, Ming Shan, et al.
Published: (2025)
Similar Items
-
HateSieve: A Contrastive Learning Framework for Detecting and Segmenting Hateful Content in Multimodal Memes
by: Su, Xuanyu, et al.
Published: (2024) -
uOttawa at LegalLens-2024: Transformer-based Classification Experiments
by: Meghdadi, Nima, et al.
Published: (2024) -
Robust Infidelity: When Faithfulness Measures on Masked Language Models Are Misleading
by: Crothers, Evan, et al.
Published: (2023) -
HateModerate: Testing Hate Speech Detectors against Content Moderation Policies
by: Zheng, Jiangrui, et al.
Published: (2023) -
Let's CONFER: A Dataset for Evaluating Natural Language Inference Models on CONditional InFERence and Presupposition
by: Azin, Tara, et al.
Published: (2025)