HateBench: Benchmarking Hate Speech Detectors on LLM-Generated Content and Hate Campaigns
Fuente:
arXiv
Guardado en:
| Autores principales: | Shen, Xinyue, Wu, Yixin, Qu, Yiting, Backes, Michael, Zannettou, Savvas, Zhang, Yang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Hate in Plain Sight: On the Risks of Moderating AI-Generated Hateful Illusions
por: Qu, Yiting, et al.
Publicado: (2025)
por: Qu, Yiting, et al.
Publicado: (2025)
UnsafeBench: Benchmarking Image Safety Classifiers on Real-World and AI-Generated Images
por: Qu, Yiting, et al.
Publicado: (2024)
por: Qu, Yiting, et al.
Publicado: (2024)
Understanding LLM Behavior When Encountering User-Supplied Harmful Content in Harmless Tasks
por: Chu, Junjie, et al.
Publicado: (2026)
por: Chu, Junjie, et al.
Publicado: (2026)
Prompt Stealing Attacks Against Text-to-Image Generation Models
por: Shen, Xinyue, et al.
Publicado: (2023)
por: Shen, Xinyue, et al.
Publicado: (2023)
Breaking Agents: Compromising Autonomous LLM Agents Through Malfunction Amplification
por: Zhang, Boyang, et al.
Publicado: (2024)
por: Zhang, Boyang, et al.
Publicado: (2024)
Voice Jailbreak Attacks Against GPT-4o
por: Shen, Xinyue, et al.
Publicado: (2024)
por: Shen, Xinyue, et al.
Publicado: (2024)
MGTBench: Benchmarking Machine-Generated Text Detection
por: He, Xinlei, et al.
Publicado: (2023)
por: He, Xinlei, et al.
Publicado: (2023)
Synthetic Artifact Auditing: Tracing LLM-Generated Synthetic Data Usage in Downstream Applications
por: Wu, Yixin, et al.
Publicado: (2025)
por: Wu, Yixin, et al.
Publicado: (2025)
Image-Perfect Imperfections: Safety, Bias, and Authenticity in the Shadow of Text-To-Image Model Evolution
por: Wu, Yixin, et al.
Publicado: (2024)
por: Wu, Yixin, et al.
Publicado: (2024)
When GPT Spills the Tea: Comprehensive Assessment of Knowledge File Leakage in GPTs
por: Shen, Xinyue, et al.
Publicado: (2025)
por: Shen, Xinyue, et al.
Publicado: (2025)
All You Need is "Leet": Evading Hate-speech Detection AI
por: Kahu, Sampanna Yashwant, et al.
Publicado: (2025)
por: Kahu, Sampanna Yashwant, et al.
Publicado: (2025)
"Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models
por: Shen, Xinyue, et al.
Publicado: (2023)
por: Shen, Xinyue, et al.
Publicado: (2023)
The Challenge of Identifying the Origin of Black-Box Large Language Models
por: Yang, Ziqing, et al.
Publicado: (2025)
por: Yang, Ziqing, et al.
Publicado: (2025)
Bridging the Gap in Vision Language Models in Identifying Unsafe Concepts Across Modalities
por: Qu, Yiting, et al.
Publicado: (2025)
por: Qu, Yiting, et al.
Publicado: (2025)
Meme Trojan: Backdoor Attacks Against Hateful Meme Detection via Cross-Modal Triggers
por: Wang, Ruofei, et al.
Publicado: (2024)
por: Wang, Ruofei, et al.
Publicado: (2024)
Benchmark of Benchmarks: Unpacking Influence and Code Repository Quality in LLM Safety Benchmarks
por: Chu, Junjie, et al.
Publicado: (2026)
por: Chu, Junjie, et al.
Publicado: (2026)
No Easy Way Out: the Effectiveness of Deplatforming an Extremist Forum to Suppress Hate and Harassment
por: Vu, Anh V., et al.
Publicado: (2023)
por: Vu, Anh V., et al.
Publicado: (2023)
On the Proactive Generation of Unsafe Images From Text-To-Image Models Using Benign Prompts
por: Wu, Yixin, et al.
Publicado: (2023)
por: Wu, Yixin, et al.
Publicado: (2023)
HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?
por: Jiang, Yukun, et al.
Publicado: (2026)
por: Jiang, Yukun, et al.
Publicado: (2026)
TUBERAIDER: Attributing Coordinated Hate Attacks on YouTube Videos to their Source Communities
por: Saeed, Mohammad Hammas, et al.
Publicado: (2023)
por: Saeed, Mohammad Hammas, et al.
Publicado: (2023)
SoK: Data Reconstruction Attacks Against Machine Learning Models: Definition, Metrics, and Benchmark
por: Wen, Rui, et al.
Publicado: (2025)
por: Wen, Rui, et al.
Publicado: (2025)
Link Stealing Attacks Against Inductive Graph Neural Networks
por: Wu, Yixin, et al.
Publicado: (2024)
por: Wu, Yixin, et al.
Publicado: (2024)
GEO-Detective: Unveiling Location Privacy Risks in Images with LLM Agents
por: Zhang, Xinyu, et al.
Publicado: (2025)
por: Zhang, Xinyu, et al.
Publicado: (2025)
Pop Quiz Attack: Black-box Membership Inference Attacks Against Large Language Models
por: Chen, Zeyuan, et al.
Publicado: (2026)
por: Chen, Zeyuan, et al.
Publicado: (2026)
AttackPilot: Autonomous Inference Attacks Against ML Services With LLM-Based Agents
por: Wu, Yixin, et al.
Publicado: (2025)
por: Wu, Yixin, et al.
Publicado: (2025)
Peering Behind the Shield: Guardrail Identification in Large Language Models
por: Yang, Ziqing, et al.
Publicado: (2025)
por: Yang, Ziqing, et al.
Publicado: (2025)
Understanding Data Importance in Machine Learning Attacks: Does Valuable Data Pose Greater Harm?
por: Wen, Rui, et al.
Publicado: (2024)
por: Wen, Rui, et al.
Publicado: (2024)
From Evidence to Verdict: An Agent-Based Forensic Framework for AI-Generated Image Detection
por: Liang, Mengfei, et al.
Publicado: (2025)
por: Liang, Mengfei, et al.
Publicado: (2025)
BackdoorBench: A Comprehensive Benchmark and Analysis of Backdoor Learning
por: Wu, Baoyuan, et al.
Publicado: (2024)
por: Wu, Baoyuan, et al.
Publicado: (2024)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
por: Chu, Junjie, et al.
Publicado: (2024)
por: Chu, Junjie, et al.
Publicado: (2024)
Vera Verto: Multimodal Hijacking Attack
por: Zhang, Minxing, et al.
Publicado: (2024)
por: Zhang, Minxing, et al.
Publicado: (2024)
Watermarking LLM-Generated Datasets in Downstream Tasks
por: Liu, Yugeng, et al.
Publicado: (2025)
por: Liu, Yugeng, et al.
Publicado: (2025)
HateModerate: Testing Hate Speech Detectors against Content Moderation Policies
por: Zheng, Jiangrui, et al.
Publicado: (2023)
por: Zheng, Jiangrui, et al.
Publicado: (2023)
Transferable Availability Poisoning Attacks
por: Liu, Yiyong, et al.
Publicado: (2023)
por: Liu, Yiyong, et al.
Publicado: (2023)
Excessive Reasoning Attack on Reasoning LLMs
por: Si, Wai Man, et al.
Publicado: (2025)
por: Si, Wai Man, et al.
Publicado: (2025)
Generated Data with Fake Privacy: Hidden Dangers of Fine-tuning Large Language Models on Generated Data
por: Akkus, Atilla, et al.
Publicado: (2024)
por: Akkus, Atilla, et al.
Publicado: (2024)
Instruction Backdoor Attacks Against Customized LLMs
por: Zhang, Rui, et al.
Publicado: (2024)
por: Zhang, Rui, et al.
Publicado: (2024)
Composite Backdoor Attacks Against Large Language Models
por: Huang, Hai, et al.
Publicado: (2023)
por: Huang, Hai, et al.
Publicado: (2023)
Provably Cost-Sensitive Adversarial Defense via Randomized Smoothing
por: Xin, Yuan, et al.
Publicado: (2023)
por: Xin, Yuan, et al.
Publicado: (2023)
SOS! Soft Prompt Attack Against Open-Source Large Language Models
por: Yang, Ziqing, et al.
Publicado: (2024)
por: Yang, Ziqing, et al.
Publicado: (2024)
Ejemplares similares
-
Hate in Plain Sight: On the Risks of Moderating AI-Generated Hateful Illusions
por: Qu, Yiting, et al.
Publicado: (2025) -
UnsafeBench: Benchmarking Image Safety Classifiers on Real-World and AI-Generated Images
por: Qu, Yiting, et al.
Publicado: (2024) -
Understanding LLM Behavior When Encountering User-Supplied Harmful Content in Harmless Tasks
por: Chu, Junjie, et al.
Publicado: (2026) -
Prompt Stealing Attacks Against Text-to-Image Generation Models
por: Shen, Xinyue, et al.
Publicado: (2023) -
Breaking Agents: Compromising Autonomous LLM Agents Through Malfunction Amplification
por: Zhang, Boyang, et al.
Publicado: (2024)