The Enforcement and Feasibility of Hate Speech Moderation on Twitter
Fuente:
arXiv
Guardado en:
| Autores principales: | Tonneau, Manuel, Thurgood, Dylan, Liu, Diyi, Malhotra, Niyati, Orozco-Olvera, Victor, Schroeder, Ralph, Hale, Scott A., Ribeiro, Manoel Horta, Röttger, Paul, Fraiberger, Samuel P. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HateDay: Insights from a Global Hate Speech Dataset Representative of a Day on Twitter
por: Tonneau, Manuel, et al.
Publicado: (2024)
por: Tonneau, Manuel, et al.
Publicado: (2024)
From Languages to Geographies: Towards Evaluating Cultural Bias in Hate Speech Datasets
por: Tonneau, Manuel, et al.
Publicado: (2024)
por: Tonneau, Manuel, et al.
Publicado: (2024)
NaijaHate: Evaluating Hate Speech Detection on Nigerian Twitter Using Representative Data
por: Tonneau, Manuel, et al.
Publicado: (2024)
por: Tonneau, Manuel, et al.
Publicado: (2024)
Different Demographic Cues Yield Inconsistent Conclusions About LLM Personalization and Bias
por: Tonneau, Manuel, et al.
Publicado: (2026)
por: Tonneau, Manuel, et al.
Publicado: (2026)
HateModerate: Testing Hate Speech Detectors against Content Moderation Policies
por: Zheng, Jiangrui, et al.
Publicado: (2023)
por: Zheng, Jiangrui, et al.
Publicado: (2023)
Improving Adversarial Data Collection by Supporting Annotators: Lessons from GAHD, a German Hate Speech Dataset
por: Goldzycher, Janis, et al.
Publicado: (2024)
por: Goldzycher, Janis, et al.
Publicado: (2024)
ProvocationProbe: Instigating Hate Speech Dataset from Twitter
por: Kumar, Abhay, et al.
Publicado: (2024)
por: Kumar, Abhay, et al.
Publicado: (2024)
A Hate Speech Moderated Chat Application: Use Case for GDPR and DSA Compliance
por: Fillies, Jan, et al.
Publicado: (2024)
por: Fillies, Jan, et al.
Publicado: (2024)
Beyond Hate: Differentiating Uncivil and Intolerant Speech in Multimodal Content Moderation
por: Herrmann, Nils A., et al.
Publicado: (2026)
por: Herrmann, Nils A., et al.
Publicado: (2026)
EkoHate: Abusive Language and Hate Speech Detection for Code-switched Political Discussions on Nigerian Twitter
por: Ilevbare, Comfort Eseohen, et al.
Publicado: (2024)
por: Ilevbare, Comfort Eseohen, et al.
Publicado: (2024)
Silencing Empowerment, Allowing Bigotry: Auditing the Moderation of Hate Speech on Twitch
por: Shukla, Prarabdh, et al.
Publicado: (2025)
por: Shukla, Prarabdh, et al.
Publicado: (2025)
Lost in Moderation: How Commercial Content Moderation APIs Over- and Under-Moderate Group-Targeted Hate Speech and Linguistic Variations
por: Hartmann, David, et al.
Publicado: (2025)
por: Hartmann, David, et al.
Publicado: (2025)
Indian-BhED: A Dataset for Measuring India-Centric Biases in Large Language Models
por: Khandelwal, Khyati, et al.
Publicado: (2023)
por: Khandelwal, Khyati, et al.
Publicado: (2023)
Recent Advances in Hate Speech Moderation: Multimodality and the Role of Large Models
por: Hee, Ming Shan, et al.
Publicado: (2024)
por: Hee, Ming Shan, et al.
Publicado: (2024)
HateBuffer: Safeguarding Content Moderators' Mental Well-Being through Hate Speech Content Modification
por: Park, Subin, et al.
Publicado: (2025)
por: Park, Subin, et al.
Publicado: (2025)
When Claims Evolve: Evaluating and Enhancing the Robustness of Embedding Models Against Misinformation Edits
por: Magomere, Jabez, et al.
Publicado: (2025)
por: Magomere, Jabez, et al.
Publicado: (2025)
Commercial Persuasion in AI-Mediated Conversations
por: Salvi, Francesco, et al.
Publicado: (2026)
por: Salvi, Francesco, et al.
Publicado: (2026)
Evaluating Deduplication Techniques for Economic Research Paper Titles with a Focus on Semantic Similarity using NLP and LLMs
por: You, Doohee, et al.
Publicado: (2024)
por: You, Doohee, et al.
Publicado: (2024)
Explainability and Hate Speech: Structured Explanations Make Social Media Moderators Faster
por: Calabrese, Agostina, et al.
Publicado: (2024)
por: Calabrese, Agostina, et al.
Publicado: (2024)
Evidence of a log scaling law for political persuasion with large language models
por: Hackenburg, Kobi, et al.
Publicado: (2024)
por: Hackenburg, Kobi, et al.
Publicado: (2024)
AfriHate: A Multilingual Collection of Hate Speech and Abusive Language Datasets for African Languages
por: Muhammad, Shamsuddeen Hassan, et al.
Publicado: (2025)
por: Muhammad, Shamsuddeen Hassan, et al.
Publicado: (2025)
When LLMs Help -- and Hurt -- Teaching Assistants in Proof-Based Courses
por: Mahinpei, Romina, et al.
Publicado: (2026)
por: Mahinpei, Romina, et al.
Publicado: (2026)
Can Language Models Recognize Convincing Arguments?
por: Rescala, Paula, et al.
Publicado: (2024)
por: Rescala, Paula, et al.
Publicado: (2024)
Take the Power Back: Screen-Based Personal Moderation Against Hate Speech on Instagram
por: Luther, Anna Ricarda, et al.
Publicado: (2026)
por: Luther, Anna Ricarda, et al.
Publicado: (2026)
Auditing the Compliance and Enforcement of Twitter's Advertising Policy
por: Vekaria, Yash, et al.
Publicado: (2023)
por: Vekaria, Yash, et al.
Publicado: (2023)
The Illusion of Insight in Reasoning Models
por: d'Aliberti, Liv G., et al.
Publicado: (2026)
por: d'Aliberti, Liv G., et al.
Publicado: (2026)
Chameleon Channels: Measuring YouTube Accounts Repurposed for Deception and Profit
por: Cuevas, Alejandro, et al.
Publicado: (2025)
por: Cuevas, Alejandro, et al.
Publicado: (2025)
LID Models are Actually Accent Classifiers: Implications and Solutions for LID on Accented Speech
por: Bafna, Niyati, et al.
Publicado: (2025)
por: Bafna, Niyati, et al.
Publicado: (2025)
HateDebias: On the Diversity and Variability of Hate Speech Debiasing
por: Wu, Hongyan, et al.
Publicado: (2024)
por: Wu, Hongyan, et al.
Publicado: (2024)
The Effects of Enterprise Social Media on Communication Networks
por: Ribeiro, Manoel Horta, et al.
Publicado: (2025)
por: Ribeiro, Manoel Horta, et al.
Publicado: (2025)
Decoding Hate: Exploring Language Models' Reactions to Hate Speech
por: Piot, Paloma, et al.
Publicado: (2024)
por: Piot, Paloma, et al.
Publicado: (2024)
Post Guidance for Online Communities
por: Ribeiro, Manoel Horta, et al.
Publicado: (2024)
por: Ribeiro, Manoel Horta, et al.
Publicado: (2024)
On the Conversational Persuasiveness of Large Language Models: A Randomized Controlled Trial
por: Salvi, Francesco, et al.
Publicado: (2024)
por: Salvi, Francesco, et al.
Publicado: (2024)
Hate in Plain Sight: On the Risks of Moderating AI-Generated Hateful Illusions
por: Qu, Yiting, et al.
Publicado: (2025)
por: Qu, Yiting, et al.
Publicado: (2025)
Hate Speech Detection and Classification in Amharic Text with Deep Learning
por: Gashe, Samuel Minale, et al.
Publicado: (2024)
por: Gashe, Samuel Minale, et al.
Publicado: (2024)
A Comparative Study of PyCaret AutoML and CNN-BiLSTM for Binary Hate Speech Detection in Indonesian Twitter
por: Widiyastuti, Tanty, et al.
Publicado: (2026)
por: Widiyastuti, Tanty, et al.
Publicado: (2026)
"Is Hate Lost in Translation?": Evaluation of Multilingual LGBTQIA+ Hate Speech Detection
por: Chan, Fai Leui, et al.
Publicado: (2024)
por: Chan, Fai Leui, et al.
Publicado: (2024)
Web(er) of Hate: A Survey on How Hate Speech Is Typed
por: Wang, Luna, et al.
Publicado: (2025)
por: Wang, Luna, et al.
Publicado: (2025)
GPT-HateCheck: Can LLMs Write Better Functional Tests for Hate Speech Detection?
por: Jin, Yiping, et al.
Publicado: (2024)
por: Jin, Yiping, et al.
Publicado: (2024)
Hateful Person or Hateful Model? Investigating the Role of Personas in Hate Speech Detection by Large Language Models
por: Yuan, Shuzhou, et al.
Publicado: (2025)
por: Yuan, Shuzhou, et al.
Publicado: (2025)
Ejemplares similares
-
HateDay: Insights from a Global Hate Speech Dataset Representative of a Day on Twitter
por: Tonneau, Manuel, et al.
Publicado: (2024) -
From Languages to Geographies: Towards Evaluating Cultural Bias in Hate Speech Datasets
por: Tonneau, Manuel, et al.
Publicado: (2024) -
NaijaHate: Evaluating Hate Speech Detection on Nigerian Twitter Using Representative Data
por: Tonneau, Manuel, et al.
Publicado: (2024) -
Different Demographic Cues Yield Inconsistent Conclusions About LLM Personalization and Bias
por: Tonneau, Manuel, et al.
Publicado: (2026) -
HateModerate: Testing Hate Speech Detectors against Content Moderation Policies
por: Zheng, Jiangrui, et al.
Publicado: (2023)