Explain the Flag: Contextualizing Hate Speech Beyond Censorship
Fuente:
arXiv
Salvato in:
| Autori principali: | Liartis, Jason, Kaldeli, Eirini, Gyftokosta, Lambrini, Chelioudakis, Eleftherios, Mastromichalakis, Orfeas Menis |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Don't Erase, Inform! Detecting and Contextualizing Harmful Language in Cultural Heritage Collections
di: Mastromichalakis, Orfeas Menis, et al.
Pubblicazione: (2025)
di: Mastromichalakis, Orfeas Menis, et al.
Pubblicazione: (2025)
Beyond One-Size-Fits-All: Adapting Counterfactual Explanations to User Objectives
di: Mastromichalakis, Orfeas Menis, et al.
Pubblicazione: (2024)
di: Mastromichalakis, Orfeas Menis, et al.
Pubblicazione: (2024)
The Grounding Gap: How LLMs Anchor the Meaning of Abstract Concepts Differently from Humans
di: Chlapanis, Odysseas S., et al.
Pubblicazione: (2026)
di: Chlapanis, Odysseas S., et al.
Pubblicazione: (2026)
Assumed Identities: Quantifying Gender Bias in Machine Translation of Gender-Ambiguous Occupational Terms
di: Mastromichalakis, Orfeas Menis, et al.
Pubblicazione: (2025)
di: Mastromichalakis, Orfeas Menis, et al.
Pubblicazione: (2025)
Semantic Prototypes: Enhancing Transparency Without Black Boxes
di: Menis-Mastromichalakis, Orfeas, et al.
Pubblicazione: (2024)
di: Menis-Mastromichalakis, Orfeas, et al.
Pubblicazione: (2024)
GAMBIT+: A Challenge Set for Evaluating Gender Bias in Machine Translation Quality Estimation Metrics
di: Filandrianos, Giorgos, et al.
Pubblicazione: (2025)
di: Filandrianos, Giorgos, et al.
Pubblicazione: (2025)
AILS-NTUA at SemEval-2025 Task 4: Parameter-Efficient Unlearning for Large Language Models using Data Chunking
di: Premptis, Iraklis, et al.
Pubblicazione: (2025)
di: Premptis, Iraklis, et al.
Pubblicazione: (2025)
Deep Ensemble Art Style Recognition
di: Menis-Mastromichalakis, Orfeas, et al.
Pubblicazione: (2024)
di: Menis-Mastromichalakis, Orfeas, et al.
Pubblicazione: (2024)
GOSt-MT: A Knowledge Graph for Occupation-related Gender Biases in Machine Translation
di: Mastromichalakis, Orfeas Menis, et al.
Pubblicazione: (2024)
di: Mastromichalakis, Orfeas Menis, et al.
Pubblicazione: (2024)
Self-Explaining Hate Speech Detection with Moral Rationales
di: Vargas, Francielle, et al.
Pubblicazione: (2026)
di: Vargas, Francielle, et al.
Pubblicazione: (2026)
MusicLIME: Explainable Multimodal Music Understanding
di: Sotirou, Theodoros, et al.
Pubblicazione: (2024)
di: Sotirou, Theodoros, et al.
Pubblicazione: (2024)
Aligning Attention with Human Rationales for Self-Explaining Hate Speech Detection
di: Eilertsen, Brage, et al.
Pubblicazione: (2025)
di: Eilertsen, Brage, et al.
Pubblicazione: (2025)
Beyond Hate Speech: NLP's Challenges and Opportunities in Uncovering Dehumanizing Language
di: Saffari, Hamidreza, et al.
Pubblicazione: (2024)
di: Saffari, Hamidreza, et al.
Pubblicazione: (2024)
Beyond Hate: Differentiating Uncivil and Intolerant Speech in Multimodal Content Moderation
di: Herrmann, Nils A., et al.
Pubblicazione: (2026)
di: Herrmann, Nils A., et al.
Pubblicazione: (2026)
HateDebias: On the Diversity and Variability of Hate Speech Debiasing
di: Wu, Hongyan, et al.
Pubblicazione: (2024)
di: Wu, Hongyan, et al.
Pubblicazione: (2024)
Decoding Hate: Exploring Language Models' Reactions to Hate Speech
di: Piot, Paloma, et al.
Pubblicazione: (2024)
di: Piot, Paloma, et al.
Pubblicazione: (2024)
"Is Hate Lost in Translation?": Evaluation of Multilingual LGBTQIA+ Hate Speech Detection
di: Chan, Fai Leui, et al.
Pubblicazione: (2024)
di: Chan, Fai Leui, et al.
Pubblicazione: (2024)
Web(er) of Hate: A Survey on How Hate Speech Is Typed
di: Wang, Luna, et al.
Pubblicazione: (2025)
di: Wang, Luna, et al.
Pubblicazione: (2025)
Hateful Person or Hateful Model? Investigating the Role of Personas in Hate Speech Detection by Large Language Models
di: Yuan, Shuzhou, et al.
Pubblicazione: (2025)
di: Yuan, Shuzhou, et al.
Pubblicazione: (2025)
LLM in the Loop: Creating the ParaDeHate Dataset for Hate Speech Detoxification
di: Yuan, Shuzhou, et al.
Pubblicazione: (2025)
di: Yuan, Shuzhou, et al.
Pubblicazione: (2025)
ExPO-HM: Learning to Explain-then-Detect for Hateful Meme Detection
di: Mei, Jingbiao, et al.
Pubblicazione: (2025)
di: Mei, Jingbiao, et al.
Pubblicazione: (2025)
MasonPerplexity at Multimodal Hate Speech Event Detection 2024: Hate Speech and Target Detection Using Transformer Ensembles
di: Ganguly, Amrita, et al.
Pubblicazione: (2024)
di: Ganguly, Amrita, et al.
Pubblicazione: (2024)
When Hate Meets Facts: LLMs-in-the-Loop for Check-worthiness Detection in Hate Speech
di: Ocampo, Nicolás Benjamín, et al.
Pubblicazione: (2026)
di: Ocampo, Nicolás Benjamín, et al.
Pubblicazione: (2026)
HateGPT: Unleashing GPT-3.5 Turbo to Combat Hate Speech on X
di: Deroy, Aniket, et al.
Pubblicazione: (2024)
di: Deroy, Aniket, et al.
Pubblicazione: (2024)
NaijaHate: Evaluating Hate Speech Detection on Nigerian Twitter Using Representative Data
di: Tonneau, Manuel, et al.
Pubblicazione: (2024)
di: Tonneau, Manuel, et al.
Pubblicazione: (2024)
Challenger at MultiPRIDE: Is It Hate Speech or Reclaimed?
di: Tekanlou, Hadi Bayrami Asl, et al.
Pubblicazione: (2026)
di: Tekanlou, Hadi Bayrami Asl, et al.
Pubblicazione: (2026)
Compositional Generalisation for Explainable Hate Speech Detection
di: Calabrese, Agostina, et al.
Pubblicazione: (2025)
di: Calabrese, Agostina, et al.
Pubblicazione: (2025)
Automatic Textual Normalization for Hate Speech Detection
di: Nguyen, Anh Thi-Hoang, et al.
Pubblicazione: (2023)
di: Nguyen, Anh Thi-Hoang, et al.
Pubblicazione: (2023)
Advancing Hate Speech Detection with Transformers: Insights from the MetaHate
di: Chapagain, Santosh, et al.
Pubblicazione: (2025)
di: Chapagain, Santosh, et al.
Pubblicazione: (2025)
The Enforcement and Feasibility of Hate Speech Moderation on Twitter
di: Tonneau, Manuel, et al.
Pubblicazione: (2026)
di: Tonneau, Manuel, et al.
Pubblicazione: (2026)
AfriHate: A Multilingual Collection of Hate Speech and Abusive Language Datasets for African Languages
di: Muhammad, Shamsuddeen Hassan, et al.
Pubblicazione: (2025)
di: Muhammad, Shamsuddeen Hassan, et al.
Pubblicazione: (2025)
Dialogues of Dissent: Thematic and Rhetorical Dimensions of Hate and Counter-Hate Speech in Social Media Conversations
di: Levi, Effi, et al.
Pubblicazione: (2025)
di: Levi, Effi, et al.
Pubblicazione: (2025)
HatePRISM: Policies, Platforms, and Research Integration. Advancing NLP for Hate Speech Proactive Mitigation
di: Rizwan, Naquee, et al.
Pubblicazione: (2025)
di: Rizwan, Naquee, et al.
Pubblicazione: (2025)
Multi3Hate: Multimodal, Multilingual, and Multicultural Hate Speech Detection with Vision-Language Models
di: Bui, Minh Duc, et al.
Pubblicazione: (2024)
di: Bui, Minh Duc, et al.
Pubblicazione: (2024)
GPT-HateCheck: Can LLMs Write Better Functional Tests for Hate Speech Detection?
di: Jin, Yiping, et al.
Pubblicazione: (2024)
di: Jin, Yiping, et al.
Pubblicazione: (2024)
HatePrototypes: Interpretable and Transferable Representations for Implicit and Explicit Hate Speech Detection
di: Proskurina, Irina, et al.
Pubblicazione: (2025)
di: Proskurina, Irina, et al.
Pubblicazione: (2025)
HateModerate: Testing Hate Speech Detectors against Content Moderation Policies
di: Zheng, Jiangrui, et al.
Pubblicazione: (2023)
di: Zheng, Jiangrui, et al.
Pubblicazione: (2023)
MetaHate: A Dataset for Unifying Efforts on Hate Speech Detection
di: Piot, Paloma, et al.
Pubblicazione: (2024)
di: Piot, Paloma, et al.
Pubblicazione: (2024)
EkoHate: Abusive Language and Hate Speech Detection for Code-switched Political Discussions on Nigerian Twitter
di: Ilevbare, Comfort Eseohen, et al.
Pubblicazione: (2024)
di: Ilevbare, Comfort Eseohen, et al.
Pubblicazione: (2024)
HateDay: Insights from a Global Hate Speech Dataset Representative of a Day on Twitter
di: Tonneau, Manuel, et al.
Pubblicazione: (2024)
di: Tonneau, Manuel, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Don't Erase, Inform! Detecting and Contextualizing Harmful Language in Cultural Heritage Collections
di: Mastromichalakis, Orfeas Menis, et al.
Pubblicazione: (2025) -
Beyond One-Size-Fits-All: Adapting Counterfactual Explanations to User Objectives
di: Mastromichalakis, Orfeas Menis, et al.
Pubblicazione: (2024) -
The Grounding Gap: How LLMs Anchor the Meaning of Abstract Concepts Differently from Humans
di: Chlapanis, Odysseas S., et al.
Pubblicazione: (2026) -
Assumed Identities: Quantifying Gender Bias in Machine Translation of Gender-Ambiguous Occupational Terms
di: Mastromichalakis, Orfeas Menis, et al.
Pubblicazione: (2025) -
Semantic Prototypes: Enhancing Transparency Without Black Boxes
di: Menis-Mastromichalakis, Orfeas, et al.
Pubblicazione: (2024)