Salvato in:
| Autori principali: | Masud, Sarah, Bajpai, Ashutosh, Chakraborty, Tanmoy |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2309.11896 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hate Personified: Investigating the role of LLMs in content moderation
di: Masud, Sarah, et al.
Pubblicazione: (2024)
di: Masud, Sarah, et al.
Pubblicazione: (2024)
Information Anxiety in Large Language Models
di: Bajpai, Prasoon, et al.
Pubblicazione: (2024)
di: Bajpai, Prasoon, et al.
Pubblicazione: (2024)
SAFE-MEME: Structured Reasoning Framework for Robust Hate Speech Detection in Memes
di: Nandi, Palash, et al.
Pubblicazione: (2024)
di: Nandi, Palash, et al.
Pubblicazione: (2024)
Temporal Referential Consistency: Do LLMs Favor Sequences Over Absolute Time References?
di: Bajpai, Ashutosh, et al.
Pubblicazione: (2025)
di: Bajpai, Ashutosh, et al.
Pubblicazione: (2025)
Tox-BART: Leveraging Toxicity Attributes for Explanation Generation of Implicit Hate Speech
di: Yadav, Neemesh, et al.
Pubblicazione: (2024)
di: Yadav, Neemesh, et al.
Pubblicazione: (2024)
Multilingual LLMs Inherently Reward In-Language Time-Sensitive Semantic Alignment for Low-Resource Languages
di: Bajpai, Ashutosh, et al.
Pubblicazione: (2024)
di: Bajpai, Ashutosh, et al.
Pubblicazione: (2024)
Probing Critical Learning Dynamics of PLMs for Hate Speech Detection
di: Masud, Sarah, et al.
Pubblicazione: (2024)
di: Masud, Sarah, et al.
Pubblicazione: (2024)
Decoding Memes: Benchmarking Narrative Role Classification across Multilingual and Multimodal Models
di: Sharma, Shivam, et al.
Pubblicazione: (2025)
di: Sharma, Shivam, et al.
Pubblicazione: (2025)
Temporally Consistent Factuality Probing for Large Language Models
di: Bajpai, Ashutosh, et al.
Pubblicazione: (2024)
di: Bajpai, Ashutosh, et al.
Pubblicazione: (2024)
AmpleHate: Amplifying the Attention for Versatile Implicit Hate Detection
di: Lee, Yejin, et al.
Pubblicazione: (2025)
di: Lee, Yejin, et al.
Pubblicazione: (2025)
Rethinking Hate Speech Detection on Social Media: Can LLMs Replace Traditional Models?
di: Singh, Daman Deep, et al.
Pubblicazione: (2025)
di: Singh, Daman Deep, et al.
Pubblicazione: (2025)
Multilingual Test-Time Scaling via Initial Thought Transfer
di: Bajpai, Prasoon, et al.
Pubblicazione: (2025)
di: Bajpai, Prasoon, et al.
Pubblicazione: (2025)
SpatialMath: Spatial Comprehension-Infused Symbolic Reasoning for Mathematical Problem-Solving
di: Bajpai, Ashutosh, et al.
Pubblicazione: (2026)
di: Bajpai, Ashutosh, et al.
Pubblicazione: (2026)
MemeMQA: Multimodal Question Answering for Memes via Rationale-Based Inferencing
di: Agarwal, Siddhant, et al.
Pubblicazione: (2024)
di: Agarwal, Siddhant, et al.
Pubblicazione: (2024)
GPT-HateCheck: Can LLMs Write Better Functional Tests for Hate Speech Detection?
di: Jin, Yiping, et al.
Pubblicazione: (2024)
di: Jin, Yiping, et al.
Pubblicazione: (2024)
The Psychology of Falsehood: A Human-Centric Survey of Misinformation Detection
di: Nandi, Arghodeep, et al.
Pubblicazione: (2025)
di: Nandi, Arghodeep, et al.
Pubblicazione: (2025)
The Unseen Targets of Hate -- A Systematic Review of Hateful Communication Datasets
di: Yu, Zehui, et al.
Pubblicazione: (2024)
di: Yu, Zehui, et al.
Pubblicazione: (2024)
Few-shot Hate Speech Detection Based on the MindSpore Framework
di: Qin, Zhenkai, et al.
Pubblicazione: (2025)
di: Qin, Zhenkai, et al.
Pubblicazione: (2025)
SUKHSANDESH: An Avatar Therapeutic Question Answering Platform for Sexual Education in Rural India
di: Singh, Salam Michael, et al.
Pubblicazione: (2024)
di: Singh, Salam Michael, et al.
Pubblicazione: (2024)
Waking Up Blind: Cold-Start Optimization of Supervision-Free Agentic Trajectories for Grounded Visual Perception
di: Bajpai, Ashutosh, et al.
Pubblicazione: (2026)
di: Bajpai, Ashutosh, et al.
Pubblicazione: (2026)
Towards Fairness Assessment of Dutch Hate Speech Detection
di: Bauer, Julie, et al.
Pubblicazione: (2025)
di: Bauer, Julie, et al.
Pubblicazione: (2025)
Algorithmic Fairness in NLP: Persona-Infused LLMs for Human-Centric Hate Speech Detection
di: Gajewska, Ewelina, et al.
Pubblicazione: (2025)
di: Gajewska, Ewelina, et al.
Pubblicazione: (2025)
Can LLMs reason over extended multilingual contexts? Towards long-context evaluation beyond retrieval and haystacks
di: Hengle, Amey, et al.
Pubblicazione: (2025)
di: Hengle, Amey, et al.
Pubblicazione: (2025)
The Enforcement and Feasibility of Hate Speech Moderation on Twitter
di: Tonneau, Manuel, et al.
Pubblicazione: (2026)
di: Tonneau, Manuel, et al.
Pubblicazione: (2026)
CSEval: Towards Automated, Multi-Dimensional, and Reference-Free Counterspeech Evaluation using Auto-Calibrated LLMs
di: Hengle, Amey, et al.
Pubblicazione: (2025)
di: Hengle, Amey, et al.
Pubblicazione: (2025)
Subjective $\textit{Isms}$? On the Danger of Conflating Hate and Offence in Abusive Language Detection
di: Curry, Amanda Cercas, et al.
Pubblicazione: (2024)
di: Curry, Amanda Cercas, et al.
Pubblicazione: (2024)
Deep Learning Approaches for Detecting Adversarial Cyberbullying and Hate Speech in Social Networks
di: Azumah, Sylvia Worlali, et al.
Pubblicazione: (2024)
di: Azumah, Sylvia Worlali, et al.
Pubblicazione: (2024)
Navigating Dialectal Bias and Ethical Complexities in Levantine Arabic Hate Speech Detection
di: Ahmed, Ahmed Haj, et al.
Pubblicazione: (2024)
di: Ahmed, Ahmed Haj, et al.
Pubblicazione: (2024)
Multilingual Needle in a Haystack: Investigating Long-Context Behavior of Multilingual Large Language Models
di: Hengle, Amey, et al.
Pubblicazione: (2024)
di: Hengle, Amey, et al.
Pubblicazione: (2024)
Can LLMs replace Neil deGrasse Tyson? Evaluating the Reliability of LLMs as Science Communicators
di: Bajpai, Prasoon, et al.
Pubblicazione: (2024)
di: Bajpai, Prasoon, et al.
Pubblicazione: (2024)
Multilingualism, Transnationality, and K-pop in the Online #StopAsianHate Movement
di: Masis, Tessa, et al.
Pubblicazione: (2025)
di: Masis, Tessa, et al.
Pubblicazione: (2025)
Beyond Hate: Differentiating Uncivil and Intolerant Speech in Multimodal Content Moderation
di: Herrmann, Nils A., et al.
Pubblicazione: (2026)
di: Herrmann, Nils A., et al.
Pubblicazione: (2026)
Data-Efficient Hate Speech Detection via Cross-Lingual Nearest Neighbor Retrieval with Limited Labeled Data
di: Ghorbanpour, Faeze, et al.
Pubblicazione: (2025)
di: Ghorbanpour, Faeze, et al.
Pubblicazione: (2025)
EtiCor++: Towards Understanding Etiquettical Bias in LLMs
di: Dwivedi, Ashutosh, et al.
Pubblicazione: (2025)
di: Dwivedi, Ashutosh, et al.
Pubblicazione: (2025)
Towards Implicit Bias Detection and Mitigation in Multi-Agent LLM Interactions
di: Borah, Angana, et al.
Pubblicazione: (2024)
di: Borah, Angana, et al.
Pubblicazione: (2024)
Can Prompting LLMs Unlock Hate Speech Detection across Languages? A Zero-shot and Few-shot Study
di: Ghorbanpour, Faeze, et al.
Pubblicazione: (2025)
di: Ghorbanpour, Faeze, et al.
Pubblicazione: (2025)
Measuring Online Hate on 4chan using Pre-trained Deep Learning Models
di: Bermudez-Villalva, Adrian, et al.
Pubblicazione: (2025)
di: Bermudez-Villalva, Adrian, et al.
Pubblicazione: (2025)
Towards Weakly-Supervised Hate Speech Classification Across Datasets
di: Jin, Yiping, et al.
Pubblicazione: (2023)
di: Jin, Yiping, et al.
Pubblicazione: (2023)
A Modular Taxonomy for Hate Speech Definitions and Its Impact on Zero-Shot LLM Classification Performance
di: Melis, Matteo, et al.
Pubblicazione: (2025)
di: Melis, Matteo, et al.
Pubblicazione: (2025)
Listening Between the Lines: Decoding Podcast Narratives with Language Modeling
di: Gupta, Shreya, et al.
Pubblicazione: (2025)
di: Gupta, Shreya, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Hate Personified: Investigating the role of LLMs in content moderation
di: Masud, Sarah, et al.
Pubblicazione: (2024) -
Information Anxiety in Large Language Models
di: Bajpai, Prasoon, et al.
Pubblicazione: (2024) -
SAFE-MEME: Structured Reasoning Framework for Robust Hate Speech Detection in Memes
di: Nandi, Palash, et al.
Pubblicazione: (2024) -
Temporal Referential Consistency: Do LLMs Favor Sequences Over Absolute Time References?
di: Bajpai, Ashutosh, et al.
Pubblicazione: (2025) -
Tox-BART: Leveraging Toxicity Attributes for Explanation Generation of Implicit Hate Speech
di: Yadav, Neemesh, et al.
Pubblicazione: (2024)