Echoes of Human Malice in Agents: Benchmarking LLMs for Multi-Turn Online Harassment Attacks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Padhi, Trilok, Lu, Pinxian, Erol, Abdulkadir, Sutar, Tanmay, Sharma, Gauri, Sonmez, Mina, De Choudhury, Munmun, Kursuncu, Ugur |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Playing Devil's Advocate: Unmasking Toxicity and Vulnerabilities in Large Vision-Language Models
par: Erol, Abdulkadir, et autres
Publié: (2025)
par: Erol, Abdulkadir, et autres
Publié: (2025)
From Reddit to Generative AI: Evaluating Large Language Models for Anxiety Support Fine-tuned on Social Media Data
par: Kursuncu, Ugur, et autres
Publié: (2025)
par: Kursuncu, Ugur, et autres
Publié: (2025)
Just KIDDIN: Knowledge Infusion and Distillation for Detection of INdecent Memes
par: Garg, Rahul, et autres
Publié: (2024)
par: Garg, Rahul, et autres
Publié: (2024)
Enhancing Cross-Modal Contextual Congruence for Crowdfunding Success using Knowledge-infused Learning
par: Padhi, Trilok, et autres
Publié: (2024)
par: Padhi, Trilok, et autres
Publié: (2024)
Context-Aware Detection and Victim-Centered Response Generation for Online Harassment in Private Messaging
par: Lu, Pinxian, et autres
Publié: (2025)
par: Lu, Pinxian, et autres
Publié: (2025)
Understanding the Humans Behind Online Misinformation: An Observational Study Through the Lens of the COVID-19 Pandemic
par: Chandra, Mohit, et autres
Publié: (2023)
par: Chandra, Mohit, et autres
Publié: (2023)
Fairness in Computational Innovations: Identifying Bias in Substance Use Treatment Length of Stay Prediction Models with Policy Implications
par: Kursuncu, Ugur, et autres
Publié: (2024)
par: Kursuncu, Ugur, et autres
Publié: (2024)
Reasoning Is Not All You Need: Examining LLMs for Multi-Turn Mental Health Conversations
par: Chandra, Mohit, et autres
Publié: (2025)
par: Chandra, Mohit, et autres
Publié: (2025)
Employing Social Media to Improve Mental Health Outcomes
par: De Choudhury, Munmun
Publié: (2025)
par: De Choudhury, Munmun
Publié: (2025)
Linguistic Comparison of AI- and Human-Written Responses to Online Mental Health Queries
par: Saha, Koustuv, et autres
Publié: (2025)
par: Saha, Koustuv, et autres
Publié: (2025)
Annotation Techniques for Judo Combat Phase Classification from Tournament Footage
par: Miyaguchi, Anthony, et autres
Publié: (2024)
par: Miyaguchi, Anthony, et autres
Publié: (2024)
Policy-as-Prompt: Turning AI Governance Rules into Guardrails for AI Agents
par: Kholkar, Gauri, et autres
Publié: (2025)
par: Kholkar, Gauri, et autres
Publié: (2025)
Co-Evolving Agents: Learning from Failures as Hard Negatives
par: Jung, Yeonsung, et autres
Publié: (2025)
par: Jung, Yeonsung, et autres
Publié: (2025)
The Adaptive Strategies of Anti-Kremlin Digital Dissent in Telegram during the Russian Invasion of Ukraine
par: Bawa, Apaar, et autres
Publié: (2024)
par: Bawa, Apaar, et autres
Publié: (2024)
The Role of Partisan Culture in Mental Health Language Online
par: Pendse, Sachin R., et autres
Publié: (2025)
par: Pendse, Sachin R., et autres
Publié: (2025)
Towards Unifying Quantitative Security Benchmarking for Multi Agent Systems
par: Sharma, Gauri, et autres
Publié: (2025)
par: Sharma, Gauri, et autres
Publié: (2025)
A Domain-Agnostic Neurosymbolic Approach for Big Social Data Analysis: Evaluating Mental Health Sentiment on Social Media during COVID-19
par: Khandelwal, Vedant, et autres
Publié: (2024)
par: Khandelwal, Vedant, et autres
Publié: (2024)
Large-Scale Analysis of Online Questions Related to Opioid Use Disorder on Reddit
par: Laud, Tanmay, et autres
Publié: (2025)
par: Laud, Tanmay, et autres
Publié: (2025)
Online Harassment of Japanese Celebrities and Influencers
par: Takano, Masanori, et autres
Publié: (2022)
par: Takano, Masanori, et autres
Publié: (2022)
Medical Malice: A Dataset for Context-Aware Safety in Healthcare LLMs
par: D'addario, Andrew Maranhão Ventura
Publié: (2025)
par: D'addario, Andrew Maranhão Ventura
Publié: (2025)
Communication Styles and Reader Preferences of LLM and Human Experts in Explaining Health Information
par: Zhou, Jiawei, et autres
Publié: (2025)
par: Zhou, Jiawei, et autres
Publié: (2025)
Not All Turns Are Equally Hard: Adaptive Thinking Budgets For Efficient Multi-Turn Reasoning
par: Jali, Neharika, et autres
Publié: (2026)
par: Jali, Neharika, et autres
Publié: (2026)
Integrative Review of Recruitment Literature: Conceptual Evolution, Technological Developments, and Scope for Future Research
par: Preeti Sharma, et autres
Publié: (2026)
par: Preeti Sharma, et autres
Publié: (2026)
Sleeper Cell: Injecting Latent Malice Temporal Backdoors into Tool-Using LLMs
par: Pallakonda, Bhanu, et autres
Publié: (2026)
par: Pallakonda, Bhanu, et autres
Publié: (2026)
Large Language Models for Cancer Communication: Evaluating Linguistic Quality, Safety, and Accessibility in Generative AI
par: Saha, Agnik, et autres
Publié: (2025)
par: Saha, Agnik, et autres
Publié: (2025)
Navigating the Rabbit Hole: Emergent Biases in LLM-Generated Attack Narratives Targeting Mental Health Groups
par: Magu, Rijul, et autres
Publié: (2025)
par: Magu, Rijul, et autres
Publié: (2025)
The Effect of the Difficulties Faced by Palliative Care Nurses on Perceived Quality of Palliative Care: A Cross‐Sectional Descriptive Study
par: Uğur Öner, et autres
Publié: (2025)
par: Uğur Öner, et autres
Publié: (2025)
Ethical Reasoning and Moral Value Alignment of LLMs Depend on the Language we Prompt them in
par: Agarwal, Utkarsh, et autres
Publié: (2024)
par: Agarwal, Utkarsh, et autres
Publié: (2024)
Another Turn, Better Output? A Turn-Wise Analysis of Iterative LLM Prompting
par: Javaji, Shashidhar Reddy, et autres
Publié: (2025)
par: Javaji, Shashidhar Reddy, et autres
Publié: (2025)
Cyberbully and Online Harassment: Issues Associated with Digital Wellbeing
par: Kulkarni, Manasi, et autres
Publié: (2024)
par: Kulkarni, Manasi, et autres
Publié: (2024)
The Role of Digital Media in Promoting Sustainable Business Practices in Delhi NCR
par: Singh, Trilok Kumar
Publié: (2025)
par: Singh, Trilok Kumar
Publié: (2025)
Adaptive Attack Mitigation for IoV Flood Attacks
par: Gelenbe, Erol, et autres
Publié: (2025)
par: Gelenbe, Erol, et autres
Publié: (2025)
Harassment
par: Eric Lyerly
Publié: (2026)
par: Eric Lyerly
Publié: (2026)
Telegram as a Battlefield: Kremlin-related Communications during the Russia-Ukraine Conflict
par: Bawa, Apaar, et autres
Publié: (2025)
par: Bawa, Apaar, et autres
Publié: (2025)
Do Moral Judgment and Reasoning Capability of LLMs Change with Language? A Study using the Multilingual Defining Issues Test
par: Khandelwal, Aditi, et autres
Publié: (2024)
par: Khandelwal, Aditi, et autres
Publié: (2024)
HiFACTMix: A Code-Mixed Benchmark and Graph-Aware Model for EvidenceBased Political Claim Verification in Hinglish
par: Thakur, Rakesh, et autres
Publié: (2025)
par: Thakur, Rakesh, et autres
Publié: (2025)
Calibrating Uncertainty Quantification of Multi-Modal LLMs using Grounding
par: Padhi, Trilok, et autres
Publié: (2025)
par: Padhi, Trilok, et autres
Publié: (2025)
A Construction of the Symmetric Monoidal Structure of the Geometric Whittaker Model
par: Choudhury, Ashutosh Roy, et autres
Publié: (2024)
par: Choudhury, Ashutosh Roy, et autres
Publié: (2024)
From Guessing to Asking: An Approach to Resolving the Persona Knowledge Gap in LLMs during Multi-Turn Conversations
par: Baskar, Sarvesh, et autres
Publié: (2025)
par: Baskar, Sarvesh, et autres
Publié: (2025)
TRUCE: Private Benchmarking to Prevent Contamination and Improve Comparative Evaluation of LLMs
par: Rajore, Tanmay, et autres
Publié: (2024)
par: Rajore, Tanmay, et autres
Publié: (2024)
Documents similaires
-
Playing Devil's Advocate: Unmasking Toxicity and Vulnerabilities in Large Vision-Language Models
par: Erol, Abdulkadir, et autres
Publié: (2025) -
From Reddit to Generative AI: Evaluating Large Language Models for Anxiety Support Fine-tuned on Social Media Data
par: Kursuncu, Ugur, et autres
Publié: (2025) -
Just KIDDIN: Knowledge Infusion and Distillation for Detection of INdecent Memes
par: Garg, Rahul, et autres
Publié: (2024) -
Enhancing Cross-Modal Contextual Congruence for Crowdfunding Success using Knowledge-infused Learning
par: Padhi, Trilok, et autres
Publié: (2024) -
Context-Aware Detection and Victim-Centered Response Generation for Online Harassment in Private Messaging
par: Lu, Pinxian, et autres
Publié: (2025)