Toxicity Detection Should Measure Contextual Harm, Not Text-Intrinsic Badness
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Berezin, Sergei, Farahbakhsh, Reza, Crespi, Noel |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evading Toxicity Detection with ASCII-art: A Benchmark of Spatial Attacks on Moderation Systems
par: Berezin, Sergey, et autres
Publié: (2024)
par: Berezin, Sergey, et autres
Publié: (2024)
The TIP of the Iceberg: Revealing a Hidden Class of Task-in-Prompt Adversarial Attacks on LLMs
par: Berezin, Sergey, et autres
Publié: (2025)
par: Berezin, Sergey, et autres
Publié: (2025)
Towards Cross-Lingual Audio Abuse Detection in Low-Resource Settings with Few-Shot Learning
par: Sankaran, Aditya Narayan, et autres
Publié: (2024)
par: Sankaran, Aditya Narayan, et autres
Publié: (2024)
Towards Detecting Contextual Real-Time Toxicity for In-Game Chat
par: Yang, Zachary, et autres
Publié: (2023)
par: Yang, Zachary, et autres
Publié: (2023)
AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents
par: Andriushchenko, Maksym, et autres
Publié: (2024)
par: Andriushchenko, Maksym, et autres
Publié: (2024)
Information Density as a Quantitative Measure for AI-enabled Virtual Sensing: Feasibility and Limits
par: Dutta, Hrishikesh, et autres
Publié: (2026)
par: Dutta, Hrishikesh, et autres
Publié: (2026)
DPIC: Decoupling Prompt and Intrinsic Characteristics for LLM Generated Text Detection
par: Yu, Xiao, et autres
Publié: (2023)
par: Yu, Xiao, et autres
Publié: (2023)
Less is More: Local Intrinsic Dimensions of Contextual Language Models
par: Ruppik, Benjamin Matthias, et autres
Publié: (2025)
par: Ruppik, Benjamin Matthias, et autres
Publié: (2025)
Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content
par: Stepanov, Ihor, et autres
Publié: (2026)
par: Stepanov, Ihor, et autres
Publié: (2026)
When Should Models Change Their Minds? Contextual Belief Management in Large Language Models
par: Xu, Haoming, et autres
Publié: (2026)
par: Xu, Haoming, et autres
Publié: (2026)
Beyond Behaviorist Representational Harms: A Plan for Measurement and Mitigation
par: Chien, Jennifer, et autres
Publié: (2024)
par: Chien, Jennifer, et autres
Publié: (2024)
Unveiling Intrinsic Dimension of Texts: from Academic Abstract to Creative Story
par: Pedashenko, Vladislav, et autres
Publié: (2025)
par: Pedashenko, Vladislav, et autres
Publié: (2025)
SocialHarmBench: Revealing LLM Vulnerabilities to Socially Harmful Requests
par: Pandey, Punya Syon, et autres
Publié: (2025)
par: Pandey, Punya Syon, et autres
Publié: (2025)
When Should LLMs Be Less Specific? Selective Abstraction for Reliable Long-Form Text Generation
par: Goren, Shani, et autres
Publié: (2026)
par: Goren, Shani, et autres
Publié: (2026)
SafetyNet: Detecting Harmful Outputs in LLMs by Modeling and Monitoring Deceptive Behaviors
par: Chaudhary, Maheep, et autres
Publié: (2025)
par: Chaudhary, Maheep, et autres
Publié: (2025)
Towards Generalizable Generic Harmful Speech Datasets for Implicit Hate Speech Detection
par: Almohaimeed, Saad, et autres
Publié: (2025)
par: Almohaimeed, Saad, et autres
Publié: (2025)
The Randomness Floor: Measuring Intrinsic Non-Randomness in Language Model Token Distributions
par: Hryszko, Jarosław
Publié: (2026)
par: Hryszko, Jarosław
Publié: (2026)
Reinforcement Learning for Diffusion LLMs with Entropy-Guided Step Selection and Stepwise Advantages
par: Kunde, Vishnu Teja, et autres
Publié: (2026)
par: Kunde, Vishnu Teja, et autres
Publié: (2026)
When Bad Data Leads to Good Models
par: Li, Kenneth, et autres
Publié: (2025)
par: Li, Kenneth, et autres
Publié: (2025)
FADE: Why Bad Descriptions Happen to Good Features
par: Puri, Bruno, et autres
Publié: (2025)
par: Puri, Bruno, et autres
Publié: (2025)
Diversity Measures: Domain-Independent Proxies for Failure in Language Model Queries
par: Ngu, Noel, et autres
Publié: (2023)
par: Ngu, Noel, et autres
Publié: (2023)
IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures
par: Gringras, David
Publié: (2026)
par: Gringras, David
Publié: (2026)
Meta-DiffuB: A Contextualized Sequence-to-Sequence Text Diffusion Model with Meta-Exploration
par: Chuang, Yun-Yen, et autres
Publié: (2024)
par: Chuang, Yun-Yen, et autres
Publié: (2024)
Characterizing Large Language Model Geometry Helps Solve Toxicity Detection and Generation
par: Balestriero, Randall, et autres
Publié: (2023)
par: Balestriero, Randall, et autres
Publié: (2023)
Local Topology Measures of Contextual Language Model Latent Spaces With Applications to Dialogue Term Extraction
par: Ruppik, Benjamin Matthias, et autres
Publié: (2024)
par: Ruppik, Benjamin Matthias, et autres
Publié: (2024)
LLMs Should Express Uncertainty Explicitly
par: Guo, Junyu, et autres
Publié: (2026)
par: Guo, Junyu, et autres
Publié: (2026)
Enriching GNNs with Text Contextual Representations for Detecting Disinformation Campaigns on Social Media
par: da Silva, Bruno Croso Cunha, et autres
Publié: (2024)
par: da Silva, Bruno Croso Cunha, et autres
Publié: (2024)
Simulation, Modelling and Classification of Wiki Contributors: Spotting The Good, The Bad, and The Ugly
par: Méndez, Silvia García, et autres
Publié: (2024)
par: Méndez, Silvia García, et autres
Publié: (2024)
Model Merging and Safety Alignment: One Bad Model Spoils the Bunch
par: Hammoud, Hasan Abed Al Kader, et autres
Publié: (2024)
par: Hammoud, Hasan Abed Al Kader, et autres
Publié: (2024)
Beyond Architectures: Evaluating the Role of Contextual Embeddings in Detecting Bipolar Disorder on Social Media
par: Hasan, Khalid, et autres
Publié: (2025)
par: Hasan, Khalid, et autres
Publié: (2025)
Estimation of Concept Explanations Should be Uncertainty Aware
par: Piratla, Vihari, et autres
Publié: (2023)
par: Piratla, Vihari, et autres
Publié: (2023)
AgentCollabBench: Diagnosing When Good Agents Make Bad Collaborators
par: Mazumder, Aritra, et autres
Publié: (2026)
par: Mazumder, Aritra, et autres
Publié: (2026)
ChineseHarm-Bench: A Chinese Harmful Content Detection Benchmark
par: Liu, Kangwei, et autres
Publié: (2025)
par: Liu, Kangwei, et autres
Publié: (2025)
Few-Shot Contrastive Adaptation for Audio Abuse Detection in Low-Resource Indic Languages
par: Sankaran, Aditya Narayan, et autres
Publié: (2026)
par: Sankaran, Aditya Narayan, et autres
Publié: (2026)
Text-ADBench: Text Anomaly Detection Benchmark based on LLMs Embedding
par: Xiao, Feng, et autres
Publié: (2025)
par: Xiao, Feng, et autres
Publié: (2025)
Toxicity Detection towards Adaptability to Changing Perturbations
par: Kang, Hankun, et autres
Publié: (2024)
par: Kang, Hankun, et autres
Publié: (2024)
How Bad is Training on Synthetic Data? A Statistical Analysis of Language Model Collapse
par: Seddik, Mohamed El Amine, et autres
Publié: (2024)
par: Seddik, Mohamed El Amine, et autres
Publié: (2024)
Lookback Lens: Detecting and Mitigating Contextual Hallucinations in Large Language Models Using Only Attention Maps
par: Chuang, Yung-Sung, et autres
Publié: (2024)
par: Chuang, Yung-Sung, et autres
Publié: (2024)
The Multilingual Alignment Prism: Aligning Global and Local Preferences to Reduce Harm
par: Aakanksha, et autres
Publié: (2024)
par: Aakanksha, et autres
Publié: (2024)
Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs
par: Sheshadri, Abhay, et autres
Publié: (2024)
par: Sheshadri, Abhay, et autres
Publié: (2024)
Documents similaires
-
Evading Toxicity Detection with ASCII-art: A Benchmark of Spatial Attacks on Moderation Systems
par: Berezin, Sergey, et autres
Publié: (2024) -
The TIP of the Iceberg: Revealing a Hidden Class of Task-in-Prompt Adversarial Attacks on LLMs
par: Berezin, Sergey, et autres
Publié: (2025) -
Towards Cross-Lingual Audio Abuse Detection in Low-Resource Settings with Few-Shot Learning
par: Sankaran, Aditya Narayan, et autres
Publié: (2024) -
Towards Detecting Contextual Real-Time Toxicity for In-Game Chat
par: Yang, Zachary, et autres
Publié: (2023) -
AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents
par: Andriushchenko, Maksym, et autres
Publié: (2024)