Probing Association Biases in LLM Moderation Over-Sensitivity
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Yuxin, Yu, Botao, Yang, Ivory, Hassanpour, Saeed, Vosoughi, Soroush |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MentalManip: A Dataset For Fine-grained Analysis of Mental Manipulation in Conversations
par: Wang, Yuxin, et autres
Publié: (2024)
par: Wang, Yuxin, et autres
Publié: (2024)
Communication is All You Need: Persuasion Dataset Construction via Multi-LLM Communication
par: Ma, Weicheng, et autres
Publié: (2025)
par: Ma, Weicheng, et autres
Publié: (2025)
Cluster-R1: Large Reasoning Models Are Instruction-following Clustering Agents
par: Qing, Peijun, et autres
Publié: (2026)
par: Qing, Peijun, et autres
Publié: (2026)
Towards Interpretable Deep Reinforcement Learning Models via Inverse Reinforcement Learning
par: Xie, Sean, et autres
Publié: (2022)
par: Xie, Sean, et autres
Publié: (2022)
ImpScore: A Learnable Metric For Quantifying The Implicitness Level of Sentence
par: Wang, Yuxin, et autres
Publié: (2024)
par: Wang, Yuxin, et autres
Publié: (2024)
NushuRescue: Revitalization of the Endangered Nushu Language with AI
par: Yang, Ivory, et autres
Publié: (2024)
par: Yang, Ivory, et autres
Publié: (2024)
Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge
par: Shi, Lin, et autres
Publié: (2024)
par: Shi, Lin, et autres
Publié: (2024)
Is It Navajo? Accurate Language Detection in Endangered Athabaskan Languages
par: Yang, Ivory, et autres
Publié: (2025)
par: Yang, Ivory, et autres
Publié: (2025)
Enhanced Detection of Conversational Mental Manipulation Through Advanced Prompting Techniques
par: Yang, Ivory, et autres
Publié: (2024)
par: Yang, Ivory, et autres
Publié: (2024)
From Biased Chatbots to Biased Agents: Examining Role Assignment Effects on LLM Agent Robustness
par: Cao, Linbo, et autres
Publié: (2026)
par: Cao, Linbo, et autres
Publié: (2026)
Split and Merge: Aligning Position Biases in LLM-based Evaluators
par: Li, Zongjie, et autres
Publié: (2023)
par: Li, Zongjie, et autres
Publié: (2023)
Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge
par: Ye, Jiayi, et autres
Publié: (2024)
par: Ye, Jiayi, et autres
Publié: (2024)
The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering
par: Zhou, Yefan, et autres
Publié: (2026)
par: Zhou, Yefan, et autres
Publié: (2026)
Overcoming Multi-step Complexity in Multimodal Theory-of-Mind Reasoning: A Scalable Bayesian Planner
par: Zhang, Chunhui, et autres
Publié: (2025)
par: Zhang, Chunhui, et autres
Publié: (2025)
Diffusion Language Models Know the Answer Before Decoding
par: Li, Pengxiang, et autres
Publié: (2025)
par: Li, Pengxiang, et autres
Publié: (2025)
Systematic Biases in LLM Simulations of Debates
par: Taubenfeld, Amir, et autres
Publié: (2024)
par: Taubenfeld, Amir, et autres
Publié: (2024)
An Investigation of Linguistic Biases in LLM-Based Recommendations
par: Venkateswaran, Nitin, et autres
Publié: (2026)
par: Venkateswaran, Nitin, et autres
Publié: (2026)
Unveiling Selection Biases: Exploring Order and Token Sensitivity in Large Language Models
par: Wei, Sheng-Lun, et autres
Publié: (2024)
par: Wei, Sheng-Lun, et autres
Publié: (2024)
A Benchmark for Long-Form Medical Question Answering
par: Hosseini, Pedram, et autres
Publié: (2024)
par: Hosseini, Pedram, et autres
Publié: (2024)
Backtracking When It Strays: Mitigating Dual Exposure Biases in LLM Reasoning Distillation
par: Wang, Bing, et autres
Publié: (2026)
par: Wang, Bing, et autres
Publié: (2026)
Neural Retrievers are Biased Towards LLM-Generated Content
par: Dai, Sunhao, et autres
Publié: (2023)
par: Dai, Sunhao, et autres
Publié: (2023)
Socio-Culturally Aware Evaluation Framework for LLM-Based Content Moderation
par: Kumar, Shanu, et autres
Publié: (2024)
par: Kumar, Shanu, et autres
Publié: (2024)
Sentinel: Decoding Context Utilization via Attention Probing for Efficient LLM Context Compression
par: Zhang, Yong, et autres
Publié: (2025)
par: Zhang, Yong, et autres
Publié: (2025)
IPS: In-Prompt Process Supervision for Short Video Content Moderation
par: Liu, Mingchao, et autres
Publié: (2024)
par: Liu, Mingchao, et autres
Publié: (2024)
Decoding Biases: Automated Methods and LLM Judges for Gender Bias Detection in Language Models
par: Kumar, Shachi H, et autres
Publié: (2024)
par: Kumar, Shachi H, et autres
Publié: (2024)
Evaluating Implicit Biases in LLM Reasoning through Logic Grid Puzzles
par: Jahara, Fatima, et autres
Publié: (2025)
par: Jahara, Fatima, et autres
Publié: (2025)
LLM-C3MOD: A Human-LLM Collaborative System for Cross-Cultural Hate Speech Moderation
par: Park, Junyeong, et autres
Publié: (2025)
par: Park, Junyeong, et autres
Publié: (2025)
PRISM: Probing Reasoning, Instruction, and Source Memory in LLM Hallucinations
par: Wu, Yuhe, et autres
Publié: (2026)
par: Wu, Yuhe, et autres
Publié: (2026)
The African Woman is Rhythmic and Soulful: An Investigation of Implicit Biases in LLM Open-ended Text Generation
par: Lim, Serene, et autres
Publié: (2024)
par: Lim, Serene, et autres
Publié: (2024)
Taming Sensitive Weights : Noise Perturbation Fine-tuning for Robust LLM Quantization
par: Wang, Dongwei, et autres
Publié: (2024)
par: Wang, Dongwei, et autres
Publié: (2024)
FLAME: Flexible LLM-Assisted Moderation Engine
par: Bakulin, Ivan, et autres
Publié: (2025)
par: Bakulin, Ivan, et autres
Publié: (2025)
Spot the BlindSpots: Systematic Identification and Quantification of Fine-Grained LLM Biases in Contact Center Summaries
par: Mayilvaghanan, Kawin, et autres
Publié: (2025)
par: Mayilvaghanan, Kawin, et autres
Publié: (2025)
Let's Reason Formally: Natural-Formal Hybrid Reasoning Enhances LLM's Math Capability
par: Wang, Ruida, et autres
Publié: (2025)
par: Wang, Ruida, et autres
Publié: (2025)
AI Can Be Cognitively Biased: An Exploratory Study on Threshold Priming in LLM-Based Batch Relevance Assessment
par: Chen, Nuo, et autres
Publié: (2024)
par: Chen, Nuo, et autres
Publié: (2024)
Are Akpans Trick or Treat: Unveiling Helpful Biases in Assistant Systems
par: Sun, Jiao, et autres
Publié: (2022)
par: Sun, Jiao, et autres
Publié: (2022)
Single Parent Family: A Spectrum of Family Members from a Single Pre-Trained Foundation Model
par: Hajimolahoseini, Habib, et autres
Publié: (2024)
par: Hajimolahoseini, Habib, et autres
Publié: (2024)
Benchmarking Open-Source Large Language Models for Persian in Zero-Shot and Few-Shot Learning
par: Cherakhloo, Mahdi, et autres
Publié: (2025)
par: Cherakhloo, Mahdi, et autres
Publié: (2025)
Decoding Multilingual Moral Preferences: Unveiling LLM's Biases Through the Moral Machine Experiment
par: Vida, Karina, et autres
Publié: (2024)
par: Vida, Karina, et autres
Publié: (2024)
Are Bias Evaluation Methods Biased ?
par: Berrayana, Lina, et autres
Publié: (2025)
par: Berrayana, Lina, et autres
Publié: (2025)
Look Before You Leap: Autonomous Exploration for LLM Agents
par: Ye, Ziang, et autres
Publié: (2026)
par: Ye, Ziang, et autres
Publié: (2026)
Documents similaires
-
MentalManip: A Dataset For Fine-grained Analysis of Mental Manipulation in Conversations
par: Wang, Yuxin, et autres
Publié: (2024) -
Communication is All You Need: Persuasion Dataset Construction via Multi-LLM Communication
par: Ma, Weicheng, et autres
Publié: (2025) -
Cluster-R1: Large Reasoning Models Are Instruction-following Clustering Agents
par: Qing, Peijun, et autres
Publié: (2026) -
Towards Interpretable Deep Reinforcement Learning Models via Inverse Reinforcement Learning
par: Xie, Sean, et autres
Publié: (2022) -
ImpScore: A Learnable Metric For Quantifying The Implicitness Level of Sentence
par: Wang, Yuxin, et autres
Publié: (2024)