Explicit vs. Implicit: Investigating Social Bias in Large Language Models through Self-Reflection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Yachao, Wang, Bo, Wang, Yan, Zhao, Dongming, He, Ruifang, Hou, Yuexian |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Do LLMs Have the Generalization Ability in Conducting Causal Inference?
par: Wang, Chen, et autres
Publié: (2024)
par: Wang, Chen, et autres
Publié: (2024)
MORPHEUS: Modeling Role from Personalized Dialogue History by Exploring and Utilizing Latent Space
par: Tang, Yihong, et autres
Publié: (2024)
par: Tang, Yihong, et autres
Publié: (2024)
RoleBreak: Character Hallucination as a Jailbreak Attack in Role-Playing Systems
par: Tang, Yihong, et autres
Publié: (2024)
par: Tang, Yihong, et autres
Publié: (2024)
Understanding the Self-Reflection Mechanisms of LLMs through Biased Attitude Associations
par: Zhang, Jingshen, et autres
Publié: (2026)
par: Zhang, Jingshen, et autres
Publié: (2026)
VisBias: Measuring Explicit and Implicit Social Biases in Vision Language Models
par: Huang, Jen-tse, et autres
Publié: (2025)
par: Huang, Jen-tse, et autres
Publié: (2025)
Measuring Implicit Bias in Explicitly Unbiased Large Language Models
par: Bai, Xuechunzi, et autres
Publié: (2024)
par: Bai, Xuechunzi, et autres
Publié: (2024)
Modeling Implicit Conflict Monitoring Mechanisms against Stereotypes in LLMs
par: Zhang, Jingshen, et autres
Publié: (2026)
par: Zhang, Jingshen, et autres
Publié: (2026)
Implicit Probabilistic Reasoning Does Not Reflect Explicit Answers in Large Language Models
par: Mondal, Manuel, et autres
Publié: (2024)
par: Mondal, Manuel, et autres
Publié: (2024)
Covert Bias: The Severity of Social Views' Unalignment in Language Models Towards Implicit and Explicit Opinion
par: Aldayel, Abeer, et autres
Publié: (2024)
par: Aldayel, Abeer, et autres
Publié: (2024)
From Implicit to Explicit: Enhancing Self-Recognition in Large Language Models
par: Zhou, Yinghan, et autres
Publié: (2025)
par: Zhou, Yinghan, et autres
Publié: (2025)
Think Twice: A Human-like Two-stage Conversational Agent for Emotional Response Generation
par: Qian, Yushan, et autres
Publié: (2023)
par: Qian, Yushan, et autres
Publié: (2023)
Infusing Hierarchical Guidance into Prompt Tuning: A Parameter-Efficient Framework for Multi-level Implicit Discourse Relation Recognition
par: Zhao, Haodong, et autres
Publié: (2024)
par: Zhao, Haodong, et autres
Publié: (2024)
CLIMB: A Benchmark of Clinical Bias in Large Language Models
par: Zhang, Yubo, et autres
Publié: (2024)
par: Zhang, Yubo, et autres
Publié: (2024)
Uncovering Implicit Bias in Large Language Models with Concept Learning Dataset
par: Wang, Leroy Z.
Publié: (2025)
par: Wang, Leroy Z.
Publié: (2025)
ImplicitBBQ: Benchmarking Implicit Bias in Large Language Models through Characteristic Based Cues
par: Vedula, Bhaskara Hanuma, et autres
Publié: (2026)
par: Vedula, Bhaskara Hanuma, et autres
Publié: (2026)
Inference-Time Reasoning Selectively Reduces Implicit Social Bias in Large Language Models
par: Apsel, Molly, et autres
Publié: (2026)
par: Apsel, Molly, et autres
Publié: (2026)
MixRea: Benchmarking Explicit-Implicit Reasoning in Large Language Models
par: Cai, Yuanqing, et autres
Publié: (2026)
par: Cai, Yuanqing, et autres
Publié: (2026)
Retrieving Implicit and Explicit Emotional Events Using Large Language Models
par: Hu, Guimin, et autres
Publié: (2024)
par: Hu, Guimin, et autres
Publié: (2024)
Problematic Tokens: Tokenizer Bias in Large Language Models
par: Yang, Jin, et autres
Publié: (2024)
par: Yang, Jin, et autres
Publié: (2024)
Investigating Implicit Bias in Large Language Models: A Large-Scale Study of Over 50 LLMs
par: Kumar, Divyanshu, et autres
Publié: (2024)
par: Kumar, Divyanshu, et autres
Publié: (2024)
Chain of Stance: Stance Detection with Large Language Models
par: Ma, Junxia, et autres
Publié: (2024)
par: Ma, Junxia, et autres
Publié: (2024)
Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings
par: Liu, Zhao, et autres
Publié: (2024)
par: Liu, Zhao, et autres
Publié: (2024)
Enabling Language Models to Implicitly Learn Self-Improvement
par: Wang, Ziqi, et autres
Publié: (2023)
par: Wang, Ziqi, et autres
Publié: (2023)
Gender Bias in Large Language Models across Multiple Languages
par: Zhao, Jinman, et autres
Publié: (2024)
par: Zhao, Jinman, et autres
Publié: (2024)
Dialect vs Demographics: Quantifying LLM Bias from Implicit Linguistic Signals vs. Explicit User Profiles
par: Haq, Irti, et autres
Publié: (2026)
par: Haq, Irti, et autres
Publié: (2026)
Syntax-Aware Complex-Valued Neural Machine Translation
par: Liu, Yang, et autres
Publié: (2023)
par: Liu, Yang, et autres
Publié: (2023)
Think Twice Before Trusting: Self-Detection for Large Language Models through Comprehensive Answer Reflection
par: Li, Moxin, et autres
Publié: (2024)
par: Li, Moxin, et autres
Publié: (2024)
TasTe: Teaching Large Language Models to Translate through Self-Reflection
par: Wang, Yutong, et autres
Publié: (2024)
par: Wang, Yutong, et autres
Publié: (2024)
Self-Debias: Self-correcting for Debiasing Large Language Models
par: Feng, Xuan, et autres
Publié: (2026)
par: Feng, Xuan, et autres
Publié: (2026)
Explicit and Implicit Data Augmentation for Social Event Detection
par: Ma, Congbo, et autres
Publié: (2025)
par: Ma, Congbo, et autres
Publié: (2025)
Enhancing Self-Correction in Large Language Models through Multi-Perspective Reflection
par: Costa, Mariana, et autres
Publié: (2026)
par: Costa, Mariana, et autres
Publié: (2026)
Towards Verifiable Text Generation with Evolving Memory and Self-Reflection
par: Sun, Hao, et autres
Publié: (2023)
par: Sun, Hao, et autres
Publié: (2023)
Is Self-knowledge and Action Consistent or Not: Investigating Large Language Model's Personality
par: Ai, Yiming, et autres
Publié: (2024)
par: Ai, Yiming, et autres
Publié: (2024)
Enhancing Retrieval-Augmented LMs with a Two-stage Consistency Learning Compressor
par: Xu, Chuankai, et autres
Publié: (2024)
par: Xu, Chuankai, et autres
Publié: (2024)
IndiVec: An Exploration of Leveraging Large Language Models for Media Bias Detection with Fine-Grained Bias Indicators
par: Lin, Luyang, et autres
Publié: (2024)
par: Lin, Luyang, et autres
Publié: (2024)
Systematic Bias in Large Language Models: Discrepant Response Patterns in Binary vs. Continuous Judgment Tasks
par: Lu, Yi-Long, et autres
Publié: (2025)
par: Lu, Yi-Long, et autres
Publié: (2025)
Implicit Graph, Explicit Retrieval: Towards Efficient and Interpretable Long-horizon Memory for Large Language Models
par: Zhang, Xin, et autres
Publié: (2026)
par: Zhang, Xin, et autres
Publié: (2026)
Instruct-of-Reflection: Enhancing Large Language Models Iterative Reflection Capabilities via Dynamic-Meta Instruction
par: Liu, Liping, et autres
Publié: (2025)
par: Liu, Liping, et autres
Publié: (2025)
Invisible Influences: Investigating Implicit Intersectional Biases through Persona Engineering in Large Language Models
par: Arimanda, Nandini, et autres
Publié: (2026)
par: Arimanda, Nandini, et autres
Publié: (2026)
Distilling Implicit Multimodal Knowledge into Large Language Models for Zero-Resource Dialogue Generation
par: Zhang, Bo, et autres
Publié: (2024)
par: Zhang, Bo, et autres
Publié: (2024)
Documents similaires
-
Do LLMs Have the Generalization Ability in Conducting Causal Inference?
par: Wang, Chen, et autres
Publié: (2024) -
MORPHEUS: Modeling Role from Personalized Dialogue History by Exploring and Utilizing Latent Space
par: Tang, Yihong, et autres
Publié: (2024) -
RoleBreak: Character Hallucination as a Jailbreak Attack in Role-Playing Systems
par: Tang, Yihong, et autres
Publié: (2024) -
Understanding the Self-Reflection Mechanisms of LLMs through Biased Attitude Associations
par: Zhang, Jingshen, et autres
Publié: (2026) -
VisBias: Measuring Explicit and Implicit Social Biases in Vision Language Models
par: Huang, Jen-tse, et autres
Publié: (2025)