Uncovering Implicit Bias in Large Language Models with Concept Learning Dataset
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Wang, Leroy Z. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ImplicitBBQ: Benchmarking Implicit Bias in Large Language Models through Characteristic Based Cues
par: Vedula, Bhaskara Hanuma, et autres
Publié: (2026)
par: Vedula, Bhaskara Hanuma, et autres
Publié: (2026)
Minimization of Boolean Complexity in In-Context Concept Learning
par: Wang, Leroy Z., et autres
Publié: (2024)
par: Wang, Leroy Z., et autres
Publié: (2024)
Evaluating Implicit Bias in Large Language Models by Attacking From a Psychometric Perspective
par: Wen, Yuchen, et autres
Publié: (2024)
par: Wen, Yuchen, et autres
Publié: (2024)
Investigating Implicit Bias in Large Language Models: A Large-Scale Study of Over 50 LLMs
par: Kumar, Divyanshu, et autres
Publié: (2024)
par: Kumar, Divyanshu, et autres
Publié: (2024)
Promoting Equality in Large Language Models: Identifying and Mitigating the Implicit Bias based on Bayesian Theory
par: Deng, Yongxin, et autres
Publié: (2024)
par: Deng, Yongxin, et autres
Publié: (2024)
GenderAlign: An Alignment Dataset for Mitigating Gender Bias in Large Language Models
par: Zhang, Tao, et autres
Publié: (2024)
par: Zhang, Tao, et autres
Publié: (2024)
Regional Bias in Large Language Models
par: Gopinadh, M P V S, et autres
Publié: (2026)
par: Gopinadh, M P V S, et autres
Publié: (2026)
ImF: Implicit Fingerprint for Large Language Models
par: Wu, Jiaxuan, et autres
Publié: (2025)
par: Wu, Jiaxuan, et autres
Publié: (2025)
Self-Specialization: Uncovering Latent Expertise within Large Language Models
par: Kang, Junmo, et autres
Publié: (2023)
par: Kang, Junmo, et autres
Publié: (2023)
MegaFake: A Theory-Driven Dataset of Fake News Generated by Large Language Models
par: Wang, Lionel Z., et autres
Publié: (2024)
par: Wang, Lionel Z., et autres
Publié: (2024)
Assessing Political Bias in Large Language Models
par: Rettenberger, Luca, et autres
Publié: (2024)
par: Rettenberger, Luca, et autres
Publié: (2024)
Uncovering Emergent Physics Representations Learned In-Context by Large Language Models
par: Song, Yeongwoo, et autres
Publié: (2025)
par: Song, Yeongwoo, et autres
Publié: (2025)
Large Language Model for Patent Concept Generation
par: Ren, Runtao, et autres
Publié: (2024)
par: Ren, Runtao, et autres
Publié: (2024)
ConceptViz: A Visual Analytics Approach for Exploring Concepts in Large Language Models
par: Li, Haoxuan, et autres
Publié: (2025)
par: Li, Haoxuan, et autres
Publié: (2025)
Implicit Bias in LLMs: A Survey
par: Lin, Xinru, et autres
Publié: (2025)
par: Lin, Xinru, et autres
Publié: (2025)
Implicit Reasoning in Large Language Models: A Comprehensive Survey
par: Li, Jindong, et autres
Publié: (2025)
par: Li, Jindong, et autres
Publié: (2025)
Comparing Human and Large Language Model Interpretation of Implicit Information
par: De Santis, Antonio, et autres
Publié: (2026)
par: De Santis, Antonio, et autres
Publié: (2026)
Locating and Mitigating Gender Bias in Large Language Models
par: Cai, Yuchen, et autres
Publié: (2024)
par: Cai, Yuchen, et autres
Publié: (2024)
Cultural Bias and Cultural Alignment of Large Language Models
par: Tao, Yan, et autres
Publié: (2023)
par: Tao, Yan, et autres
Publié: (2023)
Cross-Language Bias Examination in Large Language Models
par: Liang, Yuxuan, et autres
Publié: (2025)
par: Liang, Yuxuan, et autres
Publié: (2025)
Identifying Linear Relational Concepts in Large Language Models
par: Chanin, David, et autres
Publié: (2023)
par: Chanin, David, et autres
Publié: (2023)
Emotion Concepts and their Function in a Large Language Model
par: Sofroniew, Nicholas, et autres
Publié: (2026)
par: Sofroniew, Nicholas, et autres
Publié: (2026)
Dataset Featurization: Uncovering Natural Language Features through Unsupervised Data Reconstruction
par: Bravansky, Michal, et autres
Publié: (2025)
par: Bravansky, Michal, et autres
Publié: (2025)
Uncovering Competency Gaps in Large Language Models and Their Benchmarks
par: Bohacek, Maty, et autres
Publié: (2025)
par: Bohacek, Maty, et autres
Publié: (2025)
From Implicit to Explicit: Enhancing Self-Recognition in Large Language Models
par: Zhou, Yinghan, et autres
Publié: (2025)
par: Zhou, Yinghan, et autres
Publié: (2025)
No LLM is Free From Bias: A Comprehensive Study of Bias Evaluation in Large Language Models
par: Kumar, Charaka Vinayak, et autres
Publié: (2025)
par: Kumar, Charaka Vinayak, et autres
Publié: (2025)
Observations and Remedies for Large Language Model Bias in Self-Consuming Performative Loop
par: Wang, Yaxuan, et autres
Publié: (2026)
par: Wang, Yaxuan, et autres
Publié: (2026)
Large Language Models Are Still Misled by Simple Bias Ensembles
par: Sun, Zhouhao, et autres
Publié: (2025)
par: Sun, Zhouhao, et autres
Publié: (2025)
Likelihood-based Mitigation of Evaluation Bias in Large Language Models
par: Oi, Masanari, et autres
Publié: (2024)
par: Oi, Masanari, et autres
Publié: (2024)
Multi-Persona Thinking for Bias Mitigation in Large Language Models
par: Chen, Yuxing, et autres
Publié: (2026)
par: Chen, Yuxing, et autres
Publié: (2026)
Prompt Programming for Cultural Bias and Alignment of Large Language Models
par: Eren, Maksim, et autres
Publié: (2026)
par: Eren, Maksim, et autres
Publié: (2026)
Large Language Models on Fine-grained Emotion Detection Dataset with Data Augmentation and Transfer Learning
par: Wang, Kaipeng, et autres
Publié: (2024)
par: Wang, Kaipeng, et autres
Publié: (2024)
Meta-Judging with Large Language Models: Concepts, Methods, and Challenges
par: Silva, Hugo, et autres
Publié: (2026)
par: Silva, Hugo, et autres
Publié: (2026)
CoLLEGe: Concept Embedding Generation for Large Language Models
par: Teehan, Ryan, et autres
Publié: (2024)
par: Teehan, Ryan, et autres
Publié: (2024)
AfriStereo: A Culturally Grounded Dataset for Evaluating Stereotypical Bias in Large Language Models
par: Beux, Yann Le, et autres
Publié: (2025)
par: Beux, Yann Le, et autres
Publié: (2025)
Analyzing Bias in Swiss Federal Supreme Court Judgments Using Facebook's Holistic Bias Dataset: Implications for Language Model Training
par: Wehnert, Sabine, et autres
Publié: (2025)
par: Wehnert, Sabine, et autres
Publié: (2025)
iCLP: Large Language Model Reasoning with Implicit Cognition Latent Planning
par: Chen, Sijia, et autres
Publié: (2025)
par: Chen, Sijia, et autres
Publié: (2025)
A Peek into Token Bias: Large Language Models Are Not Yet Genuine Reasoners
par: Jiang, Bowen, et autres
Publié: (2024)
par: Jiang, Bowen, et autres
Publié: (2024)
Implicit Probabilistic Reasoning Does Not Reflect Explicit Answers in Large Language Models
par: Mondal, Manuel, et autres
Publié: (2024)
par: Mondal, Manuel, et autres
Publié: (2024)
Are Large Language Models Really Bias-Free? Jailbreak Prompts for Assessing Adversarial Robustness to Bias Elicitation
par: Cantini, Riccardo, et autres
Publié: (2024)
par: Cantini, Riccardo, et autres
Publié: (2024)
Documents similaires
-
ImplicitBBQ: Benchmarking Implicit Bias in Large Language Models through Characteristic Based Cues
par: Vedula, Bhaskara Hanuma, et autres
Publié: (2026) -
Minimization of Boolean Complexity in In-Context Concept Learning
par: Wang, Leroy Z., et autres
Publié: (2024) -
Evaluating Implicit Bias in Large Language Models by Attacking From a Psychometric Perspective
par: Wen, Yuchen, et autres
Publié: (2024) -
Investigating Implicit Bias in Large Language Models: A Large-Scale Study of Over 50 LLMs
par: Kumar, Divyanshu, et autres
Publié: (2024) -
Promoting Equality in Large Language Models: Identifying and Mitigating the Implicit Bias based on Bayesian Theory
par: Deng, Yongxin, et autres
Publié: (2024)