Bias Runs Deep: Implicit Reasoning Biases in Persona-Assigned LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Gupta, Shashank, Shrivastava, Vaishnavi, Deshpande, Ameet, Kalyan, Ashwin, Clark, Peter, Sabharwal, Ashish, Khot, Tushar |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
QualEval: Qualitative Evaluation for Model Improvement
di: Murahari, Vishvak, et al.
Pubblicazione: (2023)
di: Murahari, Vishvak, et al.
Pubblicazione: (2023)
SUPER: Evaluating Agents on Setting Up and Executing Tasks from Research Repositories
di: Bogin, Ben, et al.
Pubblicazione: (2024)
di: Bogin, Ben, et al.
Pubblicazione: (2024)
PersonaGym: Evaluating Persona Agents and LLMs
di: Samuel, Vinay, et al.
Pubblicazione: (2024)
di: Samuel, Vinay, et al.
Pubblicazione: (2024)
Leveraging In-Context Learning for Language Model Agents
di: Gupta, Shivanshu, et al.
Pubblicazione: (2025)
di: Gupta, Shivanshu, et al.
Pubblicazione: (2025)
ADaPT: As-Needed Decomposition and Planning with Language Models
di: Prasad, Archiki, et al.
Pubblicazione: (2023)
di: Prasad, Archiki, et al.
Pubblicazione: (2023)
Engagement Undermines Safety: How Stereotypes and Toxicity Shape Humor in Language Models
di: Dogra, Atharvan, et al.
Pubblicazione: (2025)
di: Dogra, Atharvan, et al.
Pubblicazione: (2025)
AppWorld: A Controllable World of Apps and People for Benchmarking Interactive Coding Agents
di: Trivedi, Harsh, et al.
Pubblicazione: (2024)
di: Trivedi, Harsh, et al.
Pubblicazione: (2024)
Leveraging Code to Improve In-context Learning for Semantic Parsing
di: Bogin, Ben, et al.
Pubblicazione: (2023)
di: Bogin, Ben, et al.
Pubblicazione: (2023)
MoNaCo: More Natural and Complex Questions for Reasoning Across Dozens of Documents
di: Wolfson, Tomer, et al.
Pubblicazione: (2025)
di: Wolfson, Tomer, et al.
Pubblicazione: (2025)
Probing AI Safety with Source Code
di: Narayan, Ujwal, et al.
Pubblicazione: (2025)
di: Narayan, Ujwal, et al.
Pubblicazione: (2025)
Exploring Changes in Nation Perception with Nationality-Assigned Personas in LLMs
di: Kamruzzaman, Mahammed, et al.
Pubblicazione: (2024)
di: Kamruzzaman, Mahammed, et al.
Pubblicazione: (2024)
Are Economists Always More Introverted? Analyzing Consistency in Persona-Assigned LLMs
di: Reusens, Manon, et al.
Pubblicazione: (2025)
di: Reusens, Manon, et al.
Pubblicazione: (2025)
RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs
di: Chaudhari, Shreyas, et al.
Pubblicazione: (2024)
di: Chaudhari, Shreyas, et al.
Pubblicazione: (2024)
On the Reasoning Abilities of Masked Diffusion Language Models
di: Svete, Anej, et al.
Pubblicazione: (2025)
di: Svete, Anej, et al.
Pubblicazione: (2025)
ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning
di: Lin, Bill Yuchen, et al.
Pubblicazione: (2025)
di: Lin, Bill Yuchen, et al.
Pubblicazione: (2025)
DiscoveryBench: Towards Data-Driven Discovery with Large Language Models
di: Majumder, Bodhisattwa Prasad, et al.
Pubblicazione: (2024)
di: Majumder, Bodhisattwa Prasad, et al.
Pubblicazione: (2024)
Language Models can Subtly Deceive Without Lying: A Case Study on Strategic Phrasing in Legislation
di: Dogra, Atharvan, et al.
Pubblicazione: (2024)
di: Dogra, Atharvan, et al.
Pubblicazione: (2024)
Persona-Assigned Large Language Models Exhibit Human-Like Motivated Reasoning
di: Dash, Saloni, et al.
Pubblicazione: (2025)
di: Dash, Saloni, et al.
Pubblicazione: (2025)
Agent Context Protocols Enhance Collective Inference
di: Bhardwaj, Devansh, et al.
Pubblicazione: (2025)
di: Bhardwaj, Devansh, et al.
Pubblicazione: (2025)
Husky: A Unified, Open-Source Language Agent for Multi-Step Reasoning
di: Kim, Joongwon, et al.
Pubblicazione: (2024)
di: Kim, Joongwon, et al.
Pubblicazione: (2024)
Capturing Bias Diversity in LLMs
di: Gosavi, Purva Prasad, et al.
Pubblicazione: (2024)
di: Gosavi, Purva Prasad, et al.
Pubblicazione: (2024)
Exact Expressive Power of Transformers with Padding
di: Merrill, William, et al.
Pubblicazione: (2025)
di: Merrill, William, et al.
Pubblicazione: (2025)
MEDEQUALQA: Evaluating Biases in LLMs with Counterfactual Reasoning
di: Ghosh, Rajarshi, et al.
Pubblicazione: (2025)
di: Ghosh, Rajarshi, et al.
Pubblicazione: (2025)
Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences
di: Shrivastava, Vaishnavi, et al.
Pubblicazione: (2025)
di: Shrivastava, Vaishnavi, et al.
Pubblicazione: (2025)
The Expressive Power of Transformers with Chain of Thought
di: Merrill, William, et al.
Pubblicazione: (2023)
di: Merrill, William, et al.
Pubblicazione: (2023)
Understanding the Logic of Direct Preference Alignment through Logic
di: Richardson, Kyle, et al.
Pubblicazione: (2024)
di: Richardson, Kyle, et al.
Pubblicazione: (2024)
The Illusion of State in State-Space Models
di: Merrill, William, et al.
Pubblicazione: (2024)
di: Merrill, William, et al.
Pubblicazione: (2024)
Implicit Bias in LLMs: A Survey
di: Lin, Xinru, et al.
Pubblicazione: (2025)
di: Lin, Xinru, et al.
Pubblicazione: (2025)
Invisible Influences: Investigating Implicit Intersectional Biases through Persona Engineering in Large Language Models
di: Arimanda, Nandini, et al.
Pubblicazione: (2026)
di: Arimanda, Nandini, et al.
Pubblicazione: (2026)
Latent Factor Models Meets Instructions: Goal-conditioned Latent Factor Discovery without Task Supervision
di: Xie, Zhouhang, et al.
Pubblicazione: (2025)
di: Xie, Zhouhang, et al.
Pubblicazione: (2025)
Data-driven Discovery with Large Generative Models
di: Majumder, Bodhisattwa Prasad, et al.
Pubblicazione: (2024)
di: Majumder, Bodhisattwa Prasad, et al.
Pubblicazione: (2024)
Modeling Human Subjectivity in LLMs Using Explicit and Implicit Human Factors in Personas
di: Giorgi, Salvatore, et al.
Pubblicazione: (2024)
di: Giorgi, Salvatore, et al.
Pubblicazione: (2024)
GEO: Generative Engine Optimization
di: Aggarwal, Pranjal, et al.
Pubblicazione: (2023)
di: Aggarwal, Pranjal, et al.
Pubblicazione: (2023)
'Since Lawyers are Males..': Examining Implicit Gender Bias in Hindi Language Generation by LLMs
di: Joshi, Ishika, et al.
Pubblicazione: (2024)
di: Joshi, Ishika, et al.
Pubblicazione: (2024)
Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning
di: Shrivastava, Vaishnavi, et al.
Pubblicazione: (2025)
di: Shrivastava, Vaishnavi, et al.
Pubblicazione: (2025)
VisBias: Measuring Explicit and Implicit Social Biases in Vision Language Models
di: Huang, Jen-tse, et al.
Pubblicazione: (2025)
di: Huang, Jen-tse, et al.
Pubblicazione: (2025)
Location Not Found: Exposing Implicit Local and Global Biases in Multilingual LLMs
di: Mor-Lan, Guy, et al.
Pubblicazione: (2026)
di: Mor-Lan, Guy, et al.
Pubblicazione: (2026)
Language Model Planners do not Scale, but do Formalizers?
di: Jiang, Owen, et al.
Pubblicazione: (2026)
di: Jiang, Owen, et al.
Pubblicazione: (2026)
LLMs are Biased Teachers: Evaluating LLM Bias in Personalized Education
di: Weissburg, Iain, et al.
Pubblicazione: (2024)
di: Weissburg, Iain, et al.
Pubblicazione: (2024)
DIF: A Framework for Benchmarking and Verifying Implicit Bias in LLMs
di: Yin, Lake, et al.
Pubblicazione: (2025)
di: Yin, Lake, et al.
Pubblicazione: (2025)
Documenti analoghi
-
QualEval: Qualitative Evaluation for Model Improvement
di: Murahari, Vishvak, et al.
Pubblicazione: (2023) -
SUPER: Evaluating Agents on Setting Up and Executing Tasks from Research Repositories
di: Bogin, Ben, et al.
Pubblicazione: (2024) -
PersonaGym: Evaluating Persona Agents and LLMs
di: Samuel, Vinay, et al.
Pubblicazione: (2024) -
Leveraging In-Context Learning for Language Model Agents
di: Gupta, Shivanshu, et al.
Pubblicazione: (2025) -
ADaPT: As-Needed Decomposition and Planning with Language Models
di: Prasad, Archiki, et al.
Pubblicazione: (2023)