Evaluating Large Language Model Biases in Persona-Steered Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Andy, Diab, Mona, Fried, Daniel |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Generative Value Conflicts Reveal LLM Priorities
di: Liu, Andy, et al.
Pubblicazione: (2025)
di: Liu, Andy, et al.
Pubblicazione: (2025)
Biases Propagate in Encoder-based Vision-Language Models: A Systematic Analysis From Intrinsic Measures to Zero-shot Retrieval Outcomes
di: Ghate, Kshitish, et al.
Pubblicazione: (2025)
di: Ghate, Kshitish, et al.
Pubblicazione: (2025)
Beyond Static Personas: Situational Personality Steering for Large Language Models
di: Wei, Zesheng, et al.
Pubblicazione: (2026)
di: Wei, Zesheng, et al.
Pubblicazione: (2026)
Investigating Cultural Alignment of Large Language Models
di: AlKhamissi, Badr, et al.
Pubblicazione: (2024)
di: AlKhamissi, Badr, et al.
Pubblicazione: (2024)
BILLY: Steering Large Language Models via Merging Persona Vectors for Creative Generation
di: Pai, Tsung-Min, et al.
Pubblicazione: (2025)
di: Pai, Tsung-Min, et al.
Pubblicazione: (2025)
DSPA: Dynamic SAE Steering for Data-Efficient Preference Alignment
di: Wedgwood, James, et al.
Pubblicazione: (2026)
di: Wedgwood, James, et al.
Pubblicazione: (2026)
Automatic Generation of Model and Data Cards: A Step Towards Responsible AI
di: Liu, Jiarui, et al.
Pubblicazione: (2024)
di: Liu, Jiarui, et al.
Pubblicazione: (2024)
The Impact of Steering Large Language Models with Persona Vectors in Educational Applications
di: Wu, Yongchao, et al.
Pubblicazione: (2026)
di: Wu, Yongchao, et al.
Pubblicazione: (2026)
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
di: Muhamed, Aashiq, et al.
Pubblicazione: (2025)
di: Muhamed, Aashiq, et al.
Pubblicazione: (2025)
A Note on Bias to Complete
di: Xu, Jia, et al.
Pubblicazione: (2024)
di: Xu, Jia, et al.
Pubblicazione: (2024)
Personal Information Parroting in Language Models
di: Subramani, Nishant, et al.
Pubblicazione: (2026)
di: Subramani, Nishant, et al.
Pubblicazione: (2026)
Beyond Understanding: Evaluating the Pragmatic Gap in LLMs' Cultural Processing of Figurative Language
di: Attia, Mena, et al.
Pubblicazione: (2025)
di: Attia, Mena, et al.
Pubblicazione: (2025)
BIG5-CHAT: Shaping LLM Personalities Through Training on Human-Grounded Data
di: Li, Wenkai, et al.
Pubblicazione: (2024)
di: Li, Wenkai, et al.
Pubblicazione: (2024)
Towards Valid Student Simulation with Large Language Models
di: Yuan, Zhihao, et al.
Pubblicazione: (2026)
di: Yuan, Zhihao, et al.
Pubblicazione: (2026)
Synthetic Socratic Debates: Examining Persona Effects on Moral Decision and Persuasion Dynamics
di: Liu, Jiarui, et al.
Pubblicazione: (2025)
di: Liu, Jiarui, et al.
Pubblicazione: (2025)
LLM Microscope: What Model Internals Reveal About Answer Correctness and Context Utilization
di: Liu, Jiarui, et al.
Pubblicazione: (2025)
di: Liu, Jiarui, et al.
Pubblicazione: (2025)
Invisible Influences: Investigating Implicit Intersectional Biases through Persona Engineering in Large Language Models
di: Arimanda, Nandini, et al.
Pubblicazione: (2026)
di: Arimanda, Nandini, et al.
Pubblicazione: (2026)
Emotion Classification in Low and Moderate Resource Languages
di: Tafreshi, Shabnam, et al.
Pubblicazione: (2024)
di: Tafreshi, Shabnam, et al.
Pubblicazione: (2024)
Persona Setting Pitfall: Persistent Outgroup Biases in Large Language Models Arising from Social Identity Adoption
di: Dong, Wenchao, et al.
Pubblicazione: (2024)
di: Dong, Wenchao, et al.
Pubblicazione: (2024)
Style Vectors for Steering Generative Large Language Model
di: Konen, Kai, et al.
Pubblicazione: (2024)
di: Konen, Kai, et al.
Pubblicazione: (2024)
Evaluating and Steering Modality Preferences in Multimodal Large Language Model
di: Zhang, Yu, et al.
Pubblicazione: (2025)
di: Zhang, Yu, et al.
Pubblicazione: (2025)
Combining Discrete Wavelet and Cosine Transforms for Efficient Sentence Embedding
di: Salama, Rana, et al.
Pubblicazione: (2025)
di: Salama, Rana, et al.
Pubblicazione: (2025)
EVALUESTEER: Measuring Reward Model Steerability Towards Values and Preferences
di: Ghate, Kshitish, et al.
Pubblicazione: (2025)
di: Ghate, Kshitish, et al.
Pubblicazione: (2025)
Measuring Stereotype and Deviation Biases in Large Language Models
di: Wang, Daniel, et al.
Pubblicazione: (2025)
di: Wang, Daniel, et al.
Pubblicazione: (2025)
Steering Large Language Models to Evaluate and Amplify Creativity
di: Olson, Matthew Lyle, et al.
Pubblicazione: (2024)
di: Olson, Matthew Lyle, et al.
Pubblicazione: (2024)
Robust Evaluation Measures for Evaluating Social Biases in Masked Language Models
di: Liu, Yang
Pubblicazione: (2024)
di: Liu, Yang
Pubblicazione: (2024)
Persona Jailbreaking in Large Language Models
di: Sandhan, Jivnesh, et al.
Pubblicazione: (2026)
di: Sandhan, Jivnesh, et al.
Pubblicazione: (2026)
CoRAG: Collaborative Retrieval-Augmented Generation
di: Muhamed, Aashiq, et al.
Pubblicazione: (2025)
di: Muhamed, Aashiq, et al.
Pubblicazione: (2025)
Analyzing the Role of Semantic Representations in the Era of Large Language Models
di: Jin, Zhijing, et al.
Pubblicazione: (2024)
di: Jin, Zhijing, et al.
Pubblicazione: (2024)
Can Large Language Models Infer Causation from Correlation?
di: Jin, Zhijing, et al.
Pubblicazione: (2023)
di: Jin, Zhijing, et al.
Pubblicazione: (2023)
JiraiBench: A Bilingual Benchmark for Evaluating Large Language Models' Detection of Human Self-Destructive Behavior Content in Jirai Community
di: Xiao, Yunze, et al.
Pubblicazione: (2025)
di: Xiao, Yunze, et al.
Pubblicazione: (2025)
Decoding Dark Matter: Specialized Sparse Autoencoders for Interpreting Rare Concepts in Foundation Models
di: Muhamed, Aashiq, et al.
Pubblicazione: (2024)
di: Muhamed, Aashiq, et al.
Pubblicazione: (2024)
Psychological Steering of Large Language Models
di: Blas, Leonardo, et al.
Pubblicazione: (2026)
di: Blas, Leonardo, et al.
Pubblicazione: (2026)
Decomposing and Steering Functional Metacognition in Large Language Models
di: Li, Yanshi, et al.
Pubblicazione: (2026)
di: Li, Yanshi, et al.
Pubblicazione: (2026)
Semantic Compression for Word and Sentence Embeddings using Discrete Wavelet Transform
di: Salama, Rana Aref, et al.
Pubblicazione: (2025)
di: Salama, Rana Aref, et al.
Pubblicazione: (2025)
BiasCause: Evaluate Socially Biased Causal Reasoning of Large Language Models
di: Xie, Tian, et al.
Pubblicazione: (2025)
di: Xie, Tian, et al.
Pubblicazione: (2025)
StressRoBERTa: Cross-Condition Transfer Learning from Depression, Anxiety, and PTSD to Stress Detection
di: Alqahtani, Amal, et al.
Pubblicazione: (2025)
di: Alqahtani, Amal, et al.
Pubblicazione: (2025)
DWTSumm: Discrete Wavelet Transform for Document Summarization
di: Salama, Rana, et al.
Pubblicazione: (2026)
di: Salama, Rana, et al.
Pubblicazione: (2026)
Evaluating Cultural Adaptability of a Large Language Model via Simulation of Synthetic Personas
di: Kwok, Louis, et al.
Pubblicazione: (2024)
di: Kwok, Louis, et al.
Pubblicazione: (2024)
Taming Object Hallucinations with Verified Atomic Confidence Estimation
di: Liu, Jiarui, et al.
Pubblicazione: (2025)
di: Liu, Jiarui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Generative Value Conflicts Reveal LLM Priorities
di: Liu, Andy, et al.
Pubblicazione: (2025) -
Biases Propagate in Encoder-based Vision-Language Models: A Systematic Analysis From Intrinsic Measures to Zero-shot Retrieval Outcomes
di: Ghate, Kshitish, et al.
Pubblicazione: (2025) -
Beyond Static Personas: Situational Personality Steering for Large Language Models
di: Wei, Zesheng, et al.
Pubblicazione: (2026) -
Investigating Cultural Alignment of Large Language Models
di: AlKhamissi, Badr, et al.
Pubblicazione: (2024) -
BILLY: Steering Large Language Models via Merging Persona Vectors for Creative Generation
di: Pai, Tsung-Min, et al.
Pubblicazione: (2025)