Examining Alignment of Large Language Models through Representative Heuristics: The Case of Political Stereotypes
Fuente:
arXiv
Salvato in:
| Autori principali: | Jeoung, Sullam, Ge, Yubin, Wang, Haohan, Diesner, Jana |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond Binary Gender Labels: Revealing Gender Biases in LLMs through Gender-Neutral Name Predictions
di: You, Zhiwen, et al.
Pubblicazione: (2024)
di: You, Zhiwen, et al.
Pubblicazione: (2024)
MEXA: Multilingual Evaluation of English-Centric LLMs via Cross-Lingual Alignment
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2024)
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2024)
Examining the Influence of Political Bias on Large Language Model Performance in Stance Classification
di: Ng, Lynnette Hui Xian, et al.
Pubblicazione: (2024)
di: Ng, Lynnette Hui Xian, et al.
Pubblicazione: (2024)
Detecting Linguistic Indicators for Stereotype Assessment with Large Language Models
di: Görge, Rebekka, et al.
Pubblicazione: (2025)
di: Görge, Rebekka, et al.
Pubblicazione: (2025)
Evaluation of Large Language Models: STEM education and Gender Stereotypes
di: Due, Smilla, et al.
Pubblicazione: (2024)
di: Due, Smilla, et al.
Pubblicazione: (2024)
An Empirical Investigation of Gender Stereotype Representation in Large Language Models: The Italian Case
di: Giachino, Gioele, et al.
Pubblicazione: (2025)
di: Giachino, Gioele, et al.
Pubblicazione: (2025)
Large Language Models Reproduce Racial Stereotypes When Used for Text Annotation
di: Törnberg, Petter
Pubblicazione: (2026)
di: Törnberg, Petter
Pubblicazione: (2026)
Investigating Gender Stereotypes in Large Language Models via Social Determinants of Health
di: Ngo, Trung Hieu, et al.
Pubblicazione: (2026)
di: Ngo, Trung Hieu, et al.
Pubblicazione: (2026)
SQL-Trail: Multi-Turn Reinforcement Learning with Interleaved Feedback for Text-to-SQL
di: Hua, Harper, et al.
Pubblicazione: (2026)
di: Hua, Harper, et al.
Pubblicazione: (2026)
LLM for Everyone: Representing the Underrepresented in Large Language Models
di: Cahyawijaya, Samuel
Pubblicazione: (2024)
di: Cahyawijaya, Samuel
Pubblicazione: (2024)
More Women, Same Stereotypes: Unpacking the Gender Bias Paradox in Large Language Models
di: Chen, Evan, et al.
Pubblicazione: (2025)
di: Chen, Evan, et al.
Pubblicazione: (2025)
A Taxonomy of Stereotype Content in Large Language Models
di: Nicolas, Gandalf, et al.
Pubblicazione: (2024)
di: Nicolas, Gandalf, et al.
Pubblicazione: (2024)
Representing the Under-Represented: Cultural and Core Capability Benchmarks for Developing Thai Large Language Models
di: Kim, Dahyun, et al.
Pubblicazione: (2024)
di: Kim, Dahyun, et al.
Pubblicazione: (2024)
Political-LLM: Large Language Models in Political Science
di: Li, Lincan, et al.
Pubblicazione: (2024)
di: Li, Lincan, et al.
Pubblicazione: (2024)
HALO: An Ontology for Representing and Categorizing Hallucinations in Large Language Models
di: Nananukul, Navapat, et al.
Pubblicazione: (2023)
di: Nananukul, Navapat, et al.
Pubblicazione: (2023)
A Stereotype Content Analysis on Color-related Social Bias in Large Vision Language Models
di: Choi, Junhyuk, et al.
Pubblicazione: (2025)
di: Choi, Junhyuk, et al.
Pubblicazione: (2025)
Reasoning Can Hurt the Inductive Abilities of Large Language Models
di: Jin, Haibo, et al.
Pubblicazione: (2025)
di: Jin, Haibo, et al.
Pubblicazione: (2025)
SGSH: Stimulate Large Language Models with Skeleton Heuristics for Knowledge Base Question Generation
di: Guo, Shasha, et al.
Pubblicazione: (2024)
di: Guo, Shasha, et al.
Pubblicazione: (2024)
Achieving Tokenizer Flexibility in Language Models through Heuristic Adaptation and Supertoken Learning
di: Sharthak, Shaurya, et al.
Pubblicazione: (2025)
di: Sharthak, Shaurya, et al.
Pubblicazione: (2025)
Adaptive Video Understanding Agent: Enhancing efficiency with dynamic frame sampling and feedback-driven reasoning
di: Jeoung, Sullam, et al.
Pubblicazione: (2024)
di: Jeoung, Sullam, et al.
Pubblicazione: (2024)
Language Models Represent Beliefs of Self and Others
di: Zhu, Wentao, et al.
Pubblicazione: (2024)
di: Zhu, Wentao, et al.
Pubblicazione: (2024)
Political Alignment in Large Language Models: A Multidimensional Audit of Psychometric Identity and Behavioral Bias
di: Sakhawat, Adib, et al.
Pubblicazione: (2026)
di: Sakhawat, Adib, et al.
Pubblicazione: (2026)
Correcting Negative Bias in Large Language Models through Negative Attention Score Alignment
di: Yu, Sangwon, et al.
Pubblicazione: (2024)
di: Yu, Sangwon, et al.
Pubblicazione: (2024)
Cross-Language Bias Examination in Large Language Models
di: Liang, Yuxuan, et al.
Pubblicazione: (2025)
di: Liang, Yuxuan, et al.
Pubblicazione: (2025)
Assessing Political Bias in Large Language Models
di: Rettenberger, Luca, et al.
Pubblicazione: (2024)
di: Rettenberger, Luca, et al.
Pubblicazione: (2024)
Towards Context-Invariant Safety Alignment for Large Language Models
di: Wang, Yixu, et al.
Pubblicazione: (2026)
di: Wang, Yixu, et al.
Pubblicazione: (2026)
REFINE-LM: Mitigating Language Model Stereotypes via Reinforcement Learning
di: Qureshi, Rameez, et al.
Pubblicazione: (2024)
di: Qureshi, Rameez, et al.
Pubblicazione: (2024)
Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation
di: Zhuang, Jun, et al.
Pubblicazione: (2025)
di: Zhuang, Jun, et al.
Pubblicazione: (2025)
Hybrid Fact-Checking that Integrates Knowledge Graphs, Large Language Models, and Search-Based Retrieval Agents Improves Interpretable Claim Verification
di: Kolli, Shaghayegh, et al.
Pubblicazione: (2025)
di: Kolli, Shaghayegh, et al.
Pubblicazione: (2025)
Annotation-Efficient Language Model Alignment via Diverse and Representative Response Texts
di: Jinnai, Yuu, et al.
Pubblicazione: (2024)
di: Jinnai, Yuu, et al.
Pubblicazione: (2024)
Unlocking the Power of Large Language Models for Entity Alignment
di: Jiang, Xuhui, et al.
Pubblicazione: (2024)
di: Jiang, Xuhui, et al.
Pubblicazione: (2024)
LLM-A*: Large Language Model Enhanced Incremental Heuristic Search on Path Planning
di: Meng, Silin, et al.
Pubblicazione: (2024)
di: Meng, Silin, et al.
Pubblicazione: (2024)
PREMISE: Scalable and Strategic Prompt Optimization for Efficient Mathematical Reasoning in Large Models
di: Yu, Ye, et al.
Pubblicazione: (2025)
di: Yu, Ye, et al.
Pubblicazione: (2025)
Fundamental Limitations of Alignment in Large Language Models
di: Wolf, Yotam, et al.
Pubblicazione: (2023)
di: Wolf, Yotam, et al.
Pubblicazione: (2023)
Benchmarking Distributional Alignment of Large Language Models
di: Meister, Nicole, et al.
Pubblicazione: (2024)
di: Meister, Nicole, et al.
Pubblicazione: (2024)
Self-Debiasing Large Language Models: Zero-Shot Recognition and Reduction of Stereotypes
di: Gallegos, Isabel O., et al.
Pubblicazione: (2024)
di: Gallegos, Isabel O., et al.
Pubblicazione: (2024)
Multi-objective Large Language Model Alignment with Hierarchical Experts
di: Li, Zhuo, et al.
Pubblicazione: (2025)
di: Li, Zhuo, et al.
Pubblicazione: (2025)
DaSAThco: Data-Aware SAT Heuristics Combinations Optimization via Large Language Models
di: Chen, Minyu, et al.
Pubblicazione: (2025)
di: Chen, Minyu, et al.
Pubblicazione: (2025)
Now You Hear Me: Audio Narrative Attacks Against Large Audio-Language Models
di: Yu, Ye, et al.
Pubblicazione: (2026)
di: Yu, Ye, et al.
Pubblicazione: (2026)
PoliticsBench: Benchmarking Political Values in Large Language Models with Multi-Turn Roleplay
di: Khetan, Rohan, et al.
Pubblicazione: (2026)
di: Khetan, Rohan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Beyond Binary Gender Labels: Revealing Gender Biases in LLMs through Gender-Neutral Name Predictions
di: You, Zhiwen, et al.
Pubblicazione: (2024) -
MEXA: Multilingual Evaluation of English-Centric LLMs via Cross-Lingual Alignment
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2024) -
Examining the Influence of Political Bias on Large Language Model Performance in Stance Classification
di: Ng, Lynnette Hui Xian, et al.
Pubblicazione: (2024) -
Detecting Linguistic Indicators for Stereotype Assessment with Large Language Models
di: Görge, Rebekka, et al.
Pubblicazione: (2025) -
Evaluation of Large Language Models: STEM education and Gender Stereotypes
di: Due, Smilla, et al.
Pubblicazione: (2024)