The Emergence of Lab-Driven Alignment Signatures: A Psychometric Framework for Auditing Latent Bias and Compounding Risk in Generative AI
Fuente:
arXiv
Salvato in:
| Autore principale: | Bosnjakovic, Dusan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Political Alignment in Large Language Models: A Multidimensional Audit of Psychometric Identity and Behavioral Bias
di: Sakhawat, Adib, et al.
Pubblicazione: (2026)
di: Sakhawat, Adib, et al.
Pubblicazione: (2026)
Compounding Disadvantage: Auditing Intersectional Bias in LLM-Generated Explanations Across Indian and American STEM Education
di: Gupta, Amogh, et al.
Pubblicazione: (2026)
di: Gupta, Amogh, et al.
Pubblicazione: (2026)
A Scalable Entity-Based Framework for Auditing Bias in LLMs
di: Elbouanani, Akram, et al.
Pubblicazione: (2026)
di: Elbouanani, Akram, et al.
Pubblicazione: (2026)
Down the Toxicity Rabbit Hole: A Novel Framework to Bias Audit Large Language Models
di: Dutta, Arka, et al.
Pubblicazione: (2023)
di: Dutta, Arka, et al.
Pubblicazione: (2023)
BiasLab: A Multilingual, Dual-Framing Framework for Robust Measurement of Output-Level Bias in Large Language Models
di: Guey, William, et al.
Pubblicazione: (2026)
di: Guey, William, et al.
Pubblicazione: (2026)
AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviors
di: Sheshadri, Abhay, et al.
Pubblicazione: (2026)
di: Sheshadri, Abhay, et al.
Pubblicazione: (2026)
BiasLab: Toward Explainable Political Bias Detection with Dual-Axis Annotations and Rationale Indicators
di: Solaiman, Kma
Pubblicazione: (2025)
di: Solaiman, Kma
Pubblicazione: (2025)
Alignment Reduces Expressed but Not Encoded Gender Bias: A Unified Framework and Study
di: Bouchouchi, Nour, et al.
Pubblicazione: (2026)
di: Bouchouchi, Nour, et al.
Pubblicazione: (2026)
AISafetyLab: A Comprehensive Framework for AI Safety Evaluation and Improvement
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
Anchoring LLM Gender Bias to Human Baselines: A Cross-Lingual Audit
di: Choi, Jiwoo, et al.
Pubblicazione: (2026)
di: Choi, Jiwoo, et al.
Pubblicazione: (2026)
Automated Bias Assessment in AI-Generated Educational Content Using CEAT Framework
di: Peng, Jingyang, et al.
Pubblicazione: (2025)
di: Peng, Jingyang, et al.
Pubblicazione: (2025)
Keeping Up with the Language Models: Systematic Benchmark Extension for Bias Auditing
di: Baldini, Ioana, et al.
Pubblicazione: (2023)
di: Baldini, Ioana, et al.
Pubblicazione: (2023)
Assessing AI-Generated Questions' Alignment with Cognitive Frameworks in Educational Assessment
di: Yaacoub, Antoun, et al.
Pubblicazione: (2025)
di: Yaacoub, Antoun, et al.
Pubblicazione: (2025)
BiAxisAudit: A Novel Framework to Evaluate LLM Bias Across Prompt Sensitivity and Response-Layer Divergence
di: Gan, Jialing, et al.
Pubblicazione: (2026)
di: Gan, Jialing, et al.
Pubblicazione: (2026)
Who Gets Which Message? Auditing Demographic Bias in LLM-Generated Targeted Text
di: Islam, Tunazzina
Pubblicazione: (2026)
di: Islam, Tunazzina
Pubblicazione: (2026)
TakeLab Retriever: AI-Driven Search Engine for Articles from Croatian News Outlets
di: Dukić, David, et al.
Pubblicazione: (2024)
di: Dukić, David, et al.
Pubblicazione: (2024)
A Persona-Based Evaluation Framework for Pluralistic Alignment in Generative AI
di: Karagoz, Atahan
Pubblicazione: (2026)
di: Karagoz, Atahan
Pubblicazione: (2026)
Measuring Human and AI Values Based on Generative Psychometrics with Large Language Models
di: Ye, Haoran, et al.
Pubblicazione: (2024)
di: Ye, Haoran, et al.
Pubblicazione: (2024)
EQUITRIAGE: A Fairness Audit of Gender Bias in LLM-Based Emergency Department Triage
di: Young, Richard J., et al.
Pubblicazione: (2026)
di: Young, Richard J., et al.
Pubblicazione: (2026)
Emergence of Self-Identity in AI: A Mathematical Framework and Empirical Study with Generative Large Language Models
di: Lee, Minhyeok
Pubblicazione: (2024)
di: Lee, Minhyeok
Pubblicazione: (2024)
Psychometric Alignment: Capturing Human Knowledge Distributions via Language Models
di: He-Yueya, Joy, et al.
Pubblicazione: (2024)
di: He-Yueya, Joy, et al.
Pubblicazione: (2024)
When AI Speaks, Whose Values Does It Express? A Cross-Cultural Audit of Individualism-Collectivism Bias in Large Language Models
di: Venkata, Pruthvinath Jeripity
Pubblicazione: (2026)
di: Venkata, Pruthvinath Jeripity
Pubblicazione: (2026)
Audit, Alignment, and Optimization of LM-Powered Subroutines with Application to Public Comment Processing
di: Raab, Reilly, et al.
Pubblicazione: (2025)
di: Raab, Reilly, et al.
Pubblicazione: (2025)
SAIF: A Comprehensive Framework for Evaluating the Risks of Generative AI in the Public Sector
di: Lee, Kyeongryul, et al.
Pubblicazione: (2025)
di: Lee, Kyeongryul, et al.
Pubblicazione: (2025)
Evaluating and Mitigating Bias in AI-Based Medical Text Generation
di: Chen, Xiuying, et al.
Pubblicazione: (2025)
di: Chen, Xiuying, et al.
Pubblicazione: (2025)
Combating Confirmation Bias: A Unified Pseudo-Labeling Framework for Entity Alignment
di: Ding, Qijie, et al.
Pubblicazione: (2023)
di: Ding, Qijie, et al.
Pubblicazione: (2023)
AI-Driven Generation of Old English: A Framework for Low-Resource Languages
di: Alva, Rodrigo Gabriel Salazar, et al.
Pubblicazione: (2025)
di: Alva, Rodrigo Gabriel Salazar, et al.
Pubblicazione: (2025)
Evaluating Implicit Bias in Large Language Models by Attacking From a Psychometric Perspective
di: Wen, Yuchen, et al.
Pubblicazione: (2024)
di: Wen, Yuchen, et al.
Pubblicazione: (2024)
FAIRE: Assessing Racial and Gender Bias in AI-Driven Resume Evaluations
di: Wen, Athena, et al.
Pubblicazione: (2025)
di: Wen, Athena, et al.
Pubblicazione: (2025)
When AI Settles Down: Late-Stage Stability as a Signature of AI-Generated Text Detection
di: Sun, Ke, et al.
Pubblicazione: (2026)
di: Sun, Ke, et al.
Pubblicazione: (2026)
Pluralistic Alignment for Healthcare: A Role-Driven Framework
di: Zhong, Jiayou, et al.
Pubblicazione: (2025)
di: Zhong, Jiayou, et al.
Pubblicazione: (2025)
Bias Association Discovery Framework for Open-Ended LLM Generations
di: Pan, Jinhao, et al.
Pubblicazione: (2025)
di: Pan, Jinhao, et al.
Pubblicazione: (2025)
EthicMind: A Risk-Aware Framework for Ethical-Emotional Alignment in Multi-Turn Dialogue
di: Deng, Jiawen, et al.
Pubblicazione: (2026)
di: Deng, Jiawen, et al.
Pubblicazione: (2026)
Auditing Stance Asymmetry in Generative Explanations
di: Han, Jiarui
Pubblicazione: (2026)
di: Han, Jiarui
Pubblicazione: (2026)
The Canary's Echo: Auditing Privacy Risks of LLM-Generated Synthetic Text
di: Meeus, Matthieu, et al.
Pubblicazione: (2025)
di: Meeus, Matthieu, et al.
Pubblicazione: (2025)
Don't Change My View: Ideological Bias Auditing in Large Language Models
di: Kröger, Paul, et al.
Pubblicazione: (2025)
di: Kröger, Paul, et al.
Pubblicazione: (2025)
Aegis2.0: A Diverse AI Safety Dataset and Risks Taxonomy for Alignment of LLM Guardrails
di: Ghosh, Shaona, et al.
Pubblicazione: (2025)
di: Ghosh, Shaona, et al.
Pubblicazione: (2025)
Exploring the Effects of Alignment on Numerical Bias in Large Language Models
di: Sato, Ayako, et al.
Pubblicazione: (2026)
di: Sato, Ayako, et al.
Pubblicazione: (2026)
AesBiasBench: Evaluating Bias and Alignment in Multimodal Language Models for Personalized Image Aesthetic Assessment
di: Li, Kun, et al.
Pubblicazione: (2025)
di: Li, Kun, et al.
Pubblicazione: (2025)
Automated Benchmark Auditing for AI Agents and Large Language Models
di: Wang, Junlin, et al.
Pubblicazione: (2026)
di: Wang, Junlin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Political Alignment in Large Language Models: A Multidimensional Audit of Psychometric Identity and Behavioral Bias
di: Sakhawat, Adib, et al.
Pubblicazione: (2026) -
Compounding Disadvantage: Auditing Intersectional Bias in LLM-Generated Explanations Across Indian and American STEM Education
di: Gupta, Amogh, et al.
Pubblicazione: (2026) -
A Scalable Entity-Based Framework for Auditing Bias in LLMs
di: Elbouanani, Akram, et al.
Pubblicazione: (2026) -
Down the Toxicity Rabbit Hole: A Novel Framework to Bias Audit Large Language Models
di: Dutta, Arka, et al.
Pubblicazione: (2023) -
BiasLab: A Multilingual, Dual-Framing Framework for Robust Measurement of Output-Level Bias in Large Language Models
di: Guey, William, et al.
Pubblicazione: (2026)