Large Language Model Psychometrics: A Systematic Review of Evaluation, Validation, and Enhancement
Fuente:
arXiv
Guardado en:
| Autores principales: | Ye, Haoran, Jin, Jing, Xie, Yuhang, Zhang, Xin, Song, Guojie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Context-Value-Action Architecture for Value-Driven Large Language Model Agents
por: Zhang, TianZe, et al.
Publicado: (2026)
por: Zhang, TianZe, et al.
Publicado: (2026)
Measuring Human and AI Values Based on Generative Psychometrics with Large Language Models
por: Ye, Haoran, et al.
Publicado: (2024)
por: Ye, Haoran, et al.
Publicado: (2024)
Evaluating Large Language Models in Analysing Classroom Dialogue
por: Long, Yun, et al.
Publicado: (2024)
por: Long, Yun, et al.
Publicado: (2024)
Multi-agent KTO: Reinforcing Strategic Interactions of Large Language Model in Language Game
por: Ye, Rong, et al.
Publicado: (2025)
por: Ye, Rong, et al.
Publicado: (2025)
An Evaluation of Estimative Uncertainty in Large Language Models
por: Tang, Zhisheng, et al.
Publicado: (2024)
por: Tang, Zhisheng, et al.
Publicado: (2024)
Evaluating the Prompt Steerability of Large Language Models
por: Miehling, Erik, et al.
Publicado: (2024)
por: Miehling, Erik, et al.
Publicado: (2024)
WundtGPT: Shaping Large Language Models To Be An Empathetic, Proactive Psychologist
por: Ren, Chenyu, et al.
Publicado: (2024)
por: Ren, Chenyu, et al.
Publicado: (2024)
Helmsman of the Masses? Evaluate the Opinion Leadership of Large Language Models in the Werewolf Game
por: Du, Silin, et al.
Publicado: (2024)
por: Du, Silin, et al.
Publicado: (2024)
A Systematic Survey of Prompt Engineering in Large Language Models: Techniques and Applications
por: Sahoo, Pranab, et al.
Publicado: (2024)
por: Sahoo, Pranab, et al.
Publicado: (2024)
Evalet: Evaluating Large Language Models through Functional Fragmentation
por: Kim, Tae Soo, et al.
Publicado: (2025)
por: Kim, Tae Soo, et al.
Publicado: (2025)
From Voices to Validity: Leveraging Large Language Models (LLMs) for Textual Analysis of Policy Stakeholder Interviews
por: Liu, Alex, et al.
Publicado: (2023)
por: Liu, Alex, et al.
Publicado: (2023)
Heterogeneous Value Alignment Evaluation for Large Language Models
por: Zhang, Zhaowei, et al.
Publicado: (2023)
por: Zhang, Zhaowei, et al.
Publicado: (2023)
Can Large Language Model Agents Simulate Human Trust Behavior?
por: Xie, Chengxing, et al.
Publicado: (2024)
por: Xie, Chengxing, et al.
Publicado: (2024)
Are We There Yet? Revealing the Risks of Utilizing Large Language Models in Scholarly Peer Review
por: Ye, Rui, et al.
Publicado: (2024)
por: Ye, Rui, et al.
Publicado: (2024)
Role-Playing Agents Driven by Large Language Models: Current Status, Challenges, and Future Trends
por: Wang, Ye, et al.
Publicado: (2026)
por: Wang, Ye, et al.
Publicado: (2026)
The Effectiveness of Style Vectors for Steering Large Language Models: A Human Evaluation
por: Diallo, Diaoulé, et al.
Publicado: (2026)
por: Diallo, Diaoulé, et al.
Publicado: (2026)
The Adoption and Efficacy of Large Language Models: Evidence From Consumer Complaints in the Financial Industry
por: Shin, Minkyu, et al.
Publicado: (2023)
por: Shin, Minkyu, et al.
Publicado: (2023)
Prompt Engineering Techniques for Mitigating Cultural Bias Against Arabs and Muslims in Large Language Models: A Systematic Review
por: Asseri, Bushra, et al.
Publicado: (2025)
por: Asseri, Bushra, et al.
Publicado: (2025)
EvalLM: Interactive Evaluation of Large Language Model Prompts on User-Defined Criteria
por: Kim, Tae Soo, et al.
Publicado: (2023)
por: Kim, Tae Soo, et al.
Publicado: (2023)
Human Evaluation of Procedural Knowledge Graph Extraction from Text with Large Language Models
por: Carriero, Valentina Anita, et al.
Publicado: (2024)
por: Carriero, Valentina Anita, et al.
Publicado: (2024)
Prompt Engineering for Scale Development in Generative Psychometrics
por: Russell-Lasalandra, Lara Lee, et al.
Publicado: (2026)
por: Russell-Lasalandra, Lara Lee, et al.
Publicado: (2026)
A Scalable Framework for Evaluating Health Language Models
por: Mallinar, Neil, et al.
Publicado: (2025)
por: Mallinar, Neil, et al.
Publicado: (2025)
LalaEval: A Holistic Human Evaluation Framework for Domain-Specific Large Language Models
por: Sun, Chongyan, et al.
Publicado: (2024)
por: Sun, Chongyan, et al.
Publicado: (2024)
LLM Can be a Dangerous Persuader: Empirical Study of Persuasion Safety in Large Language Models
por: Liu, Minqian, et al.
Publicado: (2025)
por: Liu, Minqian, et al.
Publicado: (2025)
Large Language Model-Brained GUI Agents: A Survey
por: Zhang, Chaoyun, et al.
Publicado: (2024)
por: Zhang, Chaoyun, et al.
Publicado: (2024)
Humans and Large Language Models in Clinical Decision Support: A Study with Medical Calculators
por: Wan, Nicholas, et al.
Publicado: (2024)
por: Wan, Nicholas, et al.
Publicado: (2024)
MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models
por: Lee, Suhyun, et al.
Publicado: (2026)
por: Lee, Suhyun, et al.
Publicado: (2026)
Stories of Your Life as Others: A Round-Trip Evaluation of LLM-Generated Life Stories Conditioned on Rich Psychometric Profiles
por: Wigler, Ben, et al.
Publicado: (2026)
por: Wigler, Ben, et al.
Publicado: (2026)
Prompt4Vis: Prompting Large Language Models with Example Mining and Schema Filtering for Tabular Data Visualization
por: Li, Shuaimin, et al.
Publicado: (2024)
por: Li, Shuaimin, et al.
Publicado: (2024)
Epistemic Integrity in Large Language Models
por: Ghafouri, Bijean, et al.
Publicado: (2024)
por: Ghafouri, Bijean, et al.
Publicado: (2024)
Evaluating Large Language Models' Ability Using a Psychiatric Screening Tool Based on Metaphor and Sarcasm Scenarios
por: Yakura, Hiromu
Publicado: (2023)
por: Yakura, Hiromu
Publicado: (2023)
CompeteAI: Understanding the Competition Dynamics in Large Language Model-based Agents
por: Zhao, Qinlin, et al.
Publicado: (2023)
por: Zhao, Qinlin, et al.
Publicado: (2023)
Psychometric Comparability of LLM-Based Digital Twins
por: Zhang, Yufei, et al.
Publicado: (2025)
por: Zhang, Yufei, et al.
Publicado: (2025)
RNR: Teaching Large Language Models to Follow Roles and Rules
por: Wang, Kuan, et al.
Publicado: (2024)
por: Wang, Kuan, et al.
Publicado: (2024)
Autonomous Prompt Engineering in Large Language Models
por: Kepel, Daan, et al.
Publicado: (2024)
por: Kepel, Daan, et al.
Publicado: (2024)
Ensembling Large Language Models to Characterize Affective Dynamics in Student-AI Tutor Dialogues
por: Zhang, Chenyu, et al.
Publicado: (2025)
por: Zhang, Chenyu, et al.
Publicado: (2025)
PersonaLLM: Investigating the Ability of Large Language Models to Express Personality Traits
por: Jiang, Hang, et al.
Publicado: (2023)
por: Jiang, Hang, et al.
Publicado: (2023)
Inertia in Moral and Value Judgments of Large Language Models
por: Lee, Bruce W., et al.
Publicado: (2024)
por: Lee, Bruce W., et al.
Publicado: (2024)
Large Language Model Use Impact Locus of Control
por: Fu, Jenny Xiyu, et al.
Publicado: (2025)
por: Fu, Jenny Xiyu, et al.
Publicado: (2025)
Large Language Models and Games: A Survey and Roadmap
por: Gallotta, Roberto, et al.
Publicado: (2024)
por: Gallotta, Roberto, et al.
Publicado: (2024)
Ejemplares similares
-
Context-Value-Action Architecture for Value-Driven Large Language Model Agents
por: Zhang, TianZe, et al.
Publicado: (2026) -
Measuring Human and AI Values Based on Generative Psychometrics with Large Language Models
por: Ye, Haoran, et al.
Publicado: (2024) -
Evaluating Large Language Models in Analysing Classroom Dialogue
por: Long, Yun, et al.
Publicado: (2024) -
Multi-agent KTO: Reinforcing Strategic Interactions of Large Language Model in Language Game
por: Ye, Rong, et al.
Publicado: (2025) -
An Evaluation of Estimative Uncertainty in Large Language Models
por: Tang, Zhisheng, et al.
Publicado: (2024)