Stable and Explainable Personality Trait Evaluation in Large Language Models with Internal Activations
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ma, Xiaoxu, Zhang, Xiangbo, Weng, Zhenyu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
UniHash: Unifying Pointwise and Pairwise Hashing Paradigms
von: Ma, Xiaoxu, et al.
Veröffentlicht: (2026)
von: Ma, Xiaoxu, et al.
Veröffentlicht: (2026)
Personality Alignment of Large Language Models
von: Zhu, Minjun, et al.
Veröffentlicht: (2024)
von: Zhu, Minjun, et al.
Veröffentlicht: (2024)
Eliciting Personality Traits in Large Language Models
von: Hilliard, Airlie, et al.
Veröffentlicht: (2024)
von: Hilliard, Airlie, et al.
Veröffentlicht: (2024)
Neuron-based Personality Trait Induction in Large Language Models
von: Deng, Jia, et al.
Veröffentlicht: (2024)
von: Deng, Jia, et al.
Veröffentlicht: (2024)
Activation-Space Personality Steering: Hybrid Layer Selection for Stable Trait Control in LLMs
von: Bhandari, Pranav, et al.
Veröffentlicht: (2025)
von: Bhandari, Pranav, et al.
Veröffentlicht: (2025)
Personality Traits in Large Language Models
von: Serapio-García, Greg, et al.
Veröffentlicht: (2023)
von: Serapio-García, Greg, et al.
Veröffentlicht: (2023)
Rediscovering the Latent Dimensions of Personality with Large Language Models as Trait Descriptors
von: Suh, Joseph, et al.
Veröffentlicht: (2024)
von: Suh, Joseph, et al.
Veröffentlicht: (2024)
Predicting the Big Five Personality Traits in Chinese Counselling Dialogues Using Large Language Models
von: Yan, Yang, et al.
Veröffentlicht: (2024)
von: Yan, Yang, et al.
Veröffentlicht: (2024)
Towards Transparent AI: A Survey on Explainable Large Language Models
von: Palikhe, Avash, et al.
Veröffentlicht: (2025)
von: Palikhe, Avash, et al.
Veröffentlicht: (2025)
Memory Dial: A Training Framework for Controllable Memorization in Language Models
von: Zhang, Xiangbo, et al.
Veröffentlicht: (2026)
von: Zhang, Xiangbo, et al.
Veröffentlicht: (2026)
Investigating Large Language Models in Inferring Personality Traits from User Conversations
von: Zhu, Jianfeng, et al.
Veröffentlicht: (2025)
von: Zhu, Jianfeng, et al.
Veröffentlicht: (2025)
Revealing Personality Traits: A New Benchmark Dataset for Explainable Personality Recognition on Dialogues
von: Sun, Lei, et al.
Veröffentlicht: (2024)
von: Sun, Lei, et al.
Veröffentlicht: (2024)
PersonaLLM: Investigating the Ability of Large Language Models to Express Personality Traits
von: Jiang, Hang, et al.
Veröffentlicht: (2023)
von: Jiang, Hang, et al.
Veröffentlicht: (2023)
A Comparative Study of Large Language Models and Human Personality Traits
von: Jiaqi, Wang, et al.
Veröffentlicht: (2025)
von: Jiaqi, Wang, et al.
Veröffentlicht: (2025)
Evaluating Personality Traits in Large Language Models: Insights from Psychological Questionnaires
von: Bhandari, Pranav, et al.
Veröffentlicht: (2025)
von: Bhandari, Pranav, et al.
Veröffentlicht: (2025)
Exploring the Impact of Personality Traits on Conversational Recommender Systems: A Simulation with Large Language Models
von: Zhao, Xiaoyan, et al.
Veröffentlicht: (2025)
von: Zhao, Xiaoyan, et al.
Veröffentlicht: (2025)
Inclusivity in Large Language Models: Personality Traits and Gender Bias in Scientific Abstracts
von: Pervez, Naseela, et al.
Veröffentlicht: (2024)
von: Pervez, Naseela, et al.
Veröffentlicht: (2024)
Evaluating Language Model Character Traits
von: Ward, Francis Rhys, et al.
Veröffentlicht: (2024)
von: Ward, Francis Rhys, et al.
Veröffentlicht: (2024)
NILE: Internal Consistency Alignment in Large Language Models
von: Hu, Minda, et al.
Veröffentlicht: (2024)
von: Hu, Minda, et al.
Veröffentlicht: (2024)
Probing then Editing Response Personality of Large Language Models
von: Ju, Tianjie, et al.
Veröffentlicht: (2025)
von: Ju, Tianjie, et al.
Veröffentlicht: (2025)
UCoder: Unsupervised Code Generation by Internal Probing of Large Language Models
von: Wu, Jiajun, et al.
Veröffentlicht: (2025)
von: Wu, Jiajun, et al.
Veröffentlicht: (2025)
E-Bench: Towards Evaluating the Ease-of-Use of Large Language Models
von: Zhang, Zhenyu, et al.
Veröffentlicht: (2024)
von: Zhang, Zhenyu, et al.
Veröffentlicht: (2024)
Can Large Language Models Understand Preferences in Personalized Recommendation?
von: Tan, Zhaoxuan, et al.
Veröffentlicht: (2025)
von: Tan, Zhaoxuan, et al.
Veröffentlicht: (2025)
Orca: Enhancing Role-Playing Abilities of Large Language Models by Integrating Personality Traits
von: Huang, Yuxuan
Veröffentlicht: (2024)
von: Huang, Yuxuan
Veröffentlicht: (2024)
Online Training of Large Language Models: Learn while chatting
von: Liang, Juhao, et al.
Veröffentlicht: (2024)
von: Liang, Juhao, et al.
Veröffentlicht: (2024)
Can Large Language Models Understand You Better? An MBTI Personality Detection Dataset Aligned with Population Traits
von: Li, Bohan, et al.
Veröffentlicht: (2024)
von: Li, Bohan, et al.
Veröffentlicht: (2024)
Identifying and Manipulating Personality Traits in LLMs Through Activation Engineering
von: Allbert, Rumi, et al.
Veröffentlicht: (2024)
von: Allbert, Rumi, et al.
Veröffentlicht: (2024)
Artificial Impressions: Evaluating Large Language Model Behavior Through the Lens of Trait Impressions
von: Deas, Nicholas, et al.
Veröffentlicht: (2025)
von: Deas, Nicholas, et al.
Veröffentlicht: (2025)
How Personality Traits Influence Negotiation Outcomes? A Simulation based on Large Language Models
von: Huang, Yin Jou, et al.
Veröffentlicht: (2024)
von: Huang, Yin Jou, et al.
Veröffentlicht: (2024)
XIFBench: Evaluating Large Language Models on Multilingual Instruction Following
von: Li, Zhenyu, et al.
Veröffentlicht: (2025)
von: Li, Zhenyu, et al.
Veröffentlicht: (2025)
Large Language Models Are Human-Like Internally
von: Kuribayashi, Tatsuki, et al.
Veröffentlicht: (2025)
von: Kuribayashi, Tatsuki, et al.
Veröffentlicht: (2025)
PersonalityChat: Conversation Distillation for Personalized Dialog Modeling with Facts and Traits
von: Lotfi, Ehsan, et al.
Veröffentlicht: (2024)
von: Lotfi, Ehsan, et al.
Veröffentlicht: (2024)
Vision-centric Token Compression in Large Language Model
von: Xing, Ling, et al.
Veröffentlicht: (2025)
von: Xing, Ling, et al.
Veröffentlicht: (2025)
XRec: Large Language Models for Explainable Recommendation
von: Ma, Qiyao, et al.
Veröffentlicht: (2024)
von: Ma, Qiyao, et al.
Veröffentlicht: (2024)
Prompt-Guided Internal States for Hallucination Detection of Large Language Models
von: Zhang, Fujie, et al.
Veröffentlicht: (2024)
von: Zhang, Fujie, et al.
Veröffentlicht: (2024)
Towards Personalized Evaluation of Large Language Models with An Anonymous Crowd-Sourcing Platform
von: Cheng, Mingyue, et al.
Veröffentlicht: (2024)
von: Cheng, Mingyue, et al.
Veröffentlicht: (2024)
From Attention to Activation: Unravelling the Enigmas of Large Language Models
von: Kaul, Prannay, et al.
Veröffentlicht: (2024)
von: Kaul, Prannay, et al.
Veröffentlicht: (2024)
The Dark Patterns of Personalized Persuasion in Large Language Models: Exposing Persuasive Linguistic Features for Big Five Personality Traits in LLMs Responses
von: Mieleszczenko-Kowszewicz, Wiktoria, et al.
Veröffentlicht: (2024)
von: Mieleszczenko-Kowszewicz, Wiktoria, et al.
Veröffentlicht: (2024)
Internal Value Alignment in Large Language Models through Controlled Value Vector Activation
von: Jin, Haoran, et al.
Veröffentlicht: (2025)
von: Jin, Haoran, et al.
Veröffentlicht: (2025)
KEDRec-LM: A Knowledge-distilled Explainable Drug Recommendation Large Language Model
von: Zhang, Kai, et al.
Veröffentlicht: (2025)
von: Zhang, Kai, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
UniHash: Unifying Pointwise and Pairwise Hashing Paradigms
von: Ma, Xiaoxu, et al.
Veröffentlicht: (2026) -
Personality Alignment of Large Language Models
von: Zhu, Minjun, et al.
Veröffentlicht: (2024) -
Eliciting Personality Traits in Large Language Models
von: Hilliard, Airlie, et al.
Veröffentlicht: (2024) -
Neuron-based Personality Trait Induction in Large Language Models
von: Deng, Jia, et al.
Veröffentlicht: (2024) -
Activation-Space Personality Steering: Hybrid Layer Selection for Stable Trait Control in LLMs
von: Bhandari, Pranav, et al.
Veröffentlicht: (2025)