Psychometric Personality Shaping Modulates Capabilities and Safety in Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fitz, Stephen, Romero, Peter, Basart, Steven, Chen, Sipeng, Hernandez-Orallo, Jose |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Do GPT Language Models Suffer From Split Personality Disorder? The Advent Of Substrate-Free Psychometrics
par: Romero, Peter, et autres
Publié: (2024)
par: Romero, Peter, et autres
Publié: (2024)
Safetywashing: Do AI Safety Benchmarks Actually Measure Safety Progress?
par: Ren, Richard, et autres
Publié: (2024)
par: Ren, Richard, et autres
Publié: (2024)
Conversational Complexity for Assessing Risk in Large Language Models
par: Burden, John, et autres
Publié: (2024)
par: Burden, John, et autres
Publié: (2024)
Hidden Holes: topological aspects of language models
par: Fitz, Stephen, et autres
Publié: (2024)
par: Fitz, Stephen, et autres
Publié: (2024)
Measuring Data Science Automation: A Survey of Evaluation Tools for AI Assistants and Agents
par: Testini, Irene, et autres
Publié: (2025)
par: Testini, Irene, et autres
Publié: (2025)
Personality Traits in Large Language Models
par: Serapio-García, Greg, et autres
Publié: (2023)
par: Serapio-García, Greg, et autres
Publié: (2023)
Leaving the barn door open for Clever Hans: Simple features predict LLM benchmark answers
par: Pacchiardi, Lorenzo, et autres
Publié: (2024)
par: Pacchiardi, Lorenzo, et autres
Publié: (2024)
SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities
par: Jiang, Fengqing, et autres
Publié: (2025)
par: Jiang, Fengqing, et autres
Publié: (2025)
100 instances is all you need: predicting the success of a new LLM on unseen data by testing on a few instances
par: Pacchiardi, Lorenzo, et autres
Publié: (2024)
par: Pacchiardi, Lorenzo, et autres
Publié: (2024)
Fundamental Safety-Capability Trade-offs in Fine-tuning Large Language Models
par: Chen, Pin-Yu, et autres
Publié: (2025)
par: Chen, Pin-Yu, et autres
Publié: (2025)
Confident Rankings with Fewer Items: Adaptive LLM Evaluation with Continuous Scores
par: Balkır, Esma, et autres
Publié: (2026)
par: Balkır, Esma, et autres
Publié: (2026)
Measuring Chain-of-Thought Monitorability Through Faithfulness and Verbosity
par: Meek, Austin, et autres
Publié: (2025)
par: Meek, Austin, et autres
Publié: (2025)
Psychometric Predictive Power of Large Language Models
par: Kuribayashi, Tatsuki, et autres
Publié: (2023)
par: Kuribayashi, Tatsuki, et autres
Publié: (2023)
Testing the Machine Consciousness Hypothesis
par: Fitz, Stephen
Publié: (2025)
par: Fitz, Stephen
Publié: (2025)
Do LLMs Have Distinct and Consistent Personality? TRAIT: Personality Testset designed for LLMs with Psychometrics
par: Lee, Seungbeen, et autres
Publié: (2024)
par: Lee, Seungbeen, et autres
Publié: (2024)
Evaluating Implicit Bias in Large Language Models by Attacking From a Psychometric Perspective
par: Wen, Yuchen, et autres
Publié: (2024)
par: Wen, Yuchen, et autres
Publié: (2024)
Psychometric Alignment: Capturing Human Knowledge Distributions via Language Models
par: He-Yueya, Joy, et autres
Publié: (2024)
par: He-Yueya, Joy, et autres
Publié: (2024)
Measuring Human and AI Values Based on Generative Psychometrics with Large Language Models
par: Ye, Haoran, et autres
Publié: (2024)
par: Ye, Haoran, et autres
Publié: (2024)
AFSPP: Agent Framework for Shaping Preference and Personality with Large Language Models
par: He, Zihong, et autres
Publié: (2024)
par: He, Zihong, et autres
Publié: (2024)
Unraveling the Capabilities of Language Models in News Summarization
par: Odabaşı, Abdurrahman, et autres
Publié: (2025)
par: Odabaşı, Abdurrahman, et autres
Publié: (2025)
Forecasting Frontier Language Model Agent Capabilities
par: Pimpale, Govind, et autres
Publié: (2025)
par: Pimpale, Govind, et autres
Publié: (2025)
Evaluating General-Purpose AI with Psychometrics
par: Wang, Xiting, et autres
Publié: (2023)
par: Wang, Xiting, et autres
Publié: (2023)
Confidence Matters: Revisiting Intrinsic Self-Correction Capabilities of Large Language Models
par: Li, Loka, et autres
Publié: (2024)
par: Li, Loka, et autres
Publié: (2024)
UniCode: Learning a Unified Codebook for Multimodal Large Language Models
par: Zheng, Sipeng, et autres
Publié: (2024)
par: Zheng, Sipeng, et autres
Publié: (2024)
MuBench: Assessment of Multilingual Capabilities of Large Language Models Across 61 Languages
par: Han, Wenhan, et autres
Publié: (2025)
par: Han, Wenhan, et autres
Publié: (2025)
All Languages Matter: On the Multilingual Safety of Large Language Models
par: Wang, Wenxuan, et autres
Publié: (2023)
par: Wang, Wenxuan, et autres
Publié: (2023)
Adapting Large Language Models for Education: Foundational Capabilities, Potentials, and Challenges
par: Li, Qingyao, et autres
Publié: (2023)
par: Li, Qingyao, et autres
Publié: (2023)
Personalized Large Language Models
par: Woźniak, Stanisław, et autres
Publié: (2024)
par: Woźniak, Stanisław, et autres
Publié: (2024)
Foundational Challenges in Assuring Alignment and Safety of Large Language Models
par: Anwar, Usman, et autres
Publié: (2024)
par: Anwar, Usman, et autres
Publié: (2024)
Reasoning Capabilities of Large Language Models on Dynamic Tasks
par: Wong, Annie, et autres
Publié: (2025)
par: Wong, Annie, et autres
Publié: (2025)
Do Large Language Models Know What They Are Capable Of?
par: Barkan, Casey O., et autres
Publié: (2025)
par: Barkan, Casey O., et autres
Publié: (2025)
Evaluating Consistency and Reasoning Capabilities of Large Language Models
par: Saxena, Yash, et autres
Publié: (2024)
par: Saxena, Yash, et autres
Publié: (2024)
Unlocking Prompt Infilling Capability for Diffusion Language Models
par: Fujinuma, Yoshinari, et autres
Publié: (2026)
par: Fujinuma, Yoshinari, et autres
Publié: (2026)
Distilling Mathematical Reasoning Capabilities into Small Language Models
par: Zhu, Xunyu, et autres
Publié: (2024)
par: Zhu, Xunyu, et autres
Publié: (2024)
On the Use of Large Language Models to Generate Capability Ontologies
par: da Silva, Luis Miguel Vieira, et autres
Publié: (2024)
par: da Silva, Luis Miguel Vieira, et autres
Publié: (2024)
Exploring the Learning Capabilities of Language Models using LEVERWORLDS
par: Wagner, Eitan, et autres
Publié: (2024)
par: Wagner, Eitan, et autres
Publié: (2024)
Preservation of Language Understanding Capabilities in Speech-aware Large Language Models
par: Kubis, Marek, et autres
Publié: (2025)
par: Kubis, Marek, et autres
Publié: (2025)
Multi-agent AI systems outperform human teams in creativity
par: Hu, Tiancheng, et autres
Publié: (2026)
par: Hu, Tiancheng, et autres
Publié: (2026)
Measuring and Benchmarking Large Language Models' Capabilities to Generate Persuasive Language
par: Pauli, Amalie Brogaard, et autres
Publié: (2024)
par: Pauli, Amalie Brogaard, et autres
Publié: (2024)
A Novel Psychometrics-Based Approach to Developing Professional Competency Benchmark for Large Language Models
par: Kardanova, Elena, et autres
Publié: (2024)
par: Kardanova, Elena, et autres
Publié: (2024)
Documents similaires
-
Do GPT Language Models Suffer From Split Personality Disorder? The Advent Of Substrate-Free Psychometrics
par: Romero, Peter, et autres
Publié: (2024) -
Safetywashing: Do AI Safety Benchmarks Actually Measure Safety Progress?
par: Ren, Richard, et autres
Publié: (2024) -
Conversational Complexity for Assessing Risk in Large Language Models
par: Burden, John, et autres
Publié: (2024) -
Hidden Holes: topological aspects of language models
par: Fitz, Stephen, et autres
Publié: (2024) -
Measuring Data Science Automation: A Survey of Evaluation Tools for AI Assistants and Agents
par: Testini, Irene, et autres
Publié: (2025)