Do Personality Traits Interfere? Geometric Limitations of Steering in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Bhandari, Pranav, Naseem, Usman, Nasim, Mehwish |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Evaluating Personality Traits in Large Language Models: Insights from Psychological Questionnaires
por: Bhandari, Pranav, et al.
Publicado: (2025)
por: Bhandari, Pranav, et al.
Publicado: (2025)
Can LLM Agents Maintain a Persona in Discourse?
por: Bhandari, Pranav, et al.
Publicado: (2025)
por: Bhandari, Pranav, et al.
Publicado: (2025)
Competing LLM Agents in a Non-Cooperative Game of Opinion Polarisation
por: Qasmi, Amin, et al.
Publicado: (2025)
por: Qasmi, Amin, et al.
Publicado: (2025)
Painless Activation Steering: An Automated, Lightweight Approach for Post-Training Large Language Models
por: Cui, Sasha, et al.
Publicado: (2025)
por: Cui, Sasha, et al.
Publicado: (2025)
Simulating Influence Dynamics with LLM Agents
por: Nasim, Mehwish, et al.
Publicado: (2025)
por: Nasim, Mehwish, et al.
Publicado: (2025)
Confident, Calibrated, or Complicit: Safety Alignment and Ideological Bias in LLM Hate Speech Detection
por: Selvaganapathy, Sanjeeevan, et al.
Publicado: (2025)
por: Selvaganapathy, Sanjeeevan, et al.
Publicado: (2025)
Large Language Model (LLM) Bias Index -- LLMBI
por: Oketunji, Abiodun Finbarrs, et al.
Publicado: (2023)
por: Oketunji, Abiodun Finbarrs, et al.
Publicado: (2023)
Cognitive Load Limits in Large Language Models: Benchmarking Multi-Hop Reasoning
por: Adapala, Sai Teja Reddy
Publicado: (2025)
por: Adapala, Sai Teja Reddy
Publicado: (2025)
Do LLMs Use Cultural Knowledge Without Being Told? A Multilingual Evaluation of Implicit Pragmatic Adaptation
por: Nasim, Mehwish, et al.
Publicado: (2026)
por: Nasim, Mehwish, et al.
Publicado: (2026)
Evaluating the Efficacy of Hybrid Deep Learning Models in Distinguishing AI-Generated Text
por: Oketunji, Abiodun Finbarrs
Publicado: (2023)
por: Oketunji, Abiodun Finbarrs
Publicado: (2023)
Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models
por: Fadli, Samih
Publicado: (2025)
por: Fadli, Samih
Publicado: (2025)
Random-Set Large Language Models
por: Mubashar, Muhammad, et al.
Publicado: (2025)
por: Mubashar, Muhammad, et al.
Publicado: (2025)
Danoliteracy of Generative Large Language Models
por: Holm, Søren Vejlgaard, et al.
Publicado: (2024)
por: Holm, Søren Vejlgaard, et al.
Publicado: (2024)
CorrSteer: Generation-Time LLM Steering via Correlated Sparse Autoencoder Features
por: Cho, Seonglae, et al.
Publicado: (2025)
por: Cho, Seonglae, et al.
Publicado: (2025)
SWI: Speaking with Intent in Large Language Models
por: Yin, Yuwei, et al.
Publicado: (2025)
por: Yin, Yuwei, et al.
Publicado: (2025)
Uncovering Biases with Reflective Large Language Models
por: Chang, Edward Y.
Publicado: (2024)
por: Chang, Edward Y.
Publicado: (2024)
Language as a Wave Phenomenon: Semantic Phase Locking and Interference in Neural Networks
por: Yıldırım, Alper, et al.
Publicado: (2025)
por: Yıldırım, Alper, et al.
Publicado: (2025)
Benchmarking Cognitive Biases in Large Language Models as Evaluators
por: Koo, Ryan, et al.
Publicado: (2023)
por: Koo, Ryan, et al.
Publicado: (2023)
Self-Supervised Position Debiasing for Large Language Models
por: Liu, Zhongkun, et al.
Publicado: (2024)
por: Liu, Zhongkun, et al.
Publicado: (2024)
Sycophancy as compositions of Atomic Psychometric Traits
por: Jain, Shreyans, et al.
Publicado: (2025)
por: Jain, Shreyans, et al.
Publicado: (2025)
Identifying and Mitigating the Influence of the Prior Distribution in Large Language Models
por: Zhang, Liyi, et al.
Publicado: (2025)
por: Zhang, Liyi, et al.
Publicado: (2025)
HAMMER: Hamiltonian Curiosity Augmented Large Language Model Reinforcement
por: Yang, Ming, et al.
Publicado: (2025)
por: Yang, Ming, et al.
Publicado: (2025)
RAVR: Reference-Answer-guided Variational Reasoning for Large Language Models
por: Lin, Tianqianjin, et al.
Publicado: (2025)
por: Lin, Tianqianjin, et al.
Publicado: (2025)
AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders
por: Wu, Zhengxuan, et al.
Publicado: (2025)
por: Wu, Zhengxuan, et al.
Publicado: (2025)
Detecting Hallucinations in Large Language Model Generation: A Token Probability Approach
por: Quevedo, Ernesto, et al.
Publicado: (2024)
por: Quevedo, Ernesto, et al.
Publicado: (2024)
Mathador-LM: A Dynamic Benchmark for Mathematical Reasoning on Large Language Models
por: Kurtic, Eldar, et al.
Publicado: (2024)
por: Kurtic, Eldar, et al.
Publicado: (2024)
Consistency Evaluation of News Article Summaries Generated by Large (and Small) Language Models
por: Gilhuly, Colleen, et al.
Publicado: (2025)
por: Gilhuly, Colleen, et al.
Publicado: (2025)
External Hippocampus: Topological Cognitive Maps for Guiding Large Language Model Reasoning
por: Yan, Jian
Publicado: (2025)
por: Yan, Jian
Publicado: (2025)
Concept Navigation and Classification via Open-Source Large Language Model Processing
por: Kubli, Maël
Publicado: (2025)
por: Kubli, Maël
Publicado: (2025)
Towards Intrinsic Interpretability of Large Language Models:A Survey of Design Principles and Architectures
por: Gao, Yutong, et al.
Publicado: (2026)
por: Gao, Yutong, et al.
Publicado: (2026)
Large Language Models Generate Harmful Content Using a Distinct, Unified Mechanism
por: Orgad, Hadas, et al.
Publicado: (2026)
por: Orgad, Hadas, et al.
Publicado: (2026)
ProSparse: Introducing and Enhancing Intrinsic Activation Sparsity within Large Language Models
por: Song, Chenyang, et al.
Publicado: (2024)
por: Song, Chenyang, et al.
Publicado: (2024)
Distilling Knowledge from Large Language Models: A Concept Bottleneck Model for Hate and Counter Speech Recognition
por: Labadie-Tamayo, Roberto, et al.
Publicado: (2025)
por: Labadie-Tamayo, Roberto, et al.
Publicado: (2025)
Stick to your Role! Stability of Personal Values Expressed in Large Language Models
por: Kovač, Grgur, et al.
Publicado: (2024)
por: Kovač, Grgur, et al.
Publicado: (2024)
AMALIA Technical Report: A Fully Open Source Large Language Model for European Portuguese
por: Simplício, Afonso, et al.
Publicado: (2026)
por: Simplício, Afonso, et al.
Publicado: (2026)
Skill Availability and Presentation Granularity in Large-Language-Model Agents: A Controlled SkillsBench Study
por: Xu, Xiaonan, et al.
Publicado: (2026)
por: Xu, Xiaonan, et al.
Publicado: (2026)
PlanRAG: A Plan-then-Retrieval Augmented Generation for Generative Large Language Models as Decision Makers
por: Lee, Myeonghwa, et al.
Publicado: (2024)
por: Lee, Myeonghwa, et al.
Publicado: (2024)
Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models
por: Zhang, Gongbo, et al.
Publicado: (2026)
por: Zhang, Gongbo, et al.
Publicado: (2026)
AgentTTS: Large Language Model Agent for Test-time Compute-optimal Scaling Strategy in Complex Tasks
por: Wang, Fali, et al.
Publicado: (2025)
por: Wang, Fali, et al.
Publicado: (2025)
Few-Shot Optimization for Sensor Data Using Large Language Models: A Case Study on Fatigue Detection
por: Ronando, Elsen, et al.
Publicado: (2025)
por: Ronando, Elsen, et al.
Publicado: (2025)
Ejemplares similares
-
Evaluating Personality Traits in Large Language Models: Insights from Psychological Questionnaires
por: Bhandari, Pranav, et al.
Publicado: (2025) -
Can LLM Agents Maintain a Persona in Discourse?
por: Bhandari, Pranav, et al.
Publicado: (2025) -
Competing LLM Agents in a Non-Cooperative Game of Opinion Polarisation
por: Qasmi, Amin, et al.
Publicado: (2025) -
Painless Activation Steering: An Automated, Lightweight Approach for Post-Training Large Language Models
por: Cui, Sasha, et al.
Publicado: (2025) -
Simulating Influence Dynamics with LLM Agents
por: Nasim, Mehwish, et al.
Publicado: (2025)