Personas as a Way to Model Truthfulness in Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Joshi, Nitish, Rando, Javier, Saparov, Abulhair, Kim, Najoung, He, He |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Transformers Struggle to Learn to Search
by: Saparov, Abulhair, et al.
Published: (2024)
by: Saparov, Abulhair, et al.
Published: (2024)
LLMs Are Prone to Fallacies in Causal Inference
by: Joshi, Nitish, et al.
Published: (2024)
by: Joshi, Nitish, et al.
Published: (2024)
Transformers Can Learn Connectivity in Some Graphs but Not Others
by: Roy, Amit, et al.
Published: (2025)
by: Roy, Amit, et al.
Published: (2025)
Language Models Might Not Understand You: Evaluating Theory of Mind via Story Prompting
by: Getachew, Nathaniel, et al.
Published: (2025)
by: Getachew, Nathaniel, et al.
Published: (2025)
Do Language Models Follow Occam's Razor? An Evaluation of Parsimony in Inductive and Abductive Reasoning
by: Sun, Yunxin, et al.
Published: (2025)
by: Sun, Yunxin, et al.
Published: (2025)
MathGAP: Out-of-Distribution Evaluation on Problems with Arbitrarily Complex Proofs
by: Opedal, Andreas, et al.
Published: (2024)
by: Opedal, Andreas, et al.
Published: (2024)
Do Language Models Exhibit the Same Cognitive Biases in Problem Solving as Human Learners?
by: Opedal, Andreas, et al.
Published: (2024)
by: Opedal, Andreas, et al.
Published: (2024)
Are Language Models Efficient Reasoners? A Perspective from Logic Programming
by: Opedal, Andreas, et al.
Published: (2025)
by: Opedal, Andreas, et al.
Published: (2025)
Learning to Reason Efficiently with A* Post-Training
by: Opedal, Andreas, et al.
Published: (2026)
by: Opedal, Andreas, et al.
Published: (2026)
Reasoning Models Reason Well, Until They Don't
by: Rameshkumar, Revanth, et al.
Published: (2025)
by: Rameshkumar, Revanth, et al.
Published: (2025)
TruthX: Alleviating Hallucinations by Editing Large Language Models in Truthful Space
by: Zhang, Shaolei, et al.
Published: (2024)
by: Zhang, Shaolei, et al.
Published: (2024)
A Practical Review of Mechanistic Interpretability for Transformer-Based Language Models
by: Rai, Daking, et al.
Published: (2024)
by: Rai, Daking, et al.
Published: (2024)
Ranking Large Language Models without Ground Truth
by: Dhurandhar, Amit, et al.
Published: (2024)
by: Dhurandhar, Amit, et al.
Published: (2024)
Inference-Time Intervention: Eliciting Truthful Answers from a Language Model
by: Li, Kenneth, et al.
Published: (2023)
by: Li, Kenneth, et al.
Published: (2023)
Overthinking the Truth: Understanding how Language Models Process False Demonstrations
by: Halawi, Danny, et al.
Published: (2023)
by: Halawi, Danny, et al.
Published: (2023)
Foundational Challenges in Assuring Alignment and Safety of Large Language Models
by: Anwar, Usman, et al.
Published: (2024)
by: Anwar, Usman, et al.
Published: (2024)
Machine Bullshit: Characterizing the Emergent Disregard for Truth in Large Language Models
by: Liang, Kaiqu, et al.
Published: (2025)
by: Liang, Kaiqu, et al.
Published: (2025)
Dissecting Persona-Driven Reasoning in Language Models via Activation Patching
by: Poonia, Ansh, et al.
Published: (2025)
by: Poonia, Ansh, et al.
Published: (2025)
Universal Jailbreak Backdoors from Poisoned Human Feedback
by: Rando, Javier, et al.
Published: (2023)
by: Rando, Javier, et al.
Published: (2023)
Persona-driven Simulation of Voting Behavior in the European Parliament with Large Language Models
by: Kreutner, Maximilian, et al.
Published: (2025)
by: Kreutner, Maximilian, et al.
Published: (2025)
Geometry of Decision Making in Language Models
by: Joshi, Abhinav, et al.
Published: (2025)
by: Joshi, Abhinav, et al.
Published: (2025)
Hallucination to Truth: A Review of Fact-Checking and Factuality Evaluation in Large Language Models
by: Rahman, Subhey Sadi, et al.
Published: (2025)
by: Rahman, Subhey Sadi, et al.
Published: (2025)
Pareto Multi-Objective Alignment for Language Models
by: He, Qiang, et al.
Published: (2025)
by: He, Qiang, et al.
Published: (2025)
Code Pretraining Improves Entity Tracking Abilities of Language Models
by: Kim, Najoung, et al.
Published: (2024)
by: Kim, Najoung, et al.
Published: (2024)
Language Models as Hierarchy Encoders
by: He, Yuan, et al.
Published: (2024)
by: He, Yuan, et al.
Published: (2024)
A Law of Next-Token Prediction in Large Language Models
by: He, Hangfeng, et al.
Published: (2024)
by: He, Hangfeng, et al.
Published: (2024)
Accelerated Preference Optimization for Large Language Model Alignment
by: He, Jiafan, et al.
Published: (2024)
by: He, Jiafan, et al.
Published: (2024)
DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language Models
by: Chuang, Yung-Sung, et al.
Published: (2023)
by: Chuang, Yung-Sung, et al.
Published: (2023)
LogicTree: Structured Proof Exploration for Coherent and Rigorous Logical Reasoning with Large Language Models
by: He, Kang, et al.
Published: (2025)
by: He, Kang, et al.
Published: (2025)
On The Truthfulness of 'Surprisingly Likely' Responses of Large Language Models
by: Goel, Naman
Published: (2023)
by: Goel, Naman
Published: (2023)
Language Model Prompt Selection via Simulation Optimization
by: Zhang, Haoting, et al.
Published: (2024)
by: Zhang, Haoting, et al.
Published: (2024)
One Model for All: Multi-Objective Controllable Language Models
by: He, Qiang, et al.
Published: (2026)
by: He, Qiang, et al.
Published: (2026)
Federated Data-Efficient Instruction Tuning for Large Language Models
by: Qin, Zhen, et al.
Published: (2024)
by: Qin, Zhen, et al.
Published: (2024)
TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning
by: Wei, Zhepei, et al.
Published: (2025)
by: Wei, Zhepei, et al.
Published: (2025)
Sparse Shift Autoencoders for Identifying Concepts from Large Language Model Activations
by: Joshi, Shruti, et al.
Published: (2025)
by: Joshi, Shruti, et al.
Published: (2025)
PersonaGym: Evaluating Persona Agents and LLMs
by: Samuel, Vinay, et al.
Published: (2024)
by: Samuel, Vinay, et al.
Published: (2024)
Is Active Persona Inference Necessary for Aligning Small Models to Personal Preferences?
by: Tang, Zilu, et al.
Published: (2025)
by: Tang, Zilu, et al.
Published: (2025)
Self-contradictory Hallucinations of Large Language Models: Evaluation, Detection and Mitigation
by: Mündler, Niels, et al.
Published: (2023)
by: Mündler, Niels, et al.
Published: (2023)
TruthFlow: Truthful LLM Generation via Representation Flow Correction
by: Wang, Hanyu, et al.
Published: (2025)
by: Wang, Hanyu, et al.
Published: (2025)
Theoretical Benefit and Limitation of Diffusion Language Model
by: Feng, Guhao, et al.
Published: (2025)
by: Feng, Guhao, et al.
Published: (2025)
Similar Items
-
Transformers Struggle to Learn to Search
by: Saparov, Abulhair, et al.
Published: (2024) -
LLMs Are Prone to Fallacies in Causal Inference
by: Joshi, Nitish, et al.
Published: (2024) -
Transformers Can Learn Connectivity in Some Graphs but Not Others
by: Roy, Amit, et al.
Published: (2025) -
Language Models Might Not Understand You: Evaluating Theory of Mind via Story Prompting
by: Getachew, Nathaniel, et al.
Published: (2025) -
Do Language Models Follow Occam's Razor? An Evaluation of Parsimony in Inductive and Abductive Reasoning
by: Sun, Yunxin, et al.
Published: (2025)