Steering Risk Preferences in Large Language Models by Aligning Behavioral and Neural Representations
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhu, Jian-Qiao, Yan, Haijiang, Griffiths, Thomas L. |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Recovering Mental Representations from Large Language Models with Markov Chain Monte Carlo
von: Zhu, Jian-Qiao, et al.
Veröffentlicht: (2024)
von: Zhu, Jian-Qiao, et al.
Veröffentlicht: (2024)
Recovering Event Probabilities from Large Language Model Embeddings via Axiomatic Constraints
von: Zhu, Jian-Qiao, et al.
Veröffentlicht: (2025)
von: Zhu, Jian-Qiao, et al.
Veröffentlicht: (2025)
Language Models Trained to do Arithmetic Predict Human Risky and Intertemporal Choice
von: Zhu, Jian-Qiao, et al.
Veröffentlicht: (2024)
von: Zhu, Jian-Qiao, et al.
Veröffentlicht: (2024)
Incoherent Probability Judgments in Large Language Models
von: Zhu, Jian-Qiao, et al.
Veröffentlicht: (2024)
von: Zhu, Jian-Qiao, et al.
Veröffentlicht: (2024)
Aligning Large Language Model Behavior with Human Citation Preferences
von: Ando, Kenichiro, et al.
Veröffentlicht: (2026)
von: Ando, Kenichiro, et al.
Veröffentlicht: (2026)
Using Reinforcement Learning to Train Large Language Models to Explain Human Decisions
von: Zhu, Jian-Qiao, et al.
Veröffentlicht: (2025)
von: Zhu, Jian-Qiao, et al.
Veröffentlicht: (2025)
Aligning Large Language Models with Searcher Preferences
von: Wu, Wei, et al.
Veröffentlicht: (2026)
von: Wu, Wei, et al.
Veröffentlicht: (2026)
Eliciting Trustworthiness Priors of Large Language Models via Economic Games
von: Yan, Siyu, et al.
Veröffentlicht: (2026)
von: Yan, Siyu, et al.
Veröffentlicht: (2026)
The Real, the Better: Aligning Large Language Models with Online Human Behaviors
von: Jiang, Guanying, et al.
Veröffentlicht: (2024)
von: Jiang, Guanying, et al.
Veröffentlicht: (2024)
On Effects of Steering Latent Representation for Large Language Model Unlearning
von: Huu-Tien, Dang, et al.
Veröffentlicht: (2024)
von: Huu-Tien, Dang, et al.
Veröffentlicht: (2024)
Levels of Analysis for Large Language Models
von: Ku, Alexander Y., et al.
Veröffentlicht: (2025)
von: Ku, Alexander Y., et al.
Veröffentlicht: (2025)
Semantic Representation Attack against Aligned Large Language Models
von: Lian, Jiawei, et al.
Veröffentlicht: (2025)
von: Lian, Jiawei, et al.
Veröffentlicht: (2025)
Capturing Nuanced Preferences: Preference-Aligned Distillation for Small Language Models
von: Gu, Yanggan, et al.
Veröffentlicht: (2025)
von: Gu, Yanggan, et al.
Veröffentlicht: (2025)
Icon$^{2}$: Aligning Large Language Models Using Self-Synthetic Preference Data via Inherent Regulation
von: Chen, Qiyuan, et al.
Veröffentlicht: (2025)
von: Chen, Qiyuan, et al.
Veröffentlicht: (2025)
What is a Number, That a Large Language Model May Know It?
von: Marjieh, Raja, et al.
Veröffentlicht: (2025)
von: Marjieh, Raja, et al.
Veröffentlicht: (2025)
Large Language Models Can Take False First Steps at Inference-time Planning
von: Yan, Haijiang, et al.
Veröffentlicht: (2026)
von: Yan, Haijiang, et al.
Veröffentlicht: (2026)
TPO: Aligning Large Language Models with Multi-branch & Multi-step Preference Trees
von: Liao, Weibin, et al.
Veröffentlicht: (2024)
von: Liao, Weibin, et al.
Veröffentlicht: (2024)
How does Misinformation Affect Large Language Model Behaviors and Preferences?
von: Peng, Miao, et al.
Veröffentlicht: (2025)
von: Peng, Miao, et al.
Veröffentlicht: (2025)
Aligning Machiavellian Agents: Behavior Steering via Test-Time Policy Shaping
von: Mujtaba, Dena, et al.
Veröffentlicht: (2025)
von: Mujtaba, Dena, et al.
Veröffentlicht: (2025)
Steering When Necessary: Flexible Steering Large Language Models with Backtracking
von: Cheng, Zifeng, et al.
Veröffentlicht: (2025)
von: Cheng, Zifeng, et al.
Veröffentlicht: (2025)
Safer-Instruct: Aligning Language Models with Automated Preference Data
von: Shi, Taiwei, et al.
Veröffentlicht: (2023)
von: Shi, Taiwei, et al.
Veröffentlicht: (2023)
Simulated Annealing Enhances Theory-of-Mind Reasoning in Autoregressive Language Models
von: Hu, Xucong, et al.
Veröffentlicht: (2026)
von: Hu, Xucong, et al.
Veröffentlicht: (2026)
Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators
von: Liu, Yinhong, et al.
Veröffentlicht: (2024)
von: Liu, Yinhong, et al.
Veröffentlicht: (2024)
Peering Through Preferences: Unraveling Feedback Acquisition for Aligning Large Language Models
von: Bansal, Hritik, et al.
Veröffentlicht: (2023)
von: Bansal, Hritik, et al.
Veröffentlicht: (2023)
Compositional Steering of Large Language Models with Steering Tokens
von: Radevski, Gorjan, et al.
Veröffentlicht: (2026)
von: Radevski, Gorjan, et al.
Veröffentlicht: (2026)
Large Language Models Develop Novel Social Biases Through Adaptive Exploration
von: Wu, Addison J., et al.
Veröffentlicht: (2025)
von: Wu, Addison J., et al.
Veröffentlicht: (2025)
Parallelograms Strike Back: LLMs Generate Better Analogies than People
von: Liu, Qiawen Ella, et al.
Veröffentlicht: (2026)
von: Liu, Qiawen Ella, et al.
Veröffentlicht: (2026)
Prompt-Based Value Steering of Large Language Models
von: Abbo, Giulio Antonio, et al.
Veröffentlicht: (2025)
von: Abbo, Giulio Antonio, et al.
Veröffentlicht: (2025)
Steering Large Language Models to Evaluate and Amplify Creativity
von: Olson, Matthew Lyle, et al.
Veröffentlicht: (2024)
von: Olson, Matthew Lyle, et al.
Veröffentlicht: (2024)
ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models
von: Guang, Jiahui, et al.
Veröffentlicht: (2026)
von: Guang, Jiahui, et al.
Veröffentlicht: (2026)
Aligning with Logic: Measuring, Evaluating and Improving Logical Preference Consistency in Large Language Models
von: Liu, Yinhong, et al.
Veröffentlicht: (2024)
von: Liu, Yinhong, et al.
Veröffentlicht: (2024)
Eliciting the Priors of Large Language Models using Iterated In-Context Learning
von: Zhu, Jian-Qiao, et al.
Veröffentlicht: (2024)
von: Zhu, Jian-Qiao, et al.
Veröffentlicht: (2024)
CogSteer: Cognition-Inspired Selective Layer Intervention for Efficiently Steering Large Language Models
von: Wang, Xintong, et al.
Veröffentlicht: (2024)
von: Wang, Xintong, et al.
Veröffentlicht: (2024)
Fairer Preferences Elicit Improved Human-Aligned Large Language Model Judgments
von: Zhou, Han, et al.
Veröffentlicht: (2024)
von: Zhou, Han, et al.
Veröffentlicht: (2024)
Extended Inductive Reasoning for Personalized Preference Inference from Behavioral Signals
von: Li, Jia-Nan, et al.
Veröffentlicht: (2025)
von: Li, Jia-Nan, et al.
Veröffentlicht: (2025)
Preference Packing: Efficient Preference Optimization for Large Language Models
von: Cho, Jaekyung
Veröffentlicht: (2026)
von: Cho, Jaekyung
Veröffentlicht: (2026)
Extracting and Steering Emotion Representations in Small Language Models: A Methodological Comparison
von: Jeong, Jihoon
Veröffentlicht: (2026)
von: Jeong, Jihoon
Veröffentlicht: (2026)
Attention-Aligned Reasoning for Large Language Models
von: Zhang, Hongxiang, et al.
Veröffentlicht: (2025)
von: Zhang, Hongxiang, et al.
Veröffentlicht: (2025)
Aligning Large Language Models with Counterfactual DPO
von: Butcher, Bradley
Veröffentlicht: (2024)
von: Butcher, Bradley
Veröffentlicht: (2024)
Localized Cultural Knowledge is Conserved and Controllable in Large Language Models
von: Veselovsky, Veniamin, et al.
Veröffentlicht: (2025)
von: Veselovsky, Veniamin, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Recovering Mental Representations from Large Language Models with Markov Chain Monte Carlo
von: Zhu, Jian-Qiao, et al.
Veröffentlicht: (2024) -
Recovering Event Probabilities from Large Language Model Embeddings via Axiomatic Constraints
von: Zhu, Jian-Qiao, et al.
Veröffentlicht: (2025) -
Language Models Trained to do Arithmetic Predict Human Risky and Intertemporal Choice
von: Zhu, Jian-Qiao, et al.
Veröffentlicht: (2024) -
Incoherent Probability Judgments in Large Language Models
von: Zhu, Jian-Qiao, et al.
Veröffentlicht: (2024) -
Aligning Large Language Model Behavior with Human Citation Preferences
von: Ando, Kenichiro, et al.
Veröffentlicht: (2026)