Using Reinforcement Learning to Train Large Language Models to Explain Human Decisions
Fuente:
arXiv
Saved in:
| Main Authors: | Zhu, Jian-Qiao, Xie, Hanbo, Arumugam, Dilip, Wilson, Robert C., Griffiths, Thomas L. |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Are Large Language Models Reliable AI Scientists? Assessing Reverse-Engineering of Black-Box Systems
by: Geng, Jiayi, et al.
Published: (2025)
by: Geng, Jiayi, et al.
Published: (2025)
Incoherent Probability Judgments in Large Language Models
by: Zhu, Jian-Qiao, et al.
Published: (2024)
by: Zhu, Jian-Qiao, et al.
Published: (2024)
Toward Efficient Exploration by Large Language Model Agents
by: Arumugam, Dilip, et al.
Published: (2025)
by: Arumugam, Dilip, et al.
Published: (2025)
Language Models Trained to do Arithmetic Predict Human Risky and Intertemporal Choice
by: Zhu, Jian-Qiao, et al.
Published: (2024)
by: Zhu, Jian-Qiao, et al.
Published: (2024)
Steering Risk Preferences in Large Language Models by Aligning Behavioral and Neural Representations
by: Zhu, Jian-Qiao, et al.
Published: (2025)
by: Zhu, Jian-Qiao, et al.
Published: (2025)
Recovering Event Probabilities from Large Language Model Embeddings via Axiomatic Constraints
by: Zhu, Jian-Qiao, et al.
Published: (2025)
by: Zhu, Jian-Qiao, et al.
Published: (2025)
Recovering Mental Representations from Large Language Models with Markov Chain Monte Carlo
by: Zhu, Jian-Qiao, et al.
Published: (2024)
by: Zhu, Jian-Qiao, et al.
Published: (2024)
Eliciting the Priors of Large Language Models using Iterated In-Context Learning
by: Zhu, Jian-Qiao, et al.
Published: (2024)
by: Zhu, Jian-Qiao, et al.
Published: (2024)
Cognitive Models and AI Algorithms Provide Templates for Designing Language Agents
by: Liu, Ryan, et al.
Published: (2026)
by: Liu, Ryan, et al.
Published: (2026)
Explaining Large Language Models Decisions Using Shapley Values
by: Mohammadi, Behnam
Published: (2024)
by: Mohammadi, Behnam
Published: (2024)
Large Language Models Think Too Fast To Explore Effectively
by: Pan, Lan, et al.
Published: (2025)
by: Pan, Lan, et al.
Published: (2025)
Improving the Efficiency of Language Agent Teams with Adaptive Task Graphs
by: Mieczkowski, Elizabeth, et al.
Published: (2026)
by: Mieczkowski, Elizabeth, et al.
Published: (2026)
Improving Phishing Email Detection Performance of Small Large Language Models
by: Lin, Zijie, et al.
Published: (2025)
by: Lin, Zijie, et al.
Published: (2025)
Improving the Language Understanding Capabilities of Large Language Models Using Reinforcement Learning
by: Hu, Bokai, et al.
Published: (2024)
by: Hu, Bokai, et al.
Published: (2024)
Towards a More Inclusive AI: Progress and Perspectives in Large Language Model Training for the Sámi Language
by: Paul, Ronny, et al.
Published: (2024)
by: Paul, Ronny, et al.
Published: (2024)
Comparing Abstraction in Humans and Large Language Models Using Multimodal Serial Reproduction
by: Kumar, Sreejan, et al.
Published: (2024)
by: Kumar, Sreejan, et al.
Published: (2024)
Levels of Analysis for Large Language Models
by: Ku, Alexander Y., et al.
Published: (2025)
by: Ku, Alexander Y., et al.
Published: (2025)
Eliciting Trustworthiness Priors of Large Language Models via Economic Games
by: Yan, Siyu, et al.
Published: (2026)
by: Yan, Siyu, et al.
Published: (2026)
Explaining the Reasoning of Large Language Models Using Attribution Graphs
by: Walker, Chase, et al.
Published: (2025)
by: Walker, Chase, et al.
Published: (2025)
What is a Number, That a Large Language Model May Know It?
by: Marjieh, Raja, et al.
Published: (2025)
by: Marjieh, Raja, et al.
Published: (2025)
Localized Cultural Knowledge is Conserved and Controllable in Large Language Models
by: Veselovsky, Veniamin, et al.
Published: (2025)
by: Veselovsky, Veniamin, et al.
Published: (2025)
Rational Metareasoning for Large Language Models
by: De Sabbata, C. Nicolò, et al.
Published: (2024)
by: De Sabbata, C. Nicolò, et al.
Published: (2024)
Training Language Models to Explain Their Own Computations
by: Li, Belinda Z., et al.
Published: (2025)
by: Li, Belinda Z., et al.
Published: (2025)
Large Language Models Are Latent Variable Models: Explaining and Finding Good Demonstrations for In-Context Learning
by: Wang, Xinyi, et al.
Published: (2023)
by: Wang, Xinyi, et al.
Published: (2023)
Simulated Annealing Enhances Theory-of-Mind Reasoning in Autoregressive Language Models
by: Hu, Xucong, et al.
Published: (2026)
by: Hu, Xucong, et al.
Published: (2026)
Pruning Large Language Models with Semi-Structural Adaptive Sparse Training
by: Huang, Weiyu, et al.
Published: (2024)
by: Huang, Weiyu, et al.
Published: (2024)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
by: Wang, Yiping, et al.
Published: (2025)
by: Wang, Yiping, et al.
Published: (2025)
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback
by: van Niekerk, Carel, et al.
Published: (2025)
by: van Niekerk, Carel, et al.
Published: (2025)
Parallelograms Strike Back: LLMs Generate Better Analogies than People
by: Liu, Qiawen Ella, et al.
Published: (2026)
by: Liu, Qiawen Ella, et al.
Published: (2026)
Large Language Models Develop Novel Social Biases Through Adaptive Exploration
by: Wu, Addison J., et al.
Published: (2025)
by: Wu, Addison J., et al.
Published: (2025)
How do Large Language Models Navigate Conflicts between Honesty and Helpfulness?
by: Liu, Ryan, et al.
Published: (2024)
by: Liu, Ryan, et al.
Published: (2024)
Regurgitative Training: The Value of Real Data in Training Large Language Models
by: Zhang, Jinghui, et al.
Published: (2024)
by: Zhang, Jinghui, et al.
Published: (2024)
Are Large Language Models Sensitive to the Motives Behind Communication?
by: Wu, Addison J., et al.
Published: (2025)
by: Wu, Addison J., et al.
Published: (2025)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
by: Xi, Zhiheng, et al.
Published: (2024)
by: Xi, Zhiheng, et al.
Published: (2024)
Explaining Large Language Models with gSMILE
by: Dehghani, Zeinab, et al.
Published: (2025)
by: Dehghani, Zeinab, et al.
Published: (2025)
Humans and Large Language Models in Clinical Decision Support: A Study with Medical Calculators
by: Wan, Nicholas, et al.
Published: (2024)
by: Wan, Nicholas, et al.
Published: (2024)
On the Decision-Making Abilities in Role-Playing using Large Language Models
by: Shen, Chenglei, et al.
Published: (2024)
by: Shen, Chenglei, et al.
Published: (2024)
Identifying and Mitigating the Influence of the Prior Distribution in Large Language Models
by: Zhang, Liyi, et al.
Published: (2025)
by: Zhang, Liyi, et al.
Published: (2025)
Large Language Models Assume People are More Rational than We Really are
by: Liu, Ryan, et al.
Published: (2024)
by: Liu, Ryan, et al.
Published: (2024)
Explanations of Large Language Models Explain Language Representations in the Brain
by: Rahimi, Maryam, et al.
Published: (2025)
by: Rahimi, Maryam, et al.
Published: (2025)
Similar Items
-
Are Large Language Models Reliable AI Scientists? Assessing Reverse-Engineering of Black-Box Systems
by: Geng, Jiayi, et al.
Published: (2025) -
Incoherent Probability Judgments in Large Language Models
by: Zhu, Jian-Qiao, et al.
Published: (2024) -
Toward Efficient Exploration by Large Language Model Agents
by: Arumugam, Dilip, et al.
Published: (2025) -
Language Models Trained to do Arithmetic Predict Human Risky and Intertemporal Choice
by: Zhu, Jian-Qiao, et al.
Published: (2024) -
Steering Risk Preferences in Large Language Models by Aligning Behavioral and Neural Representations
by: Zhu, Jian-Qiao, et al.
Published: (2025)