MoralReason: Generalizable Moral Decision Alignment For LLM Agents Using Reasoning-Level Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | An, Zhiyu, Du, Wan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Open Problems in Differentiable Social Choice: Learning Mechanisms, Decisions, and Alignment
di: An, Zhiyu, et al.
Pubblicazione: (2026)
di: An, Zhiyu, et al.
Pubblicazione: (2026)
Integrating Reason-Based Moral Decision-Making in the Reinforcement Learning Architecture
di: Dargasz, Lisa
Pubblicazione: (2025)
di: Dargasz, Lisa
Pubblicazione: (2025)
Moral Alignment for LLM Agents
di: Tennant, Elizaveta, et al.
Pubblicazione: (2024)
di: Tennant, Elizaveta, et al.
Pubblicazione: (2024)
The Moral Turing Test: Evaluating Human-LLM Alignment in Moral Decision-Making
di: Garcia, Basile, et al.
Pubblicazione: (2024)
di: Garcia, Basile, et al.
Pubblicazione: (2024)
MoralityGym: A Benchmark for Evaluating Hierarchical Moral Alignment in Sequential Decision-Making Agents
di: Rosen, Simon, et al.
Pubblicazione: (2026)
di: Rosen, Simon, et al.
Pubblicazione: (2026)
Acting for the Right Reasons: Creating Reason-Sensitive Artificial Moral Agents
di: Baum, Kevin, et al.
Pubblicazione: (2024)
di: Baum, Kevin, et al.
Pubblicazione: (2024)
FlowReasoner: Reinforcing Query-Level Meta-Agents
di: Gao, Hongcheng, et al.
Pubblicazione: (2025)
di: Gao, Hongcheng, et al.
Pubblicazione: (2025)
ProMoral-Bench: Evaluating Prompting Strategies for Moral Reasoning and Safety in LLMs
di: Thomas, Rohan Subramanian, et al.
Pubblicazione: (2026)
di: Thomas, Rohan Subramanian, et al.
Pubblicazione: (2026)
DIML: Differentiable Inverse Mechanism Learning from Behaviors of Multi-Agent Learning Trajectories
di: An, Zhiyu, et al.
Pubblicazione: (2026)
di: An, Zhiyu, et al.
Pubblicazione: (2026)
Reasoning or Rhetoric? An Empirical Analysis of Moral Reasoning Explanations in Large Language Models
di: Kasat, Aryan, et al.
Pubblicazione: (2026)
di: Kasat, Aryan, et al.
Pubblicazione: (2026)
Ethical Reasoning and Moral Value Alignment of LLMs Depend on the Language we Prompt them in
di: Agarwal, Utkarsh, et al.
Pubblicazione: (2024)
di: Agarwal, Utkarsh, et al.
Pubblicazione: (2024)
One Model, Many Morals: Uncovering Cross-Linguistic Misalignments in Computational Moral Reasoning
di: Farid, Sualeha, et al.
Pubblicazione: (2025)
di: Farid, Sualeha, et al.
Pubblicazione: (2025)
Exploring the psychology of LLMs' Moral and Legal Reasoning
di: Almeida, Guilherme F. C. F., et al.
Pubblicazione: (2023)
di: Almeida, Guilherme F. C. F., et al.
Pubblicazione: (2023)
Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning
di: Dou, Zhihao, et al.
Pubblicazione: (2025)
di: Dou, Zhihao, et al.
Pubblicazione: (2025)
Social Catalysts, Not Moral Agents: The Illusion of Alignment in LLM Societies
di: Hu, Yueqing, et al.
Pubblicazione: (2026)
di: Hu, Yueqing, et al.
Pubblicazione: (2026)
Does LLM Alignment Really Need Diversity? An Empirical Study of Adapting RLVR Methods for Moral Reasoning
di: Zhang, Zhaowei, et al.
Pubblicazione: (2026)
di: Zhang, Zhaowei, et al.
Pubblicazione: (2026)
Visual Distraction Undermines Moral Reasoning in Vision-Language Models
di: Yang, Xinyi, et al.
Pubblicazione: (2026)
di: Yang, Xinyi, et al.
Pubblicazione: (2026)
CHIMERA: Compact Synthetic Data for Generalizable LLM Reasoning
di: Zhu, Xinyu, et al.
Pubblicazione: (2026)
di: Zhu, Xinyu, et al.
Pubblicazione: (2026)
Histoires Morales: A French Dataset for Assessing Moral Alignment
di: Leteno, Thibaud, et al.
Pubblicazione: (2025)
di: Leteno, Thibaud, et al.
Pubblicazione: (2025)
Agentified Assessment of Logical Reasoning Agents
di: Ni, Zhiyu, et al.
Pubblicazione: (2026)
di: Ni, Zhiyu, et al.
Pubblicazione: (2026)
Dropouts in Confidence: Moral Uncertainty in Human-LLM Alignment
di: Kwon, Jea, et al.
Pubblicazione: (2025)
di: Kwon, Jea, et al.
Pubblicazione: (2025)
Reward Bound for Behavioral Guarantee of Model-based Planning Agents
di: An, Zhiyu, et al.
Pubblicazione: (2024)
di: An, Zhiyu, et al.
Pubblicazione: (2024)
Untangling Input Language from Reasoning Language: A Diagnostic Framework for Cross-Lingual Moral Alignment in LLMs
di: Li, Nan, et al.
Pubblicazione: (2026)
di: Li, Nan, et al.
Pubblicazione: (2026)
Generalizable Reasoning through Compositional Energy Minimization
di: Oarga, Alexandru, et al.
Pubblicazione: (2025)
di: Oarga, Alexandru, et al.
Pubblicazione: (2025)
Exploring Persona-dependent LLM Alignment for the Moral Machine Experiment
di: Kim, Jiseon, et al.
Pubblicazione: (2025)
di: Kim, Jiseon, et al.
Pubblicazione: (2025)
Scheduling Your LLM Reinforcement Learning with Reasoning Trees
di: Wang, Hong, et al.
Pubblicazione: (2025)
di: Wang, Hong, et al.
Pubblicazione: (2025)
Wide Reflective Equilibrium in LLM Alignment: Bridging Moral Epistemology and AI Safety
di: Brophy, Matthew
Pubblicazione: (2025)
di: Brophy, Matthew
Pubblicazione: (2025)
Go Beyond Black-box Policies: Rethinking the Design of Learning Agent for Interpretable and Verifiable HVAC Control
di: An, Zhiyu, et al.
Pubblicazione: (2024)
di: An, Zhiyu, et al.
Pubblicazione: (2024)
Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective
di: Kong, Deyang, et al.
Pubblicazione: (2025)
di: Kong, Deyang, et al.
Pubblicazione: (2025)
Inducing Human-like Biases in Moral Reasoning Language Models
di: Karpov, Artem, et al.
Pubblicazione: (2024)
di: Karpov, Artem, et al.
Pubblicazione: (2024)
A Novel Architecture for Symbolic Reasoning with Decision Trees and LLM Agents
di: Kiruluta, Andrew
Pubblicazione: (2025)
di: Kiruluta, Andrew
Pubblicazione: (2025)
An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents
di: Jin, Bowen, et al.
Pubblicazione: (2025)
di: Jin, Bowen, et al.
Pubblicazione: (2025)
Contesting Artificial Moral Agents
di: Aijaz, Aisha
Pubblicazione: (2026)
di: Aijaz, Aisha
Pubblicazione: (2026)
Reinforce LLM Reasoning through Multi-Agent Reflection
di: Yuan, Yurun, et al.
Pubblicazione: (2025)
di: Yuan, Yurun, et al.
Pubblicazione: (2025)
Reasoning-Aware AIGC Detection via Alignment and Reinforcement
di: Wang, Zhao, et al.
Pubblicazione: (2026)
di: Wang, Zhao, et al.
Pubblicazione: (2026)
Efficient Reinforcement Learning with Semantic and Token Entropy for LLM Reasoning
di: Cao, Hongye, et al.
Pubblicazione: (2025)
di: Cao, Hongye, et al.
Pubblicazione: (2025)
Beyond Ethical Alignment: Evaluating LLMs as Artificial Moral Assistants
di: Galatolo, Alessio, et al.
Pubblicazione: (2025)
di: Galatolo, Alessio, et al.
Pubblicazione: (2025)
MarsRL: Advancing Multi-Agent Reasoning System via Reinforcement Learning with Agentic Pipeline Parallelism
di: Liu, Shulin, et al.
Pubblicazione: (2025)
di: Liu, Shulin, et al.
Pubblicazione: (2025)
CounterMoral: Editing Morals in Language Models
di: Ripa, Michael, et al.
Pubblicazione: (2026)
di: Ripa, Michael, et al.
Pubblicazione: (2026)
Strat-Reasoner: Reinforcing Strategic Reasoning of LLMs in Multi-Agent Games
di: He, Yidong, et al.
Pubblicazione: (2026)
di: He, Yidong, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Open Problems in Differentiable Social Choice: Learning Mechanisms, Decisions, and Alignment
di: An, Zhiyu, et al.
Pubblicazione: (2026) -
Integrating Reason-Based Moral Decision-Making in the Reinforcement Learning Architecture
di: Dargasz, Lisa
Pubblicazione: (2025) -
Moral Alignment for LLM Agents
di: Tennant, Elizaveta, et al.
Pubblicazione: (2024) -
The Moral Turing Test: Evaluating Human-LLM Alignment in Moral Decision-Making
di: Garcia, Basile, et al.
Pubblicazione: (2024) -
MoralityGym: A Benchmark for Evaluating Hierarchical Moral Alignment in Sequential Decision-Making Agents
di: Rosen, Simon, et al.
Pubblicazione: (2026)