Building Interpretable Models for Moral Decision-Making
Fuente:
arXiv
Salvato in:
| Autori principali: | Goel, Mayank, Das, Aritra, Chopra, Paras |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Integrating Reason-Based Moral Decision-Making in the Reinforcement Learning Architecture
di: Dargasz, Lisa
Pubblicazione: (2025)
di: Dargasz, Lisa
Pubblicazione: (2025)
Hybrid Neural World Models
di: Lakshmanan, Pranav, et al.
Pubblicazione: (2026)
di: Lakshmanan, Pranav, et al.
Pubblicazione: (2026)
Remembering to Be Fair: Non-Markovian Fairness in Sequential Decision Making
di: Alamdari, Parand A., et al.
Pubblicazione: (2023)
di: Alamdari, Parand A., et al.
Pubblicazione: (2023)
Algorithmic Fairness in AI Surrogates for End-of-Life Decision-Making
di: Ahmad, Muhammad Aurangzeb
Pubblicazione: (2025)
di: Ahmad, Muhammad Aurangzeb
Pubblicazione: (2025)
Decision Making with Differential Privacy under a Fairness Lens
di: Fioretto, Ferdinando, et al.
Pubblicazione: (2021)
di: Fioretto, Ferdinando, et al.
Pubblicazione: (2021)
DM-Bench: Benchmarking LLMs for Personalized Decision Making in Diabetes Management
di: Cardei, Maria Ana, et al.
Pubblicazione: (2025)
di: Cardei, Maria Ana, et al.
Pubblicazione: (2025)
Reinforced Sequential Decision-Making for Sepsis Treatment: The POSNEGDM Framework with Mortality Classifier and Transformer
di: Tamboli, Dipesh, et al.
Pubblicazione: (2024)
di: Tamboli, Dipesh, et al.
Pubblicazione: (2024)
A Post-Processing-Based Fair Federated Learning Framework
di: Zhou, Yi, et al.
Pubblicazione: (2025)
di: Zhou, Yi, et al.
Pubblicazione: (2025)
Language Agents as Digital Representatives in Collective Decision-Making
di: Jarrett, Daniel, et al.
Pubblicazione: (2025)
di: Jarrett, Daniel, et al.
Pubblicazione: (2025)
Why LLMs Aren't Scientists Yet: Lessons from Four Autonomous Research Attempts
di: Trehan, Dhruv, et al.
Pubblicazione: (2026)
di: Trehan, Dhruv, et al.
Pubblicazione: (2026)
The Sequential Edge: Inverse-Entropy Voting Beats Parallel Self-Consistency at Matched Compute
di: Sharma, Aman, et al.
Pubblicazione: (2025)
di: Sharma, Aman, et al.
Pubblicazione: (2025)
Think Just Enough: Sequence-Level Entropy as a Confidence Signal for LLM Reasoning
di: Sharma, Aman, et al.
Pubblicazione: (2025)
di: Sharma, Aman, et al.
Pubblicazione: (2025)
EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages
di: Sharma, Aman, et al.
Pubblicazione: (2026)
di: Sharma, Aman, et al.
Pubblicazione: (2026)
Inducing Human-like Biases in Moral Reasoning Language Models
di: Karpov, Artem, et al.
Pubblicazione: (2024)
di: Karpov, Artem, et al.
Pubblicazione: (2024)
Moral Alignment for LLM Agents
di: Tennant, Elizaveta, et al.
Pubblicazione: (2024)
di: Tennant, Elizaveta, et al.
Pubblicazione: (2024)
Building a Domain-specific Guardrail Model in Production
di: Niknazar, Mohammad, et al.
Pubblicazione: (2024)
di: Niknazar, Mohammad, et al.
Pubblicazione: (2024)
A Frank System for Co-Evolutionary Hybrid Decision-Making
di: Mazzoni, Federico, et al.
Pubblicazione: (2025)
di: Mazzoni, Federico, et al.
Pubblicazione: (2025)
Inducing Group Fairness in Prompt-Based Language Model Decisions
di: Atwood, James, et al.
Pubblicazione: (2024)
di: Atwood, James, et al.
Pubblicazione: (2024)
Discovering Reinforcement Learning Interfaces with Large Language Models
di: Jaswal, Akshat Singh, et al.
Pubblicazione: (2026)
di: Jaswal, Akshat Singh, et al.
Pubblicazione: (2026)
Fairness-Aware Interpretable Modeling (FAIM) for Trustworthy Machine Learning in Healthcare
di: Liu, Mingxuan, et al.
Pubblicazione: (2024)
di: Liu, Mingxuan, et al.
Pubblicazione: (2024)
Interpretable Graph-Language Modeling for Detecting Youth Illicit Drug Use
di: Li, Yiyang, et al.
Pubblicazione: (2025)
di: Li, Yiyang, et al.
Pubblicazione: (2025)
Computational Basis of LLM's Decision Making in Social Simulation
di: Ma, Ji
Pubblicazione: (2025)
di: Ma, Ji
Pubblicazione: (2025)
Building Decision Making Models Through Language Model Regime
di: Zhang, Yu, et al.
Pubblicazione: (2024)
di: Zhang, Yu, et al.
Pubblicazione: (2024)
Regulation of Language Models With Interpretability Will Likely Result In A Performance Trade-Off
di: Kenny, Eoin M., et al.
Pubblicazione: (2024)
di: Kenny, Eoin M., et al.
Pubblicazione: (2024)
Mechanistic Interpretability with SAEs: Probing Religion, Violence, and Geography in Large Language Models
di: Simbeck, Katharina, et al.
Pubblicazione: (2025)
di: Simbeck, Katharina, et al.
Pubblicazione: (2025)
A Moral Imperative: The Need for Continual Superalignment of Large Language Models
di: Puthumanaillam, Gokul, et al.
Pubblicazione: (2024)
di: Puthumanaillam, Gokul, et al.
Pubblicazione: (2024)
Does Cross-Cultural Alignment Change the Commonsense Morality of Language Models?
di: Jinnai, Yuu
Pubblicazione: (2024)
di: Jinnai, Yuu
Pubblicazione: (2024)
Acting for the Right Reasons: Creating Reason-Sensitive Artificial Moral Agents
di: Baum, Kevin, et al.
Pubblicazione: (2024)
di: Baum, Kevin, et al.
Pubblicazione: (2024)
Are There Exceptions to Goodhart's Law? On the Moral Justification of Fairness-Aware Machine Learning
di: Weerts, Hilde, et al.
Pubblicazione: (2022)
di: Weerts, Hilde, et al.
Pubblicazione: (2022)
Artificial Intelligence Should Genuinely Support Clinical Reasoning and Decision Making To Bridge the Translational Gap
di: Sokol, Kacper, et al.
Pubblicazione: (2025)
di: Sokol, Kacper, et al.
Pubblicazione: (2025)
Transparent AI: The Case for Interpretability and Explainability
di: Ramachandram, Dhanesh, et al.
Pubblicazione: (2025)
di: Ramachandram, Dhanesh, et al.
Pubblicazione: (2025)
GreedLlama: Performance of Financial Value-Aligned Large Language Models in Moral Reasoning
di: Yu, Jeffy, et al.
Pubblicazione: (2024)
di: Yu, Jeffy, et al.
Pubblicazione: (2024)
Addressing Moral Uncertainty using Large Language Models for Ethical Decision-Making
di: Dubey, Rohit K., et al.
Pubblicazione: (2025)
di: Dubey, Rohit K., et al.
Pubblicazione: (2025)
Two Types of AI Existential Risk: Decisive and Accumulative
di: Kasirzadeh, Atoosa
Pubblicazione: (2024)
di: Kasirzadeh, Atoosa
Pubblicazione: (2024)
Personalized Decision Modeling: Utility Optimization or Textualized-Symbolic Reasoning
di: Zhao, Yibo, et al.
Pubblicazione: (2025)
di: Zhao, Yibo, et al.
Pubblicazione: (2025)
A Question-centric Multi-experts Contrastive Learning Framework for Improving the Accuracy and Interpretability of Deep Sequential Knowledge Tracing Models
di: Zhang, Hengyuan, et al.
Pubblicazione: (2024)
di: Zhang, Hengyuan, et al.
Pubblicazione: (2024)
Safeguarding Autonomy: a Focus on Machine Learning Decision Systems
di: Subías-Beltrán, Paula, et al.
Pubblicazione: (2025)
di: Subías-Beltrán, Paula, et al.
Pubblicazione: (2025)
IGANN Sparse: Bridging Sparsity and Interpretability with Non-linear Insight
di: Stoecker, Theodor, et al.
Pubblicazione: (2024)
di: Stoecker, Theodor, et al.
Pubblicazione: (2024)
METIS: Mentoring Engine for Thoughtful Inquiry & Solutions
di: Kumar, Abhinav Rajeev, et al.
Pubblicazione: (2026)
di: Kumar, Abhinav Rajeev, et al.
Pubblicazione: (2026)
Explainable AI Systems Must Be Contestable: Here's How to Make It Happen
di: Moreira, Catarina, et al.
Pubblicazione: (2025)
di: Moreira, Catarina, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Integrating Reason-Based Moral Decision-Making in the Reinforcement Learning Architecture
di: Dargasz, Lisa
Pubblicazione: (2025) -
Hybrid Neural World Models
di: Lakshmanan, Pranav, et al.
Pubblicazione: (2026) -
Remembering to Be Fair: Non-Markovian Fairness in Sequential Decision Making
di: Alamdari, Parand A., et al.
Pubblicazione: (2023) -
Algorithmic Fairness in AI Surrogates for End-of-Life Decision-Making
di: Ahmad, Muhammad Aurangzeb
Pubblicazione: (2025) -
Decision Making with Differential Privacy under a Fairness Lens
di: Fioretto, Ferdinando, et al.
Pubblicazione: (2021)