Procedural Dilemma Generation for Evaluating Moral Reasoning in Humans and Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Fränken, Jan-Philipp, Gandhi, Kanishk, Qiu, Tori, Khawaja, Ayesha, Goodman, Noah D., Gerstenberg, Tobias |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Self-Supervised Alignment with Mutual Information: Learning to Follow Principles without Preference Labels
di: Fränken, Jan-Philipp, et al.
Pubblicazione: (2024)
di: Fränken, Jan-Philipp, et al.
Pubblicazione: (2024)
Human-like Affective Cognition in Foundation Models
di: Gandhi, Kanishk, et al.
Pubblicazione: (2024)
di: Gandhi, Kanishk, et al.
Pubblicazione: (2024)
STaR-GATE: Teaching Language Models to Ask Clarifying Questions
di: Andukuri, Chinmaya, et al.
Pubblicazione: (2024)
di: Andukuri, Chinmaya, et al.
Pubblicazione: (2024)
Non-literal Understanding of Number Words by Language Models
di: Tsvilodub, Polina, et al.
Pubblicazione: (2025)
di: Tsvilodub, Polina, et al.
Pubblicazione: (2025)
Learning to Simulate Human Dialogue
di: Gandhi, Kanishk, et al.
Pubblicazione: (2026)
di: Gandhi, Kanishk, et al.
Pubblicazione: (2026)
Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs
di: Gandhi, Kanishk, et al.
Pubblicazione: (2025)
di: Gandhi, Kanishk, et al.
Pubblicazione: (2025)
Endless Terminals: Scaling RL Environments for Terminal Agents
di: Gandhi, Kanishk, et al.
Pubblicazione: (2026)
di: Gandhi, Kanishk, et al.
Pubblicazione: (2026)
Psychometric Alignment: Capturing Human Knowledge Distributions via Language Models
di: He-Yueya, Joy, et al.
Pubblicazione: (2024)
di: He-Yueya, Joy, et al.
Pubblicazione: (2024)
Stream of Search (SoS): Learning to Search in Language
di: Gandhi, Kanishk, et al.
Pubblicazione: (2024)
di: Gandhi, Kanishk, et al.
Pubblicazione: (2024)
Scaling up the think-aloud method
di: Wurgaft, Daniel, et al.
Pubblicazione: (2025)
di: Wurgaft, Daniel, et al.
Pubblicazione: (2025)
Large Language Model Reasoning Failures
di: Song, Peiyang, et al.
Pubblicazione: (2026)
di: Song, Peiyang, et al.
Pubblicazione: (2026)
From Next-Token to Mathematics: The Learning Dynamics of Mathematical Reasoning in Language Models
di: Mishra, Shubhra, et al.
Pubblicazione: (2024)
di: Mishra, Shubhra, et al.
Pubblicazione: (2024)
Evaluating and Optimizing Educational Content with Large Language Model Judgments
di: He-Yueya, Joy, et al.
Pubblicazione: (2024)
di: He-Yueya, Joy, et al.
Pubblicazione: (2024)
Machine Behavior in Relational Moral Dilemmas: Moral Rightness, Predicted Human Behavior, and Model Decisions
di: Kim, Jiseon, et al.
Pubblicazione: (2026)
di: Kim, Jiseon, et al.
Pubblicazione: (2026)
Towards System 2 Reasoning in LLMs: Learning How to Think With Meta Chain-of-Thought
di: Xiang, Violet, et al.
Pubblicazione: (2025)
di: Xiang, Violet, et al.
Pubblicazione: (2025)
Bifocal Attention: Harmonizing Geometric and Spectral Positional Embeddings for Algorithmic Generalization
di: Awadhiya, Kanishk
Pubblicazione: (2026)
di: Awadhiya, Kanishk
Pubblicazione: (2026)
Hypothesis Search: Inductive Reasoning with Language Models
di: Wang, Ruocheng, et al.
Pubblicazione: (2023)
di: Wang, Ruocheng, et al.
Pubblicazione: (2023)
MoReBench: Evaluating Procedural and Pluralistic Moral Reasoning in Language Models, More than Outcomes
di: Chiu, Yu Ying, et al.
Pubblicazione: (2025)
di: Chiu, Yu Ying, et al.
Pubblicazione: (2025)
Automated Statistical Model Discovery with Language Models
di: Li, Michael Y., et al.
Pubblicazione: (2024)
di: Li, Michael Y., et al.
Pubblicazione: (2024)
Diagnosing Moral Reasoning Acquisition in Language Models: Pragmatics and Generalization
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
Is Child-Directed Speech Effective Training Data for Language Models?
di: Feng, Steven Y., et al.
Pubblicazione: (2024)
di: Feng, Steven Y., et al.
Pubblicazione: (2024)
L0-Reasoning Bench: Evaluating Procedural Correctness in Language Models via Simple Program Execution
di: Sun, Simeng, et al.
Pubblicazione: (2025)
di: Sun, Simeng, et al.
Pubblicazione: (2025)
Are Language Models Consequentialist or Deontological Moral Reasoners?
di: Samway, Keenan, et al.
Pubblicazione: (2025)
di: Samway, Keenan, et al.
Pubblicazione: (2025)
ActuBench: A Multi-Agent LLM Pipeline for Generation and Evaluation of Actuarial Reasoning Tasks
di: Schmidt, Jan-Philipp
Pubblicazione: (2026)
di: Schmidt, Jan-Philipp
Pubblicazione: (2026)
Chain-of-Procedure: Hierarchical Visual-Language Reasoning for Procedural QA
di: Chen, Guanhua, et al.
Pubblicazione: (2026)
di: Chen, Guanhua, et al.
Pubblicazione: (2026)
Effective Explanations Support Planning Under Uncertainty
di: Zhou, Hanqi, et al.
Pubblicazione: (2026)
di: Zhou, Hanqi, et al.
Pubblicazione: (2026)
Understanding the Dilemma of Unlearning for Large Language Models
di: Zhang, Qingjie, et al.
Pubblicazione: (2025)
di: Zhang, Qingjie, et al.
Pubblicazione: (2025)
"Pull or Not to Pull?'': Investigating Moral Biases in Leading Large Language Models Across Ethical Dilemmas
di: Ding, Junchen, et al.
Pubblicazione: (2025)
di: Ding, Junchen, et al.
Pubblicazione: (2025)
Role-Play Paradox in Large Language Models: Reasoning Performance Gains and Ethical Dilemmas
di: Zhao, Jinman, et al.
Pubblicazione: (2024)
di: Zhao, Jinman, et al.
Pubblicazione: (2024)
Why Someone Asked "Why": Foil Inference in Human and LLM Question Interpretation
di: Besch, Britt, et al.
Pubblicazione: (2026)
di: Besch, Britt, et al.
Pubblicazione: (2026)
CriticAL: Critic Automation with Language Models
di: Li, Michael Y., et al.
Pubblicazione: (2024)
di: Li, Michael Y., et al.
Pubblicazione: (2024)
Comparing Inferential Strategies of Humans and Large Language Models in Deductive Reasoning
di: Mondorf, Philipp, et al.
Pubblicazione: (2024)
di: Mondorf, Philipp, et al.
Pubblicazione: (2024)
CLEVRER-Humans: Describing Physical and Causal Events the Human Way
di: Mao, Jiayuan, et al.
Pubblicazione: (2023)
di: Mao, Jiayuan, et al.
Pubblicazione: (2023)
ELSA: A Style Aligned Dataset for Emotionally Intelligent Language Generation
di: Gandhi, Vishal, et al.
Pubblicazione: (2025)
di: Gandhi, Vishal, et al.
Pubblicazione: (2025)
PERSONA: A Reproducible Testbed for Pluralistic Alignment
di: Castricato, Louis, et al.
Pubblicazione: (2024)
di: Castricato, Louis, et al.
Pubblicazione: (2024)
Bayesian Preference Elicitation with Language Models
di: Handa, Kunal, et al.
Pubblicazione: (2024)
di: Handa, Kunal, et al.
Pubblicazione: (2024)
The Greatest Good Benchmark: Measuring LLMs' Alignment with Utilitarian Moral Dilemmas
di: Marraffini, Giovanni Franco Gabriel, et al.
Pubblicazione: (2025)
di: Marraffini, Giovanni Franco Gabriel, et al.
Pubblicazione: (2025)
Human Evaluation of Procedural Knowledge Graph Extraction from Text with Large Language Models
di: Carriero, Valentina Anita, et al.
Pubblicazione: (2024)
di: Carriero, Valentina Anita, et al.
Pubblicazione: (2024)
BengaliMoralBench: A Benchmark for Auditing Moral Reasoning in Large Language Models within Bengali Language and Culture
di: Ridoy, Shahriyar Zaman, et al.
Pubblicazione: (2025)
di: Ridoy, Shahriyar Zaman, et al.
Pubblicazione: (2025)
AutoLogi: Automated Generation of Logic Puzzles for Evaluating Reasoning Abilities of Large Language Models
di: Zhu, Qin, et al.
Pubblicazione: (2025)
di: Zhu, Qin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Self-Supervised Alignment with Mutual Information: Learning to Follow Principles without Preference Labels
di: Fränken, Jan-Philipp, et al.
Pubblicazione: (2024) -
Human-like Affective Cognition in Foundation Models
di: Gandhi, Kanishk, et al.
Pubblicazione: (2024) -
STaR-GATE: Teaching Language Models to Ask Clarifying Questions
di: Andukuri, Chinmaya, et al.
Pubblicazione: (2024) -
Non-literal Understanding of Number Words by Language Models
di: Tsvilodub, Polina, et al.
Pubblicazione: (2025) -
Learning to Simulate Human Dialogue
di: Gandhi, Kanishk, et al.
Pubblicazione: (2026)