Moral Persuasion in Large Language Models: Evaluating Susceptibility and Ethical Alignment
Fuente:
arXiv
Saved in:
| Main Authors: | Huang, Allison, Pi, Yulu Niki, Mougan, Carlos |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
The Moral Consistency Pipeline: Continuous Ethical Evaluation for Large Language Models
by: Jamshidi, Saeid, et al.
Published: (2025)
by: Jamshidi, Saeid, et al.
Published: (2025)
Ethical Reasoning and Moral Value Alignment of LLMs Depend on the Language we Prompt them in
by: Agarwal, Utkarsh, et al.
Published: (2024)
by: Agarwal, Utkarsh, et al.
Published: (2024)
Kantian Deontology Meets AI Alignment: Towards Morally Grounded Fairness Metrics
by: Mougan, Carlos, et al.
Published: (2023)
by: Mougan, Carlos, et al.
Published: (2023)
Persuasion Games using Large Language Models
by: Ramani, Ganesh Prasath, et al.
Published: (2024)
by: Ramani, Ganesh Prasath, et al.
Published: (2024)
Diverse Human Value Alignment for Large Language Models via Ethical Reasoning
by: Wang, Jiahao, et al.
Published: (2025)
by: Wang, Jiahao, et al.
Published: (2025)
EvalMORAAL: Interpretable Chain-of-Thought and LLM-as-Judge Evaluation for Moral Alignment in Large Language Models
by: Mohammadi, Hadi, et al.
Published: (2025)
by: Mohammadi, Hadi, et al.
Published: (2025)
Moral Susceptibility and Robustness under Persona Role-Play in Large Language Models
by: Costa, Davi Bastos, et al.
Published: (2025)
by: Costa, Davi Bastos, et al.
Published: (2025)
"Pull or Not to Pull?'': Investigating Moral Biases in Leading Large Language Models Across Ethical Dilemmas
by: Ding, Junchen, et al.
Published: (2025)
by: Ding, Junchen, et al.
Published: (2025)
Persuade Me if You Can: A Framework for Evaluating Persuasion Effectiveness and Susceptibility Among Large Language Models
by: Bozdag, Nimet Beyza, et al.
Published: (2025)
by: Bozdag, Nimet Beyza, et al.
Published: (2025)
Measuring and Benchmarking Large Language Models' Capabilities to Generate Persuasive Language
by: Pauli, Amalie Brogaard, et al.
Published: (2024)
by: Pauli, Amalie Brogaard, et al.
Published: (2024)
SaGE: Evaluating Moral Consistency in Large Language Models
by: Bonagiri, Vamshi Krishna, et al.
Published: (2024)
by: Bonagiri, Vamshi Krishna, et al.
Published: (2024)
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
by: Yu, Linhao, et al.
Published: (2024)
by: Yu, Linhao, et al.
Published: (2024)
LocalValueBench: A Collaboratively Built and Extensible Benchmark for Evaluating Localized Value Alignment and Ethical Safety in Large Language Models
by: Meadows, Gwenyth Isobel, et al.
Published: (2024)
by: Meadows, Gwenyth Isobel, et al.
Published: (2024)
Benchmarking Distributional Alignment of Large Language Models
by: Meister, Nicole, et al.
Published: (2024)
by: Meister, Nicole, et al.
Published: (2024)
Investigating Persuasion Techniques in Arabic: An Empirical Study Leveraging Large Language Models
by: Alzahrani, Abdurahmman, et al.
Published: (2024)
by: Alzahrani, Abdurahmman, et al.
Published: (2024)
The Dark Patterns of Personalized Persuasion in Large Language Models: Exposing Persuasive Linguistic Features for Big Five Personality Traits in LLMs Responses
by: Mieleszczenko-Kowszewicz, Wiktoria, et al.
Published: (2024)
by: Mieleszczenko-Kowszewicz, Wiktoria, et al.
Published: (2024)
Revealing the Intrinsic Ethical Vulnerability of Aligned Large Language Models
by: Lian, Jiawei, et al.
Published: (2025)
by: Lian, Jiawei, et al.
Published: (2025)
Tracing Moral Foundations in Large Language Models
by: Yu, Chenxiao, et al.
Published: (2026)
by: Yu, Chenxiao, et al.
Published: (2026)
Cultural Bias in Large Language Models: Evaluating AI Agents through Moral Questionnaires
by: Münker, Simon
Published: (2025)
by: Münker, Simon
Published: (2025)
Iterative Prompting with Persuasion Skills in Jailbreaking Large Language Models
by: Ke, Shih-Wen, et al.
Published: (2025)
by: Ke, Shih-Wen, et al.
Published: (2025)
Are Large Language Models Moral Hypocrites? A Study Based on Moral Foundations
by: Nunes, José Luiz, et al.
Published: (2024)
by: Nunes, José Luiz, et al.
Published: (2024)
Reasoning Capabilities of Large Language Models on Dynamic Tasks
by: Wong, Annie, et al.
Published: (2025)
by: Wong, Annie, et al.
Published: (2025)
Understanding Moral Reasoning Trajectories in Large Language Models: Toward Probing-Based Explainability
by: Huang, Fan, et al.
Published: (2026)
by: Huang, Fan, et al.
Published: (2026)
FactAlign: Long-form Factuality Alignment of Large Language Models
by: Huang, Chao-Wei, et al.
Published: (2024)
by: Huang, Chao-Wei, et al.
Published: (2024)
AI Debaters are More Persuasive when Arguing in Alignment with Their Own Beliefs
by: Carro, María Victoria, et al.
Published: (2025)
by: Carro, María Victoria, et al.
Published: (2025)
Entity Alignment with Noisy Annotations from Large Language Models
by: Chen, Shengyuan, et al.
Published: (2024)
by: Chen, Shengyuan, et al.
Published: (2024)
ALIGN: Word Association Learning for Cultural Alignment in Large Language Models
by: Liu, Chunhua, et al.
Published: (2025)
by: Liu, Chunhua, et al.
Published: (2025)
LLM Can be a Dangerous Persuader: Empirical Study of Persuasion Safety in Large Language Models
by: Liu, Minqian, et al.
Published: (2025)
by: Liu, Minqian, et al.
Published: (2025)
Toward Understanding the Transferability of Adversarial Suffixes in Large Language Models
by: Ball, Sarah, et al.
Published: (2025)
by: Ball, Sarah, et al.
Published: (2025)
The Only Way is Ethics: A Guide to Ethical Research with Large Language Models
by: Ungless, Eddie L., et al.
Published: (2024)
by: Ungless, Eddie L., et al.
Published: (2024)
SproutBench: A Benchmark for Safe and Ethical Large Language Models for Youth
by: Xing, Wenpeng, et al.
Published: (2025)
by: Xing, Wenpeng, et al.
Published: (2025)
Large-Scale Analysis of Persuasive Content on Moltbook
by: Jose, Julia, et al.
Published: (2026)
by: Jose, Julia, et al.
Published: (2026)
DeAL: Decoding-time Alignment for Large Language Models
by: Huang, James Y., et al.
Published: (2024)
by: Huang, James Y., et al.
Published: (2024)
Exploring Cultural Variations in Moral Judgments with Large Language Models
by: Mohammadi, Hadi, et al.
Published: (2025)
by: Mohammadi, Hadi, et al.
Published: (2025)
State Design Matters: How Representations Shape Dynamic Reasoning in Large Language Models
by: Wong, Annie, et al.
Published: (2026)
by: Wong, Annie, et al.
Published: (2026)
Fundamental Limitations of Alignment in Large Language Models
by: Wolf, Yotam, et al.
Published: (2023)
by: Wolf, Yotam, et al.
Published: (2023)
Histoires Morales: A French Dataset for Assessing Moral Alignment
by: Leteno, Thibaud, et al.
Published: (2025)
by: Leteno, Thibaud, et al.
Published: (2025)
Large Language Models as Mirrors of Societal Moral Standards
by: Papadopoulou, Evi, et al.
Published: (2024)
by: Papadopoulou, Evi, et al.
Published: (2024)
Fortifying Ethical Boundaries in AI: Advanced Strategies for Enhancing Security in Large Language Models
by: He, Yunhong, et al.
Published: (2024)
by: He, Yunhong, et al.
Published: (2024)
Probing Ethical Framework Representations in Large Language Models: Structure, Entanglement, and Methodological Challenges
by: Xu, Weilun, et al.
Published: (2026)
by: Xu, Weilun, et al.
Published: (2026)
Similar Items
-
The Moral Consistency Pipeline: Continuous Ethical Evaluation for Large Language Models
by: Jamshidi, Saeid, et al.
Published: (2025) -
Ethical Reasoning and Moral Value Alignment of LLMs Depend on the Language we Prompt them in
by: Agarwal, Utkarsh, et al.
Published: (2024) -
Kantian Deontology Meets AI Alignment: Towards Morally Grounded Fairness Metrics
by: Mougan, Carlos, et al.
Published: (2023) -
Persuasion Games using Large Language Models
by: Ramani, Ganesh Prasath, et al.
Published: (2024) -
Diverse Human Value Alignment for Large Language Models via Ethical Reasoning
by: Wang, Jiahao, et al.
Published: (2025)