Are Language Models Sensitive to Morally Irrelevant Distractors?

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Shaw, Andrew, Hahn, Christina, Rasgaitis, Catherine, Mishra, Yash, Liu, Alisa, Jaques, Natasha, Tsvetkov, Yulia, Zhang, Amy X.
Format: Preprint
Published: 2026
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!