Multi-turn Evaluation of Anthropomorphic Behaviours in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Ibrahim, Lujain, Akbulut, Canfer, Elasmar, Rasmi, Rastogi, Charvi, Kahng, Minsuk, Morris, Meredith Ringel, McKee, Kevin R., Rieser, Verena, Shanahan, Murray, Weidinger, Laura |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Evaluating Language Models for Harmful Manipulation
by: Akbulut, Canfer, et al.
Published: (2026)
by: Akbulut, Canfer, et al.
Published: (2026)
STAR: SocioTechnical Approach to Red Teaming Language Models
by: Weidinger, Laura, et al.
Published: (2024)
by: Weidinger, Laura, et al.
Published: (2024)
Data-Prompt Co-Evolution: Growing Test Sets to Refine LLM Behavior
by: Lee, Minjae, et al.
Published: (2025)
by: Lee, Minjae, et al.
Published: (2025)
Understanding the Dataset Practitioners Behind Large Language Model Development
by: Qian, Crystal, et al.
Published: (2024)
by: Qian, Crystal, et al.
Published: (2024)
Generative Ghosts: Anticipating Benefits and Risks of AI Afterlives
by: Morris, Meredith Ringel, et al.
Published: (2024)
by: Morris, Meredith Ringel, et al.
Published: (2024)
VLSlice: Interactive Vision-and-Language Slice Discovery
by: Slyman, Eric, et al.
Published: (2023)
by: Slyman, Eric, et al.
Published: (2023)
Human participants in AI research: Ethics and transparency in practice
by: McKee, Kevin R.
Published: (2023)
by: McKee, Kevin R.
Published: (2023)
Automatic Histograms: Leveraging Language Models for Text Dataset Exploration
by: Reif, Emily, et al.
Published: (2024)
by: Reif, Emily, et al.
Published: (2024)
SAFEPATH: Preventing Harmful Reasoning in Chain-of-Thought via Early Alignment
by: Jeung, Wonje, et al.
Published: (2025)
by: Jeung, Wonje, et al.
Published: (2025)
Decoding Safety Feedback from Diverse Raters: A Data-driven Lens on Responsiveness to Severity
by: Mishra, Pushkar, et al.
Published: (2025)
by: Mishra, Pushkar, et al.
Published: (2025)
Who Defines "Best"? Towards Interactive, User-Defined Evaluation of LLM Leaderboards
by: Jung, Minji, et al.
Published: (2026)
by: Jung, Minji, et al.
Published: (2026)
Thinking beyond the anthropomorphic paradigm benefits LLM research
by: Ibrahim, Lujain, et al.
Published: (2025)
by: Ibrahim, Lujain, et al.
Published: (2025)
Going PLACES: Participatory Localized Red Teaming for Text-to-Image Safety in the Global South
by: Rastogi, Charvi, et al.
Published: (2026)
by: Rastogi, Charvi, et al.
Published: (2026)
When Cars Have Stereotypes: Auditing Demographic Bias in Objects from Text-to-Image Models
by: Choi, Dasol, et al.
Published: (2025)
by: Choi, Dasol, et al.
Published: (2025)
Warmth and competence in human-agent cooperation
by: McKee, Kevin R., et al.
Published: (2022)
by: McKee, Kevin R., et al.
Published: (2022)
From Perception to Decision: Assessing the Role of Chart Types Affordances in High-Level Decision Tasks
by: Li, Yixuan, et al.
Published: (2024)
by: Li, Yixuan, et al.
Published: (2024)
Recourse for reclamation: Chatting with generative language models
by: Chien, Jennifer, et al.
Published: (2024)
by: Chien, Jennifer, et al.
Published: (2024)
Characterizing and modeling harms from interactions with design patterns in AI interfaces
by: Ibrahim, Lujain, et al.
Published: (2024)
by: Ibrahim, Lujain, et al.
Published: (2024)
Interactive AI Alignment: Specification, Process, and Evaluation Alignment
by: Terry, Michael, et al.
Published: (2023)
by: Terry, Michael, et al.
Published: (2023)
Interactive Prompt Debugging with Sequence Salience
by: Tenney, Ian, et al.
Published: (2024)
by: Tenney, Ian, et al.
Published: (2024)
Training language models to be warm and empathetic makes them less reliable and more sycophantic
by: Ibrahim, Lujain, et al.
Published: (2025)
by: Ibrahim, Lujain, et al.
Published: (2025)
Still "Talking About Large Language Models": Some Clarifications
by: Shanahan, Murray
Published: (2024)
by: Shanahan, Murray
Published: (2024)
Adversarial Nibbler: An Open Red-Teaming Method for Identifying Diverse Harms in Text-to-Image Generation
by: Quaye, Jessica, et al.
Published: (2024)
by: Quaye, Jessica, et al.
Published: (2024)
"Just a strange pic": Evaluating 'safety' in GenAI Image safety annotation tasks from diverse annotators' perspectives
by: Wang, Ding, et al.
Published: (2025)
by: Wang, Ding, et al.
Published: (2025)
LLM Comparator: Visual Analytics for Side-by-Side Evaluation of Large Language Models
by: Kahng, Minsuk, et al.
Published: (2024)
by: Kahng, Minsuk, et al.
Published: (2024)
The Impossible Test: A 2024 Unsolvable Dataset and A Chance for an AGI Quiz
by: Noever, David, et al.
Published: (2024)
by: Noever, David, et al.
Published: (2024)
Alpha Excel Benchmark
by: Noever, David, et al.
Published: (2025)
by: Noever, David, et al.
Published: (2025)
Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests
by: Noever, David, et al.
Published: (2025)
by: Noever, David, et al.
Published: (2025)
Novel AI Camera Camouflage: Face Cloaking Without Full Disguise
by: Noever, David, et al.
Published: (2024)
by: Noever, David, et al.
Published: (2024)
Exploiting Alpha Transparency In Language And Vision-Based AI Systems
by: Noever, David, et al.
Published: (2024)
by: Noever, David, et al.
Published: (2024)
Can AI Freelancers Compete? Benchmarking Earnings, Reliability, and Task Success at Scale
by: Noever, David, et al.
Published: (2025)
by: Noever, David, et al.
Published: (2025)
Whose View of Safety? A Deep DIVE Dataset for Pluralistic Alignment of Text-to-Image Models
by: Rastogi, Charvi, et al.
Published: (2025)
by: Rastogi, Charvi, et al.
Published: (2025)
Towards interactive evaluations for interaction harms in human-AI systems
by: Ibrahim, Lujain, et al.
Published: (2024)
by: Ibrahim, Lujain, et al.
Published: (2024)
Existential Conversations with Large Language Models: Content, Community, and Culture
by: Shanahan, Murray, et al.
Published: (2024)
by: Shanahan, Murray, et al.
Published: (2024)
Does It Make Sense to Speak of Introspection in Large Language Models?
by: Comsa, Iulia M., et al.
Published: (2025)
by: Comsa, Iulia M., et al.
Published: (2025)
Consistency is Key: Disentangling Label Variation in Natural Language Processing with Intra-Annotator Agreement
by: Abercrombie, Gavin, et al.
Published: (2023)
by: Abercrombie, Gavin, et al.
Published: (2023)
The Missing Knowledge Layer in AI: A Framework for Stable Human-AI Reasoning
by: Rosenbacke, Rikard, et al.
Published: (2026)
by: Rosenbacke, Rikard, et al.
Published: (2026)
Governing Reflective Human-AI Collaboration: A Framework for Epistemic Scaffolding and Traceable Reasoning
by: Rosenbacke, Rikard, et al.
Published: (2026)
by: Rosenbacke, Rikard, et al.
Published: (2026)
VET: A Framework for Analyzing AI Discourse
by: Morris, Meredith Ringel
Published: (2026)
by: Morris, Meredith Ringel
Published: (2026)
Thinking agents for zero-shot generalization to qualitatively novel tasks
by: Miconi, Thomas, et al.
Published: (2025)
by: Miconi, Thomas, et al.
Published: (2025)
Similar Items
-
Evaluating Language Models for Harmful Manipulation
by: Akbulut, Canfer, et al.
Published: (2026) -
STAR: SocioTechnical Approach to Red Teaming Language Models
by: Weidinger, Laura, et al.
Published: (2024) -
Data-Prompt Co-Evolution: Growing Test Sets to Refine LLM Behavior
by: Lee, Minjae, et al.
Published: (2025) -
Understanding the Dataset Practitioners Behind Large Language Model Development
by: Qian, Crystal, et al.
Published: (2024) -
Generative Ghosts: Anticipating Benefits and Risks of AI Afterlives
by: Morris, Meredith Ringel, et al.
Published: (2024)