Evaluation Awareness in Language Models Has Limited Effect on Behaviour
Fuente:
arXiv
Saved in:
| Main Authors: | Knecht, Amelie, Florin, Lucas, Hagendorff, Thilo |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
On the Inevitability of Left-Leaning Political Bias in Aligned Language Models
by: Hagendorff, Thilo
Published: (2025)
by: Hagendorff, Thilo
Published: (2025)
PRIDE -- Parameter-Efficient Reduction of Identity Discrimination for Equality in LLMs
by: Menke, Maluna, et al.
Published: (2025)
by: Menke, Maluna, et al.
Published: (2025)
Speciesism in AI: Evaluating Discrimination Against Animals in Large Language Models
by: Jotautaitė, Monika, et al.
Published: (2025)
by: Jotautaitė, Monika, et al.
Published: (2025)
Compromising Honesty and Harmlessness in Language Models via Deception Attacks
by: Vaugrante, Laurène, et al.
Published: (2025)
by: Vaugrante, Laurène, et al.
Published: (2025)
Deception Abilities Emerged in Large Language Models
by: Hagendorff, Thilo
Published: (2023)
by: Hagendorff, Thilo
Published: (2023)
Mapping the Ethics of Generative AI: A Comprehensive Scoping Review
by: Hagendorff, Thilo
Published: (2024)
by: Hagendorff, Thilo
Published: (2024)
When Image Generation Goes Wrong: A Safety Analysis of Stable Diffusion Models
by: Schneider, Matthias, et al.
Published: (2024)
by: Schneider, Matthias, et al.
Published: (2024)
Beyond Chains of Thought: Benchmarking Latent-Space Reasoning Abilities in Large Language Models
by: Hagendorff, Thilo, et al.
Published: (2025)
by: Hagendorff, Thilo, et al.
Published: (2025)
Emergently Misaligned Language Models Show Behavioral Self-Awareness That Shifts With Subsequent Realignment
by: Vaugrante, Laurène, et al.
Published: (2026)
by: Vaugrante, Laurène, et al.
Published: (2026)
A Looming Replication Crisis in Evaluating Behavior in Language Models? Evidence and Solutions
by: Vaugrante, Laurène, et al.
Published: (2024)
by: Vaugrante, Laurène, et al.
Published: (2024)
Fairness Hacking: The Malicious Practice of Shrouding Unfairness in Algorithms
by: Meding, Kristof, et al.
Published: (2023)
by: Meding, Kristof, et al.
Published: (2023)
Multi-turn Evaluation of Anthropomorphic Behaviours in Large Language Models
by: Ibrahim, Lujain, et al.
Published: (2025)
by: Ibrahim, Lujain, et al.
Published: (2025)
Evaluating Proactive Risk Awareness of Large Language Models
by: Luo, Xuan, et al.
Published: (2026)
by: Luo, Xuan, et al.
Published: (2026)
The Hawthorne Effect in Reasoning Models: Evaluating and Steering Test Awareness
by: Abdelnabi, Sahar, et al.
Published: (2025)
by: Abdelnabi, Sahar, et al.
Published: (2025)
Large Reasoning Models Are Autonomous Jailbreak Agents
by: Hagendorff, Thilo, et al.
Published: (2025)
by: Hagendorff, Thilo, et al.
Published: (2025)
Theoretical Limits of Language Model Alignment
by: Paes, Lucas Monteiro, et al.
Published: (2026)
by: Paes, Lucas Monteiro, et al.
Published: (2026)
A Behavioural and Representational Evaluation of Goal-Directedness in Language Model Agents
by: Arghal, Raghu, et al.
Published: (2026)
by: Arghal, Raghu, et al.
Published: (2026)
Affective Computing Has Changed: The Foundation Model Disruption
by: Schuller, Björn, et al.
Published: (2024)
by: Schuller, Björn, et al.
Published: (2024)
Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation
by: Mukherjee, Arka, et al.
Published: (2025)
by: Mukherjee, Arka, et al.
Published: (2025)
DaKultur: Evaluating the Cultural Awareness of Language Models for Danish with Native Speakers
by: Müller-Eberstein, Max, et al.
Published: (2025)
by: Müller-Eberstein, Max, et al.
Published: (2025)
Extrinsic Evaluation of Cultural Competence in Large Language Models
by: Bhatt, Shaily, et al.
Published: (2024)
by: Bhatt, Shaily, et al.
Published: (2024)
Societal AI Research Has Become Less Interdisciplinary
by: Markus, Dror Kris, et al.
Published: (2025)
by: Markus, Dror Kris, et al.
Published: (2025)
Evaluating open-source Large Language Models for automated fact-checking
by: Fontana, Nicolo', et al.
Published: (2025)
by: Fontana, Nicolo', et al.
Published: (2025)
Limits to Predicting Online Speech Using Large Language Models
by: Remeli, Mina, et al.
Published: (2024)
by: Remeli, Mina, et al.
Published: (2024)
CALM: Culturally Self-Aware Language Models
by: Shen, Lingzhi, et al.
Published: (2026)
by: Shen, Lingzhi, et al.
Published: (2026)
Cancer-Myth: Evaluating Large Language Models on Patient Questions with False Presuppositions
by: Zhu, Wang Bill, et al.
Published: (2025)
by: Zhu, Wang Bill, et al.
Published: (2025)
Not All Jokes Land: Evaluating Large Language Models Understanding of Workplace Humor
by: Shafiei, Mohammadamin, et al.
Published: (2025)
by: Shafiei, Mohammadamin, et al.
Published: (2025)
Leveraging Large Language Models for Actionable Course Evaluation Student Feedback to Lecturers
by: Zhang, Mike, et al.
Published: (2024)
by: Zhang, Mike, et al.
Published: (2024)
WorldValuesBench: A Large-Scale Benchmark Dataset for Multi-Cultural Value Awareness of Language Models
by: Zhao, Wenlong, et al.
Published: (2024)
by: Zhao, Wenlong, et al.
Published: (2024)
Evaluating Large Language Models on Spatial Tasks: A Multi-Task Benchmarking Study
by: Xu, Liuchang, et al.
Published: (2024)
by: Xu, Liuchang, et al.
Published: (2024)
Bias and Volatility: A Statistical Framework for Evaluating Large Language Model's Stereotypes and the Associated Generation Inconsistency
by: Liu, Yiran, et al.
Published: (2024)
by: Liu, Yiran, et al.
Published: (2024)
AesBiasBench: Evaluating Bias and Alignment in Multimodal Language Models for Personalized Image Aesthetic Assessment
by: Li, Kun, et al.
Published: (2025)
by: Li, Kun, et al.
Published: (2025)
MalAlgoQA: Pedagogical Evaluation of Counterfactual Reasoning in Large Language Models and Implications for AI in Education
by: Liu, Naiming, et al.
Published: (2024)
by: Liu, Naiming, et al.
Published: (2024)
Evaluating Digital Inclusiveness of Digital Agri-Food Tools Using Large Language Models: A Comparative Analysis Between Human and AI-Based Evaluations
by: Pewinya, Githma, et al.
Published: (2026)
by: Pewinya, Githma, et al.
Published: (2026)
From General Reasoning to Domain Expertise: Uncovering the Limits of Generalization in Large Language Models
by: Alsagheer, Dana, et al.
Published: (2025)
by: Alsagheer, Dana, et al.
Published: (2025)
Evaluating Large Language Models for Detecting Antisemitism
by: Patel, Jay, et al.
Published: (2025)
by: Patel, Jay, et al.
Published: (2025)
Evaluating Psychological Safety of Large Language Models
by: Li, Xingxuan, et al.
Published: (2022)
by: Li, Xingxuan, et al.
Published: (2022)
Evaluating Large Language Models in Theory of Mind Tasks
by: Kosinski, Michal
Published: (2023)
by: Kosinski, Michal
Published: (2023)
Secure On-Premise Deployment of Open-Weights Large Language Models in Radiology: An Isolation-First Architecture with Prospective Pilot Evaluation
by: Nowak, Sebastian, et al.
Published: (2026)
by: Nowak, Sebastian, et al.
Published: (2026)
"Dark Triad" Model Organisms of Misalignment: Narrow Fine-Tuning Mirrors Human Antisocial Behavior
by: Lulla, Roshni, et al.
Published: (2026)
by: Lulla, Roshni, et al.
Published: (2026)
Similar Items
-
On the Inevitability of Left-Leaning Political Bias in Aligned Language Models
by: Hagendorff, Thilo
Published: (2025) -
PRIDE -- Parameter-Efficient Reduction of Identity Discrimination for Equality in LLMs
by: Menke, Maluna, et al.
Published: (2025) -
Speciesism in AI: Evaluating Discrimination Against Animals in Large Language Models
by: Jotautaitė, Monika, et al.
Published: (2025) -
Compromising Honesty and Harmlessness in Language Models via Deception Attacks
by: Vaugrante, Laurène, et al.
Published: (2025) -
Deception Abilities Emerged in Large Language Models
by: Hagendorff, Thilo
Published: (2023)