Questionnaire Responses Do not Capture the Safety of AI Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hellrigel-Holderbaum, Max, Young, Edward James |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Against racing to AGI: Cooperation, deterrence, and catastrophic risks
par: Dung, Leonard, et autres
Publié: (2025)
par: Dung, Leonard, et autres
Publié: (2025)
Misalignment or misuse? The AGI alignment tradeoff
par: Hellrigel-Holderbaum, Max, et autres
Publié: (2025)
par: Hellrigel-Holderbaum, Max, et autres
Publié: (2025)
Safetywashing: Do AI Safety Benchmarks Actually Measure Safety Progress?
par: Ren, Richard, et autres
Publié: (2024)
par: Ren, Richard, et autres
Publié: (2024)
EmoAgent: Assessing and Safeguarding Human-AI Interaction for Mental Health Safety
par: Qiu, Jiahao, et autres
Publié: (2025)
par: Qiu, Jiahao, et autres
Publié: (2025)
IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures
par: Gringras, David
Publié: (2026)
par: Gringras, David
Publié: (2026)
Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey
par: Dong, Zhichen, et autres
Publié: (2024)
par: Dong, Zhichen, et autres
Publié: (2024)
Foundational Challenges in Assuring Alignment and Safety of Large Language Models
par: Anwar, Usman, et autres
Publié: (2024)
par: Anwar, Usman, et autres
Publié: (2024)
Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness
par: Shayegani, Erfan, et autres
Publié: (2025)
par: Shayegani, Erfan, et autres
Publié: (2025)
When Style Breaks Safety: Defending LLMs Against Superficial Style Alignment
par: Xiao, Yuxin, et autres
Publié: (2025)
par: Xiao, Yuxin, et autres
Publié: (2025)
Reducing Large Language Model Safety Risks in Women's Health using Semantic Entropy
par: Penny-Dimri, Jahan C., et autres
Publié: (2025)
par: Penny-Dimri, Jahan C., et autres
Publié: (2025)
Why Do Safety Guardrails Degrade Across Languages?
par: Zhang, Max, et autres
Publié: (2026)
par: Zhang, Max, et autres
Publié: (2026)
AI-AI Bias: large language models favor communications generated by large language models
par: Laurito, Walter, et autres
Publié: (2024)
par: Laurito, Walter, et autres
Publié: (2024)
Beyond Accuracy: Rethinking Hallucination and Regulatory Response in Generative AI
par: Li, Zihao, et autres
Publié: (2025)
par: Li, Zihao, et autres
Publié: (2025)
Language Agents as Digital Representatives in Collective Decision-Making
par: Jarrett, Daniel, et autres
Publié: (2025)
par: Jarrett, Daniel, et autres
Publié: (2025)
Retrieval Improvements Do Not Guarantee Better Answers: A Study of RAG for AI Policy QA
par: Mathur, Saahil, et autres
Publié: (2026)
par: Mathur, Saahil, et autres
Publié: (2026)
Do Large Language Models Walk Their Talk? Measuring the Gap Between Implicit Associations, Self-Report, and Behavioral Altruism
par: Andric, Sandro
Publié: (2025)
par: Andric, Sandro
Publié: (2025)
BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses
par: Xu, Xin, et autres
Publié: (2025)
par: Xu, Xin, et autres
Publié: (2025)
How malicious AI swarms can threaten democracy: The fusion of agentic AI and LLMs marks a new frontier in information warfare
par: Schroeder, Daniel Thilo, et autres
Publié: (2025)
par: Schroeder, Daniel Thilo, et autres
Publié: (2025)
A Behavioural and Representational Evaluation of Goal-Directedness in Language Model Agents
par: Arghal, Raghu, et autres
Publié: (2026)
par: Arghal, Raghu, et autres
Publié: (2026)
Prompt-Counterfactual Explanations for Generative AI System Behavior
par: Goethals, Sofie, et autres
Publié: (2026)
par: Goethals, Sofie, et autres
Publié: (2026)
Understanding and Mitigating Risks of Generative AI in Financial Services
par: Gehrmann, Sebastian, et autres
Publié: (2025)
par: Gehrmann, Sebastian, et autres
Publié: (2025)
Managing extreme AI risks amid rapid progress
par: Bengio, Yoshua, et autres
Publié: (2023)
par: Bengio, Yoshua, et autres
Publié: (2023)
Risks of AI Scientists: Prioritizing Safeguarding Over Autonomy
par: Tang, Xiangru, et autres
Publié: (2024)
par: Tang, Xiangru, et autres
Publié: (2024)
Know Thyself? On the Incapability and Implications of AI Self-Recognition
par: Bai, Xiaoyan, et autres
Publié: (2025)
par: Bai, Xiaoyan, et autres
Publié: (2025)
How Prevalent is Gender Bias in ChatGPT? -- Exploring German and English ChatGPT Responses
par: Urchs, Stefanie, et autres
Publié: (2023)
par: Urchs, Stefanie, et autres
Publié: (2023)
Rigor in AI: Doing Rigorous AI Work Requires a Broader, Responsible AI-Informed Conception of Rigor
par: Olteanu, Alexandra, et autres
Publié: (2025)
par: Olteanu, Alexandra, et autres
Publié: (2025)
AI Sandbagging: Language Models can Strategically Underperform on Evaluations
par: van der Weij, Teun, et autres
Publié: (2024)
par: van der Weij, Teun, et autres
Publié: (2024)
Standardizing Intelligence: Aligning Generative AI for Regulatory and Operational Compliance
par: Imperial, Joseph Marvin, et autres
Publié: (2025)
par: Imperial, Joseph Marvin, et autres
Publié: (2025)
The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems
par: Ren, Richard, et autres
Publié: (2025)
par: Ren, Richard, et autres
Publié: (2025)
Impacts of Racial Bias in Historical Training Data for News AI
par: Bhargava, Rahul, et autres
Publié: (2025)
par: Bhargava, Rahul, et autres
Publié: (2025)
Large Language Models as Urban Residents: An LLM Agent Framework for Personal Mobility Generation
par: Wang, Jiawei, et autres
Publié: (2024)
par: Wang, Jiawei, et autres
Publié: (2024)
AI-University: An LLM-based platform for instructional alignment to scientific classrooms
par: Shojaei, Mostafa Faghih, et autres
Publié: (2025)
par: Shojaei, Mostafa Faghih, et autres
Publié: (2025)
AI-Augmented Predictions: LLM Assistants Improve Human Forecasting Accuracy
par: Schoenegger, Philipp, et autres
Publié: (2024)
par: Schoenegger, Philipp, et autres
Publié: (2024)
Towards AI-$45^{\circ}$ Law: A Roadmap to Trustworthy AGI
par: Yang, Chao, et autres
Publié: (2024)
par: Yang, Chao, et autres
Publié: (2024)
Frontier AI systems have surpassed the self-replicating red line
par: Pan, Xudong, et autres
Publié: (2024)
par: Pan, Xudong, et autres
Publié: (2024)
The Compliance Gap: Why AI Systems Promise to Follow Process Instructions but Don't
par: Shin, Kwan Soo
Publié: (2026)
par: Shin, Kwan Soo
Publié: (2026)
Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models
par: Zhang, Yue, et autres
Publié: (2023)
par: Zhang, Yue, et autres
Publié: (2023)
Whose Preferences? Differences in Fairness Preferences and Their Impact on the Fairness of AI Utilizing Human Feedback
par: Lerner, Emilia Agis, et autres
Publié: (2024)
par: Lerner, Emilia Agis, et autres
Publié: (2024)
Empowering Bengali Education with AI: Solving Bengali Math Word Problems through Transformer Models
par: Era, Jalisha Jashim, et autres
Publié: (2025)
par: Era, Jalisha Jashim, et autres
Publié: (2025)
Future of Work with AI Agents: Auditing Automation and Augmentation Potential across the U.S. Workforce
par: Shao, Yijia, et autres
Publié: (2025)
par: Shao, Yijia, et autres
Publié: (2025)
Documents similaires
-
Against racing to AGI: Cooperation, deterrence, and catastrophic risks
par: Dung, Leonard, et autres
Publié: (2025) -
Misalignment or misuse? The AGI alignment tradeoff
par: Hellrigel-Holderbaum, Max, et autres
Publié: (2025) -
Safetywashing: Do AI Safety Benchmarks Actually Measure Safety Progress?
par: Ren, Richard, et autres
Publié: (2024) -
EmoAgent: Assessing and Safeguarding Human-AI Interaction for Mental Health Safety
par: Qiu, Jiahao, et autres
Publié: (2025) -
IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures
par: Gringras, David
Publié: (2026)