Evaluating Proactive Risk Awareness of Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Luo, Xuan, Chen, Yubin, Hou, Zhiyu, Yu, Linpu, Tu, Geng, Li, Jing, Xu, Ruifeng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
BAIT: Boundary-Guided Disclosure Escalation via Self-Conditioned Reasoning
von: Luo, Xuan, et al.
Veröffentlicht: (2026)
von: Luo, Xuan, et al.
Veröffentlicht: (2026)
A Comprehensive Survey on the Trustworthiness of Large Language Models in Healthcare
von: Aljohani, Manar, et al.
Veröffentlicht: (2025)
von: Aljohani, Manar, et al.
Veröffentlicht: (2025)
Evaluating Large Language Models on Spatial Tasks: A Multi-Task Benchmarking Study
von: Xu, Liuchang, et al.
Veröffentlicht: (2024)
von: Xu, Liuchang, et al.
Veröffentlicht: (2024)
Benchmarking Political Persuasion Risks Across Frontier Large Language Models
von: Chen, Zhongren, et al.
Veröffentlicht: (2026)
von: Chen, Zhongren, et al.
Veröffentlicht: (2026)
CBT-Bench: Evaluating Large Language Models on Assisting Cognitive Behavior Therapy
von: Zhang, Mian, et al.
Veröffentlicht: (2024)
von: Zhang, Mian, et al.
Veröffentlicht: (2024)
Analyzing the Safety of Japanese Large Language Models in Stereotype-Triggering Prompts
von: Nakanishi, Akito, et al.
Veröffentlicht: (2025)
von: Nakanishi, Akito, et al.
Veröffentlicht: (2025)
Advancing Conversational Psychotherapy: Integrating Privacy, Dual-Memory, and Domain Expertise with Large Language Models
von: Zhang, XiuYu, et al.
Veröffentlicht: (2024)
von: Zhang, XiuYu, et al.
Veröffentlicht: (2024)
Sentient Agent as a Judge: Evaluating Higher-Order Social Cognition in Large Language Models
von: Zhang, Bang, et al.
Veröffentlicht: (2025)
von: Zhang, Bang, et al.
Veröffentlicht: (2025)
Cancer-Myth: Evaluating Large Language Models on Patient Questions with False Presuppositions
von: Zhu, Wang Bill, et al.
Veröffentlicht: (2025)
von: Zhu, Wang Bill, et al.
Veröffentlicht: (2025)
Evaluation Awareness in Language Models Has Limited Effect on Behaviour
von: Knecht, Amelie, et al.
Veröffentlicht: (2026)
von: Knecht, Amelie, et al.
Veröffentlicht: (2026)
Urban Computing in the Era of Large Language Models
von: Li, Zhonghang, et al.
Veröffentlicht: (2025)
von: Li, Zhonghang, et al.
Veröffentlicht: (2025)
A Framework to Assess the Persuasion Risks Large Language Model Chatbots Pose to Democratic Societies
von: Chen, Zhongren, et al.
Veröffentlicht: (2025)
von: Chen, Zhongren, et al.
Veröffentlicht: (2025)
A Simple and Efficient Jailbreak Method Exploiting LLMs' Helpfulness
von: Luo, Xuan, et al.
Veröffentlicht: (2025)
von: Luo, Xuan, et al.
Veröffentlicht: (2025)
Extrinsic Evaluation of Cultural Competence in Large Language Models
von: Bhatt, Shaily, et al.
Veröffentlicht: (2024)
von: Bhatt, Shaily, et al.
Veröffentlicht: (2024)
Evaluating Psychological Safety of Large Language Models
von: Li, Xingxuan, et al.
Veröffentlicht: (2022)
von: Li, Xingxuan, et al.
Veröffentlicht: (2022)
Language of Thought Shapes Output Diversity in Large Language Models
von: Xu, Shaoyang, et al.
Veröffentlicht: (2026)
von: Xu, Shaoyang, et al.
Veröffentlicht: (2026)
ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios
von: Wei, Shou'ang, et al.
Veröffentlicht: (2025)
von: Wei, Shou'ang, et al.
Veröffentlicht: (2025)
Navigating the Risks of Using Large Language Models for Text Annotation in Social Science Research
von: Lin, Hao, et al.
Veröffentlicht: (2025)
von: Lin, Hao, et al.
Veröffentlicht: (2025)
Bias and Volatility: A Statistical Framework for Evaluating Large Language Model's Stereotypes and the Associated Generation Inconsistency
von: Liu, Yiran, et al.
Veröffentlicht: (2024)
von: Liu, Yiran, et al.
Veröffentlicht: (2024)
Speciesism in AI: Evaluating Discrimination Against Animals in Large Language Models
von: Jotautaitė, Monika, et al.
Veröffentlicht: (2025)
von: Jotautaitė, Monika, et al.
Veröffentlicht: (2025)
Evaluating open-source Large Language Models for automated fact-checking
von: Fontana, Nicolo', et al.
Veröffentlicht: (2025)
von: Fontana, Nicolo', et al.
Veröffentlicht: (2025)
Large Language Models as Misleading Assistants in Conversation
von: Hou, Betty Li, et al.
Veröffentlicht: (2024)
von: Hou, Betty Li, et al.
Veröffentlicht: (2024)
What do Large Language Models Say About Animals? Investigating Risks of Animal Harm in Generated Text
von: Kanepajs, Arturs, et al.
Veröffentlicht: (2025)
von: Kanepajs, Arturs, et al.
Veröffentlicht: (2025)
Not All Jokes Land: Evaluating Large Language Models Understanding of Workplace Humor
von: Shafiei, Mohammadamin, et al.
Veröffentlicht: (2025)
von: Shafiei, Mohammadamin, et al.
Veröffentlicht: (2025)
Leveraging Large Language Models for Actionable Course Evaluation Student Feedback to Lecturers
von: Zhang, Mike, et al.
Veröffentlicht: (2024)
von: Zhang, Mike, et al.
Veröffentlicht: (2024)
Characterizing Bias: Benchmarking Large Language Models in Simplified versus Traditional Chinese
von: Lyu, Hanjia, et al.
Veröffentlicht: (2025)
von: Lyu, Hanjia, et al.
Veröffentlicht: (2025)
JiraiBench: A Bilingual Benchmark for Evaluating Large Language Models' Detection of Human Self-Destructive Behavior Content in Jirai Community
von: Xiao, Yunze, et al.
Veröffentlicht: (2025)
von: Xiao, Yunze, et al.
Veröffentlicht: (2025)
Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation
von: Mukherjee, Arka, et al.
Veröffentlicht: (2025)
von: Mukherjee, Arka, et al.
Veröffentlicht: (2025)
Human-Level and Beyond: Benchmarking Large Language Models Against Clinical Pharmacists in Prescription Review
von: Yang, Yan, et al.
Veröffentlicht: (2025)
von: Yang, Yan, et al.
Veröffentlicht: (2025)
Towards Evaluating Proactive Risk Awareness of Multimodal Language Models
von: Yuan, Youliang, et al.
Veröffentlicht: (2025)
von: Yuan, Youliang, et al.
Veröffentlicht: (2025)
AI Safety in Generative AI Large Language Models: A Survey
von: Chua, Jaymari, et al.
Veröffentlicht: (2024)
von: Chua, Jaymari, et al.
Veröffentlicht: (2024)
Ensuring Safety and Trust: Analyzing the Risks of Large Language Models in Medicine
von: Yang, Yifan, et al.
Veröffentlicht: (2024)
von: Yang, Yifan, et al.
Veröffentlicht: (2024)
Is Self-knowledge and Action Consistent or Not: Investigating Large Language Model's Personality
von: Ai, Yiming, et al.
Veröffentlicht: (2024)
von: Ai, Yiming, et al.
Veröffentlicht: (2024)
Evaluating Large Language Models for Detecting Antisemitism
von: Patel, Jay, et al.
Veröffentlicht: (2025)
von: Patel, Jay, et al.
Veröffentlicht: (2025)
Large Language Models for Education: A Survey
von: Xu, Hanyi, et al.
Veröffentlicht: (2024)
von: Xu, Hanyi, et al.
Veröffentlicht: (2024)
On Classification with Large Language Models in Cultural Analytics
von: Bamman, David, et al.
Veröffentlicht: (2024)
von: Bamman, David, et al.
Veröffentlicht: (2024)
WorldValuesBench: A Large-Scale Benchmark Dataset for Multi-Cultural Value Awareness of Language Models
von: Zhao, Wenlong, et al.
Veröffentlicht: (2024)
von: Zhao, Wenlong, et al.
Veröffentlicht: (2024)
Collapsed Language Models Promote Fairness
von: Xu, Jingxuan, et al.
Veröffentlicht: (2024)
von: Xu, Jingxuan, et al.
Veröffentlicht: (2024)
Evaluation of Large Language Models in Legal Applications: Challenges, Methods, and Future Directions
von: Hu, Yiran, et al.
Veröffentlicht: (2026)
von: Hu, Yiran, et al.
Veröffentlicht: (2026)
Evaluating Large Language Models in Theory of Mind Tasks
von: Kosinski, Michal
Veröffentlicht: (2023)
von: Kosinski, Michal
Veröffentlicht: (2023)
Ähnliche Einträge
-
BAIT: Boundary-Guided Disclosure Escalation via Self-Conditioned Reasoning
von: Luo, Xuan, et al.
Veröffentlicht: (2026) -
A Comprehensive Survey on the Trustworthiness of Large Language Models in Healthcare
von: Aljohani, Manar, et al.
Veröffentlicht: (2025) -
Evaluating Large Language Models on Spatial Tasks: A Multi-Task Benchmarking Study
von: Xu, Liuchang, et al.
Veröffentlicht: (2024) -
Benchmarking Political Persuasion Risks Across Frontier Large Language Models
von: Chen, Zhongren, et al.
Veröffentlicht: (2026) -
CBT-Bench: Evaluating Large Language Models on Assisting Cognitive Behavior Therapy
von: Zhang, Mian, et al.
Veröffentlicht: (2024)