Risk and Response in Large Language Models: Evaluating Key Threat Categories
Fuente:
arXiv
Saved in:
| Main Authors: | Harandizadeh, Bahareh, Salinas, Abel, Morstatter, Fred |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
The Butterfly Effect of Altering Prompts: How Small Changes and Jailbreaks Affect Large Language Model Performance
by: Salinas, Abel, et al.
Published: (2024)
by: Salinas, Abel, et al.
Published: (2024)
Knowledge Graph Analysis of Legal Understanding and Violations in LLMs
by: Jha, Abha, et al.
Published: (2025)
by: Jha, Abha, et al.
Published: (2025)
The Unequal Opportunities of Large Language Models: Revealing Demographic Bias through Job Recommendations
by: Salinas, Abel, et al.
Published: (2023)
by: Salinas, Abel, et al.
Published: (2023)
Harmful Speech Detection by Language Models Exhibits Gender-Queer Dialect Bias
by: Dorn, Rebecca, et al.
Published: (2024)
by: Dorn, Rebecca, et al.
Published: (2024)
Do Methods to Jailbreak and Defend LLMs Generalize Across Languages?
by: Atil, Berk, et al.
Published: (2025)
by: Atil, Berk, et al.
Published: (2025)
"Define Your Terms" : Enhancing Efficient Offensive Speech Classification with Definition
by: Nghiem, Huy, et al.
Published: (2024)
by: Nghiem, Huy, et al.
Published: (2024)
The Curious Case of Nonverbal Abstract Reasoning with Multi-Modal Large Language Models
by: Ahrabian, Kian, et al.
Published: (2024)
by: Ahrabian, Kian, et al.
Published: (2024)
Offset Unlearning for Large Language Models
by: Huang, James Y., et al.
Published: (2024)
by: Huang, James Y., et al.
Published: (2024)
Contextualizing Argument Quality Assessment with Relevant Knowledge
by: Deshpande, Darshan, et al.
Published: (2023)
by: Deshpande, Darshan, et al.
Published: (2023)
The Shrinking Landscape of Linguistic Diversity in the Age of Large Language Models
by: Sourati, Zhivar, et al.
Published: (2025)
by: Sourati, Zhivar, et al.
Published: (2025)
Estimating Causal Effects of Text Interventions Leveraging LLMs
by: Guo, Siyi, et al.
Published: (2024)
by: Guo, Siyi, et al.
Published: (2024)
From Generation to Collaboration: Using LLMs to Edit for Empathy in Healthcare
by: Luo, Man, et al.
Published: (2026)
by: Luo, Man, et al.
Published: (2026)
Large Language Models for Explainable Threat Intelligence
by: Dinis, Tiago, et al.
Published: (2025)
by: Dinis, Tiago, et al.
Published: (2025)
Evaluating Proactive Risk Awareness of Large Language Models
by: Luo, Xuan, et al.
Published: (2026)
by: Luo, Xuan, et al.
Published: (2026)
From Prompt Risk to Response Risk: Paired Analysis of Safety Behavior of Large Language Model
by: Hu, Mengya, et al.
Published: (2026)
by: Hu, Mengya, et al.
Published: (2026)
Capturing Perspectives of Crowdsourced Annotators in Subjective Learning Tasks
by: Mokhberian, Negar, et al.
Published: (2023)
by: Mokhberian, Negar, et al.
Published: (2023)
Don't Blame the Data, Blame the Model: Understanding Noise and Bias When Learning from Subjective Annotations
by: Anand, Abhishek, et al.
Published: (2024)
by: Anand, Abhishek, et al.
Published: (2024)
Patience Is The Key to Large Language Model Reasoning
by: Yu, Yijiong
Published: (2024)
by: Yu, Yijiong
Published: (2024)
Citation: A Key to Building Responsible and Accountable Large Language Models
by: Huang, Jie, et al.
Published: (2023)
by: Huang, Jie, et al.
Published: (2023)
CyberThreat-Eval: Can Large Language Models Automate Real-World Threat Research?
by: Chen, Xiangsen, et al.
Published: (2026)
by: Chen, Xiangsen, et al.
Published: (2026)
Evaluating Nuanced Bias in Large Language Model Free Response Answers
by: Healey, Jennifer, et al.
Published: (2024)
by: Healey, Jennifer, et al.
Published: (2024)
Resource Consumption Threats in Large Language Models
by: Zhang, Yuanhe, et al.
Published: (2026)
by: Zhang, Yuanhe, et al.
Published: (2026)
Overconfidence is Key: Verbalized Uncertainty Evaluation in Large Language and Vision-Language Models
by: Groot, Tobias, et al.
Published: (2024)
by: Groot, Tobias, et al.
Published: (2024)
Generalized Category Discovery with Large Language Models in the Loop
by: An, Wenbin, et al.
Published: (2023)
by: An, Wenbin, et al.
Published: (2023)
Evaluating Large Language Models' Responses to Sexual and Reproductive Health Queries in Nepali
by: Sharma, Medha, et al.
Published: (2026)
by: Sharma, Medha, et al.
Published: (2026)
Basic Category Usage in Vision Language Models
by: Sawyer, Hunter, et al.
Published: (2025)
by: Sawyer, Hunter, et al.
Published: (2025)
Language-Specific Neurons: The Key to Multilingual Capabilities in Large Language Models
by: Tang, Tianyi, et al.
Published: (2024)
by: Tang, Tianyi, et al.
Published: (2024)
Large Language Models and Forensic Linguistics: Navigating Opportunities and Threats in the Age of Generative AI
by: Mikros, George
Published: (2025)
by: Mikros, George
Published: (2025)
Secret Keepers: The Impact of LLMs on Linguistic Markers of Personal Traits
by: Sourati, Zhivar, et al.
Published: (2024)
by: Sourati, Zhivar, et al.
Published: (2024)
Towards Inference-time Category-wise Safety Steering for Large Language Models
by: Bhattacharjee, Amrita, et al.
Published: (2024)
by: Bhattacharjee, Amrita, et al.
Published: (2024)
Probing the Category of Verbal Aspect in Transformer Language Models
by: Katinskaia, Anisia, et al.
Published: (2024)
by: Katinskaia, Anisia, et al.
Published: (2024)
Cross-Lingual Response Consistency in Large Language Models: An ILR-Informed Evaluation of Claude Across Six Languages
by: Baluta, Camelia
Published: (2026)
by: Baluta, Camelia
Published: (2026)
The Ability of Large Language Models to Evaluate Constraint-satisfaction in Agent Responses to Open-ended Requests
by: Madmoni, Lior, et al.
Published: (2024)
by: Madmoni, Lior, et al.
Published: (2024)
Questioning the Survey Responses of Large Language Models
by: Dominguez-Olmedo, Ricardo, et al.
Published: (2023)
by: Dominguez-Olmedo, Ricardo, et al.
Published: (2023)
Large Language Models Can Self-Correct with Key Condition Verification
by: Wu, Zhenyu, et al.
Published: (2024)
by: Wu, Zhenyu, et al.
Published: (2024)
Reinforcing Stereotypes of Anger: Emotion AI on African American Vernacular English
by: Dorn, Rebecca, et al.
Published: (2025)
by: Dorn, Rebecca, et al.
Published: (2025)
CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models
by: Shi, Ling, et al.
Published: (2024)
by: Shi, Ling, et al.
Published: (2024)
News Recommendation with Category Description by a Large Language Model
by: Yada, Yuki, et al.
Published: (2024)
by: Yada, Yuki, et al.
Published: (2024)
Evaluating Large Language Models with Psychometrics
by: Li, Yuan, et al.
Published: (2024)
by: Li, Yuan, et al.
Published: (2024)
RCScore: Quantifying Response Consistency in Large Language Models
by: Jang, Dongjun, et al.
Published: (2025)
by: Jang, Dongjun, et al.
Published: (2025)
Similar Items
-
The Butterfly Effect of Altering Prompts: How Small Changes and Jailbreaks Affect Large Language Model Performance
by: Salinas, Abel, et al.
Published: (2024) -
Knowledge Graph Analysis of Legal Understanding and Violations in LLMs
by: Jha, Abha, et al.
Published: (2025) -
The Unequal Opportunities of Large Language Models: Revealing Demographic Bias through Job Recommendations
by: Salinas, Abel, et al.
Published: (2023) -
Harmful Speech Detection by Language Models Exhibits Gender-Queer Dialect Bias
by: Dorn, Rebecca, et al.
Published: (2024) -
Do Methods to Jailbreak and Defend LLMs Generalize Across Languages?
by: Atil, Berk, et al.
Published: (2025)