From Prompt Risk to Response Risk: Paired Analysis of Safety Behavior of Large Language Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Hu, Mengya, Wei, Qiong, Atluri, Sandeep |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mitigating Gambling-Like Risk-Taking Behaviors in Large Language Models: A Behavioral Economics Approach to AI Safety
di: Du, Y.
Pubblicazione: (2025)
di: Du, Y.
Pubblicazione: (2025)
Prompt Risk Control: A Rigorous Framework for Responsible Deployment of Large Language Models
di: Zollo, Thomas P., et al.
Pubblicazione: (2023)
di: Zollo, Thomas P., et al.
Pubblicazione: (2023)
Position: Editing Large Language Models Poses Serious Safety Risks
di: Youssef, Paul, et al.
Pubblicazione: (2025)
di: Youssef, Paul, et al.
Pubblicazione: (2025)
Uncovering Safety Risks of Large Language Models through Concept Activation Vector
di: Xu, Zhihao, et al.
Pubblicazione: (2024)
di: Xu, Zhihao, et al.
Pubblicazione: (2024)
Risk and Response in Large Language Models: Evaluating Key Threat Categories
di: Harandizadeh, Bahareh, et al.
Pubblicazione: (2024)
di: Harandizadeh, Bahareh, et al.
Pubblicazione: (2024)
SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models
di: Vidgen, Bertie, et al.
Pubblicazione: (2023)
di: Vidgen, Bertie, et al.
Pubblicazione: (2023)
Ensuring Safety and Trust: Analyzing the Risks of Large Language Models in Medicine
di: Yang, Yifan, et al.
Pubblicazione: (2024)
di: Yang, Yifan, et al.
Pubblicazione: (2024)
KZ-SafetyPrompts: A Kazakh Safety Evaluation Prompt Dataset for Large Language Models
di: Zaghouani, Wajdi, et al.
Pubblicazione: (2026)
di: Zaghouani, Wajdi, et al.
Pubblicazione: (2026)
DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models
di: Liu, Jianyu, et al.
Pubblicazione: (2025)
di: Liu, Jianyu, et al.
Pubblicazione: (2025)
From Token to Token Pair: Efficient Prompt Compression for Large Language Models in Clinical Prediction
di: Zhu, Mingcheng, et al.
Pubblicazione: (2026)
di: Zhu, Mingcheng, et al.
Pubblicazione: (2026)
Steering Risk Preferences in Large Language Models by Aligning Behavioral and Neural Representations
di: Zhu, Jian-Qiao, et al.
Pubblicazione: (2025)
di: Zhu, Jian-Qiao, et al.
Pubblicazione: (2025)
Surgical Action Planning with Large Language Models
di: Xu, Mengya, et al.
Pubblicazione: (2025)
di: Xu, Mengya, et al.
Pubblicazione: (2025)
A Survey of Theory of Mind in Large Language Models: Evaluations, Representations, and Safety Risks
di: Nguyen, Hieu Minh "Jord"
Pubblicazione: (2025)
di: Nguyen, Hieu Minh "Jord"
Pubblicazione: (2025)
When Choices Become Risks: Safety Failures of Large Language Models under Multiple-Choice Constraints
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
Analyzing the Safety of Japanese Large Language Models in Stereotype-Triggering Prompts
di: Nakanishi, Akito, et al.
Pubblicazione: (2025)
di: Nakanishi, Akito, et al.
Pubblicazione: (2025)
Reducing Large Language Model Safety Risks in Women's Health using Semantic Entropy
di: Penny-Dimri, Jahan C., et al.
Pubblicazione: (2025)
di: Penny-Dimri, Jahan C., et al.
Pubblicazione: (2025)
Multi-expert Prompting Improves Reliability, Safety, and Usefulness of Large Language Models
di: Long, Do Xuan, et al.
Pubblicazione: (2024)
di: Long, Do Xuan, et al.
Pubblicazione: (2024)
Evaluating Proactive Risk Awareness of Large Language Models
di: Luo, Xuan, et al.
Pubblicazione: (2026)
di: Luo, Xuan, et al.
Pubblicazione: (2026)
A Security Risk Taxonomy for Prompt-Based Interaction With Large Language Models
di: Derner, Erik, et al.
Pubblicazione: (2023)
di: Derner, Erik, et al.
Pubblicazione: (2023)
Improving Minimum Bayes Risk Decoding with Multi-Prompt
di: Heineman, David, et al.
Pubblicazione: (2024)
di: Heineman, David, et al.
Pubblicazione: (2024)
Risk-Averse Finetuning of Large Language Models
di: Chaudhary, Sapana, et al.
Pubblicazione: (2025)
di: Chaudhary, Sapana, et al.
Pubblicazione: (2025)
Risks of Cultural Erasure in Large Language Models
di: Qadri, Rida, et al.
Pubblicazione: (2025)
di: Qadri, Rida, et al.
Pubblicazione: (2025)
Dynamic Compressing Prompts for Efficient Inference of Large Language Models
di: Hu, Jinwu, et al.
Pubblicazione: (2025)
di: Hu, Jinwu, et al.
Pubblicazione: (2025)
Mitigating the Risk of Health Inequity Exacerbated by Large Language Models
di: Ji, Yuelyu, et al.
Pubblicazione: (2024)
di: Ji, Yuelyu, et al.
Pubblicazione: (2024)
PromptBridge: Cross-Model Prompt Transfer for Large Language Models
di: Wang, Yaxuan, et al.
Pubblicazione: (2025)
di: Wang, Yaxuan, et al.
Pubblicazione: (2025)
Scaling Behavior of Machine Translation with Large Language Models under Prompt Injection Attacks
di: Sun, Zhifan, et al.
Pubblicazione: (2024)
di: Sun, Zhifan, et al.
Pubblicazione: (2024)
Causal Prompting for Implicit Sentiment Analysis with Large Language Models
di: Ren, Jing, et al.
Pubblicazione: (2025)
di: Ren, Jing, et al.
Pubblicazione: (2025)
Behavioral Analysis of Information Salience in Large Language Models
di: Trienes, Jan, et al.
Pubblicazione: (2025)
di: Trienes, Jan, et al.
Pubblicazione: (2025)
SafetyPrompts: a Systematic Review of Open Datasets for Evaluating and Improving Large Language Model Safety
di: Röttger, Paul, et al.
Pubblicazione: (2024)
di: Röttger, Paul, et al.
Pubblicazione: (2024)
Persona-Conditioned Risk Behavior in Large Language Models: A Simulated Gambling Study with GPT-4.1
di: Dubedy, Sankalp
Pubblicazione: (2026)
di: Dubedy, Sankalp
Pubblicazione: (2026)
Benchmarking Political Persuasion Risks Across Frontier Large Language Models
di: Chen, Zhongren, et al.
Pubblicazione: (2026)
di: Chen, Zhongren, et al.
Pubblicazione: (2026)
Understanding the Relationship between Prompts and Response Uncertainty in Large Language Models
di: Zhang, Ze Yu, et al.
Pubblicazione: (2024)
di: Zhang, Ze Yu, et al.
Pubblicazione: (2024)
Language-Agnostic Suicidal Risk Detection Using Large Language Models
di: Kim, June-Woo, et al.
Pubblicazione: (2025)
di: Kim, June-Woo, et al.
Pubblicazione: (2025)
Beyond Words: On Large Language Models Actionability in Mission-Critical Risk Analysis
di: Esposito, Matteo, et al.
Pubblicazione: (2024)
di: Esposito, Matteo, et al.
Pubblicazione: (2024)
Safety-Tuned LLaMAs: Lessons From Improving the Safety of Large Language Models that Follow Instructions
di: Bianchi, Federico, et al.
Pubblicazione: (2023)
di: Bianchi, Federico, et al.
Pubblicazione: (2023)
SafetyBench: Evaluating the Safety of Large Language Models
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
Mixture-of-Instructions: Aligning Large Language Models via Mixture Prompting
di: Xu, Bowen, et al.
Pubblicazione: (2024)
di: Xu, Bowen, et al.
Pubblicazione: (2024)
AURA: Affordance-Understanding and Risk-aware Alignment Technique for Large Language Models
di: Adak, Sayantan, et al.
Pubblicazione: (2025)
di: Adak, Sayantan, et al.
Pubblicazione: (2025)
GAF-Guard: An Agentic Framework for Risk Management and Governance in Large Language Models
di: Tirupathi, Seshu, et al.
Pubblicazione: (2025)
di: Tirupathi, Seshu, et al.
Pubblicazione: (2025)
The Cost of Thinking: Increased Jailbreak Risk in Large Language Models
di: Yang, Fan
Pubblicazione: (2025)
di: Yang, Fan
Pubblicazione: (2025)
Documenti analoghi
-
Mitigating Gambling-Like Risk-Taking Behaviors in Large Language Models: A Behavioral Economics Approach to AI Safety
di: Du, Y.
Pubblicazione: (2025) -
Prompt Risk Control: A Rigorous Framework for Responsible Deployment of Large Language Models
di: Zollo, Thomas P., et al.
Pubblicazione: (2023) -
Position: Editing Large Language Models Poses Serious Safety Risks
di: Youssef, Paul, et al.
Pubblicazione: (2025) -
Uncovering Safety Risks of Large Language Models through Concept Activation Vector
di: Xu, Zhihao, et al.
Pubblicazione: (2024) -
Risk and Response in Large Language Models: Evaluating Key Threat Categories
di: Harandizadeh, Bahareh, et al.
Pubblicazione: (2024)