SafetyPrompts: a Systematic Review of Open Datasets for Evaluating and Improving Large Language Model Safety
Fuente:
arXiv
Salvato in:
| Autori principali: | Röttger, Paul, Pernisi, Fabio, Vidgen, Bertie, Hovy, Dirk |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models
di: Röttger, Paul, et al.
Pubblicazione: (2023)
di: Röttger, Paul, et al.
Pubblicazione: (2023)
Compromesso! Italian Many-Shot Jailbreaks Undermine the Safety of Large Language Models
di: Pernisi, Fabio, et al.
Pubblicazione: (2024)
di: Pernisi, Fabio, et al.
Pubblicazione: (2024)
The Pluralistic Moral Gap: Understanding Judgment and Value Differences between Humans and Large Language Models
di: Russo, Giuseppe, et al.
Pubblicazione: (2025)
di: Russo, Giuseppe, et al.
Pubblicazione: (2025)
KZ-SafetyPrompts: A Kazakh Safety Evaluation Prompt Dataset for Large Language Models
di: Zaghouani, Wajdi, et al.
Pubblicazione: (2026)
di: Zaghouani, Wajdi, et al.
Pubblicazione: (2026)
SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models
di: Vidgen, Bertie, et al.
Pubblicazione: (2023)
di: Vidgen, Bertie, et al.
Pubblicazione: (2023)
Political Compass or Spinning Arrow? Towards More Meaningful Evaluations for Values and Opinions in Large Language Models
di: Röttger, Paul, et al.
Pubblicazione: (2024)
di: Röttger, Paul, et al.
Pubblicazione: (2024)
SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors
di: Hu, Tiancheng, et al.
Pubblicazione: (2025)
di: Hu, Tiancheng, et al.
Pubblicazione: (2025)
Classification is a RAG problem: A case study on hate speech detection
di: Willats, Richard, et al.
Pubblicazione: (2025)
di: Willats, Richard, et al.
Pubblicazione: (2025)
Do Prompts Reshape Representations? An Empirical Study of Prompting Effects on Embeddings
di: Gonzalez-Gutierrez, Cesar, et al.
Pubblicazione: (2025)
di: Gonzalez-Gutierrez, Cesar, et al.
Pubblicazione: (2025)
WorkBench: a Benchmark Dataset for Agents in a Realistic Workplace Setting
di: Styles, Olly, et al.
Pubblicazione: (2024)
di: Styles, Olly, et al.
Pubblicazione: (2024)
Evaluating the Elementary Multilingual Capabilities of Large Language Models with MultiQ
di: Holtermann, Carolin, et al.
Pubblicazione: (2024)
di: Holtermann, Carolin, et al.
Pubblicazione: (2024)
Large Language Model Hacking: Quantifying the Hidden Risks of Using LLMs for Text Annotation
di: Baumann, Joachim, et al.
Pubblicazione: (2025)
di: Baumann, Joachim, et al.
Pubblicazione: (2025)
Beyond Flesch-Kincaid: Prompt-based Metrics Improve Difficulty Classification of Educational Texts
di: Rooein, Donya, et al.
Pubblicazione: (2024)
di: Rooein, Donya, et al.
Pubblicazione: (2024)
LongSafety: Evaluating Long-Context Safety of Large Language Models
di: Lu, Yida, et al.
Pubblicazione: (2025)
di: Lu, Yida, et al.
Pubblicazione: (2025)
LMUnit: Fine-grained Evaluation with Natural Language Unit Tests
di: Saad-Falcon, Jon, et al.
Pubblicazione: (2024)
di: Saad-Falcon, Jon, et al.
Pubblicazione: (2024)
Evaluating Psychological Safety of Large Language Models
di: Li, Xingxuan, et al.
Pubblicazione: (2022)
di: Li, Xingxuan, et al.
Pubblicazione: (2022)
SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models
di: Torres-Fonseca, Josue, et al.
Pubblicazione: (2026)
di: Torres-Fonseca, Josue, et al.
Pubblicazione: (2026)
Towards Safety Evaluations of Theory of Mind in Large Language Models
di: Aoshima, Tatsuhiro, et al.
Pubblicazione: (2025)
di: Aoshima, Tatsuhiro, et al.
Pubblicazione: (2025)
A Systematic Review of Open Datasets Used in Text-to-Image (T2I) Gen AI Model Safety
di: Rouf, Rakeen, et al.
Pubblicazione: (2025)
di: Rouf, Rakeen, et al.
Pubblicazione: (2025)
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
di: Zong, Xuanjun, et al.
Pubblicazione: (2025)
di: Zong, Xuanjun, et al.
Pubblicazione: (2025)
Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
di: Alssum, Lama, et al.
Pubblicazione: (2025)
di: Alssum, Lama, et al.
Pubblicazione: (2025)
Improving Large Language Model Safety with Contrastive Representation Learning
di: Simko, Samuel, et al.
Pubblicazione: (2025)
di: Simko, Samuel, et al.
Pubblicazione: (2025)
Measuring Pragmatic Influence in Large Language Model Instructions
di: Geng, Yilin, et al.
Pubblicazione: (2026)
di: Geng, Yilin, et al.
Pubblicazione: (2026)
Evaluating Prompting Strategies and Large Language Models in Systematic Literature Review Screening: Relevance and Task-Stage Classification
di: Han, Binglan, et al.
Pubblicazione: (2025)
di: Han, Binglan, et al.
Pubblicazione: (2025)
WalledEval: A Comprehensive Safety Evaluation Toolkit for Large Language Models
di: Gupta, Prannaya, et al.
Pubblicazione: (2024)
di: Gupta, Prannaya, et al.
Pubblicazione: (2024)
Impoverished Language Technology: The Lack of (Social) Class in NLP
di: Curry, Amanda Cercas, et al.
Pubblicazione: (2024)
di: Curry, Amanda Cercas, et al.
Pubblicazione: (2024)
PATS: Personality-Aware Teaching Strategies with Large Language Model Tutors
di: Rooein, Donya, et al.
Pubblicazione: (2026)
di: Rooein, Donya, et al.
Pubblicazione: (2026)
CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models
di: Zhang, Wenjing, et al.
Pubblicazione: (2024)
di: Zhang, Wenjing, et al.
Pubblicazione: (2024)
All Languages Matter: On the Multilingual Safety of Large Language Models
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
di: Tan, Yingshui, et al.
Pubblicazione: (2024)
di: Tan, Yingshui, et al.
Pubblicazione: (2024)
CoSafe: Evaluating Large Language Model Safety in Multi-Turn Dialogue Coreference
di: Yu, Erxin, et al.
Pubblicazione: (2024)
di: Yu, Erxin, et al.
Pubblicazione: (2024)
A Survey of Theory of Mind in Large Language Models: Evaluations, Representations, and Safety Risks
di: Nguyen, Hieu Minh "Jord"
Pubblicazione: (2025)
di: Nguyen, Hieu Minh "Jord"
Pubblicazione: (2025)
Safety-Aware Fine-Tuning of Large Language Models
di: Choi, Hyeong Kyu, et al.
Pubblicazione: (2024)
di: Choi, Hyeong Kyu, et al.
Pubblicazione: (2024)
Large Language Model Safety: A Holistic Survey
di: Shi, Dan, et al.
Pubblicazione: (2024)
di: Shi, Dan, et al.
Pubblicazione: (2024)
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
di: Liu, Zheyuan, et al.
Pubblicazione: (2026)
di: Liu, Zheyuan, et al.
Pubblicazione: (2026)
Towards Context-Invariant Safety Alignment for Large Language Models
di: Wang, Yixu, et al.
Pubblicazione: (2026)
di: Wang, Yixu, et al.
Pubblicazione: (2026)
Precision Knowledge Editing: Enhancing Safety in Large Language Models
di: Li, Xuying, et al.
Pubblicazione: (2024)
di: Li, Xuying, et al.
Pubblicazione: (2024)
SteeringSafety: A Systematic Safety Evaluation Framework of Representation Steering in LLMs
di: Siu, Vincent, et al.
Pubblicazione: (2025)
di: Siu, Vincent, et al.
Pubblicazione: (2025)
Can Reasoning Help Large Language Models Capture Human Annotator Disagreement?
di: Ni, Jingwei, et al.
Pubblicazione: (2025)
di: Ni, Jingwei, et al.
Pubblicazione: (2025)
The AI Consumer Index (ACE)
di: Benchek, Julien, et al.
Pubblicazione: (2025)
di: Benchek, Julien, et al.
Pubblicazione: (2025)
Documenti analoghi
-
XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models
di: Röttger, Paul, et al.
Pubblicazione: (2023) -
Compromesso! Italian Many-Shot Jailbreaks Undermine the Safety of Large Language Models
di: Pernisi, Fabio, et al.
Pubblicazione: (2024) -
The Pluralistic Moral Gap: Understanding Judgment and Value Differences between Humans and Large Language Models
di: Russo, Giuseppe, et al.
Pubblicazione: (2025) -
KZ-SafetyPrompts: A Kazakh Safety Evaluation Prompt Dataset for Large Language Models
di: Zaghouani, Wajdi, et al.
Pubblicazione: (2026) -
SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models
di: Vidgen, Bertie, et al.
Pubblicazione: (2023)