Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: An, Bang, Zhu, Sicheng, Zhang, Ruiyi, Panaitescu-Liess, Michael-Andrei, Xu, Yuancheng, Huang, Furong
Formato: Preprint
Publicado: 2024
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!