Understanding and Mitigating Over-refusal for Large Language Models via Safety Representation

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Zhang, Junbo, Chen, Ran, Zhou, Qianli, Deng, Xinyang, Jiang, Wen
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!