SDGO: Self-Discrimination-Guided Optimization for Consistent Safety in Large Language Models

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Ding, Peng, Sun, Wen, Li, Dailin, Zou, Wei, Wang, Jiaming, Chen, Jiajun, Huang, Shujian
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!