TriPlay-RL: Tri-Role Self-Play Reinforcement Learning for LLM Safety Alignment

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Tan, Zhewen, Yu, Wenhan, Si, Jianfeng, Liu, Tongxin, Guan, Kaiqi, Jin, Huiyan, Tao, Jiawen, Yuan, Xiaokun, Ma, Duohe, Zhang, Xiangzheng, Yang, Tong, Sun, Lin
Formato: Preprint
Publicado: 2026
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!