TLPO: Token-Level Policy Optimization for Mitigating Language Confusion in Large Language Models

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Choo, Jinho, Lee, JunSeung, Kim, Jimyeong, Song, Yeeho, Hong, S. K., Kwon, Yeong-Dae
Formato: Preprint
Publicado: 2026
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!