Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Mukherjee, Subhojyoti, Lai, Viet Dac, Addanki, Raghavendra, Rossi, Ryan, Yoon, Seunghyun, Bui, Trung, Rao, Anup, Subramanian, Jayakumar, Kveton, Branislav
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!