Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Tajwar, Fahim, Singh, Anikait, Sharma, Archit, Rafailov, Rafael, Schneider, Jeff, Xie, Tengyang, Ermon, Stefano, Finn, Chelsea, Kumar, Aviral
Natura: Preprint
Pubblicazione: 2024
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!