Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Wu, Tianhao, Yuan, Weizhe, Golovneva, Olga, Xu, Jing, Tian, Yuandong, Jiao, Jiantao, Weston, Jason, Sukhbaatar, Sainbayar
Format: Preprint
Published: 2024
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!