Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Karlekar, Sweta, Zheng, Carolina, Saebo, Magnus, Beltran-Velez, Nicolas, Yu, Shuyang, Bowlan, John, Kucer, Michal, Blei, David
Format: Preprint
Publié: 2026
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!