Approximation of Log-Partition Function in Policy Mirror Descent Induces Implicit Regularization for LLM Post-Training

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Xu, Zhenghao, Lu, Qin, Yu, Changlong, Zhao, Tuo
Format: Preprint
Publié: 2026
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!