Yu, S., Li, L., Zhao, W., & Yang, Z. (2026). ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models.
Cita Chicago Style (17a ed.)Yu, Song, Li Li, Wenwen Zhao, y Zhisheng Yang. ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models. 2026.
Cita MLA (9a ed.)Yu, Song, et al. ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models. 2026.
Precaución: Estas citas no son 100% exactas.