He, S., Xia, T., Zhou, X., & Wei, H. (2025). Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective.
Cita Chicago Style (17a ed.)He, Shenghua, Tian Xia, Xuan Zhou, y Hui Wei. Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective. 2025.
Cita MLA (9a ed.)He, Shenghua, et al. Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective. 2025.
Precaución: Estas citas no son 100% exactas.