Mao, Y., Qu, Y., Wang, Q., Zou, H., & Ji, X. (2026). RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning.
Cita Chicago Style (17a ed.)Mao, Yixiu, Yun Qu, Qi Wang, Heming Zou, y Xiangyang Ji. RLVR Without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning. 2026.
Cita MLA (9a ed.)Mao, Yixiu, et al. RLVR Without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning. 2026.
Precaución: Estas citas no son 100% exactas.