Cita APA (7a ed.)

Mao, Y., Qu, Y., Wang, Q., Zou, H., & Ji, X. (2026). RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning.

Cita Chicago Style (17a ed.)

Mao, Yixiu, Yun Qu, Qi Wang, Heming Zou, y Xiangyang Ji. RLVR Without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning. 2026.

Cita MLA (9a ed.)

Mao, Yixiu, et al. RLVR Without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning. 2026.

Precaución: Estas citas no son 100% exactas.