Wang, Z. (2026). GRPO and Reflection Reward for Mathematical Reasoning in Large Language Models.
Cita Chicago Style (17a ed.)Wang, Zhijie. GRPO and Reflection Reward for Mathematical Reasoning in Large Language Models. 2026.
Cita MLA (9a ed.)Wang, Zhijie. GRPO and Reflection Reward for Mathematical Reasoning in Large Language Models. 2026.
Precaución: Estas citas no son 100% exactas.