Dong, D., Chen, J., Jia, H., Wu, J., Di, H., Liu, J., . . . Wang, H. (2026). PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning.
Cita Chicago Style (17a ed.)Dong, Daize, et al. PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning. 2026.
Cita MLA (9a ed.)Dong, Daize, et al. PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning. 2026.
Precaución: Estas citas no son 100% exactas.