Zhang, Y., Lin, X., & Wu, C. (2026). StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning.
Cita Chicago Style (17a ed.)Zhang, Yanfei, Xu Lin, y Chenglin Wu. StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning. 2026.
Cita MLA (9a ed.)Zhang, Yanfei, et al. StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning. 2026.
Precaución: Estas citas no son 100% exactas.