Yi, H., Li, Q., Hu, Y., Zhang, F., Zhang, D., & Liu, Y. (2025). SPPD: Self-training with Process Preference Learning Using Dynamic Value Margin.
Cita Chicago Style (17a ed.)Yi, Hao, Qingyang Li, Yulan Hu, Fuzheng Zhang, Di Zhang, y Yong Liu. SPPD: Self-training with Process Preference Learning Using Dynamic Value Margin. 2025.
Cita MLA (9a ed.)Yi, Hao, et al. SPPD: Self-training with Process Preference Learning Using Dynamic Value Margin. 2025.
Precaución: Estas citas no son 100% exactas.