Wang, T., Li, S., & Lu, W. (2024). Self-Training with Direct Preference Optimization Improves Chain-of-Thought Reasoning.
Style de citation Chicago (17e éd.)Wang, Tianduo, Shichen Li, et Wei Lu. Self-Training with Direct Preference Optimization Improves Chain-of-Thought Reasoning. 2024.
Style de citation MLA (9e éd.)Wang, Tianduo, et al. Self-Training with Direct Preference Optimization Improves Chain-of-Thought Reasoning. 2024.
Attention : ces citations peuvent ne pas être correctes à 100%.