Style de citation APA (7e éd.)

Wang, T., Li, S., & Lu, W. (2024). Self-Training with Direct Preference Optimization Improves Chain-of-Thought Reasoning.

Style de citation Chicago (17e éd.)

Wang, Tianduo, Shichen Li, et Wei Lu. Self-Training with Direct Preference Optimization Improves Chain-of-Thought Reasoning. 2024.

Style de citation MLA (9e éd.)

Wang, Tianduo, et al. Self-Training with Direct Preference Optimization Improves Chain-of-Thought Reasoning. 2024.

Attention : ces citations peuvent ne pas être correctes à 100%.