Dang, H., Lan, C., Wan, H., Zhao, X., & Lu, Y. (2026). Temperature as a Meta-Policy: Adaptive Temperature in LLM Reinforcement Learning.
Style de citation Chicago (17e éd.)Dang, Haoran, Cuiling Lan, Hai Wan, Xibin Zhao, et Yan Lu. Temperature as a Meta-Policy: Adaptive Temperature in LLM Reinforcement Learning. 2026.
Style de citation MLA (9e éd.)Dang, Haoran, et al. Temperature as a Meta-Policy: Adaptive Temperature in LLM Reinforcement Learning. 2026.
Attention : ces citations peuvent ne pas être correctes à 100%.