Huo, Y., Wang, C., Zhu, Z., Xing, S., Feng, P., Liu, T., . . . Xiao, T. (2026). SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models.
Chicago-Zitierstil (17. Ausg.)Huo, Yifu, et al. SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models. 2026.
MLA-Zitierstil (9. Ausg.)Huo, Yifu, et al. SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models. 2026.
Achtung: Diese Zitate sind unter Umständen nicht zu 100% korrekt.