Wang, H., Cui, H., Zhang, C., Liu, X., Jin, S., Geng, S., . . . Sun, Y. (2026). T$^2$PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement Learning.
Chicago-Zitierstil (17. Ausg.)Wang, Haixin, et al. T$^2$PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement Learning. 2026.
MLA-Zitierstil (9. Ausg.)Wang, Haixin, et al. T$^2$PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement Learning. 2026.
Achtung: Diese Zitate sind unter Umständen nicht zu 100% korrekt.