Ren, T., Jiang, J., Yang, H., Tian, W., Zou, M., Li, G., . . . Peng, Y. (2025). RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training.
Chicago-Zitierstil (17. Ausg.)Ren, Tao, et al. RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training. 2025.
MLA-Zitierstil (9. Ausg.)Ren, Tao, et al. RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training. 2025.
Achtung: Diese Zitate sind unter Umständen nicht zu 100% korrekt.