Wang, L., Wang, Y., Yu, X., Zhang, K., Peng, T., & Wu, W. (2026). TAMTRL: Teacher-Aligned Reward Reshaping for Multi-Turn Reinforcement Learning in Long-Context Compression.
Chicago-Zitierstil (17. Ausg.)Wang, Li, Yandong Wang, Xin Yu, Kui Zhang, Tianhao Peng, und Wenjun Wu. TAMTRL: Teacher-Aligned Reward Reshaping for Multi-Turn Reinforcement Learning in Long-Context Compression. 2026.
MLA-Zitierstil (9. Ausg.)Wang, Li, et al. TAMTRL: Teacher-Aligned Reward Reshaping for Multi-Turn Reinforcement Learning in Long-Context Compression. 2026.
Achtung: Diese Zitate sind unter Umständen nicht zu 100% korrekt.