Zeng, X., Chen, Y., Liu, L., Luo, C., Chen, Y., & Zhuang, Z. (2025). Teaching LLM to be Persuasive: Reward-Enhanced Policy Optimization for Alignment from Heterogeneous Rewards.
Cita Chicago Style (17a ed.)Zeng, Xia, Yihan Chen, Luhui Liu, Chao Luo, Ye Chen, y Zhuoran Zhuang. Teaching LLM to Be Persuasive: Reward-Enhanced Policy Optimization for Alignment from Heterogeneous Rewards. 2025.
Cita MLA (9a ed.)Zeng, Xia, et al. Teaching LLM to Be Persuasive: Reward-Enhanced Policy Optimization for Alignment from Heterogeneous Rewards. 2025.
Precaución: Estas citas no son 100% exactas.