RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Dong, Yihong, Jiang, Xue, Tao, Yongding, Liu, Huanyu, Zhang, Kechi, Mou, Lili, Cao, Rongyu, Ma, Yingwei, Chen, Jue, Li, Binhua, Jin, Zhi, Huang, Fei, Li, Yongbin, Li, Ge
Format: Preprint
Veröffentlicht: 2025
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!