Learn the Ropes, Then Trust the Wins: Self-imitation with Progressive Exploration for Agentic Reinforcement Learning

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Qin, Yulei, Tan, Xiaoyu, He, Zhengbao, Li, Gang, Lin, Haojia, Li, Zongyi, Xu, Zihan, Shi, Yuchen, Cai, Siqi, Rui, Renting, Cai, Shaofei, Cai, Yuzheng, Zhang, Xuan, Ye, Sheng, Li, Ke, Sun, Xing
Format: Preprint
Veröffentlicht: 2025
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!