Learn the Ropes, Then Trust the Wins: Self-imitation with Progressive Exploration for Agentic Reinforcement Learning

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Qin, Yulei, Tan, Xiaoyu, He, Zhengbao, Li, Gang, Lin, Haojia, Li, Zongyi, Xu, Zihan, Shi, Yuchen, Cai, Siqi, Rui, Renting, Cai, Shaofei, Cai, Yuzheng, Zhang, Xuan, Ye, Sheng, Li, Ke, Sun, Xing
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!