CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Zhang, Zhen, Song, Kaiqiang, Wang, Xun, Hu, Yebowen, Yan, Weixiang, Zhao, Chenyang, Zou, Henry Peng, Deng, Haoyun, Indurthi, Sathish Reddy, Liu, Shujian, Ma, Simin, Wang, Xiaoyang, Wang, Xin Eric, Wang, Song
Natura: Preprint
Pubblicazione: 2026
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!