AWPO: Enhancing Tool-Use of Large Language Models through Adaptive Integration of Reasoning Rewards

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Lin, Zihan, Wang, Xiaohan, Yang, Hexiong, Chai, Jiajun, Cao, Jie, Yin, Guojun, Lin, Wei, He, Ran
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!