Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Tu, Songjun, Lin, Jiahao, Zhang, Qichao, Tian, Xiangyu, Li, Linjing, Lan, Xiangyuan, Zhao, Dongbin
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!