Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Yao, Jiarui, Hao, Yifan, Zhang, Hanning, Dong, Hanze, Xiong, Wei, Jiang, Nan, Zhang, Tong
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!