Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Tu, Songjun, Lin, Jiahao, Tian, Xiangyu, Zhang, Qichao, Li, Linjing, Fu, Yuqian, Xu, Nan, He, Wei, Lan, Xiangyuan, Jiang, Dongmei, Zhao, Dongbin
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!

Documenti analoghi