EAPO: Entropy-Driven Adaptive Positive-Negative Sample Weighting for Policy Optimization in Open-Ended QA

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Zeng, Yunsheng, Li, Gen, Miao, Yuwei, Li, Xiandong, Wang, Yujin, Chen, Siyu, Wang, Luning, Qiao, Yunhao, Wang, Junfeng, Lv, Jianwei, Yuan, Bo
Natura: Preprint
Pubblicazione: 2026
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!