Policy Split: Incentivizing Dual-Mode Exploration in LLM Reinforcement with Dual-Mode Entropy Regularization

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Yao, Jiashu, Huang, Heyan, Luo, Chuwei, Wu, Daiqing, Liu, Zeming, Guo, Yuhang, Kang, Yangyang
Natura: Preprint
Pubblicazione: 2026
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!