Policy Split: Incentivizing Dual-Mode Exploration in LLM Reinforcement with Dual-Mode Entropy Regularization

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Yao, Jiashu, Huang, Heyan, Luo, Chuwei, Wu, Daiqing, Liu, Zeming, Guo, Yuhang, Kang, Yangyang
Format: Preprint
Published: 2026
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!