Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Wang, Shenzhi, Yu, Le, Gao, Chang, Zheng, Chujie, Liu, Shixuan, Lu, Rui, Dang, Kai, Chen, Xionghui, Yang, Jianxin, Zhang, Zhenru, Liu, Yuqiong, Yang, An, Zhao, Andrew, Yue, Yang, Song, Shiji, Yu, Bowen, Huang, Gao, Lin, Junyang
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!