KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Xu, Hongling, Zhu, Qi, Deng, Heyuan, Li, Jinpeng, Hou, Lu, Wang, Yasheng, Shang, Lifeng, Xu, Ruifeng, Mi, Fei
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!