RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Ren, Tao, Jiang, Jinyang, Yang, Hui, Tian, Wan, Zou, Minhao, Li, Guanghao, Zhang, Zishi, Wang, Qinghao, Qin, Shentao, Zhao, Yanjun, Tao, Rui, Shao, Hui, Peng, Yijie
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!

Ejemplares similares