Adaptive Reinforcement for Open-ended Medical Reasoning via Semantic-Guided Reward Collapse Mitigation

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Liu, Yizhou, Yang, Dingkang, Chen, Zizhi, Han, Minghao, Zhang, Xukun, Liu, Keliang, Wei, Jingwei, Zhang, Lihua
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!