GHPO: Adaptive Guidance for Stable and Efficient LLM Reinforcement Learning

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Liu, Ziru, Gong, Cheng, Fu, Xinyu, Liu, Yaofang, Chen, Ran, Hu, Shoubo, Zhang, Suiyun, Liu, Rui, Zhang, Qingfu, Tu, Dandan
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!

Similar Items