Zhang, Z., Tang, Y., Zhang, J., Ma, L., & Sugiyama, M. (2026). Data-dependent Exploration for Online Reinforcement Learning from Human Feedback.
Chicago Style (17th ed.) CitationZhang, Zhen-Yu, Yuting Tang, Jiandong Zhang, Lanjihong Ma, and Masashi Sugiyama. Data-dependent Exploration for Online Reinforcement Learning from Human Feedback. 2026.
MLA (9th ed.) CitationZhang, Zhen-Yu, et al. Data-dependent Exploration for Online Reinforcement Learning from Human Feedback. 2026.
Warning: These citations may not always be 100% accurate.