Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Gan, Siyuan, Liu, Jiaheng, Wang, Boyan, Yang, Tianpei, Miao, Runqing, Zhang, Yuyao, Meng, Fanyu, Feng, Junlan, Meng, Linjian, Huo, Jing, Gao, Yang
Format: Preprint
Veröffentlicht: 2026
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!