Making Bias Non-Predictive: Training Robust LLM Reasoning via Reinforcement Learning

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Wang, Qian, Zhao, Xuandong, Zhang, Zirui, Lou, Zhanzhi, Chen, Nuo, Song, Dawn, He, Bingsheng
Format: Preprint
Publié: 2026
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!