Stop Rewarding Hallucinated Steps: Faithfulness-Aware Step-Level Reinforcement Learning for Small Reasoning Models

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Nie, Shuo, Deng, Hexuan, Wang, Chao, Fang, Ruiyu, Liu, Xuebo, Song, Shuangyong, Li, Yu, Zhang, Min, Li, Xuelong
Natura: Preprint
Pubblicazione: 2026
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!

Documenti analoghi