Stop Rewarding Hallucinated Steps: Faithfulness-Aware Step-Level Reinforcement Learning for Small Reasoning Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Nie, Shuo, Deng, Hexuan, Wang, Chao, Fang, Ruiyu, Liu, Xuebo, Song, Shuangyong, Li, Yu, Zhang, Min, Li, Xuelong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning
di: Deng, Hexuan, et al.
Pubblicazione: (2025)
di: Deng, Hexuan, et al.
Pubblicazione: (2025)
FaithRL: Learning to Reason Faithfully through Step-Level Faithfulness Maximization
di: Gui, Runquan, et al.
Pubblicazione: (2026)
di: Gui, Runquan, et al.
Pubblicazione: (2026)
RouterKGQA: Specialized--General Model Routing for Constraint-Aware Knowledge Graph Question Answering
di: Yuan, Bo, et al.
Pubblicazione: (2026)
di: Yuan, Bo, et al.
Pubblicazione: (2026)
MR-UIE: Multi-Perspective Reasoning with Reinforcement Learning for Universal Information Extraction
di: Li, Zhongqiu, et al.
Pubblicazione: (2025)
di: Li, Zhongqiu, et al.
Pubblicazione: (2025)
Rewarding What Matters: Step-by-Step Reinforcement Learning for Task-Oriented Dialogue
di: Du, Huifang, et al.
Pubblicazione: (2024)
di: Du, Huifang, et al.
Pubblicazione: (2024)
Big-Stop Semantics: Small-Step Semantics in a Big-Step Judgment
di: Kahn, David M, et al.
Pubblicazione: (2025)
di: Kahn, David M, et al.
Pubblicazione: (2025)
GroundedPRM: Tree-Guided and Fidelity-Aware Process Reward Modeling for Step-Level Reasoning
di: Zhang, Yao, et al.
Pubblicazione: (2025)
di: Zhang, Yao, et al.
Pubblicazione: (2025)
Dynamic Sampling that Adapts: Self-Aware Iterative Data Persistent Optimization for Mathematical Reasoning
di: Rao, Jun, et al.
Pubblicazione: (2025)
di: Rao, Jun, et al.
Pubblicazione: (2025)
Agentic Reinforcement Learning with Implicit Step Rewards
di: Liu, Xiaoqian, et al.
Pubblicazione: (2025)
di: Liu, Xiaoqian, et al.
Pubblicazione: (2025)
Introducing Visual Scenes and Reasoning: A More Realistic Benchmark for Spoken Language Understanding
di: Wu, Di, et al.
Pubblicazione: (2025)
di: Wu, Di, et al.
Pubblicazione: (2025)
StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning
di: Wang, Daoyu, et al.
Pubblicazione: (2026)
di: Wang, Daoyu, et al.
Pubblicazione: (2026)
Emotional Support with LLM-based Empathetic Dialogue Generation
di: Wang, Shiquan, et al.
Pubblicazione: (2025)
di: Wang, Shiquan, et al.
Pubblicazione: (2025)
D-QRELO: Training- and Data-Free Delta Compression for Large Language Models via Quantization and Residual Low-Rank Approximation
di: Li, Junlin, et al.
Pubblicazione: (2026)
di: Li, Junlin, et al.
Pubblicazione: (2026)
UniARM: Towards a Unified Autoregressive Reward Model for Multi-Objective Test-Time Alignment
di: Xie, Hongyan, et al.
Pubblicazione: (2026)
di: Xie, Hongyan, et al.
Pubblicazione: (2026)
Prompt-Level Reward Specifications for Open-Ended Post-Training
di: Weng, Zijun, et al.
Pubblicazione: (2026)
di: Weng, Zijun, et al.
Pubblicazione: (2026)
Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments
di: Li, Haoyuan, et al.
Pubblicazione: (2026)
di: Li, Haoyuan, et al.
Pubblicazione: (2026)
RB-SQL: A Retrieval-based LLM Framework for Text-to-SQL
di: Wu, Zhenhe, et al.
Pubblicazione: (2024)
di: Wu, Zhenhe, et al.
Pubblicazione: (2024)
R3-RAG: Learning Step-by-Step Reasoning and Retrieval for LLMs via Reinforcement Learning
di: Li, Yuan, et al.
Pubblicazione: (2025)
di: Li, Yuan, et al.
Pubblicazione: (2025)
Hierarchical Reinforcement Learning with Augmented Step-Level Transitions for LLM Agents
di: Zhen, Shuai, et al.
Pubblicazione: (2026)
di: Zhen, Shuai, et al.
Pubblicazione: (2026)
NewTerm: Benchmarking Real-Time New Terms for Large Language Models with Annual Updates
di: Deng, Hexuan, et al.
Pubblicazione: (2024)
di: Deng, Hexuan, et al.
Pubblicazione: (2024)
DRPruning: Efficient Large Language Model Pruning through Distributionally Robust Optimization
di: Deng, Hexuan, et al.
Pubblicazione: (2024)
di: Deng, Hexuan, et al.
Pubblicazione: (2024)
Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning
di: Samarinas, Chris, et al.
Pubblicazione: (2026)
di: Samarinas, Chris, et al.
Pubblicazione: (2026)
Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards
di: Yoon, Deokgyu, et al.
Pubblicazione: (2026)
di: Yoon, Deokgyu, et al.
Pubblicazione: (2026)
Measuring Chain of Thought Faithfulness by Unlearning Reasoning Steps
di: Tutek, Martin, et al.
Pubblicazione: (2025)
di: Tutek, Martin, et al.
Pubblicazione: (2025)
Dynamic Knowledge Fusion for Multi-Domain Dialogue State Tracking
di: Su, Haoxiang, et al.
Pubblicazione: (2026)
di: Su, Haoxiang, et al.
Pubblicazione: (2026)
AQuilt: Weaving Logic and Self-Inspection into Low-Cost, High-Relevance Data Synthesis for Specialist LLMs
di: Ke, Xiaopeng, et al.
Pubblicazione: (2025)
di: Ke, Xiaopeng, et al.
Pubblicazione: (2025)
Awakening Dormant Experts:Counterfactual Routing to Mitigate MoE Hallucinations
di: Hu, Wentao, et al.
Pubblicazione: (2026)
di: Hu, Wentao, et al.
Pubblicazione: (2026)
Step Guided Reasoning: Improving Mathematical Reasoning using Guidance Generation and Step Reasoning
di: Cao, Lang, et al.
Pubblicazione: (2024)
di: Cao, Lang, et al.
Pubblicazione: (2024)
StepTool: Enhancing Multi-Step Tool Usage in LLMs via Step-Grained Reinforcement Learning
di: Yu, Yuanqing, et al.
Pubblicazione: (2024)
di: Yu, Yuanqing, et al.
Pubblicazione: (2024)
Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoning
di: Xu, Huimin, et al.
Pubblicazione: (2025)
di: Xu, Huimin, et al.
Pubblicazione: (2025)
IG-Search: Step-Level Information Gain Rewards for Search-Augmented Reasoning
di: Liang, Zihan, et al.
Pubblicazione: (2026)
di: Liang, Zihan, et al.
Pubblicazione: (2026)
Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization
di: Zhang, Tao, et al.
Pubblicazione: (2025)
di: Zhang, Tao, et al.
Pubblicazione: (2025)
StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning
di: Zhang, Yanfei, et al.
Pubblicazione: (2026)
di: Zhang, Yanfei, et al.
Pubblicazione: (2026)
What Are Step-Level Reward Models Rewarding? Counterintuitive Findings from MCTS-Boosted Mathematical Reasoning
di: Ma, Yiran, et al.
Pubblicazione: (2024)
di: Ma, Yiran, et al.
Pubblicazione: (2024)
Step-wise Rubric Rewards for LLM Reasoning
di: Xie, Weichu, et al.
Pubblicazione: (2026)
di: Xie, Weichu, et al.
Pubblicazione: (2026)
Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning
di: Deng, Yihe, et al.
Pubblicazione: (2025)
di: Deng, Yihe, et al.
Pubblicazione: (2025)
Watch Every Step! LLM Agent Learning via Iterative Step-Level Process Refinement
di: Xiong, Weimin, et al.
Pubblicazione: (2024)
di: Xiong, Weimin, et al.
Pubblicazione: (2024)
TCNN: Triple Convolutional Neural Network Models for Retrieval-based Question Answering System in E-commerce
di: Song, Shuangyong, et al.
Pubblicazione: (2020)
di: Song, Shuangyong, et al.
Pubblicazione: (2020)
TRACES: Tagging Reasoning Steps for Adaptive Cost-Efficient Early-Stopping
di: Belkhiter, Yannis, et al.
Pubblicazione: (2026)
di: Belkhiter, Yannis, et al.
Pubblicazione: (2026)
CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use
di: Zhang, Zhen, et al.
Pubblicazione: (2026)
di: Zhang, Zhen, et al.
Pubblicazione: (2026)
Documenti analoghi
-
REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning
di: Deng, Hexuan, et al.
Pubblicazione: (2025) -
FaithRL: Learning to Reason Faithfully through Step-Level Faithfulness Maximization
di: Gui, Runquan, et al.
Pubblicazione: (2026) -
RouterKGQA: Specialized--General Model Routing for Constraint-Aware Knowledge Graph Question Answering
di: Yuan, Bo, et al.
Pubblicazione: (2026) -
MR-UIE: Multi-Perspective Reasoning with Reinforcement Learning for Universal Information Extraction
di: Li, Zhongqiu, et al.
Pubblicazione: (2025) -
Rewarding What Matters: Step-by-Step Reinforcement Learning for Task-Oriented Dialogue
di: Du, Huifang, et al.
Pubblicazione: (2024)