Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Qiyuan, Xu, Hao, Chen, Xuhong, Chen, Wei, Teh, Yee Whye, Miao, Ning |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Verifier-Backed Hard Problem Generation for Mathematical Reasoning
di: Lai, Yuhang, et al.
Pubblicazione: (2026)
di: Lai, Yuhang, et al.
Pubblicazione: (2026)
L3Ms -- Lagrange Large Language Models
di: Dhillon, Guneet S., et al.
Pubblicazione: (2024)
di: Dhillon, Guneet S., et al.
Pubblicazione: (2024)
Prompting Strategies for Enabling Large Language Models to Infer Causation from Correlation
di: Sgouritsa, Eleni, et al.
Pubblicazione: (2024)
di: Sgouritsa, Eleni, et al.
Pubblicazione: (2024)
Online Adaptation of Language Models with a Memory of Amortized Contexts
di: Tack, Jihoon, et al.
Pubblicazione: (2024)
di: Tack, Jihoon, et al.
Pubblicazione: (2024)
Large Language Model-Enhanced Symbolic Reasoning for Knowledge Base Completion
di: He, Qiyuan, et al.
Pubblicazione: (2025)
di: He, Qiyuan, et al.
Pubblicazione: (2025)
Revisiting Dynamic Evaluation: Online Adaptation for Large Language Models
di: Rannen-Triki, Amal, et al.
Pubblicazione: (2024)
di: Rannen-Triki, Amal, et al.
Pubblicazione: (2024)
From Backward Spreading to Forward Replay: Revisiting Target Construction in LLM Parameter Editing
di: Liu, Wei, et al.
Pubblicazione: (2026)
di: Liu, Wei, et al.
Pubblicazione: (2026)
Efficient Safety Alignment of Large Language Models via Preference Re-ranking and Representation-based Reward Modeling
di: Deng, Qiyuan, et al.
Pubblicazione: (2025)
di: Deng, Qiyuan, et al.
Pubblicazione: (2025)
Linear Dynamics in the RLVR Training of Large Language Models
di: Wang, Tianle, et al.
Pubblicazione: (2026)
di: Wang, Tianle, et al.
Pubblicazione: (2026)
Learning to Contextualize Web Pages for Enhanced Decision Making by LLM Agents
di: Lee, Dongjun, et al.
Pubblicazione: (2025)
di: Lee, Dongjun, et al.
Pubblicazione: (2025)
Improving Data and Reward Design for Scientific Reasoning in Large Language Models
di: Chen, Zijie, et al.
Pubblicazione: (2026)
di: Chen, Zijie, et al.
Pubblicazione: (2026)
ReasonGRM: Enhancing Generative Reward Models through Large Reasoning Models
di: Chen, Bin, et al.
Pubblicazione: (2025)
di: Chen, Bin, et al.
Pubblicazione: (2025)
A Survey on Large Language Models for Mathematical Reasoning
di: Wang, Peng-Yuan, et al.
Pubblicazione: (2025)
di: Wang, Peng-Yuan, et al.
Pubblicazione: (2025)
Logical Reasoning in Large Language Models: A Survey
di: Liu, Hanmeng, et al.
Pubblicazione: (2025)
di: Liu, Hanmeng, et al.
Pubblicazione: (2025)
From Coarse to Fine: Benchmarking and Reward Modeling for Writing-Centric Generation Tasks
di: Ren, Qingyu, et al.
Pubblicazione: (2026)
di: Ren, Qingyu, et al.
Pubblicazione: (2026)
A Survey on Enhancing Causal Reasoning Ability of Large Language Models
di: Li, Xin, et al.
Pubblicazione: (2025)
di: Li, Xin, et al.
Pubblicazione: (2025)
A Survey of Efficient Reasoning for Large Reasoning Models: Language, Multimodality, and Beyond
di: Qu, Xiaoye, et al.
Pubblicazione: (2025)
di: Qu, Xiaoye, et al.
Pubblicazione: (2025)
AWPO: Enhancing Tool-Use of Large Language Models through Adaptive Integration of Reasoning Rewards
di: Lin, Zihan, et al.
Pubblicazione: (2025)
di: Lin, Zihan, et al.
Pubblicazione: (2025)
Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models
di: Xu, Fengli, et al.
Pubblicazione: (2025)
di: Xu, Fengli, et al.
Pubblicazione: (2025)
Generalist Reward Models: Found Inside Large Language Models
di: Li, Yi-Chen, et al.
Pubblicazione: (2025)
di: Li, Yi-Chen, et al.
Pubblicazione: (2025)
RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance
di: Chen, Tianlang, et al.
Pubblicazione: (2025)
di: Chen, Tianlang, et al.
Pubblicazione: (2025)
Collaborative Performance Prediction for Large Language Models
di: Zhang, Qiyuan, et al.
Pubblicazione: (2024)
di: Zhang, Qiyuan, et al.
Pubblicazione: (2024)
A Survey of Inductive Reasoning for Large Language Models
di: Chen, Kedi, et al.
Pubblicazione: (2025)
di: Chen, Kedi, et al.
Pubblicazione: (2025)
Towards Hierarchical Multi-Step Reward Models for Enhanced Reasoning in Large Language Models
di: Wang, Teng, et al.
Pubblicazione: (2025)
di: Wang, Teng, et al.
Pubblicazione: (2025)
Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models
di: Xu, Shilin, et al.
Pubblicazione: (2025)
di: Xu, Shilin, et al.
Pubblicazione: (2025)
Alleviating Hallucination in Large Vision-Language Models with Active Retrieval Augmentation
di: Qu, Xiaoye, et al.
Pubblicazione: (2024)
di: Qu, Xiaoye, et al.
Pubblicazione: (2024)
Fin-PRM: A Domain-Specialized Process Reward Model for Financial Reasoning in Large Language Models
di: Zhu, Jie, et al.
Pubblicazione: (2025)
di: Zhu, Jie, et al.
Pubblicazione: (2025)
Internalizing World Models via Self-Play Finetuning for Agentic RL
di: Chen, Shiqi, et al.
Pubblicazione: (2025)
di: Chen, Shiqi, et al.
Pubblicazione: (2025)
Can Large Language Models do Analytical Reasoning?
di: Hu, Yebowen, et al.
Pubblicazione: (2024)
di: Hu, Yebowen, et al.
Pubblicazione: (2024)
VRM: Teaching Reward Models to Understand Authentic Human Preferences
di: Liu, Biao, et al.
Pubblicazione: (2026)
di: Liu, Biao, et al.
Pubblicazione: (2026)
Enhancing Large Language Models for Mobility Analytics with Semantic Location Tokenization
di: Chen, Yile, et al.
Pubblicazione: (2025)
di: Chen, Yile, et al.
Pubblicazione: (2025)
Rich Semantic Knowledge Enhanced Large Language Models for Few-shot Chinese Spell Checking
di: Dong, Ming, et al.
Pubblicazione: (2024)
di: Dong, Ming, et al.
Pubblicazione: (2024)
Large Language Models for Generative Information Extraction: A Survey
di: Xu, Derong, et al.
Pubblicazione: (2023)
di: Xu, Derong, et al.
Pubblicazione: (2023)
Data Mixing for Large Language Models Pretraining: A Survey and Outlook
di: Chen, Zhuo, et al.
Pubblicazione: (2026)
di: Chen, Zhuo, et al.
Pubblicazione: (2026)
Uncertainty Quantification and Confidence Calibration in Large Language Models: A Survey
di: Liu, Xiaoou, et al.
Pubblicazione: (2025)
di: Liu, Xiaoou, et al.
Pubblicazione: (2025)
Code-Driven Inductive Synthesis: Enhancing Reasoning Abilities of Large Language Models with Sequences
di: Chen, Kedi, et al.
Pubblicazione: (2025)
di: Chen, Kedi, et al.
Pubblicazione: (2025)
Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models
di: Sui, Yang, et al.
Pubblicazione: (2025)
di: Sui, Yang, et al.
Pubblicazione: (2025)
Reward Reasoning Model
di: Guo, Jiaxin, et al.
Pubblicazione: (2025)
di: Guo, Jiaxin, et al.
Pubblicazione: (2025)
Sparse Reward Subsystem in Large Language Models
di: Xu, Guowei, et al.
Pubblicazione: (2026)
di: Xu, Guowei, et al.
Pubblicazione: (2026)
Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling
di: Chen, Qiyuan, et al.
Pubblicazione: (2026)
di: Chen, Qiyuan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Verifier-Backed Hard Problem Generation for Mathematical Reasoning
di: Lai, Yuhang, et al.
Pubblicazione: (2026) -
L3Ms -- Lagrange Large Language Models
di: Dhillon, Guneet S., et al.
Pubblicazione: (2024) -
Prompting Strategies for Enabling Large Language Models to Infer Causation from Correlation
di: Sgouritsa, Eleni, et al.
Pubblicazione: (2024) -
Online Adaptation of Language Models with a Memory of Amortized Contexts
di: Tack, Jihoon, et al.
Pubblicazione: (2024) -
Large Language Model-Enhanced Symbolic Reasoning for Knowledge Base Completion
di: He, Qiyuan, et al.
Pubblicazione: (2025)