Reward Models Identify Consistency, Not Causality
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xu, Yuhui, Dong, Hanze, Wang, Lei, Xiong, Caiming, Li, Junnan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Scalable Chain of Thoughts via Elastic Reasoning
von: Xu, Yuhui, et al.
Veröffentlicht: (2025)
von: Xu, Yuhui, et al.
Veröffentlicht: (2025)
Fractured Chain-of-Thought Reasoning
von: Liao, Baohao, et al.
Veröffentlicht: (2025)
von: Liao, Baohao, et al.
Veröffentlicht: (2025)
A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce
von: Xiong, Wei, et al.
Veröffentlicht: (2025)
von: Xiong, Wei, et al.
Veröffentlicht: (2025)
Reward-Guided Speculative Decoding for Efficient LLM Reasoning
von: Liao, Baohao, et al.
Veröffentlicht: (2025)
von: Liao, Baohao, et al.
Veröffentlicht: (2025)
RLHF Workflow: From Reward Modeling to Online RLHF
von: Dong, Hanze, et al.
Veröffentlicht: (2024)
von: Dong, Hanze, et al.
Veröffentlicht: (2024)
Automatic Curriculum Expert Iteration for Reliable LLM Reasoning
von: Zhao, Zirui, et al.
Veröffentlicht: (2024)
von: Zhao, Zirui, et al.
Veröffentlicht: (2024)
Self-Hinting Language Models Enhance Reinforcement Learning
von: Liao, Baohao, et al.
Veröffentlicht: (2026)
von: Liao, Baohao, et al.
Veröffentlicht: (2026)
CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks
von: Wang, Hao, et al.
Veröffentlicht: (2026)
von: Wang, Hao, et al.
Veröffentlicht: (2026)
ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training
von: Liang, Yu, et al.
Veröffentlicht: (2026)
von: Liang, Yu, et al.
Veröffentlicht: (2026)
ThinK: Thinner Key Cache by Query-Driven Pruning
von: Xu, Yuhui, et al.
Veröffentlicht: (2024)
von: Xu, Yuhui, et al.
Veröffentlicht: (2024)
Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL
von: Yao, Jiarui, et al.
Veröffentlicht: (2025)
von: Yao, Jiarui, et al.
Veröffentlicht: (2025)
Reinforce-Ada: An Adaptive Sampling Framework under Non-linear RL Objectives
von: Xiong, Wei, et al.
Veröffentlicht: (2025)
von: Xiong, Wei, et al.
Veröffentlicht: (2025)
Inference-Time Scaling for Generalist Reward Modeling
von: Liu, Zijun, et al.
Veröffentlicht: (2025)
von: Liu, Zijun, et al.
Veröffentlicht: (2025)
AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning
von: Wang, Tevin, et al.
Veröffentlicht: (2025)
von: Wang, Tevin, et al.
Veröffentlicht: (2025)
Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math
von: Pandit, Shrey, et al.
Veröffentlicht: (2025)
von: Pandit, Shrey, et al.
Veröffentlicht: (2025)
RewardAnything: Generalizable Principle-Following Reward Models
von: Yu, Zhuohao, et al.
Veröffentlicht: (2025)
von: Yu, Zhuohao, et al.
Veröffentlicht: (2025)
Adaptive Segment-level Reward: Bridging the Gap Between Action and Reward Space in Alignment
von: Li, Yanshi, et al.
Veröffentlicht: (2024)
von: Li, Yanshi, et al.
Veröffentlicht: (2024)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
von: Wang, Huaijie, et al.
Veröffentlicht: (2024)
von: Wang, Huaijie, et al.
Veröffentlicht: (2024)
Language Models are Hidden Reasoners: Unlocking Latent Reasoning Capabilities via Self-Rewarding
von: Chen, Haolin, et al.
Veröffentlicht: (2024)
von: Chen, Haolin, et al.
Veröffentlicht: (2024)
Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
von: Xu, Austin, et al.
Veröffentlicht: (2025)
von: Xu, Austin, et al.
Veröffentlicht: (2025)
LiveMathematicianBench: A Live Benchmark for Mathematician-Level Reasoning with Proof Sketches
von: He, Linyang, et al.
Veröffentlicht: (2026)
von: He, Linyang, et al.
Veröffentlicht: (2026)
Reward-Robust RLHF in LLMs
von: Yan, Yuzi, et al.
Veröffentlicht: (2024)
von: Yan, Yuzi, et al.
Veröffentlicht: (2024)
FaithEval: Can Your Language Model Stay Faithful to Context, Even If "The Moon is Made of Marshmallows"
von: Ming, Yifei, et al.
Veröffentlicht: (2024)
von: Ming, Yifei, et al.
Veröffentlicht: (2024)
LoRe: Personalizing LLMs via Low-Rank Reward Modeling
von: Bose, Avinandan, et al.
Veröffentlicht: (2025)
von: Bose, Avinandan, et al.
Veröffentlicht: (2025)
Text2Data: Low-Resource Data Generation with Textual Control
von: Wang, Shiyu, et al.
Veröffentlicht: (2024)
von: Wang, Shiyu, et al.
Veröffentlicht: (2024)
RM-R1: Reward Modeling as Reasoning
von: Chen, Xiusi, et al.
Veröffentlicht: (2025)
von: Chen, Xiusi, et al.
Veröffentlicht: (2025)
MAS-ZERO: Designing Multi-Agent Systems with Zero Supervision
von: Ke, Zixuan, et al.
Veröffentlicht: (2025)
von: Ke, Zixuan, et al.
Veröffentlicht: (2025)
Unlocking Multimodal Mathematical Reasoning via Process Reward Model
von: Luo, Ruilin, et al.
Veröffentlicht: (2025)
von: Luo, Ruilin, et al.
Veröffentlicht: (2025)
Beyond Scalar Reward Model: Learning Generative Judge from Preference Data
von: Ye, Ziyi, et al.
Veröffentlicht: (2024)
von: Ye, Ziyi, et al.
Veröffentlicht: (2024)
SSR: Socratic Self-Refine for Large Language Model Reasoning
von: Shi, Haizhou, et al.
Veröffentlicht: (2025)
von: Shi, Haizhou, et al.
Veröffentlicht: (2025)
Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance
von: Yan, Kai, et al.
Veröffentlicht: (2026)
von: Yan, Kai, et al.
Veröffentlicht: (2026)
Improving Consistency in Retrieval-Augmented Systems with Group Similarity Rewards
von: Hamman, Faisal, et al.
Veröffentlicht: (2025)
von: Hamman, Faisal, et al.
Veröffentlicht: (2025)
Process Reward Models That Think
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2025)
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2025)
SLM Meets LLM: Balancing Latency, Interpretability and Consistency in Hallucination Detection
von: Hu, Mengya, et al.
Veröffentlicht: (2024)
von: Hu, Mengya, et al.
Veröffentlicht: (2024)
Prompt Optimization Via Diffusion Language Models
von: Wang, Shiyu, et al.
Veröffentlicht: (2026)
von: Wang, Shiyu, et al.
Veröffentlicht: (2026)
Causal Evaluation of Language Models
von: Chen, Sirui, et al.
Veröffentlicht: (2024)
von: Chen, Sirui, et al.
Veröffentlicht: (2024)
Preference Poisoning Attacks on Reward Model Learning
von: Wu, Junlin, et al.
Veröffentlicht: (2024)
von: Wu, Junlin, et al.
Veröffentlicht: (2024)
Rethinking Reward Model Evaluation Through the Lens of Reward Overoptimization
von: Kim, Sunghwan, et al.
Veröffentlicht: (2025)
von: Kim, Sunghwan, et al.
Veröffentlicht: (2025)
CauScientist: Teaching LLMs to Respect Data for Causal Discovery
von: Peng, Bo, et al.
Veröffentlicht: (2026)
von: Peng, Bo, et al.
Veröffentlicht: (2026)
M-RewardBench: Evaluating Reward Models in Multilingual Settings
von: Gureja, Srishti, et al.
Veröffentlicht: (2024)
von: Gureja, Srishti, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Scalable Chain of Thoughts via Elastic Reasoning
von: Xu, Yuhui, et al.
Veröffentlicht: (2025) -
Fractured Chain-of-Thought Reasoning
von: Liao, Baohao, et al.
Veröffentlicht: (2025) -
A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce
von: Xiong, Wei, et al.
Veröffentlicht: (2025) -
Reward-Guided Speculative Decoding for Efficient LLM Reasoning
von: Liao, Baohao, et al.
Veröffentlicht: (2025) -
RLHF Workflow: From Reward Modeling to Online RLHF
von: Dong, Hanze, et al.
Veröffentlicht: (2024)