Reward Models Identify Consistency, Not Causality
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Yuhui, Dong, Hanze, Wang, Lei, Xiong, Caiming, Li, Junnan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Scalable Chain of Thoughts via Elastic Reasoning
par: Xu, Yuhui, et autres
Publié: (2025)
par: Xu, Yuhui, et autres
Publié: (2025)
Fractured Chain-of-Thought Reasoning
par: Liao, Baohao, et autres
Publié: (2025)
par: Liao, Baohao, et autres
Publié: (2025)
A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce
par: Xiong, Wei, et autres
Publié: (2025)
par: Xiong, Wei, et autres
Publié: (2025)
Reward-Guided Speculative Decoding for Efficient LLM Reasoning
par: Liao, Baohao, et autres
Publié: (2025)
par: Liao, Baohao, et autres
Publié: (2025)
RLHF Workflow: From Reward Modeling to Online RLHF
par: Dong, Hanze, et autres
Publié: (2024)
par: Dong, Hanze, et autres
Publié: (2024)
Automatic Curriculum Expert Iteration for Reliable LLM Reasoning
par: Zhao, Zirui, et autres
Publié: (2024)
par: Zhao, Zirui, et autres
Publié: (2024)
Self-Hinting Language Models Enhance Reinforcement Learning
par: Liao, Baohao, et autres
Publié: (2026)
par: Liao, Baohao, et autres
Publié: (2026)
CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training
par: Liang, Yu, et autres
Publié: (2026)
par: Liang, Yu, et autres
Publié: (2026)
ThinK: Thinner Key Cache by Query-Driven Pruning
par: Xu, Yuhui, et autres
Publié: (2024)
par: Xu, Yuhui, et autres
Publié: (2024)
Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL
par: Yao, Jiarui, et autres
Publié: (2025)
par: Yao, Jiarui, et autres
Publié: (2025)
Reinforce-Ada: An Adaptive Sampling Framework under Non-linear RL Objectives
par: Xiong, Wei, et autres
Publié: (2025)
par: Xiong, Wei, et autres
Publié: (2025)
Inference-Time Scaling for Generalist Reward Modeling
par: Liu, Zijun, et autres
Publié: (2025)
par: Liu, Zijun, et autres
Publié: (2025)
AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning
par: Wang, Tevin, et autres
Publié: (2025)
par: Wang, Tevin, et autres
Publié: (2025)
Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math
par: Pandit, Shrey, et autres
Publié: (2025)
par: Pandit, Shrey, et autres
Publié: (2025)
RewardAnything: Generalizable Principle-Following Reward Models
par: Yu, Zhuohao, et autres
Publié: (2025)
par: Yu, Zhuohao, et autres
Publié: (2025)
Adaptive Segment-level Reward: Bridging the Gap Between Action and Reward Space in Alignment
par: Li, Yanshi, et autres
Publié: (2024)
par: Li, Yanshi, et autres
Publié: (2024)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
par: Wang, Huaijie, et autres
Publié: (2024)
par: Wang, Huaijie, et autres
Publié: (2024)
Language Models are Hidden Reasoners: Unlocking Latent Reasoning Capabilities via Self-Rewarding
par: Chen, Haolin, et autres
Publié: (2024)
par: Chen, Haolin, et autres
Publié: (2024)
Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
par: Xu, Austin, et autres
Publié: (2025)
par: Xu, Austin, et autres
Publié: (2025)
LiveMathematicianBench: A Live Benchmark for Mathematician-Level Reasoning with Proof Sketches
par: He, Linyang, et autres
Publié: (2026)
par: He, Linyang, et autres
Publié: (2026)
Reward-Robust RLHF in LLMs
par: Yan, Yuzi, et autres
Publié: (2024)
par: Yan, Yuzi, et autres
Publié: (2024)
FaithEval: Can Your Language Model Stay Faithful to Context, Even If "The Moon is Made of Marshmallows"
par: Ming, Yifei, et autres
Publié: (2024)
par: Ming, Yifei, et autres
Publié: (2024)
LoRe: Personalizing LLMs via Low-Rank Reward Modeling
par: Bose, Avinandan, et autres
Publié: (2025)
par: Bose, Avinandan, et autres
Publié: (2025)
Text2Data: Low-Resource Data Generation with Textual Control
par: Wang, Shiyu, et autres
Publié: (2024)
par: Wang, Shiyu, et autres
Publié: (2024)
RM-R1: Reward Modeling as Reasoning
par: Chen, Xiusi, et autres
Publié: (2025)
par: Chen, Xiusi, et autres
Publié: (2025)
MAS-ZERO: Designing Multi-Agent Systems with Zero Supervision
par: Ke, Zixuan, et autres
Publié: (2025)
par: Ke, Zixuan, et autres
Publié: (2025)
Unlocking Multimodal Mathematical Reasoning via Process Reward Model
par: Luo, Ruilin, et autres
Publié: (2025)
par: Luo, Ruilin, et autres
Publié: (2025)
Beyond Scalar Reward Model: Learning Generative Judge from Preference Data
par: Ye, Ziyi, et autres
Publié: (2024)
par: Ye, Ziyi, et autres
Publié: (2024)
SSR: Socratic Self-Refine for Large Language Model Reasoning
par: Shi, Haizhou, et autres
Publié: (2025)
par: Shi, Haizhou, et autres
Publié: (2025)
Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance
par: Yan, Kai, et autres
Publié: (2026)
par: Yan, Kai, et autres
Publié: (2026)
Improving Consistency in Retrieval-Augmented Systems with Group Similarity Rewards
par: Hamman, Faisal, et autres
Publié: (2025)
par: Hamman, Faisal, et autres
Publié: (2025)
Process Reward Models That Think
par: Khalifa, Muhammad, et autres
Publié: (2025)
par: Khalifa, Muhammad, et autres
Publié: (2025)
SLM Meets LLM: Balancing Latency, Interpretability and Consistency in Hallucination Detection
par: Hu, Mengya, et autres
Publié: (2024)
par: Hu, Mengya, et autres
Publié: (2024)
Prompt Optimization Via Diffusion Language Models
par: Wang, Shiyu, et autres
Publié: (2026)
par: Wang, Shiyu, et autres
Publié: (2026)
Causal Evaluation of Language Models
par: Chen, Sirui, et autres
Publié: (2024)
par: Chen, Sirui, et autres
Publié: (2024)
Preference Poisoning Attacks on Reward Model Learning
par: Wu, Junlin, et autres
Publié: (2024)
par: Wu, Junlin, et autres
Publié: (2024)
Rethinking Reward Model Evaluation Through the Lens of Reward Overoptimization
par: Kim, Sunghwan, et autres
Publié: (2025)
par: Kim, Sunghwan, et autres
Publié: (2025)
CauScientist: Teaching LLMs to Respect Data for Causal Discovery
par: Peng, Bo, et autres
Publié: (2026)
par: Peng, Bo, et autres
Publié: (2026)
M-RewardBench: Evaluating Reward Models in Multilingual Settings
par: Gureja, Srishti, et autres
Publié: (2024)
par: Gureja, Srishti, et autres
Publié: (2024)
Documents similaires
-
Scalable Chain of Thoughts via Elastic Reasoning
par: Xu, Yuhui, et autres
Publié: (2025) -
Fractured Chain-of-Thought Reasoning
par: Liao, Baohao, et autres
Publié: (2025) -
A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce
par: Xiong, Wei, et autres
Publié: (2025) -
Reward-Guided Speculative Decoding for Efficient LLM Reasoning
par: Liao, Baohao, et autres
Publié: (2025) -
RLHF Workflow: From Reward Modeling to Online RLHF
par: Dong, Hanze, et autres
Publié: (2024)