On the Power of (Approximate) Reward Models for Inference-Time Scaling
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhu, Youheng, Lu, Yiping |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Inference-Time Scaling for Generalist Reward Modeling
von: Liu, Zijun, et al.
Veröffentlicht: (2025)
von: Liu, Zijun, et al.
Veröffentlicht: (2025)
A Covering Framework for Offline POMDPs Learning using Belief Space Metric
von: Zhu, Youheng, et al.
Veröffentlicht: (2026)
von: Zhu, Youheng, et al.
Veröffentlicht: (2026)
Entropy Centroids as Intrinsic Rewards for Test-Time Scaling
von: Zhao, Wenshuo, et al.
Veröffentlicht: (2026)
von: Zhao, Wenshuo, et al.
Veröffentlicht: (2026)
RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance
von: Chen, Tianlang, et al.
Veröffentlicht: (2025)
von: Chen, Tianlang, et al.
Veröffentlicht: (2025)
TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference
von: Zhang, Dan, et al.
Veröffentlicht: (2025)
von: Zhang, Dan, et al.
Veröffentlicht: (2025)
Inference-Time Hyper-Scaling with KV Cache Compression
von: Łańcucki, Adrian, et al.
Veröffentlicht: (2025)
von: Łańcucki, Adrian, et al.
Veröffentlicht: (2025)
Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension
von: Wang, Xiyao, et al.
Veröffentlicht: (2024)
von: Wang, Xiyao, et al.
Veröffentlicht: (2024)
Bayesian Preference Learning for Test-Time Steerable Reward Models
von: Hong, Jiwoo, et al.
Veröffentlicht: (2026)
von: Hong, Jiwoo, et al.
Veröffentlicht: (2026)
GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling
von: Hou, Zhenyu, et al.
Veröffentlicht: (2025)
von: Hou, Zhenyu, et al.
Veröffentlicht: (2025)
What is a Sketch-and-Precondition Derivation for Low-Rank Approximation? Inverse Power Error or Inverse Power Estimation?
von: Xu, Ruihan, et al.
Veröffentlicht: (2025)
von: Xu, Ruihan, et al.
Veröffentlicht: (2025)
Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment
von: Wang, Ye, et al.
Veröffentlicht: (2026)
von: Wang, Ye, et al.
Veröffentlicht: (2026)
MarkovScale: Towards Optimal Sequential Scaling at Inference Time
von: Wang, Youkang, et al.
Veröffentlicht: (2026)
von: Wang, Youkang, et al.
Veröffentlicht: (2026)
Reward-Robust RLHF in LLMs
von: Yan, Yuzi, et al.
Veröffentlicht: (2024)
von: Yan, Yuzi, et al.
Veröffentlicht: (2024)
Simple Approximation and Derivative Free Inference-Time Scaling for Diffusion Models via Sequential Monte Carlo on Path Measures
von: Wang, Chenyang, et al.
Veröffentlicht: (2026)
von: Wang, Chenyang, et al.
Veröffentlicht: (2026)
GTS: Inference-Time Scaling of Latent Reasoning with a Learnable Gaussian Thought Sampler
von: Wang, Minghan, et al.
Veröffentlicht: (2026)
von: Wang, Minghan, et al.
Veröffentlicht: (2026)
Noise Contrastive Alignment of Language Models with Explicit Rewards
von: Chen, Huayu, et al.
Veröffentlicht: (2024)
von: Chen, Huayu, et al.
Veröffentlicht: (2024)
Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning
von: Setlur, Amrith, et al.
Veröffentlicht: (2024)
von: Setlur, Amrith, et al.
Veröffentlicht: (2024)
Cascade Reward Sampling for Efficient Decoding-Time Alignment
von: Li, Bolian, et al.
Veröffentlicht: (2024)
von: Li, Bolian, et al.
Veröffentlicht: (2024)
Are More Tokens Rational? Inference-Time Scaling in Language Models as Adaptive Resource Rationality
von: Hu, Zhimin, et al.
Veröffentlicht: (2026)
von: Hu, Zhimin, et al.
Veröffentlicht: (2026)
Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws
von: Sardana, Nikhil, et al.
Veröffentlicht: (2023)
von: Sardana, Nikhil, et al.
Veröffentlicht: (2023)
Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
von: Ma, Qiyao, et al.
Veröffentlicht: (2026)
von: Ma, Qiyao, et al.
Veröffentlicht: (2026)
Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms
von: Rafailov, Rafael, et al.
Veröffentlicht: (2024)
von: Rafailov, Rafael, et al.
Veröffentlicht: (2024)
Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences
von: Karlekar, Sweta, et al.
Veröffentlicht: (2026)
von: Karlekar, Sweta, et al.
Veröffentlicht: (2026)
Latent Thought Models with Variational Bayes Inference-Time Computation
von: Kong, Deqian, et al.
Veröffentlicht: (2025)
von: Kong, Deqian, et al.
Veröffentlicht: (2025)
Scaling Inference-Efficient Language Models
von: Bian, Song, et al.
Veröffentlicht: (2025)
von: Bian, Song, et al.
Veröffentlicht: (2025)
Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models
von: Wang, Jian, et al.
Veröffentlicht: (2025)
von: Wang, Jian, et al.
Veröffentlicht: (2025)
Fast-Slow Thinking RM: Efficient Integration of Scalar and Generative Reward Models
von: Wu, Jiayun, et al.
Veröffentlicht: (2026)
von: Wu, Jiayun, et al.
Veröffentlicht: (2026)
Test-Time Scaling with Reflective Generative Model
von: Wang, Zixiao, et al.
Veröffentlicht: (2025)
von: Wang, Zixiao, et al.
Veröffentlicht: (2025)
Process Reward Models That Think
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2025)
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2025)
On Almost Surely Safe Alignment of Large Language Models at Inference-Time
von: Ji, Xiaotong, et al.
Veröffentlicht: (2025)
von: Ji, Xiaotong, et al.
Veröffentlicht: (2025)
Entropy-Regularized Process Reward Model
von: Zhang, Hanning, et al.
Veröffentlicht: (2024)
von: Zhang, Hanning, et al.
Veröffentlicht: (2024)
Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference
von: Song, Yuxuan, et al.
Veröffentlicht: (2025)
von: Song, Yuxuan, et al.
Veröffentlicht: (2025)
Expected Reward Prediction, with Applications to Model Routing
von: Hasanaliyev, Kenan, et al.
Veröffentlicht: (2026)
von: Hasanaliyev, Kenan, et al.
Veröffentlicht: (2026)
Bootstrapping Language Models with DPO Implicit Rewards
von: Chen, Changyu, et al.
Veröffentlicht: (2024)
von: Chen, Changyu, et al.
Veröffentlicht: (2024)
Improving Text Style Transfer using Masked Diffusion Language Models with Inference-time Scaling
von: Padole, Tejomay Kishor, et al.
Veröffentlicht: (2025)
von: Padole, Tejomay Kishor, et al.
Veröffentlicht: (2025)
HEART: Emotionally-Driven Test-Time Scaling of Language Models
von: Pinto, Gabriela, et al.
Veröffentlicht: (2025)
von: Pinto, Gabriela, et al.
Veröffentlicht: (2025)
Mitigating Premature Exploitation in Particle-based Monte Carlo for Inference-Time Scaling
von: Giannone, Giorgio, et al.
Veröffentlicht: (2025)
von: Giannone, Giorgio, et al.
Veröffentlicht: (2025)
Energy-Based Reward Models for Robust Language Model Alignment
von: Lochab, Anamika, et al.
Veröffentlicht: (2025)
von: Lochab, Anamika, et al.
Veröffentlicht: (2025)
Blackbox Model Provenance via Palimpsestic Membership Inference
von: Kuditipudi, Rohith, et al.
Veröffentlicht: (2025)
von: Kuditipudi, Rohith, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Inference-Time Scaling for Generalist Reward Modeling
von: Liu, Zijun, et al.
Veröffentlicht: (2025) -
A Covering Framework for Offline POMDPs Learning using Belief Space Metric
von: Zhu, Youheng, et al.
Veröffentlicht: (2026) -
Entropy Centroids as Intrinsic Rewards for Test-Time Scaling
von: Zhao, Wenshuo, et al.
Veröffentlicht: (2026) -
RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance
von: Chen, Tianlang, et al.
Veröffentlicht: (2025) -
TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference
von: Zhang, Dan, et al.
Veröffentlicht: (2025)