Inference-Time Scaling for Generalist Reward Modeling
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Zijun, Wang, Peiyi, Xu, Runxin, Ma, Shirong, Ruan, Chong, Li, Peng, Liu, Yang, Wu, Yu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
di: Shao, Zhihong, et al.
Pubblicazione: (2024)
di: Shao, Zhihong, et al.
Pubblicazione: (2024)
Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment
di: Wang, Ye, et al.
Pubblicazione: (2026)
di: Wang, Ye, et al.
Pubblicazione: (2026)
LimiX: Unleashing Structured-Data Modeling Capability for Generalist Intelligence
di: Zhang, Xingxuan, et al.
Pubblicazione: (2025)
di: Zhang, Xingxuan, et al.
Pubblicazione: (2025)
Let the Expert Stick to His Last: Expert-Specialized Fine-Tuning for Sparse Architectural Large Language Models
di: Wang, Zihan, et al.
Pubblicazione: (2024)
di: Wang, Zihan, et al.
Pubblicazione: (2024)
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
di: Cheng, Ruoxi, et al.
Pubblicazione: (2025)
di: Cheng, Ruoxi, et al.
Pubblicazione: (2025)
Diagnosing Training Inference Mismatch in LLM Reinforcement Learning
di: Zhong, Tianle, et al.
Pubblicazione: (2026)
di: Zhong, Tianle, et al.
Pubblicazione: (2026)
Reward Modeling with Ordinal Feedback: Wisdom of the Crowd
di: Liu, Shang, et al.
Pubblicazione: (2024)
di: Liu, Shang, et al.
Pubblicazione: (2024)
ControlMath: Controllable Data Generation Promotes Math Generalist Models
di: Chen, Nuo, et al.
Pubblicazione: (2024)
di: Chen, Nuo, et al.
Pubblicazione: (2024)
ROSE: A Reward-Oriented Data Selection Framework for LLM Task-Specific Instruction Tuning
di: Wu, Yang, et al.
Pubblicazione: (2024)
di: Wu, Yang, et al.
Pubblicazione: (2024)
Advancing LLM Reasoning Generalists with Preference Trees
di: Yuan, Lifan, et al.
Pubblicazione: (2024)
di: Yuan, Lifan, et al.
Pubblicazione: (2024)
$ϕ$-Decoding: Adaptive Foresight Sampling for Balanced Inference-Time Exploration and Exploitation
di: Xu, Fangzhi, et al.
Pubblicazione: (2025)
di: Xu, Fangzhi, et al.
Pubblicazione: (2025)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
DavIR: Data Selection via Implicit Reward for Large Language Models
di: Zhou, Haotian, et al.
Pubblicazione: (2023)
di: Zhou, Haotian, et al.
Pubblicazione: (2023)
Entropy Centroids as Intrinsic Rewards for Test-Time Scaling
di: Zhao, Wenshuo, et al.
Pubblicazione: (2026)
di: Zhao, Wenshuo, et al.
Pubblicazione: (2026)
MarkovScale: Towards Optimal Sequential Scaling at Inference Time
di: Wang, Youkang, et al.
Pubblicazione: (2026)
di: Wang, Youkang, et al.
Pubblicazione: (2026)
Generalist Foundation Models Are Not Clinical Enough for Hospital Operations
di: Jiang, Lavender Y., et al.
Pubblicazione: (2025)
di: Jiang, Lavender Y., et al.
Pubblicazione: (2025)
On Designing Effective RL Reward at Training Time for LLM Reasoning
di: Gao, Jiaxuan, et al.
Pubblicazione: (2024)
di: Gao, Jiaxuan, et al.
Pubblicazione: (2024)
Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy
di: Liu, Chris Yuhao, et al.
Pubblicazione: (2025)
di: Liu, Chris Yuhao, et al.
Pubblicazione: (2025)
AIGS: Generating Science from AI-Powered Automated Falsification
di: Liu, Zijun, et al.
Pubblicazione: (2024)
di: Liu, Zijun, et al.
Pubblicazione: (2024)
Scaling Generalist Data-Analytic Agents
di: Qiao, Shuofei, et al.
Pubblicazione: (2025)
di: Qiao, Shuofei, et al.
Pubblicazione: (2025)
Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences
di: Karlekar, Sweta, et al.
Pubblicazione: (2026)
di: Karlekar, Sweta, et al.
Pubblicazione: (2026)
Enabling Weak LLMs to Judge Response Reliability via Meta Ranking
di: Liu, Zijun, et al.
Pubblicazione: (2024)
di: Liu, Zijun, et al.
Pubblicazione: (2024)
Parallel Test-Time Scaling for Latent Reasoning Models
di: You, Runyang, et al.
Pubblicazione: (2025)
di: You, Runyang, et al.
Pubblicazione: (2025)
More Bang for the Buck: Process Reward Modeling with Entropy-Driven Uncertainty
di: Cao, Lang, et al.
Pubblicazione: (2025)
di: Cao, Lang, et al.
Pubblicazione: (2025)
Mitigating Premature Exploitation in Particle-based Monte Carlo for Inference-Time Scaling
di: Giannone, Giorgio, et al.
Pubblicazione: (2025)
di: Giannone, Giorgio, et al.
Pubblicazione: (2025)
The Lessons of Developing Process Reward Models in Mathematical Reasoning
di: Zhang, Zhenru, et al.
Pubblicazione: (2025)
di: Zhang, Zhenru, et al.
Pubblicazione: (2025)
DeepSeek LLM: Scaling Open-Source Language Models with Longtermism
di: DeepSeek-AI, et al.
Pubblicazione: (2024)
di: DeepSeek-AI, et al.
Pubblicazione: (2024)
CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning
di: Zheng, Congmin, et al.
Pubblicazione: (2025)
di: Zheng, Congmin, et al.
Pubblicazione: (2025)
Reward Models Identify Consistency, Not Causality
di: Xu, Yuhui, et al.
Pubblicazione: (2025)
di: Xu, Yuhui, et al.
Pubblicazione: (2025)
Are More Tokens Rational? Inference-Time Scaling in Language Models as Adaptive Resource Rationality
di: Hu, Zhimin, et al.
Pubblicazione: (2026)
di: Hu, Zhimin, et al.
Pubblicazione: (2026)
SPARK: Stepwise Process-Aware Rewards for Reference-Free Reinforcement Learning
di: Rahman, Salman, et al.
Pubblicazione: (2025)
di: Rahman, Salman, et al.
Pubblicazione: (2025)
Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
From Generalist to Specialist: A Survey of Large Language Models for Chemistry
di: Han, Yang, et al.
Pubblicazione: (2024)
di: Han, Yang, et al.
Pubblicazione: (2024)
Action Controlled Paraphrasing
di: Shi, Ning, et al.
Pubblicazione: (2024)
di: Shi, Ning, et al.
Pubblicazione: (2024)
GLiREL -- Generalist Model for Zero-Shot Relation Extraction
di: Boylan, Jack, et al.
Pubblicazione: (2025)
di: Boylan, Jack, et al.
Pubblicazione: (2025)
GLiClass: Generalist Lightweight Model for Sequence Classification Tasks
di: Stepanov, Ihor, et al.
Pubblicazione: (2025)
di: Stepanov, Ihor, et al.
Pubblicazione: (2025)
Scaling Inference-Efficient Language Models
di: Bian, Song, et al.
Pubblicazione: (2025)
di: Bian, Song, et al.
Pubblicazione: (2025)
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
di: Liu, Bingshuai, et al.
Pubblicazione: (2025)
di: Liu, Bingshuai, et al.
Pubblicazione: (2025)
PRISM: Parametrically Refactoring Inference for Speculative Sampling Draft Models
di: Wang, Xuliang, et al.
Pubblicazione: (2026)
di: Wang, Xuliang, et al.
Pubblicazione: (2026)
Observational Scaling Laws and the Predictability of Language Model Performance
di: Ruan, Yangjun, et al.
Pubblicazione: (2024)
di: Ruan, Yangjun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
di: Shao, Zhihong, et al.
Pubblicazione: (2024) -
Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment
di: Wang, Ye, et al.
Pubblicazione: (2026) -
LimiX: Unleashing Structured-Data Modeling Capability for Generalist Intelligence
di: Zhang, Xingxuan, et al.
Pubblicazione: (2025) -
Let the Expert Stick to His Last: Expert-Specialized Fine-Tuning for Sparse Architectural Large Language Models
di: Wang, Zihan, et al.
Pubblicazione: (2024) -
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
di: Cheng, Ruoxi, et al.
Pubblicazione: (2025)