Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xue, Chao, Wang, Yao, Liu, Mengqiao, Liang, Di, Han, Xingsheng, Liu, Peiyang, Wu, Xianjie, Lu, Chenyao, Jiang, Lei, Lu, Yu, Shi, Haibo, Liang, Shuang, Peng, Minlong, Salim, Flora D. |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Why Supervised Fine-Tuning Fails to Learn: A Systematic Study of Incomplete Learning in Large Language Models
par: Xue, Chao, et autres
Publié: (2026)
par: Xue, Chao, et autres
Publié: (2026)
Parameter Importance is Not Static: Evolving Parameter Isolation for Supervised Fine-Tuning
par: Lin, Zekai, et autres
Publié: (2026)
par: Lin, Zekai, et autres
Publié: (2026)
Structural Reward Model: Enhancing Interpretability, Efficiency, and Scalability in Reward Modeling
par: Liu, Xiaoyu, et autres
Publié: (2025)
par: Liu, Xiaoyu, et autres
Publié: (2025)
DeCoRL: Decoupling Reasoning Chains via Parallel Sub-Step Generation and Cascaded Reinforcement for Interpretable and Scalable RLHF
par: Gao, Ziyuan, et autres
Publié: (2025)
par: Gao, Ziyuan, et autres
Publié: (2025)
Not All Parameters Are Created Equal: Smart Isolation Boosts Fine-Tuning Performance
par: Wang, Yao, et autres
Publié: (2025)
par: Wang, Yao, et autres
Publié: (2025)
Think Only When You Need with Large Hybrid-Reasoning Models
par: Jiang, Lingjie, et autres
Publié: (2025)
par: Jiang, Lingjie, et autres
Publié: (2025)
Mechanistic Indicators of Steering Effectiveness in Large Language Models
par: Jafari, Mehdi, et autres
Publié: (2026)
par: Jafari, Mehdi, et autres
Publié: (2026)
When You Need to Know
par: Brown, Flora Morris
Publié: (1976)
par: Brown, Flora Morris
Publié: (1976)
Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models
par: Hong, Ilgee, et autres
Publié: (2025)
par: Hong, Ilgee, et autres
Publié: (2025)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
par: Zhang, Qingru, et autres
Publié: (2025)
par: Zhang, Qingru, et autres
Publié: (2025)
Reinforcement Learning Enhanced Multi-hop Reasoning for Temporal Knowledge Question Answering
par: Wen, Wuzhenghong, et autres
Publié: (2026)
par: Wen, Wuzhenghong, et autres
Publié: (2026)
Whether Uncertainty Theory Can Enhance GDP Forecasting From Energy: A New Uncertain MIDAS Model
par: Yuxin Shi, et autres
Publié: (2025)
par: Yuxin Shi, et autres
Publié: (2025)
DeepLévy: Learning Heavy-Tailed Uncertainty in Highly Volatile Time Series
par: Yang, Yang, et autres
Publié: (2026)
par: Yang, Yang, et autres
Publié: (2026)
Uncertainty Quantification for Large Language Model Reward Learning under Heterogeneous Human Feedback
par: Liu, Pangpang, et autres
Publié: (2025)
par: Liu, Pangpang, et autres
Publié: (2025)
DPI: Exploiting Parameter Heterogeneity for Interference-Free Fine-Tuning
par: Liu, Xiaoyu, et autres
Publié: (2026)
par: Liu, Xiaoyu, et autres
Publié: (2026)
Reward Model Routing in Alignment
par: Wu, Xinle, et autres
Publié: (2025)
par: Wu, Xinle, et autres
Publié: (2025)
MAPLE: Mobile App Prediction Leveraging Large Language Model Embeddings
par: Khaokaew, Yonchanok, et autres
Publié: (2023)
par: Khaokaew, Yonchanok, et autres
Publié: (2023)
Who Stole Your Data? A Method for Detecting Unauthorized RAG Theft
par: Liu, Peiyang, et autres
Publié: (2025)
par: Liu, Peiyang, et autres
Publié: (2025)
STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models
par: Liang, Yiming, et autres
Publié: (2026)
par: Liang, Yiming, et autres
Publié: (2026)
Ask Only When Needed: Proactive Retrieval from Memory and Skills for Experience-Driven Lifelong Agents
par: Cai, Yuxuan, et autres
Publié: (2026)
par: Cai, Yuxuan, et autres
Publié: (2026)
Take Only What You Need: Rank Minimization as an Implicit Forgetting Regularizer in Continual Learning
par: Lu, Haodong, et autres
Publié: (2024)
par: Lu, Haodong, et autres
Publié: (2024)
Large Language Models are Contrastive Reasoners
par: Yao, Liang
Publié: (2024)
par: Yao, Liang
Publié: (2024)
Optimal Uncertainty Quantification under General Moment Constraints on Input Subdomains
par: Jin, Rong, et autres
Publié: (2025)
par: Jin, Rong, et autres
Publié: (2025)
Double-Diffusion: ODE-Prior Accelerated Diffusion Models for Spatio-Temporal Graph Forecasting
par: Dong, Hanlin, et autres
Publié: (2025)
par: Dong, Hanlin, et autres
Publié: (2025)
A-UTE: Advection Informed, Uncertainty Aware Temperature Emulator
par: Saleem, Hira, et autres
Publié: (2024)
par: Saleem, Hira, et autres
Publié: (2024)
Large Language Models for Next Point-of-Interest Recommendation
par: Li, Peibo, et autres
Publié: (2024)
par: Li, Peibo, et autres
Publié: (2024)
When Ads Become Profiles: Uncovering the Invisible Risk of Web Advertising at Scale with LLMs
par: Chen, Baiyu, et autres
Publié: (2025)
par: Chen, Baiyu, et autres
Publié: (2025)
Decoder-Only LLMs are Better Controllers for Diffusion Models
par: Dong, Ziyi, et autres
Publié: (2025)
par: Dong, Ziyi, et autres
Publié: (2025)
STAR: Failure-Aware Markovian Routing for Multi-Agent Spatiotemporal Reasoning
par: Yang, Ruiyi, et autres
Publié: (2026)
par: Yang, Ruiyi, et autres
Publié: (2026)
From XXLTraffic to EvoXXLTraffic: Scaling Traffic Forecasting to Sensor-Evolving Networks
par: Yin, Du, et autres
Publié: (2026)
par: Yin, Du, et autres
Publié: (2026)
XXLTraffic: Expanding and Extremely Long Traffic forecasting beyond test adaptation
par: Yin, Du, et autres
Publié: (2024)
par: Yin, Du, et autres
Publié: (2024)
HiT-JEPA: A Hierarchical Self-supervised Trajectory Embedding Framework for Similarity Computation
par: Li, Lihuan, et autres
Publié: (2025)
par: Li, Lihuan, et autres
Publié: (2025)
Large Language Model Reasoning Failures
par: Song, Peiyang, et autres
Publié: (2026)
par: Song, Peiyang, et autres
Publié: (2026)
Learning from Contrasts: Synthesizing Reasoning Paths from Diverse Search Trajectories
par: Liu, Peiyang, et autres
Publié: (2026)
par: Liu, Peiyang, et autres
Publié: (2026)
Free(): Learning to Forget in Malloc-Only Reasoning Models
par: Zheng, Yilun, et autres
Publié: (2026)
par: Zheng, Yilun, et autres
Publié: (2026)
EMAC+: Embodied Multimodal Agent for Collaborative Planning with VLM+LLM
par: Ao, Shuang, et autres
Publié: (2025)
par: Ao, Shuang, et autres
Publié: (2025)
ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents
par: Li, Zechen, et autres
Publié: (2025)
par: Li, Zechen, et autres
Publié: (2025)
Native Reasoning Models: Training Language Models to Reason on Unverifiable Data
par: Wang, Yuanfu, et autres
Publié: (2026)
par: Wang, Yuanfu, et autres
Publié: (2026)
Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models
par: Yang, Yankai, et autres
Publié: (2026)
par: Yang, Yankai, et autres
Publié: (2026)
When Safety Becomes a Vulnerability: Exploiting LLM Alignment Homogeneity for Transferable Blocking in RAG
par: Li, Junchen, et autres
Publié: (2026)
par: Li, Junchen, et autres
Publié: (2026)
Documents similaires
-
Why Supervised Fine-Tuning Fails to Learn: A Systematic Study of Incomplete Learning in Large Language Models
par: Xue, Chao, et autres
Publié: (2026) -
Parameter Importance is Not Static: Evolving Parameter Isolation for Supervised Fine-Tuning
par: Lin, Zekai, et autres
Publié: (2026) -
Structural Reward Model: Enhancing Interpretability, Efficiency, and Scalability in Reward Modeling
par: Liu, Xiaoyu, et autres
Publié: (2025) -
DeCoRL: Decoupling Reasoning Chains via Parallel Sub-Step Generation and Cascaded Reinforcement for Interpretable and Scalable RLHF
par: Gao, Ziyuan, et autres
Publié: (2025) -
Not All Parameters Are Created Equal: Smart Isolation Boosts Fine-Tuning Performance
par: Wang, Yao, et autres
Publié: (2025)