DDO-RM: Distribution-Level Policy Improvement after Reward Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Tiantian, Zuo, Jierui, Chen, Michael, Wang, Wenping |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
On Pareto Optimality for Parametric Choice Bandits
by: Zuo, Jierui, et al.
Published: (2025)
by: Zuo, Jierui, et al.
Published: (2025)
RM-R1: Reward Modeling as Reasoning
by: Chen, Xiusi, et al.
Published: (2025)
by: Chen, Xiusi, et al.
Published: (2025)
Coherent Off-Policy Improvement of Large Behavior Models with Learned Rewards
by: Scherer, Christian, et al.
Published: (2026)
by: Scherer, Christian, et al.
Published: (2026)
PersRM-R1: Enhance Personalized Reward Modeling with Reinforcement Learning
by: Li, Mengdi, et al.
Published: (2025)
by: Li, Mengdi, et al.
Published: (2025)
EQA-RM: A Generative Embodied Reward Model with Test-time Scaling
by: Chen, Yuhang, et al.
Published: (2025)
by: Chen, Yuhang, et al.
Published: (2025)
InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling
by: Miao, Yuchun, et al.
Published: (2024)
by: Miao, Yuchun, et al.
Published: (2024)
Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models
by: Hong, Ilgee, et al.
Published: (2025)
by: Hong, Ilgee, et al.
Published: (2025)
AgentRM: Enhancing Agent Generalization with Reward Modeling
by: Xia, Yu, et al.
Published: (2025)
by: Xia, Yu, et al.
Published: (2025)
ProgRM: Build Better GUI Agents with Progress Rewards
by: Zhang, Danyang, et al.
Published: (2025)
by: Zhang, Danyang, et al.
Published: (2025)
Policy Improvement Reinforcement Learning
by: Wang, Huaiyang, et al.
Published: (2026)
by: Wang, Huaiyang, et al.
Published: (2026)
UMM-RM: An Upcycle-and-Merge MoE Reward Model for Mitigating Reward Hacking
by: Fu, Lingling, et al.
Published: (2025)
by: Fu, Lingling, et al.
Published: (2025)
MetaRM: Shifted Distributions Alignment via Meta-Learning
by: Dou, Shihan, et al.
Published: (2024)
by: Dou, Shihan, et al.
Published: (2024)
Reward Weighted Classifier-Free Guidance as Policy Improvement in Autoregressive Models
by: Peysakhovich, Alexander, et al.
Published: (2026)
by: Peysakhovich, Alexander, et al.
Published: (2026)
Fast-Slow Thinking RM: Efficient Integration of Scalar and Generative Reward Models
by: Wu, Jiayun, et al.
Published: (2026)
by: Wu, Jiayun, et al.
Published: (2026)
Policy-based Tuning of Autoregressive Image Models with Instance- and Distribution-Level Rewards
by: Baran, Orhun Buğra, et al.
Published: (2026)
by: Baran, Orhun Buğra, et al.
Published: (2026)
The Distributional Reward Critic Framework for Reinforcement Learning Under Perturbed Rewards
by: Chen, Xi, et al.
Published: (2024)
by: Chen, Xi, et al.
Published: (2024)
ALaRM: Align Language Models via Hierarchical Rewards Modeling
by: Lai, Yuhang, et al.
Published: (2024)
by: Lai, Yuhang, et al.
Published: (2024)
RM -RF: Reward Model for Run-Free Unit Test Evaluation
by: Bruches, Elena, et al.
Published: (2026)
by: Bruches, Elena, et al.
Published: (2026)
ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training
by: Liang, Yu, et al.
Published: (2026)
by: Liang, Yu, et al.
Published: (2026)
ROAD: Responsibility-Oriented Reward Design for Reinforcement Learning in Autonomous Driving
by: Chen, Yongming, et al.
Published: (2025)
by: Chen, Yongming, et al.
Published: (2025)
CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks
by: Wang, Hao, et al.
Published: (2026)
by: Wang, Hao, et al.
Published: (2026)
Trajectory-Oriented Policy Optimization with Sparse Rewards
by: Wang, Guojian, et al.
Published: (2024)
by: Wang, Guojian, et al.
Published: (2024)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
by: Bai, Yang, et al.
Published: (2026)
by: Bai, Yang, et al.
Published: (2026)
LoLaFL: Low-Latency Federated Learning via Forward-only Propagation
by: Zhang, Jierui, et al.
Published: (2024)
by: Zhang, Jierui, et al.
Published: (2024)
Sample Complexity of Distributionally Robust Average-Reward Reinforcement Learning
by: Chen, Zijun, et al.
Published: (2025)
by: Chen, Zijun, et al.
Published: (2025)
Policy Learning for Balancing Short-Term and Long-Term Rewards
by: Wu, Peng, et al.
Published: (2024)
by: Wu, Peng, et al.
Published: (2024)
A Unified Pairwise Framework for RLHF: Bridging Generative Reward Modeling and Policy Optimization
by: Xu, Wenyuan, et al.
Published: (2025)
by: Xu, Wenyuan, et al.
Published: (2025)
Probability Distribution of Hypervolume Improvement in Bi-objective Bayesian Optimization
by: Wang, Hao, et al.
Published: (2022)
by: Wang, Hao, et al.
Published: (2022)
PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling
by: Jian, Ai, et al.
Published: (2025)
by: Jian, Ai, et al.
Published: (2025)
Active Reinforcement Learning Strategies for Offline Policy Improvement
by: Dukkipati, Ambedkar, et al.
Published: (2024)
by: Dukkipati, Ambedkar, et al.
Published: (2024)
Generalization in VAE and Diffusion Models: A Unified Information-Theoretic Analysis
by: Chen, Qi, et al.
Published: (2025)
by: Chen, Qi, et al.
Published: (2025)
Blending Imitation and Reinforcement Learning for Robust Policy Improvement
by: Liu, Xuefeng, et al.
Published: (2023)
by: Liu, Xuefeng, et al.
Published: (2023)
Generalizing Reward Modeling for Out-of-Distribution Preference Learning
by: Jia, Chen
Published: (2024)
by: Jia, Chen
Published: (2024)
Group Distributionally Robust Machine Learning under Group Level Distributional Uncertainty
by: Konti, Xenia, et al.
Published: (2025)
by: Konti, Xenia, et al.
Published: (2025)
ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization
by: Zhang, Chen Bo Calvin, et al.
Published: (2024)
by: Zhang, Chen Bo Calvin, et al.
Published: (2024)
SNPL: Simultaneous Policy Learning and Evaluation for Safe Multi-Objective Policy Improvement
by: Cho, Brian, et al.
Published: (2025)
by: Cho, Brian, et al.
Published: (2025)
FM-IRL: Flow-Matching for Reward Modeling and Policy Regularization in Reinforcement Learning
by: Wan, Zhenglin, et al.
Published: (2025)
by: Wan, Zhenglin, et al.
Published: (2025)
Robot Policy Learning with Temporal Optimal Transport Reward
by: Fu, Yuwei, et al.
Published: (2024)
by: Fu, Yuwei, et al.
Published: (2024)
Survival Dynamics of Neural and Programmatic Policies in Evolutionary Reinforcement Learning
by: Roupassov-Ruiz, Anton, et al.
Published: (2026)
by: Roupassov-Ruiz, Anton, et al.
Published: (2026)
Zeroth-Order Policy Gradient for Reinforcement Learning from Human Feedback without Reward Inference
by: Zhang, Qining, et al.
Published: (2024)
by: Zhang, Qining, et al.
Published: (2024)
Similar Items
-
On Pareto Optimality for Parametric Choice Bandits
by: Zuo, Jierui, et al.
Published: (2025) -
RM-R1: Reward Modeling as Reasoning
by: Chen, Xiusi, et al.
Published: (2025) -
Coherent Off-Policy Improvement of Large Behavior Models with Learned Rewards
by: Scherer, Christian, et al.
Published: (2026) -
PersRM-R1: Enhance Personalized Reward Modeling with Reinforcement Learning
by: Li, Mengdi, et al.
Published: (2025) -
EQA-RM: A Generative Embodied Reward Model with Test-time Scaling
by: Chen, Yuhang, et al.
Published: (2025)