DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Gang, Chen, Yan, Lin, Ming, Yang, Tianbao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
DisCO: Reinforcing Large Reasoning Models with Discriminative Constrained Optimization
von: Li, Gang, et al.
Veröffentlicht: (2025)
von: Li, Gang, et al.
Veröffentlicht: (2025)
Pretrain Value, Not Reward: Decoupled Value Policy Optimization
von: Huang, Chenghua, et al.
Veröffentlicht: (2025)
von: Huang, Chenghua, et al.
Veröffentlicht: (2025)
Multi-Output Distributional Fairness via Post-Processing
von: Li, Gang, et al.
Veröffentlicht: (2024)
von: Li, Gang, et al.
Veröffentlicht: (2024)
Mitigating Reward Over-Optimization in RLHF via Behavior-Supported Regularization
von: Dai, Juntao, et al.
Veröffentlicht: (2025)
von: Dai, Juntao, et al.
Veröffentlicht: (2025)
ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization
von: Zhang, Chen Bo Calvin, et al.
Veröffentlicht: (2024)
von: Zhang, Chen Bo Calvin, et al.
Veröffentlicht: (2024)
Value-Free Policy Optimization via Reward Partitioning
von: Faye, Bilal, et al.
Veröffentlicht: (2025)
von: Faye, Bilal, et al.
Veröffentlicht: (2025)
Towards Flash Thinking via Decoupled Advantage Policy Optimization
von: Tan, Zezhong, et al.
Veröffentlicht: (2025)
von: Tan, Zezhong, et al.
Veröffentlicht: (2025)
Harness as an Asset: Enforcing Determinism via the Convergent AI Agent Framework (CAAF)
von: Zhang, Tianbao
Veröffentlicht: (2026)
von: Zhang, Tianbao
Veröffentlicht: (2026)
Beyond Alignment: Expanding Reasoning Capacity via Manifold-Reshaping Policy Optimization
von: Wang, Dayu, et al.
Veröffentlicht: (2026)
von: Wang, Dayu, et al.
Veröffentlicht: (2026)
Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models
von: Yang, Shidong, et al.
Veröffentlicht: (2026)
von: Yang, Shidong, et al.
Veröffentlicht: (2026)
Intrinsic Reward Policy Optimization for Sparse-Reward Environments
von: Cho, Minjae, et al.
Veröffentlicht: (2026)
von: Cho, Minjae, et al.
Veröffentlicht: (2026)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
von: Ma, Zhengzhao, et al.
Veröffentlicht: (2026)
von: Ma, Zhengzhao, et al.
Veröffentlicht: (2026)
Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation
von: Zhang, Xiaoying, et al.
Veröffentlicht: (2024)
von: Zhang, Xiaoying, et al.
Veröffentlicht: (2024)
ABPT: Amended Backpropagation through Time with Partially Differentiable Rewards
von: Li, Fanxing, et al.
Veröffentlicht: (2025)
von: Li, Fanxing, et al.
Veröffentlicht: (2025)
Mutual-Taught for Co-adapting Policy and Reward Models
von: Shi, Tianyuan, et al.
Veröffentlicht: (2025)
von: Shi, Tianyuan, et al.
Veröffentlicht: (2025)
Assigning Credit with Partial Reward Decoupling in Multi-Agent Proximal Policy Optimization
von: Kapoor, Aditya, et al.
Veröffentlicht: (2024)
von: Kapoor, Aditya, et al.
Veröffentlicht: (2024)
Boosting LLM Reasoning via Human-Inspired Reward Shaping
von: Lin, Wenze, et al.
Veröffentlicht: (2026)
von: Lin, Wenze, et al.
Veröffentlicht: (2026)
Reference-guided Policy Optimization for Molecular Optimization via LLM Reasoning
von: Li, Xuan, et al.
Veröffentlicht: (2026)
von: Li, Xuan, et al.
Veröffentlicht: (2026)
Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards
von: He, Haoran, et al.
Veröffentlicht: (2025)
von: He, Haoran, et al.
Veröffentlicht: (2025)
Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy
von: Gao, Shujian, et al.
Veröffentlicht: (2026)
von: Gao, Shujian, et al.
Veröffentlicht: (2026)
RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training
von: Ren, Tao, et al.
Veröffentlicht: (2025)
von: Ren, Tao, et al.
Veröffentlicht: (2025)
Gradient Aligned Regression via Pairwise Losses
von: Zhu, Dixian, et al.
Veröffentlicht: (2024)
von: Zhu, Dixian, et al.
Veröffentlicht: (2024)
HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime
von: Sana, Mohamed, et al.
Veröffentlicht: (2026)
von: Sana, Mohamed, et al.
Veröffentlicht: (2026)
GOPO: Policy Optimization using Ranked Rewards
von: Choi, Kyuseong, et al.
Veröffentlicht: (2026)
von: Choi, Kyuseong, et al.
Veröffentlicht: (2026)
CROP: Conservative Reward for Model-based Offline Policy Optimization
von: Li, Hao, et al.
Veröffentlicht: (2023)
von: Li, Hao, et al.
Veröffentlicht: (2023)
Trust Region Reward Optimization and Proximal Inverse Reward Optimization Algorithm
von: Chen, Yang, et al.
Veröffentlicht: (2025)
von: Chen, Yang, et al.
Veröffentlicht: (2025)
Optimizing Anytime Reasoning via Budget Relative Policy Optimization
von: Qi, Penghui, et al.
Veröffentlicht: (2025)
von: Qi, Penghui, et al.
Veröffentlicht: (2025)
PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment
von: Li, Jiawei, et al.
Veröffentlicht: (2024)
von: Li, Jiawei, et al.
Veröffentlicht: (2024)
RLAnything: Forge Environment, Policy, and Reward Model in Completely Dynamic RL System
von: Wang, Yinjie, et al.
Veröffentlicht: (2026)
von: Wang, Yinjie, et al.
Veröffentlicht: (2026)
Stepwise Guided Policy Optimization: Coloring your Incorrect Reasoning in GRPO
von: Chen, Peter, et al.
Veröffentlicht: (2025)
von: Chen, Peter, et al.
Veröffentlicht: (2025)
Verifying Meta-Awareness via Predictive Rewards in Reasoning Models
von: Kim, Yoonjeon, et al.
Veröffentlicht: (2025)
von: Kim, Yoonjeon, et al.
Veröffentlicht: (2025)
RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time
von: Wang, Haozhe, et al.
Veröffentlicht: (2026)
von: Wang, Haozhe, et al.
Veröffentlicht: (2026)
IIB-LPO: Latent Policy Optimization via Iterative Information Bottleneck
von: Deng, Huilin, et al.
Veröffentlicht: (2026)
von: Deng, Huilin, et al.
Veröffentlicht: (2026)
Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization
von: Zhu, Haodong, et al.
Veröffentlicht: (2026)
von: Zhu, Haodong, et al.
Veröffentlicht: (2026)
ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models
von: Yu, Song, et al.
Veröffentlicht: (2026)
von: Yu, Song, et al.
Veröffentlicht: (2026)
Efficient LLM Reasoning via Variational Posterior Guidance with Efficiency Awareness
von: Chen, Zizhao, et al.
Veröffentlicht: (2026)
von: Chen, Zizhao, et al.
Veröffentlicht: (2026)
ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization
von: Patel, Nirmal, et al.
Veröffentlicht: (2026)
von: Patel, Nirmal, et al.
Veröffentlicht: (2026)
PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning
von: Wu, Feijie, et al.
Veröffentlicht: (2025)
von: Wu, Feijie, et al.
Veröffentlicht: (2025)
Non-Smooth Weakly-Convex Finite-sum Coupled Compositional Optimization
von: Hu, Quanqi, et al.
Veröffentlicht: (2023)
von: Hu, Quanqi, et al.
Veröffentlicht: (2023)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
von: Xie, Tianbao, et al.
Veröffentlicht: (2023)
von: Xie, Tianbao, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
DisCO: Reinforcing Large Reasoning Models with Discriminative Constrained Optimization
von: Li, Gang, et al.
Veröffentlicht: (2025) -
Pretrain Value, Not Reward: Decoupled Value Policy Optimization
von: Huang, Chenghua, et al.
Veröffentlicht: (2025) -
Multi-Output Distributional Fairness via Post-Processing
von: Li, Gang, et al.
Veröffentlicht: (2024) -
Mitigating Reward Over-Optimization in RLHF via Behavior-Supported Regularization
von: Dai, Juntao, et al.
Veröffentlicht: (2025) -
ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization
von: Zhang, Chen Bo Calvin, et al.
Veröffentlicht: (2024)