GOPO: Policy Optimization using Ranked Rewards
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Choi, Kyuseong, Saha, Dwaipayan, Kim, Woojeong, Agarwal, Anish, Dwivedi, Raaz |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TabImpute: Universal Zero-Shot Imputation for Tabular Data
par: Feitelberg, Jacob, et autres
Publié: (2025)
par: Feitelberg, Jacob, et autres
Publié: (2025)
Distributional Matrix Completion via Nearest Neighbors in the Wasserstein Space
par: Feitelberg, Jacob, et autres
Publié: (2024)
par: Feitelberg, Jacob, et autres
Publié: (2024)
Learning Counterfactual Distributions via Kernel Nearest Neighbors
par: Choi, Kyuseong, et autres
Publié: (2024)
par: Choi, Kyuseong, et autres
Publié: (2024)
Supervised Kernel Thinning
par: Gong, Albert, et autres
Publié: (2024)
par: Gong, Albert, et autres
Publié: (2024)
Doubly Robust Inference in Causal Latent Factor Models
par: Abadie, Alberto, et autres
Publié: (2024)
par: Abadie, Alberto, et autres
Publié: (2024)
N$^2$: A Unified Python Package and Test Bench for Nearest Neighbor-Based Matrix Completion
par: Chin, Caleb, et autres
Publié: (2025)
par: Chin, Caleb, et autres
Publié: (2025)
Intrinsic Reward Policy Optimization for Sparse-Reward Environments
par: Cho, Minjae, et autres
Publié: (2026)
par: Cho, Minjae, et autres
Publié: (2026)
From Chat Logs to Collective Insights: Aggregative Question Answering
par: Zhang, Wentao, et autres
Publié: (2025)
par: Zhang, Wentao, et autres
Publié: (2025)
An Imperfect Verifier is Good Enough: Learning with Noisy Rewards
par: Plesner, Andreas, et autres
Publié: (2026)
par: Plesner, Andreas, et autres
Publié: (2026)
Fairness Aware Reward Optimization
par: Choi, Ching Lam, et autres
Publié: (2026)
par: Choi, Ching Lam, et autres
Publié: (2026)
Pretrain Value, Not Reward: Decoupled Value Policy Optimization
par: Huang, Chenghua, et autres
Publié: (2025)
par: Huang, Chenghua, et autres
Publié: (2025)
Value-Free Policy Optimization via Reward Partitioning
par: Faye, Bilal, et autres
Publié: (2025)
par: Faye, Bilal, et autres
Publié: (2025)
Mitigating Preference Hacking in Policy Optimization with Pessimism
par: Gupta, Dhawal, et autres
Publié: (2025)
par: Gupta, Dhawal, et autres
Publié: (2025)
ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization
par: Patel, Nirmal, et autres
Publié: (2026)
par: Patel, Nirmal, et autres
Publié: (2026)
CROP: Conservative Reward for Model-based Offline Policy Optimization
par: Li, Hao, et autres
Publié: (2023)
par: Li, Hao, et autres
Publié: (2023)
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
par: Li, Gang, et autres
Publié: (2025)
par: Li, Gang, et autres
Publié: (2025)
Matrix Low-Rank Trust Region Policy Optimization
par: Rozada, Sergio, et autres
Publié: (2024)
par: Rozada, Sergio, et autres
Publié: (2024)
ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization
par: Zhang, Chen Bo Calvin, et autres
Publié: (2024)
par: Zhang, Chen Bo Calvin, et autres
Publié: (2024)
Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation
par: Zhang, Xiaoying, et autres
Publié: (2024)
par: Zhang, Xiaoying, et autres
Publié: (2024)
ECPO: Evidence-Coupled Policy Optimization for Evidence-Certified Candidate Ranking
par: Hu, Miaobo, et autres
Publié: (2026)
par: Hu, Miaobo, et autres
Publié: (2026)
Gradient Extrapolation-Based Policy Optimization
par: Swapnil, Ismam Nur, et autres
Publié: (2026)
par: Swapnil, Ismam Nur, et autres
Publié: (2026)
Reward Learning through Ranking Mean Squared Error
par: Kharyal, Chaitanya, et autres
Publié: (2026)
par: Kharyal, Chaitanya, et autres
Publié: (2026)
Reliable Policy Iteration: Performance Robustness Across Architecture and Environment Perturbations
par: Eshwar, S. R., et autres
Publié: (2025)
par: Eshwar, S. R., et autres
Publié: (2025)
Pessimistic Off-Policy Optimization for Learning to Rank
par: Cief, Matej, et autres
Publié: (2022)
par: Cief, Matej, et autres
Publié: (2022)
HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime
par: Sana, Mohamed, et autres
Publié: (2026)
par: Sana, Mohamed, et autres
Publié: (2026)
Trust Region Reward Optimization and Proximal Inverse Reward Optimization Algorithm
par: Chen, Yang, et autres
Publié: (2025)
par: Chen, Yang, et autres
Publié: (2025)
Clustered Policy Decision Ranking
par: Levin, Mark, et autres
Publié: (2023)
par: Levin, Mark, et autres
Publié: (2023)
RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training
par: Ren, Tao, et autres
Publié: (2025)
par: Ren, Tao, et autres
Publié: (2025)
Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards
par: Ahmad, Ahmad, et autres
Publié: (2024)
par: Ahmad, Ahmad, et autres
Publié: (2024)
ReDit: Reward Dithering for Improved LLM Policy Optimization
par: Wei, Chenxing, et autres
Publié: (2025)
par: Wei, Chenxing, et autres
Publié: (2025)
WARP: On the Benefits of Weight Averaged Rewarded Policies
par: Ramé, Alexandre, et autres
Publié: (2024)
par: Ramé, Alexandre, et autres
Publié: (2024)
R^3: Replay, Reflection, and Ranking Rewards for LLM Reinforcement Learning
par: Jiang, Zhizheng, et autres
Publié: (2026)
par: Jiang, Zhizheng, et autres
Publié: (2026)
Optimizing Classification of Infrequent Labels by Reducing Variability in Label Distribution
par: Agarwal, Ashutosh
Publié: (2025)
par: Agarwal, Ashutosh
Publié: (2025)
Joint Optimization of Multi-Objective Reinforcement Learning with Policy Gradient Based Algorithm
par: Bai, Qinbo, et autres
Publié: (2021)
par: Bai, Qinbo, et autres
Publié: (2021)
Reward Hacking Mitigation using Verifiable Composite Rewards
par: Tarek, Mirza Farhan Bin, et autres
Publié: (2025)
par: Tarek, Mirza Farhan Bin, et autres
Publié: (2025)
Synthetic Blips: Generalizing Synthetic Controls for Dynamic Treatment Effects
par: Agarwal, Anish, et autres
Publié: (2022)
par: Agarwal, Anish, et autres
Publié: (2022)
Hierarchical Apprenticeship Learning from Imperfect Demonstrations with Evolving Rewards
par: Islam, Md Mirajul, et autres
Publié: (2026)
par: Islam, Md Mirajul, et autres
Publié: (2026)
Confidence-aware Reward Optimization for Fine-tuning Text-to-Image Models
par: Kim, Kyuyoung, et autres
Publié: (2024)
par: Kim, Kyuyoung, et autres
Publié: (2024)
Mutual-Taught for Co-adapting Policy and Reward Models
par: Shi, Tianyuan, et autres
Publié: (2025)
par: Shi, Tianyuan, et autres
Publié: (2025)
Adaptive Exploration for Multi-Reward Multi-Policy Evaluation
par: Russo, Alessio, et autres
Publié: (2025)
par: Russo, Alessio, et autres
Publié: (2025)
Documents similaires
-
TabImpute: Universal Zero-Shot Imputation for Tabular Data
par: Feitelberg, Jacob, et autres
Publié: (2025) -
Distributional Matrix Completion via Nearest Neighbors in the Wasserstein Space
par: Feitelberg, Jacob, et autres
Publié: (2024) -
Learning Counterfactual Distributions via Kernel Nearest Neighbors
par: Choi, Kyuseong, et autres
Publié: (2024) -
Supervised Kernel Thinning
par: Gong, Albert, et autres
Publié: (2024) -
Doubly Robust Inference in Causal Latent Factor Models
par: Abadie, Alberto, et autres
Publié: (2024)