State Regularized Policy Optimization on Data with Dynamics Shift
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xue, Zhenghai, Cai, Qingpeng, Liu, Shuchang, Zheng, Dong, Jiang, Peng, Gai, Kun, An, Bo |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Policy Regularization on Globally Accessible States in Cross-Dynamics Reinforcement Learning
par: Xue, Zhenghai, et autres
Publié: (2025)
par: Xue, Zhenghai, et autres
Publié: (2025)
Group-in-Group Policy Optimization for LLM Agent Training
par: Feng, Lang, et autres
Publié: (2025)
par: Feng, Lang, et autres
Publié: (2025)
AURO: Reinforcement Learning for Adaptive User Retention Optimization in Recommender Systems
par: Xue, Zhenghai, et autres
Publié: (2023)
par: Xue, Zhenghai, et autres
Publié: (2023)
Two-Stage Constrained Actor-Critic for Short Video Recommendation
par: Cai, Qingpeng, et autres
Publié: (2023)
par: Cai, Qingpeng, et autres
Publié: (2023)
Symmetric Behavior Regularized Policy Optimization
par: Zhu, Lingwei, et autres
Publié: (2025)
par: Zhu, Lingwei, et autres
Publié: (2025)
Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards
par: He, Haoran, et autres
Publié: (2025)
par: He, Haoran, et autres
Publié: (2025)
Regularized Offline Policy Optimization with Posterior Hybrid Bayesian Belief
par: Lin, Hongqiang, et autres
Publié: (2026)
par: Lin, Hongqiang, et autres
Publié: (2026)
Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization
par: Su, Zhenpeng, et autres
Publié: (2025)
par: Su, Zhenpeng, et autres
Publié: (2025)
Ratio-Variance Regularized Policy Optimization for Efficient LLM Fine-tuning
par: Luo, Yu, et autres
Publié: (2026)
par: Luo, Yu, et autres
Publié: (2026)
Complexity-Regularized Proximal Policy Optimization
par: Serfilippi, Luca, et autres
Publié: (2025)
par: Serfilippi, Luca, et autres
Publié: (2025)
Federated Offline Policy Optimization with Dual Regularization
par: Yue, Sheng, et autres
Publié: (2024)
par: Yue, Sheng, et autres
Publié: (2024)
Beyond State-Wise Mirror Descent: Offline Policy Optimization with Parametric Policies
par: Li, Xiang, et autres
Publié: (2026)
par: Li, Xiang, et autres
Publié: (2026)
REG: A Regularization Optimizer for Robust Training Dynamics
par: Liu, Zehua, et autres
Publié: (2025)
par: Liu, Zehua, et autres
Publié: (2025)
Adaptive Divergence Regularized Policy Optimization for Fine-tuning Generative Models
par: Fan, Jiajun, et autres
Publié: (2025)
par: Fan, Jiajun, et autres
Publié: (2025)
CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR
par: Cui, Sijia, et autres
Publié: (2026)
par: Cui, Sijia, et autres
Publié: (2026)
A Variance-Reduced Cubic-Regularized Newton for Policy Optimization
par: Sun, Cheng, et autres
Publié: (2025)
par: Sun, Cheng, et autres
Publié: (2025)
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
par: Gao, Chen-Xiao, et autres
Publié: (2025)
par: Gao, Chen-Xiao, et autres
Publié: (2025)
EvaDrive: Evolutionary Adversarial Policy Optimization for End-to-End Autonomous Driving
par: Jiao, Siwen, et autres
Publié: (2025)
par: Jiao, Siwen, et autres
Publié: (2025)
The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL
par: Li, Yingru, et autres
Publié: (2026)
par: Li, Yingru, et autres
Publié: (2026)
OMPO: A Unified Framework for RL under Policy and Dynamics Shifts
par: Luo, Yu, et autres
Publié: (2024)
par: Luo, Yu, et autres
Publié: (2024)
Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement
par: Wen, Muning, et autres
Publié: (2024)
par: Wen, Muning, et autres
Publié: (2024)
Optimistic Policy Regularization
par: Pham, Mai, et autres
Publié: (2026)
par: Pham, Mai, et autres
Publié: (2026)
FAAR: Format-Aware Adaptive Rounding for NVFP4
par: Li, Hanglin, et autres
Publié: (2026)
par: Li, Hanglin, et autres
Publié: (2026)
Rethinking Distribution Shifts: Empirical Analysis and Inductive Modeling for Tabular Data
par: Wang, Tianyu, et autres
Publié: (2023)
par: Wang, Tianyu, et autres
Publié: (2023)
LLM-Based Scientific Equation Discovery via Physics-Informed Token-Regularized Policy Optimization
par: Wang, Boxiao, et autres
Publié: (2026)
par: Wang, Boxiao, et autres
Publié: (2026)
ECPO: Evidence-Coupled Policy Optimization for Evidence-Certified Candidate Ranking
par: Hu, Miaobo, et autres
Publié: (2026)
par: Hu, Miaobo, et autres
Publié: (2026)
Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization
par: Zhu, Haodong, et autres
Publié: (2026)
par: Zhu, Haodong, et autres
Publié: (2026)
Displacement-Sparse Neural Optimal Transport
par: Chen, Peter, et autres
Publié: (2025)
par: Chen, Peter, et autres
Publié: (2025)
Revisiting Regularized Policy Optimization for Stable and Efficient Reinforcement Learning in Two-Player Games
par: Ota, Kazuki, et autres
Publié: (2026)
par: Ota, Kazuki, et autres
Publié: (2026)
Composite Flow Matching for Reinforcement Learning with Shifted-Dynamics Data
par: Kong, Lingkai, et autres
Publié: (2025)
par: Kong, Lingkai, et autres
Publié: (2025)
Conditional Quantile Estimation for Uncertain Watch Time in Short-Video Recommendation
par: Lin, Chengzhi, et autres
Publié: (2024)
par: Lin, Chengzhi, et autres
Publié: (2024)
Addressing Label Shift in Distributed Learning via Entropy Regularization
par: Wu, Zhiyuan, et autres
Publié: (2025)
par: Wu, Zhiyuan, et autres
Publié: (2025)
Latent Adversarial Regularization for Offline Preference Optimization
par: Jiang, Enyi, et autres
Publié: (2026)
par: Jiang, Enyi, et autres
Publié: (2026)
How to Allocate, How to Learn? Dynamic Rollout Allocation and Advantage Modulation for Policy Optimization
par: Fang, Yangyi, et autres
Publié: (2026)
par: Fang, Yangyi, et autres
Publié: (2026)
LFPO: Likelihood-Free Policy Optimization for Masked Diffusion Models
par: Wei, Chenxing, et autres
Publié: (2026)
par: Wei, Chenxing, et autres
Publié: (2026)
Agentic Entropy-Balanced Policy Optimization
par: Dong, Guanting, et autres
Publié: (2025)
par: Dong, Guanting, et autres
Publié: (2025)
Post-Training is About States, Not Tokens: A State Distribution View of SFT, RL, and On-Policy Distillation
par: Nie, Dong
Publié: (2026)
par: Nie, Dong
Publié: (2026)
Learning Regularizers: Learning Optimizers that can Regularize
par: Sahoo, Suraj Kumar, et autres
Publié: (2025)
par: Sahoo, Suraj Kumar, et autres
Publié: (2025)
Spectral Invariant Learning for Dynamic Graphs under Distribution Shifts
par: Zhang, Zeyang, et autres
Publié: (2024)
par: Zhang, Zeyang, et autres
Publié: (2024)
Asymmetric Proximal Policy Optimization: mini-critics boost LLM reasoning
par: Liu, Jiashun, et autres
Publié: (2025)
par: Liu, Jiashun, et autres
Publié: (2025)
Documents similaires
-
Policy Regularization on Globally Accessible States in Cross-Dynamics Reinforcement Learning
par: Xue, Zhenghai, et autres
Publié: (2025) -
Group-in-Group Policy Optimization for LLM Agent Training
par: Feng, Lang, et autres
Publié: (2025) -
AURO: Reinforcement Learning for Adaptive User Retention Optimization in Recommender Systems
par: Xue, Zhenghai, et autres
Publié: (2023) -
Two-Stage Constrained Actor-Critic for Short Video Recommendation
par: Cai, Qingpeng, et autres
Publié: (2023) -
Symmetric Behavior Regularized Policy Optimization
par: Zhu, Lingwei, et autres
Publié: (2025)