OMPO: A Unified Framework for RL under Policy and Dynamics Shifts
Fuente:
arXiv
Guardado en:
| Autores principales: | Luo, Yu, Ji, Tianying, Sun, Fuchun, Zhang, Jianwei, Xu, Huazhe, Zhan, Xianyuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Offline-Boosted Actor-Critic: Adaptively Blending Optimal Historical Behaviors in Deep Off-Policy RL
por: Luo, Yu, et al.
Publicado: (2024)
por: Luo, Yu, et al.
Publicado: (2024)
Seizing Serendipity: Exploiting the Value of Past Success in Off-Policy Actor-Critic
por: Ji, Tianying, et al.
Publicado: (2023)
por: Ji, Tianying, et al.
Publicado: (2023)
Bidirectional-Reachable Hierarchical Reinforcement Learning with Mutually Responsive Policies
por: Luo, Yu, et al.
Publicado: (2024)
por: Luo, Yu, et al.
Publicado: (2024)
ACE : Off-Policy Actor-Critic with Causality-Aware Entropy Regularization
por: Ji, Tianying, et al.
Publicado: (2024)
por: Ji, Tianying, et al.
Publicado: (2024)
H2O+: An Improved Framework for Hybrid Offline-and-Online RL with Dynamics Gaps
por: Niu, Haoyi, et al.
Publicado: (2023)
por: Niu, Haoyi, et al.
Publicado: (2023)
FLAC: Maximum Entropy RL via Kinetic Energy Regularized Bridge Matching
por: Lv, Lei, et al.
Publicado: (2026)
por: Lv, Lei, et al.
Publicado: (2026)
Are Expressive Models Truly Necessary for Offline RL?
por: Wang, Guan, et al.
Publicado: (2024)
por: Wang, Guan, et al.
Publicado: (2024)
A Comprehensive Survey of Cross-Domain Policy Transfer for Embodied Agents
por: Niu, Haoyi, et al.
Publicado: (2024)
por: Niu, Haoyi, et al.
Publicado: (2024)
Flow-Based Policy for Online Reinforcement Learning
por: Lv, Lei, et al.
Publicado: (2025)
por: Lv, Lei, et al.
Publicado: (2025)
RoboGolf: Mastering Real-World Minigolf with a Reflective Multi-Modality Vision-Language Model
por: Zhou, Hantao, et al.
Publicado: (2024)
por: Zhou, Hantao, et al.
Publicado: (2024)
Dynamics-Aligned Shared Hypernetworks for Contextual RL under Discontinuous Shifts
por: Benad, Jan, et al.
Publicado: (2026)
por: Benad, Jan, et al.
Publicado: (2026)
ODICE: Revealing the Mystery of Distribution Correction Estimation via Orthogonal-gradient Update
por: Mao, Liyuan, et al.
Publicado: (2024)
por: Mao, Liyuan, et al.
Publicado: (2024)
Adaptive Layerwise Perturbation: Unifying Off-Policy Corrections for LLM RL
por: Ye, Chenlu, et al.
Publicado: (2026)
por: Ye, Chenlu, et al.
Publicado: (2026)
Diffusion-DICE: In-Sample Diffusion Guidance for Offline Reinforcement Learning
por: Mao, Liyuan, et al.
Publicado: (2024)
por: Mao, Liyuan, et al.
Publicado: (2024)
Towards Robust Zero-Shot Reinforcement Learning
por: Zheng, Kexin, et al.
Publicado: (2025)
por: Zheng, Kexin, et al.
Publicado: (2025)
Learning by Doing: An Online Causal Reinforcement Learning Framework with Causal-Aware Policy
por: Cai, Ruichu, et al.
Publicado: (2024)
por: Cai, Ruichu, et al.
Publicado: (2024)
Scrutinize What We Ignore: Reining In Task Representation Shift Of Context-Based Offline Meta Reinforcement Learning
por: Zhang, Hai, et al.
Publicado: (2024)
por: Zhang, Hai, et al.
Publicado: (2024)
A Unified Framework for Rethinking Policy Divergence Measures in GRPO
por: Wu, Qingyuan, et al.
Publicado: (2026)
por: Wu, Qingyuan, et al.
Publicado: (2026)
Subequivariant Reinforcement Learning in 3D Multi-Entity Physical Environments
por: Chen, Runfa, et al.
Publicado: (2024)
por: Chen, Runfa, et al.
Publicado: (2024)
RL-100: Performant Robotic Manipulation with Real-World Reinforcement Learning
por: Lei, Kun, et al.
Publicado: (2025)
por: Lei, Kun, et al.
Publicado: (2025)
On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting
por: Zhang, Wenhao, et al.
Publicado: (2025)
por: Zhang, Wenhao, et al.
Publicado: (2025)
Policy Learning for Off-Dynamics RL with Deficient Support
por: Van, Linh Le Pham, et al.
Publicado: (2024)
por: Van, Linh Le Pham, et al.
Publicado: (2024)
BlendRL: A Framework for Merging Symbolic and Neural Policy Learning
por: Shindo, Hikaru, et al.
Publicado: (2024)
por: Shindo, Hikaru, et al.
Publicado: (2024)
When to Trust Your Simulator: Dynamics-Aware Hybrid Offline-and-Online Reinforcement Learning
por: Niu, Haoyi, et al.
Publicado: (2022)
por: Niu, Haoyi, et al.
Publicado: (2022)
Failure-Aware RL: Reliable Offline-to-Online Reinforcement Learning with Self-Recovery for Real-World Manipulation
por: Li, Huanyu, et al.
Publicado: (2026)
por: Li, Huanyu, et al.
Publicado: (2026)
Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation
por: Xue, Han, et al.
Publicado: (2025)
por: Xue, Han, et al.
Publicado: (2025)
Spectral Invariant Learning for Dynamic Graphs under Distribution Shifts
por: Zhang, Zeyang, et al.
Publicado: (2024)
por: Zhang, Zeyang, et al.
Publicado: (2024)
State Regularized Policy Optimization on Data with Dynamics Shift
por: Xue, Zhenghai, et al.
Publicado: (2023)
por: Xue, Zhenghai, et al.
Publicado: (2023)
Robust Policy Expansion for Offline-to-Online RL under Diverse Data Corruption
por: He, Longxiang, et al.
Publicado: (2025)
por: He, Longxiang, et al.
Publicado: (2025)
Mirror Learning: A Unifying Framework of Policy Optimisation
por: Kuba, Jakub Grudzien, et al.
Publicado: (2022)
por: Kuba, Jakub Grudzien, et al.
Publicado: (2022)
Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS
por: Jin, Can, et al.
Publicado: (2025)
por: Jin, Can, et al.
Publicado: (2025)
Rethinking Adversarial Policies: A Generalized Attack Formulation and Provable Defense in RL
por: Liu, Xiangyu, et al.
Publicado: (2023)
por: Liu, Xiangyu, et al.
Publicado: (2023)
An Empirical Study on the Effectiveness of Incorporating Offline RL As Online RL Subroutines
por: Su, Jianhai, et al.
Publicado: (2025)
por: Su, Jianhai, et al.
Publicado: (2025)
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
por: Cohen, Taco, et al.
Publicado: (2025)
por: Cohen, Taco, et al.
Publicado: (2025)
When Are Learning Biases Equivalent? A Unifying Framework for Fairness, Robustness, and Distribution Shift
por: Mehta, Sushant
Publicado: (2025)
por: Mehta, Sushant
Publicado: (2025)
Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
por: Mark, Max Sobol, et al.
Publicado: (2024)
por: Mark, Max Sobol, et al.
Publicado: (2024)
AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training
por: Han, Zhenyu, et al.
Publicado: (2025)
por: Han, Zhenyu, et al.
Publicado: (2025)
Accelerating RL for LLM Reasoning with Optimal Advantage Regression
por: Brantley, Kianté, et al.
Publicado: (2025)
por: Brantley, Kianté, et al.
Publicado: (2025)
Calibrating and Rotating: A Unified Framework for Weight Conditioning in PEFT
por: Chang, Da, et al.
Publicado: (2025)
por: Chang, Da, et al.
Publicado: (2025)
Partial Policy Gradients for RL in LLMs
por: Mathur, Puneet, et al.
Publicado: (2026)
por: Mathur, Puneet, et al.
Publicado: (2026)
Ejemplares similares
-
Offline-Boosted Actor-Critic: Adaptively Blending Optimal Historical Behaviors in Deep Off-Policy RL
por: Luo, Yu, et al.
Publicado: (2024) -
Seizing Serendipity: Exploiting the Value of Past Success in Off-Policy Actor-Critic
por: Ji, Tianying, et al.
Publicado: (2023) -
Bidirectional-Reachable Hierarchical Reinforcement Learning with Mutually Responsive Policies
por: Luo, Yu, et al.
Publicado: (2024) -
ACE : Off-Policy Actor-Critic with Causality-Aware Entropy Regularization
por: Ji, Tianying, et al.
Publicado: (2024) -
H2O+: An Improved Framework for Hybrid Offline-and-Online RL with Dynamics Gaps
por: Niu, Haoyi, et al.
Publicado: (2023)