Uni-O4: Unifying Online and Offline Deep Reinforcement Learning with Multi-Step On-Policy Optimization
Fuente:
arXiv
Saved in:
| Main Authors: | Lei, Kun, He, Zhengmao, Lu, Chenhao, Hu, Kaizhe, Gao, Yang, Xu, Huazhe |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Failure-Aware RL: Reliable Offline-to-Online Reinforcement Learning with Self-Recovery for Real-World Manipulation
by: Li, Huanyu, et al.
Published: (2026)
by: Li, Huanyu, et al.
Published: (2026)
Learning Visual Quadrupedal Loco-Manipulation from Demonstrations
by: He, Zhengmao, et al.
Published: (2024)
by: He, Zhengmao, et al.
Published: (2024)
Beyond Action Residuals: Real-World Robot Policy Steering via Bottleneck Latent Reinforcement Learning
by: Yu, Dongjie, et al.
Published: (2026)
by: Yu, Dongjie, et al.
Published: (2026)
Stem-OB: Generalizable Visual Imitation Learning with Stem-Like Convergent Observation through Diffusion Inversion
by: Hu, Kaizhe, et al.
Published: (2024)
by: Hu, Kaizhe, et al.
Published: (2024)
ArrayBot: Reinforcement Learning for Generalizable Distributed Manipulation through Touch
by: Xue, Zhengrong, et al.
Published: (2023)
by: Xue, Zhengrong, et al.
Published: (2023)
AffordGen: Generating Diverse Demonstrations for Generalizable Object Manipulation with Afford Correspondence
by: Zhang, Jiawei, et al.
Published: (2026)
by: Zhang, Jiawei, et al.
Published: (2026)
Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning
by: Gireesh, Nandiraju, et al.
Published: (2026)
by: Gireesh, Nandiraju, et al.
Published: (2026)
Robo-ABC: Affordance Generalization Beyond Categories via Semantic Correspondence for Robot Manipulation
by: Ju, Yuanchen, et al.
Published: (2024)
by: Ju, Yuanchen, et al.
Published: (2024)
Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control
by: Gao, Yuxuan, et al.
Published: (2026)
by: Gao, Yuxuan, et al.
Published: (2026)
DenseMatcher: Learning 3D Semantic Correspondence for Category-Level Manipulation from a Single Demo
by: Zhu, Junzhe, et al.
Published: (2024)
by: Zhu, Junzhe, et al.
Published: (2024)
MENTOR: Mixture-of-Experts Network with Task-Oriented Perturbation for Visual Reinforcement Learning
by: Huang, Suning, et al.
Published: (2024)
by: Huang, Suning, et al.
Published: (2024)
Diffusion Policies with Value-Conditional Optimization for Offline Reinforcement Learning
by: Ma, Yunchang, et al.
Published: (2025)
by: Ma, Yunchang, et al.
Published: (2025)
Robot Trains Robot: Automatic Real-World Policy Adaptation and Learning for Humanoids
by: Hu, Kaizhe, et al.
Published: (2025)
by: Hu, Kaizhe, et al.
Published: (2025)
Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning
by: Liu, Tenglong, et al.
Published: (2024)
by: Liu, Tenglong, et al.
Published: (2024)
UniJEPA: Enhancing Robot Policy via Unified Continuous and Discrete Representation Learning
by: Zhang, Jianke, et al.
Published: (2025)
by: Zhang, Jianke, et al.
Published: (2025)
DA-MMP: Learning Coordinated and Accurate Throwing with Dynamics-Aware Motion Manifold Primitives
by: Chu, Chi, et al.
Published: (2025)
by: Chu, Chi, et al.
Published: (2025)
DemoSpeedup: Accelerating Visuomotor Policies via Entropy-Guided Demonstration Acceleration
by: Guo, Lingxiao, et al.
Published: (2025)
by: Guo, Lingxiao, et al.
Published: (2025)
UniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human Videos
by: Zhang, Gu, et al.
Published: (2026)
by: Zhang, Gu, et al.
Published: (2026)
UniLCD: Unified Local-Cloud Decision-Making via Reinforcement Learning
by: Sengupta, Kathakoli, et al.
Published: (2024)
by: Sengupta, Kathakoli, et al.
Published: (2024)
RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking
by: Choi, Andrew, et al.
Published: (2026)
by: Choi, Andrew, et al.
Published: (2026)
UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling
by: Chen, Boyu, et al.
Published: (2026)
by: Chen, Boyu, et al.
Published: (2026)
Residual Learning and Context Encoding for Adaptive Offline-to-Online Reinforcement Learning
by: Nakhaei, Mohammadreza, et al.
Published: (2024)
by: Nakhaei, Mohammadreza, et al.
Published: (2024)
Uncertainty-Aware Robotic World Model Makes Offline Model-Based Reinforcement Learning Work on Real Robots
by: Li, Chenhao, et al.
Published: (2025)
by: Li, Chenhao, et al.
Published: (2025)
Conservative Offline Robot Policy Learning via Posterior-Transition Reweighting
by: Zhang, Wanpeng, et al.
Published: (2026)
by: Zhang, Wanpeng, et al.
Published: (2026)
UniMSF: A Unified Multi-Sensor Fusion Framework for Intelligent Transportation System Global Localization
by: Liu, Wei, et al.
Published: (2024)
by: Liu, Wei, et al.
Published: (2024)
DemoGen: Synthetic Demonstration Generation for Data-Efficient Visuomotor Policy Learning
by: Xue, Zhengrong, et al.
Published: (2025)
by: Xue, Zhengrong, et al.
Published: (2025)
RL-100: Performant Robotic Manipulation with Real-World Reinforcement Learning
by: Lei, Kun, et al.
Published: (2025)
by: Lei, Kun, et al.
Published: (2025)
3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
by: Ze, Yanjie, et al.
Published: (2024)
by: Ze, Yanjie, et al.
Published: (2024)
ENOTO: Improving Offline-to-Online Reinforcement Learning with Q-Ensembles
by: Zhao, Kai, et al.
Published: (2023)
by: Zhao, Kai, et al.
Published: (2023)
Adversarial Fine-tuning in Offline-to-Online Reinforcement Learning for Robust Robot Control
by: Ayabe, Shingo, et al.
Published: (2025)
by: Ayabe, Shingo, et al.
Published: (2025)
Offline Goal-Conditioned Reinforcement Learning for Safety-Critical Tasks with Recovery Policy
by: Cao, Chenyang, et al.
Published: (2024)
by: Cao, Chenyang, et al.
Published: (2024)
What Matters for Simulation to Online Reinforcement Learning on Real Robots
by: As, Yarden, et al.
Published: (2026)
by: As, Yarden, et al.
Published: (2026)
Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation
by: Xue, Han, et al.
Published: (2025)
by: Xue, Han, et al.
Published: (2025)
DOGlove: Dexterous Manipulation with a Low-Cost Open-Source Haptic Force Feedback Glove
by: Zhang, Han, et al.
Published: (2025)
by: Zhang, Han, et al.
Published: (2025)
ORION: Option-Regularized Deep Reinforcement Learning for Cooperative Multi-Agent Online Navigation
by: Zhang, Shizhe, et al.
Published: (2026)
by: Zhang, Shizhe, et al.
Published: (2026)
UniGraspTransformer: Simplified Policy Distillation for Scalable Dexterous Robotic Grasping
by: Wang, Wenbo, et al.
Published: (2024)
by: Wang, Wenbo, et al.
Published: (2024)
VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation
by: Zhong, Zhide, et al.
Published: (2026)
by: Zhong, Zhide, et al.
Published: (2026)
BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models
by: Chen, Zhongxi, et al.
Published: (2026)
by: Chen, Zhongxi, et al.
Published: (2026)
Hybrid Offline-Online Reinforcement Learning for Sensorless, High-Precision Force Regulation in Surgical Robotic Grasping
by: Fazzari, Edoardo, et al.
Published: (2026)
by: Fazzari, Edoardo, et al.
Published: (2026)
Equivariant Offline Reinforcement Learning
by: Tangri, Arsh, et al.
Published: (2024)
by: Tangri, Arsh, et al.
Published: (2024)
Similar Items
-
Failure-Aware RL: Reliable Offline-to-Online Reinforcement Learning with Self-Recovery for Real-World Manipulation
by: Li, Huanyu, et al.
Published: (2026) -
Learning Visual Quadrupedal Loco-Manipulation from Demonstrations
by: He, Zhengmao, et al.
Published: (2024) -
Beyond Action Residuals: Real-World Robot Policy Steering via Bottleneck Latent Reinforcement Learning
by: Yu, Dongjie, et al.
Published: (2026) -
Stem-OB: Generalizable Visual Imitation Learning with Stem-Like Convergent Observation through Diffusion Inversion
by: Hu, Kaizhe, et al.
Published: (2024) -
ArrayBot: Reinforcement Learning for Generalizable Distributed Manipulation through Touch
by: Xue, Zhengrong, et al.
Published: (2023)