Uni-O4: Unifying Online and Offline Deep Reinforcement Learning with Multi-Step On-Policy Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lei, Kun, He, Zhengmao, Lu, Chenhao, Hu, Kaizhe, Gao, Yang, Xu, Huazhe |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Failure-Aware RL: Reliable Offline-to-Online Reinforcement Learning with Self-Recovery for Real-World Manipulation
par: Li, Huanyu, et autres
Publié: (2026)
par: Li, Huanyu, et autres
Publié: (2026)
Learning Visual Quadrupedal Loco-Manipulation from Demonstrations
par: He, Zhengmao, et autres
Publié: (2024)
par: He, Zhengmao, et autres
Publié: (2024)
Beyond Action Residuals: Real-World Robot Policy Steering via Bottleneck Latent Reinforcement Learning
par: Yu, Dongjie, et autres
Publié: (2026)
par: Yu, Dongjie, et autres
Publié: (2026)
Stem-OB: Generalizable Visual Imitation Learning with Stem-Like Convergent Observation through Diffusion Inversion
par: Hu, Kaizhe, et autres
Publié: (2024)
par: Hu, Kaizhe, et autres
Publié: (2024)
ArrayBot: Reinforcement Learning for Generalizable Distributed Manipulation through Touch
par: Xue, Zhengrong, et autres
Publié: (2023)
par: Xue, Zhengrong, et autres
Publié: (2023)
AffordGen: Generating Diverse Demonstrations for Generalizable Object Manipulation with Afford Correspondence
par: Zhang, Jiawei, et autres
Publié: (2026)
par: Zhang, Jiawei, et autres
Publié: (2026)
Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning
par: Gireesh, Nandiraju, et autres
Publié: (2026)
par: Gireesh, Nandiraju, et autres
Publié: (2026)
Robo-ABC: Affordance Generalization Beyond Categories via Semantic Correspondence for Robot Manipulation
par: Ju, Yuanchen, et autres
Publié: (2024)
par: Ju, Yuanchen, et autres
Publié: (2024)
Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control
par: Gao, Yuxuan, et autres
Publié: (2026)
par: Gao, Yuxuan, et autres
Publié: (2026)
DenseMatcher: Learning 3D Semantic Correspondence for Category-Level Manipulation from a Single Demo
par: Zhu, Junzhe, et autres
Publié: (2024)
par: Zhu, Junzhe, et autres
Publié: (2024)
MENTOR: Mixture-of-Experts Network with Task-Oriented Perturbation for Visual Reinforcement Learning
par: Huang, Suning, et autres
Publié: (2024)
par: Huang, Suning, et autres
Publié: (2024)
Diffusion Policies with Value-Conditional Optimization for Offline Reinforcement Learning
par: Ma, Yunchang, et autres
Publié: (2025)
par: Ma, Yunchang, et autres
Publié: (2025)
Robot Trains Robot: Automatic Real-World Policy Adaptation and Learning for Humanoids
par: Hu, Kaizhe, et autres
Publié: (2025)
par: Hu, Kaizhe, et autres
Publié: (2025)
Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning
par: Liu, Tenglong, et autres
Publié: (2024)
par: Liu, Tenglong, et autres
Publié: (2024)
UniJEPA: Enhancing Robot Policy via Unified Continuous and Discrete Representation Learning
par: Zhang, Jianke, et autres
Publié: (2025)
par: Zhang, Jianke, et autres
Publié: (2025)
DA-MMP: Learning Coordinated and Accurate Throwing with Dynamics-Aware Motion Manifold Primitives
par: Chu, Chi, et autres
Publié: (2025)
par: Chu, Chi, et autres
Publié: (2025)
DemoSpeedup: Accelerating Visuomotor Policies via Entropy-Guided Demonstration Acceleration
par: Guo, Lingxiao, et autres
Publié: (2025)
par: Guo, Lingxiao, et autres
Publié: (2025)
UniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human Videos
par: Zhang, Gu, et autres
Publié: (2026)
par: Zhang, Gu, et autres
Publié: (2026)
UniLCD: Unified Local-Cloud Decision-Making via Reinforcement Learning
par: Sengupta, Kathakoli, et autres
Publié: (2024)
par: Sengupta, Kathakoli, et autres
Publié: (2024)
RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking
par: Choi, Andrew, et autres
Publié: (2026)
par: Choi, Andrew, et autres
Publié: (2026)
UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling
par: Chen, Boyu, et autres
Publié: (2026)
par: Chen, Boyu, et autres
Publié: (2026)
Residual Learning and Context Encoding for Adaptive Offline-to-Online Reinforcement Learning
par: Nakhaei, Mohammadreza, et autres
Publié: (2024)
par: Nakhaei, Mohammadreza, et autres
Publié: (2024)
Uncertainty-Aware Robotic World Model Makes Offline Model-Based Reinforcement Learning Work on Real Robots
par: Li, Chenhao, et autres
Publié: (2025)
par: Li, Chenhao, et autres
Publié: (2025)
Conservative Offline Robot Policy Learning via Posterior-Transition Reweighting
par: Zhang, Wanpeng, et autres
Publié: (2026)
par: Zhang, Wanpeng, et autres
Publié: (2026)
UniMSF: A Unified Multi-Sensor Fusion Framework for Intelligent Transportation System Global Localization
par: Liu, Wei, et autres
Publié: (2024)
par: Liu, Wei, et autres
Publié: (2024)
DemoGen: Synthetic Demonstration Generation for Data-Efficient Visuomotor Policy Learning
par: Xue, Zhengrong, et autres
Publié: (2025)
par: Xue, Zhengrong, et autres
Publié: (2025)
RL-100: Performant Robotic Manipulation with Real-World Reinforcement Learning
par: Lei, Kun, et autres
Publié: (2025)
par: Lei, Kun, et autres
Publié: (2025)
3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
par: Ze, Yanjie, et autres
Publié: (2024)
par: Ze, Yanjie, et autres
Publié: (2024)
ENOTO: Improving Offline-to-Online Reinforcement Learning with Q-Ensembles
par: Zhao, Kai, et autres
Publié: (2023)
par: Zhao, Kai, et autres
Publié: (2023)
Adversarial Fine-tuning in Offline-to-Online Reinforcement Learning for Robust Robot Control
par: Ayabe, Shingo, et autres
Publié: (2025)
par: Ayabe, Shingo, et autres
Publié: (2025)
Offline Goal-Conditioned Reinforcement Learning for Safety-Critical Tasks with Recovery Policy
par: Cao, Chenyang, et autres
Publié: (2024)
par: Cao, Chenyang, et autres
Publié: (2024)
What Matters for Simulation to Online Reinforcement Learning on Real Robots
par: As, Yarden, et autres
Publié: (2026)
par: As, Yarden, et autres
Publié: (2026)
Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation
par: Xue, Han, et autres
Publié: (2025)
par: Xue, Han, et autres
Publié: (2025)
DOGlove: Dexterous Manipulation with a Low-Cost Open-Source Haptic Force Feedback Glove
par: Zhang, Han, et autres
Publié: (2025)
par: Zhang, Han, et autres
Publié: (2025)
ORION: Option-Regularized Deep Reinforcement Learning for Cooperative Multi-Agent Online Navigation
par: Zhang, Shizhe, et autres
Publié: (2026)
par: Zhang, Shizhe, et autres
Publié: (2026)
UniGraspTransformer: Simplified Policy Distillation for Scalable Dexterous Robotic Grasping
par: Wang, Wenbo, et autres
Publié: (2024)
par: Wang, Wenbo, et autres
Publié: (2024)
VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation
par: Zhong, Zhide, et autres
Publié: (2026)
par: Zhong, Zhide, et autres
Publié: (2026)
BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models
par: Chen, Zhongxi, et autres
Publié: (2026)
par: Chen, Zhongxi, et autres
Publié: (2026)
Hybrid Offline-Online Reinforcement Learning for Sensorless, High-Precision Force Regulation in Surgical Robotic Grasping
par: Fazzari, Edoardo, et autres
Publié: (2026)
par: Fazzari, Edoardo, et autres
Publié: (2026)
Equivariant Offline Reinforcement Learning
par: Tangri, Arsh, et autres
Publié: (2024)
par: Tangri, Arsh, et autres
Publié: (2024)
Documents similaires
-
Failure-Aware RL: Reliable Offline-to-Online Reinforcement Learning with Self-Recovery for Real-World Manipulation
par: Li, Huanyu, et autres
Publié: (2026) -
Learning Visual Quadrupedal Loco-Manipulation from Demonstrations
par: He, Zhengmao, et autres
Publié: (2024) -
Beyond Action Residuals: Real-World Robot Policy Steering via Bottleneck Latent Reinforcement Learning
par: Yu, Dongjie, et autres
Publié: (2026) -
Stem-OB: Generalizable Visual Imitation Learning with Stem-Like Convergent Observation through Diffusion Inversion
par: Hu, Kaizhe, et autres
Publié: (2024) -
ArrayBot: Reinforcement Learning for Generalizable Distributed Manipulation through Touch
par: Xue, Zhengrong, et autres
Publié: (2023)