Offline Actor-Critic Reinforcement Learning Scales to Large Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Springenberg, Jost Tobias, Abdolmaleki, Abbas, Zhang, Jingwei, Groth, Oliver, Bloesch, Michael, Lampe, Thomas, Brakel, Philemon, Bechtle, Sarah, Kapturowski, Steven, Hafner, Roland, Heess, Nicolas, Riedmiller, Martin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Value from Observations: Towards Large-Scale Imitation Learning via Self-Improvement
von: Bloesch, Michael, et al.
Veröffentlicht: (2025)
von: Bloesch, Michael, et al.
Veröffentlicht: (2025)
Game On: Towards Language Models as RL Experimenters
von: Zhang, Jingwei, et al.
Veröffentlicht: (2024)
von: Zhang, Jingwei, et al.
Veröffentlicht: (2024)
Learning from negative feedback, or positive feedback or both
von: Abdolmaleki, Abbas, et al.
Veröffentlicht: (2024)
von: Abdolmaleki, Abbas, et al.
Veröffentlicht: (2024)
Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)
von: Qin, Chongli, et al.
Veröffentlicht: (2025)
von: Qin, Chongli, et al.
Veröffentlicht: (2025)
Imitating Language via Scalable Inverse Reinforcement Learning
von: Wulfmeier, Markus, et al.
Veröffentlicht: (2024)
von: Wulfmeier, Markus, et al.
Veröffentlicht: (2024)
Exploiting Policy Idling for Dexterous Manipulation
von: Chen, Annie S., et al.
Veröffentlicht: (2025)
von: Chen, Annie S., et al.
Veröffentlicht: (2025)
Less is more -- the Dispatcher/ Executor principle for multi-task Reinforcement Learning
von: Riedmiller, Martin, et al.
Veröffentlicht: (2023)
von: Riedmiller, Martin, et al.
Veröffentlicht: (2023)
NFQ2.0: The CartPole Benchmark Revisited
von: Lange, Sascha, et al.
Veröffentlicht: (2025)
von: Lange, Sascha, et al.
Veröffentlicht: (2025)
Real-World Fluid Directed Rigid Body Control via Deep Reinforcement Learning
von: Bhardwaj, Mohak, et al.
Veröffentlicht: (2024)
von: Bhardwaj, Mohak, et al.
Veröffentlicht: (2024)
Flow Actor-Critic for Offline Reinforcement Learning
von: Chae, Jongseong, et al.
Veröffentlicht: (2026)
von: Chae, Jongseong, et al.
Veröffentlicht: (2026)
Adversarially Trained Weighted Actor-Critic for Safe Offline Reinforcement Learning
von: Wei, Honghao, et al.
Veröffentlicht: (2024)
von: Wei, Honghao, et al.
Veröffentlicht: (2024)
Proximal Action Replacement for Behavior Cloning Actor-Critic in Offline Reinforcement Learning
von: Dong, Jinzong, et al.
Veröffentlicht: (2026)
von: Dong, Jinzong, et al.
Veröffentlicht: (2026)
Inshore-offshore sedimentation differences resulting from resuspension in the Eastern Basin of Lake Erie
von: Bloesch, J
Veröffentlicht: (1978)
von: Bloesch, J
Veröffentlicht: (1978)
Private sector investment in Marine Protected Areas-Experiences of the Chumbe Island Coral Park in Zanzibar/Tanzania
von: Riedmiller, S.
Veröffentlicht: (2003)
von: Riedmiller, S.
Veröffentlicht: (2003)
Private Sector Management of Marine Protected Areas: The Chumbe Island Case
von: Riedmiller, S.
Veröffentlicht: (2000)
von: Riedmiller, S.
Veröffentlicht: (2000)
Actor-Critic Reinforcement Learning with Phased Actor
von: Wu, Ruofan, et al.
Veröffentlicht: (2024)
von: Wu, Ruofan, et al.
Veröffentlicht: (2024)
Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning
von: Moghimi, Mehrdad, et al.
Veröffentlicht: (2025)
von: Moghimi, Mehrdad, et al.
Veröffentlicht: (2025)
Pareto-Optimal Offline Reinforcement Learning via Smooth Tchebysheff Scalarization
von: Bhatnagar, Aadyot, et al.
Veröffentlicht: (2026)
von: Bhatnagar, Aadyot, et al.
Veröffentlicht: (2026)
Diffusion Actor-Critic: Formulating Constrained Policy Iteration as Diffusion Noise Regression for Offline Reinforcement Learning
von: Fang, Linjiajie, et al.
Veröffentlicht: (2024)
von: Fang, Linjiajie, et al.
Veröffentlicht: (2024)
SMAC: Score-Matched Actor-Critics for Robust Offline-to-Online Transfer
von: de Lara, Nathan Samuel, et al.
Veröffentlicht: (2026)
von: de Lara, Nathan Samuel, et al.
Veröffentlicht: (2026)
Risk-Sensitive Soft Actor-Critic for Robust Deep Reinforcement Learning under Distribution Shifts
von: Enders, Tobias, et al.
Veröffentlicht: (2024)
von: Enders, Tobias, et al.
Veröffentlicht: (2024)
FORLER: Federated Offline Reinforcement Learning with Q-Ensemble and Actor Rectification
von: Qiao, Nan, et al.
Veröffentlicht: (2026)
von: Qiao, Nan, et al.
Veröffentlicht: (2026)
Quantum Advantage Actor-Critic for Reinforcement Learning
von: Kölle, Michael, et al.
Veröffentlicht: (2024)
von: Kölle, Michael, et al.
Veröffentlicht: (2024)
DemoStart: Demonstration-led auto-curriculum applied to sim-to-real with multi-fingered robots
von: Bauza, Maria, et al.
Veröffentlicht: (2024)
von: Bauza, Maria, et al.
Veröffentlicht: (2024)
RL Token: Bootstrapping Online RL with Vision-Language-Action Models
von: Xu, Charles, et al.
Veröffentlicht: (2026)
von: Xu, Charles, et al.
Veröffentlicht: (2026)
Actor-Critic without Actor
von: Ki, Donghyeon, et al.
Veröffentlicht: (2025)
von: Ki, Donghyeon, et al.
Veröffentlicht: (2025)
Zostera marina wasting disease index of Labyrinthula zosterae inoculated plants at two nutrient levels
von: Brakel, Janina
Veröffentlicht: (2016)
von: Brakel, Janina
Veröffentlicht: (2016)
Zostera marina gene expression of Labyrinthula zosterae inoculated plants at two nutrient levels
von: Brakel, Janina
Veröffentlicht: (2016)
von: Brakel, Janina
Veröffentlicht: (2016)
Heatwave experiment in Kiel Outdoor Benthocosms, 2015: Labyrinthula zosterae abundance in eelgrass tissue
von: Brakel, Janina
Veröffentlicht: (2019)
von: Brakel, Janina
Veröffentlicht: (2019)
Zostera marina growth parameters of Labyrinthula zosterae inoculated plants at two nutrient levels
von: Brakel, Janina
Veröffentlicht: (2016)
von: Brakel, Janina
Veröffentlicht: (2016)
Pretraining in Actor-Critic Reinforcement Learning for Robot Locomotion
von: Fan, Jiale, et al.
Veröffentlicht: (2025)
von: Fan, Jiale, et al.
Veröffentlicht: (2025)
Trajectory-Level Data Augmentation for Offline Reinforcement Learning
von: Schmähling, Tobias, et al.
Veröffentlicht: (2026)
von: Schmähling, Tobias, et al.
Veröffentlicht: (2026)
Towards Optimal Offline Reinforcement Learning
von: Li, Mengmeng, et al.
Veröffentlicht: (2025)
von: Li, Mengmeng, et al.
Veröffentlicht: (2025)
Actor-Critic Pretraining for Proximal Policy Optimization
von: Kernbach, Andreas, et al.
Veröffentlicht: (2026)
von: Kernbach, Andreas, et al.
Veröffentlicht: (2026)
SHAP-Guided Kernel Actor-Critic for Explainable Reinforcement Learning
von: Li, Na, et al.
Veröffentlicht: (2025)
von: Li, Na, et al.
Veröffentlicht: (2025)
Wasserstein Adaptive Value Estimation for Actor-Critic Reinforcement Learning
von: Baheri, Ali, et al.
Veröffentlicht: (2025)
von: Baheri, Ali, et al.
Veröffentlicht: (2025)
Broad Critic Deep Actor Reinforcement Learning for Continuous Control
von: Thalagala, Shiron, et al.
Veröffentlicht: (2024)
von: Thalagala, Shiron, et al.
Veröffentlicht: (2024)
Studying the Interplay Between the Actor and Critic Representations in Reinforcement Learning
von: Garcin, Samuel, et al.
Veröffentlicht: (2025)
von: Garcin, Samuel, et al.
Veröffentlicht: (2025)
Decorrelated Soft Actor-Critic for Efficient Deep Reinforcement Learning
von: Küçükoğlu, Burcu, et al.
Veröffentlicht: (2025)
von: Küçükoğlu, Burcu, et al.
Veröffentlicht: (2025)
Physics-Guided Actor-Critic Reinforcement Learning for Swimming in Turbulence
von: Koh, Christopher, et al.
Veröffentlicht: (2024)
von: Koh, Christopher, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Value from Observations: Towards Large-Scale Imitation Learning via Self-Improvement
von: Bloesch, Michael, et al.
Veröffentlicht: (2025) -
Game On: Towards Language Models as RL Experimenters
von: Zhang, Jingwei, et al.
Veröffentlicht: (2024) -
Learning from negative feedback, or positive feedback or both
von: Abdolmaleki, Abbas, et al.
Veröffentlicht: (2024) -
Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)
von: Qin, Chongli, et al.
Veröffentlicht: (2025) -
Imitating Language via Scalable Inverse Reinforcement Learning
von: Wulfmeier, Markus, et al.
Veröffentlicht: (2024)