Salvato in:
| Autori principali: | Wang, Tao, Herbert, Sylvia, Gao, Sicun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2405.17832 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improving Value Estimation Critically Enhances Vanilla Policy Gradient
di: Wang, Tao, et al.
Pubblicazione: (2025)
di: Wang, Tao, et al.
Pubblicazione: (2025)
Fractal Landscapes in Policy Optimization
di: Wang, Tao, et al.
Pubblicazione: (2023)
di: Wang, Tao, et al.
Pubblicazione: (2023)
Extremum-Seeking Action Selection for Accelerating Policy Optimization
di: Chang, Ya-Chien, et al.
Pubblicazione: (2024)
di: Chang, Ya-Chien, et al.
Pubblicazione: (2024)
Hamilton-Jacobi Reachability in Reinforcement Learning: A Survey
di: Ganai, Milan, et al.
Pubblicazione: (2024)
di: Ganai, Milan, et al.
Pubblicazione: (2024)
Value Functions for Temporal Logic: Optimal Policies and Safety Filters
di: So, Oswin, et al.
Pubblicazione: (2026)
di: So, Oswin, et al.
Pubblicazione: (2026)
Does "Do Differentiable Simulators Give Better Policy Gradients?'' Give Better Policy Gradients?
di: Onoda, Ku, et al.
Pubblicazione: (2026)
di: Onoda, Ku, et al.
Pubblicazione: (2026)
Rethinking Policy Diversity in Ensemble Policy Gradient in Large-Scale Reinforcement Learning
di: Shitanda, Naoki, et al.
Pubblicazione: (2026)
di: Shitanda, Naoki, et al.
Pubblicazione: (2026)
Optimal Control-Based Baseline for Guided Exploration in Policy Gradient Methods
di: Lyu, Xubo, et al.
Pubblicazione: (2020)
di: Lyu, Xubo, et al.
Pubblicazione: (2020)
Drifting Field Policy: A One-Step Generative Policy via Wasserstein Gradient Flow
di: Koo, Juil, et al.
Pubblicazione: (2026)
di: Koo, Juil, et al.
Pubblicazione: (2026)
Mitigating Suboptimality of Deterministic Policy Gradients in Complex Q-functions
di: Jain, Ayush, et al.
Pubblicazione: (2024)
di: Jain, Ayush, et al.
Pubblicazione: (2024)
Deep Policy Gradient Methods Without Batch Updates, Target Networks, or Replay Buffers
di: Vasan, Gautham, et al.
Pubblicazione: (2024)
di: Vasan, Gautham, et al.
Pubblicazione: (2024)
A Multi-Fidelity Control Variate Approach for Policy Gradient Estimation
di: Liu, Xinjie, et al.
Pubblicazione: (2025)
di: Liu, Xinjie, et al.
Pubblicazione: (2025)
When Maximum Entropy Misleads Policy Optimization
di: Zhang, Ruipeng, et al.
Pubblicazione: (2025)
di: Zhang, Ruipeng, et al.
Pubblicazione: (2025)
Enhancing Hardware Fault Tolerance in Machines with Reinforcement Learning Policy Gradient Algorithms
di: Schoepp, Sheila, et al.
Pubblicazione: (2024)
di: Schoepp, Sheila, et al.
Pubblicazione: (2024)
ImaginationPolicy: Towards Generalizable, Precise and Reliable End-to-End Policy for Robotic Manipulation
di: Lu, Dekun, et al.
Pubblicazione: (2025)
di: Lu, Dekun, et al.
Pubblicazione: (2025)
Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model
di: Yuan, Xiu, et al.
Pubblicazione: (2024)
di: Yuan, Xiu, et al.
Pubblicazione: (2024)
Distilling Reinforcement Learning Policies for Interpretable Robot Locomotion: Gradient Boosting Machines and Symbolic Regression
di: Acero, Fernando, et al.
Pubblicazione: (2024)
di: Acero, Fernando, et al.
Pubblicazione: (2024)
RN-D: Discretized Categorical Actors with Regularized Networks for On-Policy Reinforcement Learning
di: Bian, Yuexin, et al.
Pubblicazione: (2026)
di: Bian, Yuexin, et al.
Pubblicazione: (2026)
Grasp Anything: Combining Teacher-Augmented Policy Gradient Learning with Instance Segmentation to Grasp Arbitrary Objects
di: Mosbach, Malte, et al.
Pubblicazione: (2024)
di: Mosbach, Malte, et al.
Pubblicazione: (2024)
Multi-Agent Reinforcement Learning for Unmanned Aerial Vehicle Coordination by Multi-Critic Policy Gradient Optimization
di: Alon, Yoav, et al.
Pubblicazione: (2020)
di: Alon, Yoav, et al.
Pubblicazione: (2020)
Activation-Descent Regularization for Input Optimization of ReLU Networks
di: Yu, Hongzhan, et al.
Pubblicazione: (2024)
di: Yu, Hongzhan, et al.
Pubblicazione: (2024)
A Taxonomy for Evaluating Generalist Robot Manipulation Policies
di: Gao, Jensen, et al.
Pubblicazione: (2025)
di: Gao, Jensen, et al.
Pubblicazione: (2025)
Evolutionary Policy Optimization
di: Wang, Jianren, et al.
Pubblicazione: (2025)
di: Wang, Jianren, et al.
Pubblicazione: (2025)
Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning
di: Liu, Tenglong, et al.
Pubblicazione: (2024)
di: Liu, Tenglong, et al.
Pubblicazione: (2024)
Imagination Policy: Using Generative Point Cloud Models for Learning Manipulation Policies
di: Huang, Haojie, et al.
Pubblicazione: (2024)
di: Huang, Haojie, et al.
Pubblicazione: (2024)
Video2Policy: Scaling up Manipulation Tasks in Simulation through Internet Videos
di: Ye, Weirui, et al.
Pubblicazione: (2025)
di: Ye, Weirui, et al.
Pubblicazione: (2025)
Coordinated Humanoid Manipulation with Choice Policies
di: Qi, Haozhi, et al.
Pubblicazione: (2025)
di: Qi, Haozhi, et al.
Pubblicazione: (2025)
Latent Policy Steering with Embodiment-Agnostic Pretrained World Models
di: Wang, Yiqi, et al.
Pubblicazione: (2025)
di: Wang, Yiqi, et al.
Pubblicazione: (2025)
Policy-Guided Diffusion
di: Jackson, Matthew Thomas, et al.
Pubblicazione: (2024)
di: Jackson, Matthew Thomas, et al.
Pubblicazione: (2024)
Absolute Policy Optimization
di: Zhao, Weiye, et al.
Pubblicazione: (2023)
di: Zhao, Weiye, et al.
Pubblicazione: (2023)
WarmPrior: Straightening Flow-Matching Policies with Temporal Priors
di: Kang, Sinjae, et al.
Pubblicazione: (2026)
di: Kang, Sinjae, et al.
Pubblicazione: (2026)
Scaling Policy Gradient Quality-Diversity with Massive Parallelization via Behavioral Variations
di: Mitsides, Konstantinos, et al.
Pubblicazione: (2025)
di: Mitsides, Konstantinos, et al.
Pubblicazione: (2025)
Leveraging Analytic Gradients in Provably Safe Reinforcement Learning
di: Walter, Tim, et al.
Pubblicazione: (2025)
di: Walter, Tim, et al.
Pubblicazione: (2025)
Foundation Policies with Hilbert Representations
di: Park, Seohong, et al.
Pubblicazione: (2024)
di: Park, Seohong, et al.
Pubblicazione: (2024)
Exploiting Hybrid Policy in Reinforcement Learning for Interpretable Temporal Logic Manipulation
di: Zhang, Hao, et al.
Pubblicazione: (2024)
di: Zhang, Hao, et al.
Pubblicazione: (2024)
Safe Deep Policy Adaptation
di: Xiao, Wenli, et al.
Pubblicazione: (2023)
di: Xiao, Wenli, et al.
Pubblicazione: (2023)
Flattening Hierarchies with Policy Bootstrapping
di: Zhou, John L., et al.
Pubblicazione: (2025)
di: Zhou, John L., et al.
Pubblicazione: (2025)
Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation
di: Xue, Han, et al.
Pubblicazione: (2025)
di: Xue, Han, et al.
Pubblicazione: (2025)
TRANSIC: Sim-to-Real Policy Transfer by Learning from Online Correction
di: Jiang, Yunfan, et al.
Pubblicazione: (2024)
di: Jiang, Yunfan, et al.
Pubblicazione: (2024)
RoboPocket: Improve Robot Policies Instantly with Your Phone
di: Fang, Junjie, et al.
Pubblicazione: (2026)
di: Fang, Junjie, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Improving Value Estimation Critically Enhances Vanilla Policy Gradient
di: Wang, Tao, et al.
Pubblicazione: (2025) -
Fractal Landscapes in Policy Optimization
di: Wang, Tao, et al.
Pubblicazione: (2023) -
Extremum-Seeking Action Selection for Accelerating Policy Optimization
di: Chang, Ya-Chien, et al.
Pubblicazione: (2024) -
Hamilton-Jacobi Reachability in Reinforcement Learning: A Survey
di: Ganai, Milan, et al.
Pubblicazione: (2024) -
Value Functions for Temporal Logic: Optimal Policies and Safety Filters
di: So, Oswin, et al.
Pubblicazione: (2026)