Group Policy Gradient
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Junhua, Zhang, Zixi, Zhong, Hantao, Antonova, Rika |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DiffCloud: Real-to-Sim from Point Clouds with Differentiable Simulation and Rendering of Deformable Objects
di: Sundaresan, Priya, et al.
Pubblicazione: (2022)
di: Sundaresan, Priya, et al.
Pubblicazione: (2022)
EquivAct: SIM(3)-Equivariant Visuomotor Policies beyond Rigid Object Manipulation
di: Yang, Jingyun, et al.
Pubblicazione: (2023)
di: Yang, Jingyun, et al.
Pubblicazione: (2023)
EquiBot: SIM(3)-Equivariant Diffusion Policy for Generalizable and Data Efficient Learning
di: Yang, Jingyun, et al.
Pubblicazione: (2024)
di: Yang, Jingyun, et al.
Pubblicazione: (2024)
Mobi-$π$: Mobilizing Your Robot Learning Policy
di: Yang, Jingyun, et al.
Pubblicazione: (2025)
di: Yang, Jingyun, et al.
Pubblicazione: (2025)
Causal-PIK: Causality-based Physical Reasoning with a Physics-Informed Kernel
di: Parés-Morlans, Carlota, et al.
Pubblicazione: (2025)
di: Parés-Morlans, Carlota, et al.
Pubblicazione: (2025)
Demystifying Group Relative Policy Optimization: Its Policy Gradient is a U-Statistic
di: Zhou, Hongyi, et al.
Pubblicazione: (2026)
di: Zhou, Hongyi, et al.
Pubblicazione: (2026)
Unpacking Failure Modes of Generative Policies: Runtime Monitoring of Consistency and Progress
di: Agia, Christopher, et al.
Pubblicazione: (2024)
di: Agia, Christopher, et al.
Pubblicazione: (2024)
Wasserstein Proximal Policy Gradient
di: Zhu, Zhaoyu, et al.
Pubblicazione: (2026)
di: Zhu, Zhaoyu, et al.
Pubblicazione: (2026)
Convergence Rate in Nonlinear Two-Time-Scale Stochastic Approximation with State (Time)-Dependence
di: Chen, Zixi, et al.
Pubblicazione: (2025)
di: Chen, Zixi, et al.
Pubblicazione: (2025)
A Closed-Form Upper Bound for Admissible Learning-Rate Steps in Belief-Space Dynamics
di: Li, Zixi, et al.
Pubblicazione: (2026)
di: Li, Zixi, et al.
Pubblicazione: (2026)
Reasoning: From Reflection to Solution
di: Li, Zixi
Pubblicazione: (2025)
di: Li, Zixi
Pubblicazione: (2025)
Revisiting Policy Gradients for Restricted Policy Classes: Escaping Myopic Local Optima with $k$-step Policy Gradients
di: DeWeese, Alex, et al.
Pubblicazione: (2026)
di: DeWeese, Alex, et al.
Pubblicazione: (2026)
On-Policy Policy Gradient Reinforcement Learning Without On-Policy Sampling
di: Corrado, Nicholas E., et al.
Pubblicazione: (2023)
di: Corrado, Nicholas E., et al.
Pubblicazione: (2023)
Differentially Private Policy Gradient
di: Rio, Alexandre, et al.
Pubblicazione: (2025)
di: Rio, Alexandre, et al.
Pubblicazione: (2025)
Functional Natural Policy Gradients
di: Bibaut, Aurelien, et al.
Pubblicazione: (2026)
di: Bibaut, Aurelien, et al.
Pubblicazione: (2026)
Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient
di: Zhou, Zhongzhu, et al.
Pubblicazione: (2025)
di: Zhou, Zhongzhu, et al.
Pubblicazione: (2025)
Learning Optimal Deterministic Policies with Stochastic Policy Gradients
di: Montenegro, Alessandro, et al.
Pubblicazione: (2024)
di: Montenegro, Alessandro, et al.
Pubblicazione: (2024)
When Do Off-Policy and On-Policy Policy Gradient Methods Align?
di: Mambelli, Davide, et al.
Pubblicazione: (2024)
di: Mambelli, Davide, et al.
Pubblicazione: (2024)
Beyond Exact Gradients: Convergence of Stochastic Soft-Max Policy Gradient Methods with Entropy Regularization
di: Ding, Yuhao, et al.
Pubblicazione: (2021)
di: Ding, Yuhao, et al.
Pubblicazione: (2021)
Fast Stochastic Policy Gradient: Negative Momentum for Reinforcement Learning
di: Zhang, Haobin, et al.
Pubblicazione: (2024)
di: Zhang, Haobin, et al.
Pubblicazione: (2024)
Two Heads Are Better than One: Simulating Large Transformers with Small Ones
di: Yu, Hantao, et al.
Pubblicazione: (2025)
di: Yu, Hantao, et al.
Pubblicazione: (2025)
GTPO: Stabilizing Group Relative Policy Optimization via Gradient and Entropy Control
di: Simoni, Marco, et al.
Pubblicazione: (2025)
di: Simoni, Marco, et al.
Pubblicazione: (2025)
Enhancing Policy Gradient with the Polyak Step-Size Adaption
di: Li, Yunxiang, et al.
Pubblicazione: (2024)
di: Li, Yunxiang, et al.
Pubblicazione: (2024)
Behind the Myth of Exploration in Policy Gradients
di: Bolland, Adrien, et al.
Pubblicazione: (2024)
di: Bolland, Adrien, et al.
Pubblicazione: (2024)
GFlowNet Training by Policy Gradients
di: Niu, Puhua, et al.
Pubblicazione: (2024)
di: Niu, Puhua, et al.
Pubblicazione: (2024)
Policy Gradient with Active Importance Sampling
di: Papini, Matteo, et al.
Pubblicazione: (2024)
di: Papini, Matteo, et al.
Pubblicazione: (2024)
Flow Matching Policy Gradients
di: McAllister, David, et al.
Pubblicazione: (2025)
di: McAllister, David, et al.
Pubblicazione: (2025)
Identifying Policy Gradient Subspaces
di: Schneider, Jan, et al.
Pubblicazione: (2024)
di: Schneider, Jan, et al.
Pubblicazione: (2024)
Reevaluating Policy Gradient Methods for Imperfect-Information Games
di: Rudolph, Max, et al.
Pubblicazione: (2025)
di: Rudolph, Max, et al.
Pubblicazione: (2025)
Learning Multimodal Behaviors from Scratch with Diffusion Policy Gradient
di: Li, Zechu, et al.
Pubblicazione: (2024)
di: Li, Zechu, et al.
Pubblicazione: (2024)
GAGPO: Generalized Advantage Grouped Policy Optimization
di: Zhu, Siyuan, et al.
Pubblicazione: (2026)
di: Zhu, Siyuan, et al.
Pubblicazione: (2026)
Deep Kernel Fusion for Transformers
di: Zhang, Zixi, et al.
Pubblicazione: (2026)
di: Zhang, Zixi, et al.
Pubblicazione: (2026)
Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes
di: Montenegro, Alessandro, et al.
Pubblicazione: (2025)
di: Montenegro, Alessandro, et al.
Pubblicazione: (2025)
Learning General Policies with Policy Gradient Methods
di: Ståhlberg, Simon, et al.
Pubblicazione: (2025)
di: Ståhlberg, Simon, et al.
Pubblicazione: (2025)
Natural Policy Gradient as Doubly Smoothed Policy Iteration: A Bellman-Operator Framework
di: Nanda, Phalguni, et al.
Pubblicazione: (2026)
di: Nanda, Phalguni, et al.
Pubblicazione: (2026)
Revisiting Group Relative Policy Optimization: Insights into On-Policy and Off-Policy Training
di: Mroueh, Youssef, et al.
Pubblicazione: (2025)
di: Mroueh, Youssef, et al.
Pubblicazione: (2025)
CUPID: Curating Data your Robot Loves with Influence Functions
di: Agia, Christopher, et al.
Pubblicazione: (2025)
di: Agia, Christopher, et al.
Pubblicazione: (2025)
Policy Gradient Methods for Distortion Risk Measures
di: Vijayan, Nithia, et al.
Pubblicazione: (2021)
di: Vijayan, Nithia, et al.
Pubblicazione: (2021)
Residual Policy Gradient: A Reward View of KL-regularized Objective
di: Wang, Pengcheng, et al.
Pubblicazione: (2025)
di: Wang, Pengcheng, et al.
Pubblicazione: (2025)
Accelerated Policy Gradient: On the Convergence Rates of the Nesterov Momentum for Reinforcement Learning
di: Chen, Yen-Ju, et al.
Pubblicazione: (2023)
di: Chen, Yen-Ju, et al.
Pubblicazione: (2023)
Documenti analoghi
-
DiffCloud: Real-to-Sim from Point Clouds with Differentiable Simulation and Rendering of Deformable Objects
di: Sundaresan, Priya, et al.
Pubblicazione: (2022) -
EquivAct: SIM(3)-Equivariant Visuomotor Policies beyond Rigid Object Manipulation
di: Yang, Jingyun, et al.
Pubblicazione: (2023) -
EquiBot: SIM(3)-Equivariant Diffusion Policy for Generalizable and Data Efficient Learning
di: Yang, Jingyun, et al.
Pubblicazione: (2024) -
Mobi-$π$: Mobilizing Your Robot Learning Policy
di: Yang, Jingyun, et al.
Pubblicazione: (2025) -
Causal-PIK: Causality-based Physical Reasoning with a Physics-Informed Kernel
di: Parés-Morlans, Carlota, et al.
Pubblicazione: (2025)