Salvato in:
| Autori principali: | DeWeese, Alex, Qu, Guannan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2605.10909 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Thinking Beyond Visibility: A Near-Optimal Policy Framework for Locally Interdependent Multi-Agent MDPs
di: DeWeese, Alex, et al.
Pubblicazione: (2025)
di: DeWeese, Alex, et al.
Pubblicazione: (2025)
Locally Interdependent Multi-Agent MDP: Theoretical Framework for Decentralized Agents with Dynamic Dependencies
di: DeWeese, Alex, et al.
Pubblicazione: (2024)
di: DeWeese, Alex, et al.
Pubblicazione: (2024)
A Theory of Saddle Escape in Deep Nonlinear Networks
di: Rawal, Divit, et al.
Pubblicazione: (2026)
di: Rawal, Divit, et al.
Pubblicazione: (2026)
Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead
di: Koren, Uri, et al.
Pubblicazione: (2025)
di: Koren, Uri, et al.
Pubblicazione: (2025)
Non-Myopic Active Feature Acquisition via Pathwise Policy Gradients
di: Aronsson, Linus, et al.
Pubblicazione: (2026)
di: Aronsson, Linus, et al.
Pubblicazione: (2026)
Natural Policy Gradient for Average Reward Non-Stationary RL
di: Jali, Neharika, et al.
Pubblicazione: (2025)
di: Jali, Neharika, et al.
Pubblicazione: (2025)
Differentiating Policies for Non-Myopic Bayesian Optimization
di: Nwankwo, Darian, et al.
Pubblicazione: (2024)
di: Nwankwo, Darian, et al.
Pubblicazione: (2024)
On-Policy Policy Gradient Reinforcement Learning Without On-Policy Sampling
di: Corrado, Nicholas E., et al.
Pubblicazione: (2023)
di: Corrado, Nicholas E., et al.
Pubblicazione: (2023)
Escaping Local Optima in Global Placement
di: Xue, Ke, et al.
Pubblicazione: (2024)
di: Xue, Ke, et al.
Pubblicazione: (2024)
Group Policy Gradient
di: Chen, Junhua, et al.
Pubblicazione: (2025)
di: Chen, Junhua, et al.
Pubblicazione: (2025)
Alternating Gradient Flows: A Theory of Feature Learning in Two-layer Neural Networks
di: Kunin, Daniel, et al.
Pubblicazione: (2025)
di: Kunin, Daniel, et al.
Pubblicazione: (2025)
When Do Off-Policy and On-Policy Policy Gradient Methods Align?
di: Mambelli, Davide, et al.
Pubblicazione: (2024)
di: Mambelli, Davide, et al.
Pubblicazione: (2024)
Learning General Policies with Policy Gradient Methods
di: Ståhlberg, Simon, et al.
Pubblicazione: (2025)
di: Ståhlberg, Simon, et al.
Pubblicazione: (2025)
Learning Optimal Deterministic Policies with Stochastic Policy Gradients
di: Montenegro, Alessandro, et al.
Pubblicazione: (2024)
di: Montenegro, Alessandro, et al.
Pubblicazione: (2024)
Wasserstein Proximal Policy Gradient
di: Zhu, Zhaoyu, et al.
Pubblicazione: (2026)
di: Zhu, Zhaoyu, et al.
Pubblicazione: (2026)
Functional Natural Policy Gradients
di: Bibaut, Aurelien, et al.
Pubblicazione: (2026)
di: Bibaut, Aurelien, et al.
Pubblicazione: (2026)
Differentially Private Policy Gradient
di: Rio, Alexandre, et al.
Pubblicazione: (2025)
di: Rio, Alexandre, et al.
Pubblicazione: (2025)
Delightful Policy Gradient
di: Osband, Ian
Pubblicazione: (2026)
di: Osband, Ian
Pubblicazione: (2026)
Flow Matching Policy Gradients
di: McAllister, David, et al.
Pubblicazione: (2025)
di: McAllister, David, et al.
Pubblicazione: (2025)
A Minibatch-SGD-Based Learning Meta-Policy for Inventory Systems with Myopic Optimal Policy
di: Lyu, Jiameng, et al.
Pubblicazione: (2024)
di: Lyu, Jiameng, et al.
Pubblicazione: (2024)
On Building Myopic MPC Policies using Supervised Learning
di: Orrico, Christopher A., et al.
Pubblicazione: (2024)
di: Orrico, Christopher A., et al.
Pubblicazione: (2024)
Policy Gradient with Kernel Quadrature
di: Hayakawa, Satoshi, et al.
Pubblicazione: (2023)
di: Hayakawa, Satoshi, et al.
Pubblicazione: (2023)
On Quantum Natural Policy Gradients
di: Sequeira, André, et al.
Pubblicazione: (2024)
di: Sequeira, André, et al.
Pubblicazione: (2024)
Policy Gradient with Tree Expansion
di: Dalal, Gal, et al.
Pubblicazione: (2023)
di: Dalal, Gal, et al.
Pubblicazione: (2023)
Closed-Form Training Dynamics Reveal Learned Features and Linear Structure in Word2Vec-like Models
di: Karkada, Dhruva, et al.
Pubblicazione: (2025)
di: Karkada, Dhruva, et al.
Pubblicazione: (2025)
Identifying Policy Gradient Subspaces
di: Schneider, Jan, et al.
Pubblicazione: (2024)
di: Schneider, Jan, et al.
Pubblicazione: (2024)
Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient
di: Zhou, Zhongzhu, et al.
Pubblicazione: (2025)
di: Zhou, Zhongzhu, et al.
Pubblicazione: (2025)
Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes
di: Montenegro, Alessandro, et al.
Pubblicazione: (2025)
di: Montenegro, Alessandro, et al.
Pubblicazione: (2025)
Behind the Myth of Exploration in Policy Gradients
di: Bolland, Adrien, et al.
Pubblicazione: (2024)
di: Bolland, Adrien, et al.
Pubblicazione: (2024)
GFlowNet Training by Policy Gradients
di: Niu, Puhua, et al.
Pubblicazione: (2024)
di: Niu, Puhua, et al.
Pubblicazione: (2024)
Policy Gradient with Active Importance Sampling
di: Papini, Matteo, et al.
Pubblicazione: (2024)
di: Papini, Matteo, et al.
Pubblicazione: (2024)
Does "Do Differentiable Simulators Give Better Policy Gradients?'' Give Better Policy Gradients?
di: Onoda, Ku, et al.
Pubblicazione: (2026)
di: Onoda, Ku, et al.
Pubblicazione: (2026)
Delightful Distributed Policy Gradient
di: Osband, Ian
Pubblicazione: (2026)
di: Osband, Ian
Pubblicazione: (2026)
GPG: Generalized Policy Gradient Theorem for Transformer-based Policies
di: Mao, Hangyu, et al.
Pubblicazione: (2025)
di: Mao, Hangyu, et al.
Pubblicazione: (2025)
Privacy-Constrained Policies via Mutual Information Regularized Policy Gradients
di: Cundy, Chris, et al.
Pubblicazione: (2020)
di: Cundy, Chris, et al.
Pubblicazione: (2020)
Gradient Extrapolation-Based Policy Optimization
di: Swapnil, Ismam Nur, et al.
Pubblicazione: (2026)
di: Swapnil, Ismam Nur, et al.
Pubblicazione: (2026)
Partial Policy Gradients for RL in LLMs
di: Mathur, Puneet, et al.
Pubblicazione: (2026)
di: Mathur, Puneet, et al.
Pubblicazione: (2026)
Policy Gradient for LQR with Domain Randomization
di: Fujinami, Tesshu, et al.
Pubblicazione: (2025)
di: Fujinami, Tesshu, et al.
Pubblicazione: (2025)
Recurrent Natural Policy Gradient for POMDPs
di: Cayci, Semih, et al.
Pubblicazione: (2024)
di: Cayci, Semih, et al.
Pubblicazione: (2024)
Elementary Analysis of Policy Gradient Methods
di: Liu, Jiacai, et al.
Pubblicazione: (2024)
di: Liu, Jiacai, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Thinking Beyond Visibility: A Near-Optimal Policy Framework for Locally Interdependent Multi-Agent MDPs
di: DeWeese, Alex, et al.
Pubblicazione: (2025) -
Locally Interdependent Multi-Agent MDP: Theoretical Framework for Decentralized Agents with Dynamic Dependencies
di: DeWeese, Alex, et al.
Pubblicazione: (2024) -
A Theory of Saddle Escape in Deep Nonlinear Networks
di: Rawal, Divit, et al.
Pubblicazione: (2026) -
Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead
di: Koren, Uri, et al.
Pubblicazione: (2025) -
Non-Myopic Active Feature Acquisition via Pathwise Policy Gradients
di: Aronsson, Linus, et al.
Pubblicazione: (2026)