Mirror Descent Actor Critic via Bounded Advantage Learning
Fuente:
arXiv
Guardado en:
| Autor principal: | Iwaki, Ryo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Distorted Distributional Policy Evaluation for Offline Reinforcement Learning
por: Iwaki, Ryo, et al.
Publicado: (2026)
por: Iwaki, Ryo, et al.
Publicado: (2026)
Quantum Advantage Actor-Critic for Reinforcement Learning
por: Kölle, Michael, et al.
Publicado: (2024)
por: Kölle, Michael, et al.
Publicado: (2024)
Maximum Entropy On-Policy Actor-Critic via Entropy Advantage Estimation
por: Choe, Jean Seong Bjorn, et al.
Publicado: (2024)
por: Choe, Jean Seong Bjorn, et al.
Publicado: (2024)
ReLU to the Rescue: Improve Your On-Policy Actor-Critic with Positive Advantages
por: Jesson, Andrew, et al.
Publicado: (2023)
por: Jesson, Andrew, et al.
Publicado: (2023)
Actor-Critic Reinforcement Learning with Phased Actor
por: Wu, Ruofan, et al.
Publicado: (2024)
por: Wu, Ruofan, et al.
Publicado: (2024)
Transformers Learn Latent Mixture Models In-Context via Mirror Descent
por: D'Angelo, Francesco, et al.
Publicado: (2026)
por: D'Angelo, Francesco, et al.
Publicado: (2026)
Value Mirror Descent for Reinforcement Learning
por: Jia, Zhichao, et al.
Publicado: (2026)
por: Jia, Zhichao, et al.
Publicado: (2026)
Actor-Critic without Actor
por: Ki, Donghyeon, et al.
Publicado: (2025)
por: Ki, Donghyeon, et al.
Publicado: (2025)
On the Effect of Regularization in Policy Mirror Descent
por: Kleuker, Jan Felix, et al.
Publicado: (2025)
por: Kleuker, Jan Felix, et al.
Publicado: (2025)
Variational Online Mirror Descent for Robust Learning in Schrödinger Bridge
por: Han, Dong-Sig, et al.
Publicado: (2025)
por: Han, Dong-Sig, et al.
Publicado: (2025)
Learning Mixtures of Experts with EM: A Mirror Descent Perspective
por: Fruytier, Quentin, et al.
Publicado: (2024)
por: Fruytier, Quentin, et al.
Publicado: (2024)
Parameter-free Mirror Descent
por: Jacobsen, Andrew, et al.
Publicado: (2022)
por: Jacobsen, Andrew, et al.
Publicado: (2022)
Policy Mirror Descent with Lookahead
por: Protopapas, Kimon, et al.
Publicado: (2024)
por: Protopapas, Kimon, et al.
Publicado: (2024)
Mirror Descent on Riemannian Manifolds
por: Jiang, Jiaxin, et al.
Publicado: (2026)
por: Jiang, Jiaxin, et al.
Publicado: (2026)
A Mirror Descent Perspective of Smoothed Sign Descent
por: Wang, Shuyang, et al.
Publicado: (2024)
por: Wang, Shuyang, et al.
Publicado: (2024)
A Unified Approach to Controlling Implicit Regularization via Mirror Descent
por: Sun, Haoyuan, et al.
Publicado: (2023)
por: Sun, Haoyuan, et al.
Publicado: (2023)
Adaptively Perturbed Mirror Descent for Learning in Games
por: Abe, Kenshi, et al.
Publicado: (2023)
por: Abe, Kenshi, et al.
Publicado: (2023)
One-Step Flow Policy Mirror Descent
por: Chen, Tianyi, et al.
Publicado: (2025)
por: Chen, Tianyi, et al.
Publicado: (2025)
The Hidden Cost of Approximation in Online Mirror Descent
por: Schlisselberg, Ofir, et al.
Publicado: (2025)
por: Schlisselberg, Ofir, et al.
Publicado: (2025)
Learnable Loss Geometries with Mirror Descent for Scalable and Convergent Meta-Learning
por: Zhang, Yilang, et al.
Publicado: (2025)
por: Zhang, Yilang, et al.
Publicado: (2025)
D2 Actor Critic: Diffusion Actor Meets Distributional Critic
por: Zhang, Lunjun, et al.
Publicado: (2025)
por: Zhang, Lunjun, et al.
Publicado: (2025)
Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm
por: Qiao, Ting, et al.
Publicado: (2024)
por: Qiao, Ting, et al.
Publicado: (2024)
Actor-Critic or Critic-Actor? A Tale of Two Time Scales
por: Bhatnagar, Shalabh, et al.
Publicado: (2022)
por: Bhatnagar, Shalabh, et al.
Publicado: (2022)
Functional Acceleration for Policy Mirror Descent
por: Chelu, Veronica, et al.
Publicado: (2024)
por: Chelu, Veronica, et al.
Publicado: (2024)
PAC-Bayesian Soft Actor-Critic Learning
por: Tasdighi, Bahareh, et al.
Publicado: (2023)
por: Tasdighi, Bahareh, et al.
Publicado: (2023)
Stability and Robustness via Regularization: Bandit Inference via Regularized Stochastic Mirror Descent
por: Halder, Budhaditya, et al.
Publicado: (2026)
por: Halder, Budhaditya, et al.
Publicado: (2026)
Generative Actor Critic
por: Qin, Aoyang, et al.
Publicado: (2025)
por: Qin, Aoyang, et al.
Publicado: (2025)
Stress-Aware Learning under KL Drift via Trust-Decayed Mirror Descent
por: Raj, Gabriel Nixon
Publicado: (2025)
por: Raj, Gabriel Nixon
Publicado: (2025)
The Computational Advantage of Depth: Learning High-Dimensional Hierarchical Functions with Gradient Descent
por: Dandi, Yatin, et al.
Publicado: (2025)
por: Dandi, Yatin, et al.
Publicado: (2025)
Meta-Learning with Versatile Loss Geometries for Fast Adaptation Using Mirror Descent
por: Zhang, Yilang, et al.
Publicado: (2023)
por: Zhang, Yilang, et al.
Publicado: (2023)
Never Saddle for Reparameterized Steepest Descent as Mirror Flow
por: Jacobs, Tom, et al.
Publicado: (2026)
por: Jacobs, Tom, et al.
Publicado: (2026)
On the Convergence of Policy in Unregularized Policy Mirror Descent
por: Lin, Dachao, et al.
Publicado: (2022)
por: Lin, Dachao, et al.
Publicado: (2022)
Mirror Descent on Reproducing Kernel Banach Spaces
por: Kumar, Akash, et al.
Publicado: (2024)
por: Kumar, Akash, et al.
Publicado: (2024)
Mirror and Preconditioned Gradient Descent in Wasserstein Space
por: Bonet, Clément, et al.
Publicado: (2024)
por: Bonet, Clément, et al.
Publicado: (2024)
Adaptive Online Mirror Descent for Tchebycheff Scalarization in Multi-Objective Learning
por: Liu, Meitong, et al.
Publicado: (2024)
por: Liu, Meitong, et al.
Publicado: (2024)
Path-Space Mirror Descent for On-Policy Reinforcement Learning under the Generalized Schrödinger Bridge
por: Gong, Yuehu, et al.
Publicado: (2026)
por: Gong, Yuehu, et al.
Publicado: (2026)
Flow Matching Policy Optimization with Mirror Descent and Entropy Constraints
por: Gao, Ting, et al.
Publicado: (2026)
por: Gao, Ting, et al.
Publicado: (2026)
Nonstationary Generalized Linear Bandits with Discounted Online Mirror Descent
por: Lee, Joongkyu, et al.
Publicado: (2026)
por: Lee, Joongkyu, et al.
Publicado: (2026)
Flow Actor-Critic for Offline Reinforcement Learning
por: Chae, Jongseong, et al.
Publicado: (2026)
por: Chae, Jongseong, et al.
Publicado: (2026)
Finite-Time Analysis of Three-Timescale Constrained Actor-Critic and Constrained Natural Actor-Critic Algorithms
por: Panda, Prashansa, et al.
Publicado: (2023)
por: Panda, Prashansa, et al.
Publicado: (2023)
Ejemplares similares
-
Distorted Distributional Policy Evaluation for Offline Reinforcement Learning
por: Iwaki, Ryo, et al.
Publicado: (2026) -
Quantum Advantage Actor-Critic for Reinforcement Learning
por: Kölle, Michael, et al.
Publicado: (2024) -
Maximum Entropy On-Policy Actor-Critic via Entropy Advantage Estimation
por: Choe, Jean Seong Bjorn, et al.
Publicado: (2024) -
ReLU to the Rescue: Improve Your On-Policy Actor-Critic with Positive Advantages
por: Jesson, Andrew, et al.
Publicado: (2023) -
Actor-Critic Reinforcement Learning with Phased Actor
por: Wu, Ruofan, et al.
Publicado: (2024)