Policy Zooming: Adaptive Discretization-based Infinite-Horizon Average-Reward Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Kar, Avik, Singh, Rahul |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Provably Adaptive Average Reward Reinforcement Learning for Metric Spaces
di: Kar, Avik, et al.
Pubblicazione: (2024)
di: Kar, Avik, et al.
Pubblicazione: (2024)
Reinforcement Learning for Infinite-Horizon Average-Reward Linear MDPs via Approximation by Discounted-Reward MDPs
di: Hong, Kihyuk, et al.
Pubblicazione: (2024)
di: Hong, Kihyuk, et al.
Pubblicazione: (2024)
Policy Gradient Methods for Non-Markovian Reinforcement Learning
di: Kar, Avik, et al.
Pubblicazione: (2026)
di: Kar, Avik, et al.
Pubblicazione: (2026)
Order-Optimal Regret with Novel Policy Gradient Approaches in Infinite-Horizon Average Reward MDPs
di: Ganesh, Swetha, et al.
Pubblicazione: (2024)
di: Ganesh, Swetha, et al.
Pubblicazione: (2024)
Provably Efficient Infinite-Horizon Average-Reward Reinforcement Learning with Linear Function Approximation
di: Chae, Woojin, et al.
Pubblicazione: (2024)
di: Chae, Woojin, et al.
Pubblicazione: (2024)
Learning Infinite-Horizon Average-Reward Linear Mixture MDPs of Bounded Span
di: Chae, Woojin, et al.
Pubblicazione: (2024)
di: Chae, Woojin, et al.
Pubblicazione: (2024)
Regret Analysis of Policy Gradient Algorithm for Infinite Horizon Average Reward Markov Decision Processes
di: Bai, Qinbo, et al.
Pubblicazione: (2023)
di: Bai, Qinbo, et al.
Pubblicazione: (2023)
Learning General Parameterized Policies for Infinite Horizon Average Reward Constrained MDPs via Primal-Dual Policy Gradient Algorithm
di: Bai, Qinbo, et al.
Pubblicazione: (2024)
di: Bai, Qinbo, et al.
Pubblicazione: (2024)
A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs
di: Hong, Kihyuk, et al.
Pubblicazione: (2025)
di: Hong, Kihyuk, et al.
Pubblicazione: (2025)
Quantum Speedups in Regret Analysis of Infinite Horizon Average-Reward Markov Decision Processes
di: Ganguly, Bhargav, et al.
Pubblicazione: (2023)
di: Ganguly, Bhargav, et al.
Pubblicazione: (2023)
Finite-Sample Analysis of Policy Evaluation for Robust Average Reward Reinforcement Learning
di: Xu, Yang, et al.
Pubblicazione: (2025)
di: Xu, Yang, et al.
Pubblicazione: (2025)
RVI-SAC: Average Reward Off-Policy Deep Reinforcement Learning
di: Hisaki, Yukinari, et al.
Pubblicazione: (2024)
di: Hisaki, Yukinari, et al.
Pubblicazione: (2024)
Statistical Inference of the Value Function for Reinforcement Learning in Infinite Horizon Settings
di: Shi, C., et al.
Pubblicazione: (2020)
di: Shi, C., et al.
Pubblicazione: (2020)
Provably Sample-Efficient Robust Reinforcement Learning with Average Reward
di: Roch, Zachary, et al.
Pubblicazione: (2025)
di: Roch, Zachary, et al.
Pubblicazione: (2025)
Infinite-Horizon Reinforcement Learning with Multinomial Logistic Function Approximation
di: Park, Jaehyun, et al.
Pubblicazione: (2024)
di: Park, Jaehyun, et al.
Pubblicazione: (2024)
Towards Global Optimality for Practical Average Reward Reinforcement Learning without Mixing Time Oracles
di: Patel, Bhrij, et al.
Pubblicazione: (2024)
di: Patel, Bhrij, et al.
Pubblicazione: (2024)
Optimistically Optimistic Exploration for Provably Efficient Infinite-Horizon Reinforcement and Imitation Learning
di: Moulin, Antoine, et al.
Pubblicazione: (2025)
di: Moulin, Antoine, et al.
Pubblicazione: (2025)
Average-Reward Soft Actor-Critic
di: Adamczyk, Jacob, et al.
Pubblicazione: (2025)
di: Adamczyk, Jacob, et al.
Pubblicazione: (2025)
Sample Complexity of Distributionally Robust Average-Reward Reinforcement Learning
di: Chen, Zijun, et al.
Pubblicazione: (2025)
di: Chen, Zijun, et al.
Pubblicazione: (2025)
High-Probability Bounds for SGD under the Polyak-Lojasiewicz Condition with Markovian Noise
di: Kar, Avik, et al.
Pubblicazione: (2026)
di: Kar, Avik, et al.
Pubblicazione: (2026)
WARP: On the Benefits of Weight Averaged Rewarded Policies
di: Ramé, Alexandre, et al.
Pubblicazione: (2024)
di: Ramé, Alexandre, et al.
Pubblicazione: (2024)
Deep Reinforcement Learning for Infinite Horizon Mean Field Problems in Continuous Spaces
di: Angiuli, Andrea, et al.
Pubblicazione: (2023)
di: Angiuli, Andrea, et al.
Pubblicazione: (2023)
Natural Policy Gradient for Average Reward Non-Stationary RL
di: Jali, Neharika, et al.
Pubblicazione: (2025)
di: Jali, Neharika, et al.
Pubblicazione: (2025)
A Harmonic Mean Formulation of Average Reward Reinforcement Learning in SMDPs
di: Shtossel, Erel, et al.
Pubblicazione: (2026)
di: Shtossel, Erel, et al.
Pubblicazione: (2026)
Sample Complexity of Average-Reward Q-Learning: From Single-agent to Federated Reinforcement Learning
di: Jiao, Yuchen, et al.
Pubblicazione: (2026)
di: Jiao, Yuchen, et al.
Pubblicazione: (2026)
Average-Reward Maximum Entropy Reinforcement Learning for Underactuated Double Pendulum Tasks
di: Choe, Jean Seong Bjorn, et al.
Pubblicazione: (2024)
di: Choe, Jean Seong Bjorn, et al.
Pubblicazione: (2024)
Exchange Policy Optimization Algorithm for Semi-Infinite Safe Reinforcement Learning
di: Zhang, Jiaming, et al.
Pubblicazione: (2025)
di: Zhang, Jiaming, et al.
Pubblicazione: (2025)
Improved Sample Complexity Analysis of Natural Policy Gradient Algorithm with General Parameterization for Infinite Horizon Discounted Reward Markov Decision Processes
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2023)
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2023)
Efficient $Q$-Learning and Actor-Critic Methods for Robust Average Reward Reinforcement Learning
di: Xu, Yang, et al.
Pubblicazione: (2025)
di: Xu, Yang, et al.
Pubblicazione: (2025)
Quotient-Categorical Representations for Bellman-Compatible Average-Reward Distributional Reinforcement Learning
di: Kaya, Ege C., et al.
Pubblicazione: (2026)
di: Kaya, Ege C., et al.
Pubblicazione: (2026)
Binary Reward Labeling: Bridging Offline Preference and Reward-Based Reinforcement Learning
di: Xu, Yinglun, et al.
Pubblicazione: (2024)
di: Xu, Yinglun, et al.
Pubblicazione: (2024)
Semi-Explicit Neural DAEs: Learning Long-Horizon Dynamical Systems with Algebraic Constraints
di: Pal, Avik, et al.
Pubblicazione: (2025)
di: Pal, Avik, et al.
Pubblicazione: (2025)
Actor-Accelerated Policy Dual Averaging for Reinforcement Learning in Continuous Action Spaces
di: Gao, Ji, et al.
Pubblicazione: (2026)
di: Gao, Ji, et al.
Pubblicazione: (2026)
Kernel-Based Function Approximation for Average Reward Reinforcement Learning: An Optimist No-Regret Algorithm
di: Vakili, Sattar, et al.
Pubblicazione: (2024)
di: Vakili, Sattar, et al.
Pubblicazione: (2024)
Constrained Reinforcement Learning with Average Reward Objective: Model-Based and Model-Free Algorithms
di: Aggarwal, Vaneet, et al.
Pubblicazione: (2024)
di: Aggarwal, Vaneet, et al.
Pubblicazione: (2024)
Efficient Exploration in Average-Reward Constrained Reinforcement Learning: Achieving Near-Optimal Regret With Posterior Sampling
di: Provodin, Danil, et al.
Pubblicazione: (2024)
di: Provodin, Danil, et al.
Pubblicazione: (2024)
A Sharper Global Convergence Analysis for Average Reward Reinforcement Learning via an Actor-Critic Approach
di: Ganesh, Swetha, et al.
Pubblicazione: (2024)
di: Ganesh, Swetha, et al.
Pubblicazione: (2024)
Efficient Online Learning with Offline Datasets for Infinite Horizon MDPs: A Bayesian Approach
di: Tang, Dengwang, et al.
Pubblicazione: (2023)
di: Tang, Dengwang, et al.
Pubblicazione: (2023)
Implicit Updates for Average-Reward Temporal Difference Learning
di: Kim, Hwanwoo, et al.
Pubblicazione: (2025)
di: Kim, Hwanwoo, et al.
Pubblicazione: (2025)
A Risk-Aware Reinforcement Learning Reward for Financial Trading
di: Srivastava, Uditansh, et al.
Pubblicazione: (2025)
di: Srivastava, Uditansh, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Provably Adaptive Average Reward Reinforcement Learning for Metric Spaces
di: Kar, Avik, et al.
Pubblicazione: (2024) -
Reinforcement Learning for Infinite-Horizon Average-Reward Linear MDPs via Approximation by Discounted-Reward MDPs
di: Hong, Kihyuk, et al.
Pubblicazione: (2024) -
Policy Gradient Methods for Non-Markovian Reinforcement Learning
di: Kar, Avik, et al.
Pubblicazione: (2026) -
Order-Optimal Regret with Novel Policy Gradient Approaches in Infinite-Horizon Average Reward MDPs
di: Ganesh, Swetha, et al.
Pubblicazione: (2024) -
Provably Efficient Infinite-Horizon Average-Reward Reinforcement Learning with Linear Function Approximation
di: Chae, Woojin, et al.
Pubblicazione: (2024)