Logarithmic Regret of Exploration in Average Reward Markov Decision Processes
Fuente:
arXiv
Salvato in:
| Autori principali: | Boone, Victor, Gaujal, Bruno |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Achieving Tractable Minimax Optimal Regret in Average Reward MDPs
di: Boone, Victor, et al.
Pubblicazione: (2024)
di: Boone, Victor, et al.
Pubblicazione: (2024)
Quantum Speedups in Regret Analysis of Infinite Horizon Average-Reward Markov Decision Processes
di: Ganguly, Bhargav, et al.
Pubblicazione: (2023)
di: Ganguly, Bhargav, et al.
Pubblicazione: (2023)
The regret lower bound for communicating Markov Decision Processes
di: Boone, Victor, et al.
Pubblicazione: (2025)
di: Boone, Victor, et al.
Pubblicazione: (2025)
Regret Analysis of Policy Gradient Algorithm for Infinite Horizon Average Reward Markov Decision Processes
di: Bai, Qinbo, et al.
Pubblicazione: (2023)
di: Bai, Qinbo, et al.
Pubblicazione: (2023)
Hierarchical Average-Reward Linearly-solvable Markov Decision Processes
di: Infante, Guillermo, et al.
Pubblicazione: (2024)
di: Infante, Guillermo, et al.
Pubblicazione: (2024)
Optimal Sample Complexity for Average Reward Markov Decision Processes
di: Wang, Shengbo, et al.
Pubblicazione: (2023)
di: Wang, Shengbo, et al.
Pubblicazione: (2023)
On the Global Convergence of Policy Gradient in Average Reward Markov Decision Processes
di: Kumar, Navdeep, et al.
Pubblicazione: (2024)
di: Kumar, Navdeep, et al.
Pubblicazione: (2024)
On Convergence of Average-Reward Q-Learning in Weakly Communicating Markov Decision Processes
di: Wan, Yi, et al.
Pubblicazione: (2024)
di: Wan, Yi, et al.
Pubblicazione: (2024)
Asymptotically optimal regret in communicating Markov decision processes
di: Boone, Victor
Pubblicazione: (2025)
di: Boone, Victor
Pubblicazione: (2025)
Horizon-Free Regret for Linear Markov Decision Processes
di: Zhang, Zihan, et al.
Pubblicazione: (2024)
di: Zhang, Zihan, et al.
Pubblicazione: (2024)
Achieving Constant Regret in Linear Markov Decision Processes
di: Zhang, Weitong, et al.
Pubblicazione: (2024)
di: Zhang, Weitong, et al.
Pubblicazione: (2024)
Logarithmic Neyman Regret for Adaptive Estimation of the Average Treatment Effect
di: Neopane, Ojash, et al.
Pubblicazione: (2024)
di: Neopane, Ojash, et al.
Pubblicazione: (2024)
Bellman Optimality of Average-Reward Robust Markov Decision Processes with a Constant Gain
di: Wang, Shengbo, et al.
Pubblicazione: (2025)
di: Wang, Shengbo, et al.
Pubblicazione: (2025)
No-Regret Thompson Sampling for Finite-Horizon Markov Decision Processes with Gaussian Processes
di: Bayrooti, Jasmine, et al.
Pubblicazione: (2025)
di: Bayrooti, Jasmine, et al.
Pubblicazione: (2025)
Almost Sure Convergence of Differential Temporal Difference Learning for Average Reward Markov Decision Processes
di: Blaser, Ethan, et al.
Pubblicazione: (2026)
di: Blaser, Ethan, et al.
Pubblicazione: (2026)
Efficient Exploration in Average-Reward Constrained Reinforcement Learning: Achieving Near-Optimal Regret With Posterior Sampling
di: Provodin, Danil, et al.
Pubblicazione: (2024)
di: Provodin, Danil, et al.
Pubblicazione: (2024)
Concentration of Cumulative Reward in Markov Decision Processes
di: Sayedana, Borna, et al.
Pubblicazione: (2024)
di: Sayedana, Borna, et al.
Pubblicazione: (2024)
Optimistic Regret Bounds for Online Learning in Adversarial Markov Decision Processes
di: Moon, Sang Bin, et al.
Pubblicazione: (2024)
di: Moon, Sang Bin, et al.
Pubblicazione: (2024)
Model-Based Exploration in Monitored Markov Decision Processes
di: Kazemipour, Alireza, et al.
Pubblicazione: (2025)
di: Kazemipour, Alireza, et al.
Pubblicazione: (2025)
Exploration by Optimization with Hybrid Regularizers: Logarithmic Regret with Adversarial Robustness in Partial Monitoring
di: Tsuchiya, Taira, et al.
Pubblicazione: (2024)
di: Tsuchiya, Taira, et al.
Pubblicazione: (2024)
Burning RED: Unlocking Subtask-Driven Reinforcement Learning and Risk-Awareness in Average-Reward Markov Decision Processes
di: Rojas, Juan Sebastian, et al.
Pubblicazione: (2024)
di: Rojas, Juan Sebastian, et al.
Pubblicazione: (2024)
Logarithmic Regret for Nonlinear Control
di: Wang, James, et al.
Pubblicazione: (2025)
di: Wang, James, et al.
Pubblicazione: (2025)
Warm-up Free Policy Optimization: Improved Regret in Linear Markov Decision Processes
di: Cassel, Asaf, et al.
Pubblicazione: (2024)
di: Cassel, Asaf, et al.
Pubblicazione: (2024)
Regret Analysis of Unichain Average Reward Constrained MDPs with General Parameterization
di: Satheesh, Anirudh, et al.
Pubblicazione: (2026)
di: Satheesh, Anirudh, et al.
Pubblicazione: (2026)
Reoptimization Nearly Solves Weakly Coupled Markov Decision Processes
di: Gast, Nicolas, et al.
Pubblicazione: (2022)
di: Gast, Nicolas, et al.
Pubblicazione: (2022)
Geometric Active Exploration in Markov Decision Processes: the Benefit of Abstraction
di: De Santi, Riccardo, et al.
Pubblicazione: (2024)
di: De Santi, Riccardo, et al.
Pubblicazione: (2024)
Learning Constrained Markov Decision Processes With Non-stationary Rewards and Constraints
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
Regret Analysis of Average-Reward Unichain MDPs via an Actor-Critic Approach
di: Ganesh, Swetha, et al.
Pubblicazione: (2025)
di: Ganesh, Swetha, et al.
Pubblicazione: (2025)
Provably Efficient Exploration in Reward Machines with Low Regret
di: Bourel, Hippolyte, et al.
Pubblicazione: (2024)
di: Bourel, Hippolyte, et al.
Pubblicazione: (2024)
Achieving Logarithmic Regret in KL-Regularized Zero-Sum Markov Games
di: Nayak, Anupam, et al.
Pubblicazione: (2025)
di: Nayak, Anupam, et al.
Pubblicazione: (2025)
Provably Efficient Exploration in Quantum Reinforcement Learning with Logarithmic Worst-Case Regret
di: Zhong, Han, et al.
Pubblicazione: (2023)
di: Zhong, Han, et al.
Pubblicazione: (2023)
Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes
di: Wang, Zijian, et al.
Pubblicazione: (2025)
di: Wang, Zijian, et al.
Pubblicazione: (2025)
Learning Weakly Communicating Average-Reward CMDPs: Strong Duality and Improved Regret
di: Yu, Kihyun, et al.
Pubblicazione: (2026)
di: Yu, Kihyun, et al.
Pubblicazione: (2026)
Achieving $\widetilde{\mathcal{O}}(\sqrt{T})$ Regret in Average-Reward POMDPs with Known Observation Models
di: Russo, Alessio, et al.
Pubblicazione: (2025)
di: Russo, Alessio, et al.
Pubblicazione: (2025)
Order-Optimal Regret with Novel Policy Gradient Approaches in Infinite-Horizon Average Reward MDPs
di: Ganesh, Swetha, et al.
Pubblicazione: (2024)
di: Ganesh, Swetha, et al.
Pubblicazione: (2024)
Provably Efficient Reward Transfer in Reinforcement Learning with Discrete Markov Decision Processes
di: Vora, Kevin, et al.
Pubblicazione: (2025)
di: Vora, Kevin, et al.
Pubblicazione: (2025)
Logarithmic Regret for Online KL-Regularized Reinforcement Learning
di: Zhao, Heyang, et al.
Pubblicazione: (2025)
di: Zhao, Heyang, et al.
Pubblicazione: (2025)
Finite-Time Logarithmic Bayes Regret Upper Bounds
di: Atsidakou, Alexia, et al.
Pubblicazione: (2023)
di: Atsidakou, Alexia, et al.
Pubblicazione: (2023)
Kernel-Based Function Approximation for Average Reward Reinforcement Learning: An Optimist No-Regret Algorithm
di: Vakili, Sattar, et al.
Pubblicazione: (2024)
di: Vakili, Sattar, et al.
Pubblicazione: (2024)
Monitored Markov Decision Processes
di: Parisi, Simone, et al.
Pubblicazione: (2024)
di: Parisi, Simone, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Achieving Tractable Minimax Optimal Regret in Average Reward MDPs
di: Boone, Victor, et al.
Pubblicazione: (2024) -
Quantum Speedups in Regret Analysis of Infinite Horizon Average-Reward Markov Decision Processes
di: Ganguly, Bhargav, et al.
Pubblicazione: (2023) -
The regret lower bound for communicating Markov Decision Processes
di: Boone, Victor, et al.
Pubblicazione: (2025) -
Regret Analysis of Policy Gradient Algorithm for Infinite Horizon Average Reward Markov Decision Processes
di: Bai, Qinbo, et al.
Pubblicazione: (2023) -
Hierarchical Average-Reward Linearly-solvable Markov Decision Processes
di: Infante, Guillermo, et al.
Pubblicazione: (2024)