Regret and Sample Complexity of Online Q-Learning via Concentration of Stochastic Approximation with Time-Inhomogeneous Markov Chains
Fuente:
arXiv
Salvato in:
| Autori principali: | Singh, Rahul, Chandak, Siddharth, Moulines, Eric, Borkar, Vivek S., Bambos, Nicholas |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Concentration Bound for TD(0) with Function Approximation
di: Chandak, Siddharth, et al.
Pubblicazione: (2023)
di: Chandak, Siddharth, et al.
Pubblicazione: (2023)
Finite-Time Bounds for Two-Time-Scale Stochastic Approximation with Arbitrary Norm Contractions and Markovian Noise
di: Chandak, Siddharth, et al.
Pubblicazione: (2025)
di: Chandak, Siddharth, et al.
Pubblicazione: (2025)
High-Probability Bounds for SGD under the Polyak-Lojasiewicz Condition with Markovian Noise
di: Kar, Avik, et al.
Pubblicazione: (2026)
di: Kar, Avik, et al.
Pubblicazione: (2026)
Heavy-Tailed and Long-Range Dependent Noise in Stochastic Approximation: A Finite-Time Analysis
di: Chandak, Siddharth, et al.
Pubblicazione: (2026)
di: Chandak, Siddharth, et al.
Pubblicazione: (2026)
Policy Gradient Methods for Non-Markovian Reinforcement Learning
di: Kar, Avik, et al.
Pubblicazione: (2026)
di: Kar, Avik, et al.
Pubblicazione: (2026)
Learning to Control Unknown Strongly Monotone Games
di: Chandak, Siddharth, et al.
Pubblicazione: (2024)
di: Chandak, Siddharth, et al.
Pubblicazione: (2024)
Last-Iterate Guarantees for Learning in Co-coercive Games
di: Chandak, Siddharth, et al.
Pubblicazione: (2026)
di: Chandak, Siddharth, et al.
Pubblicazione: (2026)
Choose Your Battles: Distributed Learning Over Multiple Tug of War Games
di: Chandak, Siddharth, et al.
Pubblicazione: (2025)
di: Chandak, Siddharth, et al.
Pubblicazione: (2025)
$O(1/k)$ Finite-Time Bound for Non-Linear Two-Time-Scale Stochastic Approximation
di: Chandak, Siddharth
Pubblicazione: (2025)
di: Chandak, Siddharth
Pubblicazione: (2025)
Reinforcement Learning in Non-Markovian Environments
di: Chandak, Siddharth, et al.
Pubblicazione: (2022)
di: Chandak, Siddharth, et al.
Pubblicazione: (2022)
Non-Expansive Mappings in Two-Time-Scale Stochastic Approximation: Finite-Time Analysis
di: Chandak, Siddharth
Pubblicazione: (2025)
di: Chandak, Siddharth
Pubblicazione: (2025)
Stochastic Approximation with Two Time Scales: The General Case
di: Borkar, Vivek S
Pubblicazione: (2024)
di: Borkar, Vivek S
Pubblicazione: (2024)
An Actor-Critic Algorithm with Function Approximation for Risk Sensitive Cost Markov Decision Processes
di: Guin, Soumyajit, et al.
Pubblicazione: (2025)
di: Guin, Soumyajit, et al.
Pubblicazione: (2025)
Optimal Control for Remote Patient Monitoring with Multidimensional Health States
di: Chandak, Siddharth, et al.
Pubblicazione: (2025)
di: Chandak, Siddharth, et al.
Pubblicazione: (2025)
Tiered Service Architecture for Remote Patient Monitoring
di: Chandak, Siddharth, et al.
Pubblicazione: (2024)
di: Chandak, Siddharth, et al.
Pubblicazione: (2024)
Stochastic approximation in non-markovian environments revisited
di: Borkar, Vivek Shripad
Pubblicazione: (2026)
di: Borkar, Vivek Shripad
Pubblicazione: (2026)
On Gaussian approximation for entropy-regularized Q-learning with function approximation
di: Rubtsov, Artemy, et al.
Pubblicazione: (2026)
di: Rubtsov, Artemy, et al.
Pubblicazione: (2026)
On Sampling with Approximate Transport Maps
di: Grenioux, Louis, et al.
Pubblicazione: (2023)
di: Grenioux, Louis, et al.
Pubblicazione: (2023)
The ODE Method for Asymptotic Statistics in Stochastic Approximation and Reinforcement Learning
di: Borkar, Vivek, et al.
Pubblicazione: (2021)
di: Borkar, Vivek, et al.
Pubblicazione: (2021)
An Asymptotic CVaR Measure of Risk for Markov Chains
di: Patel, Shivam, et al.
Pubblicazione: (2024)
di: Patel, Shivam, et al.
Pubblicazione: (2024)
Gaussian Approximation and Multiplier Bootstrap for Federated Linear Stochastic Approximation
di: Levin, Ilya, et al.
Pubblicazione: (2026)
di: Levin, Ilya, et al.
Pubblicazione: (2026)
Statistical inference for Linear Stochastic Approximation with Markovian Noise
di: Samsonov, Sergey, et al.
Pubblicazione: (2025)
di: Samsonov, Sergey, et al.
Pubblicazione: (2025)
A theoretical basis for model collapse in recursive training
di: Borkar, Vivek Shripad
Pubblicazione: (2025)
di: Borkar, Vivek Shripad
Pubblicazione: (2025)
SCAFFLSA: Taming Heterogeneity in Federated Linear Stochastic Approximation and TD Learning
di: Mangold, Paul, et al.
Pubblicazione: (2024)
di: Mangold, Paul, et al.
Pubblicazione: (2024)
Actor-Critic or Critic-Actor? A Tale of Two Time Scales
di: Bhatnagar, Shalabh, et al.
Pubblicazione: (2022)
di: Bhatnagar, Shalabh, et al.
Pubblicazione: (2022)
Regret Minimization via Saddle Point Optimization
di: Kirschner, Johannes, et al.
Pubblicazione: (2024)
di: Kirschner, Johannes, et al.
Pubblicazione: (2024)
A dynamic view of some anomalous phenomena in SGD
di: Borkar, Vivek Shripad
Pubblicazione: (2025)
di: Borkar, Vivek Shripad
Pubblicazione: (2025)
Federated UCBVI: Communication-Efficient Federated Regret Minimization with Heterogeneous Agents
di: Labbi, Safwan, et al.
Pubblicazione: (2024)
di: Labbi, Safwan, et al.
Pubblicazione: (2024)
Learning Time-Inhomogeneous Markov Dynamics in Financial Time Series via Neural Parameterization
di: Rovirosa, Jan, et al.
Pubblicazione: (2026)
di: Rovirosa, Jan, et al.
Pubblicazione: (2026)
The Sample Complexity of Approximate Rejection Sampling with Applications to Smoothed Online Learning
di: Block, Adam, et al.
Pubblicazione: (2023)
di: Block, Adam, et al.
Pubblicazione: (2023)
Gaussian Approximation and Multiplier Bootstrap for Polyak-Ruppert Averaged Linear Stochastic Approximation with Applications to TD Learning
di: Samsonov, Sergey, et al.
Pubblicazione: (2024)
di: Samsonov, Sergey, et al.
Pubblicazione: (2024)
Markov Chain Variance Estimation: A Stochastic Approximation Approach
di: Agrawal, Shubhada, et al.
Pubblicazione: (2024)
di: Agrawal, Shubhada, et al.
Pubblicazione: (2024)
Learning the Model While Learning Q: Finite-Time Sample Complexity of Online SyncMBQ
di: Lim, Han-Dong, et al.
Pubblicazione: (2024)
di: Lim, Han-Dong, et al.
Pubblicazione: (2024)
Asymptotic convexity of wide and shallow neural networks
di: Borkar, Vivek, et al.
Pubblicazione: (2025)
di: Borkar, Vivek, et al.
Pubblicazione: (2025)
Identification and Adaptive Control of Markov Jump Systems: Sample Complexity and Regret Bounds
di: Sattar, Yahya, et al.
Pubblicazione: (2021)
di: Sattar, Yahya, et al.
Pubblicazione: (2021)
Balanced Training of Energy-Based Models with Adaptive Flow Sampling
di: Grenioux, Louis, et al.
Pubblicazione: (2023)
di: Grenioux, Louis, et al.
Pubblicazione: (2023)
Regret-Oracle Complexity Tradeoffs in Agnostic Online Learning
di: Attias, Idan, et al.
Pubblicazione: (2026)
di: Attias, Idan, et al.
Pubblicazione: (2026)
Optimistic Regret Bounds for Online Learning in Adversarial Markov Decision Processes
di: Moon, Sang Bin, et al.
Pubblicazione: (2024)
di: Moon, Sang Bin, et al.
Pubblicazione: (2024)
Improved Central Limit Theorem and Bootstrap Approximations for Linear Stochastic Approximation
di: Butyrin, Bogdan, et al.
Pubblicazione: (2025)
di: Butyrin, Bogdan, et al.
Pubblicazione: (2025)
Online Decision-Focused Learning
di: Capitaine, Aymeric, et al.
Pubblicazione: (2025)
di: Capitaine, Aymeric, et al.
Pubblicazione: (2025)
Documenti analoghi
-
A Concentration Bound for TD(0) with Function Approximation
di: Chandak, Siddharth, et al.
Pubblicazione: (2023) -
Finite-Time Bounds for Two-Time-Scale Stochastic Approximation with Arbitrary Norm Contractions and Markovian Noise
di: Chandak, Siddharth, et al.
Pubblicazione: (2025) -
High-Probability Bounds for SGD under the Polyak-Lojasiewicz Condition with Markovian Noise
di: Kar, Avik, et al.
Pubblicazione: (2026) -
Heavy-Tailed and Long-Range Dependent Noise in Stochastic Approximation: A Finite-Time Analysis
di: Chandak, Siddharth, et al.
Pubblicazione: (2026) -
Policy Gradient Methods for Non-Markovian Reinforcement Learning
di: Kar, Avik, et al.
Pubblicazione: (2026)