Optimal Horizon-Free Reward-Free Exploration for Linear Mixture MDPs
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Junkai, Zhang, Weitong, Gu, Quanquan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning Infinite-Horizon Average-Reward Linear Mixture MDPs of Bounded Span
di: Chae, Woojin, et al.
Pubblicazione: (2024)
di: Chae, Woojin, et al.
Pubblicazione: (2024)
Uncertainty-Aware Reward-Free Exploration with General Function Approximation
di: Zhang, Junkai, et al.
Pubblicazione: (2024)
di: Zhang, Junkai, et al.
Pubblicazione: (2024)
Efficient Model-Free Exploration in Low-Rank MDPs
di: Mhammedi, Zakaria, et al.
Pubblicazione: (2023)
di: Mhammedi, Zakaria, et al.
Pubblicazione: (2023)
Offline-Online Reinforcement Learning for Linear Mixture MDPs
di: Zhang, Zhongjun, et al.
Pubblicazione: (2026)
di: Zhang, Zhongjun, et al.
Pubblicazione: (2026)
Achieving Tractable Minimax Optimal Regret in Average Reward MDPs
di: Boone, Victor, et al.
Pubblicazione: (2024)
di: Boone, Victor, et al.
Pubblicazione: (2024)
Provably Efficient Representation Selection in Low-rank Markov Decision Processes: From Online to Offline RL
di: Zhang, Weitong, et al.
Pubblicazione: (2021)
di: Zhang, Weitong, et al.
Pubblicazione: (2021)
Understanding SGD with Exponential Moving Average: A Case Study in Linear Regression
di: Li, Xuheng, et al.
Pubblicazione: (2025)
di: Li, Xuheng, et al.
Pubblicazione: (2025)
Non-Rectangular Average-Reward Robust MDPs: Optimal Policies and Their Transient Values
di: Wang, Shengbo, et al.
Pubblicazione: (2026)
di: Wang, Shengbo, et al.
Pubblicazione: (2026)
Towards Simple and Provable Parameter-Free Adaptive Gradient Methods
di: Tao, Yuanzhe, et al.
Pubblicazione: (2024)
di: Tao, Yuanzhe, et al.
Pubblicazione: (2024)
Optimal Variance-Dependent Regret Bounds for Infinite-Horizon MDPs
di: Zamir, Guy, et al.
Pubblicazione: (2026)
di: Zamir, Guy, et al.
Pubblicazione: (2026)
Near-Optimal Primal-Dual Algorithm for Learning Linear Mixture CMDPs with Adversarial Rewards
di: Yu, Kihyun, et al.
Pubblicazione: (2026)
di: Yu, Kihyun, et al.
Pubblicazione: (2026)
A Nearly Optimal and Low-Switching Algorithm for Reinforcement Learning with General Function Approximation
di: Zhao, Heyang, et al.
Pubblicazione: (2023)
di: Zhao, Heyang, et al.
Pubblicazione: (2023)
Span-Based Optimal Sample Complexity for Average Reward MDPs
di: Zurek, Matthew, et al.
Pubblicazione: (2023)
di: Zurek, Matthew, et al.
Pubblicazione: (2023)
Variance-Aware Feel-Good Thompson Sampling for Contextual Bandits
di: Li, Xuheng, et al.
Pubblicazione: (2025)
di: Li, Xuheng, et al.
Pubblicazione: (2025)
Landscape of Policy Optimization for Finite Horizon MDPs with General State and Action
di: Chen, Xin, et al.
Pubblicazione: (2024)
di: Chen, Xin, et al.
Pubblicazione: (2024)
The Plug-in Approach for Average-Reward and Discounted MDPs: Optimal Sample Complexity Analysis
di: Zurek, Matthew, et al.
Pubblicazione: (2024)
di: Zurek, Matthew, et al.
Pubblicazione: (2024)
Span-Based Optimal Sample Complexity for Weakly Communicating and General Average Reward MDPs
di: Zurek, Matthew, et al.
Pubblicazione: (2024)
di: Zurek, Matthew, et al.
Pubblicazione: (2024)
Soft Robust MDPs and Risk-Sensitive MDPs: Equivalence, Policy Gradient, and Sample Complexity
di: Zhang, Runyu, et al.
Pubblicazione: (2023)
di: Zhang, Runyu, et al.
Pubblicazione: (2023)
Dimension-Independent Convergence of Underdamped Langevin Monte Carlo in KL Divergence
di: Zhang, Shiyuan, et al.
Pubblicazione: (2026)
di: Zhang, Shiyuan, et al.
Pubblicazione: (2026)
Deflation-Free Optimal Scoring
di: Afroz, Sharmin, et al.
Pubblicazione: (2026)
di: Afroz, Sharmin, et al.
Pubblicazione: (2026)
Feel-Good Thompson Sampling for Contextual Dueling Bandits
di: Li, Xuheng, et al.
Pubblicazione: (2024)
di: Li, Xuheng, et al.
Pubblicazione: (2024)
Unified Convergence Analysis for Score-Based Diffusion Models with Deterministic Samplers
di: Li, Runjia, et al.
Pubblicazione: (2024)
di: Li, Runjia, et al.
Pubblicazione: (2024)
MARS-M: When Variance Reduction Meets Matrices
di: Liu, Yifeng, et al.
Pubblicazione: (2025)
di: Liu, Yifeng, et al.
Pubblicazione: (2025)
Probabilistic Safety Guarantee for Stochastic Control Systems Using Average Reward MDPs
di: Omidi, Saber, et al.
Pubblicazione: (2025)
di: Omidi, Saber, et al.
Pubblicazione: (2025)
Pessimistic Nonlinear Least-Squares Value Iteration for Offline Reinforcement Learning
di: Di, Qiwei, et al.
Pubblicazione: (2023)
di: Di, Qiwei, et al.
Pubblicazione: (2023)
Optimal Projection-Free Adaptive SGD for Matrix Optimization
di: Kovalev, Dmitry
Pubblicazione: (2026)
di: Kovalev, Dmitry
Pubblicazione: (2026)
Optimal Hessian/Jacobian-Free Nonconvex-PL Bilevel Optimization
di: Huang, Feihu
Pubblicazione: (2024)
di: Huang, Feihu
Pubblicazione: (2024)
Matching the Statistical Query Lower Bound for $k$-Sparse Parity Problems with Sign Stochastic Gradient Descent
di: Kou, Yiwen, et al.
Pubblicazione: (2024)
di: Kou, Yiwen, et al.
Pubblicazione: (2024)
Last-Iterate Convergent Policy Gradient Primal-Dual Methods for Constrained MDPs
di: Ding, Dongsheng, et al.
Pubblicazione: (2023)
di: Ding, Dongsheng, et al.
Pubblicazione: (2023)
On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization
di: Zhou, Dongruo, et al.
Pubblicazione: (2018)
di: Zhou, Dongruo, et al.
Pubblicazione: (2018)
MARS: Unleashing the Power of Variance Reduction for Training Large Models
di: Yuan, Huizhuo, et al.
Pubblicazione: (2024)
di: Yuan, Huizhuo, et al.
Pubblicazione: (2024)
Model-Free Learning for the Linear Quadratic Regulator over Rate-Limited Channels
di: Ye, Lintao, et al.
Pubblicazione: (2024)
di: Ye, Lintao, et al.
Pubblicazione: (2024)
Faster Fixed-Point Methods for Multichain MDPs
di: Zurek, Matthew, et al.
Pubblicazione: (2025)
di: Zurek, Matthew, et al.
Pubblicazione: (2025)
Planning and Learning in Average Risk-aware MDPs
di: Wang, Weikai, et al.
Pubblicazione: (2025)
di: Wang, Weikai, et al.
Pubblicazione: (2025)
Anytime Pretraining: Horizon-Free Learning-Rate Schedules with Weight Averaging
di: Meterez, Alexandru, et al.
Pubblicazione: (2026)
di: Meterez, Alexandru, et al.
Pubblicazione: (2026)
How Free is Parameter-Free Stochastic Optimization?
di: Attia, Amit, et al.
Pubblicazione: (2024)
di: Attia, Amit, et al.
Pubblicazione: (2024)
Problem-Parameter-Free Decentralized Bilevel Optimization
di: Zhai, Zhiwei, et al.
Pubblicazione: (2025)
di: Zhai, Zhiwei, et al.
Pubblicazione: (2025)
Provably Efficient Infinite-Horizon Average-Reward Reinforcement Learning with Linear Function Approximation
di: Chae, Woojin, et al.
Pubblicazione: (2024)
di: Chae, Woojin, et al.
Pubblicazione: (2024)
Active Learning of Deep Neural Networks via Gradient-Free Cutting Planes
di: Zhang, Erica, et al.
Pubblicazione: (2024)
di: Zhang, Erica, et al.
Pubblicazione: (2024)
Faster Algorithms for Structured Linear and Kernel Support Vector Machines
di: Gu, Yuzhou, et al.
Pubblicazione: (2023)
di: Gu, Yuzhou, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Learning Infinite-Horizon Average-Reward Linear Mixture MDPs of Bounded Span
di: Chae, Woojin, et al.
Pubblicazione: (2024) -
Uncertainty-Aware Reward-Free Exploration with General Function Approximation
di: Zhang, Junkai, et al.
Pubblicazione: (2024) -
Efficient Model-Free Exploration in Low-Rank MDPs
di: Mhammedi, Zakaria, et al.
Pubblicazione: (2023) -
Offline-Online Reinforcement Learning for Linear Mixture MDPs
di: Zhang, Zhongjun, et al.
Pubblicazione: (2026) -
Achieving Tractable Minimax Optimal Regret in Average Reward MDPs
di: Boone, Victor, et al.
Pubblicazione: (2024)