A Nearly Optimal and Low-Switching Algorithm for Reinforcement Learning with General Function Approximation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Heyang, He, Jiafan, Gu, Quanquan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Pessimistic Nonlinear Least-Squares Value Iteration for Offline Reinforcement Learning
di: Di, Qiwei, et al.
Pubblicazione: (2023)
di: Di, Qiwei, et al.
Pubblicazione: (2023)
Reinforcement Learning from Human Feedback with Active Queries
di: Ji, Kaixuan, et al.
Pubblicazione: (2024)
di: Ji, Kaixuan, et al.
Pubblicazione: (2024)
Feel-Good Thompson Sampling for Contextual Dueling Bandits
di: Li, Xuheng, et al.
Pubblicazione: (2024)
di: Li, Xuheng, et al.
Pubblicazione: (2024)
Provably Efficient Representation Selection in Low-rank Markov Decision Processes: From Online to Offline RL
di: Zhang, Weitong, et al.
Pubblicazione: (2021)
di: Zhang, Weitong, et al.
Pubblicazione: (2021)
Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits
di: Di, Qiwei, et al.
Pubblicazione: (2023)
di: Di, Qiwei, et al.
Pubblicazione: (2023)
Optimal Horizon-Free Reward-Free Exploration for Linear Mixture MDPs
di: Zhang, Junkai, et al.
Pubblicazione: (2023)
di: Zhang, Junkai, et al.
Pubblicazione: (2023)
Understanding SGD with Exponential Moving Average: A Case Study in Linear Regression
di: Li, Xuheng, et al.
Pubblicazione: (2025)
di: Li, Xuheng, et al.
Pubblicazione: (2025)
Variance-Aware Feel-Good Thompson Sampling for Contextual Bandits
di: Li, Xuheng, et al.
Pubblicazione: (2025)
di: Li, Xuheng, et al.
Pubblicazione: (2025)
Nearly Optimal Algorithms for Contextual Dueling Bandits from Adversarial Feedback
di: Di, Qiwei, et al.
Pubblicazione: (2024)
di: Di, Qiwei, et al.
Pubblicazione: (2024)
Reinforcement Learning with Function Approximation for Non-Markov Processes
di: Kara, Ali Devran
Pubblicazione: (2026)
di: Kara, Ali Devran
Pubblicazione: (2026)
Unified Convergence Analysis for Score-Based Diffusion Models with Deterministic Samplers
di: Li, Runjia, et al.
Pubblicazione: (2024)
di: Li, Runjia, et al.
Pubblicazione: (2024)
MARS-M: When Variance Reduction Meets Matrices
di: Liu, Yifeng, et al.
Pubblicazione: (2025)
di: Liu, Yifeng, et al.
Pubblicazione: (2025)
Infinite-Horizon Reinforcement Learning with Multinomial Logistic Function Approximation
di: Park, Jaehyun, et al.
Pubblicazione: (2024)
di: Park, Jaehyun, et al.
Pubblicazione: (2024)
Scalable Approximate Algorithms for Optimal Transport Linear Models
di: Kacprzak, Tomasz, et al.
Pubblicazione: (2025)
di: Kacprzak, Tomasz, et al.
Pubblicazione: (2025)
Near-Optimal Primal-Dual Algorithm for Learning Linear Mixture CMDPs with Adversarial Rewards
di: Yu, Kihyun, et al.
Pubblicazione: (2026)
di: Yu, Kihyun, et al.
Pubblicazione: (2026)
Global Convergence and Rich Feature Learning in $L$-Layer Infinite-Width Neural Networks under $μ$P Parametrization
di: Chen, Zixiang, et al.
Pubblicazione: (2025)
di: Chen, Zixiang, et al.
Pubblicazione: (2025)
Near-Optimal Algorithms for Group Distributionally Robust Optimization and Beyond
di: Soma, Tasuku, et al.
Pubblicazione: (2022)
di: Soma, Tasuku, et al.
Pubblicazione: (2022)
Dimension-Independent Convergence of Underdamped Langevin Monte Carlo in KL Divergence
di: Zhang, Shiyuan, et al.
Pubblicazione: (2026)
di: Zhang, Shiyuan, et al.
Pubblicazione: (2026)
AdaSwitch: An Adaptive Switching Meta-Algorithm for Learning-Augmented Bounded-Influence Problems
di: Chen, Xi, et al.
Pubblicazione: (2025)
di: Chen, Xi, et al.
Pubblicazione: (2025)
Reinforcement Learning from Partial Observation: Linear Function Approximation with Provable Sample Efficiency
di: Cai, Qi, et al.
Pubblicazione: (2022)
di: Cai, Qi, et al.
Pubblicazione: (2022)
A Lower Bound and a Near-Optimal Algorithm for Bilevel Empirical Risk Minimization
di: Dagréou, Mathieu, et al.
Pubblicazione: (2023)
di: Dagréou, Mathieu, et al.
Pubblicazione: (2023)
ROOT-SGD: Sharp Nonasymptotics and Near-Optimal Asymptotics in a Single Algorithm
di: Li, Chris Junchi, et al.
Pubblicazione: (2020)
di: Li, Chris Junchi, et al.
Pubblicazione: (2020)
A Nearly Optimal Single Loop Algorithm for Stochastic Bilevel Optimization under Unbounded Smoothness
di: Gong, Xiaochuan, et al.
Pubblicazione: (2024)
di: Gong, Xiaochuan, et al.
Pubblicazione: (2024)
Matching the Statistical Query Lower Bound for $k$-Sparse Parity Problems with Sign Stochastic Gradient Descent
di: Kou, Yiwen, et al.
Pubblicazione: (2024)
di: Kou, Yiwen, et al.
Pubblicazione: (2024)
A Near-Optimal Single-Loop Stochastic Algorithm for Convex Finite-Sum Coupled Compositional Optimization
di: Wang, Bokun, et al.
Pubblicazione: (2023)
di: Wang, Bokun, et al.
Pubblicazione: (2023)
On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization
di: Zhou, Dongruo, et al.
Pubblicazione: (2018)
di: Zhou, Dongruo, et al.
Pubblicazione: (2018)
MARS: Unleashing the Power of Variance Reduction for Training Large Models
di: Yuan, Huizhuo, et al.
Pubblicazione: (2024)
di: Yuan, Huizhuo, et al.
Pubblicazione: (2024)
Machine Learning Guided Optimal Transmission Switching to Mitigate Wildfire Ignition Risk
di: Huang, Weimin, et al.
Pubblicazione: (2025)
di: Huang, Weimin, et al.
Pubblicazione: (2025)
Near-Optimal Online Learning for Multi-Agent Submodular Coordination: Tight Approximation and Communication Efficiency
di: Zhang, Qixin, et al.
Pubblicazione: (2025)
di: Zhang, Qixin, et al.
Pubblicazione: (2025)
Fast Catch-Up, Late Switching: Optimal Batch Size Scheduling via Functional Scaling Laws
di: Wang, Jinbo, et al.
Pubblicazione: (2026)
di: Wang, Jinbo, et al.
Pubblicazione: (2026)
Corruption-Tolerant Asynchronous Q-Learning with Near-Optimal Rates
di: Maity, Sreejeet, et al.
Pubblicazione: (2025)
di: Maity, Sreejeet, et al.
Pubblicazione: (2025)
Blackwell's Approachability with Approximation Algorithms
di: Garber, Dan, et al.
Pubblicazione: (2025)
di: Garber, Dan, et al.
Pubblicazione: (2025)
General Loss Functions Lead to (Approximate) Interpolation in High Dimensions
di: Lai, Kuo-Wei, et al.
Pubblicazione: (2023)
di: Lai, Kuo-Wei, et al.
Pubblicazione: (2023)
Efficient Alternating Minimization with Applications to Weighted Low Rank Approximation
di: Song, Zhao, et al.
Pubblicazione: (2023)
di: Song, Zhao, et al.
Pubblicazione: (2023)
Optimal Guarantees for Algorithmic Reproducibility and Gradient Complexity in Convex Optimization
di: Zhang, Liang, et al.
Pubblicazione: (2023)
di: Zhang, Liang, et al.
Pubblicazione: (2023)
A Simple, Optimal and Efficient Algorithm for Online Exp-Concave Optimization
di: Wang, Yi-Han, et al.
Pubblicazione: (2025)
di: Wang, Yi-Han, et al.
Pubblicazione: (2025)
Towards Simple and Provable Parameter-Free Adaptive Gradient Methods
di: Tao, Yuanzhe, et al.
Pubblicazione: (2024)
di: Tao, Yuanzhe, et al.
Pubblicazione: (2024)
Achieve Performatively Optimal Policy for Performative Reinforcement Learning
di: Chen, Ziyi, et al.
Pubblicazione: (2025)
di: Chen, Ziyi, et al.
Pubblicazione: (2025)
Gauss-Newton Temporal Difference Learning with Nonlinear Function Approximation
di: Ke, Zhifa, et al.
Pubblicazione: (2023)
di: Ke, Zhifa, et al.
Pubblicazione: (2023)
Linear Convergence of Entropy-Regularized Natural Policy Gradient with Linear Function Approximation
di: Cayci, Semih, et al.
Pubblicazione: (2021)
di: Cayci, Semih, et al.
Pubblicazione: (2021)
Documenti analoghi
-
Pessimistic Nonlinear Least-Squares Value Iteration for Offline Reinforcement Learning
di: Di, Qiwei, et al.
Pubblicazione: (2023) -
Reinforcement Learning from Human Feedback with Active Queries
di: Ji, Kaixuan, et al.
Pubblicazione: (2024) -
Feel-Good Thompson Sampling for Contextual Dueling Bandits
di: Li, Xuheng, et al.
Pubblicazione: (2024) -
Provably Efficient Representation Selection in Low-rank Markov Decision Processes: From Online to Offline RL
di: Zhang, Weitong, et al.
Pubblicazione: (2021) -
Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits
di: Di, Qiwei, et al.
Pubblicazione: (2023)