Minimax Optimal Strategy for Delayed Observations in Online Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lee, Harin, Jamieson, Kevin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Minimax Optimal Reinforcement Learning with Quasi-Optimism
par: Lee, Harin, et autres
Publié: (2025)
par: Lee, Harin, et autres
Publié: (2025)
Nearly Minimax Optimal Submodular Maximization with Bandit Feedback
par: Tajdini, Artin, et autres
Publié: (2023)
par: Tajdini, Artin, et autres
Publié: (2023)
Unified Framework of Distributional Regret in Multi-Armed Bandits and Reinforcement Learning
par: Lee, Harin, et autres
Publié: (2026)
par: Lee, Harin, et autres
Publié: (2026)
Near-Minimax-Optimal Distributional Reinforcement Learning with a Generative Model
par: Rowland, Mark, et autres
Publié: (2024)
par: Rowland, Mark, et autres
Publié: (2024)
Minimax-Optimal Multi-Agent Robust Reinforcement Learning
par: Jiao, Yuchen, et autres
Publié: (2024)
par: Jiao, Yuchen, et autres
Publié: (2024)
Lasso Bandit with Compatibility Condition on Optimal Arm
par: Lee, Harin, et autres
Publié: (2024)
par: Lee, Harin, et autres
Publié: (2024)
Towards Minimax Optimality of Model-based Robust Reinforcement Learning
par: Clavier, Pierre, et autres
Publié: (2023)
par: Clavier, Pierre, et autres
Publié: (2023)
Deep Reinforcement Learning for Online Optimal Execution Strategies
par: Micheli, Alessandro, et autres
Publié: (2024)
par: Micheli, Alessandro, et autres
Publié: (2024)
Optimal Posterior Sampling for Policy Identification in Tabular Markov Decision Processes
par: Kone, Cyrille, et autres
Publié: (2026)
par: Kone, Cyrille, et autres
Publié: (2026)
Infrequent Exploration in Linear Bandits
par: Lee, Harin, et autres
Publié: (2025)
par: Lee, Harin, et autres
Publié: (2025)
Improved Regret of Linear Ensemble Sampling
par: Lee, Harin, et autres
Publié: (2024)
par: Lee, Harin, et autres
Publié: (2024)
Gap-Dependent Bounds for Nearly Minimax Optimal Reinforcement Learning with Linear Function Approximation
par: Zhang, Haochen, et autres
Publié: (2026)
par: Zhang, Haochen, et autres
Publié: (2026)
Minimax-Optimal Reward-Agnostic Exploration in Reinforcement Learning
par: Li, Gen, et autres
Publié: (2023)
par: Li, Gen, et autres
Publié: (2023)
Minimax Optimal Q Learning with Nearest Neighbors
par: Zhao, Puning, et autres
Publié: (2023)
par: Zhao, Puning, et autres
Publié: (2023)
Minimax Optimal and Computationally Efficient Algorithms for Distributionally Robust Offline Reinforcement Learning
par: Liu, Zhishuai, et autres
Publié: (2024)
par: Liu, Zhishuai, et autres
Publié: (2024)
Nearly Minimax Optimal Regret for Multinomial Logistic Bandit
par: Lee, Joongkyu, et autres
Publié: (2024)
par: Lee, Joongkyu, et autres
Publié: (2024)
Best-of-Majority: Minimax-Optimal Strategy for Pass@$k$ Inference Scaling
par: Di, Qiwei, et autres
Publié: (2025)
par: Di, Qiwei, et autres
Publié: (2025)
Sample Complexity Reduction via Policy Difference Estimation in Tabular Reinforcement Learning
par: Narang, Adhyyan, et autres
Publié: (2024)
par: Narang, Adhyyan, et autres
Publié: (2024)
Model-Based Reinforcement Learning under Random Observation Delays
par: Karamzade, Armin, et autres
Publié: (2025)
par: Karamzade, Armin, et autres
Publié: (2025)
Reinforcement Learning from Delayed Observations via World Models
par: Karamzade, Armin, et autres
Publié: (2024)
par: Karamzade, Armin, et autres
Publié: (2024)
Learning to Actively Learn: A Robust Approach
par: Zhang, Jifan, et autres
Publié: (2020)
par: Zhang, Jifan, et autres
Publié: (2020)
Near-Optimal Regret in Adversarial Kernel Bandits
par: Zhang, Yu-Jie, et autres
Publié: (2026)
par: Zhang, Yu-Jie, et autres
Publié: (2026)
Exactly Minimax-Optimal Locally Differentially Private Sampling
par: Park, Hyun-Young, et autres
Publié: (2024)
par: Park, Hyun-Young, et autres
Publié: (2024)
Learning What to Recommend: Minimax Optimal Simple Regret in Logistic Bandits
par: Liu, Shuai, et autres
Publié: (2026)
par: Liu, Shuai, et autres
Publié: (2026)
Linear Bandits on Ellipsoids: Minimax Optimal Algorithms
par: Zhang, Raymond, et autres
Publié: (2025)
par: Zhang, Raymond, et autres
Publié: (2025)
Transformers are Minimax Optimal Nonparametric In-Context Learners
par: Kim, Juno, et autres
Publié: (2024)
par: Kim, Juno, et autres
Publié: (2024)
ORVIT: Near-Optimal Online Distributionally Robust Reinforcement Learning
par: Ghosh, Debamita, et autres
Publié: (2025)
par: Ghosh, Debamita, et autres
Publié: (2025)
Efficient Near-Optimal Algorithm for Online Shortest Paths in Directed Acyclic Graphs with Bandit Feedback Against Adaptive Adversaries
par: Maiti, Arnab, et autres
Publié: (2025)
par: Maiti, Arnab, et autres
Publié: (2025)
Tackling Heavy-Tailed Rewards in Reinforcement Learning with Function Approximation: Minimax Optimal and Instance-Dependent Regret Bounds
par: Huang, Jiayi, et autres
Publié: (2023)
par: Huang, Jiayi, et autres
Publié: (2023)
On the Minimax Regret in Online Ranking with Top-k Feedback
par: Zhang, Mingyuan, et autres
Publié: (2023)
par: Zhang, Mingyuan, et autres
Publié: (2023)
Nearly Minimax Optimal Regret for Learning Linear Mixture Stochastic Shortest Path
par: Di, Qiwei, et autres
Publié: (2024)
par: Di, Qiwei, et autres
Publié: (2024)
Reward Transfer from Inverse Reinforcement Learning: A Coupled Minimax Approach
par: Hao, Guang-Yuan, et autres
Publié: (2026)
par: Hao, Guang-Yuan, et autres
Publié: (2026)
Minimax Optimal Estimation of Stability Under Distribution Shift
par: Namkoong, Hongseok, et autres
Publié: (2022)
par: Namkoong, Hongseok, et autres
Publié: (2022)
Computational Efficient and Minimax Optimal Nonignorable Matrix Completion
par: A, Yuanhong, et autres
Publié: (2025)
par: A, Yuanhong, et autres
Publié: (2025)
Online Matching via Reinforcement Learning: An Expert Policy Orchestration Strategy
par: Mignacco, Chiara, et autres
Publié: (2025)
par: Mignacco, Chiara, et autres
Publié: (2025)
Decoding Game: On Minimax Optimality of Heuristic Text Generation Strategies
par: Chen, Sijin, et autres
Publié: (2024)
par: Chen, Sijin, et autres
Publié: (2024)
Online Pre-Training for Offline-to-Online Reinforcement Learning
par: Shin, Yongjae, et autres
Publié: (2025)
par: Shin, Yongjae, et autres
Publié: (2025)
High Effort, Low Gain: Fundamental Limits of Active Learning for Linear Dynamical Systems
par: Chatzikiriakos, Nicolas, et autres
Publié: (2025)
par: Chatzikiriakos, Nicolas, et autres
Publié: (2025)
Settling the Sample Complexity of Online Reinforcement Learning
par: Zhang, Zihan, et autres
Publié: (2023)
par: Zhang, Zihan, et autres
Publié: (2023)
Information-Theoretic Minimax Regret Bounds for Reinforcement Learning based on Duality
par: Bongole, Raghav, et autres
Publié: (2024)
par: Bongole, Raghav, et autres
Publié: (2024)
Documents similaires
-
Minimax Optimal Reinforcement Learning with Quasi-Optimism
par: Lee, Harin, et autres
Publié: (2025) -
Nearly Minimax Optimal Submodular Maximization with Bandit Feedback
par: Tajdini, Artin, et autres
Publié: (2023) -
Unified Framework of Distributional Regret in Multi-Armed Bandits and Reinforcement Learning
par: Lee, Harin, et autres
Publié: (2026) -
Near-Minimax-Optimal Distributional Reinforcement Learning with a Generative Model
par: Rowland, Mark, et autres
Publié: (2024) -
Minimax-Optimal Multi-Agent Robust Reinforcement Learning
par: Jiao, Yuchen, et autres
Publié: (2024)