An Improved Model-Free Decision-Estimation Coefficient with Applications in Adversarial MDPs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Haolin, Wei, Chen-Yu, Zimmert, Julian |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Beating Adversarial Low-Rank MDPs with Unknown Transition and Bandit Feedback
par: Liu, Haolin, et autres
Publié: (2024)
par: Liu, Haolin, et autres
Publié: (2024)
Decision Making in Hybrid Environments: A Model Aggregation Approach
par: Liu, Haolin, et autres
Publié: (2025)
par: Liu, Haolin, et autres
Publié: (2025)
A Model Selection Approach for Corruption Robust Reinforcement Learning
par: Wei, Chen-Yu, et autres
Publié: (2021)
par: Wei, Chen-Yu, et autres
Publié: (2021)
Optimal cross-learning for contextual bandits with unknown context distributions
par: Schneider, Jon, et autres
Publié: (2024)
par: Schneider, Jon, et autres
Publié: (2024)
A Best-of-both-worlds Algorithm for Bandits with Delayed Feedback with Robustness to Excessive Delays
par: Masoudian, Saeed, et autres
Publié: (2023)
par: Masoudian, Saeed, et autres
Publié: (2023)
Incentive-compatible Bandits: Importance Weighting No More
par: Zimmert, Julian, et autres
Publié: (2024)
par: Zimmert, Julian, et autres
Publié: (2024)
Unified Algorithms for RL with Decision-Estimation Coefficients: PAC, Reward-Free, Preference-Based Learning, and Beyond
par: Chen, Fan, et autres
Publié: (2022)
par: Chen, Fan, et autres
Publié: (2022)
Improved Algorithm for Adversarial Linear Mixture MDPs with Bandit Feedback and Unknown Transition
par: Li, Long-Fei, et autres
Publié: (2024)
par: Li, Long-Fei, et autres
Publié: (2024)
Slowly Changing Adversarial Bandit Algorithms are Efficient for Discounted MDPs
par: Kash, Ian A., et autres
Publié: (2022)
par: Kash, Ian A., et autres
Publié: (2022)
Non-stationary Bandit Convex Optimization: A Comprehensive Study
par: Liu, Xiaoqi, et autres
Publié: (2025)
par: Liu, Xiaoqi, et autres
Publié: (2025)
Learning Adversarial MDPs with Stochastic Hard Constraints
par: Stradi, Francesco Emanuele, et autres
Publié: (2024)
par: Stradi, Francesco Emanuele, et autres
Publié: (2024)
NAN: A Training-Free Solution to Coefficient Estimation in Model Merging
par: Si, Chongjie, et autres
Publié: (2025)
par: Si, Chongjie, et autres
Publié: (2025)
Reinforcement Learning from Adversarial Preferences in Tabular MDPs
par: Tsuchiya, Taira, et autres
Publié: (2025)
par: Tsuchiya, Taira, et autres
Publié: (2025)
Online Learning in MDPs with Partially Adversarial Transitions and Losses
par: Schlisselberg, Ofir, et autres
Publié: (2026)
par: Schlisselberg, Ofir, et autres
Publié: (2026)
Contextual Dynamic Pricing with Heterogeneous Buyers
par: Lykouris, Thodoris, et autres
Publié: (2025)
par: Lykouris, Thodoris, et autres
Publié: (2025)
Efficient Model-Free Exploration in Low-Rank MDPs
par: Mhammedi, Zakaria, et autres
Publié: (2023)
par: Mhammedi, Zakaria, et autres
Publié: (2023)
Near-Optimal Dynamic Regret for Adversarial Linear Mixture MDPs
par: Li, Long-Fei, et autres
Publié: (2024)
par: Li, Long-Fei, et autres
Publié: (2024)
Breiman meets Bellman: Non-Greedy Decision Trees with MDPs
par: Kohler, Hector, et autres
Publié: (2023)
par: Kohler, Hector, et autres
Publié: (2023)
$κ$-Explorer: A Unified Framework for Active Model Estimation in MDPs
par: Gu, Xihe, et autres
Publié: (2026)
par: Gu, Xihe, et autres
Publié: (2026)
Adapting to Stochastic and Adversarial Losses in Episodic MDPs with Aggregate Bandit Feedback
par: Ito, Shinji, et autres
Publié: (2025)
par: Ito, Shinji, et autres
Publié: (2025)
Narrowing the Gap between Adversarial and Stochastic MDPs via Policy Optimization
par: Tiapkin, Daniil, et autres
Publié: (2024)
par: Tiapkin, Daniil, et autres
Publié: (2024)
Optimal Horizon-Free Reward-Free Exploration for Linear Mixture MDPs
par: Zhang, Junkai, et autres
Publié: (2023)
par: Zhang, Junkai, et autres
Publié: (2023)
TBDFiltering: Sample-Efficient Tree-Based Data Filtering
par: Busa-Fekete, Robert Istvan, et autres
Publié: (2026)
par: Busa-Fekete, Robert Istvan, et autres
Publié: (2026)
How Do Diffusion Models Improve Adversarial Robustness?
par: Yuezhang, Liu, et autres
Publié: (2025)
par: Yuezhang, Liu, et autres
Publié: (2025)
On the Complexity of Offline Reinforcement Learning with $Q^\star$-Approximation and Partial Coverage
par: Liu, Haolin, et autres
Publié: (2026)
par: Liu, Haolin, et autres
Publié: (2026)
An Improved Algorithm for Adversarial Linear Contextual Bandits via Reduction
par: van Erven, Tim, et autres
Publié: (2025)
par: van Erven, Tim, et autres
Publié: (2025)
Adaptive Estimation and Optimal Control in Offline Contextual MDPs without Stationarity
par: Bhattacharyya, Riddhiman, et autres
Publié: (2026)
par: Bhattacharyya, Riddhiman, et autres
Publié: (2026)
Corruption-Robust Linear Bandits: Minimax Optimality and Gap-Dependent Misspecification
par: Liu, Haolin, et autres
Publié: (2024)
par: Liu, Haolin, et autres
Publié: (2024)
Efficient Opportunistic Approachability
par: Marinov, Teodor Vanislavov, et autres
Publié: (2026)
par: Marinov, Teodor Vanislavov, et autres
Publié: (2026)
Sample Complexity Bounds for Linear Constrained MDPs with a Generative Model
par: Liu, Xingtu, et autres
Publié: (2025)
par: Liu, Xingtu, et autres
Publié: (2025)
Hybrid Reinforcement Learning Breaks Sample Size Barriers in Linear MDPs
par: Tan, Kevin, et autres
Publié: (2024)
par: Tan, Kevin, et autres
Publié: (2024)
Teaching Precommitted Agents: Model-Free Policy Evaluation and Control in Quasi-Hyperbolic Discounted MDPs
par: Eshwar, S. R.
Publié: (2025)
par: Eshwar, S. R.
Publié: (2025)
Modes of Sequence Models and Learning Coefficients
par: Chen, Zhongtian, et autres
Publié: (2025)
par: Chen, Zhongtian, et autres
Publié: (2025)
Interval Estimation of Coefficients in Penalized Regression Models of Insurance Data
par: Manna, Alokesh, et autres
Publié: (2024)
par: Manna, Alokesh, et autres
Publié: (2024)
Time-Constrained Robust MDPs
par: Zouitine, Adil, et autres
Publié: (2024)
par: Zouitine, Adil, et autres
Publié: (2024)
Estimation of the Learning Coefficient Using Empirical Loss
par: Takio, Tatsuyoshi, et autres
Publié: (2025)
par: Takio, Tatsuyoshi, et autres
Publié: (2025)
Last-Iterate Convergent Policy Gradient Primal-Dual Methods for Constrained MDPs
par: Ding, Dongsheng, et autres
Publié: (2023)
par: Ding, Dongsheng, et autres
Publié: (2023)
Near-Optimal Sample Complexity for Online Constrained MDPs
par: Liu, Chang, et autres
Publié: (2026)
par: Liu, Chang, et autres
Publié: (2026)
Reinforcement Learning for Infinite-Horizon Average-Reward Linear MDPs via Approximation by Discounted-Reward MDPs
par: Hong, Kihyuk, et autres
Publié: (2024)
par: Hong, Kihyuk, et autres
Publié: (2024)
Bring Your Own (Non-Robust) Algorithm to Solve Robust MDPs by Estimating The Worst Kernel
par: Wang, Kaixin, et autres
Publié: (2023)
par: Wang, Kaixin, et autres
Publié: (2023)
Documents similaires
-
Beating Adversarial Low-Rank MDPs with Unknown Transition and Bandit Feedback
par: Liu, Haolin, et autres
Publié: (2024) -
Decision Making in Hybrid Environments: A Model Aggregation Approach
par: Liu, Haolin, et autres
Publié: (2025) -
A Model Selection Approach for Corruption Robust Reinforcement Learning
par: Wei, Chen-Yu, et autres
Publié: (2021) -
Optimal cross-learning for contextual bandits with unknown context distributions
par: Schneider, Jon, et autres
Publié: (2024) -
A Best-of-both-worlds Algorithm for Bandits with Delayed Feedback with Robustness to Excessive Delays
par: Masoudian, Saeed, et autres
Publié: (2023)