Offline Oracle-Efficient Learning for Contextual MDPs via Layerwise Exploration-Exploitation Tradeoff
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qian, Jian, Hu, Haichen, Simchi-Levi, David |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Model-Based Reinforcement Learning with Double Oracle Efficiency in Policy Optimization and Offline Estimation
par: Hu, Haichen, et autres
Publié: (2026)
par: Hu, Haichen, et autres
Publié: (2026)
Interleaved Resampling and Refitting: Data and Compute-Efficient Evaluation of Black-Box Predictors
par: Hu, Haichen, et autres
Publié: (2026)
par: Hu, Haichen, et autres
Publié: (2026)
Perturbing the Derivative: Doubly Wild Refitting for Model-Free Evaluation of Opaque Machine Learning Predictors
par: Hu, Haichen, et autres
Publié: (2025)
par: Hu, Haichen, et autres
Publié: (2025)
Perturbing the Derivative: Wild Refitting for Model-Free Evaluation of Machine Learning Models under Bregman Losses
par: Hu, Haichen, et autres
Publié: (2025)
par: Hu, Haichen, et autres
Publié: (2025)
Pre-Trained AI Model Assisted Online Decision-Making under Missing Covariates: A Theoretical Perspective
par: Hu, Haichen, et autres
Publié: (2025)
par: Hu, Haichen, et autres
Publié: (2025)
Contextual Online Decision Making with Infinite-Dimensional Functional Regression
par: Hu, Haichen, et autres
Publié: (2025)
par: Hu, Haichen, et autres
Publié: (2025)
Constrained Online Decision-Making: A Unified Framework
par: Hu, Haichen, et autres
Publié: (2025)
par: Hu, Haichen, et autres
Publié: (2025)
On the Optimal Regret of Locally Private Linear Contextual Bandit
par: Li, Jiachun, et autres
Publié: (2024)
par: Li, Jiachun, et autres
Publié: (2024)
Exploration-Exploitation Tradeoff in Universal Lossy Compression
par: Weinberger, Nir, et autres
Publié: (2025)
par: Weinberger, Nir, et autres
Publié: (2025)
Neural Exploitation and Exploration of Contextual Bandits
par: Ban, Yikun, et autres
Publié: (2023)
par: Ban, Yikun, et autres
Publié: (2023)
Adaptive Estimation and Optimal Control in Offline Contextual MDPs without Stationarity
par: Bhattacharyya, Riddhiman, et autres
Publié: (2026)
par: Bhattacharyya, Riddhiman, et autres
Publié: (2026)
From Confounding to Learning: Dynamic Service Fee Pricing on Third-Party Platforms
par: Ai, Rui, et autres
Publié: (2025)
par: Ai, Rui, et autres
Publié: (2025)
Learning to Price with Resource Constraints: From Full Information to Machine-Learned Prices
par: Ao, Ruicheng, et autres
Publié: (2025)
par: Ao, Ruicheng, et autres
Publié: (2025)
Near-Optimal Regret for Policy Optimization in Contextual MDPs with General Offline Function Approximation
par: Levy, Orin, et autres
Publié: (2026)
par: Levy, Orin, et autres
Publié: (2026)
Sample and Oracle Efficient Reinforcement Learning for MDPs with Linearly-Realizable Value Functions
par: Mhammedi, Zakaria
Publié: (2024)
par: Mhammedi, Zakaria
Publié: (2024)
Taming the Monster Every Context: Complexity Measure and Unified Framework for Offline-Oracle Efficient Contextual Bandits
par: Qin, Hao, et autres
Publié: (2026)
par: Qin, Hao, et autres
Publié: (2026)
Sobolev Norm Learning Rates for Conditional Mean Embeddings
par: Talwai, Prem, et autres
Publié: (2021)
par: Talwai, Prem, et autres
Publié: (2021)
Exploration Implies Data Augmentation: Reachability and Generalisation in Contextual MDPs
par: Weltevrede, Max, et autres
Publié: (2024)
par: Weltevrede, Max, et autres
Publié: (2024)
Regret-Oracle Complexity Tradeoffs in Agnostic Online Learning
par: Attias, Idan, et autres
Publié: (2026)
par: Attias, Idan, et autres
Publié: (2026)
Navigating the Exploration-Exploitation Tradeoff in Inference-Time Scaling of Diffusion Models
par: Su, Xun, et autres
Publié: (2025)
par: Su, Xun, et autres
Publié: (2025)
Improving the Estimation of Lifetime Effects in A/B Testing via Treatment Locality
par: Chen, Shuze, et autres
Publié: (2024)
par: Chen, Shuze, et autres
Publié: (2024)
Optimal Adaptive Experimental Design for Estimating Treatment Effect
par: Li, Jiachun, et autres
Publié: (2024)
par: Li, Jiachun, et autres
Publié: (2024)
Prediction-Guided Active Experiments
par: Ao, Ruicheng, et autres
Publié: (2024)
par: Ao, Ruicheng, et autres
Publié: (2024)
Beyond ATE: Multi-Criteria Design for A/B Testing
par: Li, Jiachun, et autres
Publié: (2025)
par: Li, Jiachun, et autres
Publié: (2025)
Is Pure Exploitation Sufficient in Exogenous MDPs with Linear Function Approximation?
par: Liang, Hao, et autres
Publié: (2026)
par: Liang, Hao, et autres
Publié: (2026)
Offline-Online Reinforcement Learning for Linear Mixture MDPs
par: Zhang, Zhongjun, et autres
Publié: (2026)
par: Zhang, Zhongjun, et autres
Publié: (2026)
Exploitation Over Exploration: Unmasking the Bias in Linear Bandit Recommender Offline Evaluation
par: Pires, Pedro R., et autres
Publié: (2025)
par: Pires, Pedro R., et autres
Publié: (2025)
A Simple and Optimal Policy Design with Safety against Heavy-Tailed Risk for Stochastic Bandits
par: Simchi-Levi, David, et autres
Publié: (2022)
par: Simchi-Levi, David, et autres
Publié: (2022)
Partial Identification under Missing Data Using Weak Shadow Variables from Pretrained Models
par: Chen, Hongyu, et autres
Publié: (2026)
par: Chen, Hongyu, et autres
Publié: (2026)
The Value of Information in Resource-Constrained Pricing
par: Ao, Ruicheng, et autres
Publié: (2026)
par: Ao, Ruicheng, et autres
Publié: (2026)
Privacy Preserving Adaptive Experiment Design
par: Li, Jiachun, et autres
Publié: (2024)
par: Li, Jiachun, et autres
Publié: (2024)
Regret Distribution in Stochastic Bandits: Optimal Trade-off between Expectation and Tail Risk
par: Simchi-Levi, David, et autres
Publié: (2023)
par: Simchi-Levi, David, et autres
Publié: (2023)
Efficient Model-Free Exploration in Low-Rank MDPs
par: Mhammedi, Zakaria, et autres
Publié: (2023)
par: Mhammedi, Zakaria, et autres
Publié: (2023)
Sample Complexity Characterization for Linear Contextual MDPs
par: Deng, Junze, et autres
Publié: (2024)
par: Deng, Junze, et autres
Publié: (2024)
Eluder-based Regret for Stochastic Contextual MDPs
par: Levy, Orin, et autres
Publié: (2022)
par: Levy, Orin, et autres
Publié: (2022)
On the Reliability Limits of LLM-Based Multi-Agent Planning
par: Ao, Ruicheng, et autres
Publié: (2026)
par: Ao, Ruicheng, et autres
Publié: (2026)
ORLoopBench: Solver-in-the-Loop Benchmarks for Self-Correction and Behavioral Rationality in Operations Research
par: Ao, Ruicheng, et autres
Publié: (2026)
par: Ao, Ruicheng, et autres
Publié: (2026)
OptiRepair: Closed-Loop Diagnosis and Repair of Supply Chain Optimization Models with LLM Agents
par: Ao, Ruicheng, et autres
Publié: (2026)
par: Ao, Ruicheng, et autres
Publié: (2026)
A Primal-Dual Algorithm for Offline Constrained Reinforcement Learning with Linear MDPs
par: Hong, Kihyuk, et autres
Publié: (2024)
par: Hong, Kihyuk, et autres
Publié: (2024)
In-context Exploration-Exploitation for Reinforcement Learning
par: Dai, Zhenwen, et autres
Publié: (2024)
par: Dai, Zhenwen, et autres
Publié: (2024)
Documents similaires
-
Model-Based Reinforcement Learning with Double Oracle Efficiency in Policy Optimization and Offline Estimation
par: Hu, Haichen, et autres
Publié: (2026) -
Interleaved Resampling and Refitting: Data and Compute-Efficient Evaluation of Black-Box Predictors
par: Hu, Haichen, et autres
Publié: (2026) -
Perturbing the Derivative: Doubly Wild Refitting for Model-Free Evaluation of Opaque Machine Learning Predictors
par: Hu, Haichen, et autres
Publié: (2025) -
Perturbing the Derivative: Wild Refitting for Model-Free Evaluation of Machine Learning Models under Bregman Losses
par: Hu, Haichen, et autres
Publié: (2025) -
Pre-Trained AI Model Assisted Online Decision-Making under Missing Covariates: A Theoretical Perspective
par: Hu, Haichen, et autres
Publié: (2025)