Online Bandits with (Biased) Offline Data: Adaptive Learning under Distribution Mismatch
Fuente:
arXiv
Guardado en:
| Autores principales: | Cheung, Wang Chi, Lyu, Lixing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Best Arm Identification with Possibly Biased Offline Data
por: Yang, Le, et al.
Publicado: (2025)
por: Yang, Le, et al.
Publicado: (2025)
Efficiently Solving Discounted MDPs with Predictions on Transition Matrices
por: Lyu, Lixing, et al.
Publicado: (2025)
por: Lyu, Lixing, et al.
Publicado: (2025)
Episodic Contextual Bandits with Knapsacks under Conversion Models
por: Cheung, Wang Chi, et al.
Publicado: (2025)
por: Cheung, Wang Chi, et al.
Publicado: (2025)
Online Bandit Learning with Offline Preference Data for Improved RLHF
por: Agnihotri, Akhil, et al.
Publicado: (2024)
por: Agnihotri, Akhil, et al.
Publicado: (2024)
Contextual Online Pricing with (Biased) Offline Data
por: Zhang, Yixuan, et al.
Publicado: (2025)
por: Zhang, Yixuan, et al.
Publicado: (2025)
Pure Exploration for a Good Policy in Reinforcement Learning with Bandit Feedback
por: Li, Zitian, et al.
Publicado: (2026)
por: Li, Zitian, et al.
Publicado: (2026)
Direction-Aware Offline-to-Online Learning in Linear Contextual Bandits
por: Han, Zean, et al.
Publicado: (2026)
por: Han, Zean, et al.
Publicado: (2026)
Offline Local Search for Online Stochastic Bandits
por: Benadè, Gerdus, et al.
Publicado: (2026)
por: Benadè, Gerdus, et al.
Publicado: (2026)
Offline Clustering of Linear Bandits: The Power of Clusters under Limited Data
por: Liu, Jingyuan, et al.
Publicado: (2025)
por: Liu, Jingyuan, et al.
Publicado: (2025)
Simulating Biases for Interpretable Fairness in Offline and Online Classifiers
por: Inácio, Ricardo, et al.
Publicado: (2025)
por: Inácio, Ricardo, et al.
Publicado: (2025)
Benchmarks for Reinforcement Learning with Biased Offline Data and Imperfect Simulators
por: Linial, Ori, et al.
Publicado: (2024)
por: Linial, Ori, et al.
Publicado: (2024)
Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning
por: Gireesh, Nandiraju, et al.
Publicado: (2026)
por: Gireesh, Nandiraju, et al.
Publicado: (2026)
Offline Learning for Combinatorial Multi-armed Bandits
por: Liu, Xutong, et al.
Publicado: (2025)
por: Liu, Xutong, et al.
Publicado: (2025)
Adaptive Client Sampling in Federated Learning via Online Learning with Bandit Feedback
por: Zhao, Boxin, et al.
Publicado: (2021)
por: Zhao, Boxin, et al.
Publicado: (2021)
Distributed quasi-Newton robust estimation under differential privacy
por: Wang, Chuhan, et al.
Publicado: (2024)
por: Wang, Chuhan, et al.
Publicado: (2024)
Planning to Go Out-of-Distribution in Offline-to-Online Reinforcement Learning
por: McInroe, Trevor, et al.
Publicado: (2023)
por: McInroe, Trevor, et al.
Publicado: (2023)
Adaptive Replay Buffer for Offline-to-Online Reinforcement Learning
por: Song, Chihyeon, et al.
Publicado: (2025)
por: Song, Chihyeon, et al.
Publicado: (2025)
ROAD: Adaptive Data Mixing for Offline-to-Online Reinforcement Learning via Bi-Level Optimization
por: Yang, Letian, et al.
Publicado: (2026)
por: Yang, Letian, et al.
Publicado: (2026)
Online Learning to Rank under Corruption: A Robust Cascading Bandits Approach
por: Ghaffari, Fatemeh, et al.
Publicado: (2025)
por: Ghaffari, Fatemeh, et al.
Publicado: (2025)
Adaptive Policy Selection and Fine-Tuning under Interaction Budgets for Offline-to-Online Reinforcement Learning
por: Bozkurt, Alper Kamil, et al.
Publicado: (2026)
por: Bozkurt, Alper Kamil, et al.
Publicado: (2026)
Residual Learning and Context Encoding for Adaptive Offline-to-Online Reinforcement Learning
por: Nakhaei, Mohammadreza, et al.
Publicado: (2024)
por: Nakhaei, Mohammadreza, et al.
Publicado: (2024)
Leveraging Offline Data in Linear Latent Contextual Bandits
por: Kausik, Chinmaya, et al.
Publicado: (2024)
por: Kausik, Chinmaya, et al.
Publicado: (2024)
Multiclass Online Learnability under Bandit Feedback
por: Raman, Ananth, et al.
Publicado: (2023)
por: Raman, Ananth, et al.
Publicado: (2023)
Bayesian Regret Minimization in Offline Bandits
por: Petrik, Marek, et al.
Publicado: (2023)
por: Petrik, Marek, et al.
Publicado: (2023)
Group-Sensitive Offline Contextual Bandits
por: Guo, Yihong, et al.
Publicado: (2025)
por: Guo, Yihong, et al.
Publicado: (2025)
Robust Policy Expansion for Offline-to-Online RL under Diverse Data Corruption
por: He, Longxiang, et al.
Publicado: (2025)
por: He, Longxiang, et al.
Publicado: (2025)
Active Advantage-Aligned Online Reinforcement Learning with Offline Data
por: Liu, Xuefeng, et al.
Publicado: (2025)
por: Liu, Xuefeng, et al.
Publicado: (2025)
Analysis of On-policy Policy Gradient Methods under the Distribution Mismatch
por: Wang, Weizhen, et al.
Publicado: (2025)
por: Wang, Weizhen, et al.
Publicado: (2025)
Distributionally Robust Model-Based Offline Reinforcement Learning with Near-Optimal Sample Complexity
por: Shi, Laixi, et al.
Publicado: (2022)
por: Shi, Laixi, et al.
Publicado: (2022)
Behavior-Adaptive Q-Learning: A Unifying Framework for Offline-to-Online RL
por: Zu, Lipeng, et al.
Publicado: (2025)
por: Zu, Lipeng, et al.
Publicado: (2025)
Shift is Good: Mismatched Data Mixing Improves Test Performance
por: Medvedev, Marko, et al.
Publicado: (2025)
por: Medvedev, Marko, et al.
Publicado: (2025)
Sample-Mean Anchored Thompson Sampling for Offline-to-Online Learning with Distribution Shift
por: Li, Bochao, et al.
Publicado: (2026)
por: Li, Bochao, et al.
Publicado: (2026)
Biased Dueling Bandits with Stochastic Delayed Feedback
por: Yi, Bongsoo, et al.
Publicado: (2024)
por: Yi, Bongsoo, et al.
Publicado: (2024)
Making Offline RL Online: Collaborative World Models for Offline Visual Reinforcement Learning
por: Wang, Qi, et al.
Publicado: (2023)
por: Wang, Qi, et al.
Publicado: (2023)
Offline Contextual Bandits in the Presence of New Actions
por: Kishimoto, Ren, et al.
Publicado: (2026)
por: Kishimoto, Ren, et al.
Publicado: (2026)
Refined PAC-Bayes Bounds for Offline Bandits
por: Gouverneur, Amaury, et al.
Publicado: (2025)
por: Gouverneur, Amaury, et al.
Publicado: (2025)
Offline Contextual Bandit with Counterfactual Sample Identification
por: Gilotte, Alexandre, et al.
Publicado: (2025)
por: Gilotte, Alexandre, et al.
Publicado: (2025)
Model-based Offline RL via Robust Value-Aware Model Learning with Implicitly Differentiable Adaptive Weighting
por: Qiao, Zhongjian, et al.
Publicado: (2026)
por: Qiao, Zhongjian, et al.
Publicado: (2026)
Enhancing Online Reinforcement Learning with Meta-Learned Objective from Offline Data
por: Deng, Shilong, et al.
Publicado: (2025)
por: Deng, Shilong, et al.
Publicado: (2025)
Bridging Online and Offline RL: Contextual Bandit Learning for Multi-Turn Code Generation
por: Chen, Ziru, et al.
Publicado: (2026)
por: Chen, Ziru, et al.
Publicado: (2026)
Ejemplares similares
-
Best Arm Identification with Possibly Biased Offline Data
por: Yang, Le, et al.
Publicado: (2025) -
Efficiently Solving Discounted MDPs with Predictions on Transition Matrices
por: Lyu, Lixing, et al.
Publicado: (2025) -
Episodic Contextual Bandits with Knapsacks under Conversion Models
por: Cheung, Wang Chi, et al.
Publicado: (2025) -
Online Bandit Learning with Offline Preference Data for Improved RLHF
por: Agnihotri, Akhil, et al.
Publicado: (2024) -
Contextual Online Pricing with (Biased) Offline Data
por: Zhang, Yixuan, et al.
Publicado: (2025)