Sample-Mean Anchored Thompson Sampling for Offline-to-Online Learning with Distribution Shift
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Bochao, Fu, Yao, Chen, Wei, Kong, Fang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Thompson Sampling in Online RLHF with General Function Approximation
di: Feng, Songtao, et al.
Pubblicazione: (2025)
di: Feng, Songtao, et al.
Pubblicazione: (2025)
Online Learning of Decision Trees with Thompson Sampling
di: Chaouki, Ayman, et al.
Pubblicazione: (2024)
di: Chaouki, Ayman, et al.
Pubblicazione: (2024)
Energy-Guided Diffusion Sampling for Offline-to-Online Reinforcement Learning
di: Liu, Xu-Hui, et al.
Pubblicazione: (2024)
di: Liu, Xu-Hui, et al.
Pubblicazione: (2024)
Fast Online Learning with Gaussian Prior-Driven Hierarchical Unimodal Thompson Sampling
di: Zhao, Tianchi, et al.
Pubblicazione: (2026)
di: Zhao, Tianchi, et al.
Pubblicazione: (2026)
Thompson Sampling for Repeated Newsvendor
di: Chen, Li, et al.
Pubblicazione: (2025)
di: Chen, Li, et al.
Pubblicazione: (2025)
Distilled Thompson Sampling: Practical and Efficient Thompson Sampling via Imitation Learning
di: Namkoong, Hongseok, et al.
Pubblicazione: (2020)
di: Namkoong, Hongseok, et al.
Pubblicazione: (2020)
Sample-Efficient Policy Constraint Offline Deep Reinforcement Learning based on Sample Filtering
di: Chen, Yuanhao, et al.
Pubblicazione: (2025)
di: Chen, Yuanhao, et al.
Pubblicazione: (2025)
Constrained Linear Thompson Sampling
di: Gangrade, Aditya, et al.
Pubblicazione: (2025)
di: Gangrade, Aditya, et al.
Pubblicazione: (2025)
Regenerative Particle Thompson Sampling
di: Zhou, Zeyu, et al.
Pubblicazione: (2022)
di: Zhou, Zeyu, et al.
Pubblicazione: (2022)
Sample-Efficient Tabular Self-Play for Offline Robust Reinforcement Learning
di: Li, Na, et al.
Pubblicazione: (2025)
di: Li, Na, et al.
Pubblicazione: (2025)
Adaptive Data Augmentation for Thompson Sampling
di: Kim, Wonyoung
Pubblicazione: (2025)
di: Kim, Wonyoung
Pubblicazione: (2025)
A Broader View of Thompson Sampling
di: Qu, Yanlin, et al.
Pubblicazione: (2025)
di: Qu, Yanlin, et al.
Pubblicazione: (2025)
DISA: Offline Importance Sampling for Distribution-Matching LLM-RL
di: Wang, Shaobo, et al.
Pubblicazione: (2026)
di: Wang, Shaobo, et al.
Pubblicazione: (2026)
Graph Neural Thompson Sampling
di: Wu, Shuang, et al.
Pubblicazione: (2024)
di: Wu, Shuang, et al.
Pubblicazione: (2024)
Thompson Sampling-Based Learning and Control for Unknown Dynamic Systems
di: Zheng, Kaikai, et al.
Pubblicazione: (2025)
di: Zheng, Kaikai, et al.
Pubblicazione: (2025)
Thompson Sampling For Combinatorial Bandits: Polynomial Regret and Mismatched Sampling Paradox
di: Zhang, Raymond, et al.
Pubblicazione: (2024)
di: Zhang, Raymond, et al.
Pubblicazione: (2024)
Mean-Shift PCA by Knockoff Mean
di: Li, Mengda, et al.
Pubblicazione: (2026)
di: Li, Mengda, et al.
Pubblicazione: (2026)
Stochastically Constrained Best Arm Identification with Thompson Sampling
di: Yang, Le, et al.
Pubblicazione: (2025)
di: Yang, Le, et al.
Pubblicazione: (2025)
Is Thompson Sampling Susceptible to Algorithmic Collusion?
di: Xiong, Yi, et al.
Pubblicazione: (2024)
di: Xiong, Yi, et al.
Pubblicazione: (2024)
On Regret Bounds of Thompson Sampling for Bayesian Optimization
di: Takeno, Shion, et al.
Pubblicazione: (2026)
di: Takeno, Shion, et al.
Pubblicazione: (2026)
Fast, Precise Thompson Sampling for Bayesian Optimization
di: Sweet, David
Pubblicazione: (2024)
di: Sweet, David
Pubblicazione: (2024)
Thompson Sampling in Partially Observable Contextual Bandits
di: Park, Hongju, et al.
Pubblicazione: (2024)
di: Park, Hongju, et al.
Pubblicazione: (2024)
Provable Domain Adaptation for Offline Reinforcement Learning with Limited Samples
di: Chen, Weiqin, et al.
Pubblicazione: (2024)
di: Chen, Weiqin, et al.
Pubblicazione: (2024)
BFTS: Thompson Sampling with Bayesian Additive Regression Trees
di: Deng, Ruizhe, et al.
Pubblicazione: (2026)
di: Deng, Ruizhe, et al.
Pubblicazione: (2026)
Distributionally Robust Model-Based Offline Reinforcement Learning with Near-Optimal Sample Complexity
di: Shi, Laixi, et al.
Pubblicazione: (2022)
di: Shi, Laixi, et al.
Pubblicazione: (2022)
Sampling from the Mean-Field Stationary Distribution
di: Kook, Yunbum, et al.
Pubblicazione: (2024)
di: Kook, Yunbum, et al.
Pubblicazione: (2024)
MINTS: Minimalist Thompson Sampling
di: Wang, Kaizheng
Pubblicazione: (2026)
di: Wang, Kaizheng
Pubblicazione: (2026)
Prior-Aligned Meta-RL: Thompson Sampling with Learned Priors and Guarantees in Finite-Horizon MDPs
di: Zhou, Runlin, et al.
Pubblicazione: (2025)
di: Zhou, Runlin, et al.
Pubblicazione: (2025)
Mitigating Distribution Shift in Model-based Offline RL via Shifts-aware Reward Learning
di: Luo, Wang, et al.
Pubblicazione: (2024)
di: Luo, Wang, et al.
Pubblicazione: (2024)
Settling the Sample Complexity of Model-Based Offline Reinforcement Learning
di: Li, Gen, et al.
Pubblicazione: (2022)
di: Li, Gen, et al.
Pubblicazione: (2022)
Feel-Good Thompson Sampling for Contextual Dueling Bandits
di: Li, Xuheng, et al.
Pubblicazione: (2024)
di: Li, Xuheng, et al.
Pubblicazione: (2024)
From Static Constraints to Dynamic Adaptation: Sample-Level Constraint Relaxation for Offline-to-Online Reinforcement Learning
di: Zu, Lipeng, et al.
Pubblicazione: (2025)
di: Zu, Lipeng, et al.
Pubblicazione: (2025)
Optimistic Thompson Sampling for No-Regret Learning in Unknown Games
di: Li, Yingru, et al.
Pubblicazione: (2024)
di: Li, Yingru, et al.
Pubblicazione: (2024)
Improved Bayesian Regret Bounds for Thompson Sampling in Reinforcement Learning
di: Moradipari, Ahmadreza, et al.
Pubblicazione: (2023)
di: Moradipari, Ahmadreza, et al.
Pubblicazione: (2023)
Accelerating Approximate Thompson Sampling with Underdamped Langevin Monte Carlo
di: Zheng, Haoyang, et al.
Pubblicazione: (2024)
di: Zheng, Haoyang, et al.
Pubblicazione: (2024)
Thompson Sampling Itself is Differentially Private
di: Ou, Tingting, et al.
Pubblicazione: (2024)
di: Ou, Tingting, et al.
Pubblicazione: (2024)
Counterfactual Inference under Thompson Sampling
di: Jeunen, Olivier
Pubblicazione: (2025)
di: Jeunen, Olivier
Pubblicazione: (2025)
Thompson Sampling for Multi-Objective Linear Contextual Bandit
di: Park, Somangchan, et al.
Pubblicazione: (2025)
di: Park, Somangchan, et al.
Pubblicazione: (2025)
An Information-Theoretic Analysis of Thompson Sampling for Logistic Bandits
di: Gouverneur, Amaury, et al.
Pubblicazione: (2024)
di: Gouverneur, Amaury, et al.
Pubblicazione: (2024)
On Thompson Sampling and Bilateral Uncertainty in Additive Bayesian Optimization
di: Wycoff, Nathan
Pubblicazione: (2025)
di: Wycoff, Nathan
Pubblicazione: (2025)
Documenti analoghi
-
Thompson Sampling in Online RLHF with General Function Approximation
di: Feng, Songtao, et al.
Pubblicazione: (2025) -
Online Learning of Decision Trees with Thompson Sampling
di: Chaouki, Ayman, et al.
Pubblicazione: (2024) -
Energy-Guided Diffusion Sampling for Offline-to-Online Reinforcement Learning
di: Liu, Xu-Hui, et al.
Pubblicazione: (2024) -
Fast Online Learning with Gaussian Prior-Driven Hierarchical Unimodal Thompson Sampling
di: Zhao, Tianchi, et al.
Pubblicazione: (2026) -
Thompson Sampling for Repeated Newsvendor
di: Chen, Li, et al.
Pubblicazione: (2025)