Direction-Aware Offline-to-Online Learning in Linear Contextual Bandits
Fuente:
arXiv
Guardado en:
| Autores principales: | Han, Zean, Lin, Ruihan, Ding, Zezhen, Zhang, Jiheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Large-Scale LLM Inference with Heterogeneous Workloads: Prefill-Decode Contention and Asymptotically Optimal Control
por: Lin, Ruihan, et al.
Publicado: (2026)
por: Lin, Ruihan, et al.
Publicado: (2026)
Stochastic Graph Bandit Learning with Side-Observations
por: Gong, Xueping, et al.
Publicado: (2023)
por: Gong, Xueping, et al.
Publicado: (2023)
Leveraging Offline Data in Linear Latent Contextual Bandits
por: Kausik, Chinmaya, et al.
Publicado: (2024)
por: Kausik, Chinmaya, et al.
Publicado: (2024)
Group-Sensitive Offline Contextual Bandits
por: Guo, Yihong, et al.
Publicado: (2025)
por: Guo, Yihong, et al.
Publicado: (2025)
Offline Contextual Bandits in the Presence of New Actions
por: Kishimoto, Ren, et al.
Publicado: (2026)
por: Kishimoto, Ren, et al.
Publicado: (2026)
Offline Contextual Bandit with Counterfactual Sample Identification
por: Gilotte, Alexandre, et al.
Publicado: (2025)
por: Gilotte, Alexandre, et al.
Publicado: (2025)
Online Continuous Hyperparameter Optimization for Generalized Linear Contextual Bandits
por: Kang, Yue, et al.
Publicado: (2023)
por: Kang, Yue, et al.
Publicado: (2023)
Contextual Linear Bandits with Delay as Payoff
por: Zhang, Mengxiao, et al.
Publicado: (2025)
por: Zhang, Mengxiao, et al.
Publicado: (2025)
Active Learning for Stochastic Contextual Linear Bandits
por: Brunskill, Emma, et al.
Publicado: (2026)
por: Brunskill, Emma, et al.
Publicado: (2026)
Learning with Incomplete Context: Linear Contextual Bandits with Pretrained Imputation
por: Yan, Hao, et al.
Publicado: (2025)
por: Yan, Hao, et al.
Publicado: (2025)
Bridging Online and Offline RL: Contextual Bandit Learning for Multi-Turn Code Generation
por: Chen, Ziru, et al.
Publicado: (2026)
por: Chen, Ziru, et al.
Publicado: (2026)
Linear Contextual Bandits with Interference
por: Xu, Yang, et al.
Publicado: (2024)
por: Xu, Yang, et al.
Publicado: (2024)
Variance-Aware Linear UCB with Deep Representation for Neural Contextual Bandits
por: Bui, Ha Manh, et al.
Publicado: (2024)
por: Bui, Ha Manh, et al.
Publicado: (2024)
Contextual Online Pricing with (Biased) Offline Data
por: Zhang, Yixuan, et al.
Publicado: (2025)
por: Zhang, Yixuan, et al.
Publicado: (2025)
Online Bandit Learning with Offline Preference Data for Improved RLHF
por: Agnihotri, Akhil, et al.
Publicado: (2024)
por: Agnihotri, Akhil, et al.
Publicado: (2024)
Minimax Optimality in Contextual Dynamic Pricing with General Valuation Models
por: Gong, Xueping, et al.
Publicado: (2024)
por: Gong, Xueping, et al.
Publicado: (2024)
Offline Local Search for Online Stochastic Bandits
por: Benadè, Gerdus, et al.
Publicado: (2026)
por: Benadè, Gerdus, et al.
Publicado: (2026)
Pessimistic Risk-Aware Policy Learning in Contextual Bandits
por: Wan, Yilong, et al.
Publicado: (2026)
por: Wan, Yilong, et al.
Publicado: (2026)
Make Optimization Once and for All with Fine-grained Guidance
por: Shi, Mingjia, et al.
Publicado: (2025)
por: Shi, Mingjia, et al.
Publicado: (2025)
Single Index Bandits: Generalized Linear Contextual Bandits with Unknown Reward Functions
por: Kang, Yue, et al.
Publicado: (2025)
por: Kang, Yue, et al.
Publicado: (2025)
PAK-UCB Contextual Bandit: An Online Learning Approach to Prompt-Aware Selection of Generative Models and LLMs
por: Hu, Xiaoyan, et al.
Publicado: (2024)
por: Hu, Xiaoyan, et al.
Publicado: (2024)
Partially Observable Contextual Bandits with Linear Payoffs
por: Zeng, Sihan, et al.
Publicado: (2024)
por: Zeng, Sihan, et al.
Publicado: (2024)
Strategic Linear Contextual Bandits
por: Buening, Thomas Kleine, et al.
Publicado: (2024)
por: Buening, Thomas Kleine, et al.
Publicado: (2024)
Information-Directed Offline-to-Online Reinforcement Learning
por: Chen, Keru
Publicado: (2026)
por: Chen, Keru
Publicado: (2026)
Learning Peer Influence Probabilities with Linear Contextual Bandits
por: Faruk, Ahmed Sayeed, et al.
Publicado: (2025)
por: Faruk, Ahmed Sayeed, et al.
Publicado: (2025)
A Tractable Online Learning Algorithm for the Multinomial Logit Contextual Bandit
por: Agrawal, Priyank, et al.
Publicado: (2020)
por: Agrawal, Priyank, et al.
Publicado: (2020)
Online Bandits with (Biased) Offline Data: Adaptive Learning under Distribution Mismatch
por: Cheung, Wang Chi, et al.
Publicado: (2024)
por: Cheung, Wang Chi, et al.
Publicado: (2024)
Optimizing Warfarin Dosing Using Contextual Bandit: An Offline Policy Learning and Evaluation Method
por: Huang, Yong, et al.
Publicado: (2024)
por: Huang, Yong, et al.
Publicado: (2024)
Offline-Online Reinforcement Learning for Linear Mixture MDPs
por: Zhang, Zhongjun, et al.
Publicado: (2026)
por: Zhang, Zhongjun, et al.
Publicado: (2026)
Attack-Resistant Uniform Fairness for Linear and Smooth Contextual Bandits
por: Zhang, Qingwen, et al.
Publicado: (2026)
por: Zhang, Qingwen, et al.
Publicado: (2026)
Offline Clustering of Linear Bandits: The Power of Clusters under Limited Data
por: Liu, Jingyuan, et al.
Publicado: (2025)
por: Liu, Jingyuan, et al.
Publicado: (2025)
Improved Offline Contextual Bandits with Second-Order Bounds: Betting and Freezing
por: Ryu, J. Jon, et al.
Publicado: (2025)
por: Ryu, J. Jon, et al.
Publicado: (2025)
Scaling Federated Linear Contextual Bandits via Sketching
por: Yang, Hantao, et al.
Publicado: (2026)
por: Yang, Hantao, et al.
Publicado: (2026)
A Reduction Algorithm for Markovian Contextual Linear Bandits
por: Buyukkalayci, Kaan, et al.
Publicado: (2026)
por: Buyukkalayci, Kaan, et al.
Publicado: (2026)
Thompson Sampling for Multi-Objective Linear Contextual Bandit
por: Park, Somangchan, et al.
Publicado: (2025)
por: Park, Somangchan, et al.
Publicado: (2025)
Best-of-Both-Worlds Algorithms for Linear Contextual Bandits
por: Kuroki, Yuko, et al.
Publicado: (2023)
por: Kuroki, Yuko, et al.
Publicado: (2023)
Online Policy Learning from Offline Preferences
por: Zhang, Guoxi, et al.
Publicado: (2024)
por: Zhang, Guoxi, et al.
Publicado: (2024)
Taming the Monster Every Context: Complexity Measure and Unified Framework for Offline-Oracle Efficient Contextual Bandits
por: Qin, Hao, et al.
Publicado: (2026)
por: Qin, Hao, et al.
Publicado: (2026)
Towards a Sharp Analysis of Offline Policy Learning for $f$-Divergence-Regularized Contextual Bandits
por: Zhao, Qingyue, et al.
Publicado: (2025)
por: Zhao, Qingyue, et al.
Publicado: (2025)
Federated Linear Contextual Bandits with Heterogeneous Clients
por: Blaser, Ethan, et al.
Publicado: (2024)
por: Blaser, Ethan, et al.
Publicado: (2024)
Ejemplares similares
-
Large-Scale LLM Inference with Heterogeneous Workloads: Prefill-Decode Contention and Asymptotically Optimal Control
por: Lin, Ruihan, et al.
Publicado: (2026) -
Stochastic Graph Bandit Learning with Side-Observations
por: Gong, Xueping, et al.
Publicado: (2023) -
Leveraging Offline Data in Linear Latent Contextual Bandits
por: Kausik, Chinmaya, et al.
Publicado: (2024) -
Group-Sensitive Offline Contextual Bandits
por: Guo, Yihong, et al.
Publicado: (2025) -
Offline Contextual Bandits in the Presence of New Actions
por: Kishimoto, Ren, et al.
Publicado: (2026)