Offline Contextual Bandits in the Presence of New Actions
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Kishimoto, Ren, Shimizu, Tatsuhiro, Kawamura, Kazuki, Muroi, Takanori, Narita, Yusuke, Sasamoto, Yuki, Tateno, Kei, Udagawa, Takuma, Saito, Yuta |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Off-Policy Evaluation and Learning for the Future under Non-Stationarity
von: Shimizu, Tatsuhiro, et al.
Veröffentlicht: (2025)
von: Shimizu, Tatsuhiro, et al.
Veröffentlicht: (2025)
Off-Policy Evaluation for Ranking Policies under Deterministic Logging Policies
von: Tanaka, Koichi, et al.
Veröffentlicht: (2026)
von: Tanaka, Koichi, et al.
Veröffentlicht: (2026)
Safely Exploring Novel Actions in Recommender Systems via Deployment-Efficient Policy Learning
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2025)
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2025)
Counterfactual Reciprocal Recommender Systems for User-to-User Matching
von: Kawamura, Kazuki, et al.
Veröffentlicht: (2025)
von: Kawamura, Kazuki, et al.
Veröffentlicht: (2025)
Effective Off-Policy Evaluation and Learning in Contextual Combinatorial Bandits
von: Shimizu, Tatsuhiro, et al.
Veröffentlicht: (2024)
von: Shimizu, Tatsuhiro, et al.
Veröffentlicht: (2024)
Not Just What, But When: Integrating Irregular Intervals to LLM for Sequential Recommendation
von: Du, Wei-Wei, et al.
Veröffentlicht: (2025)
von: Du, Wei-Wei, et al.
Veröffentlicht: (2025)
PROTEA: Offline Evaluation and Iterative Refinement for Multi-Agent LLM Workflows
von: Kawamura, Kazuki, et al.
Veröffentlicht: (2026)
von: Kawamura, Kazuki, et al.
Veröffentlicht: (2026)
Off-Policy Learning with Limited Supply
von: Tanaka, Koichi, et al.
Veröffentlicht: (2026)
von: Tanaka, Koichi, et al.
Veröffentlicht: (2026)
MultiScale Contextual Bandits for Long Term Objectives
von: Rastogi, Richa, et al.
Veröffentlicht: (2025)
von: Rastogi, Richa, et al.
Veröffentlicht: (2025)
SCOPE-RL: A Python Library for Offline Reinforcement Learning and Off-Policy Evaluation
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2023)
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2023)
Group-Sensitive Offline Contextual Bandits
von: Guo, Yihong, et al.
Veröffentlicht: (2025)
von: Guo, Yihong, et al.
Veröffentlicht: (2025)
Combinatorial Allocation Bandits with Nonlinear Arm Utility
von: Shibukawa, Yuki, et al.
Veröffentlicht: (2026)
von: Shibukawa, Yuki, et al.
Veröffentlicht: (2026)
Offline Contextual Bandit with Counterfactual Sample Identification
von: Gilotte, Alexandre, et al.
Veröffentlicht: (2025)
von: Gilotte, Alexandre, et al.
Veröffentlicht: (2025)
Leveraging Offline Data in Linear Latent Contextual Bandits
von: Kausik, Chinmaya, et al.
Veröffentlicht: (2024)
von: Kausik, Chinmaya, et al.
Veröffentlicht: (2024)
Direction-Aware Offline-to-Online Learning in Linear Contextual Bandits
von: Han, Zean, et al.
Veröffentlicht: (2026)
von: Han, Zean, et al.
Veröffentlicht: (2026)
Improved Offline Contextual Bandits with Second-Order Bounds: Betting and Freezing
von: Ryu, J. Jon, et al.
Veröffentlicht: (2025)
von: Ryu, J. Jon, et al.
Veröffentlicht: (2025)
NRR-Core: Non-Resolution Reasoning as a Computational Framework for Contextual Identity and Ambiguity Preservation
von: Saito, Kei
Veröffentlicht: (2025)
von: Saito, Kei
Veröffentlicht: (2025)
Off-Policy Evaluation of Slate Bandit Policies via Optimizing Abstraction
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2024)
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2024)
Towards Assessing and Benchmarking Risk-Return Tradeoff of Off-Policy Evaluation
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2023)
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2023)
Optimizing Warfarin Dosing Using Contextual Bandit: An Offline Policy Learning and Evaluation Method
von: Huang, Yong, et al.
Veröffentlicht: (2024)
von: Huang, Yong, et al.
Veröffentlicht: (2024)
Context-Action Embedding Learning for Off-Policy Evaluation in Contextual Bandits
von: Chandak, Kushagra, et al.
Veröffentlicht: (2025)
von: Chandak, Kushagra, et al.
Veröffentlicht: (2025)
Beyond Match Maximization and Fairness: Retention-Optimized Two-Sided Matching
von: Kishimoto, Ren, et al.
Veröffentlicht: (2026)
von: Kishimoto, Ren, et al.
Veröffentlicht: (2026)
Prompt Optimization with Logged Bandit Data
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2025)
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2025)
Taming the Monster Every Context: Complexity Measure and Unified Framework for Offline-Oracle Efficient Contextual Bandits
von: Qin, Hao, et al.
Veröffentlicht: (2026)
von: Qin, Hao, et al.
Veröffentlicht: (2026)
Bridging Online and Offline RL: Contextual Bandit Learning for Multi-Turn Code Generation
von: Chen, Ziru, et al.
Veröffentlicht: (2026)
von: Chen, Ziru, et al.
Veröffentlicht: (2026)
Towards a Sharp Analysis of Offline Policy Learning for $f$-Divergence-Regularized Contextual Bandits
von: Zhao, Qingyue, et al.
Veröffentlicht: (2025)
von: Zhao, Qingyue, et al.
Veröffentlicht: (2025)
Contextual Combinatorial Bandits with Changing Action Sets via Gaussian Processes
von: Nika, Andi, et al.
Veröffentlicht: (2021)
von: Nika, Andi, et al.
Veröffentlicht: (2021)
Adaptive Action Duration with Contextual Bandits for Deep Reinforcement Learning in Dynamic Environments
von: Verma, Abhishek, et al.
Veröffentlicht: (2025)
von: Verma, Abhishek, et al.
Veröffentlicht: (2025)
HTML-LSTM: Information Extraction from HTML Tables in Web Pages using Tree-Structured LSTM
von: Kawamura, Kazuki, et al.
Veröffentlicht: (2024)
von: Kawamura, Kazuki, et al.
Veröffentlicht: (2024)
Bayesian Regret Minimization in Offline Bandits
von: Petrik, Marek, et al.
Veröffentlicht: (2023)
von: Petrik, Marek, et al.
Veröffentlicht: (2023)
Fast Rates for Offline Contextual Bandits with Forward-KL Regularization under Single-Policy Concentrability
von: Zhao, Qingyue, et al.
Veröffentlicht: (2026)
von: Zhao, Qingyue, et al.
Veröffentlicht: (2026)
POTEC: Off-Policy Learning for Large Action Spaces via Two-Stage Policy Decomposition
von: Saito, Yuta, et al.
Veröffentlicht: (2024)
von: Saito, Yuta, et al.
Veröffentlicht: (2024)
Sparse Nonparametric Contextual Bandits
von: Flynn, Hamish, et al.
Veröffentlicht: (2025)
von: Flynn, Hamish, et al.
Veröffentlicht: (2025)
Linear Contextual Bandits with Interference
von: Xu, Yang, et al.
Veröffentlicht: (2024)
von: Xu, Yang, et al.
Veröffentlicht: (2024)
Offline Reinforcement Learning with Wasserstein Regularization via Optimal Transport Maps
von: Omura, Motoki, et al.
Veröffentlicht: (2025)
von: Omura, Motoki, et al.
Veröffentlicht: (2025)
Efficient Algorithms for Logistic Contextual Slate Bandits with Bandit Feedback
von: Goyal, Tanmay, et al.
Veröffentlicht: (2025)
von: Goyal, Tanmay, et al.
Veröffentlicht: (2025)
Calibrated Recommendations with Contextual Bandits
von: Feijer, Diego, et al.
Veröffentlicht: (2025)
von: Feijer, Diego, et al.
Veröffentlicht: (2025)
Batched Nonparametric Contextual Bandits
von: Jiang, Rong, et al.
Veröffentlicht: (2024)
von: Jiang, Rong, et al.
Veröffentlicht: (2024)
Tree Ensembles for Contextual Bandits
von: Nilsson, Hannes, et al.
Veröffentlicht: (2024)
von: Nilsson, Hannes, et al.
Veröffentlicht: (2024)
Refined PAC-Bayes Bounds for Offline Bandits
von: Gouverneur, Amaury, et al.
Veröffentlicht: (2025)
von: Gouverneur, Amaury, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Off-Policy Evaluation and Learning for the Future under Non-Stationarity
von: Shimizu, Tatsuhiro, et al.
Veröffentlicht: (2025) -
Off-Policy Evaluation for Ranking Policies under Deterministic Logging Policies
von: Tanaka, Koichi, et al.
Veröffentlicht: (2026) -
Safely Exploring Novel Actions in Recommender Systems via Deployment-Efficient Policy Learning
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2025) -
Counterfactual Reciprocal Recommender Systems for User-to-User Matching
von: Kawamura, Kazuki, et al.
Veröffentlicht: (2025) -
Effective Off-Policy Evaluation and Learning in Contextual Combinatorial Bandits
von: Shimizu, Tatsuhiro, et al.
Veröffentlicht: (2024)