Guardado en:
| Autores principales: | Shimizu, Tatsuhiro, Tanaka, Koichi, Kishimoto, Ren, Kiyohara, Haruka, Nomura, Masahiro, Saito, Yuta |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2408.11202 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Off-Policy Evaluation of Slate Bandit Policies via Optimizing Abstraction
por: Kiyohara, Haruka, et al.
Publicado: (2024)
por: Kiyohara, Haruka, et al.
Publicado: (2024)
SCOPE-RL: A Python Library for Offline Reinforcement Learning and Off-Policy Evaluation
por: Kiyohara, Haruka, et al.
Publicado: (2023)
por: Kiyohara, Haruka, et al.
Publicado: (2023)
Towards Assessing and Benchmarking Risk-Return Tradeoff of Off-Policy Evaluation
por: Kiyohara, Haruka, et al.
Publicado: (2023)
por: Kiyohara, Haruka, et al.
Publicado: (2023)
Prompt Optimization with Logged Bandit Data
por: Kiyohara, Haruka, et al.
Publicado: (2025)
por: Kiyohara, Haruka, et al.
Publicado: (2025)
Off-Policy Evaluation and Learning for the Future under Non-Stationarity
por: Shimizu, Tatsuhiro, et al.
Publicado: (2025)
por: Shimizu, Tatsuhiro, et al.
Publicado: (2025)
Off-Policy Learning with Limited Supply
por: Tanaka, Koichi, et al.
Publicado: (2026)
por: Tanaka, Koichi, et al.
Publicado: (2026)
Hyperparameter Optimization Can Even be Harmful in Off-Policy Learning and How to Deal with It
por: Saito, Yuta, et al.
Publicado: (2024)
por: Saito, Yuta, et al.
Publicado: (2024)
Offline Contextual Bandits in the Presence of New Actions
por: Kishimoto, Ren, et al.
Publicado: (2026)
por: Kishimoto, Ren, et al.
Publicado: (2026)
Off-Policy Evaluation and Learning for Survival Outcomes under Censoring
por: Kubota, Kohsuke, et al.
Publicado: (2026)
por: Kubota, Kohsuke, et al.
Publicado: (2026)
Combinatorial Allocation Bandits with Nonlinear Arm Utility
por: Shibukawa, Yuki, et al.
Publicado: (2026)
por: Shibukawa, Yuki, et al.
Publicado: (2026)
Beyond Match Maximization and Fairness: Retention-Optimized Two-Sided Matching
por: Kishimoto, Ren, et al.
Publicado: (2026)
por: Kishimoto, Ren, et al.
Publicado: (2026)
A Contextual Combinatorial Bandit Approach to Negotiation
por: Li, Yexin, et al.
Publicado: (2024)
por: Li, Yexin, et al.
Publicado: (2024)
Contextual Combinatorial Bandits with Probabilistically Triggered Arms
por: Liu, Xutong, et al.
Publicado: (2023)
por: Liu, Xutong, et al.
Publicado: (2023)
When is Off-Policy Evaluation (Reward Modeling) Useful in Contextual Bandits? A Data-Centric Perspective
por: Sun, Hao, et al.
Publicado: (2023)
por: Sun, Hao, et al.
Publicado: (2023)
Safely Exploring Novel Actions in Recommender Systems via Deployment-Efficient Policy Learning
por: Kiyohara, Haruka, et al.
Publicado: (2025)
por: Kiyohara, Haruka, et al.
Publicado: (2025)
Optimizing Warfarin Dosing Using Contextual Bandit: An Offline Policy Learning and Evaluation Method
por: Huang, Yong, et al.
Publicado: (2024)
por: Huang, Yong, et al.
Publicado: (2024)
From Contextual Combinatorial Semi-Bandits to Bandit List Classification: Improved Sample Complexity with Sparse Rewards
por: Erez, Liad, et al.
Publicado: (2025)
por: Erez, Liad, et al.
Publicado: (2025)
Learning When to Trust in Contextual Bandits
por: Ghasemi, Majid, et al.
Publicado: (2026)
por: Ghasemi, Majid, et al.
Publicado: (2026)
Learning Action Embeddings for Off-Policy Evaluation
por: Cief, Matej, et al.
Publicado: (2023)
por: Cief, Matej, et al.
Publicado: (2023)
Deep Active Inference with Diffusion Policy and Multiple Timescale World Model for Real-World Exploration and Navigation
por: Yokozawa, Riko, et al.
Publicado: (2025)
por: Yokozawa, Riko, et al.
Publicado: (2025)
Tree Ensembles for Contextual Bandits
por: Nilsson, Hannes, et al.
Publicado: (2024)
por: Nilsson, Hannes, et al.
Publicado: (2024)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
por: Lu, Xiaodong, et al.
Publicado: (2026)
por: Lu, Xiaodong, et al.
Publicado: (2026)
Online Prompt Pricing based on Combinatorial Multi-Armed Bandit and Hierarchical Stackelberg Game
por: Li, Meiling, et al.
Publicado: (2024)
por: Li, Meiling, et al.
Publicado: (2024)
Neural Combinatorial Clustered Bandits for Recommendation Systems
por: Atalar, Baran, et al.
Publicado: (2024)
por: Atalar, Baran, et al.
Publicado: (2024)
Bayesian Analysis of Combinatorial Gaussian Process Bandits
por: Sandberg, Jack, et al.
Publicado: (2023)
por: Sandberg, Jack, et al.
Publicado: (2023)
Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies
por: Lee, Haanvid, et al.
Publicado: (2024)
por: Lee, Haanvid, et al.
Publicado: (2024)
Causal Contextual Bandits with Adaptive Context
por: Madhavan, Rahul, et al.
Publicado: (2024)
por: Madhavan, Rahul, et al.
Publicado: (2024)
Diffusion Models Meet Contextual Bandits
por: Aouali, Imad
Publicado: (2024)
por: Aouali, Imad
Publicado: (2024)
Off-Policy Evaluation for Ranking Policies under Deterministic Logging Policies
por: Tanaka, Koichi, et al.
Publicado: (2026)
por: Tanaka, Koichi, et al.
Publicado: (2026)
Concept-driven Off Policy Evaluation
por: Majumdar, Ritam, et al.
Publicado: (2024)
por: Majumdar, Ritam, et al.
Publicado: (2024)
Clustering Context in Off-Policy Evaluation
por: Guzman-Olivares, Daniel, et al.
Publicado: (2025)
por: Guzman-Olivares, Daniel, et al.
Publicado: (2025)
Bayesian Off-Policy Evaluation and Learning for Large Action Spaces
por: Aouali, Imad, et al.
Publicado: (2024)
por: Aouali, Imad, et al.
Publicado: (2024)
Towards a Sharp Analysis of Offline Policy Learning for $f$-Divergence-Regularized Contextual Bandits
por: Zhao, Qingyue, et al.
Publicado: (2025)
por: Zhao, Qingyue, et al.
Publicado: (2025)
Federated Linear Contextual Bandits with Heterogeneous Clients
por: Blaser, Ethan, et al.
Publicado: (2024)
por: Blaser, Ethan, et al.
Publicado: (2024)
Conservative Contextual Bandits: Beyond Linear Representations
por: Deb, Rohan, et al.
Publicado: (2024)
por: Deb, Rohan, et al.
Publicado: (2024)
Linear Contextual Bandits with Hybrid Payoff: Revisited
por: Das, Nirjhar, et al.
Publicado: (2024)
por: Das, Nirjhar, et al.
Publicado: (2024)
The Sample Complexity of Multiclass and Sparse Contextual Bandits
por: Erez, Liad, et al.
Publicado: (2026)
por: Erez, Liad, et al.
Publicado: (2026)
Adaptive Budget Optimization for Multichannel Advertising Using Combinatorial Bandits
por: Gangopadhyay, Briti, et al.
Publicado: (2025)
por: Gangopadhyay, Briti, et al.
Publicado: (2025)
Off-Policy Evaluation and Learning for Matching Markets
por: Hayashi, Yudai, et al.
Publicado: (2025)
por: Hayashi, Yudai, et al.
Publicado: (2025)
Zero-Shot Off-Policy Learning
por: Asadulaev, Arip, et al.
Publicado: (2026)
por: Asadulaev, Arip, et al.
Publicado: (2026)
Ejemplares similares
-
Off-Policy Evaluation of Slate Bandit Policies via Optimizing Abstraction
por: Kiyohara, Haruka, et al.
Publicado: (2024) -
SCOPE-RL: A Python Library for Offline Reinforcement Learning and Off-Policy Evaluation
por: Kiyohara, Haruka, et al.
Publicado: (2023) -
Towards Assessing and Benchmarking Risk-Return Tradeoff of Off-Policy Evaluation
por: Kiyohara, Haruka, et al.
Publicado: (2023) -
Prompt Optimization with Logged Bandit Data
por: Kiyohara, Haruka, et al.
Publicado: (2025) -
Off-Policy Evaluation and Learning for the Future under Non-Stationarity
por: Shimizu, Tatsuhiro, et al.
Publicado: (2025)