Gespeichert in:
| Hauptverfasser: | Kiyohara, Haruka, Nomura, Masahiro, Saito, Yuta |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2402.02171 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Effective Off-Policy Evaluation and Learning in Contextual Combinatorial Bandits
von: Shimizu, Tatsuhiro, et al.
Veröffentlicht: (2024)
von: Shimizu, Tatsuhiro, et al.
Veröffentlicht: (2024)
Hyperparameter Optimization Can Even be Harmful in Off-Policy Learning and How to Deal with It
von: Saito, Yuta, et al.
Veröffentlicht: (2024)
von: Saito, Yuta, et al.
Veröffentlicht: (2024)
Towards Assessing and Benchmarking Risk-Return Tradeoff of Off-Policy Evaluation
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2023)
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2023)
SCOPE-RL: A Python Library for Offline Reinforcement Learning and Off-Policy Evaluation
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2023)
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2023)
Prompt Optimization with Logged Bandit Data
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2025)
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2025)
Off-Policy Evaluation and Learning for Matching Markets
von: Hayashi, Yudai, et al.
Veröffentlicht: (2025)
von: Hayashi, Yudai, et al.
Veröffentlicht: (2025)
POTEC: Off-Policy Learning for Large Action Spaces via Two-Stage Policy Decomposition
von: Saito, Yuta, et al.
Veröffentlicht: (2024)
von: Saito, Yuta, et al.
Veröffentlicht: (2024)
Long-term Off-Policy Evaluation and Learning
von: Saito, Yuta, et al.
Veröffentlicht: (2024)
von: Saito, Yuta, et al.
Veröffentlicht: (2024)
Off-Policy Evaluation and Learning for Survival Outcomes under Censoring
von: Kubota, Kohsuke, et al.
Veröffentlicht: (2026)
von: Kubota, Kohsuke, et al.
Veröffentlicht: (2026)
Policy Design for Two-sided Platforms with Participation Dynamics
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2025)
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2025)
Off-Policy Evaluation for Ranking Policies under Deterministic Logging Policies
von: Tanaka, Koichi, et al.
Veröffentlicht: (2026)
von: Tanaka, Koichi, et al.
Veröffentlicht: (2026)
A General Framework for Off-Policy Learning with Partially-Observed Reward
von: Takehi, Rikiya, et al.
Veröffentlicht: (2025)
von: Takehi, Rikiya, et al.
Veröffentlicht: (2025)
Quotient DAGs for Off-Policy Evaluation:Forward-Flow Importance Sampling and Exact Slate Propensities
von: Xie, Ziwen, et al.
Veröffentlicht: (2026)
von: Xie, Ziwen, et al.
Veröffentlicht: (2026)
Fast Slate Policy Optimization: Going Beyond Plackett-Luce
von: Sakhi, Otmane, et al.
Veröffentlicht: (2023)
von: Sakhi, Otmane, et al.
Veröffentlicht: (2023)
Off-Policy Learning with Limited Supply
von: Tanaka, Koichi, et al.
Veröffentlicht: (2026)
von: Tanaka, Koichi, et al.
Veröffentlicht: (2026)
Off-Policy Evaluation and Learning for the Future under Non-Stationarity
von: Shimizu, Tatsuhiro, et al.
Veröffentlicht: (2025)
von: Shimizu, Tatsuhiro, et al.
Veröffentlicht: (2025)
Efficient Algorithms for Logistic Contextual Slate Bandits with Bandit Feedback
von: Goyal, Tanmay, et al.
Veröffentlicht: (2025)
von: Goyal, Tanmay, et al.
Veröffentlicht: (2025)
Off-Policy Evaluation via Adaptive Weighting with Data from Contextual Bandits
von: Zhan, Ruohan, et al.
Veröffentlicht: (2021)
von: Zhan, Ruohan, et al.
Veröffentlicht: (2021)
PAC Off-Policy Prediction of Contextual Bandits
von: Wan, Yilong, et al.
Veröffentlicht: (2025)
von: Wan, Yilong, et al.
Veröffentlicht: (2025)
Context-Action Embedding Learning for Off-Policy Evaluation in Contextual Bandits
von: Chandak, Kushagra, et al.
Veröffentlicht: (2025)
von: Chandak, Kushagra, et al.
Veröffentlicht: (2025)
Safely Exploring Novel Actions in Recommender Systems via Deployment-Efficient Policy Learning
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2025)
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2025)
Abstract Reward Processes: Leveraging State Abstraction for Consistent Off-Policy Evaluation
von: Chaudhari, Shreyas, et al.
Veröffentlicht: (2024)
von: Chaudhari, Shreyas, et al.
Veröffentlicht: (2024)
Optimal Baseline Corrections for Off-Policy Contextual Bandits
von: Gupta, Shashank, et al.
Veröffentlicht: (2024)
von: Gupta, Shashank, et al.
Veröffentlicht: (2024)
Beyond Match Maximization and Fairness: Retention-Optimized Two-Sided Matching
von: Kishimoto, Ren, et al.
Veröffentlicht: (2026)
von: Kishimoto, Ren, et al.
Veröffentlicht: (2026)
Revisiting Group Relative Policy Optimization: Insights into On-Policy and Off-Policy Training
von: Mroueh, Youssef, et al.
Veröffentlicht: (2025)
von: Mroueh, Youssef, et al.
Veröffentlicht: (2025)
Prompt-to-Slate: Diffusion Models for Prompt-Conditioned Slate Generation
von: Tomasi, Federico, et al.
Veröffentlicht: (2024)
von: Tomasi, Federico, et al.
Veröffentlicht: (2024)
Doubly-Robust Off-Policy Evaluation with Estimated Logging Policy
von: Lee, Kyungbok, et al.
Veröffentlicht: (2024)
von: Lee, Kyungbok, et al.
Veröffentlicht: (2024)
Off-Policy Evaluation of Ranking Policies via Embedding-Space User Behavior Modeling
von: Takahashi, Tatsuki, et al.
Veröffentlicht: (2025)
von: Takahashi, Tatsuki, et al.
Veröffentlicht: (2025)
Cross-Validated Off-Policy Evaluation
von: Cief, Matej, et al.
Veröffentlicht: (2024)
von: Cief, Matej, et al.
Veröffentlicht: (2024)
Optimal Regret for Policy Optimization in Contextual Bandits
von: Levy, Orin, et al.
Veröffentlicht: (2026)
von: Levy, Orin, et al.
Veröffentlicht: (2026)
MultiScale Contextual Bandits for Long Term Objectives
von: Rastogi, Richa, et al.
Veröffentlicht: (2025)
von: Rastogi, Richa, et al.
Veröffentlicht: (2025)
When is Off-Policy Evaluation (Reward Modeling) Useful in Contextual Bandits? A Data-Centric Perspective
von: Sun, Hao, et al.
Veröffentlicht: (2023)
von: Sun, Hao, et al.
Veröffentlicht: (2023)
Deep Active Inference with Diffusion Policy and Multiple Timescale World Model for Real-World Exploration and Navigation
von: Yokozawa, Riko, et al.
Veröffentlicht: (2025)
von: Yokozawa, Riko, et al.
Veröffentlicht: (2025)
RePO: Bridging On-Policy Learning and Off-Policy Knowledge through Rephrasing Policy Optimization
von: Xia, Linxuan, et al.
Veröffentlicht: (2026)
von: Xia, Linxuan, et al.
Veröffentlicht: (2026)
Transductive Off-policy Proximal Policy Optimization
von: Gan, Yaozhong, et al.
Veröffentlicht: (2024)
von: Gan, Yaozhong, et al.
Veröffentlicht: (2024)
Concept-driven Off Policy Evaluation
von: Majumdar, Ritam, et al.
Veröffentlicht: (2024)
von: Majumdar, Ritam, et al.
Veröffentlicht: (2024)
Clustering Context in Off-Policy Evaluation
von: Guzman-Olivares, Daniel, et al.
Veröffentlicht: (2025)
von: Guzman-Olivares, Daniel, et al.
Veröffentlicht: (2025)
Combinatorial Allocation Bandits with Nonlinear Arm Utility
von: Shibukawa, Yuki, et al.
Veröffentlicht: (2026)
von: Shibukawa, Yuki, et al.
Veröffentlicht: (2026)
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
von: Cohen, Taco, et al.
Veröffentlicht: (2025)
von: Cohen, Taco, et al.
Veröffentlicht: (2025)
Data Poisoning Attacks on Off-Policy Policy Evaluation Methods
von: Lobo, Elita, et al.
Veröffentlicht: (2024)
von: Lobo, Elita, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Effective Off-Policy Evaluation and Learning in Contextual Combinatorial Bandits
von: Shimizu, Tatsuhiro, et al.
Veröffentlicht: (2024) -
Hyperparameter Optimization Can Even be Harmful in Off-Policy Learning and How to Deal with It
von: Saito, Yuta, et al.
Veröffentlicht: (2024) -
Towards Assessing and Benchmarking Risk-Return Tradeoff of Off-Policy Evaluation
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2023) -
SCOPE-RL: A Python Library for Offline Reinforcement Learning and Off-Policy Evaluation
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2023) -
Prompt Optimization with Logged Bandit Data
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2025)