Learning Action Embeddings for Off-Policy Evaluation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Cief, Matej, Golebiowski, Jacek, Schmidt, Philipp, Abedjan, Ziawasch, Bekasov, Artur |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Clustering Context in Off-Policy Evaluation
von: Guzman-Olivares, Daniel, et al.
Veröffentlicht: (2025)
von: Guzman-Olivares, Daniel, et al.
Veröffentlicht: (2025)
Guiding Catalogue Enrichment with User Queries
von: Du, Yupei, et al.
Veröffentlicht: (2024)
von: Du, Yupei, et al.
Veröffentlicht: (2024)
Pessimistic Off-Policy Optimization for Learning to Rank
von: Cief, Matej, et al.
Veröffentlicht: (2022)
von: Cief, Matej, et al.
Veröffentlicht: (2022)
Cross-Validated Off-Policy Evaluation
von: Cief, Matej, et al.
Veröffentlicht: (2024)
von: Cief, Matej, et al.
Veröffentlicht: (2024)
Bayesian Off-Policy Evaluation and Learning for Large Action Spaces
von: Aouali, Imad, et al.
Veröffentlicht: (2024)
von: Aouali, Imad, et al.
Veröffentlicht: (2024)
On Effectiveness and Efficiency of Agentic Tool-calling and RL Training
von: Liu, Tong, et al.
Veröffentlicht: (2026)
von: Liu, Tong, et al.
Veröffentlicht: (2026)
Off-OAB: Off-Policy Policy Gradient Method with Optimal Action-Dependent Baseline
von: Meng, Wenjia, et al.
Veröffentlicht: (2024)
von: Meng, Wenjia, et al.
Veröffentlicht: (2024)
RAMSeS: Robust and Adaptive Model Selection for Time-Series Anomaly Detection Algorithms
von: Abdelmaksoud, Mohamed, et al.
Veröffentlicht: (2026)
von: Abdelmaksoud, Mohamed, et al.
Veröffentlicht: (2026)
Hyperband-based Bayesian Optimization for Black-box Prompt Selection
von: Schneider, Lennart, et al.
Veröffentlicht: (2024)
von: Schneider, Lennart, et al.
Veröffentlicht: (2024)
Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies
von: Lee, Haanvid, et al.
Veröffentlicht: (2024)
von: Lee, Haanvid, et al.
Veröffentlicht: (2024)
Effective Off-Policy Evaluation and Learning in Contextual Combinatorial Bandits
von: Shimizu, Tatsuhiro, et al.
Veröffentlicht: (2024)
von: Shimizu, Tatsuhiro, et al.
Veröffentlicht: (2024)
Off-Policy Evaluation and Learning for the Future under Non-Stationarity
von: Shimizu, Tatsuhiro, et al.
Veröffentlicht: (2025)
von: Shimizu, Tatsuhiro, et al.
Veröffentlicht: (2025)
Concept-driven Off Policy Evaluation
von: Majumdar, Ritam, et al.
Veröffentlicht: (2024)
von: Majumdar, Ritam, et al.
Veröffentlicht: (2024)
Off-Policy Evaluation and Learning for Survival Outcomes under Censoring
von: Kubota, Kohsuke, et al.
Veröffentlicht: (2026)
von: Kubota, Kohsuke, et al.
Veröffentlicht: (2026)
Zero-Shot Off-Policy Learning
von: Asadulaev, Arip, et al.
Veröffentlicht: (2026)
von: Asadulaev, Arip, et al.
Veröffentlicht: (2026)
SCOPE-RL: A Python Library for Offline Reinforcement Learning and Off-Policy Evaluation
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2023)
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2023)
A Unifying View of Coverage in Linear Off-Policy Evaluation
von: Amortila, Philip, et al.
Veröffentlicht: (2026)
von: Amortila, Philip, et al.
Veröffentlicht: (2026)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
von: Xiao, Teng, et al.
Veröffentlicht: (2024)
von: Xiao, Teng, et al.
Veröffentlicht: (2024)
Learning to Act without Actions
von: Schmidt, Dominik, et al.
Veröffentlicht: (2023)
von: Schmidt, Dominik, et al.
Veröffentlicht: (2023)
Towards Unbiased Calibration using Meta-Regularization
von: Wang, Cheng, et al.
Veröffentlicht: (2023)
von: Wang, Cheng, et al.
Veröffentlicht: (2023)
Policy Learning for Off-Dynamics RL with Deficient Support
von: Van, Linh Le Pham, et al.
Veröffentlicht: (2024)
von: Van, Linh Le Pham, et al.
Veröffentlicht: (2024)
Towards Assessing and Benchmarking Risk-Return Tradeoff of Off-Policy Evaluation
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2023)
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2023)
SOPE: Stabilizing Off-Policy Evaluation for Online RL with Prior Data
von: Romeo, Carlo, et al.
Veröffentlicht: (2026)
von: Romeo, Carlo, et al.
Veröffentlicht: (2026)
Statistical Tractability of Off-policy Evaluation of History-dependent Policies in POMDPs
von: Zhang, Yuheng, et al.
Veröffentlicht: (2025)
von: Zhang, Yuheng, et al.
Veröffentlicht: (2025)
Balancing Immediate Revenue and Future Off-Policy Evaluation in Coupon Allocation
von: Nishimura, Naoki, et al.
Veröffentlicht: (2024)
von: Nishimura, Naoki, et al.
Veröffentlicht: (2024)
Efficient and Sharp Off-Policy Evaluation in Robust Markov Decision Processes
von: Bennett, Andrew, et al.
Veröffentlicht: (2024)
von: Bennett, Andrew, et al.
Veröffentlicht: (2024)
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
von: Zhou, Hongyi, et al.
Veröffentlicht: (2025)
von: Zhou, Hongyi, et al.
Veröffentlicht: (2025)
Data Poisoning Attacks on Off-Policy Policy Evaluation Methods
von: Lobo, Elita, et al.
Veröffentlicht: (2024)
von: Lobo, Elita, et al.
Veröffentlicht: (2024)
Low-Rank Adaptation for Critic Learning in Off-Policy Reinforcement Learning
von: Zhuang, Yuan, et al.
Veröffentlicht: (2026)
von: Zhuang, Yuan, et al.
Veröffentlicht: (2026)
Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization
von: Palenicek, Daniel, et al.
Veröffentlicht: (2025)
von: Palenicek, Daniel, et al.
Veröffentlicht: (2025)
Automated Off-Policy Estimator Selection via Supervised Learning
von: Felicioni, Nicolò, et al.
Veröffentlicht: (2024)
von: Felicioni, Nicolò, et al.
Veröffentlicht: (2024)
Q-MMR: Off-Policy Evaluation via Recursive Reweighting and Moment Matching
von: Li, Xiang, et al.
Veröffentlicht: (2026)
von: Li, Xiang, et al.
Veröffentlicht: (2026)
Abstract Reward Processes: Leveraging State Abstraction for Consistent Off-Policy Evaluation
von: Chaudhari, Shreyas, et al.
Veröffentlicht: (2024)
von: Chaudhari, Shreyas, et al.
Veröffentlicht: (2024)
Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning
von: Goodall, Alexander W., et al.
Veröffentlicht: (2025)
von: Goodall, Alexander W., et al.
Veröffentlicht: (2025)
Enabling Off-Policy Imitation Learning with Deep Actor Critic Stabilization
von: Sen, Sayambhu, et al.
Veröffentlicht: (2025)
von: Sen, Sayambhu, et al.
Veröffentlicht: (2025)
Conformal Off-Policy Evaluation in Markov Decision Processes
von: Foffano, Daniele, et al.
Veröffentlicht: (2023)
von: Foffano, Daniele, et al.
Veröffentlicht: (2023)
Turning Sand to Gold: Recycling Data to Bridge On-Policy and Off-Policy Learning via Causal Bound
von: Fiskus, Tal, et al.
Veröffentlicht: (2025)
von: Fiskus, Tal, et al.
Veröffentlicht: (2025)
Learning to Reason under Off-Policy Guidance
von: Yan, Jianhao, et al.
Veröffentlicht: (2025)
von: Yan, Jianhao, et al.
Veröffentlicht: (2025)
Analysis of Off-Policy $n$-Step TD-Learning with Linear Function Approximation
von: Lim, Han-Dong, et al.
Veröffentlicht: (2025)
von: Lim, Han-Dong, et al.
Veröffentlicht: (2025)
Quotient DAGs for Off-Policy Evaluation:Forward-Flow Importance Sampling and Exact Slate Propensities
von: Xie, Ziwen, et al.
Veröffentlicht: (2026)
von: Xie, Ziwen, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Clustering Context in Off-Policy Evaluation
von: Guzman-Olivares, Daniel, et al.
Veröffentlicht: (2025) -
Guiding Catalogue Enrichment with User Queries
von: Du, Yupei, et al.
Veröffentlicht: (2024) -
Pessimistic Off-Policy Optimization for Learning to Rank
von: Cief, Matej, et al.
Veröffentlicht: (2022) -
Cross-Validated Off-Policy Evaluation
von: Cief, Matej, et al.
Veröffentlicht: (2024) -
Bayesian Off-Policy Evaluation and Learning for Large Action Spaces
von: Aouali, Imad, et al.
Veröffentlicht: (2024)