Bayesian Off-Policy Evaluation and Learning for Large Action Spaces
Fuente:
arXiv
Salvato in:
| Autori principali: | Aouali, Imad, Brunel, Victor-Emmanuel, Rohde, David, Korba, Anna |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unified PAC-Bayesian Study of Pessimism for Offline Policy Learning with Regularized Importance Sampling
di: Aouali, Imad, et al.
Pubblicazione: (2024)
di: Aouali, Imad, et al.
Pubblicazione: (2024)
Off-Policy Learning in Large Action Spaces: Optimization Matters More Than Estimation
di: Aouali, Imad, et al.
Pubblicazione: (2025)
di: Aouali, Imad, et al.
Pubblicazione: (2025)
Diffusion Models Meet Contextual Bandits
di: Aouali, Imad
Pubblicazione: (2024)
di: Aouali, Imad
Pubblicazione: (2024)
Logarithmic Smoothing for Pessimistic Off-Policy Evaluation, Selection and Learning
di: Sakhi, Otmane, et al.
Pubblicazione: (2024)
di: Sakhi, Otmane, et al.
Pubblicazione: (2024)
Learning Action Embeddings for Off-Policy Evaluation
di: Cief, Matej, et al.
Pubblicazione: (2023)
di: Cief, Matej, et al.
Pubblicazione: (2023)
RecoAtlas: From Semantic Plausibility to Set-Level Utility in LLM Recommendation Agents
di: Aouali, Imad, et al.
Pubblicazione: (2026)
di: Aouali, Imad, et al.
Pubblicazione: (2026)
Off-OAB: Off-Policy Policy Gradient Method with Optimal Action-Dependent Baseline
di: Meng, Wenjia, et al.
Pubblicazione: (2024)
di: Meng, Wenjia, et al.
Pubblicazione: (2024)
Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies
di: Lee, Haanvid, et al.
Pubblicazione: (2024)
di: Lee, Haanvid, et al.
Pubblicazione: (2024)
Effective Off-Policy Evaluation and Learning in Contextual Combinatorial Bandits
di: Shimizu, Tatsuhiro, et al.
Pubblicazione: (2024)
di: Shimizu, Tatsuhiro, et al.
Pubblicazione: (2024)
Off-Policy Evaluation and Learning for the Future under Non-Stationarity
di: Shimizu, Tatsuhiro, et al.
Pubblicazione: (2025)
di: Shimizu, Tatsuhiro, et al.
Pubblicazione: (2025)
Concept-driven Off Policy Evaluation
di: Majumdar, Ritam, et al.
Pubblicazione: (2024)
di: Majumdar, Ritam, et al.
Pubblicazione: (2024)
Clustering Context in Off-Policy Evaluation
di: Guzman-Olivares, Daniel, et al.
Pubblicazione: (2025)
di: Guzman-Olivares, Daniel, et al.
Pubblicazione: (2025)
Action-Adaptive Continual Learning: Enabling Policy Generalization under Dynamic Action Spaces
di: Pan, Chaofan, et al.
Pubblicazione: (2025)
di: Pan, Chaofan, et al.
Pubblicazione: (2025)
Off-Policy Evaluation and Learning for Survival Outcomes under Censoring
di: Kubota, Kohsuke, et al.
Pubblicazione: (2026)
di: Kubota, Kohsuke, et al.
Pubblicazione: (2026)
Zero-Shot Off-Policy Learning
di: Asadulaev, Arip, et al.
Pubblicazione: (2026)
di: Asadulaev, Arip, et al.
Pubblicazione: (2026)
Evaluating the Relevance of Uncertainty Estimators for LLM Hallucination
di: Agnimo, Yedidia, et al.
Pubblicazione: (2026)
di: Agnimo, Yedidia, et al.
Pubblicazione: (2026)
SCOPE-RL: A Python Library for Offline Reinforcement Learning and Off-Policy Evaluation
di: Kiyohara, Haruka, et al.
Pubblicazione: (2023)
di: Kiyohara, Haruka, et al.
Pubblicazione: (2023)
Discretizing Continuous Action Space with Unimodal Probability Distributions for On-Policy Reinforcement Learning
di: Zhu, Yuanyang, et al.
Pubblicazione: (2024)
di: Zhu, Yuanyang, et al.
Pubblicazione: (2024)
A Unifying View of Coverage in Linear Off-Policy Evaluation
di: Amortila, Philip, et al.
Pubblicazione: (2026)
di: Amortila, Philip, et al.
Pubblicazione: (2026)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
di: Xiao, Teng, et al.
Pubblicazione: (2024)
di: Xiao, Teng, et al.
Pubblicazione: (2024)
Policy Learning for Off-Dynamics RL with Deficient Support
di: Van, Linh Le Pham, et al.
Pubblicazione: (2024)
di: Van, Linh Le Pham, et al.
Pubblicazione: (2024)
An Advantage-based Optimization Method for Reinforcement Learning in Large Action Space
di: Lin, Hai, et al.
Pubblicazione: (2024)
di: Lin, Hai, et al.
Pubblicazione: (2024)
Balancing Immediate Revenue and Future Off-Policy Evaluation in Coupon Allocation
di: Nishimura, Naoki, et al.
Pubblicazione: (2024)
di: Nishimura, Naoki, et al.
Pubblicazione: (2024)
Efficient and Sharp Off-Policy Evaluation in Robust Markov Decision Processes
di: Bennett, Andrew, et al.
Pubblicazione: (2024)
di: Bennett, Andrew, et al.
Pubblicazione: (2024)
SOPE: Stabilizing Off-Policy Evaluation for Online RL with Prior Data
di: Romeo, Carlo, et al.
Pubblicazione: (2026)
di: Romeo, Carlo, et al.
Pubblicazione: (2026)
Statistical Tractability of Off-policy Evaluation of History-dependent Policies in POMDPs
di: Zhang, Yuheng, et al.
Pubblicazione: (2025)
di: Zhang, Yuheng, et al.
Pubblicazione: (2025)
Towards Assessing and Benchmarking Risk-Return Tradeoff of Off-Policy Evaluation
di: Kiyohara, Haruka, et al.
Pubblicazione: (2023)
di: Kiyohara, Haruka, et al.
Pubblicazione: (2023)
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
di: Zhou, Hongyi, et al.
Pubblicazione: (2025)
di: Zhou, Hongyi, et al.
Pubblicazione: (2025)
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
di: Cohen, Taco, et al.
Pubblicazione: (2025)
di: Cohen, Taco, et al.
Pubblicazione: (2025)
SAINT: Attention-Based Policies for Discrete Combinatorial Action Spaces
di: Landers, Matthew, et al.
Pubblicazione: (2025)
di: Landers, Matthew, et al.
Pubblicazione: (2025)
Data Poisoning Attacks on Off-Policy Policy Evaluation Methods
di: Lobo, Elita, et al.
Pubblicazione: (2024)
di: Lobo, Elita, et al.
Pubblicazione: (2024)
Low-Rank Adaptation for Critic Learning in Off-Policy Reinforcement Learning
di: Zhuang, Yuan, et al.
Pubblicazione: (2026)
di: Zhuang, Yuan, et al.
Pubblicazione: (2026)
Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning
di: Zhao, Shiwan, et al.
Pubblicazione: (2026)
di: Zhao, Shiwan, et al.
Pubblicazione: (2026)
Automated Off-Policy Estimator Selection via Supervised Learning
di: Felicioni, Nicolò, et al.
Pubblicazione: (2024)
di: Felicioni, Nicolò, et al.
Pubblicazione: (2024)
Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization
di: Palenicek, Daniel, et al.
Pubblicazione: (2025)
di: Palenicek, Daniel, et al.
Pubblicazione: (2025)
Prior-Dependent Allocations for Bayesian Fixed-Budget Best-Arm Identification in Structured Bandits
di: Nguyen, Nicolas, et al.
Pubblicazione: (2024)
di: Nguyen, Nicolas, et al.
Pubblicazione: (2024)
Generalized Discrete Diffusion from Snapshots
di: Zekri, Oussama, et al.
Pubblicazione: (2026)
di: Zekri, Oussama, et al.
Pubblicazione: (2026)
Breaking the Grid: Distance-Guided Reinforcement Learning in Large Discrete Action Spaces
di: Hoppe, Heiko, et al.
Pubblicazione: (2026)
di: Hoppe, Heiko, et al.
Pubblicazione: (2026)
Abstract Reward Processes: Leveraging State Abstraction for Consistent Off-Policy Evaluation
di: Chaudhari, Shreyas, et al.
Pubblicazione: (2024)
di: Chaudhari, Shreyas, et al.
Pubblicazione: (2024)
Q-MMR: Off-Policy Evaluation via Recursive Reweighting and Moment Matching
di: Li, Xiang, et al.
Pubblicazione: (2026)
di: Li, Xiang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Unified PAC-Bayesian Study of Pessimism for Offline Policy Learning with Regularized Importance Sampling
di: Aouali, Imad, et al.
Pubblicazione: (2024) -
Off-Policy Learning in Large Action Spaces: Optimization Matters More Than Estimation
di: Aouali, Imad, et al.
Pubblicazione: (2025) -
Diffusion Models Meet Contextual Bandits
di: Aouali, Imad
Pubblicazione: (2024) -
Logarithmic Smoothing for Pessimistic Off-Policy Evaluation, Selection and Learning
di: Sakhi, Otmane, et al.
Pubblicazione: (2024) -
Learning Action Embeddings for Off-Policy Evaluation
di: Cief, Matej, et al.
Pubblicazione: (2023)