Off-OAB: Off-Policy Policy Gradient Method with Optimal Action-Dependent Baseline
Fuente:
arXiv
Salvato in:
| Autori principali: | Meng, Wenjia, Zheng, Qian, Yang, Long, Yin, Yilong, Pan, Gang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning Action Embeddings for Off-Policy Evaluation
di: Cief, Matej, et al.
Pubblicazione: (2023)
di: Cief, Matej, et al.
Pubblicazione: (2023)
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
di: Zhou, Hongyi, et al.
Pubblicazione: (2025)
di: Zhou, Hongyi, et al.
Pubblicazione: (2025)
Bayesian Off-Policy Evaluation and Learning for Large Action Spaces
di: Aouali, Imad, et al.
Pubblicazione: (2024)
di: Aouali, Imad, et al.
Pubblicazione: (2024)
Data Poisoning Attacks on Off-Policy Policy Evaluation Methods
di: Lobo, Elita, et al.
Pubblicazione: (2024)
di: Lobo, Elita, et al.
Pubblicazione: (2024)
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
di: Cohen, Taco, et al.
Pubblicazione: (2025)
di: Cohen, Taco, et al.
Pubblicazione: (2025)
Concept-driven Off Policy Evaluation
di: Majumdar, Ritam, et al.
Pubblicazione: (2024)
di: Majumdar, Ritam, et al.
Pubblicazione: (2024)
Clustering Context in Off-Policy Evaluation
di: Guzman-Olivares, Daniel, et al.
Pubblicazione: (2025)
di: Guzman-Olivares, Daniel, et al.
Pubblicazione: (2025)
Zero-Shot Off-Policy Learning
di: Asadulaev, Arip, et al.
Pubblicazione: (2026)
di: Asadulaev, Arip, et al.
Pubblicazione: (2026)
Optimal Control-Based Baseline for Guided Exploration in Policy Gradient Methods
di: Lyu, Xubo, et al.
Pubblicazione: (2020)
di: Lyu, Xubo, et al.
Pubblicazione: (2020)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
di: Xiao, Teng, et al.
Pubblicazione: (2024)
di: Xiao, Teng, et al.
Pubblicazione: (2024)
Off-Policy Evaluation and Counterfactual Methods in Dynamic Auction Environments
di: Guha, Ritam, et al.
Pubblicazione: (2025)
di: Guha, Ritam, et al.
Pubblicazione: (2025)
Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs
di: Huang, Luke J., et al.
Pubblicazione: (2026)
di: Huang, Luke J., et al.
Pubblicazione: (2026)
Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies
di: Lee, Haanvid, et al.
Pubblicazione: (2024)
di: Lee, Haanvid, et al.
Pubblicazione: (2024)
Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training
di: Fakoor, Rasool, et al.
Pubblicazione: (2026)
di: Fakoor, Rasool, et al.
Pubblicazione: (2026)
Policy Learning for Off-Dynamics RL with Deficient Support
di: Van, Linh Le Pham, et al.
Pubblicazione: (2024)
di: Van, Linh Le Pham, et al.
Pubblicazione: (2024)
The Impact of Off-Policy Training Data on Probe Generalisation
di: Kirch, Nathalie, et al.
Pubblicazione: (2025)
di: Kirch, Nathalie, et al.
Pubblicazione: (2025)
ExO-PPO: an Extended Off-policy Proximal Policy Optimization Algorithm
di: Wang, Hanyong, et al.
Pubblicazione: (2026)
di: Wang, Hanyong, et al.
Pubblicazione: (2026)
Effective Off-Policy Evaluation and Learning in Contextual Combinatorial Bandits
di: Shimizu, Tatsuhiro, et al.
Pubblicazione: (2024)
di: Shimizu, Tatsuhiro, et al.
Pubblicazione: (2024)
Automated Off-Policy Estimator Selection via Supervised Learning
di: Felicioni, Nicolò, et al.
Pubblicazione: (2024)
di: Felicioni, Nicolò, et al.
Pubblicazione: (2024)
Off-Policy Evaluation and Learning for the Future under Non-Stationarity
di: Shimizu, Tatsuhiro, et al.
Pubblicazione: (2025)
di: Shimizu, Tatsuhiro, et al.
Pubblicazione: (2025)
A Unifying View of Coverage in Linear Off-Policy Evaluation
di: Amortila, Philip, et al.
Pubblicazione: (2026)
di: Amortila, Philip, et al.
Pubblicazione: (2026)
Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization
di: Palenicek, Daniel, et al.
Pubblicazione: (2025)
di: Palenicek, Daniel, et al.
Pubblicazione: (2025)
Pessimistic Off-Policy Optimization for Learning to Rank
di: Cief, Matej, et al.
Pubblicazione: (2022)
di: Cief, Matej, et al.
Pubblicazione: (2022)
Learning to Reason under Off-Policy Guidance
di: Yan, Jianhao, et al.
Pubblicazione: (2025)
di: Yan, Jianhao, et al.
Pubblicazione: (2025)
Offline-Boosted Actor-Critic: Adaptively Blending Optimal Historical Behaviors in Deep Off-Policy RL
di: Luo, Yu, et al.
Pubblicazione: (2024)
di: Luo, Yu, et al.
Pubblicazione: (2024)
Exploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy Optimization
di: Liu, Zeyuan, et al.
Pubblicazione: (2026)
di: Liu, Zeyuan, et al.
Pubblicazione: (2026)
Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning
di: Goodall, Alexander W., et al.
Pubblicazione: (2025)
di: Goodall, Alexander W., et al.
Pubblicazione: (2025)
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
di: Shen, Guobin, et al.
Pubblicazione: (2026)
di: Shen, Guobin, et al.
Pubblicazione: (2026)
Breaking the Curse of Repulsion: Optimistic Distributionally Robust Policy Optimization for Off-Policy Generative Recommendation
di: Jiang, Jie, et al.
Pubblicazione: (2026)
di: Jiang, Jie, et al.
Pubblicazione: (2026)
Learning General Policies with Policy Gradient Methods
di: Ståhlberg, Simon, et al.
Pubblicazione: (2025)
di: Ståhlberg, Simon, et al.
Pubblicazione: (2025)
Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction
di: Guan, Zhong, et al.
Pubblicazione: (2026)
di: Guan, Zhong, et al.
Pubblicazione: (2026)
Balancing Immediate Revenue and Future Off-Policy Evaluation in Coupon Allocation
di: Nishimura, Naoki, et al.
Pubblicazione: (2024)
di: Nishimura, Naoki, et al.
Pubblicazione: (2024)
Efficient and Sharp Off-Policy Evaluation in Robust Markov Decision Processes
di: Bennett, Andrew, et al.
Pubblicazione: (2024)
di: Bennett, Andrew, et al.
Pubblicazione: (2024)
SOPE: Stabilizing Off-Policy Evaluation for Online RL with Prior Data
di: Romeo, Carlo, et al.
Pubblicazione: (2026)
di: Romeo, Carlo, et al.
Pubblicazione: (2026)
Statistical Tractability of Off-policy Evaluation of History-dependent Policies in POMDPs
di: Zhang, Yuheng, et al.
Pubblicazione: (2025)
di: Zhang, Yuheng, et al.
Pubblicazione: (2025)
Enabling Off-Policy Imitation Learning with Deep Actor Critic Stabilization
di: Sen, Sayambhu, et al.
Pubblicazione: (2025)
di: Sen, Sayambhu, et al.
Pubblicazione: (2025)
Adaptive Layerwise Perturbation: Unifying Off-Policy Corrections for LLM RL
di: Ye, Chenlu, et al.
Pubblicazione: (2026)
di: Ye, Chenlu, et al.
Pubblicazione: (2026)
Towards Assessing and Benchmarking Risk-Return Tradeoff of Off-Policy Evaluation
di: Kiyohara, Haruka, et al.
Pubblicazione: (2023)
di: Kiyohara, Haruka, et al.
Pubblicazione: (2023)
Low-Rank Adaptation for Critic Learning in Off-Policy Reinforcement Learning
di: Zhuang, Yuan, et al.
Pubblicazione: (2026)
di: Zhuang, Yuan, et al.
Pubblicazione: (2026)
Turning Sand to Gold: Recycling Data to Bridge On-Policy and Off-Policy Learning via Causal Bound
di: Fiskus, Tal, et al.
Pubblicazione: (2025)
di: Fiskus, Tal, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Learning Action Embeddings for Off-Policy Evaluation
di: Cief, Matej, et al.
Pubblicazione: (2023) -
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
di: Zhou, Hongyi, et al.
Pubblicazione: (2025) -
Bayesian Off-Policy Evaluation and Learning for Large Action Spaces
di: Aouali, Imad, et al.
Pubblicazione: (2024) -
Data Poisoning Attacks on Off-Policy Policy Evaluation Methods
di: Lobo, Elita, et al.
Pubblicazione: (2024) -
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
di: Cohen, Taco, et al.
Pubblicazione: (2025)