Pessimistic Auxiliary Policy for Offline Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Fan, Huang, Baoru, Zhang, Xin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Pessimistic Causal Reinforcement Learning with Mediators for Confounded Offline Data
di: Wang, Danyang, et al.
Pubblicazione: (2024)
di: Wang, Danyang, et al.
Pubblicazione: (2024)
Pessimistic Value Iteration for Multi-Task Data Sharing in Offline Reinforcement Learning
di: Bai, Chenjia, et al.
Pubblicazione: (2024)
di: Bai, Chenjia, et al.
Pubblicazione: (2024)
Diverse Randomized Value Functions: A Provably Pessimistic Approach for Offline Reinforcement Learning
di: Yu, Xudong, et al.
Pubblicazione: (2024)
di: Yu, Xudong, et al.
Pubblicazione: (2024)
Diffusion Policies with Value-Conditional Optimization for Offline Reinforcement Learning
di: Ma, Yunchang, et al.
Pubblicazione: (2025)
di: Ma, Yunchang, et al.
Pubblicazione: (2025)
Policy Constraint by Only Support Constraint for Offline Reinforcement Learning
di: Gao, Yunkai, et al.
Pubblicazione: (2025)
di: Gao, Yunkai, et al.
Pubblicazione: (2025)
Policy Expansion for Bridging Offline-to-Online Reinforcement Learning
di: Zhang, Haichao, et al.
Pubblicazione: (2023)
di: Zhang, Haichao, et al.
Pubblicazione: (2023)
Pessimistic Off-Policy Optimization for Learning to Rank
di: Cief, Matej, et al.
Pubblicazione: (2022)
di: Cief, Matej, et al.
Pubblicazione: (2022)
LLM-Driven Policy Diffusion: Enhancing Generalization in Offline Reinforcement Learning
di: Zhang, Hanping, et al.
Pubblicazione: (2025)
di: Zhang, Hanping, et al.
Pubblicazione: (2025)
Offline Trajectory Optimization for Offline Reinforcement Learning
di: Zhao, Ziqi, et al.
Pubblicazione: (2024)
di: Zhao, Ziqi, et al.
Pubblicazione: (2024)
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2025)
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2025)
Optimistic Policy Learning under Pessimistic Adversaries with Regret and Violation Guarantees
di: Ganguly, Sourav, et al.
Pubblicazione: (2026)
di: Ganguly, Sourav, et al.
Pubblicazione: (2026)
Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning
di: Liu, Tenglong, et al.
Pubblicazione: (2024)
di: Liu, Tenglong, et al.
Pubblicazione: (2024)
Offline Reinforcement Learning with Generative Trajectory Policies
di: Feng, Xinsong, et al.
Pubblicazione: (2025)
di: Feng, Xinsong, et al.
Pubblicazione: (2025)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
di: Zhang, Tianle, et al.
Pubblicazione: (2024)
di: Zhang, Tianle, et al.
Pubblicazione: (2024)
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
di: Hu, Jifeng, et al.
Pubblicazione: (2025)
di: Hu, Jifeng, et al.
Pubblicazione: (2025)
Policy-Based Trajectory Clustering in Offline Reinforcement Learning
di: Hu, Hao, et al.
Pubblicazione: (2025)
di: Hu, Hao, et al.
Pubblicazione: (2025)
Policy-regularized Offline Multi-objective Reinforcement Learning
di: Lin, Qian, et al.
Pubblicazione: (2024)
di: Lin, Qian, et al.
Pubblicazione: (2024)
Evaluation-Time Policy Switching for Offline Reinforcement Learning
di: Neggatu, Natinael Solomon, et al.
Pubblicazione: (2025)
di: Neggatu, Natinael Solomon, et al.
Pubblicazione: (2025)
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
di: Zhan, Simon Sinong, et al.
Pubblicazione: (2025)
di: Zhan, Simon Sinong, et al.
Pubblicazione: (2025)
Pessimistic Verification for Open Ended Math Questions
di: Huang, Yanxing, et al.
Pubblicazione: (2025)
di: Huang, Yanxing, et al.
Pubblicazione: (2025)
Offline Policy Evaluation for Reinforcement Learning with Adaptively Collected Data
di: Madhow, Sunil, et al.
Pubblicazione: (2023)
di: Madhow, Sunil, et al.
Pubblicazione: (2023)
Constraint-Adaptive Policy Switching for Offline Safe Reinforcement Learning
di: Chemingui, Yassine, et al.
Pubblicazione: (2024)
di: Chemingui, Yassine, et al.
Pubblicazione: (2024)
When is Offline Policy Selection Sample Efficient for Reinforcement Learning?
di: Liu, Vincent, et al.
Pubblicazione: (2023)
di: Liu, Vincent, et al.
Pubblicazione: (2023)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
di: Kang, Hyungkyu, et al.
Pubblicazione: (2025)
di: Kang, Hyungkyu, et al.
Pubblicazione: (2025)
Offline Policy Optimization with Posterior Sampling
di: Lin, Hongqiang, et al.
Pubblicazione: (2026)
di: Lin, Hongqiang, et al.
Pubblicazione: (2026)
Offline-to-Online Reinforcement Learning with Classifier-Free Diffusion Generation
di: Huang, Xiao, et al.
Pubblicazione: (2025)
di: Huang, Xiao, et al.
Pubblicazione: (2025)
Adaptive Policy Selection and Fine-Tuning under Interaction Budgets for Offline-to-Online Reinforcement Learning
di: Bozkurt, Alper Kamil, et al.
Pubblicazione: (2026)
di: Bozkurt, Alper Kamil, et al.
Pubblicazione: (2026)
Offline-to-Online Multi-Agent Reinforcement Learning with Offline Value Function Memory and Sequential Exploration
di: Zhong, Hai, et al.
Pubblicazione: (2024)
di: Zhong, Hai, et al.
Pubblicazione: (2024)
Diffusion Policies creating a Trust Region for Offline Reinforcement Learning
di: Chen, Tianyu, et al.
Pubblicazione: (2024)
di: Chen, Tianyu, et al.
Pubblicazione: (2024)
Constrained Latent Action Policies for Model-Based Offline Reinforcement Learning
di: Alles, Marvin, et al.
Pubblicazione: (2024)
di: Alles, Marvin, et al.
Pubblicazione: (2024)
Offline Reinforcement Learning for Learning to Dispatch for Job Shop Scheduling
di: van Remmerden, Jesse, et al.
Pubblicazione: (2024)
di: van Remmerden, Jesse, et al.
Pubblicazione: (2024)
Diffusion-DICE: In-Sample Diffusion Guidance for Offline Reinforcement Learning
di: Mao, Liyuan, et al.
Pubblicazione: (2024)
di: Mao, Liyuan, et al.
Pubblicazione: (2024)
FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning
di: Alles, Marvin, et al.
Pubblicazione: (2025)
di: Alles, Marvin, et al.
Pubblicazione: (2025)
Imagination-Limited Q-Learning for Offline Reinforcement Learning
di: Liu, Wenhui, et al.
Pubblicazione: (2025)
di: Liu, Wenhui, et al.
Pubblicazione: (2025)
Guided Flow Policy: Learning from High-Value Actions in Offline Reinforcement Learning
di: Tiofack, Franki Nguimatsia, et al.
Pubblicazione: (2025)
di: Tiofack, Franki Nguimatsia, et al.
Pubblicazione: (2025)
Task-Aware Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning
di: Fan, Ziqing, et al.
Pubblicazione: (2024)
di: Fan, Ziqing, et al.
Pubblicazione: (2024)
IPD: Boosting Sequential Policy with Imaginary Planning Distillation in Offline Reinforcement Learning
di: Qin, Yihao, et al.
Pubblicazione: (2026)
di: Qin, Yihao, et al.
Pubblicazione: (2026)
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
di: Yang, Yiqin, et al.
Pubblicazione: (2026)
di: Yang, Yiqin, et al.
Pubblicazione: (2026)
Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization
di: Liu, Zongkai, et al.
Pubblicazione: (2024)
di: Liu, Zongkai, et al.
Pubblicazione: (2024)
Development and Validation of Heparin Dosing Policies Using an Offline Reinforcement Learning Algorithm
di: Lim, Yooseok, et al.
Pubblicazione: (2024)
di: Lim, Yooseok, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Pessimistic Causal Reinforcement Learning with Mediators for Confounded Offline Data
di: Wang, Danyang, et al.
Pubblicazione: (2024) -
Pessimistic Value Iteration for Multi-Task Data Sharing in Offline Reinforcement Learning
di: Bai, Chenjia, et al.
Pubblicazione: (2024) -
Diverse Randomized Value Functions: A Provably Pessimistic Approach for Offline Reinforcement Learning
di: Yu, Xudong, et al.
Pubblicazione: (2024) -
Diffusion Policies with Value-Conditional Optimization for Offline Reinforcement Learning
di: Ma, Yunchang, et al.
Pubblicazione: (2025) -
Policy Constraint by Only Support Constraint for Offline Reinforcement Learning
di: Gao, Yunkai, et al.
Pubblicazione: (2025)