GEM: Guided Expectation-Maximization for Behavior-Normalized Candidate Action Selection in Offline RL
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Haoyu, Wang, Jingcheng, Wu, Shunyu, Xiao, Xinwei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Selective Uncertainty Propagation in Offline RL
por: Krishnamurthy, Sanath Kumar, et al.
Publicado: (2023)
por: Krishnamurthy, Sanath Kumar, et al.
Publicado: (2023)
Scalable Offline Model-Based RL with Action Chunks
por: Park, Kwanyoung, et al.
Publicado: (2025)
por: Park, Kwanyoung, et al.
Publicado: (2025)
DIDI: Diffusion-Guided Diversity for Offline Behavioral Generation
por: Liu, Jinxin, et al.
Publicado: (2024)
por: Liu, Jinxin, et al.
Publicado: (2024)
Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL
por: Luo, Qin-Wen, et al.
Publicado: (2025)
por: Luo, Qin-Wen, et al.
Publicado: (2025)
Allocating Variance to Maximize Expectation
por: Leme, Renato Purita Paes, et al.
Publicado: (2025)
por: Leme, Renato Purita Paes, et al.
Publicado: (2025)
Making Offline RL Online: Collaborative World Models for Offline Visual Reinforcement Learning
por: Wang, Qi, et al.
Publicado: (2023)
por: Wang, Qi, et al.
Publicado: (2023)
Offline Behavioral Data Selection
por: Lei, Shiye, et al.
Publicado: (2025)
por: Lei, Shiye, et al.
Publicado: (2025)
Uncertainty-Aware Graph Self-Training with Expectation-Maximization Regularization
por: Wang, Emily, et al.
Publicado: (2025)
por: Wang, Emily, et al.
Publicado: (2025)
HIQL: Offline Goal-Conditioned RL with Latent States as Actions
por: Park, Seohong, et al.
Publicado: (2023)
por: Park, Seohong, et al.
Publicado: (2023)
Action-Free Offline-to-Online RL via Discretised State Policies
por: Neggatu, Natinael Solomon, et al.
Publicado: (2026)
por: Neggatu, Natinael Solomon, et al.
Publicado: (2026)
Calibrated Speculative Decoding: Frequency-Guided Candidate Selection for Efficient Inference
por: Zhou, Xuwen, et al.
Publicado: (2026)
por: Zhou, Xuwen, et al.
Publicado: (2026)
Behavior-Adaptive Q-Learning: A Unifying Framework for Offline-to-Online RL
por: Zu, Lipeng, et al.
Publicado: (2025)
por: Zu, Lipeng, et al.
Publicado: (2025)
Augmenting Offline RL with Unlabeled Data
por: Wang, Zhao, et al.
Publicado: (2024)
por: Wang, Zhao, et al.
Publicado: (2024)
Diffusion Alignment as Variational Expectation-Maximization
por: Lee, Jaewoo, et al.
Publicado: (2025)
por: Lee, Jaewoo, et al.
Publicado: (2025)
Improving and Accelerating Offline RL in Large Discrete Action Spaces with Structured Policy Initialization
por: Landers, Matthew, et al.
Publicado: (2026)
por: Landers, Matthew, et al.
Publicado: (2026)
Decoupled Prioritized Resampling for Offline RL
por: Yue, Yang, et al.
Publicado: (2023)
por: Yue, Yang, et al.
Publicado: (2023)
Reinformer: Max-Return Sequence Modeling for Offline RL
por: Zhuang, Zifeng, et al.
Publicado: (2024)
por: Zhuang, Zifeng, et al.
Publicado: (2024)
Density Operator Expectation Maximization
por: Vishnu, Adit, et al.
Publicado: (2025)
por: Vishnu, Adit, et al.
Publicado: (2025)
Out-of-Distribution Adaptation in Offline RL: Counterfactual Reasoning via Causal Normalizing Flows
por: Cho, Minjae, et al.
Publicado: (2024)
por: Cho, Minjae, et al.
Publicado: (2024)
DEAS: DEtached value learning with Action Sequence for Scalable Offline RL
por: Kim, Changyeon, et al.
Publicado: (2025)
por: Kim, Changyeon, et al.
Publicado: (2025)
Energy-Guided Diffusion Sampling for Offline-to-Online Reinforcement Learning
por: Liu, Xu-Hui, et al.
Publicado: (2024)
por: Liu, Xu-Hui, et al.
Publicado: (2024)
Fat-to-Thin Policy Optimization: Offline RL with Sparse Policies
por: Zhu, Lingwei, et al.
Publicado: (2025)
por: Zhu, Lingwei, et al.
Publicado: (2025)
Solving Continual Offline RL through Selective Weights Activation on Aligned Spaces
por: Hu, Jifeng, et al.
Publicado: (2024)
por: Hu, Jifeng, et al.
Publicado: (2024)
AdamO: A Collapse-Suppressed Optimizer for Offline RL
por: Qiao, Nan, et al.
Publicado: (2026)
por: Qiao, Nan, et al.
Publicado: (2026)
Deep Generative Clustering with VAEs and Expectation-Maximization
por: Adipoetra, Michael, et al.
Publicado: (2025)
por: Adipoetra, Michael, et al.
Publicado: (2025)
Massively Parallel Expectation Maximization For Approximate Posteriors
por: Heap, Thomas, et al.
Publicado: (2025)
por: Heap, Thomas, et al.
Publicado: (2025)
General Flexible $f$-divergence for Challenging Offline RL Datasets with Low Stochasticity and Diverse Behavior Policies
por: Wang, Jianxun, et al.
Publicado: (2026)
por: Wang, Jianxun, et al.
Publicado: (2026)
Less is More: Clustered Cross-Covariance Control for Offline RL
por: Qiao, Nan, et al.
Publicado: (2026)
por: Qiao, Nan, et al.
Publicado: (2026)
Are Expressive Models Truly Necessary for Offline RL?
por: Wang, Guan, et al.
Publicado: (2024)
por: Wang, Guan, et al.
Publicado: (2024)
Improving Offline RL by Blending Heuristics
por: Geng, Sinong, et al.
Publicado: (2023)
por: Geng, Sinong, et al.
Publicado: (2023)
EM-Net: Gaze Estimation with Expectation Maximization Algorithm
por: Cheng, Zhang, et al.
Publicado: (2024)
por: Cheng, Zhang, et al.
Publicado: (2024)
Meta-DT: Offline Meta-RL as Conditional Sequence Modeling with World Model Disentanglement
por: Wang, Zhi, et al.
Publicado: (2024)
por: Wang, Zhi, et al.
Publicado: (2024)
Learning to Reason in LLMs by Expectation Maximization
por: Lee, Junghyun, et al.
Publicado: (2025)
por: Lee, Junghyun, et al.
Publicado: (2025)
Behavioral Entropy-Guided Dataset Generation for Offline Reinforcement Learning
por: Suttle, Wesley A., et al.
Publicado: (2025)
por: Suttle, Wesley A., et al.
Publicado: (2025)
QHyer: Q-conditioned Hybrid Attention-mamba Transformer for Offline Goal-conditioned RL
por: Lei, Xing, et al.
Publicado: (2026)
por: Lei, Xing, et al.
Publicado: (2026)
Budgeting Counterfactual for Offline RL
por: Liu, Yao, et al.
Publicado: (2023)
por: Liu, Yao, et al.
Publicado: (2023)
OMG-RL:Offline Model-based Guided Reward Learning for Heparin Treatment
por: Lim, Yooseok, et al.
Publicado: (2024)
por: Lim, Yooseok, et al.
Publicado: (2024)
From Biased Selective Labels to Pseudo-Labels: An Expectation-Maximization Framework for Learning from Biased Decisions
por: Chang, Trenton, et al.
Publicado: (2024)
por: Chang, Trenton, et al.
Publicado: (2024)
SEMF: Supervised Expectation-Maximization Framework for Predicting Intervals
por: Azizi, Ilia, et al.
Publicado: (2024)
por: Azizi, Ilia, et al.
Publicado: (2024)
Learning Diffusion Priors from Observations by Expectation Maximization
por: Rozet, François, et al.
Publicado: (2024)
por: Rozet, François, et al.
Publicado: (2024)
Ejemplares similares
-
Selective Uncertainty Propagation in Offline RL
por: Krishnamurthy, Sanath Kumar, et al.
Publicado: (2023) -
Scalable Offline Model-Based RL with Action Chunks
por: Park, Kwanyoung, et al.
Publicado: (2025) -
DIDI: Diffusion-Guided Diversity for Offline Behavioral Generation
por: Liu, Jinxin, et al.
Publicado: (2024) -
Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL
por: Luo, Qin-Wen, et al.
Publicado: (2025) -
Allocating Variance to Maximize Expectation
por: Leme, Renato Purita Paes, et al.
Publicado: (2025)