MePoly: Max Entropy Polynomial Policy Optimization

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Liu, Hang, Teng, Sangli, Ghaffari, Maani
Formato: Preprint
Publicado: 2026
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
_version_ 1866915808830029824
author Liu, Hang
Teng, Sangli
Ghaffari, Maani
author_facet Liu, Hang
Teng, Sangli
Ghaffari, Maani
contents Stochastic Optimal Control provides a unified mathematical framework for solving complex decision-making problems, encompassing paradigms such as maximum entropy reinforcement learning(RL) and imitation learning(IL). However, conventional parametric policies often struggle to represent the multi-modality of the solutions. Though diffusion-based policies are aimed at recovering the multi-modality, they lack an explicit probability density, which complicates policy-gradient optimization. To bridge this gap, we propose MePoly, a novel policy parameterization based on polynomial energy-based models. MePoly provides an explicit, tractable probability density, enabling exact entropy maximization. Theoretically, we ground our method in the classical moment problem, leveraging the universal approximation capabilities for arbitrary distributions. Empirically, we demonstrate that MePoly effectively captures complex non-convex manifolds and outperforms baselines in performance across diverse benchmarks.
format Preprint
id arxiv_https___arxiv_org_abs_2602_17832
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle MePoly: Max Entropy Polynomial Policy Optimization
Liu, Hang
Teng, Sangli
Ghaffari, Maani
Machine Learning
Robotics
Stochastic Optimal Control provides a unified mathematical framework for solving complex decision-making problems, encompassing paradigms such as maximum entropy reinforcement learning(RL) and imitation learning(IL). However, conventional parametric policies often struggle to represent the multi-modality of the solutions. Though diffusion-based policies are aimed at recovering the multi-modality, they lack an explicit probability density, which complicates policy-gradient optimization. To bridge this gap, we propose MePoly, a novel policy parameterization based on polynomial energy-based models. MePoly provides an explicit, tractable probability density, enabling exact entropy maximization. Theoretically, we ground our method in the classical moment problem, leveraging the universal approximation capabilities for arbitrary distributions. Empirically, we demonstrate that MePoly effectively captures complex non-convex manifolds and outperforms baselines in performance across diverse benchmarks.
title MePoly: Max Entropy Polynomial Policy Optimization
topic Machine Learning
Robotics
url https://arxiv.org/abs/2602.17832