When Maximum Entropy Misleads Policy Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Ruipeng, Chang, Ya-Chien, Gao, Sicun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Extremum-Seeking Action Selection for Accelerating Policy Optimization
por: Chang, Ya-Chien, et al.
Publicado: (2024)
por: Chang, Ya-Chien, et al.
Publicado: (2024)
Improving Value Estimation Critically Enhances Vanilla Policy Gradient
por: Wang, Tao, et al.
Publicado: (2025)
por: Wang, Tao, et al.
Publicado: (2025)
Learning Quadruped Walking from Seconds of Demonstration
por: Zhang, Ruipeng, et al.
Publicado: (2026)
por: Zhang, Ruipeng, et al.
Publicado: (2026)
Fractal Landscapes in Policy Optimization
por: Wang, Tao, et al.
Publicado: (2023)
por: Wang, Tao, et al.
Publicado: (2023)
Activation-Descent Regularization for Input Optimization of ReLU Networks
por: Yu, Hongzhan, et al.
Publicado: (2024)
por: Yu, Hongzhan, et al.
Publicado: (2024)
Mollification Effects of Policy Gradient Methods
por: Wang, Tao, et al.
Publicado: (2024)
por: Wang, Tao, et al.
Publicado: (2024)
Maximum Entropy Reinforcement Learning with Diffusion Policy
por: Dong, Xiaoyi, et al.
Publicado: (2025)
por: Dong, Xiaoyi, et al.
Publicado: (2025)
Maximum Entropy On-Policy Actor-Critic via Entropy Advantage Estimation
por: Choe, Jean Seong Bjorn, et al.
Publicado: (2024)
por: Choe, Jean Seong Bjorn, et al.
Publicado: (2024)
Improving Compositional Generation with Diffusion Models Using Lift Scores
por: Yu, Chenning, et al.
Publicado: (2025)
por: Yu, Chenning, et al.
Publicado: (2025)
Breaking the Barrier: Enhanced Utility and Robustness in Smoothed DRL Agents
por: Sun, Chung-En, et al.
Publicado: (2024)
por: Sun, Chung-En, et al.
Publicado: (2024)
ESPO: Entropy Importance Sampling Policy Optimization
por: Sheng, Yuepeng, et al.
Publicado: (2025)
por: Sheng, Yuepeng, et al.
Publicado: (2025)
Mind Your Entropy: From Maximum Entropy to Trajectory Entropy-Constrained RL
por: Zhan, Guojian, et al.
Publicado: (2025)
por: Zhan, Guojian, et al.
Publicado: (2025)
Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization
por: Xu, Huimin, et al.
Publicado: (2026)
por: Xu, Huimin, et al.
Publicado: (2026)
Maximum Entropy Exploration Without the Rollouts
por: Adamczyk, Jacob, et al.
Publicado: (2026)
por: Adamczyk, Jacob, et al.
Publicado: (2026)
Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement
por: Wen, Muning, et al.
Publicado: (2024)
por: Wen, Muning, et al.
Publicado: (2024)
Deriving the Scaled-Dot-Function via Maximum Likelihood Estimation and Maximum Entropy Approach
por: Ma, Jiyong
Publicado: (2025)
por: Ma, Jiyong
Publicado: (2025)
ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy
por: Li, Hongming, et al.
Publicado: (2024)
por: Li, Hongming, et al.
Publicado: (2024)
When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?
por: Hatgis-Kessell, Stephane, et al.
Publicado: (2026)
por: Hatgis-Kessell, Stephane, et al.
Publicado: (2026)
FastDSAC: Unlocking the Potential of Maximum Entropy RL in High-Dimensional Humanoid Control
por: Xue, Jun, et al.
Publicado: (2026)
por: Xue, Jun, et al.
Publicado: (2026)
Reward-Punishment Reinforcement Learning with Maximum Entropy
por: Wang, Jiexin, et al.
Publicado: (2024)
por: Wang, Jiexin, et al.
Publicado: (2024)
Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead
por: Kang, Feiyang, et al.
Publicado: (2025)
por: Kang, Feiyang, et al.
Publicado: (2025)
ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models
por: Yu, Song, et al.
Publicado: (2026)
por: Yu, Song, et al.
Publicado: (2026)
Diffusion-Augmented Markov Decision Processes for Maximum Entropy Reinforcement Learning
por: Sanokowski, Sebastian, et al.
Publicado: (2025)
por: Sanokowski, Sebastian, et al.
Publicado: (2025)
Agentic Entropy-Balanced Policy Optimization
por: Dong, Guanting, et al.
Publicado: (2025)
por: Dong, Guanting, et al.
Publicado: (2025)
Beyond Importance Sampling: Rejection-Gated Policy Optimization
por: Sun, Ziwu, et al.
Publicado: (2026)
por: Sun, Ziwu, et al.
Publicado: (2026)
Maximum Entropy Inverse Reinforcement Learning of Diffusion Models with Energy-Based Models
por: Yoon, Sangwoong, et al.
Publicado: (2024)
por: Yoon, Sangwoong, et al.
Publicado: (2024)
FLAC: Maximum Entropy RL via Kinetic Energy Regularized Bridge Matching
por: Lv, Lei, et al.
Publicado: (2026)
por: Lv, Lei, et al.
Publicado: (2026)
Boosting Maximum Entropy Reinforcement Learning via One-Step Flow Matching
por: Li, Zeqiao, et al.
Publicado: (2026)
por: Li, Zeqiao, et al.
Publicado: (2026)
Maximum Redundancy Pruning: A Principle-Driven Layerwise Sparsity Allocation for LLMs
por: Gao, Chang, et al.
Publicado: (2025)
por: Gao, Chang, et al.
Publicado: (2025)
EP-GRPO: Entropy-Progress Aligned Group Relative Policy Optimization with Implicit Process Guidance
por: Yu, Song, et al.
Publicado: (2026)
por: Yu, Song, et al.
Publicado: (2026)
Fibration Policy Optimization
por: Li, Chang, et al.
Publicado: (2026)
por: Li, Chang, et al.
Publicado: (2026)
Policy Gradient with Adaptive Entropy Annealing for Continual Fine-Tuning
por: Zhang, Yaqian, et al.
Publicado: (2026)
por: Zhang, Yaqian, et al.
Publicado: (2026)
Maximum Entropy Behavior Exploration for Sim2Real Zero-Shot Reinforcement Learning
por: Hu, Jiajun, et al.
Publicado: (2026)
por: Hu, Jiajun, et al.
Publicado: (2026)
Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios
por: Dang, Yunkai, et al.
Publicado: (2024)
por: Dang, Yunkai, et al.
Publicado: (2024)
Decision Flow Policy Optimization
por: Hu, Jifeng, et al.
Publicado: (2025)
por: Hu, Jifeng, et al.
Publicado: (2025)
Towards Flash Thinking via Decoupled Advantage Policy Optimization
por: Tan, Zezhong, et al.
Publicado: (2025)
por: Tan, Zezhong, et al.
Publicado: (2025)
Learning to Embed Distributions via Maximum Kernel Entropy
por: Kachaiev, Oleksii, et al.
Publicado: (2024)
por: Kachaiev, Oleksii, et al.
Publicado: (2024)
PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment
por: Li, Jiawei, et al.
Publicado: (2024)
por: Li, Jiawei, et al.
Publicado: (2024)
DiPRL: Learning Discrete Programmatic Policies via Architecture Entropy Regularization
por: Hu, Chengpeng, et al.
Publicado: (2026)
por: Hu, Chengpeng, et al.
Publicado: (2026)
On-Policy Optimization of ANFIS Policies Using Proximal Policy Optimization
por: Shankar, Kaaustaaub, et al.
Publicado: (2025)
por: Shankar, Kaaustaaub, et al.
Publicado: (2025)
Ejemplares similares
-
Extremum-Seeking Action Selection for Accelerating Policy Optimization
por: Chang, Ya-Chien, et al.
Publicado: (2024) -
Improving Value Estimation Critically Enhances Vanilla Policy Gradient
por: Wang, Tao, et al.
Publicado: (2025) -
Learning Quadruped Walking from Seconds of Demonstration
por: Zhang, Ruipeng, et al.
Publicado: (2026) -
Fractal Landscapes in Policy Optimization
por: Wang, Tao, et al.
Publicado: (2023) -
Activation-Descent Regularization for Input Optimization of ReLU Networks
por: Yu, Hongzhan, et al.
Publicado: (2024)