Exterior Penalty Policy Optimization with Penalty Metric Network under Constraints
Fuente:
arXiv
Salvato in:
| Autori principali: | Gao, Shiqing, Ding, Jiaxin, Fu, Luoyi, Wang, Xinbing, Zhou, Chenghu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Controlling Underestimation Bias in Constrained Reinforcement Learning for Safe Exploration
di: Gao, Shiqing, et al.
Pubblicazione: (2026)
di: Gao, Shiqing, et al.
Pubblicazione: (2026)
Extreme Value Policy Optimization for Safe Reinforcement Learning
di: Gao, Shiqing, et al.
Pubblicazione: (2026)
di: Gao, Shiqing, et al.
Pubblicazione: (2026)
Characterizing the Influence of Topology on Graph Learning Tasks
di: Wu, Kailong, et al.
Pubblicazione: (2024)
di: Wu, Kailong, et al.
Pubblicazione: (2024)
Proactive Constrained Policy Optimization with Preemptive Penalty
di: Yang, Ning, et al.
Pubblicazione: (2025)
di: Yang, Ning, et al.
Pubblicazione: (2025)
Constraint-Aware Diffusion Models for Trajectory Optimization
di: Li, Anjian, et al.
Pubblicazione: (2024)
di: Li, Anjian, et al.
Pubblicazione: (2024)
Graph Parsing Networks
di: Song, Yunchong, et al.
Pubblicazione: (2024)
di: Song, Yunchong, et al.
Pubblicazione: (2024)
Stop Guessing: Optimizing Goalkeeper Policies for Soccer Penalty Kicks
di: Bransen, Lotte, et al.
Pubblicazione: (2025)
di: Bransen, Lotte, et al.
Pubblicazione: (2025)
Spiking Synaptic Penalty: Appropriate Penalty Term for Energy-Efficient Spiking Neural Networks
di: Suetake, Kazuma, et al.
Pubblicazione: (2023)
di: Suetake, Kazuma, et al.
Pubblicazione: (2023)
A Primal-Dual-Assisted Penalty Approach to Bilevel Optimization with Coupled Constraints
di: Jiang, Liuyuan, et al.
Pubblicazione: (2024)
di: Jiang, Liuyuan, et al.
Pubblicazione: (2024)
Diffusion Policy Policy Optimization
di: Ren, Allen Z., et al.
Pubblicazione: (2024)
di: Ren, Allen Z., et al.
Pubblicazione: (2024)
Dichotomous Diffusion Policy Optimization
di: Liang, Ruiming, et al.
Pubblicazione: (2025)
di: Liang, Ruiming, et al.
Pubblicazione: (2025)
Guided Policy Optimization under Partial Observability
di: Li, Yueheng, et al.
Pubblicazione: (2025)
di: Li, Yueheng, et al.
Pubblicazione: (2025)
TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint
di: Lin, Haotian, et al.
Pubblicazione: (2025)
di: Lin, Haotian, et al.
Pubblicazione: (2025)
Certifiable Safe RLHF: Fixed-Penalty Constraint Optimization for Safer Language Models
di: Pandit, Kartik, et al.
Pubblicazione: (2025)
di: Pandit, Kartik, et al.
Pubblicazione: (2025)
RN-D: Discretized Categorical Actors with Regularized Networks for On-Policy Reinforcement Learning
di: Bian, Yuexin, et al.
Pubblicazione: (2026)
di: Bian, Yuexin, et al.
Pubblicazione: (2026)
Position: Adopt Constraints Over Fixed Penalties in Deep Learning
di: Ramirez, Juan, et al.
Pubblicazione: (2025)
di: Ramirez, Juan, et al.
Pubblicazione: (2025)
Convex Regression with a Penalty
di: Lim, Eunji
Pubblicazione: (2025)
di: Lim, Eunji
Pubblicazione: (2025)
Diffusion Policy through Conditional Proximal Policy Optimization
di: Liu, Ben, et al.
Pubblicazione: (2026)
di: Liu, Ben, et al.
Pubblicazione: (2026)
OXYGENERATOR: Reconstructing Global Ocean Deoxygenation Over a Century with Deep Learning
di: Lu, Bin, et al.
Pubblicazione: (2024)
di: Lu, Bin, et al.
Pubblicazione: (2024)
Latent Policy Steering through One-Step Flow Policies
di: Im, Hokyun, et al.
Pubblicazione: (2026)
di: Im, Hokyun, et al.
Pubblicazione: (2026)
Learning Smooth Time-Varying Linear Policies with an Action Jacobian Penalty
di: Xie, Zhaoming, et al.
Pubblicazione: (2026)
di: Xie, Zhaoming, et al.
Pubblicazione: (2026)
Extremum-Seeking Action Selection for Accelerating Policy Optimization
di: Chang, Ya-Chien, et al.
Pubblicazione: (2024)
di: Chang, Ya-Chien, et al.
Pubblicazione: (2024)
Aligning Diffusion Model with Problem Constraints for Trajectory Optimization
di: Li, Anjian, et al.
Pubblicazione: (2025)
di: Li, Anjian, et al.
Pubblicazione: (2025)
PolicyFlow: Policy Optimization with Continuous Normalizing Flow in Reinforcement Learning
di: Yang, Shunpeng, et al.
Pubblicazione: (2026)
di: Yang, Shunpeng, et al.
Pubblicazione: (2026)
Bayesian Cross-Modal Alignment Learning for Few-Shot Out-of-Distribution Generalization
di: Zhu, Lin, et al.
Pubblicazione: (2025)
di: Zhu, Lin, et al.
Pubblicazione: (2025)
State-wise Constrained Policy Optimization
di: Zhao, Weiye, et al.
Pubblicazione: (2023)
di: Zhao, Weiye, et al.
Pubblicazione: (2023)
Evolutionary Policy Optimization
di: Wang, Jianren, et al.
Pubblicazione: (2025)
di: Wang, Jianren, et al.
Pubblicazione: (2025)
Enhancing Sample Efficiency and Exploration in Reinforcement Learning through the Integration of Diffusion Models and Proximal Policy Optimization
di: Gao, Tianci, et al.
Pubblicazione: (2024)
di: Gao, Tianci, et al.
Pubblicazione: (2024)
Uni-O4: Unifying Online and Offline Deep Reinforcement Learning with Multi-Step On-Policy Optimization
di: Lei, Kun, et al.
Pubblicazione: (2023)
di: Lei, Kun, et al.
Pubblicazione: (2023)
Score and Distribution Matching Policy: Advanced Accelerated Visuomotor Policies via Matched Distillation
di: Jia, Bofang, et al.
Pubblicazione: (2024)
di: Jia, Bofang, et al.
Pubblicazione: (2024)
RAYEN: Imposition of Hard Convex Constraints on Neural Networks
di: Tordesillas, Jesus, et al.
Pubblicazione: (2023)
di: Tordesillas, Jesus, et al.
Pubblicazione: (2023)
Co-Optimizing Reconfigurable Environments and Policies for Decentralized Multi-Agent Navigation
di: Gao, Zhan, et al.
Pubblicazione: (2024)
di: Gao, Zhan, et al.
Pubblicazione: (2024)
Restless Bandits with Individual Penalty Constraints: Near-Optimal Indices and Deep Reinforcement Learning
di: Zamir, Nida, et al.
Pubblicazione: (2026)
di: Zamir, Nida, et al.
Pubblicazione: (2026)
MTSCI: A Conditional Diffusion Model for Multivariate Time Series Consistent Imputation
di: Zhou, Jianping, et al.
Pubblicazione: (2024)
di: Zhou, Jianping, et al.
Pubblicazione: (2024)
Is Reference Necessary in the Evaluation of NLG Systems? When and Where?
di: Sheng, Shuqian, et al.
Pubblicazione: (2024)
di: Sheng, Shuqian, et al.
Pubblicazione: (2024)
DisGNet: A Distance Graph Neural Network for Forward Kinematics Learning of Gough-Stewart Platform
di: Zhu, Huizhi, et al.
Pubblicazione: (2024)
di: Zhu, Huizhi, et al.
Pubblicazione: (2024)
Sparse Diffusion Policy: A Sparse, Reusable, and Flexible Policy for Robot Learning
di: Wang, Yixiao, et al.
Pubblicazione: (2024)
di: Wang, Yixiao, et al.
Pubblicazione: (2024)
FocalPolicy: Frequency-Optimized Chunking and Locally Anchored Flow Matching for Coherent Visuomotor Policy
di: He, Qian, et al.
Pubblicazione: (2026)
di: He, Qian, et al.
Pubblicazione: (2026)
DreamPolicy: A Unified World-model Policy for Scalable Humanoid Locomotion
di: Fan, Yahao, et al.
Pubblicazione: (2025)
di: Fan, Yahao, et al.
Pubblicazione: (2025)
ERPPO: Entropy Regularization-based Proximal Policy Optimization
di: Lee, Changha, et al.
Pubblicazione: (2026)
di: Lee, Changha, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Controlling Underestimation Bias in Constrained Reinforcement Learning for Safe Exploration
di: Gao, Shiqing, et al.
Pubblicazione: (2026) -
Extreme Value Policy Optimization for Safe Reinforcement Learning
di: Gao, Shiqing, et al.
Pubblicazione: (2026) -
Characterizing the Influence of Topology on Graph Learning Tasks
di: Wu, Kailong, et al.
Pubblicazione: (2024) -
Proactive Constrained Policy Optimization with Preemptive Penalty
di: Yang, Ning, et al.
Pubblicazione: (2025) -
Constraint-Aware Diffusion Models for Trajectory Optimization
di: Li, Anjian, et al.
Pubblicazione: (2024)