MHPO: Modulated Hazard-aware Policy Optimization for Stable Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Hongjun, Liu, Wei, Gu, Weibo, Sun, Xing, Han, Kai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Agentic Reinforced Policy Optimization
por: Dong, Guanting, et al.
Publicado: (2025)
por: Dong, Guanting, et al.
Publicado: (2025)
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
por: Xi, Zhiheng, et al.
Publicado: (2025)
por: Xi, Zhiheng, et al.
Publicado: (2025)
Causally-Enhanced Reinforcement Policy Optimization
por: Wang, Xiangqi, et al.
Publicado: (2025)
por: Wang, Xiangqi, et al.
Publicado: (2025)
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
por: Liu, Bingshuai, et al.
Publicado: (2025)
por: Liu, Bingshuai, et al.
Publicado: (2025)
Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings
por: Wu, Yuning, et al.
Publicado: (2026)
por: Wu, Yuning, et al.
Publicado: (2026)
Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems
por: Walder, Christian, et al.
Publicado: (2025)
por: Walder, Christian, et al.
Publicado: (2025)
MolMem: Memory-Augmented Agentic Reinforcement Learning for Sample-Efficient Molecular Optimization
por: Wang, Ziqing, et al.
Publicado: (2026)
por: Wang, Ziqing, et al.
Publicado: (2026)
HISR: Hindsight Information Modulated Segmental Process Rewards For Multi-turn Agentic Reinforcement Learning
por: Lu, Zhicong, et al.
Publicado: (2026)
por: Lu, Zhicong, et al.
Publicado: (2026)
COPO: Consistency-Aware Policy Optimization
por: Han, Jinghang, et al.
Publicado: (2025)
por: Han, Jinghang, et al.
Publicado: (2025)
Group Sequence Policy Optimization
por: Zheng, Chujie, et al.
Publicado: (2025)
por: Zheng, Chujie, et al.
Publicado: (2025)
Self-Distilled Agentic Reinforcement Learning
por: Lu, Zhengxi, et al.
Publicado: (2026)
por: Lu, Zhengxi, et al.
Publicado: (2026)
Soft Adaptive Policy Optimization
por: Gao, Chang, et al.
Publicado: (2025)
por: Gao, Chang, et al.
Publicado: (2025)
Agentic Policy Optimization via Instruction-Policy Co-Evolution
por: Zhou, Han, et al.
Publicado: (2025)
por: Zhou, Han, et al.
Publicado: (2025)
Asymmetric Advantage Modulation Calibrates Entropy Dynamics in RLVR
por: Gu, Hengrui, et al.
Publicado: (2026)
por: Gu, Hengrui, et al.
Publicado: (2026)
Optimizing Anytime Reasoning via Budget Relative Policy Optimization
por: Qi, Penghui, et al.
Publicado: (2025)
por: Qi, Penghui, et al.
Publicado: (2025)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
por: Ye, Zhiling, et al.
Publicado: (2025)
por: Ye, Zhiling, et al.
Publicado: (2025)
DPO Meets PPO: Reinforced Token Optimization for RLHF
por: Zhong, Han, et al.
Publicado: (2024)
por: Zhong, Han, et al.
Publicado: (2024)
Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts
por: Luo, Sijia, et al.
Publicado: (2026)
por: Luo, Sijia, et al.
Publicado: (2026)
C$^2$GSPG: Confidence-calibrated Group Sequence Policy Gradient towards Self-aware Reasoning
por: Liu, Haotian, et al.
Publicado: (2025)
por: Liu, Haotian, et al.
Publicado: (2025)
Tree-based Dialogue Reinforced Policy Optimization for Red-Teaming Attacks
por: Guo, Ruohao, et al.
Publicado: (2025)
por: Guo, Ruohao, et al.
Publicado: (2025)
DCPO: Dynamic Clipping Policy Optimization
por: Yang, Shihui, et al.
Publicado: (2025)
por: Yang, Shihui, et al.
Publicado: (2025)
STEP: Success-Rate-Aware Trajectory-Efficient Policy Optimization
por: Chen, Yuhan, et al.
Publicado: (2025)
por: Chen, Yuhan, et al.
Publicado: (2025)
$V_0$: A Generalist Value Model for Any Policy at State Zero
por: Zhang, Yi-Kai, et al.
Publicado: (2026)
por: Zhang, Yi-Kai, et al.
Publicado: (2026)
Learning to Align, Aligning to Learn: A Unified Approach for Self-Optimized Alignment
por: Wang, Haowen, et al.
Publicado: (2025)
por: Wang, Haowen, et al.
Publicado: (2025)
Stable Preference Optimization: A Bilevel Approach to Catastrophic Preference Shift
por: Jian, Chengtao, et al.
Publicado: (2025)
por: Jian, Chengtao, et al.
Publicado: (2025)
Reinforcement Learning with Rubric Anchors
por: Huang, Zenan, et al.
Publicado: (2025)
por: Huang, Zenan, et al.
Publicado: (2025)
Adaptive Social Learning via Mode Policy Optimization for Language Agents
por: Wang, Minzheng, et al.
Publicado: (2025)
por: Wang, Minzheng, et al.
Publicado: (2025)
RuleReasoner: Reinforced Rule-based Reasoning via Domain-aware Dynamic Sampling
por: Liu, Yang, et al.
Publicado: (2025)
por: Liu, Yang, et al.
Publicado: (2025)
Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
por: Jin, Renren, et al.
Publicado: (2025)
por: Jin, Renren, et al.
Publicado: (2025)
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
por: Yang, Wenkai, et al.
Publicado: (2026)
por: Yang, Wenkai, et al.
Publicado: (2026)
Dataset Reset Policy Optimization for RLHF
por: Chang, Jonathan D., et al.
Publicado: (2024)
por: Chang, Jonathan D., et al.
Publicado: (2024)
CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR
por: Cui, Sijia, et al.
Publicado: (2026)
por: Cui, Sijia, et al.
Publicado: (2026)
GRAPH-GRPO-LEX: Contract Graph Modeling and Reinforcement Learning with Group Relative Policy Optimization
por: Dechtiar, Moriya, et al.
Publicado: (2025)
por: Dechtiar, Moriya, et al.
Publicado: (2025)
Supervised Fine-Tuning as Inverse Reinforcement Learning
por: Sun, Hao
Publicado: (2024)
por: Sun, Hao
Publicado: (2024)
TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning
por: Wei, Zhepei, et al.
Publicado: (2025)
por: Wei, Zhepei, et al.
Publicado: (2025)
Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning
por: Wang, Zhaoyang, et al.
Publicado: (2026)
por: Wang, Zhaoyang, et al.
Publicado: (2026)
Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance
por: Yan, Kai, et al.
Publicado: (2026)
por: Yan, Kai, et al.
Publicado: (2026)
Aligning Frozen LLMs by Reinforcement Learning: An Iterative Reweight-then-Optimize Approach
por: Zhang, Xinnan, et al.
Publicado: (2025)
por: Zhang, Xinnan, et al.
Publicado: (2025)
Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback
por: Ackermann, Johannes, et al.
Publicado: (2025)
por: Ackermann, Johannes, et al.
Publicado: (2025)
ToolACE-R: Model-aware Iterative Training and Adaptive Refinement for Tool Learning
por: Zeng, Xingshan, et al.
Publicado: (2025)
por: Zeng, Xingshan, et al.
Publicado: (2025)
Ejemplares similares
-
Agentic Reinforced Policy Optimization
por: Dong, Guanting, et al.
Publicado: (2025) -
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
por: Xi, Zhiheng, et al.
Publicado: (2025) -
Causally-Enhanced Reinforcement Policy Optimization
por: Wang, Xiangqi, et al.
Publicado: (2025) -
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
por: Liu, Bingshuai, et al.
Publicado: (2025) -
Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings
por: Wu, Yuning, et al.
Publicado: (2026)