EP-GRPO: Entropy-Progress Aligned Group Relative Policy Optimization with Implicit Process Guidance
Fuente:
arXiv
Salvato in:
| Autori principali: | Yu, Song, Li, Li, Zhao, Wenwen, Yang, Zhisheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models
di: Yu, Song, et al.
Pubblicazione: (2026)
di: Yu, Song, et al.
Pubblicazione: (2026)
GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning
di: Wang, Jingyi, et al.
Pubblicazione: (2026)
di: Wang, Jingyi, et al.
Pubblicazione: (2026)
IB-GRPO: Aligning LLM-based Learning Path Recommendation with Educational Objectives via Indicator-Based Group Relative Policy Optimization
di: Wang, Shuai, et al.
Pubblicazione: (2026)
di: Wang, Shuai, et al.
Pubblicazione: (2026)
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
di: Zhang, Xichen, et al.
Pubblicazione: (2025)
di: Zhang, Xichen, et al.
Pubblicazione: (2025)
MC-GRPO: Median-Centered Group Relative Policy Optimization for Small-Rollout Reinforcement Learning
di: Kim, Youngeun
Pubblicazione: (2026)
di: Kim, Youngeun
Pubblicazione: (2026)
AceGRPO: Adaptive Curriculum Enhanced Group Relative Policy Optimization for Autonomous Machine Learning Engineering
di: Cai, Yuzhu, et al.
Pubblicazione: (2026)
di: Cai, Yuzhu, et al.
Pubblicazione: (2026)
Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model
di: Zhou, Renping, et al.
Pubblicazione: (2025)
di: Zhou, Renping, et al.
Pubblicazione: (2025)
AMIR-GRPO: Inducing Implicit Preference Signals into GRPO
di: Yari, Amir Hossein, et al.
Pubblicazione: (2026)
di: Yari, Amir Hossein, et al.
Pubblicazione: (2026)
GRAPH-GRPO-LEX: Contract Graph Modeling and Reinforcement Learning with Group Relative Policy Optimization
di: Dechtiar, Moriya, et al.
Pubblicazione: (2025)
di: Dechtiar, Moriya, et al.
Pubblicazione: (2025)
Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing
di: Li, Gengsheng, et al.
Pubblicazione: (2026)
di: Li, Gengsheng, et al.
Pubblicazione: (2026)
Group-Relative REINFORCE Is Secretly an Off-Policy Algorithm: Demystifying Some Myths About GRPO and Its Friends
di: Yao, Chaorui, et al.
Pubblicazione: (2025)
di: Yao, Chaorui, et al.
Pubblicazione: (2025)
Stepwise Guided Policy Optimization: Coloring your Incorrect Reasoning in GRPO
di: Chen, Peter, et al.
Pubblicazione: (2025)
di: Chen, Peter, et al.
Pubblicazione: (2025)
NGRPO: Negative-enhanced Group Relative Policy Optimization
di: Nan, Gongrui, et al.
Pubblicazione: (2025)
di: Nan, Gongrui, et al.
Pubblicazione: (2025)
GTPO: Stabilizing Group Relative Policy Optimization via Gradient and Entropy Control
di: Simoni, Marco, et al.
Pubblicazione: (2025)
di: Simoni, Marco, et al.
Pubblicazione: (2025)
Unveiling Implicit Advantage Symmetry: Why GRPO Struggles with Exploration and Difficulty Adaptation
di: Yu, Zhiqi, et al.
Pubblicazione: (2026)
di: Yu, Zhiqi, et al.
Pubblicazione: (2026)
Segment-Aligned Policy Optimization for Multi-Modal Reasoning
di: Gao, Lei, et al.
Pubblicazione: (2026)
di: Gao, Lei, et al.
Pubblicazione: (2026)
Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO
di: Ren, Yiming, et al.
Pubblicazione: (2026)
di: Ren, Yiming, et al.
Pubblicazione: (2026)
GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents
di: Wu, Xiongbin, et al.
Pubblicazione: (2026)
di: Wu, Xiongbin, et al.
Pubblicazione: (2026)
Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization
di: Sane, Soham
Pubblicazione: (2025)
di: Sane, Soham
Pubblicazione: (2025)
Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization
di: Xu, Huimin, et al.
Pubblicazione: (2026)
di: Xu, Huimin, et al.
Pubblicazione: (2026)
EBPO: Empirical Bayes Shrinkage for Stabilizing Group-Relative Policy Optimization
di: Han, Kevin, et al.
Pubblicazione: (2026)
di: Han, Kevin, et al.
Pubblicazione: (2026)
GRPO is Secretly a Process Reward Model
di: Sullivan, Michael, et al.
Pubblicazione: (2025)
di: Sullivan, Michael, et al.
Pubblicazione: (2025)
Entropy-Gated Selective Policy Optimization:Token-Level Gradient Allocation for Hybrid Training of Large Language Models
di: Hu, Yuelin, et al.
Pubblicazione: (2026)
di: Hu, Yuelin, et al.
Pubblicazione: (2026)
SofT-GRPO: Surpassing Discrete-Token LLM Reinforcement Learning via Gumbel-Reparameterized Soft-Thinking Policy Optimization
di: Zheng, Zhi, et al.
Pubblicazione: (2025)
di: Zheng, Zhi, et al.
Pubblicazione: (2025)
Group Sequence Policy Optimization
di: Zheng, Chujie, et al.
Pubblicazione: (2025)
di: Zheng, Chujie, et al.
Pubblicazione: (2025)
PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment
di: Li, Jiawei, et al.
Pubblicazione: (2024)
di: Li, Jiawei, et al.
Pubblicazione: (2024)
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
di: Wang, Junzhe, et al.
Pubblicazione: (2026)
di: Wang, Junzhe, et al.
Pubblicazione: (2026)
A Unified Framework for Rethinking Policy Divergence Measures in GRPO
di: Wu, Qingyuan, et al.
Pubblicazione: (2026)
di: Wu, Qingyuan, et al.
Pubblicazione: (2026)
Information-Consistent Language Model Recommendations through Group Relative Policy Optimization
di: Prabhune, Sonal, et al.
Pubblicazione: (2025)
di: Prabhune, Sonal, et al.
Pubblicazione: (2025)
Group Orthogonalized Policy Optimization:Group Policy Optimization as Orthogonal Projection in Hilbert Space
di: Zixian, Wang
Pubblicazione: (2026)
di: Zixian, Wang
Pubblicazione: (2026)
Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization
di: Zhu, Haodong, et al.
Pubblicazione: (2026)
di: Zhu, Haodong, et al.
Pubblicazione: (2026)
Leveraging Group Relative Policy Optimization to Advance Large Language Models in Traditional Chinese Medicine
di: Xie, Jiacheng, et al.
Pubblicazione: (2025)
di: Xie, Jiacheng, et al.
Pubblicazione: (2025)
GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning
di: Zhang, Han, et al.
Pubblicazione: (2025)
di: Zhang, Han, et al.
Pubblicazione: (2025)
Reinforcement Learning via Implicit Imitation Guidance
di: Dong, Perry, et al.
Pubblicazione: (2025)
di: Dong, Perry, et al.
Pubblicazione: (2025)
GVPO: Group Variance Policy Optimization for Large Language Model Post-Training
di: Zhang, Kaichen, et al.
Pubblicazione: (2025)
di: Zhang, Kaichen, et al.
Pubblicazione: (2025)
Conformal Constrained Policy Optimization for Cost-Effective LLM Agents
di: Si, Wenwen, et al.
Pubblicazione: (2025)
di: Si, Wenwen, et al.
Pubblicazione: (2025)
A Unified Pair-GRPO Family: From Implicit to Explicit Preference Constraints for Stable and General RL Alignment
di: Yu, Hao
Pubblicazione: (2026)
di: Yu, Hao
Pubblicazione: (2026)
When Maximum Entropy Misleads Policy Optimization
di: Zhang, Ruipeng, et al.
Pubblicazione: (2025)
di: Zhang, Ruipeng, et al.
Pubblicazione: (2025)
ESPO: Entropy Importance Sampling Policy Optimization
di: Sheng, Yuepeng, et al.
Pubblicazione: (2025)
di: Sheng, Yuepeng, et al.
Pubblicazione: (2025)
Group-in-Group Policy Optimization for LLM Agent Training
di: Feng, Lang, et al.
Pubblicazione: (2025)
di: Feng, Lang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models
di: Yu, Song, et al.
Pubblicazione: (2026) -
GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning
di: Wang, Jingyi, et al.
Pubblicazione: (2026) -
IB-GRPO: Aligning LLM-based Learning Path Recommendation with Educational Objectives via Indicator-Based Group Relative Policy Optimization
di: Wang, Shuai, et al.
Pubblicazione: (2026) -
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
di: Zhang, Xichen, et al.
Pubblicazione: (2025) -
MC-GRPO: Median-Centered Group Relative Policy Optimization for Small-Rollout Reinforcement Learning
di: Kim, Youngeun
Pubblicazione: (2026)