CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Su, Zhenpeng, Pan, Leiyu, Lv, Minxuan, Li, Yuntao, Hu, Wenping, Zhang, Fuzheng, Gai, Kun, Zhou, Guorui |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization
par: Su, Zhenpeng, et autres
Publié: (2025)
par: Su, Zhenpeng, et autres
Publié: (2025)
Entropy Ratio Clipping as a Soft Global Constraint for Stable Reinforcement Learning
par: Su, Zhenpeng, et autres
Publié: (2025)
par: Su, Zhenpeng, et autres
Publié: (2025)
Good Reasoning Makes Good Demonstrations: Implicit Reasoning Quality Supervision via In-Context Reinforcement Learning
par: Mei, Tiehua, et autres
Publié: (2026)
par: Mei, Tiehua, et autres
Publié: (2026)
Agentic Entropy-Balanced Policy Optimization
par: Dong, Guanting, et autres
Publié: (2025)
par: Dong, Guanting, et autres
Publié: (2025)
DSMoE: Matrix-Partitioned Experts with Dynamic Routing for Computation-Efficient Dense LLMs
par: Lv, Minxuan, et autres
Publié: (2025)
par: Lv, Minxuan, et autres
Publié: (2025)
Finedeep: Mitigating Sparse Activation in Dense LLMs via Multi-Layer Fine-Grained Experts
par: Pan, Leiyu, et autres
Publié: (2025)
par: Pan, Leiyu, et autres
Publié: (2025)
When Importance Sampling Misallocates Credit: Asymmetric Ratios for Outcome-Supervised RL
par: Wang, Jiakang, et autres
Publié: (2025)
par: Wang, Jiakang, et autres
Publié: (2025)
Leanabell-Prover-V2: Verifier-integrated Reasoning for Formal Theorem Proving via Reinforcement Learning
par: Ji, Xingguang, et autres
Publié: (2025)
par: Ji, Xingguang, et autres
Publié: (2025)
Agentic Reinforced Policy Optimization
par: Dong, Guanting, et autres
Publié: (2025)
par: Dong, Guanting, et autres
Publié: (2025)
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
Leanabell-Prover: Posttraining Scaling in Formal Reasoning
par: Zhang, Jingyuan, et autres
Publié: (2025)
par: Zhang, Jingyuan, et autres
Publié: (2025)
Clip-Low Increases Entropy and Clip-High Decreases Entropy in Reinforcement Learning of Large Language Models
par: Park, Jaesung R., et autres
Publié: (2025)
par: Park, Jaesung R., et autres
Publié: (2025)
Attention as a Compass: Efficient Exploration for Process-Supervised RL in Reasoning Models
par: Liu, Runze, et autres
Publié: (2025)
par: Liu, Runze, et autres
Publié: (2025)
Robust Stochastic Optimization via Gradient Quantile Clipping
par: Merad, Ibrahim, et autres
Publié: (2023)
par: Merad, Ibrahim, et autres
Publié: (2023)
CartesianMoE: Boosting Knowledge Sharing among Experts via Cartesian Product Routing in Mixture-of-Experts
par: Su, Zhenpeng, et autres
Publié: (2024)
par: Su, Zhenpeng, et autres
Publié: (2024)
AR-GRPO: Training Autoregressive Image Generation Models via Reinforcement Learning
par: Yuan, Shihao, et autres
Publié: (2025)
par: Yuan, Shihao, et autres
Publié: (2025)
Scalable Multi-Objective and Meta Reinforcement Learning via Gradient Estimation
par: Zhang, Zhenshuo, et autres
Publié: (2025)
par: Zhang, Zhenshuo, et autres
Publié: (2025)
Multi-Agent Reinforcement Learning for Unmanned Aerial Vehicle Coordination by Multi-Critic Policy Gradient Optimization
par: Alon, Yoav, et autres
Publié: (2020)
par: Alon, Yoav, et autres
Publié: (2020)
RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning
par: Zhang, Hongzhi, et autres
Publié: (2025)
par: Zhang, Hongzhi, et autres
Publié: (2025)
Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR
par: Wang, Jiakang, et autres
Publié: (2025)
par: Wang, Jiakang, et autres
Publié: (2025)
Pantheon: Personalized Multi-objective Ensemble Sort via Iterative Pareto Policy Optimization
par: Cao, Jiangxia, et autres
Publié: (2025)
par: Cao, Jiangxia, et autres
Publié: (2025)
To Clip or not to Clip: the Dynamics of SGD with Gradient Clipping in High-Dimensions
par: Marshall, Noah, et autres
Publié: (2024)
par: Marshall, Noah, et autres
Publié: (2024)
HoME: Hierarchy of Multi-Gate Experts for Multi-Task Learning at Kuaishou
par: Wang, Xu, et autres
Publié: (2024)
par: Wang, Xu, et autres
Publié: (2024)
GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment
par: Lv, Minxuan, et autres
Publié: (2026)
par: Lv, Minxuan, et autres
Publié: (2026)
DCPO: Dynamic Clipping Policy Optimization
par: Yang, Shihui, et autres
Publié: (2025)
par: Yang, Shihui, et autres
Publié: (2025)
Optimized Gradient Clipping for Noisy Label Learning
par: Ye, Xichen, et autres
Publié: (2024)
par: Ye, Xichen, et autres
Publié: (2024)
An Empirical Study on the Robustness of Massively Multilingual Neural Machine Translation
par: Supryadi, et autres
Publié: (2024)
par: Supryadi, et autres
Publié: (2024)
Klear-CodeTest: Scalable Test Case Generation for Code Reinforcement Learning
par: Fu, Jia, et autres
Publié: (2025)
par: Fu, Jia, et autres
Publié: (2025)
Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective
par: Chen, Kun, et autres
Publié: (2026)
par: Chen, Kun, et autres
Publié: (2026)
Fast Explanations via Policy Gradient-Optimized Explainer
par: Pan, Deng, et autres
Publié: (2024)
par: Pan, Deng, et autres
Publié: (2024)
GTPO: Stabilizing Group Relative Policy Optimization via Gradient and Entropy Control
par: Simoni, Marco, et autres
Publié: (2025)
par: Simoni, Marco, et autres
Publié: (2025)
FIM: Frequency-Aware Multi-View Interest Modeling for Local-Life Service Recommendation
par: Wang, Guoquan, et autres
Publié: (2025)
par: Wang, Guoquan, et autres
Publié: (2025)
EPO: Entropy-regularized Policy Optimization for LLM Agents Reinforcement Learning
par: Xu, Wujiang, et autres
Publié: (2025)
par: Xu, Wujiang, et autres
Publié: (2025)
Inductive-Deductive Strategy Reuse for Multi-Turn Instructional Dialogues
par: Ou, Jiao, et autres
Publié: (2024)
par: Ou, Jiao, et autres
Publié: (2024)
ERABAL: Enhancing Role-Playing Agents through Boundary-Aware Learning
par: Tang, Yihong, et autres
Publié: (2024)
par: Tang, Yihong, et autres
Publié: (2024)
Enhancing Role-playing Systems through Aggressive Queries: Evaluation and Improvement
par: Tang, Yihong, et autres
Publié: (2024)
par: Tang, Yihong, et autres
Publié: (2024)
Efficient Privacy-Preserving Recommendation on Sparse Data using Fully Homomorphic Encryption
par: Chowdhury, Moontaha Nishat, et autres
Publié: (2025)
par: Chowdhury, Moontaha Nishat, et autres
Publié: (2025)
Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping
par: Liu, Zijian, et autres
Publié: (2024)
par: Liu, Zijian, et autres
Publié: (2024)
Clipping-Free Policy Optimization for Large Language Models
par: Çağatan, Ömer Veysel, et autres
Publié: (2026)
par: Çağatan, Ömer Veysel, et autres
Publié: (2026)
Entropy formula for surface diffeomorphisms
par: Zang, Yuntao
Publié: (2026)
par: Zang, Yuntao
Publié: (2026)
Documents similaires
-
Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization
par: Su, Zhenpeng, et autres
Publié: (2025) -
Entropy Ratio Clipping as a Soft Global Constraint for Stable Reinforcement Learning
par: Su, Zhenpeng, et autres
Publié: (2025) -
Good Reasoning Makes Good Demonstrations: Implicit Reasoning Quality Supervision via In-Context Reinforcement Learning
par: Mei, Tiehua, et autres
Publié: (2026) -
Agentic Entropy-Balanced Policy Optimization
par: Dong, Guanting, et autres
Publié: (2025) -
DSMoE: Matrix-Partitioned Experts with Dynamic Routing for Computation-Efficient Dense LLMs
par: Lv, Minxuan, et autres
Publié: (2025)