GTPO: Stabilizing Group Relative Policy Optimization via Gradient and Entropy Control
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Simoni, Marco, Fontana, Aleksandar, Rossolini, Giulio, Saracino, Andrea, Mori, Paolo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
On the Hidden Objective Biases of Group-based Reinforcement Learning
par: Fontana, Aleksandar, et autres
Publié: (2026)
par: Fontana, Aleksandar, et autres
Publié: (2026)
Improving LLM Reasoning for Vulnerability Detection via Group Relative Policy Optimization
par: Simoni, Marco, et autres
Publié: (2025)
par: Simoni, Marco, et autres
Publié: (2025)
TITAN: Graph-Executable Reasoning for Cyber Threat Intelligence
par: Simoni, Marco, et autres
Publié: (2025)
par: Simoni, Marco, et autres
Publié: (2025)
KGQuest: Template-Driven QA Generation from Knowledge Graphs with LLM-Based Refinement
par: Nayab, Sania, et autres
Publié: (2025)
par: Nayab, Sania, et autres
Publié: (2025)
Concise Thoughts: Impact of Output Length on LLM Reasoning and Cost
par: Nayab, Sania, et autres
Publié: (2024)
par: Nayab, Sania, et autres
Publié: (2024)
How Worst-Case Are Adversarial Attacks? Linking Adversarial and Perturbation Robustness
par: Rossolini, Giulio
Publié: (2026)
par: Rossolini, Giulio
Publié: (2026)
Leveraging Knowledge Graphs and LLMs for Structured Generation of Misinformation
par: Nayab, Sania, et autres
Publié: (2025)
par: Nayab, Sania, et autres
Publié: (2025)
EBPO: Empirical Bayes Shrinkage for Stabilizing Group-Relative Policy Optimization
par: Han, Kevin, et autres
Publié: (2026)
par: Han, Kevin, et autres
Publié: (2026)
GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy
par: Tan, Hongze, et autres
Publié: (2025)
par: Tan, Hongze, et autres
Publié: (2025)
Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment
par: Wang, Jialu, et autres
Publié: (2026)
par: Wang, Jialu, et autres
Publié: (2026)
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
par: Zhang, Xichen, et autres
Publié: (2025)
par: Zhang, Xichen, et autres
Publié: (2025)
Optimizing Anytime Reasoning via Budget Relative Policy Optimization
par: Qi, Penghui, et autres
Publié: (2025)
par: Qi, Penghui, et autres
Publié: (2025)
Increasing the Confidence of Deep Neural Networks by Coverage Analysis
par: Rossolini, Giulio, et autres
Publié: (2021)
par: Rossolini, Giulio, et autres
Publié: (2021)
Group Sequence Policy Optimization
par: Zheng, Chujie, et autres
Publié: (2025)
par: Zheng, Chujie, et autres
Publié: (2025)
Leveraging Group Relative Policy Optimization to Advance Large Language Models in Traditional Chinese Medicine
par: Xie, Jiacheng, et autres
Publié: (2025)
par: Xie, Jiacheng, et autres
Publié: (2025)
Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective
par: Chen, Kun, et autres
Publié: (2026)
par: Chen, Kun, et autres
Publié: (2026)
Entropy Controllable Direct Preference Optimization
par: Omura, Motoki, et autres
Publié: (2024)
par: Omura, Motoki, et autres
Publié: (2024)
Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization
par: Su, Zhenpeng, et autres
Publié: (2025)
par: Su, Zhenpeng, et autres
Publié: (2025)
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
Agentic Entropy-Balanced Policy Optimization
par: Dong, Guanting, et autres
Publié: (2025)
par: Dong, Guanting, et autres
Publié: (2025)
Interpreting and Controlling LLM Reasoning through Integrated Policy Gradient
par: Li, Changming, et autres
Publié: (2026)
par: Li, Changming, et autres
Publié: (2026)
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
par: Liu, Shih-Yang, et autres
Publié: (2026)
par: Liu, Shih-Yang, et autres
Publié: (2026)
C$^2$GSPG: Confidence-calibrated Group Sequence Policy Gradient towards Self-aware Reasoning
par: Liu, Haotian, et autres
Publié: (2025)
par: Liu, Haotian, et autres
Publié: (2025)
PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization
par: Rahman, Ben
Publié: (2025)
par: Rahman, Ben
Publié: (2025)
EP-GRPO: Entropy-Progress Aligned Group Relative Policy Optimization with Implicit Process Guidance
par: Yu, Song, et autres
Publié: (2026)
par: Yu, Song, et autres
Publié: (2026)
GRAPH-GRPO-LEX: Contract Graph Modeling and Reinforcement Learning with Group Relative Policy Optimization
par: Dechtiar, Moriya, et autres
Publié: (2025)
par: Dechtiar, Moriya, et autres
Publié: (2025)
Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models
par: Li, Chengao, et autres
Publié: (2025)
par: Li, Chengao, et autres
Publié: (2025)
Agentic Policy Optimization via Instruction-Policy Co-Evolution
par: Zhou, Han, et autres
Publié: (2025)
par: Zhou, Han, et autres
Publié: (2025)
Regressing the Relative Future: Efficient Policy Optimization for Multi-turn RLHF
par: Gao, Zhaolin, et autres
Publié: (2024)
par: Gao, Zhaolin, et autres
Publié: (2024)
GPG: Generalized Policy Gradient Theorem for Transformer-based Policies
par: Mao, Hangyu, et autres
Publié: (2025)
par: Mao, Hangyu, et autres
Publié: (2025)
Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
par: Ding, Yifeng, et autres
Publié: (2025)
par: Ding, Yifeng, et autres
Publié: (2025)
HTPO: Towards Exploration-Exploitation Balanced Policy Optimization via Hierarchical Token-level Objective Control
par: Yao, Xincheng, et autres
Publié: (2026)
par: Yao, Xincheng, et autres
Publié: (2026)
Exploiting Edge Features for Transferable Adversarial Attacks in Distributed Machine Learning
par: Rossolini, Giulio, et autres
Publié: (2025)
par: Rossolini, Giulio, et autres
Publié: (2025)
Group-Relative REINFORCE Is Secretly an Off-Policy Algorithm: Demystifying Some Myths About GRPO and Its Friends
par: Yao, Chaorui, et autres
Publié: (2025)
par: Yao, Chaorui, et autres
Publié: (2025)
Optimize Weight Rounding via Signed Gradient Descent for the Quantization of LLMs
par: Cheng, Wenhua, et autres
Publié: (2023)
par: Cheng, Wenhua, et autres
Publié: (2023)
Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space
par: Li, Hengli, et autres
Publié: (2025)
par: Li, Hengli, et autres
Publié: (2025)
Simple Policy Gradients for Reasoning with Diffusion Language Models
par: Zhan, Anthony
Publié: (2025)
par: Zhan, Anthony
Publié: (2025)
Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing
par: Li, Gengsheng, et autres
Publié: (2026)
par: Li, Gengsheng, et autres
Publié: (2026)
NGRPO: Negative-enhanced Group Relative Policy Optimization
par: Nan, Gongrui, et autres
Publié: (2025)
par: Nan, Gongrui, et autres
Publié: (2025)
Fine-Tuning Discrete Diffusion Models with Policy Gradient Methods
par: Zekri, Oussama, et autres
Publié: (2025)
par: Zekri, Oussama, et autres
Publié: (2025)
Documents similaires
-
On the Hidden Objective Biases of Group-based Reinforcement Learning
par: Fontana, Aleksandar, et autres
Publié: (2026) -
Improving LLM Reasoning for Vulnerability Detection via Group Relative Policy Optimization
par: Simoni, Marco, et autres
Publié: (2025) -
TITAN: Graph-Executable Reasoning for Cyber Threat Intelligence
par: Simoni, Marco, et autres
Publié: (2025) -
KGQuest: Template-Driven QA Generation from Knowledge Graphs with LLM-Based Refinement
par: Nayab, Sania, et autres
Publié: (2025) -
Concise Thoughts: Impact of Output Length on LLM Reasoning and Cost
par: Nayab, Sania, et autres
Publié: (2024)