DaGRPO: Rectifying Gradient Conflict in Reasoning via Distinctiveness-Aware Group Relative Policy Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xie, Xuan, Wang, Xuan, Wang, Wenjie, Chen, Shuai, Lin, Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization
par: Chen, Minghan, et autres
Publié: (2025)
par: Chen, Minghan, et autres
Publié: (2025)
GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning
par: Wang, Jingyi, et autres
Publié: (2026)
par: Wang, Jingyi, et autres
Publié: (2026)
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
par: Zhang, Xichen, et autres
Publié: (2025)
par: Zhang, Xichen, et autres
Publié: (2025)
IB-GRPO: Aligning LLM-based Learning Path Recommendation with Educational Objectives via Indicator-Based Group Relative Policy Optimization
par: Wang, Shuai, et autres
Publié: (2026)
par: Wang, Shuai, et autres
Publié: (2026)
AceGRPO: Adaptive Curriculum Enhanced Group Relative Policy Optimization for Autonomous Machine Learning Engineering
par: Cai, Yuzhu, et autres
Publié: (2026)
par: Cai, Yuzhu, et autres
Publié: (2026)
Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model
par: Zhou, Renping, et autres
Publié: (2025)
par: Zhou, Renping, et autres
Publié: (2025)
CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models
par: Lin, Zhihang, et autres
Publié: (2025)
par: Lin, Zhihang, et autres
Publié: (2025)
SPREG: Structured Plan Repair with Entropy-Guided Test-Time Intervention for Large Language Model Reasoning
par: Wang, Xuan, et autres
Publié: (2026)
par: Wang, Xuan, et autres
Publié: (2026)
Grounding Multi-Hop Reasoning in Structural Causal Models via Group Relative Policy Optimization
par: Bu, Yunhan, et autres
Publié: (2026)
par: Bu, Yunhan, et autres
Publié: (2026)
Stepwise Guided Policy Optimization: Coloring your Incorrect Reasoning in GRPO
par: Chen, Peter, et autres
Publié: (2025)
par: Chen, Peter, et autres
Publié: (2025)
MC-GRPO: Median-Centered Group Relative Policy Optimization for Small-Rollout Reinforcement Learning
par: Kim, Youngeun
Publié: (2026)
par: Kim, Youngeun
Publié: (2026)
EP-GRPO: Entropy-Progress Aligned Group Relative Policy Optimization with Implicit Process Guidance
par: Yu, Song, et autres
Publié: (2026)
par: Yu, Song, et autres
Publié: (2026)
GRAPH-GRPO-LEX: Contract Graph Modeling and Reinforcement Learning with Group Relative Policy Optimization
par: Dechtiar, Moriya, et autres
Publié: (2025)
par: Dechtiar, Moriya, et autres
Publié: (2025)
RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents
par: Zhong, Haitian, et autres
Publié: (2026)
par: Zhong, Haitian, et autres
Publié: (2026)
Diagnosing Live Within-Policy Instruction Conflicts in LLM Agents with Witnessed Resolution Profiles
par: Yan, Lu, et autres
Publié: (2026)
par: Yan, Lu, et autres
Publié: (2026)
M$^{2}$GRPO: Mamba-based Multi-Agent Group Relative Policy Optimization for Biomimetic Underwater Robots Pursuit
par: Feng, Yukai, et autres
Publié: (2026)
par: Feng, Yukai, et autres
Publié: (2026)
Step-GRPO: Internalizing Dynamic Early Exit for Efficient Reasoning
par: Chen, Benteng, et autres
Publié: (2026)
par: Chen, Benteng, et autres
Publié: (2026)
J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization
par: Xu, Austin, et autres
Publié: (2025)
par: Xu, Austin, et autres
Publié: (2025)
VoiceGRPO: Modern MoE Transformers with Group Relative Policy Optimization GRPO for AI Voice Health Care Applications on Voice Pathology Detection
par: Togootogtokh, Enkhtogtokh, et autres
Publié: (2025)
par: Togootogtokh, Enkhtogtokh, et autres
Publié: (2025)
GTPO: Stabilizing Group Relative Policy Optimization via Gradient and Entropy Control
par: Simoni, Marco, et autres
Publié: (2025)
par: Simoni, Marco, et autres
Publié: (2025)
Reference-guided Policy Optimization for Molecular Optimization via LLM Reasoning
par: Li, Xuan, et autres
Publié: (2026)
par: Li, Xuan, et autres
Publié: (2026)
NGRPO: Negative-enhanced Group Relative Policy Optimization
par: Nan, Gongrui, et autres
Publié: (2025)
par: Nan, Gongrui, et autres
Publié: (2025)
Bridging Social Psychology and LLM Reasoning: Conflict-Aware Meta-Review Generation via Cognitive Alignment
par: Chen, Wei, et autres
Publié: (2025)
par: Chen, Wei, et autres
Publié: (2025)
Chart Deep Research in LVLMs via Parallel Relative Policy Optimization
par: Tang, Jiajin, et autres
Publié: (2026)
par: Tang, Jiajin, et autres
Publié: (2026)
Improving LLM Reasoning for Vulnerability Detection via Group Relative Policy Optimization
par: Simoni, Marco, et autres
Publié: (2025)
par: Simoni, Marco, et autres
Publié: (2025)
Optimizing Anytime Reasoning via Budget Relative Policy Optimization
par: Qi, Penghui, et autres
Publié: (2025)
par: Qi, Penghui, et autres
Publié: (2025)
Group-Relative REINFORCE Is Secretly an Off-Policy Algorithm: Demystifying Some Myths About GRPO and Its Friends
par: Yao, Chaorui, et autres
Publié: (2025)
par: Yao, Chaorui, et autres
Publié: (2025)
ProRL: Effective Reinforcement Learning for Proactive Recommendation via Rectified Policy Gradient Estimation
par: Hou, Hongru, et autres
Publié: (2026)
par: Hou, Hongru, et autres
Publié: (2026)
DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO
par: Liu, Henglin, et autres
Publié: (2025)
par: Liu, Henglin, et autres
Publié: (2025)
GRPO and Reflection Reward for Mathematical Reasoning in Large Language Models
par: Wang, Zhijie
Publié: (2026)
par: Wang, Zhijie
Publié: (2026)
GRACE: Gradient-aligned Reasoning Data Curation for Efficient Post-training
par: Li, Junjie, et autres
Publié: (2026)
par: Li, Junjie, et autres
Publié: (2026)
M$^3$-ACE: Rectifying Visual Perception in Multimodal Math Reasoning via Multi-Agentic Context Engineering
par: Xie, Peijin, et autres
Publié: (2026)
par: Xie, Peijin, et autres
Publié: (2026)
Harder Is Better: Boosting Mathematical Reasoning via Difficulty-Aware GRPO and Multi-Aspect Question Reformulation
par: Dai, Yanqi, et autres
Publié: (2026)
par: Dai, Yanqi, et autres
Publié: (2026)
Group-Aware Coordination Graph for Multi-Agent Reinforcement Learning
par: Duan, Wei, et autres
Publié: (2024)
par: Duan, Wei, et autres
Publié: (2024)
Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization
par: Kancheti, Sai Srinivas, et autres
Publié: (2026)
par: Kancheti, Sai Srinivas, et autres
Publié: (2026)
Leveraging Group Relative Policy Optimization to Advance Large Language Models in Traditional Chinese Medicine
par: Xie, Jiacheng, et autres
Publié: (2025)
par: Xie, Jiacheng, et autres
Publié: (2025)
Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO
par: Ren, Yiming, et autres
Publié: (2026)
par: Ren, Yiming, et autres
Publié: (2026)
Calibration-Aware Policy Optimization for Reasoning LLMs
par: Wang, Ziqi, et autres
Publié: (2026)
par: Wang, Ziqi, et autres
Publié: (2026)
GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy
par: Tan, Hongze, et autres
Publié: (2025)
par: Tan, Hongze, et autres
Publié: (2025)
GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
par: Chen, Yi, et autres
Publié: (2025)
par: Chen, Yi, et autres
Publié: (2025)
Documents similaires
-
SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization
par: Chen, Minghan, et autres
Publié: (2025) -
GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning
par: Wang, Jingyi, et autres
Publié: (2026) -
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
par: Zhang, Xichen, et autres
Publié: (2025) -
IB-GRPO: Aligning LLM-based Learning Path Recommendation with Educational Objectives via Indicator-Based Group Relative Policy Optimization
par: Wang, Shuai, et autres
Publié: (2026) -
AceGRPO: Adaptive Curriculum Enhanced Group Relative Policy Optimization for Autonomous Machine Learning Engineering
par: Cai, Yuzhu, et autres
Publié: (2026)