Multi-Layer GRPO: Enhancing Reasoning and Self-Correction in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Ding, Fei, Wang, Baiqiao, Zeng, Zijian, Wang, Youwei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
di: Ding, Fei, et al.
Pubblicazione: (2026)
di: Ding, Fei, et al.
Pubblicazione: (2026)
Transformation-Augmented GRPO for Enhancing Exploration in Reasoning of Large Language Models
di: Le, Khiem, et al.
Pubblicazione: (2026)
di: Le, Khiem, et al.
Pubblicazione: (2026)
Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning
di: Wang, Hu, et al.
Pubblicazione: (2025)
di: Wang, Hu, et al.
Pubblicazione: (2025)
HELM: Harness-Enhanced Long-horizon Memory for Vision-Language-Action Manipulation
di: Zeng, Zijian, et al.
Pubblicazione: (2026)
di: Zeng, Zijian, et al.
Pubblicazione: (2026)
Improved Supervised Fine-Tuning for Large Language Models to Mitigate Catastrophic Forgetting
di: Ding, Fei, et al.
Pubblicazione: (2025)
di: Ding, Fei, et al.
Pubblicazione: (2025)
Layer as Puzzle Pieces: Compressing Large Language Models through Layer Concatenation
di: Wang, Fei, et al.
Pubblicazione: (2025)
di: Wang, Fei, et al.
Pubblicazione: (2025)
Beyond Correctness: Confidence-Aware Reward Modeling for Enhancing Large Language Model Reasoning
di: He, Qianxi, et al.
Pubblicazione: (2025)
di: He, Qianxi, et al.
Pubblicazione: (2025)
DRA-GRPO: Your GRPO Needs to Know Diverse Reasoning Paths for Mathematical Reasoning
di: Chen, Xiwen, et al.
Pubblicazione: (2025)
di: Chen, Xiwen, et al.
Pubblicazione: (2025)
Predictive Scaling Laws for Efficient GRPO Training of Large Reasoning Models
di: Nimmaturi, Datta, et al.
Pubblicazione: (2025)
di: Nimmaturi, Datta, et al.
Pubblicazione: (2025)
Sherlock: Self-Correcting Reasoning in Vision-Language Models
di: Ding, Yi, et al.
Pubblicazione: (2025)
di: Ding, Yi, et al.
Pubblicazione: (2025)
Advancing Multi-Step Mathematical Reasoning in Large Language Models through Multi-Layered Self-Reflection with Auto-Prompting
di: Loureiro, André de Souza, et al.
Pubblicazione: (2025)
di: Loureiro, André de Souza, et al.
Pubblicazione: (2025)
Confidence Geometry Reveals Trace-Level Correctness in Large Language Model Reasoning
di: Liu, Shuo, et al.
Pubblicazione: (2026)
di: Liu, Shuo, et al.
Pubblicazione: (2026)
Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2026)
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2026)
On the Convergence of Moral Self-Correction in Large Language Models
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
GRPO++: Enhancing Dermatological Reasoning under Low Resource Settings
di: Swapnil, Ismam Nur, et al.
Pubblicazione: (2025)
di: Swapnil, Ismam Nur, et al.
Pubblicazione: (2025)
FunReason: Enhancing Large Language Models' Function Calling via Self-Refinement Multiscale Loss and Automated Data Refinement
di: Hao, Bingguang, et al.
Pubblicazione: (2025)
di: Hao, Bingguang, et al.
Pubblicazione: (2025)
LayerIF: Estimating Layer Quality for Large Language Models using Influence Functions
di: Askari, Hadi, et al.
Pubblicazione: (2025)
di: Askari, Hadi, et al.
Pubblicazione: (2025)
From Reasoning to Code: GRPO Optimization for Underrepresented Languages
di: Pennino, Federico, et al.
Pubblicazione: (2025)
di: Pennino, Federico, et al.
Pubblicazione: (2025)
Enhancing Spatial Reasoning in Large Language Models for Metal-Organic Frameworks Structure Prediction
di: Pan, Mianzhi, et al.
Pubblicazione: (2026)
di: Pan, Mianzhi, et al.
Pubblicazione: (2026)
TreeGRPO: Tree-Advantage GRPO for Online RL Post-Training of Diffusion Models
di: Ding, Zheng, et al.
Pubblicazione: (2025)
di: Ding, Zheng, et al.
Pubblicazione: (2025)
DGLight: DQN-Guided GRPO Fine-Tuning of Large Language Models for Traffic Signal Control
di: Yu, Chenbo
Pubblicazione: (2026)
di: Yu, Chenbo
Pubblicazione: (2026)
DexSim2Real: Foundation Model-Guided Sim-to-Real Transfer for Generalizable Dexterous Manipulation
di: Zeng, Zijian, et al.
Pubblicazione: (2026)
di: Zeng, Zijian, et al.
Pubblicazione: (2026)
ExGRPO: Learning to Reason from Experience
di: Zhan, Runzhe, et al.
Pubblicazione: (2025)
di: Zhan, Runzhe, et al.
Pubblicazione: (2025)
GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning
di: Wang, Jingyi, et al.
Pubblicazione: (2026)
di: Wang, Jingyi, et al.
Pubblicazione: (2026)
S-GRPO: Early Exit via Reinforcement Learning in Reasoning Models
di: Dai, Muzhi, et al.
Pubblicazione: (2025)
di: Dai, Muzhi, et al.
Pubblicazione: (2025)
On the Limits of Layer Pruning for Generative Reasoning in Large Language Models
di: Shrestha, Safal, et al.
Pubblicazione: (2026)
di: Shrestha, Safal, et al.
Pubblicazione: (2026)
ES-dLLM: Efficient Inference for Diffusion Large Language Models by Early-Skipping
di: Zhu, Zijian, et al.
Pubblicazione: (2026)
di: Zhu, Zijian, et al.
Pubblicazione: (2026)
S-GRPO: Unified Post-Training for Large Vision-Language Models
di: Yan, Yuming, et al.
Pubblicazione: (2026)
di: Yan, Yuming, et al.
Pubblicazione: (2026)
Design Conditions for Intra-Group Learning of Sequence-Level Rewards: Token Gradient Cancellation
di: Ding, Fei, et al.
Pubblicazione: (2026)
di: Ding, Fei, et al.
Pubblicazione: (2026)
Token-Specific Watermarking with Enhanced Detectability and Semantic Coherence for Large Language Models
di: Huo, Mingjia, et al.
Pubblicazione: (2024)
di: Huo, Mingjia, et al.
Pubblicazione: (2024)
Reinforcement Inference: Leveraging Uncertainty for Self-Correcting Language Model Reasoning
di: Sun, Xinhai
Pubblicazione: (2026)
di: Sun, Xinhai
Pubblicazione: (2026)
LithoGRPO: Fast Inverse Lithography via GRPO Reinforced Flow Matching
di: Lai, Yao, et al.
Pubblicazione: (2026)
di: Lai, Yao, et al.
Pubblicazione: (2026)
FairGRPO: Fair Reinforcement Learning for Equitable Clinical Reasoning
di: Dai, Shiqi, et al.
Pubblicazione: (2025)
di: Dai, Shiqi, et al.
Pubblicazione: (2025)
ProgCo: Program Helps Self-Correction of Large Language Models
di: Song, Xiaoshuai, et al.
Pubblicazione: (2025)
di: Song, Xiaoshuai, et al.
Pubblicazione: (2025)
Graph-GRPO: Training Graph Flow Models with Reinforcement Learning
di: Zhu, Baoheng, et al.
Pubblicazione: (2026)
di: Zhu, Baoheng, et al.
Pubblicazione: (2026)
Mitigating Selection Bias in Large Language Models via Permutation-Aware GRPO
di: Zheng, Jinquan, et al.
Pubblicazione: (2026)
di: Zheng, Jinquan, et al.
Pubblicazione: (2026)
Self-Training Large Language Models with Confident Reasoning
di: Jang, Hyosoon, et al.
Pubblicazione: (2025)
di: Jang, Hyosoon, et al.
Pubblicazione: (2025)
Self-Evolving Critique Abilities in Large Language Models
di: Tang, Zhengyang, et al.
Pubblicazione: (2025)
di: Tang, Zhengyang, et al.
Pubblicazione: (2025)
Large Language Model-Enhanced Multi-Armed Bandits
di: Sun, Jiahang, et al.
Pubblicazione: (2025)
di: Sun, Jiahang, et al.
Pubblicazione: (2025)
Plan and Budget: Effective and Efficient Test-Time Scaling on Reasoning Large Language Models
di: Lin, Junhong, et al.
Pubblicazione: (2025)
di: Lin, Junhong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
di: Ding, Fei, et al.
Pubblicazione: (2026) -
Transformation-Augmented GRPO for Enhancing Exploration in Reasoning of Large Language Models
di: Le, Khiem, et al.
Pubblicazione: (2026) -
Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning
di: Wang, Hu, et al.
Pubblicazione: (2025) -
HELM: Harness-Enhanced Long-horizon Memory for Vision-Language-Action Manipulation
di: Zeng, Zijian, et al.
Pubblicazione: (2026) -
Improved Supervised Fine-Tuning for Large Language Models to Mitigate Catastrophic Forgetting
di: Ding, Fei, et al.
Pubblicazione: (2025)