GPG: A Simple and Strong Reinforcement Learning Baseline for Model Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chu, Xiangxiang, Huang, Hailang, Zhang, Xiao, Wei, Fei, Wang, Yong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
AdaCuRL: Adaptive Curriculum Reinforcement Learning with Invalid Sample Mitigation and Historical Revisiting
von: Li, Renda, et al.
Veröffentlicht: (2025)
von: Li, Renda, et al.
Veröffentlicht: (2025)
Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models
von: Yang, Shidong, et al.
Veröffentlicht: (2026)
von: Yang, Shidong, et al.
Veröffentlicht: (2026)
Tree Search for LLM Agent Reinforcement Learning
von: Ji, Yuxiang, et al.
Veröffentlicht: (2025)
von: Ji, Yuxiang, et al.
Veröffentlicht: (2025)
MMGenBench: Fully Automatically Evaluating LMMs from the Text-to-Image Generation Perspective
von: Huang, Hailang, et al.
Veröffentlicht: (2024)
von: Huang, Hailang, et al.
Veröffentlicht: (2024)
No Mean Feat: Simple, Strong Baselines for Context Compression
von: Feldman, Yair, et al.
Veröffentlicht: (2025)
von: Feldman, Yair, et al.
Veröffentlicht: (2025)
Ranking-aware Reinforcement Learning for Ordinal Ranking
von: Hao, Aiming, et al.
Veröffentlicht: (2026)
von: Hao, Aiming, et al.
Veröffentlicht: (2026)
GPG: Generalized Policy Gradient Theorem for Transformer-based Policies
von: Mao, Hangyu, et al.
Veröffentlicht: (2025)
von: Mao, Hangyu, et al.
Veröffentlicht: (2025)
A Strong Baseline for Molecular Few-Shot Learning
von: Formont, Philippe, et al.
Veröffentlicht: (2024)
von: Formont, Philippe, et al.
Veröffentlicht: (2024)
D$^2$Evo: Dual Difficulty-Aware Self-Evolution for Data-Efficient Reinforcement Learning
von: Zhang, Ru, et al.
Veröffentlicht: (2026)
von: Zhang, Ru, et al.
Veröffentlicht: (2026)
Simple Baselines are Competitive with Code Evolution
von: Gideoni, Yonatan, et al.
Veröffentlicht: (2026)
von: Gideoni, Yonatan, et al.
Veröffentlicht: (2026)
HS-STaR: Hierarchical Sampling for Self-Taught Reasoners via Difficulty Estimation and Budget Reallocation
von: Xiong, Feng, et al.
Veröffentlicht: (2025)
von: Xiong, Feng, et al.
Veröffentlicht: (2025)
VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning
von: Wang, Haozhe, et al.
Veröffentlicht: (2025)
von: Wang, Haozhe, et al.
Veröffentlicht: (2025)
MolMix: A Simple Yet Effective Baseline for Multimodal Molecular Representation Learning
von: Manolache, Andrei, et al.
Veröffentlicht: (2024)
von: Manolache, Andrei, et al.
Veröffentlicht: (2024)
EFRame: Deeper Reasoning via Exploration-Filter-Replay Reinforcement Learning Framework
von: Wang, Chen, et al.
Veröffentlicht: (2025)
von: Wang, Chen, et al.
Veröffentlicht: (2025)
Hedging Is Not All You Need: A Simple Baseline for Online Learning Under Haphazard Inputs
von: Buckchash, Himanshu, et al.
Veröffentlicht: (2024)
von: Buckchash, Himanshu, et al.
Veröffentlicht: (2024)
SPA: A Simple but Tough-to-Beat Baseline for Knowledge Injection
von: Tang, Kexian, et al.
Veröffentlicht: (2026)
von: Tang, Kexian, et al.
Veröffentlicht: (2026)
WST: Weak-to-Strong Knowledge Transfer via Reinforcement Learning
von: Ge, Haosen, et al.
Veröffentlicht: (2025)
von: Ge, Haosen, et al.
Veröffentlicht: (2025)
Regularized Latent Dynamics Prediction is a Strong Baseline For Behavioral Foundation Models
von: Jajoo, Pranaya, et al.
Veröffentlicht: (2026)
von: Jajoo, Pranaya, et al.
Veröffentlicht: (2026)
Simple Ingredients for Offline Reinforcement Learning
von: Cetin, Edoardo, et al.
Veröffentlicht: (2024)
von: Cetin, Edoardo, et al.
Veröffentlicht: (2024)
An Embarrassingly Simple Baseline for Imbalanced Semi-Supervised Learning
von: Chen, Hao, et al.
Veröffentlicht: (2022)
von: Chen, Hao, et al.
Veröffentlicht: (2022)
Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
von: Jin, Renren, et al.
Veröffentlicht: (2025)
von: Jin, Renren, et al.
Veröffentlicht: (2025)
Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective
von: Kong, Deyang, et al.
Veröffentlicht: (2025)
von: Kong, Deyang, et al.
Veröffentlicht: (2025)
A Simple Unified Uncertainty-Guided Framework for Offline-to-Online Reinforcement Learning
von: Guo, Siyuan, et al.
Veröffentlicht: (2023)
von: Guo, Siyuan, et al.
Veröffentlicht: (2023)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)
Mol-Debate: Multi-Agent Debate Improves Structural Reasoning in Molecular Design
von: Zhang, Wengyu, et al.
Veröffentlicht: (2026)
von: Zhang, Wengyu, et al.
Veröffentlicht: (2026)
Multi-Path Collaborative Reasoning via Reinforcement Learning
von: Lv, Jindi, et al.
Veröffentlicht: (2025)
von: Lv, Jindi, et al.
Veröffentlicht: (2025)
Preference Alignment for Diffusion Model via Explicit Denoised Distribution Estimation
von: Shi, Dingyuan, et al.
Veröffentlicht: (2024)
von: Shi, Dingyuan, et al.
Veröffentlicht: (2024)
Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One
von: Song, Yiwen, et al.
Veröffentlicht: (2025)
von: Song, Yiwen, et al.
Veröffentlicht: (2025)
SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild
von: Zeng, Weihao, et al.
Veröffentlicht: (2025)
von: Zeng, Weihao, et al.
Veröffentlicht: (2025)
ADORA: Training Reasoning Models with Dynamic Advantage Estimation on Reinforcement Learning
von: Ren, Qingnan, et al.
Veröffentlicht: (2026)
von: Ren, Qingnan, et al.
Veröffentlicht: (2026)
Mitigating Overthinking in Large Reasoning Models via Difficulty-aware Reinforcement Learning
von: Wan, Qian, et al.
Veröffentlicht: (2026)
von: Wan, Qian, et al.
Veröffentlicht: (2026)
Diffusion Models for Reinforcement Learning: Foundations, Taxonomy, and Development
von: Xu, Changfu, et al.
Veröffentlicht: (2025)
von: Xu, Changfu, et al.
Veröffentlicht: (2025)
HardSATGEN: Understanding the Difficulty of Hard SAT Formula Generation and A Strong Structure-Hardness-Aware Baseline
von: Li, Yang, et al.
Veröffentlicht: (2023)
von: Li, Yang, et al.
Veröffentlicht: (2023)
Latent-Space Contrastive Reinforcement Learning for Stable and Efficient LLM Reasoning
von: Shan, Lianlei, et al.
Veröffentlicht: (2026)
von: Shan, Lianlei, et al.
Veröffentlicht: (2026)
A Case Study of Selected PTQ Baselines for Reasoning LLMs on Ascend NPU
von: Luo, Yuchen, et al.
Veröffentlicht: (2026)
von: Luo, Yuchen, et al.
Veröffentlicht: (2026)
Reward Models in Deep Reinforcement Learning: A Survey
von: Yu, Rui, et al.
Veröffentlicht: (2025)
von: Yu, Rui, et al.
Veröffentlicht: (2025)
TableGPT-R1: Advancing Tabular Reasoning Through Reinforcement Learning
von: Yang, Saisai, et al.
Veröffentlicht: (2025)
von: Yang, Saisai, et al.
Veröffentlicht: (2025)
HER: Human-like Reasoning and Reinforcement Learning for LLM Role-playing
von: Du, Chengyu, et al.
Veröffentlicht: (2026)
von: Du, Chengyu, et al.
Veröffentlicht: (2026)
Boosting Reinforcement Learning with Strongly Delayed Feedback Through Auxiliary Short Delays
von: Wu, Qingyuan, et al.
Veröffentlicht: (2024)
von: Wu, Qingyuan, et al.
Veröffentlicht: (2024)
Spatiotemporal Forecasting as Planning: A Model-Based Reinforcement Learning Approach with Generative World Models
von: Wu, Hao, et al.
Veröffentlicht: (2025)
von: Wu, Hao, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
AdaCuRL: Adaptive Curriculum Reinforcement Learning with Invalid Sample Mitigation and Historical Revisiting
von: Li, Renda, et al.
Veröffentlicht: (2025) -
Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models
von: Yang, Shidong, et al.
Veröffentlicht: (2026) -
Tree Search for LLM Agent Reinforcement Learning
von: Ji, Yuxiang, et al.
Veröffentlicht: (2025) -
MMGenBench: Fully Automatically Evaluating LMMs from the Text-to-Image Generation Perspective
von: Huang, Hailang, et al.
Veröffentlicht: (2024) -
No Mean Feat: Simple, Strong Baselines for Context Compression
von: Feldman, Yair, et al.
Veröffentlicht: (2025)