What is the Alignment Objective of GRPO?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Vojnovic, Milan, Yun, Se-Young |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
An Adaptive Approach for Infinitely Many-armed Bandits under Generalized Rotting Constraints
par: Kim, Jung-hun, et autres
Publié: (2024)
par: Kim, Jung-hun, et autres
Publié: (2024)
Temporal Alignment Guidance: On-Manifold Sampling in Diffusion Models
par: Park, Youngrok, et autres
Publié: (2025)
par: Park, Youngrok, et autres
Publié: (2025)
On the Convergence of Loss and Uncertainty-based Active Learning Algorithms
par: Haimovich, Daniel, et autres
Publié: (2023)
par: Haimovich, Daniel, et autres
Publié: (2023)
Improving Visual Representation Alignment Generation with GRPO
par: Mo, Shentong, et autres
Publié: (2026)
par: Mo, Shentong, et autres
Publié: (2026)
What Is the Alignment Tax?
par: Young, Robin
Publié: (2026)
par: Young, Robin
Publié: (2026)
AMIR-GRPO: Inducing Implicit Preference Signals into GRPO
par: Yari, Amir Hossein, et autres
Publié: (2026)
par: Yari, Amir Hossein, et autres
Publié: (2026)
GL-LowPopArt: A Nearly Instance-Wise Minimax-Optimal Estimator for Generalized Low-Rank Trace Regression
par: Lee, Junghyun, et autres
Publié: (2025)
par: Lee, Junghyun, et autres
Publié: (2025)
LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation
par: Mo, Shentong, et autres
Publié: (2026)
par: Mo, Shentong, et autres
Publié: (2026)
Predicting LLM Reasoning Performance with Small Proxy Model
par: Koh, Woosung, et autres
Publié: (2025)
par: Koh, Woosung, et autres
Publié: (2025)
IB-GRPO: Aligning LLM-based Learning Path Recommendation with Educational Objectives via Indicator-Based Group Relative Policy Optimization
par: Wang, Shuai, et autres
Publié: (2026)
par: Wang, Shuai, et autres
Publié: (2026)
DistiLLM: Towards Streamlined Distillation for Large Language Models
par: Ko, Jongwoo, et autres
Publié: (2024)
par: Ko, Jongwoo, et autres
Publié: (2024)
Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness
par: Yang, Yongjin, et autres
Publié: (2025)
par: Yang, Yongjin, et autres
Publié: (2025)
Automated Skill Discovery for Language Agents through Exploration and Iterative Feedback
par: Yang, Yongjin, et autres
Publié: (2025)
par: Yang, Yongjin, et autres
Publié: (2025)
GRPO is Secretly a Process Reward Model
par: Sullivan, Michael, et autres
Publié: (2025)
par: Sullivan, Michael, et autres
Publié: (2025)
Reward-free Alignment for Conflicting Objectives
par: Chen, Peter, et autres
Publié: (2026)
par: Chen, Peter, et autres
Publié: (2026)
Property-driven Protein Inverse Folding With Multi-Objective Preference Alignment
par: Hou, Xiaoyang, et autres
Publié: (2026)
par: Hou, Xiaoyang, et autres
Publié: (2026)
Uncalibrated Reasoning: GRPO Induces Overconfidence for Stochastic Outcomes
par: Bereket, Michael, et autres
Publié: (2025)
par: Bereket, Michael, et autres
Publié: (2025)
GRPO-$λ$: Credit Assignment improves LLM Reasoning
par: Parthasarathi, Prasanna, et autres
Publié: (2025)
par: Parthasarathi, Prasanna, et autres
Publié: (2025)
C-MORAL: Controllable Multi-Objective Molecular Optimization with Reinforcement Alignment for LLMs
par: Gao, Rui, et autres
Publié: (2026)
par: Gao, Rui, et autres
Publié: (2026)
Meta-Aligner: Bidirectional Preference-Policy Optimization for Multi-Objective LLMs Alignment
par: Xu, Wenzhe, et autres
Publié: (2026)
par: Xu, Wenzhe, et autres
Publié: (2026)
Contextual Linear Bandits under Noisy Features: Towards Bayesian Oracles
par: Kim, Jung-hun, et autres
Publié: (2017)
par: Kim, Jung-hun, et autres
Publié: (2017)
mSFT: Addressing Dataset Mixtures Overfitting Heterogeneously in Multi-task SFT
par: Koh, Woosung, et autres
Publié: (2026)
par: Koh, Woosung, et autres
Publié: (2026)
Noise-corrected GRPO: From Noisy Rewards to Unbiased Gradients
par: Mansouri, Omar El, et autres
Publié: (2025)
par: Mansouri, Omar El, et autres
Publié: (2025)
S-GRPO: Early Exit via Reinforcement Learning in Reasoning Models
par: Dai, Muzhi, et autres
Publié: (2025)
par: Dai, Muzhi, et autres
Publié: (2025)
Pareto Multi-Objective Alignment for Language Models
par: He, Qiang, et autres
Publié: (2025)
par: He, Qiang, et autres
Publié: (2025)
A Unified Framework for Rethinking Policy Divergence Measures in GRPO
par: Wu, Qingyuan, et autres
Publié: (2026)
par: Wu, Qingyuan, et autres
Publié: (2026)
Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO
par: Ren, Yiming, et autres
Publié: (2026)
par: Ren, Yiming, et autres
Publié: (2026)
A Unified Pair-GRPO Family: From Implicit to Explicit Preference Constraints for Stable and General RL Alignment
par: Yu, Hao
Publié: (2026)
par: Yu, Hao
Publié: (2026)
Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization
par: Zhou, Zhanhui, et autres
Publié: (2023)
par: Zhou, Zhanhui, et autres
Publié: (2023)
Automated Filtering of Human Feedback Data for Aligning Text-to-Image Diffusion Models
par: Yang, Yongjin, et autres
Publié: (2024)
par: Yang, Yongjin, et autres
Publié: (2024)
CoRPO: Adding a Correctness Bias to GRPO Improves Generalization
par: Garg, Anisha, et autres
Publié: (2025)
par: Garg, Anisha, et autres
Publié: (2025)
Prefix Grouper: Efficient GRPO Training through Shared-Prefix Forward
par: Liu, Zikang, et autres
Publié: (2025)
par: Liu, Zikang, et autres
Publié: (2025)
PARM: Multi-Objective Test-Time Alignment via Preference-Aware Autoregressive Reward Model
par: Lin, Baijiong, et autres
Publié: (2025)
par: Lin, Baijiong, et autres
Publié: (2025)
Adaptive Alignment: Dynamic Preference Adjustments via Multi-Objective Reinforcement Learning for Pluralistic AI
par: Harland, Hadassah, et autres
Publié: (2024)
par: Harland, Hadassah, et autres
Publié: (2024)
Conditional Synthesis of 3D Molecules with Time Correction Sampler
par: Jung, Hojung, et autres
Publié: (2024)
par: Jung, Hojung, et autres
Publié: (2024)
Comparative Analysis and Parametric Tuning of PPO, GRPO, and DAPO for LLM Reasoning Enhancement
par: Lian, Yongsheng
Publié: (2025)
par: Lian, Yongsheng
Publié: (2025)
Discovering Hidden Algebraic Structures via Transformers with Rank-Aware Beam GRPO
par: Lee, Jaeha, et autres
Publié: (2025)
par: Lee, Jaeha, et autres
Publié: (2025)
GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents
par: Wu, Xiongbin, et autres
Publié: (2026)
par: Wu, Xiongbin, et autres
Publié: (2026)
Unveiling Implicit Advantage Symmetry: Why GRPO Struggles with Exploration and Difficulty Adaptation
par: Yu, Zhiqi, et autres
Publié: (2026)
par: Yu, Zhiqi, et autres
Publié: (2026)
F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare
par: Plyusov, Daniil, et autres
Publié: (2026)
par: Plyusov, Daniil, et autres
Publié: (2026)
Documents similaires
-
An Adaptive Approach for Infinitely Many-armed Bandits under Generalized Rotting Constraints
par: Kim, Jung-hun, et autres
Publié: (2024) -
Temporal Alignment Guidance: On-Manifold Sampling in Diffusion Models
par: Park, Youngrok, et autres
Publié: (2025) -
On the Convergence of Loss and Uncertainty-based Active Learning Algorithms
par: Haimovich, Daniel, et autres
Publié: (2023) -
Improving Visual Representation Alignment Generation with GRPO
par: Mo, Shentong, et autres
Publié: (2026) -
What Is the Alignment Tax?
par: Young, Robin
Publié: (2026)