Group Orthogonalized Policy Optimization:Group Policy Optimization as Orthogonal Projection in Hilbert Space
Fuente:
arXiv
Salvato in:
| Autore principale: | Zixian, Wang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Orthogonalized Policy Optimization:Policy Optimization as Orthogonal Projection in Hilbert Space
di: Zixian, Wang
Pubblicazione: (2026)
di: Zixian, Wang
Pubblicazione: (2026)
Group-in-Group Policy Optimization for LLM Agent Training
di: Feng, Lang, et al.
Pubblicazione: (2025)
di: Feng, Lang, et al.
Pubblicazione: (2025)
Group Sequence Policy Optimization
di: Zheng, Chujie, et al.
Pubblicazione: (2025)
di: Zheng, Chujie, et al.
Pubblicazione: (2025)
Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex
di: Qu, Yun, et al.
Pubblicazione: (2026)
di: Qu, Yun, et al.
Pubblicazione: (2026)
NGRPO: Negative-enhanced Group Relative Policy Optimization
di: Nan, Gongrui, et al.
Pubblicazione: (2025)
di: Nan, Gongrui, et al.
Pubblicazione: (2025)
Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization
di: Sane, Soham
Pubblicazione: (2025)
di: Sane, Soham
Pubblicazione: (2025)
AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback
di: Hu, Miaobo, et al.
Pubblicazione: (2026)
di: Hu, Miaobo, et al.
Pubblicazione: (2026)
Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks
di: He, Shuo, et al.
Pubblicazione: (2026)
di: He, Shuo, et al.
Pubblicazione: (2026)
Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization
di: Zhu, Haodong, et al.
Pubblicazione: (2026)
di: Zhu, Haodong, et al.
Pubblicazione: (2026)
ORTHOBO: Orthogonal Bayesian Hyperparameter Optimization
di: Schröder, Maresa, et al.
Pubblicazione: (2026)
di: Schröder, Maresa, et al.
Pubblicazione: (2026)
GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning
di: Zhang, Han, et al.
Pubblicazione: (2025)
di: Zhang, Han, et al.
Pubblicazione: (2025)
Long Chain-of-Thought Compression via Fine-Grained Group Policy Optimization
di: Han, Xinchen, et al.
Pubblicazione: (2026)
di: Han, Xinchen, et al.
Pubblicazione: (2026)
Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing
di: Li, Gengsheng, et al.
Pubblicazione: (2026)
di: Li, Gengsheng, et al.
Pubblicazione: (2026)
ROOT: Robust Orthogonalized Optimizer for Neural Network Training
di: He, Wei, et al.
Pubblicazione: (2025)
di: He, Wei, et al.
Pubblicazione: (2025)
ADPO: Anchored Direct Preference Optimization
di: Zixian, Wang
Pubblicazione: (2025)
di: Zixian, Wang
Pubblicazione: (2025)
APO: Alpha-Divergence Preference Optimization
di: Zixian, Wang
Pubblicazione: (2025)
di: Zixian, Wang
Pubblicazione: (2025)
Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment
di: Wang, Jialu, et al.
Pubblicazione: (2026)
di: Wang, Jialu, et al.
Pubblicazione: (2026)
Orthogonal Finetuning for Direct Preference Optimization
di: Yang, Chenxu, et al.
Pubblicazione: (2024)
di: Yang, Chenxu, et al.
Pubblicazione: (2024)
RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning
di: Mao, Yixiu, et al.
Pubblicazione: (2026)
di: Mao, Yixiu, et al.
Pubblicazione: (2026)
Information-Consistent Language Model Recommendations through Group Relative Policy Optimization
di: Prabhune, Sonal, et al.
Pubblicazione: (2025)
di: Prabhune, Sonal, et al.
Pubblicazione: (2025)
GVPO: Group Variance Policy Optimization for Large Language Model Post-Training
di: Zhang, Kaichen, et al.
Pubblicazione: (2025)
di: Zhang, Kaichen, et al.
Pubblicazione: (2025)
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
di: Liu, Shih-Yang, et al.
Pubblicazione: (2026)
di: Liu, Shih-Yang, et al.
Pubblicazione: (2026)
Policy Newton Algorithm in Reproducing Kernel Hilbert Space
di: Zhang, Yixian, et al.
Pubblicazione: (2025)
di: Zhang, Yixian, et al.
Pubblicazione: (2025)
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
di: Wang, Junzhe, et al.
Pubblicazione: (2026)
di: Wang, Junzhe, et al.
Pubblicazione: (2026)
AceGRPO: Adaptive Curriculum Enhanced Group Relative Policy Optimization for Autonomous Machine Learning Engineering
di: Cai, Yuzhu, et al.
Pubblicazione: (2026)
di: Cai, Yuzhu, et al.
Pubblicazione: (2026)
GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning
di: Wang, Jingyi, et al.
Pubblicazione: (2026)
di: Wang, Jingyi, et al.
Pubblicazione: (2026)
EBPO: Empirical Bayes Shrinkage for Stabilizing Group-Relative Policy Optimization
di: Han, Kevin, et al.
Pubblicazione: (2026)
di: Han, Kevin, et al.
Pubblicazione: (2026)
On-Policy Optimization of ANFIS Policies Using Proximal Policy Optimization
di: Shankar, Kaaustaaub, et al.
Pubblicazione: (2025)
di: Shankar, Kaaustaaub, et al.
Pubblicazione: (2025)
Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model
di: Zhou, Renping, et al.
Pubblicazione: (2025)
di: Zhou, Renping, et al.
Pubblicazione: (2025)
MC-GRPO: Median-Centered Group Relative Policy Optimization for Small-Rollout Reinforcement Learning
di: Kim, Youngeun
Pubblicazione: (2026)
di: Kim, Youngeun
Pubblicazione: (2026)
EP-GRPO: Entropy-Progress Aligned Group Relative Policy Optimization with Implicit Process Guidance
di: Yu, Song, et al.
Pubblicazione: (2026)
di: Yu, Song, et al.
Pubblicazione: (2026)
TrasMuon: Trust-Region Adaptive Scaling for Orthogonalized Momentum Optimizers
di: Cheng, Peng, et al.
Pubblicazione: (2026)
di: Cheng, Peng, et al.
Pubblicazione: (2026)
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
di: Zhang, Xichen, et al.
Pubblicazione: (2025)
di: Zhang, Xichen, et al.
Pubblicazione: (2025)
GTPO: Stabilizing Group Relative Policy Optimization via Gradient and Entropy Control
di: Simoni, Marco, et al.
Pubblicazione: (2025)
di: Simoni, Marco, et al.
Pubblicazione: (2025)
Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
di: Ding, Yifeng, et al.
Pubblicazione: (2025)
di: Ding, Yifeng, et al.
Pubblicazione: (2025)
Uncertain Multi-Objective Recommendation via Orthogonal Meta-Learning Enhanced Bayesian Optimization
di: Wang, Hongxu, et al.
Pubblicazione: (2025)
di: Wang, Hongxu, et al.
Pubblicazione: (2025)
Refine and Purify: Orthogonal Basis Optimization with Null-Space Denoising for Conditional Representation Learning
di: Wang, Jiaquan, et al.
Pubblicazione: (2026)
di: Wang, Jiaquan, et al.
Pubblicazione: (2026)
Fisher-Orthogonal Projected Natural Gradient Descent for Continual Learning
di: Garg, Ishir, et al.
Pubblicazione: (2026)
di: Garg, Ishir, et al.
Pubblicazione: (2026)
Pro-KLShampoo: Projected KL-Shampoo with Whitening Recovered by Orthogonalization
di: Sun, Ruotong, et al.
Pubblicazione: (2026)
di: Sun, Ruotong, et al.
Pubblicazione: (2026)
Group and Shuffle: Efficient Structured Orthogonal Parametrization
di: Gorbunov, Mikhail, et al.
Pubblicazione: (2024)
di: Gorbunov, Mikhail, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Orthogonalized Policy Optimization:Policy Optimization as Orthogonal Projection in Hilbert Space
di: Zixian, Wang
Pubblicazione: (2026) -
Group-in-Group Policy Optimization for LLM Agent Training
di: Feng, Lang, et al.
Pubblicazione: (2025) -
Group Sequence Policy Optimization
di: Zheng, Chujie, et al.
Pubblicazione: (2025) -
Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex
di: Qu, Yun, et al.
Pubblicazione: (2026) -
NGRPO: Negative-enhanced Group Relative Policy Optimization
di: Nan, Gongrui, et al.
Pubblicazione: (2025)