Consensus Group Relative Policy Optimization for Text Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Ichihara, Yuki, Jinnai, Yuu, Ariu, Kaito, Uchibe, Eiji |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems
di: Ichihara, Yuki, et al.
Pubblicazione: (2025)
di: Ichihara, Yuki, et al.
Pubblicazione: (2025)
Theoretical Guarantees for Minimum Bayes Risk Decoding
di: Ichihara, Yuki, et al.
Pubblicazione: (2025)
di: Ichihara, Yuki, et al.
Pubblicazione: (2025)
Evaluation of Best-of-N Sampling Strategies for Language Model Alignment
di: Ichihara, Yuki, et al.
Pubblicazione: (2025)
di: Ichihara, Yuki, et al.
Pubblicazione: (2025)
Filtered Direct Preference Optimization
di: Morimura, Tetsuro, et al.
Pubblicazione: (2024)
di: Morimura, Tetsuro, et al.
Pubblicazione: (2024)
Hyperparameter-Free Approach for Faster Minimum Bayes Risk Decoding
di: Jinnai, Yuu, et al.
Pubblicazione: (2024)
di: Jinnai, Yuu, et al.
Pubblicazione: (2024)
Re-evaluating Minimum Bayes Risk Decoding for Automatic Speech Recognition
di: Jinnai, Yuu
Pubblicazione: (2025)
di: Jinnai, Yuu
Pubblicazione: (2025)
Does Cross-Cultural Alignment Change the Commonsense Morality of Language Models?
di: Jinnai, Yuu
Pubblicazione: (2024)
di: Jinnai, Yuu
Pubblicazione: (2024)
Annotation-Efficient Language Model Alignment via Diverse and Representative Response Texts
di: Jinnai, Yuu, et al.
Pubblicazione: (2024)
di: Jinnai, Yuu, et al.
Pubblicazione: (2024)
Model-Based Minimum Bayes Risk Decoding for Text Generation
di: Jinnai, Yuu, et al.
Pubblicazione: (2023)
di: Jinnai, Yuu, et al.
Pubblicazione: (2023)
Regularized Best-of-N Sampling with Minimum Bayes Risk Objective for Language Model Alignment
di: Jinnai, Yuu, et al.
Pubblicazione: (2024)
di: Jinnai, Yuu, et al.
Pubblicazione: (2024)
Reward-Punishment Reinforcement Learning with Maximum Entropy
di: Wang, Jiexin, et al.
Pubblicazione: (2024)
di: Wang, Jiexin, et al.
Pubblicazione: (2024)
Document-Level Text Generation with Minimum Bayes Risk Decoding using Optimal Transport
di: Jinnai, Yuu
Pubblicazione: (2025)
di: Jinnai, Yuu
Pubblicazione: (2025)
Policy Testing in Markov Decision Processes
di: Ariu, Kaito, et al.
Pubblicazione: (2025)
di: Ariu, Kaito, et al.
Pubblicazione: (2025)
The Role of Contextual Information in Best Arm Identification
di: Kato, Masahiro, et al.
Pubblicazione: (2021)
di: Kato, Masahiro, et al.
Pubblicazione: (2021)
On Universally Optimal Algorithms for A/B Testing
di: Wang, Po-An, et al.
Pubblicazione: (2023)
di: Wang, Po-An, et al.
Pubblicazione: (2023)
Matroid Semi-Bandits in Sublinear Time
di: Tzeng, Ruo-Chun, et al.
Pubblicazione: (2024)
di: Tzeng, Ruo-Chun, et al.
Pubblicazione: (2024)
Revisiting Instance-Optimal Cluster Recovery in the Labeled Stochastic Block Model
di: Ariu, Kaito, et al.
Pubblicazione: (2023)
di: Ariu, Kaito, et al.
Pubblicazione: (2023)
Optimal Clustering from Noisy Binary Feedback
di: Ariu, Kaito, et al.
Pubblicazione: (2019)
di: Ariu, Kaito, et al.
Pubblicazione: (2019)
Linear Convergence in Games with Delayed Feedback via Extra Prediction
di: Fujimoto, Yuma, et al.
Pubblicazione: (2026)
di: Fujimoto, Yuma, et al.
Pubblicazione: (2026)
Learning from Delayed Feedback in Games via Extra Prediction
di: Fujimoto, Yuma, et al.
Pubblicazione: (2025)
di: Fujimoto, Yuma, et al.
Pubblicazione: (2025)
Adaptively Perturbed Mirror Descent for Learning in Games
di: Abe, Kenshi, et al.
Pubblicazione: (2023)
di: Abe, Kenshi, et al.
Pubblicazione: (2023)
Return-Aligned Decision Transformer
di: Tanaka, Tsunehiko, et al.
Pubblicazione: (2024)
di: Tanaka, Tsunehiko, et al.
Pubblicazione: (2024)
Revisiting Group Relative Policy Optimization: Insights into On-Policy and Off-Policy Training
di: Mroueh, Youssef, et al.
Pubblicazione: (2025)
di: Mroueh, Youssef, et al.
Pubblicazione: (2025)
Reinforcement Unlearning via Group Relative Policy Optimization
di: Zaradoukas, Efstratios, et al.
Pubblicazione: (2026)
di: Zaradoukas, Efstratios, et al.
Pubblicazione: (2026)
Constrained Group Relative Policy Optimization
di: Girgis, Roger, et al.
Pubblicazione: (2026)
di: Girgis, Roger, et al.
Pubblicazione: (2026)
GRPOformer: Advancing Hyperparameter Optimization via Group Relative Policy Optimization
di: Guo, Haoxin, et al.
Pubblicazione: (2025)
di: Guo, Haoxin, et al.
Pubblicazione: (2025)
F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking
di: Surana, Rohan, et al.
Pubblicazione: (2026)
di: Surana, Rohan, et al.
Pubblicazione: (2026)
Do Large Language Models Know Folktales? A Case Study of Yokai in Japanese Folktales
di: Tsutsumi, Ayuto, et al.
Pubblicazione: (2025)
di: Tsutsumi, Ayuto, et al.
Pubblicazione: (2025)
Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation
di: He, Xixiang, et al.
Pubblicazione: (2026)
di: He, Xixiang, et al.
Pubblicazione: (2026)
Generating Diverse and High-Quality Texts by Minimum Bayes Risk Decoding
di: Jinnai, Yuu, et al.
Pubblicazione: (2024)
di: Jinnai, Yuu, et al.
Pubblicazione: (2024)
Demystifying Group Relative Policy Optimization: Its Policy Gradient is a U-Statistic
di: Zhou, Hongyi, et al.
Pubblicazione: (2026)
di: Zhou, Hongyi, et al.
Pubblicazione: (2026)
NGRPO: Negative-enhanced Group Relative Policy Optimization
di: Nan, Gongrui, et al.
Pubblicazione: (2025)
di: Nan, Gongrui, et al.
Pubblicazione: (2025)
Sharpness-Guided Group Relative Policy Optimization via Probability Shaping
di: Le, Tue, et al.
Pubblicazione: (2025)
di: Le, Tue, et al.
Pubblicazione: (2025)
Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization
di: Sane, Soham
Pubblicazione: (2025)
di: Sane, Soham
Pubblicazione: (2025)
Optimize Wider, Not Deeper: Consensus Aggregation for Policy Optimization
di: Su, Zelal, et al.
Pubblicazione: (2026)
di: Su, Zelal, et al.
Pubblicazione: (2026)
Latent-GRPO: Group Relative Policy Optimization for Latent Reasoning
di: Deng, Jingcheng, et al.
Pubblicazione: (2026)
di: Deng, Jingcheng, et al.
Pubblicazione: (2026)
GAGPO: Generalized Advantage Grouped Policy Optimization
di: Zhu, Siyuan, et al.
Pubblicazione: (2026)
di: Zhu, Siyuan, et al.
Pubblicazione: (2026)
On the Power of Perturbation under Sampling in Solving Extensive-Form Games
di: Masaka, Wataru, et al.
Pubblicazione: (2025)
di: Masaka, Wataru, et al.
Pubblicazione: (2025)
WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning
di: Mundada, Gagan, et al.
Pubblicazione: (2026)
di: Mundada, Gagan, et al.
Pubblicazione: (2026)
A Policy Gradient Primal-Dual Algorithm for Constrained MDPs with Uniform PAC Guarantees
di: Kitamura, Toshinori, et al.
Pubblicazione: (2024)
di: Kitamura, Toshinori, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems
di: Ichihara, Yuki, et al.
Pubblicazione: (2025) -
Theoretical Guarantees for Minimum Bayes Risk Decoding
di: Ichihara, Yuki, et al.
Pubblicazione: (2025) -
Evaluation of Best-of-N Sampling Strategies for Language Model Alignment
di: Ichihara, Yuki, et al.
Pubblicazione: (2025) -
Filtered Direct Preference Optimization
di: Morimura, Tetsuro, et al.
Pubblicazione: (2024) -
Hyperparameter-Free Approach for Faster Minimum Bayes Risk Decoding
di: Jinnai, Yuu, et al.
Pubblicazione: (2024)