Learning Without Critics? Revisiting GRPO in Classical Reinforcement Learning Environments
Fuente:
arXiv
Salvato in:
| Autori principali: | de Oliveira, Bryan L. M., Frujeri, Felipe V., Queiroz, Marcos P. C. M., Martins, Luana G. B., Soares, Telma W. de L., Melo, Luckeciano C. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Sliding Puzzles Gym: A Scalable Benchmark for State Representation in Visual Reinforcement Learning
di: de Oliveira, Bryan L. M., et al.
Pubblicazione: (2024)
di: de Oliveira, Bryan L. M., et al.
Pubblicazione: (2024)
Partial Reasoning in Language Models: Search and Refinement Guided by Uncertainty
di: da Luz, Murilo, et al.
Pubblicazione: (2026)
di: da Luz, Murilo, et al.
Pubblicazione: (2026)
InfoQuest: Evaluating Multi-Turn Dialogue Agents for Open-Ended Conversations with Hidden Context
di: de Oliveira, Bryan L. M., et al.
Pubblicazione: (2025)
di: de Oliveira, Bryan L. M., et al.
Pubblicazione: (2025)
Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning
di: Melo, Luckeciano C., et al.
Pubblicazione: (2025)
di: Melo, Luckeciano C., et al.
Pubblicazione: (2025)
Temporal-Difference Variational Continual Learning
di: Melo, Luckeciano C., et al.
Pubblicazione: (2024)
di: Melo, Luckeciano C., et al.
Pubblicazione: (2024)
Deep Bayesian Active Learning for Preference Modeling in Large Language Models
di: Melo, Luckeciano C., et al.
Pubblicazione: (2024)
di: Melo, Luckeciano C., et al.
Pubblicazione: (2024)
Do Reasoning Models Ask Better Questions? A Formal Information-Theoretic Analysis on Multi-Turn LLM Games
di: Pedrozo, Daniel M., et al.
Pubblicazione: (2026)
di: Pedrozo, Daniel M., et al.
Pubblicazione: (2026)
GRPO-RM: Fine-Tuning Representation Models via GRPO-Driven Reinforcement Learning
di: Xu, Yanchen, et al.
Pubblicazione: (2025)
di: Xu, Yanchen, et al.
Pubblicazione: (2025)
How Off-Policy Can GRPO Be? Mu-GRPO for Efficient LLM Reinforcement Learning
di: Tian, Minghao, et al.
Pubblicazione: (2026)
di: Tian, Minghao, et al.
Pubblicazione: (2026)
Using a Feedback-Based Quantum Algorithm to Analyze the Critical Properties of the ANNNI Model Without Classical Optimization
di: Pexe, G. E. L., et al.
Pubblicazione: (2024)
di: Pexe, G. E. L., et al.
Pubblicazione: (2024)
Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning
di: Wang, Yibin, et al.
Pubblicazione: (2025)
di: Wang, Yibin, et al.
Pubblicazione: (2025)
GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
di: Chen, Yi, et al.
Pubblicazione: (2025)
di: Chen, Yi, et al.
Pubblicazione: (2025)
Graph-GRPO: Training Graph Flow Models with Reinforcement Learning
di: Zhu, Baoheng, et al.
Pubblicazione: (2026)
di: Zhu, Baoheng, et al.
Pubblicazione: (2026)
S-GRPO: Early Exit via Reinforcement Learning in Reasoning Models
di: Dai, Muzhi, et al.
Pubblicazione: (2025)
di: Dai, Muzhi, et al.
Pubblicazione: (2025)
FairGRPO: Fair Reinforcement Learning for Equitable Clinical Reasoning
di: Dai, Shiqi, et al.
Pubblicazione: (2025)
di: Dai, Shiqi, et al.
Pubblicazione: (2025)
Loschmidt Echo and Classicality of the Gamma Model
di: Soares, Gilson V., et al.
Pubblicazione: (2025)
di: Soares, Gilson V., et al.
Pubblicazione: (2025)
GRPO-TTA: Test-Time Visual Tuning for Vision-Language Models via GRPO-Driven Reinforcement Learning
di: Li, Yujun, et al.
Pubblicazione: (2026)
di: Li, Yujun, et al.
Pubblicazione: (2026)
The Sandbox Environment for Generalizable Agent Research (SEGAR)
di: Hjelm, R Devon, et al.
Pubblicazione: (2022)
di: Hjelm, R Devon, et al.
Pubblicazione: (2022)
Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates
di: Li, Yibo, et al.
Pubblicazione: (2026)
di: Li, Yibo, et al.
Pubblicazione: (2026)
SLiM-Gym: Reinforcement Learning for Population Genetics
di: Zuppas, Niko, et al.
Pubblicazione: (2025)
di: Zuppas, Niko, et al.
Pubblicazione: (2025)
Variação da concentração de vitamina C, ºBrix e acidez em néctar de laranja em embalagens cartonadas
di: Telma Lucia de Oliveira
Pubblicazione: (2007)
di: Telma Lucia de Oliveira
Pubblicazione: (2007)
Non-Classicality and Non-adiabaticity in a Single Trapped Ion
di: Avalos, C. F. P., et al.
Pubblicazione: (2024)
di: Avalos, C. F. P., et al.
Pubblicazione: (2024)
Transition Without Direction? A Critical Look at Brazil's National Energy Transition Policy
di: Gabriel Guimarães Sales, et al.
Pubblicazione: (2025)
di: Gabriel Guimarães Sales, et al.
Pubblicazione: (2025)
Reinforcement Learning with Verifiable Rewards: GRPO's Effective Loss, Dynamics, and Success Amplification
di: Mroueh, Youssef
Pubblicazione: (2025)
di: Mroueh, Youssef
Pubblicazione: (2025)
MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understanding
di: Su, Yuhao, et al.
Pubblicazione: (2025)
di: Su, Yuhao, et al.
Pubblicazione: (2025)
Rank-GRPO: Training LLM-based Conversational Recommender Systems with Reinforcement Learning
di: Zhu, Yaochen, et al.
Pubblicazione: (2025)
di: Zhu, Yaochen, et al.
Pubblicazione: (2025)
TIC-GRPO: Provable and Efficient Optimization for Reinforcement Learning from Human Feedback
di: Pang, Lei, et al.
Pubblicazione: (2025)
di: Pang, Lei, et al.
Pubblicazione: (2025)
AR-GRPO: Training Autoregressive Image Generation Models via Reinforcement Learning
di: Yuan, Shihao, et al.
Pubblicazione: (2025)
di: Yuan, Shihao, et al.
Pubblicazione: (2025)
Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning
di: Wang, Hu, et al.
Pubblicazione: (2025)
di: Wang, Hu, et al.
Pubblicazione: (2025)
Stratified GRPO: Handling Structural Heterogeneity in Reinforcement Learning of LLM Search Agents
di: Zhu, Mingkang, et al.
Pubblicazione: (2025)
di: Zhu, Mingkang, et al.
Pubblicazione: (2025)
A new Peirosauridae (Crocodyliformes, Notosuchia) from the Adamantina Formation (Bauru Group, Late Cretaceous), with a revised phylogenetic analysis of Sebecia
di: Juan V. Ruiz, et al.
Pubblicazione: (2024)
di: Juan V. Ruiz, et al.
Pubblicazione: (2024)
LithoGRPO: Fast Inverse Lithography via GRPO Reinforced Flow Matching
di: Lai, Yao, et al.
Pubblicazione: (2026)
di: Lai, Yao, et al.
Pubblicazione: (2026)
Entity Re-identification in Visual Storytelling via Contrastive Reinforcement Learning
di: Oliveira, Daniel A. P., et al.
Pubblicazione: (2025)
di: Oliveira, Daniel A. P., et al.
Pubblicazione: (2025)
Safe Continual Reinforcement Learning in Non-stationary Environments
di: Coursey, Austin, et al.
Pubblicazione: (2026)
di: Coursey, Austin, et al.
Pubblicazione: (2026)
The Home Literacy Environment and Reading Development of Children With and Without Learning Disabilities
di: Rachelle M. Johnson, et al.
Pubblicazione: (2025)
di: Rachelle M. Johnson, et al.
Pubblicazione: (2025)
DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2026)
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2026)
Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
di: Luo, Yifu, et al.
Pubblicazione: (2025)
di: Luo, Yifu, et al.
Pubblicazione: (2025)
E-GRPO: High Entropy Steps Drive Effective Reinforcement Learning for Flow Models
di: Zhang, Shengjun, et al.
Pubblicazione: (2026)
di: Zhang, Shengjun, et al.
Pubblicazione: (2026)
f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment
di: Haldar, Rajdeep, et al.
Pubblicazione: (2026)
di: Haldar, Rajdeep, et al.
Pubblicazione: (2026)
Estratégias de Legitimidade de Suchman evidenciadas pelas empresas brasileiras destinatárias do pedido do carbon disclosure project
di: Luana das Graças Queiroz de Farias
Pubblicazione: (2017)
di: Luana das Graças Queiroz de Farias
Pubblicazione: (2017)
Documenti analoghi
-
Sliding Puzzles Gym: A Scalable Benchmark for State Representation in Visual Reinforcement Learning
di: de Oliveira, Bryan L. M., et al.
Pubblicazione: (2024) -
Partial Reasoning in Language Models: Search and Refinement Guided by Uncertainty
di: da Luz, Murilo, et al.
Pubblicazione: (2026) -
InfoQuest: Evaluating Multi-Turn Dialogue Agents for Open-Ended Conversations with Hidden Context
di: de Oliveira, Bryan L. M., et al.
Pubblicazione: (2025) -
Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning
di: Melo, Luckeciano C., et al.
Pubblicazione: (2025) -
Temporal-Difference Variational Continual Learning
di: Melo, Luckeciano C., et al.
Pubblicazione: (2024)