RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Mao, Yixiu, Qu, Yun, Wang, Qi, Zou, Heming, Ji, Xiangyang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Models
di: Mao, Yixiu, et al.
Pubblicazione: (2026)
di: Mao, Yixiu, et al.
Pubblicazione: (2026)
Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex
di: Qu, Yun, et al.
Pubblicazione: (2026)
di: Qu, Yun, et al.
Pubblicazione: (2026)
Utility-Diversity Aware Online Batch Selection for LLM Supervised Fine-tuning
di: Zou, Heming, et al.
Pubblicazione: (2025)
di: Zou, Heming, et al.
Pubblicazione: (2025)
Adaptive Neighborhood-Constrained Q Learning for Offline Reinforcement Learning
di: Mao, Yixiu, et al.
Pubblicazione: (2025)
di: Mao, Yixiu, et al.
Pubblicazione: (2025)
Fast and Robust: Task Sampling with Posterior and Diversity Synergies for Adaptive Decision-Makers in Randomized Environments
di: Qu, Yun, et al.
Pubblicazione: (2025)
di: Qu, Yun, et al.
Pubblicazione: (2025)
Offline Reinforcement Learning with OOD State Correction and OOD Action Suppression
di: Mao, Yixiu, et al.
Pubblicazione: (2024)
di: Mao, Yixiu, et al.
Pubblicazione: (2024)
Doubly Mild Generalization for Offline Reinforcement Learning
di: Mao, Yixiu, et al.
Pubblicazione: (2024)
di: Mao, Yixiu, et al.
Pubblicazione: (2024)
Can Prompt Difficulty be Online Predicted for Accelerating RL Finetuning of Reasoning Models?
di: Qu, Yun, et al.
Pubblicazione: (2025)
di: Qu, Yun, et al.
Pubblicazione: (2025)
Small Generalizable Prompt Predictive Models Can Steer Efficient RL Post-Training of Large Reasoning Models
di: Qu, Yun, et al.
Pubblicazione: (2026)
di: Qu, Yun, et al.
Pubblicazione: (2026)
Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning
di: Qu, Yun, et al.
Pubblicazione: (2024)
di: Qu, Yun, et al.
Pubblicazione: (2024)
VAO: Validation-Aligned Optimization for Cross-Task Generative Auto-Bidding
di: Lv, Yiqin, et al.
Pubblicazione: (2025)
di: Lv, Yiqin, et al.
Pubblicazione: (2025)
On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation
di: Huang, Kexin, et al.
Pubblicazione: (2026)
di: Huang, Kexin, et al.
Pubblicazione: (2026)
Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning
di: Wu, Junkang, et al.
Pubblicazione: (2025)
di: Wu, Junkang, et al.
Pubblicazione: (2025)
Structural features of the fly olfactory circuit mitigate the stability-plasticity dilemma in continual learning
di: Zou, Heming, et al.
Pubblicazione: (2025)
di: Zou, Heming, et al.
Pubblicazione: (2025)
Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning
di: Huang, Zhuoxu, et al.
Pubblicazione: (2026)
di: Huang, Zhuoxu, et al.
Pubblicazione: (2026)
The Path Not Taken: RLVR Provably Learns Off the Principals
di: Zhu, Hanqing, et al.
Pubblicazione: (2025)
di: Zhu, Hanqing, et al.
Pubblicazione: (2025)
Low-rank Optimization Trajectories Modeling for LLM RLVR Acceleration
di: Chen, Zhipeng, et al.
Pubblicazione: (2026)
di: Chen, Zhipeng, et al.
Pubblicazione: (2026)
Fly-CL: A Fly-Inspired Framework for Enhancing Efficient Decorrelation and Reduced Training Time in Pre-trained Model-based Continual Representation Learning
di: Zou, Heming, et al.
Pubblicazione: (2025)
di: Zou, Heming, et al.
Pubblicazione: (2025)
Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration
di: Yang, Zhicheng, et al.
Pubblicazione: (2025)
di: Yang, Zhicheng, et al.
Pubblicazione: (2025)
FlyLoRA: Boosting Task Decoupling and Parameter Efficiency via Implicit Rank-Wise Mixture-of-Experts
di: Zou, Heming, et al.
Pubblicazione: (2025)
di: Zou, Heming, et al.
Pubblicazione: (2025)
Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning
di: Wang, Ziyan, et al.
Pubblicazione: (2025)
di: Wang, Ziyan, et al.
Pubblicazione: (2025)
Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization
di: Xu, Huimin, et al.
Pubblicazione: (2026)
di: Xu, Huimin, et al.
Pubblicazione: (2026)
RLPR: Extrapolating RLVR to General Domains without Verifiers
di: Yu, Tianyu, et al.
Pubblicazione: (2025)
di: Yu, Tianyu, et al.
Pubblicazione: (2025)
Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing
di: Li, Gengsheng, et al.
Pubblicazione: (2026)
di: Li, Gengsheng, et al.
Pubblicazione: (2026)
Learning to Reason under Off-Policy Guidance
di: Yan, Jianhao, et al.
Pubblicazione: (2025)
di: Yan, Jianhao, et al.
Pubblicazione: (2025)
Model Predictive Task Sampling for Efficient and Robust Adaptation
di: Wang, Qi, et al.
Pubblicazione: (2025)
di: Wang, Qi, et al.
Pubblicazione: (2025)
Adaptive Negative Reinforcement for LLM Reasoning:Dynamically Balancing Correction and Diversity in RLVR
di: Ingle, Yash, et al.
Pubblicazione: (2026)
di: Ingle, Yash, et al.
Pubblicazione: (2026)
CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR
di: Cui, Sijia, et al.
Pubblicazione: (2026)
di: Cui, Sijia, et al.
Pubblicazione: (2026)
Group-in-Group Policy Optimization for LLM Agent Training
di: Feng, Lang, et al.
Pubblicazione: (2025)
di: Feng, Lang, et al.
Pubblicazione: (2025)
Shorter but not Worse: Frugal Reasoning via Easy Samples as Length Regularizers in Math RLVR
di: Bounhar, Abdelaziz, et al.
Pubblicazione: (2025)
di: Bounhar, Abdelaziz, et al.
Pubblicazione: (2025)
When to Stop Reusing: Dynamic Gradient Gating for Sample-Efficient RLVR
di: Miao, Yuchun, et al.
Pubblicazione: (2026)
di: Miao, Yuchun, et al.
Pubblicazione: (2026)
Unearthing Gems from Stones: Policy Optimization with Negative Sample Augmentation for LLM Reasoning
di: Yang, Zhaohui, et al.
Pubblicazione: (2025)
di: Yang, Zhaohui, et al.
Pubblicazione: (2025)
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
di: Shen, Guobin, et al.
Pubblicazione: (2026)
di: Shen, Guobin, et al.
Pubblicazione: (2026)
Structured Role-Aware Policy Optimization for Multimodal Reasoning
di: Jiang, Bingqing, et al.
Pubblicazione: (2026)
di: Jiang, Bingqing, et al.
Pubblicazione: (2026)
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
di: Wang, Junzhe, et al.
Pubblicazione: (2026)
di: Wang, Junzhe, et al.
Pubblicazione: (2026)
Exploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy Optimization
di: Liu, Zeyuan, et al.
Pubblicazione: (2026)
di: Liu, Zeyuan, et al.
Pubblicazione: (2026)
Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization
di: Sane, Soham
Pubblicazione: (2025)
di: Sane, Soham
Pubblicazione: (2025)
Group Orthogonalized Policy Optimization:Group Policy Optimization as Orthogonal Projection in Hilbert Space
di: Zixian, Wang
Pubblicazione: (2026)
di: Zixian, Wang
Pubblicazione: (2026)
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
di: Zhang, Xichen, et al.
Pubblicazione: (2025)
di: Zhang, Xichen, et al.
Pubblicazione: (2025)
Detector-Evasive LLM Paraphrasing via Constrained Policy Optimization
di: Wang, Mingyi, et al.
Pubblicazione: (2026)
di: Wang, Mingyi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Models
di: Mao, Yixiu, et al.
Pubblicazione: (2026) -
Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex
di: Qu, Yun, et al.
Pubblicazione: (2026) -
Utility-Diversity Aware Online Batch Selection for LLM Supervised Fine-tuning
di: Zou, Heming, et al.
Pubblicazione: (2025) -
Adaptive Neighborhood-Constrained Q Learning for Offline Reinforcement Learning
di: Mao, Yixiu, et al.
Pubblicazione: (2025) -
Fast and Robust: Task Sampling with Posterior and Diversity Synergies for Adaptive Decision-Makers in Randomized Environments
di: Qu, Yun, et al.
Pubblicazione: (2025)