Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wan, Xu, Wang, Yansheng, Huang, Wenqi, Sun, Mingyang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models
di: Hong, Haitao, et al.
Pubblicazione: (2025)
di: Hong, Haitao, et al.
Pubblicazione: (2025)
AdapThink: Adaptive Thinking Preferences for Reasoning Language Model
di: Wan, Xu, et al.
Pubblicazione: (2025)
di: Wan, Xu, et al.
Pubblicazione: (2025)
Mitigating Overthinking in Large Reasoning Models via Difficulty-aware Reinforcement Learning
di: Wan, Qian, et al.
Pubblicazione: (2026)
di: Wan, Qian, et al.
Pubblicazione: (2026)
MLCopilot: Unleashing the Power of Large Language Models in Solving Machine Learning Tasks
di: Zhang, Lei, et al.
Pubblicazione: (2023)
di: Zhang, Lei, et al.
Pubblicazione: (2023)
Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning
di: Zhao, Shiwan, et al.
Pubblicazione: (2026)
di: Zhao, Shiwan, et al.
Pubblicazione: (2026)
Exploringand Unleashing the Power of Large Language Models in CI/CD Configuration Translation
di: Wang, Chong, et al.
Pubblicazione: (2025)
di: Wang, Chong, et al.
Pubblicazione: (2025)
CogGPT: Unleashing the Power of Cognitive Dynamics on Large Language Models
di: Lv, Yaojia, et al.
Pubblicazione: (2024)
di: Lv, Yaojia, et al.
Pubblicazione: (2024)
Resource-Efficient Reinforcement for Reasoning Large Language Models via Dynamic One-Shot Policy Refinement
di: Zhang, Yunjian, et al.
Pubblicazione: (2026)
di: Zhang, Yunjian, et al.
Pubblicazione: (2026)
Score-Based Diffusion Policy Compatible with Reinforcement Learning via Optimal Transport
di: Sun, Mingyang, et al.
Pubblicazione: (2025)
di: Sun, Mingyang, et al.
Pubblicazione: (2025)
Exploring and Unleashing the Power of Large Language Models in Automated Code Translation
di: Yang, Zhen, et al.
Pubblicazione: (2024)
di: Yang, Zhen, et al.
Pubblicazione: (2024)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
di: Xiao, Teng, et al.
Pubblicazione: (2024)
di: Xiao, Teng, et al.
Pubblicazione: (2024)
m1: Unleash the Potential of Test-Time Scaling for Medical Reasoning with Large Language Models
di: Huang, Xiaoke, et al.
Pubblicazione: (2025)
di: Huang, Xiaoke, et al.
Pubblicazione: (2025)
MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
SATURN: SAT-based Reinforcement Learning to Unleash LLMs Reasoning
di: Liu, Huanyu, et al.
Pubblicazione: (2025)
di: Liu, Huanyu, et al.
Pubblicazione: (2025)
Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models
di: Liao, Yi, et al.
Pubblicazione: (2025)
di: Liao, Yi, et al.
Pubblicazione: (2025)
EvidenceMap: Learning Evidence Analysis to Unleash the Power of Small Language Models for Biomedical Question Answering
di: Zong, Chang, et al.
Pubblicazione: (2025)
di: Zong, Chang, et al.
Pubblicazione: (2025)
Think Twice, Act Once: A Co-Evolution Framework of LLM and RL for Large-Scale Decision Making
di: Wan, Xu, et al.
Pubblicazione: (2025)
di: Wan, Xu, et al.
Pubblicazione: (2025)
Effective Reinforcement Learning for Reasoning in Language Models
di: Huang, Lianghuan, et al.
Pubblicazione: (2025)
di: Huang, Lianghuan, et al.
Pubblicazione: (2025)
SAMG: Offline-to-Online Reinforcement Learning via State-Action-Conditional Offline Model Guidance
di: Zhang, Liyu, et al.
Pubblicazione: (2024)
di: Zhang, Liyu, et al.
Pubblicazione: (2024)
Learning to Reason under Off-Policy Guidance
di: Yan, Jianhao, et al.
Pubblicazione: (2025)
di: Yan, Jianhao, et al.
Pubblicazione: (2025)
Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning
di: Xie, Tian, et al.
Pubblicazione: (2025)
di: Xie, Tian, et al.
Pubblicazione: (2025)
Premise Order Matters in Reasoning with Large Language Models
di: Chen, Xinyun, et al.
Pubblicazione: (2024)
di: Chen, Xinyun, et al.
Pubblicazione: (2024)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
di: Sun, Haoyuan, et al.
Pubblicazione: (2025)
di: Sun, Haoyuan, et al.
Pubblicazione: (2025)
Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
di: Heuillet, Maxime, et al.
Pubblicazione: (2025)
di: Heuillet, Maxime, et al.
Pubblicazione: (2025)
Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models
di: Xu, Fengli, et al.
Pubblicazione: (2025)
di: Xu, Fengli, et al.
Pubblicazione: (2025)
Route-and-Reason: Scaling Large Language Model Reasoning with Reinforced Model Router
di: Shao, Chenyang, et al.
Pubblicazione: (2025)
di: Shao, Chenyang, et al.
Pubblicazione: (2025)
Training Large Language Models to Reason via EM Policy Gradient
di: Xu, Tianbing
Pubblicazione: (2025)
di: Xu, Tianbing
Pubblicazione: (2025)
On Predictability of Reinforcement Learning Dynamics for Large Language Models
di: Cai, Yuchen, et al.
Pubblicazione: (2025)
di: Cai, Yuchen, et al.
Pubblicazione: (2025)
MedAdapter: Efficient Test-Time Adaptation of Large Language Models towards Medical Reasoning
di: Shi, Wenqi, et al.
Pubblicazione: (2024)
di: Shi, Wenqi, et al.
Pubblicazione: (2024)
Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents
di: Zhou, Zihao, et al.
Pubblicazione: (2023)
di: Zhou, Zihao, et al.
Pubblicazione: (2023)
AR$^2$: Adversarial Reinforcement Learning for Abstract Reasoning in Large Language Models
di: Yeh, Cheng-Kai, et al.
Pubblicazione: (2025)
di: Yeh, Cheng-Kai, et al.
Pubblicazione: (2025)
Learning to Check: Unleashing Potentials for Self-Correction in Large Language Models
di: Zhang, Che, et al.
Pubblicazione: (2024)
di: Zhang, Che, et al.
Pubblicazione: (2024)
Rationale-Grounded In-Context Learning for Time Series Reasoning with Multimodal Large Language Models
di: Liu, Qingxiang, et al.
Pubblicazione: (2026)
di: Liu, Qingxiang, et al.
Pubblicazione: (2026)
Off-policy Reinforcement Learning with Model-based Exploration Augmentation
di: Wang, Likun, et al.
Pubblicazione: (2025)
di: Wang, Likun, et al.
Pubblicazione: (2025)
Think Before Recommend: Unleashing the Latent Reasoning Power for Sequential Recommendation
di: Tang, Jiakai, et al.
Pubblicazione: (2025)
di: Tang, Jiakai, et al.
Pubblicazione: (2025)
SrSv: Integrating Sequential Rollouts with Sequential Value Estimation for Multi-agent Reinforcement Learning
di: Wan, Xu, et al.
Pubblicazione: (2025)
di: Wan, Xu, et al.
Pubblicazione: (2025)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
di: Xi, Zhiheng, et al.
Pubblicazione: (2024)
di: Xi, Zhiheng, et al.
Pubblicazione: (2024)
Low-Rank Adaptation for Critic Learning in Off-Policy Reinforcement Learning
di: Zhuang, Yuan, et al.
Pubblicazione: (2026)
di: Zhuang, Yuan, et al.
Pubblicazione: (2026)
Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization
di: Palenicek, Daniel, et al.
Pubblicazione: (2025)
di: Palenicek, Daniel, et al.
Pubblicazione: (2025)
Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models
di: Zhou, Guanghao, et al.
Pubblicazione: (2025)
di: Zhou, Guanghao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models
di: Hong, Haitao, et al.
Pubblicazione: (2025) -
AdapThink: Adaptive Thinking Preferences for Reasoning Language Model
di: Wan, Xu, et al.
Pubblicazione: (2025) -
Mitigating Overthinking in Large Reasoning Models via Difficulty-aware Reinforcement Learning
di: Wan, Qian, et al.
Pubblicazione: (2026) -
MLCopilot: Unleashing the Power of Large Language Models in Solving Machine Learning Tasks
di: Zhang, Lei, et al.
Pubblicazione: (2023) -
Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning
di: Zhao, Shiwan, et al.
Pubblicazione: (2026)