LLMs Can Learn to Reason Via Off-Policy RL
Fuente:
arXiv
Salvato in:
| Autori principali: | Ritter, Daniel, Oertell, Owen, Guo, Bradley, Chang, Jonathan, Brantley, Kianté, Sun, Wen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RL for Consistency Models: Faster Reward Guided Text-to-Image Generation
di: Oertell, Owen, et al.
Pubblicazione: (2024)
di: Oertell, Owen, et al.
Pubblicazione: (2024)
Scaling Offline RL via Efficient and Expressive Shortcut Models
di: Espinosa-Dice, Nicolas, et al.
Pubblicazione: (2025)
di: Espinosa-Dice, Nicolas, et al.
Pubblicazione: (2025)
Dataset Reset Policy Optimization for RLHF
di: Chang, Jonathan D., et al.
Pubblicazione: (2024)
di: Chang, Jonathan D., et al.
Pubblicazione: (2024)
Adversarial Imitation Learning via Boosting
di: Chang, Jonathan D., et al.
Pubblicazione: (2024)
di: Chang, Jonathan D., et al.
Pubblicazione: (2024)
Expressive Value Learning for Scalable Offline Reinforcement Learning
di: Espinosa-Dice, Nicolas, et al.
Pubblicazione: (2025)
di: Espinosa-Dice, Nicolas, et al.
Pubblicazione: (2025)
Accelerating RL for LLM Reasoning with Optimal Advantage Regression
di: Brantley, Kianté, et al.
Pubblicazione: (2025)
di: Brantley, Kianté, et al.
Pubblicazione: (2025)
REBEL: Reinforcement Learning via Regressing Relative Rewards
di: Gao, Zhaolin, et al.
Pubblicazione: (2024)
di: Gao, Zhaolin, et al.
Pubblicazione: (2024)
A Surprising Failure? Multimodal LLMs and the NLVR Challenge
di: Wu, Anne, et al.
Pubblicazione: (2024)
di: Wu, Anne, et al.
Pubblicazione: (2024)
Diffusing States and Matching Scores: A New Framework for Imitation Learning
di: Wu, Runzhe, et al.
Pubblicazione: (2024)
di: Wu, Runzhe, et al.
Pubblicazione: (2024)
Policy-Gradient Training of Language Models for Ranking
di: Gao, Ge, et al.
Pubblicazione: (2023)
di: Gao, Ge, et al.
Pubblicazione: (2023)
Value-Guided Search for Efficient Chain-of-Thought Reasoning
di: Wang, Kaiwen, et al.
Pubblicazione: (2025)
di: Wang, Kaiwen, et al.
Pubblicazione: (2025)
$Q\sharp$: Provably Optimal Distributional RL for LLM Post-Training
di: Zhou, Jin Peng, et al.
Pubblicazione: (2025)
di: Zhou, Jin Peng, et al.
Pubblicazione: (2025)
LLMs Are In-Context Bandit Reinforcement Learners
di: Monea, Giovanni, et al.
Pubblicazione: (2024)
di: Monea, Giovanni, et al.
Pubblicazione: (2024)
Regressing the Relative Future: Efficient Policy Optimization for Multi-turn RLHF
di: Gao, Zhaolin, et al.
Pubblicazione: (2024)
di: Gao, Zhaolin, et al.
Pubblicazione: (2024)
Convergence Of Consistency Model With Multistep Sampling Under General Data Assumptions
di: Chen, Yiding, et al.
Pubblicazione: (2025)
di: Chen, Yiding, et al.
Pubblicazione: (2025)
More Benefits of Being Distributional: Second-Order Bounds for Reinforcement Learning
di: Wang, Kaiwen, et al.
Pubblicazione: (2024)
di: Wang, Kaiwen, et al.
Pubblicazione: (2024)
$p1$: Better Prompt Optimization with Fewer Prompts
di: Gao, Zhaolin, et al.
Pubblicazione: (2026)
di: Gao, Zhaolin, et al.
Pubblicazione: (2026)
Prosperity before Collapse: How Far Can Off-Policy RL Reach with Stale Data on LLMs?
di: Zheng, Haizhong, et al.
Pubblicazione: (2025)
di: Zheng, Haizhong, et al.
Pubblicazione: (2025)
Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs
di: Huang, Luke J., et al.
Pubblicazione: (2026)
di: Huang, Luke J., et al.
Pubblicazione: (2026)
Efficient Controllable Diffusion via Optimal Classifier Guidance
di: Oertell, Owen, et al.
Pubblicazione: (2025)
di: Oertell, Owen, et al.
Pubblicazione: (2025)
Policy Learning for Off-Dynamics RL with Deficient Support
di: Van, Linh Le Pham, et al.
Pubblicazione: (2024)
di: Van, Linh Le Pham, et al.
Pubblicazione: (2024)
Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction
di: Guan, Zhong, et al.
Pubblicazione: (2026)
di: Guan, Zhong, et al.
Pubblicazione: (2026)
Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies
di: Lee, Haanvid, et al.
Pubblicazione: (2024)
di: Lee, Haanvid, et al.
Pubblicazione: (2024)
Residual Off-Policy RL for Finetuning Behavior Cloning Policies
di: Ankile, Lars, et al.
Pubblicazione: (2025)
di: Ankile, Lars, et al.
Pubblicazione: (2025)
Probabilistic Reasoning with LLMs for k-anonymity Estimation
di: Zheng, Jonathan, et al.
Pubblicazione: (2025)
di: Zheng, Jonathan, et al.
Pubblicazione: (2025)
Scaling Reward Modeling without Human Supervision
di: Fan, Jingxuan, et al.
Pubblicazione: (2026)
di: Fan, Jingxuan, et al.
Pubblicazione: (2026)
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
di: Cohen, Taco, et al.
Pubblicazione: (2025)
di: Cohen, Taco, et al.
Pubblicazione: (2025)
Patch the Distribution Mismatch: RL Rewriting Agent for Stable Off-Policy SFT
di: Wang, Jiacheng, et al.
Pubblicazione: (2026)
di: Wang, Jiacheng, et al.
Pubblicazione: (2026)
On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting
di: Zhang, Wenhao, et al.
Pubblicazione: (2025)
di: Zhang, Wenhao, et al.
Pubblicazione: (2025)
Efficient Recurrent Off-Policy RL Requires a Context-Encoder-Specific Learning Rate
di: Luo, Fan-Ming, et al.
Pubblicazione: (2024)
di: Luo, Fan-Ming, et al.
Pubblicazione: (2024)
TurboHopp: Accelerated Molecule Scaffold Hopping with Consistency Models
di: Yoo, Kiwoong, et al.
Pubblicazione: (2024)
di: Yoo, Kiwoong, et al.
Pubblicazione: (2024)
Exploration Hacking: Can LLMs Learn to Resist RL Training?
di: Jang, Eyon, et al.
Pubblicazione: (2026)
di: Jang, Eyon, et al.
Pubblicazione: (2026)
Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training
di: Fakoor, Rasool, et al.
Pubblicazione: (2026)
di: Fakoor, Rasool, et al.
Pubblicazione: (2026)
Hyperparameter Optimization Can Even be Harmful in Off-Policy Learning and How to Deal with It
di: Saito, Yuta, et al.
Pubblicazione: (2024)
di: Saito, Yuta, et al.
Pubblicazione: (2024)
SCOPE-RL: A Python Library for Offline Reinforcement Learning and Off-Policy Evaluation
di: Kiyohara, Haruka, et al.
Pubblicazione: (2023)
di: Kiyohara, Haruka, et al.
Pubblicazione: (2023)
Tapered Off-Policy REINFORCE: Stable and efficient reinforcement learning for LLMs
di: Roux, Nicolas Le, et al.
Pubblicazione: (2025)
di: Roux, Nicolas Le, et al.
Pubblicazione: (2025)
Learning to Reason under Off-Policy Guidance
di: Yan, Jianhao, et al.
Pubblicazione: (2025)
di: Yan, Jianhao, et al.
Pubblicazione: (2025)
Off-Policy Maximum Entropy RL with Future State and Action Visitation Measures
di: Bolland, Adrien, et al.
Pubblicazione: (2024)
di: Bolland, Adrien, et al.
Pubblicazione: (2024)
Partial Policy Gradients for RL in LLMs
di: Mathur, Puneet, et al.
Pubblicazione: (2026)
di: Mathur, Puneet, et al.
Pubblicazione: (2026)
SOPE: Stabilizing Off-Policy Evaluation for Online RL with Prior Data
di: Romeo, Carlo, et al.
Pubblicazione: (2026)
di: Romeo, Carlo, et al.
Pubblicazione: (2026)
Documenti analoghi
-
RL for Consistency Models: Faster Reward Guided Text-to-Image Generation
di: Oertell, Owen, et al.
Pubblicazione: (2024) -
Scaling Offline RL via Efficient and Expressive Shortcut Models
di: Espinosa-Dice, Nicolas, et al.
Pubblicazione: (2025) -
Dataset Reset Policy Optimization for RLHF
di: Chang, Jonathan D., et al.
Pubblicazione: (2024) -
Adversarial Imitation Learning via Boosting
di: Chang, Jonathan D., et al.
Pubblicazione: (2024) -
Expressive Value Learning for Scalable Offline Reinforcement Learning
di: Espinosa-Dice, Nicolas, et al.
Pubblicazione: (2025)