ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Mingjie, Diao, Shizhe, Lu, Ximing, Hu, Jian, Dong, Xin, Choi, Yejin, Kautz, Jan, Dong, Yi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
von: Zhang, Hao, et al.
Veröffentlicht: (2026)
von: Zhang, Hao, et al.
Veröffentlicht: (2026)
BroRL: Scaling Reinforcement Learning via Broadened Exploration
von: Hu, Jian, et al.
Veröffentlicht: (2025)
von: Hu, Jian, et al.
Veröffentlicht: (2025)
Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training
von: Liu, Mingjie, et al.
Veröffentlicht: (2025)
von: Liu, Mingjie, et al.
Veröffentlicht: (2025)
DLER: Doing Length pEnalty Right - Incentivizing More Intelligence per Token via Reinforcement Learning
von: Liu, Shih-Yang, et al.
Veröffentlicht: (2025)
von: Liu, Shih-Yang, et al.
Veröffentlicht: (2025)
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
von: Liu, Shih-Yang, et al.
Veröffentlicht: (2026)
von: Liu, Shih-Yang, et al.
Veröffentlicht: (2026)
ProfBench: Multi-Domain Rubrics requiring Professional Knowledge to Answer and Judge
von: Wang, Zhilin, et al.
Veröffentlicht: (2025)
von: Wang, Zhilin, et al.
Veröffentlicht: (2025)
ProRL: Effective Reinforcement Learning for Proactive Recommendation via Rectified Policy Gradient Estimation
von: Hou, Hongru, et al.
Veröffentlicht: (2026)
von: Hou, Hongru, et al.
Veröffentlicht: (2026)
Polar: Agentic RL on Any Harness at Scale
von: Xu, Binfeng, et al.
Veröffentlicht: (2026)
von: Xu, Binfeng, et al.
Veröffentlicht: (2026)
Golden Goose: A Simple Trick to Synthesize Unlimited RLVR Tasks from Unverifiable Internet Text
von: Lu, Ximing, et al.
Veröffentlicht: (2026)
von: Lu, Ximing, et al.
Veröffentlicht: (2026)
ToolOrchestra: Elevating Intelligence via Efficient Model and Tool Orchestration
von: Su, Hongjin, et al.
Veröffentlicht: (2025)
von: Su, Hongjin, et al.
Veröffentlicht: (2025)
The Invisible Leash: Why RLVR May or May Not Escape Its Origin
von: Wu, Fang, et al.
Veröffentlicht: (2025)
von: Wu, Fang, et al.
Veröffentlicht: (2025)
iGRPO: Self-Feedback-Driven LLM Reasoning
von: Hatamizadeh, Ali, et al.
Veröffentlicht: (2026)
von: Hatamizadeh, Ali, et al.
Veröffentlicht: (2026)
Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention
von: Hatamizadeh, Ali, et al.
Veröffentlicht: (2026)
von: Hatamizadeh, Ali, et al.
Veröffentlicht: (2026)
ConstraintChecker: A Plugin for Large Language Models to Reason on Commonsense Knowledge Bases
von: Do, Quyet V., et al.
Veröffentlicht: (2024)
von: Do, Quyet V., et al.
Veröffentlicht: (2024)
UloRL:An Ultra-Long Output Reinforcement Learning Approach for Advancing Large Language Models' Reasoning Abilities
von: Du, Dong, et al.
Veröffentlicht: (2025)
von: Du, Dong, et al.
Veröffentlicht: (2025)
Reason-SVG: Enhancing Structured Reasoning for Vector Graphics Generation with Reinforcement Learning
von: Xing, Ximing, et al.
Veröffentlicht: (2025)
von: Xing, Ximing, et al.
Veröffentlicht: (2025)
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning
von: Liu, Yihao, et al.
Veröffentlicht: (2025)
von: Liu, Yihao, et al.
Veröffentlicht: (2025)
DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search
von: Wu, Fang, et al.
Veröffentlicht: (2025)
von: Wu, Fang, et al.
Veröffentlicht: (2025)
UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models
von: Xu, Xin, et al.
Veröffentlicht: (2025)
von: Xu, Xin, et al.
Veröffentlicht: (2025)
JAMDEC: Unsupervised Authorship Obfuscation using Constrained Decoding over Small Language Models
von: Fisher, Jillian, et al.
Veröffentlicht: (2024)
von: Fisher, Jillian, et al.
Veröffentlicht: (2024)
Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning
von: Zhang, Shaokun, et al.
Veröffentlicht: (2025)
von: Zhang, Shaokun, et al.
Veröffentlicht: (2025)
Socratic-MCTS: Test-Time Visual Reasoning by Asking the Right Questions
von: Acuna, David, et al.
Veröffentlicht: (2025)
von: Acuna, David, et al.
Veröffentlicht: (2025)
TreeRL: LLM Reinforcement Learning with On-Policy Tree Search
von: Hou, Zhenyu, et al.
Veröffentlicht: (2025)
von: Hou, Zhenyu, et al.
Veröffentlicht: (2025)
GAR: Generative Adversarial Reinforcement Learning for Formal Theorem Proving
von: Wang, Ruida, et al.
Veröffentlicht: (2025)
von: Wang, Ruida, et al.
Veröffentlicht: (2025)
LongMamba: Enhancing Mamba's Long Context Capabilities via Training-Free Receptive Field Enlargement
von: Ye, Zhifan, et al.
Veröffentlicht: (2025)
von: Ye, Zhifan, et al.
Veröffentlicht: (2025)
QuRL: Efficient Reinforcement Learning with Quantized Rollout
von: Li, Yuhang, et al.
Veröffentlicht: (2026)
von: Li, Yuhang, et al.
Veröffentlicht: (2026)
ProCeedRL: Process Critic with Exploratory Demonstration Reinforcement Learning for LLM Agentic Reasoning
von: Gao, Jingyue, et al.
Veröffentlicht: (2026)
von: Gao, Jingyue, et al.
Veröffentlicht: (2026)
Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models
von: Zhou, Guanghao, et al.
Veröffentlicht: (2025)
von: Zhou, Guanghao, et al.
Veröffentlicht: (2025)
Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings
von: Jiang, Haonan, et al.
Veröffentlicht: (2026)
von: Jiang, Haonan, et al.
Veröffentlicht: (2026)
Information-Guided Identification of Training Data Imprint in (Proprietary) Large Language Models
von: Ravichander, Abhilasha, et al.
Veröffentlicht: (2025)
von: Ravichander, Abhilasha, et al.
Veröffentlicht: (2025)
RLP: Reinforcement as a Pretraining Objective
von: Hatamizadeh, Ali, et al.
Veröffentlicht: (2025)
von: Hatamizadeh, Ali, et al.
Veröffentlicht: (2025)
Small Language Models are the Future of Agentic AI
von: Belcak, Peter, et al.
Veröffentlicht: (2025)
von: Belcak, Peter, et al.
Veröffentlicht: (2025)
Active Prompting with Chain-of-Thought for Large Language Models
von: Diao, Shizhe, et al.
Veröffentlicht: (2023)
von: Diao, Shizhe, et al.
Veröffentlicht: (2023)
Nemotron-CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training
von: Diao, Shizhe, et al.
Veröffentlicht: (2025)
von: Diao, Shizhe, et al.
Veröffentlicht: (2025)
Think-Program-reCtify: 3D Situated Reasoning with Large Language Models
von: He, Qingrong, et al.
Veröffentlicht: (2024)
von: He, Qingrong, et al.
Veröffentlicht: (2024)
Can We Verify Step by Step for Incorrect Answer Detection?
von: Xu, Xin, et al.
Veröffentlicht: (2024)
von: Xu, Xin, et al.
Veröffentlicht: (2024)
Progressive Residual Warmup for Language Model Pretraining
von: Chen, Tianhao, et al.
Veröffentlicht: (2026)
von: Chen, Tianhao, et al.
Veröffentlicht: (2026)
Interleaved Reasoning for Large Language Models via Reinforcement Learning
von: Xie, Roy, et al.
Veröffentlicht: (2025)
von: Xie, Roy, et al.
Veröffentlicht: (2025)
RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning
von: Hao, Qianyue, et al.
Veröffentlicht: (2025)
von: Hao, Qianyue, et al.
Veröffentlicht: (2025)
Structured Chemistry Reasoning with Large Language Models
von: Ouyang, Siru, et al.
Veröffentlicht: (2023)
von: Ouyang, Siru, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
von: Zhang, Hao, et al.
Veröffentlicht: (2026) -
BroRL: Scaling Reinforcement Learning via Broadened Exploration
von: Hu, Jian, et al.
Veröffentlicht: (2025) -
Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training
von: Liu, Mingjie, et al.
Veröffentlicht: (2025) -
DLER: Doing Length pEnalty Right - Incentivizing More Intelligence per Token via Reinforcement Learning
von: Liu, Shih-Yang, et al.
Veröffentlicht: (2025) -
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
von: Liu, Shih-Yang, et al.
Veröffentlicht: (2026)