UloRL:An Ultra-Long Output Reinforcement Learning Approach for Advancing Large Language Models' Reasoning Abilities
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Du, Dong, Liu, Shulin, Yang, Tao, Chen, Shaohua, Li, Yang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MarsRL: Advancing Multi-Agent Reasoning System via Reinforcement Learning with Agentic Pipeline Parallelism
par: Liu, Shulin, et autres
Publié: (2025)
par: Liu, Shulin, et autres
Publié: (2025)
ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models
par: Liu, Mingjie, et autres
Publié: (2025)
par: Liu, Mingjie, et autres
Publié: (2025)
SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data
par: Fang, Wenkai, et autres
Publié: (2025)
par: Fang, Wenkai, et autres
Publié: (2025)
Adaptive Ability Decomposing for Unlocking Large Reasoning Model Effective Reinforcement Learning
par: Chen, Zhipeng, et autres
Publié: (2026)
par: Chen, Zhipeng, et autres
Publié: (2026)
LoongRL: Reinforcement Learning for Advanced Reasoning over Long Contexts
par: Wang, Siyuan, et autres
Publié: (2025)
par: Wang, Siyuan, et autres
Publié: (2025)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
par: Gui, Jiayi, et autres
Publié: (2024)
par: Gui, Jiayi, et autres
Publié: (2024)
Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
Eliciting Causal Abilities in Large Language Models for Reasoning Tasks
par: Wang, Yajing, et autres
Publié: (2024)
par: Wang, Yajing, et autres
Publié: (2024)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
par: Wang, Yiping, et autres
Publié: (2025)
par: Wang, Yiping, et autres
Publié: (2025)
SpeakRL: Synergizing Reasoning, Speaking, and Acting in Language Models with Reinforcement Learning
par: Acikgoz, Emre Can, et autres
Publié: (2025)
par: Acikgoz, Emre Can, et autres
Publié: (2025)
Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning
par: Wang, Yiqi, et autres
Publié: (2024)
par: Wang, Yiqi, et autres
Publié: (2024)
Large Language Models Can Self-Improve in Long-context Reasoning
par: Li, Siheng, et autres
Publié: (2024)
par: Li, Siheng, et autres
Publié: (2024)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
par: Chu, Zheng, et autres
Publié: (2023)
par: Chu, Zheng, et autres
Publié: (2023)
A Survey on Enhancing Causal Reasoning Ability of Large Language Models
par: Li, Xin, et autres
Publié: (2025)
par: Li, Xin, et autres
Publié: (2025)
A Closer Look at the Self-Verification Abilities of Large Language Models in Logical Reasoning
par: Hong, Ruixin, et autres
Publié: (2023)
par: Hong, Ruixin, et autres
Publié: (2023)
Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models
par: Chen, Guanxu, et autres
Publié: (2025)
par: Chen, Guanxu, et autres
Publié: (2025)
Advancing Reasoning in Large Language Models: Promising Methods and Approaches
par: Patil, Avinash, et autres
Publié: (2025)
par: Patil, Avinash, et autres
Publié: (2025)
AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning
par: Chen, Yang, et autres
Publié: (2025)
par: Chen, Yang, et autres
Publié: (2025)
Group-Aware Reinforcement Learning for Output Diversity in Large Language Models
par: Anschel, Oron, et autres
Publié: (2025)
par: Anschel, Oron, et autres
Publié: (2025)
What Is Missing: Interpretable Ratings for Large Language Model Outputs
par: Stranges, Nicholas, et autres
Publié: (2026)
par: Stranges, Nicholas, et autres
Publié: (2026)
$π^2$: Structure-Originated Reasoning Data Improves Long-Context Reasoning Ability of Large Language Models
par: Do, Quyet V., et autres
Publié: (2026)
par: Do, Quyet V., et autres
Publié: (2026)
Understanding Reasoning Ability of Language Models From the Perspective of Reasoning Paths Aggregation
par: Wang, Xinyi, et autres
Publié: (2024)
par: Wang, Xinyi, et autres
Publié: (2024)
AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy
par: Liu, Zihan, et autres
Publié: (2025)
par: Liu, Zihan, et autres
Publié: (2025)
Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models
par: Xu, Fengli, et autres
Publié: (2025)
par: Xu, Fengli, et autres
Publié: (2025)
Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
par: Dong, Yuhao, et autres
Publié: (2026)
par: Dong, Yuhao, et autres
Publié: (2026)
CodeMind: Evaluating Large Language Models for Code Reasoning
par: Liu, Changshu, et autres
Publié: (2024)
par: Liu, Changshu, et autres
Publié: (2024)
LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL
par: Peng, Yingzhe, et autres
Publié: (2025)
par: Peng, Yingzhe, et autres
Publié: (2025)
Enhance Reasoning for Large Language Models in the Game Werewolf
par: Wu, Shuang, et autres
Publié: (2024)
par: Wu, Shuang, et autres
Publié: (2024)
Code-driven Number Sequence Calculation: Enhancing the inductive Reasoning Abilities of Large Language Models
par: Chen, Kedi, et autres
Publié: (2025)
par: Chen, Kedi, et autres
Publié: (2025)
SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution
par: Wei, Yuxiang, et autres
Publié: (2025)
par: Wei, Yuxiang, et autres
Publié: (2025)
Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models
par: Xu, Xin, et autres
Publié: (2026)
par: Xu, Xin, et autres
Publié: (2026)
GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities
par: Ghosh, Sreyan, et autres
Publié: (2024)
par: Ghosh, Sreyan, et autres
Publié: (2024)
Large Language Models have Intrinsic Self-Correction Ability
par: Liu, Dancheng, et autres
Publié: (2024)
par: Liu, Dancheng, et autres
Publié: (2024)
Language Models as Inductive Reasoners
par: Yang, Zonglin, et autres
Publié: (2022)
par: Yang, Zonglin, et autres
Publié: (2022)
StrucText-Eval: Evaluating Large Language Model's Reasoning Ability in Structure-Rich Text
par: Gu, Zhouhong, et autres
Publié: (2024)
par: Gu, Zhouhong, et autres
Publié: (2024)
Route-and-Reason: Scaling Large Language Model Reasoning with Reinforced Model Router
par: Shao, Chenyang, et autres
Publié: (2025)
par: Shao, Chenyang, et autres
Publié: (2025)
OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models
par: Wang, Jun, et autres
Publié: (2024)
par: Wang, Jun, et autres
Publié: (2024)
InftyThink: Breaking the Length Limits of Long-Context Reasoning in Large Language Models
par: Yan, Yuchen, et autres
Publié: (2025)
par: Yan, Yuchen, et autres
Publié: (2025)
Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information
par: Huang, Youcheng, et autres
Publié: (2025)
par: Huang, Youcheng, et autres
Publié: (2025)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2024)
par: Xi, Zhiheng, et autres
Publié: (2024)
Documents similaires
-
MarsRL: Advancing Multi-Agent Reasoning System via Reinforcement Learning with Agentic Pipeline Parallelism
par: Liu, Shulin, et autres
Publié: (2025) -
ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models
par: Liu, Mingjie, et autres
Publié: (2025) -
SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data
par: Fang, Wenkai, et autres
Publié: (2025) -
Adaptive Ability Decomposing for Unlocking Large Reasoning Model Effective Reinforcement Learning
par: Chen, Zhipeng, et autres
Publié: (2026) -
LoongRL: Reinforcement Learning for Advanced Reasoning over Long Contexts
par: Wang, Siyuan, et autres
Publié: (2025)