A Survey of Reinforcement Learning for Large Reasoning Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Kaiyan, Zuo, Yuxin, He, Bingxiang, Sun, Youbang, Liu, Runze, Jiang, Che, Fan, Yuchen, Tian, Kai, Jia, Guoli, Li, Pengfei, Fu, Yu, Lv, Xingtai, Zhang, Yuchen, Zeng, Sihang, Qu, Shang, Li, Haozhan, Wang, Shijie, Wang, Yuru, Long, Xinwei, Liu, Fangfu, Xu, Xiang, Ma, Jiaze, Zhu, Xuekai, Hua, Ermo, Liu, Yihao, Li, Zonglin, Chen, Huayu, Qu, Xiaoye, Li, Yafu, Chen, Weize, Yuan, Zhenzhao, Gao, Junqi, Li, Dong, Ma, Zhiyuan, Cui, Ganqu, Liu, Zhiyuan, Qi, Biqing, Ding, Ning, Zhou, Bowen |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TTRL: Test-Time Reinforcement Learning
par: Zuo, Yuxin, et autres
Publié: (2025)
par: Zuo, Yuxin, et autres
Publié: (2025)
UltraMedical: Building Specialized Generalists in Biomedicine
par: Zhang, Kaiyan, et autres
Publié: (2024)
par: Zhang, Kaiyan, et autres
Publié: (2024)
Fourier Position Embedding: Enhancing Attention's Periodic Extension for Length Generalization
par: Hua, Ermo, et autres
Publié: (2024)
par: Hua, Ermo, et autres
Publié: (2024)
Technologies on Effectiveness and Efficiency: A Survey of State Spaces Models
par: Lv, Xingtai, et autres
Publié: (2025)
par: Lv, Xingtai, et autres
Publié: (2025)
How Far Can Unsupervised RLVR Scale LLM Training?
par: He, Bingxiang, et autres
Publié: (2026)
par: He, Bingxiang, et autres
Publié: (2026)
Retrieval-Augmented Visual Question Answering via Built-in Autoregressive Search Engines
par: Long, Xinwei, et autres
Publié: (2025)
par: Long, Xinwei, et autres
Publié: (2025)
Scalable Efficient Training of Large Language Models with Low-dimensional Projected Attention
par: Lv, Xingtai, et autres
Publié: (2024)
par: Lv, Xingtai, et autres
Publié: (2024)
JustRL: Scaling a 1.5B LLM with a Simple RL Recipe
par: He, Bingxiang, et autres
Publié: (2025)
par: He, Bingxiang, et autres
Publié: (2025)
Safe-SD: Safe and Traceable Stable Diffusion with Text Prompt Trigger for Invisible Generative Watermarking
par: Ma, Zhiyuan, et autres
Publié: (2024)
par: Ma, Zhiyuan, et autres
Publié: (2024)
Fast and Slow Generating: An Empirical Study on Large and Small Language Models Collaborative Decoding
par: Zhang, Kaiyan, et autres
Publié: (2024)
par: Zhang, Kaiyan, et autres
Publié: (2024)
Intuitive Fine-Tuning: Towards Simplifying Alignment into a Single Process
par: Hua, Ermo, et autres
Publié: (2024)
par: Hua, Ermo, et autres
Publié: (2024)
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
par: Cui, Ganqu, et autres
Publié: (2025)
par: Cui, Ganqu, et autres
Publié: (2025)
Free Process Rewards without Process Labels
par: Yuan, Lifan, et autres
Publié: (2024)
par: Yuan, Lifan, et autres
Publié: (2024)
Automating Exploratory Proteomics Research via Language Models
par: Ding, Ning, et autres
Publié: (2024)
par: Ding, Ning, et autres
Publié: (2024)
Automating Exploratory Multiomics Research via Language Models
par: Qu, Shang, et autres
Publié: (2025)
par: Qu, Shang, et autres
Publié: (2025)
CMAL: A Novel Cross-Modal Associative Learning Framework for Vision-Language Pre-Training
par: Ma, Zhiyuan, et autres
Publié: (2024)
par: Ma, Zhiyuan, et autres
Publié: (2024)
Process Reinforcement through Implicit Rewards
par: Cui, Ganqu, et autres
Publié: (2025)
par: Cui, Ganqu, et autres
Publié: (2025)
How to Synthesize Text Data without Model Collapse?
par: Zhu, Xuekai, et autres
Publié: (2024)
par: Zhu, Xuekai, et autres
Publié: (2024)
MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
par: Zuo, Yuxin, et autres
Publié: (2025)
par: Zuo, Yuxin, et autres
Publié: (2025)
The Role of Bile Acid in Immune‐Mediated Skin Diseases
par: Huike Ma, et autres
Publié: (2025)
par: Huike Ma, et autres
Publié: (2025)
Large Language Models as Biomedical Hypothesis Generators: A Comprehensive Evaluation
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
Efficient Diffusion Models: A Comprehensive Survey from Principles to Practices
par: Ma, Zhiyuan, et autres
Publié: (2024)
par: Ma, Zhiyuan, et autres
Publié: (2024)
ReviewRL: Towards Automated Scientific Review with RL
par: Zeng, Sihang, et autres
Publié: (2025)
par: Zeng, Sihang, et autres
Publié: (2025)
Towards a Unified View of Large Language Model Post-Training
par: Lv, Xingtai, et autres
Publié: (2025)
par: Lv, Xingtai, et autres
Publié: (2025)
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
par: Li, Haozhan, et autres
Publié: (2025)
par: Li, Haozhan, et autres
Publié: (2025)
Post-Trained MoE Can Skip Half Experts via Self-Distillation
par: Lv, Xingtai, et autres
Publié: (2026)
par: Lv, Xingtai, et autres
Publié: (2026)
From $f(x)$ and $g(x)$ to $f(g(x))$: LLMs Learn New Skills in RL by Composing Old Ones
par: Yuan, Lifan, et autres
Publié: (2025)
par: Yuan, Lifan, et autres
Publié: (2025)
Denoising Diffusion Probabilistic Model for Radio Map Estimation in Generative Wireless Networks
par: Luo, Xuanhao, et autres
Publié: (2025)
par: Luo, Xuanhao, et autres
Publié: (2025)
Rank-Based Modeling for Universal Packets Compression in Multi-Modal Communications
par: Luo, Xuanhao, et autres
Publié: (2025)
par: Luo, Xuanhao, et autres
Publié: (2025)
Engineering Electronic Structure of Metal‐Based Catalysts Toward Selective Peroxymonosulfate Activation for Water Purification
par: Zhiyuan Feng, et autres
Publié: (2026)
par: Zhiyuan Feng, et autres
Publié: (2026)
OPERA: A Reinforcement Learning--Enhanced Orchestrated Planner-Executor Architecture for Reasoning-Oriented Multi-Hop Retrieval
par: Liu, Yu, et autres
Publié: (2025)
par: Liu, Yu, et autres
Publié: (2025)
AdapEdit: Spatio-Temporal Guided Adaptive Editing Algorithm for Text-Based Continuity-Sensitive Image Editing
par: Ma, Zhiyuan, et autres
Publié: (2023)
par: Ma, Zhiyuan, et autres
Publié: (2023)
CoGenesis: A Framework Collaborating Large and Small Language Models for Secure Context-Aware Instruction Following
par: Zhang, Kaiyan, et autres
Publié: (2024)
par: Zhang, Kaiyan, et autres
Publié: (2024)
FlowRL: Matching Reward Distributions for LLM Reasoning
par: Zhu, Xuekai, et autres
Publié: (2025)
par: Zhu, Xuekai, et autres
Publié: (2025)
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning
par: Li, Ran, et autres
Publié: (2026)
par: Li, Ran, et autres
Publié: (2026)
Structural origin of anisotropic mechanical/thermal behavior in La 2 SrAl 2 O 7 and Nd 2 SrAl 2 O 7 perovskites
par: Bin Liu, et autres
Publié: (2024)
par: Bin Liu, et autres
Publié: (2024)
Chain of Thought Empowers Transformers to Solve Inherently Serial Problems
par: Li, Zhiyuan, et autres
Publié: (2024)
par: Li, Zhiyuan, et autres
Publié: (2024)
Learning to Reason under Off-Policy Guidance
par: Yan, Jianhao, et autres
Publié: (2025)
par: Yan, Jianhao, et autres
Publié: (2025)
Mastering Text, Code and Math Simultaneously via Fusing Highly Specialized Language Models
par: Ding, Ning, et autres
Publié: (2024)
par: Ding, Ning, et autres
Publié: (2024)
Flow Diverse and Efficient: Learning Momentum Flow Matching via Stochastic Velocity Field Sampling
par: Ma, Zhiyuan, et autres
Publié: (2025)
par: Ma, Zhiyuan, et autres
Publié: (2025)
Documents similaires
-
TTRL: Test-Time Reinforcement Learning
par: Zuo, Yuxin, et autres
Publié: (2025) -
UltraMedical: Building Specialized Generalists in Biomedicine
par: Zhang, Kaiyan, et autres
Publié: (2024) -
Fourier Position Embedding: Enhancing Attention's Periodic Extension for Length Generalization
par: Hua, Ermo, et autres
Publié: (2024) -
Technologies on Effectiveness and Efficiency: A Survey of State Spaces Models
par: Lv, Xingtai, et autres
Publié: (2025) -
How Far Can Unsupervised RLVR Scale LLM Training?
par: He, Bingxiang, et autres
Publié: (2026)