The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Cui, Ganqu, Zhang, Yuchen, Chen, Jiacheng, Yuan, Lifan, Wang, Zhi, Zuo, Yuxin, Li, Haozhan, Fan, Yuchen, Chen, Huayu, Chen, Weize, Liu, Zhiyuan, Peng, Hao, Bai, Lei, Ouyang, Wanli, Cheng, Yu, Zhou, Bowen, Ding, Ning |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
TTRL: Test-Time Reinforcement Learning
by: Zuo, Yuxin, et al.
Published: (2025)
by: Zuo, Yuxin, et al.
Published: (2025)
From $f(x)$ and $g(x)$ to $f(g(x))$: LLMs Learn New Skills in RL by Composing Old Ones
by: Yuan, Lifan, et al.
Published: (2025)
by: Yuan, Lifan, et al.
Published: (2025)
Free Process Rewards without Process Labels
by: Yuan, Lifan, et al.
Published: (2024)
by: Yuan, Lifan, et al.
Published: (2024)
Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning
by: Cheng, Qianjia, et al.
Published: (2026)
by: Cheng, Qianjia, et al.
Published: (2026)
Process Reinforcement through Implicit Rewards
by: Cui, Ganqu, et al.
Published: (2025)
by: Cui, Ganqu, et al.
Published: (2025)
A Survey of Reinforcement Learning for Large Reasoning Models
by: Zhang, Kaiyan, et al.
Published: (2025)
by: Zhang, Kaiyan, et al.
Published: (2025)
Noise Contrastive Alignment of Language Models with Explicit Rewards
by: Chen, Huayu, et al.
Published: (2024)
by: Chen, Huayu, et al.
Published: (2024)
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
by: Li, Haozhan, et al.
Published: (2025)
by: Li, Haozhan, et al.
Published: (2025)
NFT: Bridging Supervised Learning and Reinforcement Learning in Math Reasoning
by: Chen, Huayu, et al.
Published: (2025)
by: Chen, Huayu, et al.
Published: (2025)
JustRL: Scaling a 1.5B LLM with a Simple RL Recipe
by: He, Bingxiang, et al.
Published: (2025)
by: He, Bingxiang, et al.
Published: (2025)
SSRL: Self-Search Reinforcement Learning
by: Fan, Yuchen, et al.
Published: (2025)
by: Fan, Yuchen, et al.
Published: (2025)
Integrated bioinformatics analysis reveals vital genes and immune infiltration for the co‐occurrence of Epstein–Barr virus‐related infectious mononucleosis and systemic lupus erythematosus
by: Yuchen Liu, et al.
Published: (2024)
by: Yuchen Liu, et al.
Published: (2024)
Advancing LLM Reasoning Generalists with Preference Trees
by: Yuan, Lifan, et al.
Published: (2024)
by: Yuan, Lifan, et al.
Published: (2024)
Deflated HeteroPCA: Overcoming the curse of ill-conditioning in heteroskedastic PCA
by: Zhou, Yuchen, et al.
Published: (2023)
by: Zhou, Yuchen, et al.
Published: (2023)
Controllable Preference Optimization: Toward Controllable Multi-Objective Alignment
by: Guo, Yiju, et al.
Published: (2024)
by: Guo, Yiju, et al.
Published: (2024)
InternBootcamp Technical Report: Boosting LLM Reasoning with Verifiable Task Scaling
by: Li, Peiji, et al.
Published: (2025)
by: Li, Peiji, et al.
Published: (2025)
Post-Trained MoE Can Skip Half Experts via Self-Distillation
by: Lv, Xingtai, et al.
Published: (2026)
by: Lv, Xingtai, et al.
Published: (2026)
How Far Can Unsupervised RLVR Scale LLM Training?
by: He, Bingxiang, et al.
Published: (2026)
by: He, Bingxiang, et al.
Published: (2026)
Mastering Text, Code and Math Simultaneously via Fusing Highly Specialized Language Models
by: Ding, Ning, et al.
Published: (2024)
by: Ding, Ning, et al.
Published: (2024)
Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation
by: Pan, Jiadong, et al.
Published: (2025)
by: Pan, Jiadong, et al.
Published: (2025)
P1: Mastering Physics Olympiads with Reinforcement Learning
by: Chen, Jiacheng, et al.
Published: (2025)
by: Chen, Jiacheng, et al.
Published: (2025)
Scalable Efficient Training of Large Language Models with Low-dimensional Projected Attention
by: Lv, Xingtai, et al.
Published: (2024)
by: Lv, Xingtai, et al.
Published: (2024)
LAM-YOLO: Drones-based Small Object Detection on Lighting-Occlusion Attention Mechanism YOLO
by: Zheng, Yuchen, et al.
Published: (2024)
by: Zheng, Yuchen, et al.
Published: (2024)
Wisdom of the Crowd: Reinforcement Learning from Coevolutionary Collective Feedback
by: Yuan, Wenzhen, et al.
Published: (2025)
by: Yuan, Wenzhen, et al.
Published: (2025)
P1-VL: Bridging Visual Perception and Scientific Reasoning in Physics Olympiads
by: Luo, Yun, et al.
Published: (2026)
by: Luo, Yun, et al.
Published: (2026)
Evaluating Black-Box Classifiers via Stable Adaptive Two-Sample Inference
by: Chen, Yuchen, et al.
Published: (2026)
by: Chen, Yuchen, et al.
Published: (2026)
De-Biased Two-Sample U-Statistics With Application To Conditional Distribution Testing
by: Chen, Yuchen, et al.
Published: (2024)
by: Chen, Yuchen, et al.
Published: (2024)
Minimax Optimal Probability Matrix Estimation For Graphon With Spectral Decay
by: Chen, Yuchen, et al.
Published: (2024)
by: Chen, Yuchen, et al.
Published: (2024)
Towards a unified framework for guided diffusion models
by: Jiao, Yuchen, et al.
Published: (2025)
by: Jiao, Yuchen, et al.
Published: (2025)
Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology
by: Jiao, Yuchen, et al.
Published: (2025)
by: Jiao, Yuchen, et al.
Published: (2025)
Stochastic Runge-Kutta Methods: Provable Acceleration of Diffusion Models
by: Wu, Yuchen, et al.
Published: (2024)
by: Wu, Yuchen, et al.
Published: (2024)
HiPhO: How Far Are (M)LLMs from Humans in the Latest High School Physics Olympiad Benchmark?
by: Yu, Fangchen, et al.
Published: (2025)
by: Yu, Fangchen, et al.
Published: (2025)
The Overthinker's DIET: Cutting Token Calories with DIfficulty-AwarE Training
by: Chen, Weize, et al.
Published: (2025)
by: Chen, Weize, et al.
Published: (2025)
Detecting, Explaining, and Mitigating Memorization in Diffusion Models
by: Wen, Yuxin, et al.
Published: (2024)
by: Wen, Yuxin, et al.
Published: (2024)
On a problem of Nathanson on non-minimal additive complements
by: Chen, Shi--Qiang, et al.
Published: (2024)
by: Chen, Shi--Qiang, et al.
Published: (2024)
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning
by: Li, Ran, et al.
Published: (2026)
by: Li, Ran, et al.
Published: (2026)
MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
by: Zuo, Yuxin, et al.
Published: (2025)
by: Zuo, Yuxin, et al.
Published: (2025)
PhysicsMinions: Winning Gold Medals in the Latest Physics Olympiads with a Coevolutionary Multimodal Multi-Agent System
by: Yu, Fangchen, et al.
Published: (2025)
by: Yu, Fangchen, et al.
Published: (2025)
EVA-Score: Evaluating Abstractive Long-form Summarization on Informativeness through Extraction and Validation
by: Fan, Yuchen, et al.
Published: (2024)
by: Fan, Yuchen, et al.
Published: (2024)
ExtremeCast: Boosting Extreme Value Prediction for Global Weather Forecast
by: Xu, Wanghan, et al.
Published: (2024)
by: Xu, Wanghan, et al.
Published: (2024)
Similar Items
-
TTRL: Test-Time Reinforcement Learning
by: Zuo, Yuxin, et al.
Published: (2025) -
From $f(x)$ and $g(x)$ to $f(g(x))$: LLMs Learn New Skills in RL by Composing Old Ones
by: Yuan, Lifan, et al.
Published: (2025) -
Free Process Rewards without Process Labels
by: Yuan, Lifan, et al.
Published: (2024) -
Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning
by: Cheng, Qianjia, et al.
Published: (2026) -
Process Reinforcement through Implicit Rewards
by: Cui, Ganqu, et al.
Published: (2025)