A Survey of Slow Thinking-based Reasoning LLMs using Reinforced Learning and Inference-time Scaling Law
Fuente:
arXiv
Saved in:
| Main Authors: | Pan, Qianjun, Ji, Wenkai, Ding, Yuyang, Li, Junsong, Chen, Shilian, Wang, Junyi, Zhou, Jie, Chen, Qin, Zhang, Min, Wu, Yulan, He, Liang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Teaching LLMs for Step-Level Automatic Math Correction via Reinforcement Learning
by: Li, Junsong, et al.
Published: (2025)
by: Li, Junsong, et al.
Published: (2025)
Reinforced Interactive Continual Learning via Real-time Noisy Human Feedback
by: Yang, Yutao, et al.
Published: (2025)
by: Yang, Yutao, et al.
Published: (2025)
LifeAlign: Lifelong Alignment for Large Language Models with Memory-Augmented Focalized Preference Optimization
by: Li, Junsong, et al.
Published: (2025)
by: Li, Junsong, et al.
Published: (2025)
Black-box Model Merging for Language-Model-as-a-Service with Massive Model Repositories
by: Chen, Shilian, et al.
Published: (2025)
by: Chen, Shilian, et al.
Published: (2025)
Forget What's Sensitive, Remember What Matters: Token-Level Differential Privacy in Memory Sculpting for Continual Learning
by: Zhan, Bihao, et al.
Published: (2025)
by: Zhan, Bihao, et al.
Published: (2025)
Time Series Forecasting as Reasoning: A Slow-Thinking Approach with Reinforced LLMs
by: Zhou, Yitong, et al.
Published: (2025)
by: Zhou, Yitong, et al.
Published: (2025)
Thinking Slow, Fast: Scaling Inference Compute with Distilled Reasoners
by: Paliotta, Daniele, et al.
Published: (2025)
by: Paliotta, Daniele, et al.
Published: (2025)
Emergent Slow Thinking in LLMs as Inverse Tree Freezing
by: Hu, Sihan, et al.
Published: (2025)
by: Hu, Sihan, et al.
Published: (2025)
Think More, Hallucinate Less: Mitigating Hallucinations via Dual Process of Fast and Slow Thinking
by: Cheng, Xiaoxue, et al.
Published: (2025)
by: Cheng, Xiaoxue, et al.
Published: (2025)
PsychAgent: An Experience-Driven Lifelong Learning Agent for Self-Evolving Psychological Counselor
by: Yang, Yutao, et al.
Published: (2026)
by: Yang, Yutao, et al.
Published: (2026)
AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning
by: Xiang, Kun, et al.
Published: (2024)
by: Xiang, Kun, et al.
Published: (2024)
From Sufficiency to Reflection: Reinforcement-Guided Thinking Quality in Retrieval-Augmented Reasoning for LLMs
by: He, Jie, et al.
Published: (2025)
by: He, Jie, et al.
Published: (2025)
Mathematical Language Models: A Survey
by: Liu, Wentao, et al.
Published: (2023)
by: Liu, Wentao, et al.
Published: (2023)
PsychEval: A Multi-Session and Multi-Therapy Benchmark for High-Realism AI Psychological Counselor
by: Pan, Qianjun, et al.
Published: (2026)
by: Pan, Qianjun, et al.
Published: (2026)
Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning
by: Shen, Junhao, et al.
Published: (2025)
by: Shen, Junhao, et al.
Published: (2025)
Double-Checker: Enhancing Reasoning of Slow-Thinking LLMs via Self-Critical Fine-Tuning
by: Xu, Xin, et al.
Published: (2025)
by: Xu, Xin, et al.
Published: (2025)
Think Twice: Enhancing LLM Reasoning by Scaling Multi-round Test-time Thinking
by: Tian, Xiaoyu, et al.
Published: (2025)
by: Tian, Xiaoyu, et al.
Published: (2025)
Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning
by: Yang, Wenkai, et al.
Published: (2025)
by: Yang, Wenkai, et al.
Published: (2025)
CMM-Math: A Chinese Multimodal Math Dataset To Evaluate and Enhance the Mathematics Reasoning of Large Multimodal Models
by: Liu, Wentao, et al.
Published: (2024)
by: Liu, Wentao, et al.
Published: (2024)
Slow Thinking for Sequential Recommendation
by: Zhang, Junjie, et al.
Published: (2025)
by: Zhang, Junjie, et al.
Published: (2025)
From Prediction to Justification: Aligning Sentiment Reasoning with Human Rationale via Reinforcement Learning
by: Zhang, Shihao, et al.
Published: (2026)
by: Zhang, Shihao, et al.
Published: (2026)
AutoSkill: Experience-Driven Lifelong Learning via Skill Self-Evolution
by: Yang, Yutao, et al.
Published: (2026)
by: Yang, Yutao, et al.
Published: (2026)
Identity, Crimes, and Law Enforcement in the Metaverse
by: Qin, Hua Xuan, et al.
Published: (2022)
by: Qin, Hua Xuan, et al.
Published: (2022)
Exploring Efficiency Frontiers of Thinking Budget in Medical Reasoning: Scaling Laws between Computational Resources and Reasoning Quality
by: Bi, Ziqian, et al.
Published: (2025)
by: Bi, Ziqian, et al.
Published: (2025)
Can Heterogeneous Language Models Be Fused?
by: Chen, Shilian, et al.
Published: (2026)
by: Chen, Shilian, et al.
Published: (2026)
Thinker: Learning to Think Fast and Slow
by: Chung, Stephen, et al.
Published: (2025)
by: Chung, Stephen, et al.
Published: (2025)
Think Natively: Unlocking Multilingual Reasoning with Consistency-Enhanced Reinforcement Learning
by: Zhang, Xue, et al.
Published: (2025)
by: Zhang, Xue, et al.
Published: (2025)
Scaling Laws for Predicting Downstream Performance in LLMs
by: Chen, Yangyi, et al.
Published: (2024)
by: Chen, Yangyi, et al.
Published: (2024)
Unlocking a New Rust Programming Experience: Fast and Slow Thinking with LLMs to Conquer Undefined Behaviors
by: Jiang, Renshuang, et al.
Published: (2025)
by: Jiang, Renshuang, et al.
Published: (2025)
ThinkGuard: Deliberative Slow Thinking Leads to Cautious Guardrails
by: Wen, Xiaofei, et al.
Published: (2025)
by: Wen, Xiaofei, et al.
Published: (2025)
Unsupervised Equivalent Contrastive Learning for Radio Signal Recognition
by: Zheng, Shilian, et al.
Published: (2026)
by: Zheng, Shilian, et al.
Published: (2026)
Relative Scaling Laws for LLMs
by: Held, William, et al.
Published: (2025)
by: Held, William, et al.
Published: (2025)
Fast, Slow, and Tool-augmented Thinking for LLMs: A Review
by: Jia, Xinda, et al.
Published: (2025)
by: Jia, Xinda, et al.
Published: (2025)
Code to Think, Think to Code: A Survey on Code-Enhanced Reasoning and Reasoning-Driven Code Intelligence in LLMs
by: Yang, Dayu, et al.
Published: (2025)
by: Yang, Dayu, et al.
Published: (2025)
Inference Stage Denoising for Undersampled MRI Reconstruction
by: Xue, Yuyang, et al.
Published: (2024)
by: Xue, Yuyang, et al.
Published: (2024)
TwiSTAR:Think Fast, Think Slow, Then Act,Generative Recommendation with Adaptive Reasoning
by: Cao, Shiteng, et al.
Published: (2026)
by: Cao, Shiteng, et al.
Published: (2026)
From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems
by: Chen, Jiayi, et al.
Published: (2025)
by: Chen, Jiayi, et al.
Published: (2025)
DAST: Difficulty-Adaptive Slow-Thinking for Large Reasoning Models
by: Shen, Yi, et al.
Published: (2025)
by: Shen, Yi, et al.
Published: (2025)
When in Doubt, Think Slow: Iterative Reasoning with Latent Imagination
by: Benfeghoul, Martin, et al.
Published: (2024)
by: Benfeghoul, Martin, et al.
Published: (2024)
Agents Thinking Fast and Slow: A Talker-Reasoner Architecture
by: Christakopoulou, Konstantina, et al.
Published: (2024)
by: Christakopoulou, Konstantina, et al.
Published: (2024)
Similar Items
-
Teaching LLMs for Step-Level Automatic Math Correction via Reinforcement Learning
by: Li, Junsong, et al.
Published: (2025) -
Reinforced Interactive Continual Learning via Real-time Noisy Human Feedback
by: Yang, Yutao, et al.
Published: (2025) -
LifeAlign: Lifelong Alignment for Large Language Models with Memory-Augmented Focalized Preference Optimization
by: Li, Junsong, et al.
Published: (2025) -
Black-box Model Merging for Language-Model-as-a-Service with Massive Model Repositories
by: Chen, Shilian, et al.
Published: (2025) -
Forget What's Sensitive, Remember What Matters: Token-Level Differential Privacy in Memory Sculpting for Continual Learning
by: Zhan, Bihao, et al.
Published: (2025)