Mitigating Overthinking in Large Reasoning Models via Difficulty-aware Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wan, Qian, Xu, Ziao, Wei, Luona, Shen, Xiaoxuan, Sun, Jianwen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Mitigating Overthinking in Large Reasoning Models via Manifold Steering
par: Huang, Yao, et autres
Publié: (2025)
par: Huang, Yao, et autres
Publié: (2025)
Beyond Error-Based Optimization: Experience-Driven Symbolic Regression with Goal-Conditioned Reinforcement Learning
par: Sun, Jianwen, et autres
Publié: (2026)
par: Sun, Jianwen, et autres
Publié: (2026)
Explore Briefly, Then Decide: Mitigating LLM Overthinking via Cumulative Entropy Regulation
par: Bin, Yi, et autres
Publié: (2025)
par: Bin, Yi, et autres
Publié: (2025)
DAST: Difficulty-Adaptive Slow-Thinking for Large Reasoning Models
par: Shen, Yi, et autres
Publié: (2025)
par: Shen, Yi, et autres
Publié: (2025)
Think How to Think: Mitigating Overthinking with Autonomous Difficulty Cognition in Large Reasoning Models
par: Liu, Yongjiang, et autres
Publié: (2025)
par: Liu, Yongjiang, et autres
Publié: (2025)
Automated discovery of symbolic laws governing skill acquisition from naturally occurring data
par: Liu, Sannyuya, et autres
Publié: (2024)
par: Liu, Sannyuya, et autres
Publié: (2024)
ROM: Real-time Overthinking Mitigation via Streaming Detection and Intervention
par: Wang, Xinyan, et autres
Publié: (2026)
par: Wang, Xinyan, et autres
Publié: (2026)
Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective
par: Kong, Deyang, et autres
Publié: (2025)
par: Kong, Deyang, et autres
Publié: (2025)
Missing Premise exacerbates Overthinking: Are Reasoning Models losing Critical Thinking Skill?
par: Fan, Chenrui, et autres
Publié: (2025)
par: Fan, Chenrui, et autres
Publié: (2025)
Reinforcement-aware Knowledge Distillation for LLM Reasoning
par: Zhang, Zhaoyang, et autres
Publié: (2026)
par: Zhang, Zhaoyang, et autres
Publié: (2026)
DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation
par: Zhou, Yang, et autres
Publié: (2026)
par: Zhou, Yang, et autres
Publié: (2026)
What Makes Reasoning Invalid: Echo Reflection Mitigation for Large Language Models
par: He, Chen, et autres
Publié: (2025)
par: He, Chen, et autres
Publié: (2025)
Mitigating Hallucinations in Large Language Models via Causal Reasoning
par: Li, Yuangang, et autres
Publié: (2025)
par: Li, Yuangang, et autres
Publié: (2025)
AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning
par: Fu, Wei, et autres
Publié: (2025)
par: Fu, Wei, et autres
Publié: (2025)
DISCO Balances the Scales: Adaptive Domain- and Difficulty-Aware Reinforcement Learning on Imbalanced Data
par: Zhou, Yuhang, et autres
Publié: (2025)
par: Zhou, Yuhang, et autres
Publié: (2025)
Mitigating Reversal Curse in Large Language Models via Semantic-aware Permutation Training
par: Guo, Qingyan, et autres
Publié: (2024)
par: Guo, Qingyan, et autres
Publié: (2024)
SAMG: Offline-to-Online Reinforcement Learning via State-Action-Conditional Offline Model Guidance
par: Zhang, Liyu, et autres
Publié: (2024)
par: Zhang, Liyu, et autres
Publié: (2024)
Don't "Overthink" Passage Reranking: Is Reasoning Truly Necessary?
par: Jedidi, Nour, et autres
Publié: (2025)
par: Jedidi, Nour, et autres
Publié: (2025)
Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
par: Jin, Renren, et autres
Publié: (2025)
par: Jin, Renren, et autres
Publié: (2025)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2024)
par: Xi, Zhiheng, et autres
Publié: (2024)
Conflict-Aware Fusion: Mitigating Logic Inertia in Large Language Models via Structured Cognitive Priors
par: Bao, Qiming, et autres
Publié: (2025)
par: Bao, Qiming, et autres
Publié: (2025)
Learning to Stop Overthinking at Test Time
par: Bao, Hieu Tran, et autres
Publié: (2025)
par: Bao, Hieu Tran, et autres
Publié: (2025)
Beyond Reasoning Gains: Mitigating General Capabilities Forgetting in Large Reasoning Models
par: Phan, Hoang, et autres
Publié: (2025)
par: Phan, Hoang, et autres
Publié: (2025)
A Survey of Reinforcement Learning for Large Reasoning Models
par: Zhang, Kaiyan, et autres
Publié: (2025)
par: Zhang, Kaiyan, et autres
Publié: (2025)
RADAR: Reasoning-Ability and Difficulty-Aware Routing for Reasoning LLMs
par: Fernandez, Nigel, et autres
Publié: (2025)
par: Fernandez, Nigel, et autres
Publié: (2025)
S-GRPO: Early Exit via Reinforcement Learning in Reasoning Models
par: Dai, Muzhi, et autres
Publié: (2025)
par: Dai, Muzhi, et autres
Publié: (2025)
On Predictability of Reinforcement Learning Dynamics for Large Language Models
par: Cai, Yuchen, et autres
Publié: (2025)
par: Cai, Yuchen, et autres
Publié: (2025)
Mitigating LLM Hallucination via Behaviorally Calibrated Reinforcement Learning
par: Wu, Jiayun, et autres
Publié: (2025)
par: Wu, Jiayun, et autres
Publié: (2025)
DecepChain: Inducing Deceptive Reasoning in Large Language Models
par: Shen, Wei, et autres
Publié: (2025)
par: Shen, Wei, et autres
Publié: (2025)
Safe: Enhancing Mathematical Reasoning in Large Language Models via Retrospective Step-aware Formal Verification
par: Liu, Chengwu, et autres
Publié: (2025)
par: Liu, Chengwu, et autres
Publié: (2025)
Can Prompt Difficulty be Online Predicted for Accelerating RL Finetuning of Reasoning Models?
par: Qu, Yun, et autres
Publié: (2025)
par: Qu, Yun, et autres
Publié: (2025)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
par: Wang, Yiping, et autres
Publié: (2025)
par: Wang, Yiping, et autres
Publié: (2025)
RuleReasoner: Reinforced Rule-based Reasoning via Domain-aware Dynamic Sampling
par: Liu, Yang, et autres
Publié: (2025)
par: Liu, Yang, et autres
Publié: (2025)
Cog-Rethinker: Hierarchical Metacognitive Reinforcement Learning for LLM Reasoning
par: Sun, Zexu, et autres
Publié: (2025)
par: Sun, Zexu, et autres
Publié: (2025)
Mitigating Overthinking through Reasoning Shaping
par: Song, Feifan, et autres
Publié: (2025)
par: Song, Feifan, et autres
Publié: (2025)
Optimizing Reasoning Efficiency through Prompt Difficulty Prediction
par: Zhao, Bo, et autres
Publié: (2025)
par: Zhao, Bo, et autres
Publié: (2025)
POT: Inducing Overthinking in LLMs via Black-Box Iterative Optimization
par: Li, Xinyu, et autres
Publié: (2025)
par: Li, Xinyu, et autres
Publié: (2025)
Mitigating Overthinking in Large Reasoning Language Models via Reasoning Path Deviation Monitoring
par: Guan, Weixin, et autres
Publié: (2026)
par: Guan, Weixin, et autres
Publié: (2026)
Precedent-Informed Reasoning: Mitigating Overthinking in Large Reasoning Models via Test-Time Precedent Learning
par: Wang, Qianyue, et autres
Publié: (2026)
par: Wang, Qianyue, et autres
Publié: (2026)
Training Large Language Models to Reason via EM Policy Gradient
par: Xu, Tianbing
Publié: (2025)
par: Xu, Tianbing
Publié: (2025)
Documents similaires
-
Mitigating Overthinking in Large Reasoning Models via Manifold Steering
par: Huang, Yao, et autres
Publié: (2025) -
Beyond Error-Based Optimization: Experience-Driven Symbolic Regression with Goal-Conditioned Reinforcement Learning
par: Sun, Jianwen, et autres
Publié: (2026) -
Explore Briefly, Then Decide: Mitigating LLM Overthinking via Cumulative Entropy Regulation
par: Bin, Yi, et autres
Publié: (2025) -
DAST: Difficulty-Adaptive Slow-Thinking for Large Reasoning Models
par: Shen, Yi, et autres
Publié: (2025) -
Think How to Think: Mitigating Overthinking with Autonomous Difficulty Cognition in Large Reasoning Models
par: Liu, Yongjiang, et autres
Publié: (2025)