How Difficulty-Aware Staged Reinforcement Learning Enhances LLMs' Reasoning Capabilities: A Preliminary Experimental Study
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ji, Yunjie, Zhao, Sitong, Tian, Xiaoyu, Wang, Haotian, Chen, Shuaiting, Peng, Yiping, Zhao, Han, Li, Xiangang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
DeepDistill: Enhancing LLM Reasoning Capabilities via Large-Scale Difficulty-Graded Data Training
von: Tian, Xiaoyu, et al.
Veröffentlicht: (2025)
von: Tian, Xiaoyu, et al.
Veröffentlicht: (2025)
Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study
von: Tian, Xiaoyu, et al.
Veröffentlicht: (2025)
von: Tian, Xiaoyu, et al.
Veröffentlicht: (2025)
Leveraging Reasoning Model Answers to Enhance Non-Reasoning Model Capability
von: Wang, Haotian, et al.
Veröffentlicht: (2025)
von: Wang, Haotian, et al.
Veröffentlicht: (2025)
Think Twice: Enhancing LLM Reasoning by Scaling Multi-round Test-time Thinking
von: Tian, Xiaoyu, et al.
Veröffentlicht: (2025)
von: Tian, Xiaoyu, et al.
Veröffentlicht: (2025)
AM-Thinking-v1: Advancing the Frontier of Reasoning at 32B Scale
von: Ji, Yunjie, et al.
Veröffentlicht: (2025)
von: Ji, Yunjie, et al.
Veröffentlicht: (2025)
1.4 Million Open-Source Distilled Reasoning Dataset to Empower Large Language Model Training
von: Zhao, Han, et al.
Veröffentlicht: (2025)
von: Zhao, Han, et al.
Veröffentlicht: (2025)
Not All Correct Answers Are Equal: Why Your Distillation Source Matters
von: Tian, Xiaoyu, et al.
Veröffentlicht: (2025)
von: Tian, Xiaoyu, et al.
Veröffentlicht: (2025)
Enhancing the Code Reasoning Capabilities of LLMs via Consistency-based Reinforcement Learning
von: Qin, Zhanyue, et al.
Veröffentlicht: (2026)
von: Qin, Zhanyue, et al.
Veröffentlicht: (2026)
SARI: Structured Audio Reasoning via Curriculum-Guided Reinforcement Learning
von: Wen, Cheng, et al.
Veröffentlicht: (2025)
von: Wen, Cheng, et al.
Veröffentlicht: (2025)
Balancing the Reasoning Load: Difficulty-Differentiated Policy Optimization with Length Redistribution for Efficient and Robust Reinforcement Learning
von: Xia, Yinan, et al.
Veröffentlicht: (2026)
von: Xia, Yinan, et al.
Veröffentlicht: (2026)
Fino1: On the Transferability of Reasoning-Enhanced LLMs and Reinforcement Learning to Finance
von: Qian, Lingfei, et al.
Veröffentlicht: (2025)
von: Qian, Lingfei, et al.
Veröffentlicht: (2025)
RADAR: Reasoning-Ability and Difficulty-Aware Routing for Reasoning LLMs
von: Fernandez, Nigel, et al.
Veröffentlicht: (2025)
von: Fernandez, Nigel, et al.
Veröffentlicht: (2025)
DISCO Balances the Scales: Adaptive Domain- and Difficulty-Aware Reinforcement Learning on Imbalanced Data
von: Zhou, Yuhang, et al.
Veröffentlicht: (2025)
von: Zhou, Yuhang, et al.
Veröffentlicht: (2025)
Enhancing Multi-Modal LLMs Reasoning via Difficulty-Aware Group Normalization
von: Li, Jinghan, et al.
Veröffentlicht: (2026)
von: Li, Jinghan, et al.
Veröffentlicht: (2026)
Enhancing Math Reasoning in Small-sized LLMs via Preview Difficulty-Aware Intervention
von: Di, Xinhan, et al.
Veröffentlicht: (2025)
von: Di, Xinhan, et al.
Veröffentlicht: (2025)
R-Log: Incentivizing Log Analysis Capability in LLMs via Reasoning-based Reinforcement Learning
von: Liu, Yilun, et al.
Veröffentlicht: (2025)
von: Liu, Yilun, et al.
Veröffentlicht: (2025)
Explore the Reasoning Capability of LLMs in the Chess Testbed
von: Wang, Shu, et al.
Veröffentlicht: (2024)
von: Wang, Shu, et al.
Veröffentlicht: (2024)
Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration
von: Deng, Wenhao, et al.
Veröffentlicht: (2025)
von: Deng, Wenhao, et al.
Veröffentlicht: (2025)
Enhancing LLMs' Reasoning-Intensive Multimedia Search Capabilities through Fine-Tuning and Reinforcement Learning
von: Li, Jinzheng, et al.
Veröffentlicht: (2025)
von: Li, Jinzheng, et al.
Veröffentlicht: (2025)
R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning
von: Song, Huatong, et al.
Veröffentlicht: (2025)
von: Song, Huatong, et al.
Veröffentlicht: (2025)
Online Difficulty Filtering for Reasoning Oriented Reinforcement Learning
von: Bae, Sanghwan, et al.
Veröffentlicht: (2025)
von: Bae, Sanghwan, et al.
Veröffentlicht: (2025)
DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation
von: Zhou, Yang, et al.
Veröffentlicht: (2026)
von: Zhou, Yang, et al.
Veröffentlicht: (2026)
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
von: DeepSeek-AI, et al.
Veröffentlicht: (2025)
von: DeepSeek-AI, et al.
Veröffentlicht: (2025)
Memorizing is Not Enough: Deep Knowledge Injection Through Reasoning
von: Xu, Ruoxi, et al.
Veröffentlicht: (2025)
von: Xu, Ruoxi, et al.
Veröffentlicht: (2025)
Explore the Reinforcement Learning for the LLM based ASR and TTS system
von: Gao, Changfeng, et al.
Veröffentlicht: (2025)
von: Gao, Changfeng, et al.
Veröffentlicht: (2025)
Learning How Much to Think: Difficulty-Aware Dynamic MoEs for Graph Node Classification
von: Zhou, Jiajun, et al.
Veröffentlicht: (2026)
von: Zhou, Jiajun, et al.
Veröffentlicht: (2026)
Visual-CoG: Stage-Aware Reinforcement Learning with Chain of Guidance for Text-to-Image Generation
von: Li, Yaqi, et al.
Veröffentlicht: (2025)
von: Li, Yaqi, et al.
Veröffentlicht: (2025)
GRPO-LEAD: A Difficulty-Aware Reinforcement Learning Approach for Concise Mathematical Reasoning in Language Models
von: Zhang, Jixiao, et al.
Veröffentlicht: (2025)
von: Zhang, Jixiao, et al.
Veröffentlicht: (2025)
From Stimuli to Minds: Enhancing Psychological Reasoning in LLMs via Bilateral Reinforcement Learning
von: Feng, Yichao, et al.
Veröffentlicht: (2025)
von: Feng, Yichao, et al.
Veröffentlicht: (2025)
Can LLMs Learn by Teaching for Better Reasoning? A Preliminary Study
von: Ning, Xuefei, et al.
Veröffentlicht: (2024)
von: Ning, Xuefei, et al.
Veröffentlicht: (2024)
ADHint: Adaptive Hints with Difficulty Priors for Reinforcement Learning
von: Zhang, Feng, et al.
Veröffentlicht: (2025)
von: Zhang, Feng, et al.
Veröffentlicht: (2025)
How Numerical Precision Affects Arithmetical Reasoning Capabilities of LLMs
von: Feng, Guhao, et al.
Veröffentlicht: (2024)
von: Feng, Guhao, et al.
Veröffentlicht: (2024)
AAPO: Enhancing the Reasoning Capabilities of LLMs with Advantage Margin
von: Xiong, Jian, et al.
Veröffentlicht: (2025)
von: Xiong, Jian, et al.
Veröffentlicht: (2025)
Enhancing Multi-Hop Knowledge Graph Reasoning through Reward Shaping Techniques
von: Li, Chen, et al.
Veröffentlicht: (2024)
von: Li, Chen, et al.
Veröffentlicht: (2024)
Breaking the Safety-Capability Tradeoff: Reinforcement Learning with Verifiable Rewards Maintains Safety Guardrails in LLMs
von: Cho, Dongkyu Derek, et al.
Veröffentlicht: (2025)
von: Cho, Dongkyu Derek, et al.
Veröffentlicht: (2025)
Fully Distributed State Estimation for Multi-agent Systems and its Application in Cooperative Localization
von: Huang, Shuaiting, et al.
Veröffentlicht: (2025)
von: Huang, Shuaiting, et al.
Veröffentlicht: (2025)
Benchmarking Spatiotemporal Reasoning in LLMs and Reasoning Models: Capabilities and Challenges
von: Quan, Pengrui, et al.
Veröffentlicht: (2025)
von: Quan, Pengrui, et al.
Veröffentlicht: (2025)
PACE: Prefix-Protected and Difficulty-Aware Compression for Efficient Reasoning
von: Feng, Ruixiang, et al.
Veröffentlicht: (2026)
von: Feng, Ruixiang, et al.
Veröffentlicht: (2026)
Legal Mathematical Reasoning with LLMs: Procedural Alignment through Two-Stage Reinforcement Learning
von: Zhang, Kepu, et al.
Veröffentlicht: (2025)
von: Zhang, Kepu, et al.
Veröffentlicht: (2025)
Saliency-R1: Incentivizing Unified Saliency Reasoning Capability in MLLM with Confidence-Guided Reinforcement Learning
von: Li, Long, et al.
Veröffentlicht: (2025)
von: Li, Long, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
DeepDistill: Enhancing LLM Reasoning Capabilities via Large-Scale Difficulty-Graded Data Training
von: Tian, Xiaoyu, et al.
Veröffentlicht: (2025) -
Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study
von: Tian, Xiaoyu, et al.
Veröffentlicht: (2025) -
Leveraging Reasoning Model Answers to Enhance Non-Reasoning Model Capability
von: Wang, Haotian, et al.
Veröffentlicht: (2025) -
Think Twice: Enhancing LLM Reasoning by Scaling Multi-round Test-time Thinking
von: Tian, Xiaoyu, et al.
Veröffentlicht: (2025) -
AM-Thinking-v1: Advancing the Frontier of Reasoning at 32B Scale
von: Ji, Yunjie, et al.
Veröffentlicht: (2025)