Saved in:
| Main Authors: | Ji, Yunjie, Zhao, Sitong, Tian, Xiaoyu, Wang, Haotian, Chen, Shuaiting, Peng, Yiping, Zhao, Han, Li, Xiangang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2504.00829 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DeepDistill: Enhancing LLM Reasoning Capabilities via Large-Scale Difficulty-Graded Data Training
by: Tian, Xiaoyu, et al.
Published: (2025)
by: Tian, Xiaoyu, et al.
Published: (2025)
Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study
by: Tian, Xiaoyu, et al.
Published: (2025)
by: Tian, Xiaoyu, et al.
Published: (2025)
Leveraging Reasoning Model Answers to Enhance Non-Reasoning Model Capability
by: Wang, Haotian, et al.
Published: (2025)
by: Wang, Haotian, et al.
Published: (2025)
Think Twice: Enhancing LLM Reasoning by Scaling Multi-round Test-time Thinking
by: Tian, Xiaoyu, et al.
Published: (2025)
by: Tian, Xiaoyu, et al.
Published: (2025)
AM-Thinking-v1: Advancing the Frontier of Reasoning at 32B Scale
by: Ji, Yunjie, et al.
Published: (2025)
by: Ji, Yunjie, et al.
Published: (2025)
1.4 Million Open-Source Distilled Reasoning Dataset to Empower Large Language Model Training
by: Zhao, Han, et al.
Published: (2025)
by: Zhao, Han, et al.
Published: (2025)
Not All Correct Answers Are Equal: Why Your Distillation Source Matters
by: Tian, Xiaoyu, et al.
Published: (2025)
by: Tian, Xiaoyu, et al.
Published: (2025)
Enhancing the Code Reasoning Capabilities of LLMs via Consistency-based Reinforcement Learning
by: Qin, Zhanyue, et al.
Published: (2026)
by: Qin, Zhanyue, et al.
Published: (2026)
SARI: Structured Audio Reasoning via Curriculum-Guided Reinforcement Learning
by: Wen, Cheng, et al.
Published: (2025)
by: Wen, Cheng, et al.
Published: (2025)
Balancing the Reasoning Load: Difficulty-Differentiated Policy Optimization with Length Redistribution for Efficient and Robust Reinforcement Learning
by: Xia, Yinan, et al.
Published: (2026)
by: Xia, Yinan, et al.
Published: (2026)
DISCO Balances the Scales: Adaptive Domain- and Difficulty-Aware Reinforcement Learning on Imbalanced Data
by: Zhou, Yuhang, et al.
Published: (2025)
by: Zhou, Yuhang, et al.
Published: (2025)
Fino1: On the Transferability of Reasoning-Enhanced LLMs and Reinforcement Learning to Finance
by: Qian, Lingfei, et al.
Published: (2025)
by: Qian, Lingfei, et al.
Published: (2025)
RADAR: Reasoning-Ability and Difficulty-Aware Routing for Reasoning LLMs
by: Fernandez, Nigel, et al.
Published: (2025)
by: Fernandez, Nigel, et al.
Published: (2025)
Enhancing Multi-Modal LLMs Reasoning via Difficulty-Aware Group Normalization
by: Li, Jinghan, et al.
Published: (2026)
by: Li, Jinghan, et al.
Published: (2026)
Enhancing Math Reasoning in Small-sized LLMs via Preview Difficulty-Aware Intervention
by: Di, Xinhan, et al.
Published: (2025)
by: Di, Xinhan, et al.
Published: (2025)
Explore the Reasoning Capability of LLMs in the Chess Testbed
by: Wang, Shu, et al.
Published: (2024)
by: Wang, Shu, et al.
Published: (2024)
R-Log: Incentivizing Log Analysis Capability in LLMs via Reasoning-based Reinforcement Learning
by: Liu, Yilun, et al.
Published: (2025)
by: Liu, Yilun, et al.
Published: (2025)
Memorizing is Not Enough: Deep Knowledge Injection Through Reasoning
by: Xu, Ruoxi, et al.
Published: (2025)
by: Xu, Ruoxi, et al.
Published: (2025)
Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration
by: Deng, Wenhao, et al.
Published: (2025)
by: Deng, Wenhao, et al.
Published: (2025)
Explore the Reinforcement Learning for the LLM based ASR and TTS system
by: Gao, Changfeng, et al.
Published: (2025)
by: Gao, Changfeng, et al.
Published: (2025)
R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning
by: Song, Huatong, et al.
Published: (2025)
by: Song, Huatong, et al.
Published: (2025)
Enhancing LLMs' Reasoning-Intensive Multimedia Search Capabilities through Fine-Tuning and Reinforcement Learning
by: Li, Jinzheng, et al.
Published: (2025)
by: Li, Jinzheng, et al.
Published: (2025)
DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation
by: Zhou, Yang, et al.
Published: (2026)
by: Zhou, Yang, et al.
Published: (2026)
Online Difficulty Filtering for Reasoning Oriented Reinforcement Learning
by: Bae, Sanghwan, et al.
Published: (2025)
by: Bae, Sanghwan, et al.
Published: (2025)
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
by: DeepSeek-AI, et al.
Published: (2025)
by: DeepSeek-AI, et al.
Published: (2025)
Fully Distributed State Estimation for Multi-agent Systems and its Application in Cooperative Localization
by: Huang, Shuaiting, et al.
Published: (2025)
by: Huang, Shuaiting, et al.
Published: (2025)
Learning How Much to Think: Difficulty-Aware Dynamic MoEs for Graph Node Classification
by: Zhou, Jiajun, et al.
Published: (2026)
by: Zhou, Jiajun, et al.
Published: (2026)
Visual-CoG: Stage-Aware Reinforcement Learning with Chain of Guidance for Text-to-Image Generation
by: Li, Yaqi, et al.
Published: (2025)
by: Li, Yaqi, et al.
Published: (2025)
Enhancing Multi-Hop Knowledge Graph Reasoning through Reward Shaping Techniques
by: Li, Chen, et al.
Published: (2024)
by: Li, Chen, et al.
Published: (2024)
GRPO-LEAD: A Difficulty-Aware Reinforcement Learning Approach for Concise Mathematical Reasoning in Language Models
by: Zhang, Jixiao, et al.
Published: (2025)
by: Zhang, Jixiao, et al.
Published: (2025)
From Stimuli to Minds: Enhancing Psychological Reasoning in LLMs via Bilateral Reinforcement Learning
by: Feng, Yichao, et al.
Published: (2025)
by: Feng, Yichao, et al.
Published: (2025)
Can LLMs Learn by Teaching for Better Reasoning? A Preliminary Study
by: Ning, Xuefei, et al.
Published: (2024)
by: Ning, Xuefei, et al.
Published: (2024)
ADHint: Adaptive Hints with Difficulty Priors for Reinforcement Learning
by: Zhang, Feng, et al.
Published: (2025)
by: Zhang, Feng, et al.
Published: (2025)
FlowSE-GRPO: Training Flow Matching Speech Enhancement via Online Reinforcement Learning
by: Wang, Haoxu, et al.
Published: (2026)
by: Wang, Haoxu, et al.
Published: (2026)
How Numerical Precision Affects Arithmetical Reasoning Capabilities of LLMs
by: Feng, Guhao, et al.
Published: (2024)
by: Feng, Guhao, et al.
Published: (2024)
ASTRA: Automated Synthesis of agentic Trajectories and Reinforcement Arenas
by: Tian, Xiaoyu, et al.
Published: (2026)
by: Tian, Xiaoyu, et al.
Published: (2026)
Breaking the Safety-Capability Tradeoff: Reinforcement Learning with Verifiable Rewards Maintains Safety Guardrails in LLMs
by: Cho, Dongkyu Derek, et al.
Published: (2025)
by: Cho, Dongkyu Derek, et al.
Published: (2025)
AAPO: Enhancing the Reasoning Capabilities of LLMs with Advantage Margin
by: Xiong, Jian, et al.
Published: (2025)
by: Xiong, Jian, et al.
Published: (2025)
PACE: Prefix-Protected and Difficulty-Aware Compression for Efficient Reasoning
by: Feng, Ruixiang, et al.
Published: (2026)
by: Feng, Ruixiang, et al.
Published: (2026)
Benchmarking Spatiotemporal Reasoning in LLMs and Reasoning Models: Capabilities and Challenges
by: Quan, Pengrui, et al.
Published: (2025)
by: Quan, Pengrui, et al.
Published: (2025)
Similar Items
-
DeepDistill: Enhancing LLM Reasoning Capabilities via Large-Scale Difficulty-Graded Data Training
by: Tian, Xiaoyu, et al.
Published: (2025) -
Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study
by: Tian, Xiaoyu, et al.
Published: (2025) -
Leveraging Reasoning Model Answers to Enhance Non-Reasoning Model Capability
by: Wang, Haotian, et al.
Published: (2025) -
Think Twice: Enhancing LLM Reasoning by Scaling Multi-round Test-time Thinking
by: Tian, Xiaoyu, et al.
Published: (2025) -
AM-Thinking-v1: Advancing the Frontier of Reasoning at 32B Scale
by: Ji, Yunjie, et al.
Published: (2025)