Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kong, Deyang, Guo, Qi, Xi, Xiangyu, Wang, Wei, Wang, Jingang, Cai, Xunliang, Zhang, Shikun, Ye, Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Autoformalizer with Tool Feedback
par: Guo, Qi, et autres
Publié: (2025)
par: Guo, Qi, et autres
Publié: (2025)
SampleMix: A Sample-wise Pre-training Data Mixing Strategey by Coordinating Data Quality and Diversity
par: Xi, Xiangyu, et autres
Publié: (2025)
par: Xi, Xiangyu, et autres
Publié: (2025)
OPE: Overcoming Information Saturation in Parallel Thinking via Outline-Guided Path Exploration
par: Guo, Qi, et autres
Publié: (2026)
par: Guo, Qi, et autres
Publié: (2026)
LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning
par: Wang, Jianing, et autres
Publié: (2026)
par: Wang, Jianing, et autres
Publié: (2026)
Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism
par: Liu, Jiahao, et autres
Publié: (2024)
par: Liu, Jiahao, et autres
Publié: (2024)
Expanding Reasoning Potential in Foundation Model by Learning Diverse Chains of Thought Patterns
par: Zhang, Xuemiao, et autres
Publié: (2025)
par: Zhang, Xuemiao, et autres
Publié: (2025)
Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective
par: Zhang, Yuheng, et autres
Publié: (2026)
par: Zhang, Yuheng, et autres
Publié: (2026)
HeavySkill: Heavy Thinking as the Inner Skill in Agentic Harness
par: Wang, Jianing, et autres
Publié: (2026)
par: Wang, Jianing, et autres
Publié: (2026)
Mitigating Overthinking in Large Reasoning Models via Difficulty-aware Reinforcement Learning
par: Wan, Qian, et autres
Publié: (2026)
par: Wan, Qian, et autres
Publié: (2026)
Human-Instruction-Free LLM Self-Alignment with Limited Samples
par: Guo, Hongyi, et autres
Publié: (2024)
par: Guo, Hongyi, et autres
Publié: (2024)
Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy
par: Zhang, Xiaoyun, et autres
Publié: (2025)
par: Zhang, Xiaoyun, et autres
Publié: (2025)
Mitigating Tail Narrowing in LLM Self-Improvement via Socratic-Guided Sampling
par: Ding, Yiwen, et autres
Publié: (2024)
par: Ding, Yiwen, et autres
Publié: (2024)
Rectification Difficulty and Optimal Sample Allocation in LLM-Augmented Surveys
par: Ye, Zikun, et autres
Publié: (2026)
par: Ye, Zikun, et autres
Publié: (2026)
Making Mathematical Reasoning Adaptive
par: Lai, Zhejian, et autres
Publié: (2025)
par: Lai, Zhejian, et autres
Publié: (2025)
SaRO: Enhancing LLM Safety through Reasoning-based Alignment
par: Mou, Yutao, et autres
Publié: (2025)
par: Mou, Yutao, et autres
Publié: (2025)
Cog-Rethinker: Hierarchical Metacognitive Reinforcement Learning for LLM Reasoning
par: Sun, Zexu, et autres
Publié: (2025)
par: Sun, Zexu, et autres
Publié: (2025)
MaskPrune: Mask-based LLM Pruning for Layer-wise Uniform Structures
par: Qin, Jiayu, et autres
Publié: (2025)
par: Qin, Jiayu, et autres
Publié: (2025)
LearnAlign: Data Selection for LLM Reinforcement Learning with Improved Gradient Alignment
par: Li, Shipeng, et autres
Publié: (2025)
par: Li, Shipeng, et autres
Publié: (2025)
What Makes Quantization for Large Language Models Hard? An Empirical Study from the Lens of Perturbation
par: Gong, Zhuocheng, et autres
Publié: (2024)
par: Gong, Zhuocheng, et autres
Publié: (2024)
Rethinking Langevin Thompson Sampling from A Stochastic Approximation Perspective
par: Wang, Weixin, et autres
Publié: (2025)
par: Wang, Weixin, et autres
Publié: (2025)
Online Difficulty Filtering for Reasoning Oriented Reinforcement Learning
par: Bae, Sanghwan, et autres
Publié: (2025)
par: Bae, Sanghwan, et autres
Publié: (2025)
Rethinking the Generation of High-Quality CoT Data from the Perspective of LLM-Adaptive Question Difficulty Grading
par: Yu, Qianjin, et autres
Publié: (2025)
par: Yu, Qianjin, et autres
Publié: (2025)
Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning
par: Li, Ang, et autres
Publié: (2025)
par: Li, Ang, et autres
Publié: (2025)
Scheduling Your LLM Reinforcement Learning with Reasoning Trees
par: Wang, Hong, et autres
Publié: (2025)
par: Wang, Hong, et autres
Publié: (2025)
Learning to Self-Verify Makes Language Models Better Reasoners
par: Chen, Yuxin, et autres
Publié: (2026)
par: Chen, Yuxin, et autres
Publié: (2026)
Learning Like Humans: Advancing LLM Reasoning Capabilities via Adaptive Difficulty Curriculum Learning and Expert-Guided Self-Reformulation
par: Zhang, Enci, et autres
Publié: (2025)
par: Zhang, Enci, et autres
Publié: (2025)
Latent-Space Contrastive Reinforcement Learning for Stable and Efficient LLM Reasoning
par: Shan, Lianlei, et autres
Publié: (2026)
par: Shan, Lianlei, et autres
Publié: (2026)
DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation
par: Zhou, Yang, et autres
Publié: (2026)
par: Zhou, Yang, et autres
Publié: (2026)
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
par: Zhang, Kongcheng, et autres
Publié: (2025)
par: Zhang, Kongcheng, et autres
Publié: (2025)
R-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?
par: Lu, Yi, et autres
Publié: (2025)
par: Lu, Yi, et autres
Publié: (2025)
A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce
par: Xiong, Wei, et autres
Publié: (2025)
par: Xiong, Wei, et autres
Publié: (2025)
Look Before You Leap: Autonomous Exploration for LLM Agents
par: Ye, Ziang, et autres
Publié: (2026)
par: Ye, Ziang, et autres
Publié: (2026)
MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use
par: Zhao, Weikang, et autres
Publié: (2025)
par: Zhao, Weikang, et autres
Publié: (2025)
Rethinking Inverse Reinforcement Learning: from Data Alignment to Task Alignment
par: Zhou, Weichao, et autres
Publié: (2024)
par: Zhou, Weichao, et autres
Publié: (2024)
Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning
par: Shi, Yaorui, et autres
Publié: (2026)
par: Shi, Yaorui, et autres
Publié: (2026)
Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs
par: Chen, Zhengyu, et autres
Publié: (2025)
par: Chen, Zhengyu, et autres
Publié: (2025)
SEAS: Self-Evolving Adversarial Safety Optimization for Large Language Models
par: Diao, Muxi, et autres
Publié: (2024)
par: Diao, Muxi, et autres
Publié: (2024)
Reasoning Pattern Alignment Merging for Adaptive Reasoning
par: Zhong, Zhaofeng, et autres
Publié: (2026)
par: Zhong, Zhaofeng, et autres
Publié: (2026)
AgentRefine: Enhancing Agent Generalization through Refinement Tuning
par: Fu, Dayuan, et autres
Publié: (2025)
par: Fu, Dayuan, et autres
Publié: (2025)
AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents
par: Guo, Zhengkang, et autres
Publié: (2026)
par: Guo, Zhengkang, et autres
Publié: (2026)
Documents similaires
-
Autoformalizer with Tool Feedback
par: Guo, Qi, et autres
Publié: (2025) -
SampleMix: A Sample-wise Pre-training Data Mixing Strategey by Coordinating Data Quality and Diversity
par: Xi, Xiangyu, et autres
Publié: (2025) -
OPE: Overcoming Information Saturation in Parallel Thinking via Outline-Guided Path Exploration
par: Guo, Qi, et autres
Publié: (2026) -
LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning
par: Wang, Jianing, et autres
Publié: (2026) -
Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism
par: Liu, Jiahao, et autres
Publié: (2024)