Saved in:
| Main Authors: | Liao, Zhaokang, Gao, Yingguo, Yang, Yi, Hu, Yongheng, Ding, Jingting |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2604.16972 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Miner:Mining Intrinsic Mastery for Data-Efficient RL in Large Reasoning Models
by: Jiang, Shuyang, et al.
Published: (2026)
by: Jiang, Shuyang, et al.
Published: (2026)
Federated Offline Policy Optimization with Dual Regularization
by: Yue, Sheng, et al.
Published: (2024)
by: Yue, Sheng, et al.
Published: (2024)
MC-CPO: Mastery-Conditioned Constrained Policy Optimization
by: Olukola, Oluseyi, et al.
Published: (2026)
by: Olukola, Oluseyi, et al.
Published: (2026)
From Correction to Mastery: Reinforced Distillation of Large Language Model Agents
by: Lyu, Yuanjie, et al.
Published: (2025)
by: Lyu, Yuanjie, et al.
Published: (2025)
KeenKT: Knowledge Mastery-State Disambiguation for Knowledge Tracing
by: Li, Zhifei, et al.
Published: (2025)
by: Li, Zhifei, et al.
Published: (2025)
Hán Dān Xué Bù (Mimicry) or Qīng Chū Yú Lán (Mastery)? A Cognitive Perspective on Reasoning Distillation in Large Language Models
by: Hu, Yueqing, et al.
Published: (2026)
by: Hu, Yueqing, et al.
Published: (2026)
ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models
by: Yu, Song, et al.
Published: (2026)
by: Yu, Song, et al.
Published: (2026)
LEPO: Latent Reasoning Policy Optimization for Large Language Models
by: Zhou, Yuyan, et al.
Published: (2026)
by: Zhou, Yuyan, et al.
Published: (2026)
Improving Multi-Step Reasoning Abilities of Large Language Models with Direct Advantage Policy Optimization
by: Liu, Jiacai, et al.
Published: (2024)
by: Liu, Jiacai, et al.
Published: (2024)
PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment
by: Li, Jiawei, et al.
Published: (2024)
by: Li, Jiawei, et al.
Published: (2024)
Reasoning Matters: Mitigate Hallucination in Multimodal Large Reasoning Models via Reasoning-Conditioned Preference Optimization
by: Kong, Jiawei, et al.
Published: (2026)
by: Kong, Jiawei, et al.
Published: (2026)
Step-by-Step Mastery: Enhancing Soft Constraint Following Ability of Large Language Models
by: Ren, Qingyu, et al.
Published: (2025)
by: Ren, Qingyu, et al.
Published: (2025)
Beyond Meta-Reasoning: Metacognitive Consolidation for Self-Improving LLM Reasoning
by: Zhuang, Ziqing, et al.
Published: (2026)
by: Zhuang, Ziqing, et al.
Published: (2026)
Optimizing Mastery Learning by Fast-Forwarding Over-Practice Steps
by: Xia, Meng, et al.
Published: (2025)
by: Xia, Meng, et al.
Published: (2025)
SkillMaster: Toward Autonomous Skill Mastery in LLM Agents
by: Yang, Min, et al.
Published: (2026)
by: Yang, Min, et al.
Published: (2026)
Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models
by: Liao, Yi, et al.
Published: (2025)
by: Liao, Yi, et al.
Published: (2025)
ACPO: Adaptive Curriculum Policy Optimization for Aligning Vision-Language Models in Complex Reasoning
by: Wang, Yunhao, et al.
Published: (2025)
by: Wang, Yunhao, et al.
Published: (2025)
AttacKG+:Boosting Attack Knowledge Graph Construction with Large Language Models
by: Zhang, Yongheng, et al.
Published: (2024)
by: Zhang, Yongheng, et al.
Published: (2024)
Reasoning Compression with Mixed-Policy Distillation
by: Yang, Han, et al.
Published: (2026)
by: Yang, Han, et al.
Published: (2026)
CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery
by: Song, Xiaoshuai, et al.
Published: (2024)
by: Song, Xiaoshuai, et al.
Published: (2024)
MKGL: Mastery of a Three-Word Language
by: Guo, Lingbing, et al.
Published: (2024)
by: Guo, Lingbing, et al.
Published: (2024)
Segment-Aligned Policy Optimization for Multi-Modal Reasoning
by: Gao, Lei, et al.
Published: (2026)
by: Gao, Lei, et al.
Published: (2026)
Adaptive Optimization for Enhanced Efficiency in Large-Scale Language Model Training
by: Chen, Jiajing, et al.
Published: (2024)
by: Chen, Jiajing, et al.
Published: (2024)
Evaluating the Logical Reasoning Abilities of Large Reasoning Models
by: Liu, Hanmeng, et al.
Published: (2025)
by: Liu, Hanmeng, et al.
Published: (2025)
ReasonGRM: Enhancing Generative Reward Models through Large Reasoning Models
by: Chen, Bin, et al.
Published: (2025)
by: Chen, Bin, et al.
Published: (2025)
Consolidation via Policy Information Regularization in Deep RL for Multi-Agent Games
by: Malloy, Tailia, et al.
Published: (2020)
by: Malloy, Tailia, et al.
Published: (2020)
Grounding Multi-Hop Reasoning in Structural Causal Models via Group Relative Policy Optimization
by: Bu, Yunhan, et al.
Published: (2026)
by: Bu, Yunhan, et al.
Published: (2026)
Retrieval-Enhanced Mutation Mastery: Augmenting Zero-Shot Prediction of Protein Language Model
by: Tan, Yang, et al.
Published: (2024)
by: Tan, Yang, et al.
Published: (2024)
Memory Retrieval and Consolidation in Large Language Models through Function Tokens
by: Zhang, Shaohua, et al.
Published: (2025)
by: Zhang, Shaohua, et al.
Published: (2025)
NP-Engine: Empowering Optimization Reasoning in Large Language Models with Verifiable Synthetic NP Problems
by: Li, Xiaozhe, et al.
Published: (2025)
by: Li, Xiaozhe, et al.
Published: (2025)
On Reasoning Strength Planning in Large Reasoning Models
by: Sheng, Leheng, et al.
Published: (2025)
by: Sheng, Leheng, et al.
Published: (2025)
Clinical-R1: Empowering Large Language Models for Faithful and Comprehensive Reasoning with Clinical Objective Relative Policy Optimization
by: Gu, Boyang, et al.
Published: (2025)
by: Gu, Boyang, et al.
Published: (2025)
Unearthing Gems from Stones: Policy Optimization with Negative Sample Augmentation for LLM Reasoning
by: Yang, Zhaohui, et al.
Published: (2025)
by: Yang, Zhaohui, et al.
Published: (2025)
Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration
by: Zhao, Yang, et al.
Published: (2026)
by: Zhao, Yang, et al.
Published: (2026)
When Can Large Reasoning Models Save Thinking? Mechanistic Analysis of Behavioral Divergence in Reasoning
by: Zhu, Rongzhi, et al.
Published: (2025)
by: Zhu, Rongzhi, et al.
Published: (2025)
ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement
by: Jiao, Difan, et al.
Published: (2026)
by: Jiao, Difan, et al.
Published: (2026)
Single-stream Policy Optimization
by: Xu, Zhongwen, et al.
Published: (2025)
by: Xu, Zhongwen, et al.
Published: (2025)
CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models
by: Lin, Zhihang, et al.
Published: (2025)
by: Lin, Zhihang, et al.
Published: (2025)
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
by: Li, Gang, et al.
Published: (2025)
by: Li, Gang, et al.
Published: (2025)
Look Before You Leap: Problem Elaboration Prompting Improves Mathematical Reasoning in Large Language Models
by: Liao, Haoran, et al.
Published: (2024)
by: Liao, Haoran, et al.
Published: (2024)
Similar Items
-
Miner:Mining Intrinsic Mastery for Data-Efficient RL in Large Reasoning Models
by: Jiang, Shuyang, et al.
Published: (2026) -
Federated Offline Policy Optimization with Dual Regularization
by: Yue, Sheng, et al.
Published: (2024) -
MC-CPO: Mastery-Conditioned Constrained Policy Optimization
by: Olukola, Oluseyi, et al.
Published: (2026) -
From Correction to Mastery: Reinforced Distillation of Large Language Model Agents
by: Lyu, Yuanjie, et al.
Published: (2025) -
KeenKT: Knowledge Mastery-State Disambiguation for Knowledge Tracing
by: Li, Zhifei, et al.
Published: (2025)