Stop Unnecessary Reflection: Training LRMs for Efficient Reasoning with Adaptive Reflection and Length Coordinated Penalty
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Zewei, Gao, Lirong, Zhu, Yuke, Zheng, Bo, Zhao, Junbo, Guo, Sheng, Wang, Haobo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FLoE: Fisher-Based Layer Selection for Efficient Sparse Adaptation of Low-Rank Experts
par: Wang, Xinyi, et autres
Publié: (2025)
par: Wang, Xinyi, et autres
Publié: (2025)
Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty
par: Ling, Zehui, et autres
Publié: (2025)
par: Ling, Zehui, et autres
Publié: (2025)
LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization
par: Zhang, Qi, et autres
Publié: (2025)
par: Zhang, Qi, et autres
Publié: (2025)
Adaptive Stopping for Multi-Turn LLM Reasoning
par: Zhou, Xiaofan, et autres
Publié: (2026)
par: Zhou, Xiaofan, et autres
Publié: (2026)
BARREL: Boundary-Aware Reasoning for Factual and Reliable LRMs
par: Yang, Junxiao, et autres
Publié: (2025)
par: Yang, Junxiao, et autres
Publié: (2025)
Thinking Out of Order: When Output Order Stops Reflecting Reasoning Order in Diffusion Language Models
par: Yu, Longxuan, et autres
Publié: (2026)
par: Yu, Longxuan, et autres
Publié: (2026)
Learn Beyond The Answer: Training Language Models with Reflection for Mathematical Reasoning
par: Zhang, Zhihan, et autres
Publié: (2024)
par: Zhang, Zhihan, et autres
Publié: (2024)
Prompt Candidates, then Distill: A Teacher-Student Framework for LLM-driven Data Annotation
par: Xia, Mingxuan, et autres
Publié: (2025)
par: Xia, Mingxuan, et autres
Publié: (2025)
Learning from the Irrecoverable: Error-Localized Policy Optimization for Tool-Integrated LLM Reasoning
par: Liang, Qiao, et autres
Publié: (2026)
par: Liang, Qiao, et autres
Publié: (2026)
DORY: Deliberative Prompt Recovery for LLM
par: Gao, Lirong, et autres
Publié: (2024)
par: Gao, Lirong, et autres
Publié: (2024)
Shorten After You're Right: Lazy Length Penalties for Reasoning RL
par: Yuan, Danlong, et autres
Publié: (2025)
par: Yuan, Danlong, et autres
Publié: (2025)
REVISION:Reflective Intent Mining and Online Reasoning Auxiliary for E-commerce Visual Search System Optimization
par: Tang, Yiwen, et autres
Publié: (2025)
par: Tang, Yiwen, et autres
Publié: (2025)
QRMeM: Unleash the Length Limitation through Question then Reflection Memory Mechanism
par: Wang, Bo, et autres
Publié: (2024)
par: Wang, Bo, et autres
Publié: (2024)
Is Long-to-Short a Free Lunch? Investigating Inconsistency and Reasoning Efficiency in LRMs
par: Yang, Shu, et autres
Publié: (2025)
par: Yang, Shu, et autres
Publié: (2025)
TRACES: Tagging Reasoning Steps for Adaptive Cost-Efficient Early-Stopping
par: Belkhiter, Yannis, et autres
Publié: (2026)
par: Belkhiter, Yannis, et autres
Publié: (2026)
Logit-Entropy Adaptive Stopping Heuristic for Efficient Chain-of-Thought Reasoning
par: Quamar, Mohammad Atif, et autres
Publié: (2025)
par: Quamar, Mohammad Atif, et autres
Publié: (2025)
Stop When Enough: Adaptive Early-Stopping for Chain-of-Thought Reasoning
par: Sun, Renliang, et autres
Publié: (2025)
par: Sun, Renliang, et autres
Publié: (2025)
MARCO: Meta-Reflection with Cross-Referencing for Code Reasoning
par: Zhao, Yusheng, et autres
Publié: (2025)
par: Zhao, Yusheng, et autres
Publié: (2025)
From Leaky Thoughts to Private Reasoning: Controlling What LRMs Say to Themselves
par: Puerto, Haritz, et autres
Publié: (2026)
par: Puerto, Haritz, et autres
Publié: (2026)
D.Va: Validate Your Demonstration First Before You Use It
par: Zhang, Qi, et autres
Publié: (2025)
par: Zhang, Qi, et autres
Publié: (2025)
Efficient Reasoning Through Suppression of Self-Affirmation Reflections in Large Reasoning Models
par: Liu, Kaiyuan, et autres
Publié: (2025)
par: Liu, Kaiyuan, et autres
Publié: (2025)
Pause and Reflect: Conformal Aggregation for Chain-of-Thought Reasoning
par: Gu, Yu, et autres
Publié: (2026)
par: Gu, Yu, et autres
Publié: (2026)
ReflectMT: Internalizing Reflection for Efficient and High-Quality Machine Translation
par: Li, Kunquan, et autres
Publié: (2026)
par: Li, Kunquan, et autres
Publié: (2026)
Rethinking Reflection in Pre-Training
par: AI, Essential, et autres
Publié: (2025)
par: AI, Essential, et autres
Publié: (2025)
RECOST: External Knowledge Guided Data-efficient Instruction Tuning
par: Zhang, Qi, et autres
Publié: (2024)
par: Zhang, Qi, et autres
Publié: (2024)
Anti-Length Shift: Dynamic Outlier Truncation for Training Efficient Reasoning Models
par: Wu, Wei, et autres
Publié: (2026)
par: Wu, Wei, et autres
Publié: (2026)
Selective "Selective Prediction": Reducing Unnecessary Abstention in Vision-Language Reasoning
par: Srinivasan, Tejas, et autres
Publié: (2024)
par: Srinivasan, Tejas, et autres
Publié: (2024)
Train It and Forget It: Merge Lists are Unnecessary for BPE Inference in Language Models
par: Sawada, Tomohiro, et autres
Publié: (2025)
par: Sawada, Tomohiro, et autres
Publié: (2025)
Unlocking Fine-Grained Translation Quality Estimation in LRMs through Synergistically Evolving Implicit and Explicit Reasoning
par: Dang, Renfei, et autres
Publié: (2026)
par: Dang, Renfei, et autres
Publié: (2026)
REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning
par: Deng, Hexuan, et autres
Publié: (2025)
par: Deng, Hexuan, et autres
Publié: (2025)
PRISM-MCTS: Learning from Reasoning Trajectories with Metacognitive Reflection
par: Cheng, Siyuan, et autres
Publié: (2026)
par: Cheng, Siyuan, et autres
Publié: (2026)
Reasoning: From Reflection to Solution
par: Li, Zixi
Publié: (2025)
par: Li, Zixi
Publié: (2025)
Revisiting Anthropomorphic Reflection Markers in Large Language Model Reasoning
par: Yu, Yahan, et autres
Publié: (2026)
par: Yu, Yahan, et autres
Publié: (2026)
Instruct-of-Reflection: Enhancing Large Language Models Iterative Reflection Capabilities via Dynamic-Meta Instruction
par: Liu, Liping, et autres
Publié: (2025)
par: Liu, Liping, et autres
Publié: (2025)
Learn to Reason Efficiently with Adaptive Length-based Reward Shaping
par: Liu, Wei, et autres
Publié: (2025)
par: Liu, Wei, et autres
Publié: (2025)
MedReflect: Teaching Medical LLMs to Self-Improve via Reflective Correction
par: Huang, Yue, et autres
Publié: (2025)
par: Huang, Yue, et autres
Publié: (2025)
FINEREASON: Evaluating and Improving LLMs' Deliberate Reasoning through Reflective Puzzle Solving
par: Chen, Guizhen, et autres
Publié: (2025)
par: Chen, Guizhen, et autres
Publié: (2025)
Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning
par: Zhang, Shenao, et autres
Publié: (2025)
par: Zhang, Shenao, et autres
Publié: (2025)
Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression
par: Huang, Jiameng, et autres
Publié: (2025)
par: Huang, Jiameng, et autres
Publié: (2025)
TTSR: Test-Time Self-Reflection for Continual Reasoning Improvement
par: He, Haoyang, et autres
Publié: (2026)
par: He, Haoyang, et autres
Publié: (2026)
Documents similaires
-
FLoE: Fisher-Based Layer Selection for Efficient Sparse Adaptation of Low-Rank Experts
par: Wang, Xinyi, et autres
Publié: (2025) -
Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty
par: Ling, Zehui, et autres
Publié: (2025) -
LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization
par: Zhang, Qi, et autres
Publié: (2025) -
Adaptive Stopping for Multi-Turn LLM Reasoning
par: Zhou, Xiaofan, et autres
Publié: (2026) -
BARREL: Boundary-Aware Reasoning for Factual and Reliable LRMs
par: Yang, Junxiao, et autres
Publié: (2025)