Stop Unnecessary Reflection: Training LRMs for Efficient Reasoning with Adaptive Reflection and Length Coordinated Penalty
Fuente:
arXiv
Guardado en:
| Autores principales: | Yu, Zewei, Gao, Lirong, Zhu, Yuke, Zheng, Bo, Zhao, Junbo, Guo, Sheng, Wang, Haobo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FLoE: Fisher-Based Layer Selection for Efficient Sparse Adaptation of Low-Rank Experts
por: Wang, Xinyi, et al.
Publicado: (2025)
por: Wang, Xinyi, et al.
Publicado: (2025)
Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty
por: Ling, Zehui, et al.
Publicado: (2025)
por: Ling, Zehui, et al.
Publicado: (2025)
LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization
por: Zhang, Qi, et al.
Publicado: (2025)
por: Zhang, Qi, et al.
Publicado: (2025)
Adaptive Stopping for Multi-Turn LLM Reasoning
por: Zhou, Xiaofan, et al.
Publicado: (2026)
por: Zhou, Xiaofan, et al.
Publicado: (2026)
BARREL: Boundary-Aware Reasoning for Factual and Reliable LRMs
por: Yang, Junxiao, et al.
Publicado: (2025)
por: Yang, Junxiao, et al.
Publicado: (2025)
Thinking Out of Order: When Output Order Stops Reflecting Reasoning Order in Diffusion Language Models
por: Yu, Longxuan, et al.
Publicado: (2026)
por: Yu, Longxuan, et al.
Publicado: (2026)
Learn Beyond The Answer: Training Language Models with Reflection for Mathematical Reasoning
por: Zhang, Zhihan, et al.
Publicado: (2024)
por: Zhang, Zhihan, et al.
Publicado: (2024)
Prompt Candidates, then Distill: A Teacher-Student Framework for LLM-driven Data Annotation
por: Xia, Mingxuan, et al.
Publicado: (2025)
por: Xia, Mingxuan, et al.
Publicado: (2025)
Learning from the Irrecoverable: Error-Localized Policy Optimization for Tool-Integrated LLM Reasoning
por: Liang, Qiao, et al.
Publicado: (2026)
por: Liang, Qiao, et al.
Publicado: (2026)
DORY: Deliberative Prompt Recovery for LLM
por: Gao, Lirong, et al.
Publicado: (2024)
por: Gao, Lirong, et al.
Publicado: (2024)
Shorten After You're Right: Lazy Length Penalties for Reasoning RL
por: Yuan, Danlong, et al.
Publicado: (2025)
por: Yuan, Danlong, et al.
Publicado: (2025)
REVISION:Reflective Intent Mining and Online Reasoning Auxiliary for E-commerce Visual Search System Optimization
por: Tang, Yiwen, et al.
Publicado: (2025)
por: Tang, Yiwen, et al.
Publicado: (2025)
QRMeM: Unleash the Length Limitation through Question then Reflection Memory Mechanism
por: Wang, Bo, et al.
Publicado: (2024)
por: Wang, Bo, et al.
Publicado: (2024)
Is Long-to-Short a Free Lunch? Investigating Inconsistency and Reasoning Efficiency in LRMs
por: Yang, Shu, et al.
Publicado: (2025)
por: Yang, Shu, et al.
Publicado: (2025)
TRACES: Tagging Reasoning Steps for Adaptive Cost-Efficient Early-Stopping
por: Belkhiter, Yannis, et al.
Publicado: (2026)
por: Belkhiter, Yannis, et al.
Publicado: (2026)
Logit-Entropy Adaptive Stopping Heuristic for Efficient Chain-of-Thought Reasoning
por: Quamar, Mohammad Atif, et al.
Publicado: (2025)
por: Quamar, Mohammad Atif, et al.
Publicado: (2025)
Stop When Enough: Adaptive Early-Stopping for Chain-of-Thought Reasoning
por: Sun, Renliang, et al.
Publicado: (2025)
por: Sun, Renliang, et al.
Publicado: (2025)
MARCO: Meta-Reflection with Cross-Referencing for Code Reasoning
por: Zhao, Yusheng, et al.
Publicado: (2025)
por: Zhao, Yusheng, et al.
Publicado: (2025)
From Leaky Thoughts to Private Reasoning: Controlling What LRMs Say to Themselves
por: Puerto, Haritz, et al.
Publicado: (2026)
por: Puerto, Haritz, et al.
Publicado: (2026)
D.Va: Validate Your Demonstration First Before You Use It
por: Zhang, Qi, et al.
Publicado: (2025)
por: Zhang, Qi, et al.
Publicado: (2025)
Efficient Reasoning Through Suppression of Self-Affirmation Reflections in Large Reasoning Models
por: Liu, Kaiyuan, et al.
Publicado: (2025)
por: Liu, Kaiyuan, et al.
Publicado: (2025)
Pause and Reflect: Conformal Aggregation for Chain-of-Thought Reasoning
por: Gu, Yu, et al.
Publicado: (2026)
por: Gu, Yu, et al.
Publicado: (2026)
ReflectMT: Internalizing Reflection for Efficient and High-Quality Machine Translation
por: Li, Kunquan, et al.
Publicado: (2026)
por: Li, Kunquan, et al.
Publicado: (2026)
Rethinking Reflection in Pre-Training
por: AI, Essential, et al.
Publicado: (2025)
por: AI, Essential, et al.
Publicado: (2025)
RECOST: External Knowledge Guided Data-efficient Instruction Tuning
por: Zhang, Qi, et al.
Publicado: (2024)
por: Zhang, Qi, et al.
Publicado: (2024)
Anti-Length Shift: Dynamic Outlier Truncation for Training Efficient Reasoning Models
por: Wu, Wei, et al.
Publicado: (2026)
por: Wu, Wei, et al.
Publicado: (2026)
Selective "Selective Prediction": Reducing Unnecessary Abstention in Vision-Language Reasoning
por: Srinivasan, Tejas, et al.
Publicado: (2024)
por: Srinivasan, Tejas, et al.
Publicado: (2024)
Train It and Forget It: Merge Lists are Unnecessary for BPE Inference in Language Models
por: Sawada, Tomohiro, et al.
Publicado: (2025)
por: Sawada, Tomohiro, et al.
Publicado: (2025)
Unlocking Fine-Grained Translation Quality Estimation in LRMs through Synergistically Evolving Implicit and Explicit Reasoning
por: Dang, Renfei, et al.
Publicado: (2026)
por: Dang, Renfei, et al.
Publicado: (2026)
REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning
por: Deng, Hexuan, et al.
Publicado: (2025)
por: Deng, Hexuan, et al.
Publicado: (2025)
PRISM-MCTS: Learning from Reasoning Trajectories with Metacognitive Reflection
por: Cheng, Siyuan, et al.
Publicado: (2026)
por: Cheng, Siyuan, et al.
Publicado: (2026)
Reasoning: From Reflection to Solution
por: Li, Zixi
Publicado: (2025)
por: Li, Zixi
Publicado: (2025)
Revisiting Anthropomorphic Reflection Markers in Large Language Model Reasoning
por: Yu, Yahan, et al.
Publicado: (2026)
por: Yu, Yahan, et al.
Publicado: (2026)
Instruct-of-Reflection: Enhancing Large Language Models Iterative Reflection Capabilities via Dynamic-Meta Instruction
por: Liu, Liping, et al.
Publicado: (2025)
por: Liu, Liping, et al.
Publicado: (2025)
Learn to Reason Efficiently with Adaptive Length-based Reward Shaping
por: Liu, Wei, et al.
Publicado: (2025)
por: Liu, Wei, et al.
Publicado: (2025)
MedReflect: Teaching Medical LLMs to Self-Improve via Reflective Correction
por: Huang, Yue, et al.
Publicado: (2025)
por: Huang, Yue, et al.
Publicado: (2025)
FINEREASON: Evaluating and Improving LLMs' Deliberate Reasoning through Reflective Puzzle Solving
por: Chen, Guizhen, et al.
Publicado: (2025)
por: Chen, Guizhen, et al.
Publicado: (2025)
Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning
por: Zhang, Shenao, et al.
Publicado: (2025)
por: Zhang, Shenao, et al.
Publicado: (2025)
Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression
por: Huang, Jiameng, et al.
Publicado: (2025)
por: Huang, Jiameng, et al.
Publicado: (2025)
TTSR: Test-Time Self-Reflection for Continual Reasoning Improvement
por: He, Haoyang, et al.
Publicado: (2026)
por: He, Haoyang, et al.
Publicado: (2026)
Ejemplares similares
-
FLoE: Fisher-Based Layer Selection for Efficient Sparse Adaptation of Low-Rank Experts
por: Wang, Xinyi, et al.
Publicado: (2025) -
Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty
por: Ling, Zehui, et al.
Publicado: (2025) -
LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization
por: Zhang, Qi, et al.
Publicado: (2025) -
Adaptive Stopping for Multi-Turn LLM Reasoning
por: Zhou, Xiaofan, et al.
Publicado: (2026) -
BARREL: Boundary-Aware Reasoning for Factual and Reliable LRMs
por: Yang, Junxiao, et al.
Publicado: (2025)