Self-Enhanced Reasoning Training: Activating Latent Reasoning in Small Models for Enhanced Reasoning Distillation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Yong, Zhang, Bingyuan, Li, Zhitao, Li, Ming, Cheng, Ning, Chen, Minchuan, Wei, Tao, Ma, Jun, Wang, Shaojun, Xiao, Jing |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reasoning-Enhanced Self-Training for Long-Form Personalized Text Generation
par: Salemi, Alireza, et autres
Publié: (2025)
par: Salemi, Alireza, et autres
Publié: (2025)
Training with Harnesses: On-Policy Harness Self-Distillation for Complex Reasoning
par: Zhao, Zhengyang, et autres
Publié: (2026)
par: Zhao, Zhengyang, et autres
Publié: (2026)
Dynamic Attention-Guided Context Decoding for Mitigating Context Faithfulness Hallucinations in Large Language Models
par: Huang, Yanwen, et autres
Publié: (2025)
par: Huang, Yanwen, et autres
Publié: (2025)
GRASP: Replace Redundant Layers with Adaptive Singular Parameters for Efficient Model Compression
par: Liu, Kainan, et autres
Publié: (2024)
par: Liu, Kainan, et autres
Publié: (2024)
Distilling Mathematical Reasoning Capabilities into Small Language Models
par: Zhu, Xunyu, et autres
Publié: (2024)
par: Zhu, Xunyu, et autres
Publié: (2024)
Enhancing Long-Chain Reasoning Distillation through Error-Aware Self-Reflection
par: Wu, Zhuoyang, et autres
Publié: (2025)
par: Wu, Zhuoyang, et autres
Publié: (2025)
Self-playing Adversarial Language Game Enhances LLM Reasoning
par: Cheng, Pengyu, et autres
Publié: (2024)
par: Cheng, Pengyu, et autres
Publié: (2024)
Reliable Reasoning Path: Distilling Effective Guidance for LLM Reasoning with Knowledge Graphs
par: Xiao, Yilin, et autres
Publié: (2025)
par: Xiao, Yilin, et autres
Publié: (2025)
Skill-Conditioned Gated Self-Distillation for LLM Reasoning
par: Huang, Jiazhen, et autres
Publié: (2026)
par: Huang, Jiazhen, et autres
Publié: (2026)
Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning
par: Wu, Tong, et autres
Publié: (2025)
par: Wu, Tong, et autres
Publié: (2025)
Diving into Self-Evolving Training for Multimodal Reasoning
par: Liu, Wei, et autres
Publié: (2024)
par: Liu, Wei, et autres
Publié: (2024)
MedCritical: Enhancing Medical Reasoning in Small Language Models via Self-Collaborative Correction
par: Su, Xinchun, et autres
Publié: (2025)
par: Su, Xinchun, et autres
Publié: (2025)
OneSearch-V2: The Latent Reasoning Enhanced Self-distillation Generative Search Framework
par: Chen, Ben, et autres
Publié: (2026)
par: Chen, Ben, et autres
Publié: (2026)
AERO: Autonomous Evolutionary Reasoning Optimization via Endogenous Dual-Loop Feedback
par: Gao, Zhitao, et autres
Publié: (2026)
par: Gao, Zhitao, et autres
Publié: (2026)
QLSC: A Query Latent Semantic Calibrator for Robust Extractive Question Answering
par: Ouyang, Sheng, et autres
Publié: (2024)
par: Ouyang, Sheng, et autres
Publié: (2024)
LLM Reasoning Engine: Specialized Training for Enhanced Mathematical Reasoning
par: Chen, Shuguang, et autres
Publié: (2024)
par: Chen, Shuguang, et autres
Publié: (2024)
Enhancing Reasoning Abilities of Small LLMs with Cognitive Alignment
par: Cai, Wenrui, et autres
Publié: (2025)
par: Cai, Wenrui, et autres
Publié: (2025)
Leveraging Biases in Large Language Models: "bias-kNN'' for Effective Few-Shot Learning
par: Zhang, Yong, et autres
Publié: (2024)
par: Zhang, Yong, et autres
Publié: (2024)
Reasoning in the Dark: Interleaved Vision-Text Reasoning in Latent Space
par: Chen, Chao, et autres
Publié: (2025)
par: Chen, Chao, et autres
Publié: (2025)
ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack
par: Li, Hao, et autres
Publié: (2026)
par: Li, Hao, et autres
Publié: (2026)
A Survey on Latent Reasoning
par: Zhu, Rui-Jie, et autres
Publié: (2025)
par: Zhu, Rui-Jie, et autres
Publié: (2025)
SuperCorrect: Advancing Small LLM Reasoning with Thought Template Distillation and Self-Correction
par: Yang, Ling, et autres
Publié: (2024)
par: Yang, Ling, et autres
Publié: (2024)
PFID: Privacy First Inference Delegation Framework for LLMs
par: Yang, Haoyan, et autres
Publié: (2024)
par: Yang, Haoyan, et autres
Publié: (2024)
xVerify: Efficient Answer Verifier for Reasoning Model Evaluations
par: Chen, Ding, et autres
Publié: (2025)
par: Chen, Ding, et autres
Publié: (2025)
Detecting Distillation Data from Reasoning Models
par: Zhang, Hengxiang, et autres
Publié: (2025)
par: Zhang, Hengxiang, et autres
Publié: (2025)
Enhancing Numerical Reasoning with the Guidance of Reliable Reasoning Processes
par: Wang, Dingzirui, et autres
Publié: (2024)
par: Wang, Dingzirui, et autres
Publié: (2024)
Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs
par: Zhu, Mengdan, et autres
Publié: (2026)
par: Zhu, Mengdan, et autres
Publié: (2026)
Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
par: Zhao, Siyan, et autres
Publié: (2026)
par: Zhao, Siyan, et autres
Publié: (2026)
LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning
par: Kang, Haoqiang, et autres
Publié: (2025)
par: Kang, Haoqiang, et autres
Publié: (2025)
DeepDistill: Enhancing LLM Reasoning Capabilities via Large-Scale Difficulty-Graded Data Training
par: Tian, Xiaoyu, et autres
Publié: (2025)
par: Tian, Xiaoyu, et autres
Publié: (2025)
From Quantity to Quality: Boosting LLM Performance with Self-Guided Data Selection for Instruction Tuning
par: Li, Ming, et autres
Publié: (2023)
par: Li, Ming, et autres
Publié: (2023)
Unconstrained Model Merging for Enhanced LLM Reasoning
par: Zhang, Yiming, et autres
Publié: (2024)
par: Zhang, Yiming, et autres
Publié: (2024)
Astra: Activation-Space Tail-Eigenvector Low-Rank Adaptation of Large Language Models
par: Liu, Kainan, et autres
Publié: (2026)
par: Liu, Kainan, et autres
Publié: (2026)
Continual Dialogue State Tracking via Reason-of-Select Distillation
par: Feng, Yujie, et autres
Publié: (2024)
par: Feng, Yujie, et autres
Publié: (2024)
Reasoning Beyond Language: A Comprehensive Survey on Latent Chain-of-Thought Reasoning
par: Chen, Xinghao, et autres
Publié: (2025)
par: Chen, Xinghao, et autres
Publié: (2025)
Enhancing the Reasoning Capabilities of Small Language Models via Solution Guidance Fine-Tuning
par: Bi, Jing, et autres
Publié: (2024)
par: Bi, Jing, et autres
Publié: (2024)
Balanced Actor Initialization: Stable RLHF Training of Distillation-Based Reasoning Models
par: Zheng, Chen, et autres
Publié: (2025)
par: Zheng, Chen, et autres
Publié: (2025)
Neural-Symbolic Collaborative Distillation: Advancing Small Language Models for Complex Reasoning Tasks
par: Liao, Huanxuan, et autres
Publié: (2024)
par: Liao, Huanxuan, et autres
Publié: (2024)
Enhancing Language Agent Strategic Reasoning through Self-Play in Adversarial Games
par: Zhang, Yikai, et autres
Publié: (2025)
par: Zhang, Yikai, et autres
Publié: (2025)
Reasoning-preserved Efficient Distillation of Large Language Models via Activation-aware Initialization
par: He, Junlin, et autres
Publié: (2026)
par: He, Junlin, et autres
Publié: (2026)
Documents similaires
-
Reasoning-Enhanced Self-Training for Long-Form Personalized Text Generation
par: Salemi, Alireza, et autres
Publié: (2025) -
Training with Harnesses: On-Policy Harness Self-Distillation for Complex Reasoning
par: Zhao, Zhengyang, et autres
Publié: (2026) -
Dynamic Attention-Guided Context Decoding for Mitigating Context Faithfulness Hallucinations in Large Language Models
par: Huang, Yanwen, et autres
Publié: (2025) -
GRASP: Replace Redundant Layers with Adaptive Singular Parameters for Efficient Model Compression
par: Liu, Kainan, et autres
Publié: (2024) -
Distilling Mathematical Reasoning Capabilities into Small Language Models
par: Zhu, Xunyu, et autres
Publié: (2024)