SuperCorrect: Advancing Small LLM Reasoning with Thought Template Distillation and Self-Correction
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Ling, Yu, Zhaochen, Zhang, Tianjun, Xu, Minkai, Gonzalez, Joseph E., Cui, Bin, Yan, Shuicheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Buffer of Thoughts: Thought-Augmented Reasoning with Large Language Models
di: Yang, Ling, et al.
Pubblicazione: (2024)
di: Yang, Ling, et al.
Pubblicazione: (2024)
ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates
di: Yang, Ling, et al.
Pubblicazione: (2025)
di: Yang, Ling, et al.
Pubblicazione: (2025)
Demystifying Reinforcement Learning in Agentic Reasoning
di: Yu, Zhaochen, et al.
Pubblicazione: (2025)
di: Yu, Zhaochen, et al.
Pubblicazione: (2025)
RATT: A Thought Structure for Coherent and Correct LLM Reasoning
di: Zhang, Jinghan, et al.
Pubblicazione: (2024)
di: Zhang, Jinghan, et al.
Pubblicazione: (2024)
TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning
di: Wu, Jinyang, et al.
Pubblicazione: (2025)
di: Wu, Jinyang, et al.
Pubblicazione: (2025)
Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs
di: Yang, Ling, et al.
Pubblicazione: (2024)
di: Yang, Ling, et al.
Pubblicazione: (2024)
Retrieval-Augmented Self-Taught Reasoning Model with Adaptive Chain-of-Thought for ASR Named Entity Correction
di: An, Junjie, et al.
Pubblicazione: (2026)
di: An, Junjie, et al.
Pubblicazione: (2026)
Small Language Models Need Strong Verifiers to Self-Correct Reasoning
di: Zhang, Yunxiang, et al.
Pubblicazione: (2024)
di: Zhang, Yunxiang, et al.
Pubblicazione: (2024)
Self-Correction Distillation for Structured Data Question Answering
di: Zhu, Yushan, et al.
Pubblicazione: (2025)
di: Zhu, Yushan, et al.
Pubblicazione: (2025)
Correct Prediction, Wrong Steps? Consensus Reasoning Knowledge Graph for Robust Chain-of-Thought Synthesis
di: Ling, Zipeng, et al.
Pubblicazione: (2026)
di: Ling, Zipeng, et al.
Pubblicazione: (2026)
A Probabilistic Inference Scaling Theory for LLM Self-Correction
di: Yang, Zhe, et al.
Pubblicazione: (2025)
di: Yang, Zhe, et al.
Pubblicazione: (2025)
DICE: Structured Reasoning in LLMs through SLM-Guided Chain-of-Thought Correction
di: Li, Yiqi, et al.
Pubblicazione: (2025)
di: Li, Yiqi, et al.
Pubblicazione: (2025)
MedCritical: Enhancing Medical Reasoning in Small Language Models via Self-Collaborative Correction
di: Su, Xinchun, et al.
Pubblicazione: (2025)
di: Su, Xinchun, et al.
Pubblicazione: (2025)
Beyond Output Critique: Self-Correction via Task Distillation
di: Rahmani, Hossein A., et al.
Pubblicazione: (2026)
di: Rahmani, Hossein A., et al.
Pubblicazione: (2026)
Self-Taught Self-Correction for Small Language Models
di: Moskvoretskii, Viktor, et al.
Pubblicazione: (2025)
di: Moskvoretskii, Viktor, et al.
Pubblicazione: (2025)
Contextualized Diffusion Models for Text-Guided Image and Video Generation
di: Yang, Ling, et al.
Pubblicazione: (2024)
di: Yang, Ling, et al.
Pubblicazione: (2024)
Mitigating Spurious Correlations Between Question and Answer via Chain-of-Thought Correctness Perception Distillation
di: Xie, Hongyan, et al.
Pubblicazione: (2025)
di: Xie, Hongyan, et al.
Pubblicazione: (2025)
Neural-Symbolic Collaborative Distillation: Advancing Small Language Models for Complex Reasoning Tasks
di: Liao, Huanxuan, et al.
Pubblicazione: (2024)
di: Liao, Huanxuan, et al.
Pubblicazione: (2024)
Table as Thought: Exploring Structured Thoughts in LLM Reasoning
di: Sun, Zhenjie, et al.
Pubblicazione: (2025)
di: Sun, Zhenjie, et al.
Pubblicazione: (2025)
EvoRoute: Experience-Driven Self-Routing LLM Agent Systems
di: Zhang, Guibin, et al.
Pubblicazione: (2026)
di: Zhang, Guibin, et al.
Pubblicazione: (2026)
PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier
di: Jiang, Yuhua, et al.
Pubblicazione: (2025)
di: Jiang, Yuhua, et al.
Pubblicazione: (2025)
NaturalThoughts: Selecting and Distilling Reasoning Traces for General Reasoning Tasks
di: Li, Yang, et al.
Pubblicazione: (2025)
di: Li, Yang, et al.
Pubblicazione: (2025)
DART: Distilling Autoregressive Reasoning to Silent Thought
di: Jiang, Nan, et al.
Pubblicazione: (2025)
di: Jiang, Nan, et al.
Pubblicazione: (2025)
History-Guided Iterative Visual Reasoning with Self-Correction
di: Yang, Xinglong, et al.
Pubblicazione: (2026)
di: Yang, Xinglong, et al.
Pubblicazione: (2026)
Correcting Hallucinations in News Summaries: Exploration of Self-Correcting LLM Methods with External Knowledge
di: Vladika, Juraj, et al.
Pubblicazione: (2025)
di: Vladika, Juraj, et al.
Pubblicazione: (2025)
Self-Correcting Code Generation Using Small Language Models
di: Cho, Jeonghun, et al.
Pubblicazione: (2025)
di: Cho, Jeonghun, et al.
Pubblicazione: (2025)
Self-Enhanced Reasoning Training: Activating Latent Reasoning in Small Models for Enhanced Reasoning Distillation
di: Zhang, Yong, et al.
Pubblicazione: (2025)
di: Zhang, Yong, et al.
Pubblicazione: (2025)
ThoughtProbe: Classifier-Guided Thought Space Exploration Leveraging LLM Intrinsic Reasoning
di: Wang, Zijian, et al.
Pubblicazione: (2025)
di: Wang, Zijian, et al.
Pubblicazione: (2025)
Triviality Corrected Endogenous Reward
di: Wang, Xinda, et al.
Pubblicazione: (2026)
di: Wang, Xinda, et al.
Pubblicazione: (2026)
MemGen: Weaving Generative Latent Memory for Self-Evolving Agents
di: Zhang, Guibin, et al.
Pubblicazione: (2025)
di: Zhang, Guibin, et al.
Pubblicazione: (2025)
CODI: Compressing Chain-of-Thought into Continuous Space via Self-Distillation
di: Shen, Zhenyi, et al.
Pubblicazione: (2025)
di: Shen, Zhenyi, et al.
Pubblicazione: (2025)
Large Language Models Cannot Self-Correct Reasoning Yet
di: Huang, Jie, et al.
Pubblicazione: (2023)
di: Huang, Jie, et al.
Pubblicazione: (2023)
Unveiling the Key Factors for Distilling Chain-of-Thought Reasoning
di: Chen, Xinghao, et al.
Pubblicazione: (2025)
di: Chen, Xinghao, et al.
Pubblicazione: (2025)
Learning When to Sample: Confidence-Aware Self-Consistency for Efficient LLM Chain-of-Thought Reasoning
di: Xiong, Juming, et al.
Pubblicazione: (2026)
di: Xiong, Juming, et al.
Pubblicazione: (2026)
RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance
di: Chen, Tianlang, et al.
Pubblicazione: (2025)
di: Chen, Tianlang, et al.
Pubblicazione: (2025)
Skill-Conditioned Gated Self-Distillation for LLM Reasoning
di: Huang, Jiazhen, et al.
Pubblicazione: (2026)
di: Huang, Jiazhen, et al.
Pubblicazione: (2026)
Enhancing Long-Chain Reasoning Distillation through Error-Aware Self-Reflection
di: Wu, Zhuoyang, et al.
Pubblicazione: (2025)
di: Wu, Zhuoyang, et al.
Pubblicazione: (2025)
ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities
di: Hong, Zhaochen, et al.
Pubblicazione: (2025)
di: Hong, Zhaochen, et al.
Pubblicazione: (2025)
Symbolic Chain-of-Thought Distillation: Small Models Can Also "Think" Step-by-Step
di: Li, Liunian Harold, et al.
Pubblicazione: (2023)
di: Li, Liunian Harold, et al.
Pubblicazione: (2023)
Recall with Reasoning: Chain-of-Thought Distillation for Mamba's Long-Context Memory and Extrapolation
di: Ma, Junyu, et al.
Pubblicazione: (2025)
di: Ma, Junyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Buffer of Thoughts: Thought-Augmented Reasoning with Large Language Models
di: Yang, Ling, et al.
Pubblicazione: (2024) -
ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates
di: Yang, Ling, et al.
Pubblicazione: (2025) -
Demystifying Reinforcement Learning in Agentic Reasoning
di: Yu, Zhaochen, et al.
Pubblicazione: (2025) -
RATT: A Thought Structure for Coherent and Correct LLM Reasoning
di: Zhang, Jinghan, et al.
Pubblicazione: (2024) -
TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning
di: Wu, Jinyang, et al.
Pubblicazione: (2025)