Learning to Reason via Self-Iterative Process Feedback for Small Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Kaiyuan, Wang, Jin, Zhang, Xuejie |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SAPO: Self-Adaptive Process Optimization Makes Small Reasoners Stronger
par: Chen, Kaiyuan, et autres
Publié: (2026)
par: Chen, Kaiyuan, et autres
Publié: (2026)
Chinese Metaphor Recognition Using a Multi-stage Prompting Large Language Model
par: Wang, Jie, et autres
Publié: (2024)
par: Wang, Jie, et autres
Publié: (2024)
Improving Mathematical Reasoning Capabilities of Small Language Models via Feedback-Driven Distillation
par: Zhu, Xunyu, et autres
Publié: (2024)
par: Zhu, Xunyu, et autres
Publié: (2024)
Small Language Models Need Strong Verifiers to Self-Correct Reasoning
par: Zhang, Yunxiang, et autres
Publié: (2024)
par: Zhang, Yunxiang, et autres
Publié: (2024)
Coherent Multimodal Reasoning with Iterative Self-Evaluation for Vision-Language Models
par: Luo, Wenjie, et autres
Publié: (2025)
par: Luo, Wenjie, et autres
Publié: (2025)
SoftMCL: Soft Momentum Contrastive Learning for Fine-grained Sentiment-aware Pre-training
par: Wang, Jin, et autres
Publié: (2024)
par: Wang, Jin, et autres
Publié: (2024)
DuetSim: Building User Simulator with Dual Large Language Models for Task-Oriented Dialogues
par: Luo, Xiang, et autres
Publié: (2024)
par: Luo, Xiang, et autres
Publié: (2024)
The Path of Self-Evolving Large Language Models: Achieving Data-Efficient Learning via Intrinsic Feedback
par: Zhang, Hangfan, et autres
Publié: (2025)
par: Zhang, Hangfan, et autres
Publié: (2025)
Efficient Reasoning Through Suppression of Self-Affirmation Reflections in Large Reasoning Models
par: Liu, Kaiyuan, et autres
Publié: (2025)
par: Liu, Kaiyuan, et autres
Publié: (2025)
Sample-aware Adaptive Structured Pruning for Large Language Models
par: Kong, Jun, et autres
Publié: (2025)
par: Kong, Jun, et autres
Publié: (2025)
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
par: You, Haoxuan, et autres
Publié: (2023)
par: You, Haoxuan, et autres
Publié: (2023)
Self-Enhanced Reasoning Training: Activating Latent Reasoning in Small Models for Enhanced Reasoning Distillation
par: Zhang, Yong, et autres
Publié: (2025)
par: Zhang, Yong, et autres
Publié: (2025)
Zero-Shot Cross-Domain Dialogue State Tracking via Dual Low-Rank Adaptation
par: Luo, Xiang, et autres
Publié: (2024)
par: Luo, Xiang, et autres
Publié: (2024)
Multi-Attribute Multi-Grained Adaptation of Pre-Trained Language Models for Text Understanding from Bayesian Perspective
par: Zhang, You, et autres
Publié: (2025)
par: Zhang, You, et autres
Publié: (2025)
RA-ISF: Learning to Answer and Understand from Retrieval Augmentation via Iterative Self-Feedback
par: Liu, Yanming, et autres
Publié: (2024)
par: Liu, Yanming, et autres
Publié: (2024)
Table-r1: Self-supervised and Reinforcement Learning for Program-based Table Reasoning in Small Language Models
par: Jin, Rihui, et autres
Publié: (2025)
par: Jin, Rihui, et autres
Publié: (2025)
Phi-4-Mini-Reasoning: Exploring the Limits of Small Reasoning Language Models in Math
par: Xu, Haoran, et autres
Publié: (2025)
par: Xu, Haoran, et autres
Publié: (2025)
In-Token Rationality Optimization: Towards Accurate and Concise LLM Reasoning via Self-Feedback
par: Zhu, Mingye, et autres
Publié: (2025)
par: Zhu, Mingye, et autres
Publié: (2025)
Teaching Language Models to Self-Improve by Learning from Language Feedback
par: Hu, Chi, et autres
Publié: (2024)
par: Hu, Chi, et autres
Publié: (2024)
Integrating Physician Diagnostic Logic into Large Language Models: Preference Learning from Process Feedback
par: Dou, Chengfeng, et autres
Publié: (2024)
par: Dou, Chengfeng, et autres
Publié: (2024)
Enhancing Semantics in Multimodal Chain of Thought via Soft Negative Sampling
par: Zheng, Guangmin, et autres
Publié: (2024)
par: Zheng, Guangmin, et autres
Publié: (2024)
LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?
par: Wang, Jingyuan, et autres
Publié: (2025)
par: Wang, Jingyuan, et autres
Publié: (2025)
Learning to Self-Verify Makes Language Models Better Reasoners
par: Chen, Yuxin, et autres
Publié: (2026)
par: Chen, Yuxin, et autres
Publié: (2026)
RISE: Reasoning Enhancement via Iterative Self-Exploration in Multi-hop Question Answering
par: He, Bolei, et autres
Publié: (2025)
par: He, Bolei, et autres
Publié: (2025)
Self-Critique Guided Iterative Reasoning for Multi-hop Question Answering
par: Chu, Zheng, et autres
Publié: (2025)
par: Chu, Zheng, et autres
Publié: (2025)
MedCritical: Enhancing Medical Reasoning in Small Language Models via Self-Collaborative Correction
par: Su, Xinchun, et autres
Publié: (2025)
par: Su, Xinchun, et autres
Publié: (2025)
Small Language Models are Equation Reasoners
par: Kim, Bumjun, et autres
Publié: (2024)
par: Kim, Bumjun, et autres
Publié: (2024)
Prejudge-Before-Think: Enhancing Large Language Models at Test-Time by Process Prejudge Reasoning
par: Wang, Jianing, et autres
Publié: (2025)
par: Wang, Jianing, et autres
Publié: (2025)
Meeseeks: A Feedback-Driven, Iterative Self-Correction Benchmark evaluating LLMs' Instruction Following Capability
par: wang, Jiaming, et autres
Publié: (2025)
par: wang, Jiaming, et autres
Publié: (2025)
Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback
par: Li, Aiden Yiliu, et autres
Publié: (2025)
par: Li, Aiden Yiliu, et autres
Publié: (2025)
Unilaw-R1: A Large Language Model for Legal Reasoning with Reinforcement Learning and Iterative Inference
par: Cai, Hua, et autres
Publié: (2025)
par: Cai, Hua, et autres
Publié: (2025)
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback
par: van Niekerk, Carel, et autres
Publié: (2025)
par: van Niekerk, Carel, et autres
Publié: (2025)
Reasoning Elicitation in Language Models via Counterfactual Feedback
par: Hüyük, Alihan, et autres
Publié: (2024)
par: Hüyük, Alihan, et autres
Publié: (2024)
Self-Polish: Enhance Reasoning in Large Language Models via Problem Refinement
par: Xi, Zhiheng, et autres
Publié: (2023)
par: Xi, Zhiheng, et autres
Publié: (2023)
Enhancing Tool Retrieval with Iterative Feedback from Large Language Models
par: Xu, Qiancheng, et autres
Publié: (2024)
par: Xu, Qiancheng, et autres
Publié: (2024)
Improving Language Model Reasoning with Self-motivated Learning
par: Feng, Yunlong, et autres
Publié: (2024)
par: Feng, Yunlong, et autres
Publié: (2024)
InfiR : Crafting Effective Small Language Models and Multimodal Small Language Models in Reasoning
par: Xie, Congkai, et autres
Publié: (2025)
par: Xie, Congkai, et autres
Publié: (2025)
Internal Consistency and Self-Feedback in Large Language Models: A Survey
par: Liang, Xun, et autres
Publié: (2024)
par: Liang, Xun, et autres
Publié: (2024)
Adapting Pretrained Language Models for Citation Classification via Self-Supervised Contrastive Learning
par: Li, Tong, et autres
Publié: (2025)
par: Li, Tong, et autres
Publié: (2025)
MIRAGE: Evaluating and Explaining Inductive Reasoning Process in Language Models
par: Li, Jiachun, et autres
Publié: (2024)
par: Li, Jiachun, et autres
Publié: (2024)
Documents similaires
-
SAPO: Self-Adaptive Process Optimization Makes Small Reasoners Stronger
par: Chen, Kaiyuan, et autres
Publié: (2026) -
Chinese Metaphor Recognition Using a Multi-stage Prompting Large Language Model
par: Wang, Jie, et autres
Publié: (2024) -
Improving Mathematical Reasoning Capabilities of Small Language Models via Feedback-Driven Distillation
par: Zhu, Xunyu, et autres
Publié: (2024) -
Small Language Models Need Strong Verifiers to Self-Correct Reasoning
par: Zhang, Yunxiang, et autres
Publié: (2024) -
Coherent Multimodal Reasoning with Iterative Self-Evaluation for Vision-Language Models
par: Luo, Wenjie, et autres
Publié: (2025)