SAPO: Self-Adaptive Process Optimization Makes Small Reasoners Stronger
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Kaiyuan, Zheng, Guangmin, Wang, Jin, Zhou, Xiaobing, Zhang, Xuejie |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Learning to Reason via Self-Iterative Process Feedback for Small Language Models
by: Chen, Kaiyuan, et al.
Published: (2024)
by: Chen, Kaiyuan, et al.
Published: (2024)
Enhancing Semantics in Multimodal Chain of Thought via Soft Negative Sampling
by: Zheng, Guangmin, et al.
Published: (2024)
by: Zheng, Guangmin, et al.
Published: (2024)
Instruction Tuning with Retrieval-based Examples Ranking for Aspect-based Sentiment Analysis
by: Zheng, Guangmin, et al.
Published: (2024)
by: Zheng, Guangmin, et al.
Published: (2024)
Reverse Thinking Makes LLMs Stronger Reasoners
by: Chen, Justin Chih-Yao, et al.
Published: (2024)
by: Chen, Justin Chih-Yao, et al.
Published: (2024)
Mutual Reasoning Makes Smaller LLMs Stronger Problem-Solvers
by: Qi, Zhenting, et al.
Published: (2024)
by: Qi, Zhenting, et al.
Published: (2024)
MA-SAPO: Multi-Agent Reasoning for Score-Aware Prompt Optimization
by: Seo, Wonduk, et al.
Published: (2025)
by: Seo, Wonduk, et al.
Published: (2025)
HintMR: Eliciting Stronger Mathematical Reasoning in Small Language Models
by: Hossain, Jawad, et al.
Published: (2026)
by: Hossain, Jawad, et al.
Published: (2026)
Mitigating Forgetting Between Supervised and Reinforcement Learning Yields Stronger Reasoners
by: Yuan, Xiangchi, et al.
Published: (2025)
by: Yuan, Xiangchi, et al.
Published: (2025)
Sample-aware Adaptive Structured Pruning for Large Language Models
by: Kong, Jun, et al.
Published: (2025)
by: Kong, Jun, et al.
Published: (2025)
Chinese Metaphor Recognition Using a Multi-stage Prompting Large Language Model
by: Wang, Jie, et al.
Published: (2024)
by: Wang, Jie, et al.
Published: (2024)
SoftMCL: Soft Momentum Contrastive Learning for Fine-grained Sentiment-aware Pre-training
by: Wang, Jin, et al.
Published: (2024)
by: Wang, Jin, et al.
Published: (2024)
Efficient Reasoning Through Suppression of Self-Affirmation Reflections in Large Reasoning Models
by: Liu, Kaiyuan, et al.
Published: (2025)
by: Liu, Kaiyuan, et al.
Published: (2025)
Self-Enhanced Reasoning Training: Activating Latent Reasoning in Small Models for Enhanced Reasoning Distillation
by: Zhang, Yong, et al.
Published: (2025)
by: Zhang, Yong, et al.
Published: (2025)
Stronger Re-identification Attacks through Reasoning and Aggregation
by: Charpentier, Lucas Georges Gabriel, et al.
Published: (2025)
by: Charpentier, Lucas Georges Gabriel, et al.
Published: (2025)
Make Every Penny Count: Difficulty-Adaptive Self-Consistency for Cost-Efficient Reasoning
by: Wang, Xinglin, et al.
Published: (2024)
by: Wang, Xinglin, et al.
Published: (2024)
Zero-Shot Cross-Domain Dialogue State Tracking via Dual Low-Rank Adaptation
by: Luo, Xiang, et al.
Published: (2024)
by: Luo, Xiang, et al.
Published: (2024)
DuQuant: Distributing Outliers via Dual Transformation Makes Stronger Quantized LLMs
by: Lin, Haokun, et al.
Published: (2024)
by: Lin, Haokun, et al.
Published: (2024)
Learning to Self-Verify Makes Language Models Better Reasoners
by: Chen, Yuxin, et al.
Published: (2026)
by: Chen, Yuxin, et al.
Published: (2026)
Self-Adaptive Cognitive Debiasing for Large Language Models in Decision-Making
by: Lyu, Yougang, et al.
Published: (2025)
by: Lyu, Yougang, et al.
Published: (2025)
In Their Own Words: Reasoning Traces Tailored for Small Models Make Them Better Reasoners
by: Kim, Jaehoon, et al.
Published: (2025)
by: Kim, Jaehoon, et al.
Published: (2025)
Stronger Models are NOT Stronger Teachers for Instruction Tuning
by: Xu, Zhangchen, et al.
Published: (2024)
by: Xu, Zhangchen, et al.
Published: (2024)
Small Language Models Need Strong Verifiers to Self-Correct Reasoning
by: Zhang, Yunxiang, et al.
Published: (2024)
by: Zhang, Yunxiang, et al.
Published: (2024)
DuetSim: Building User Simulator with Dual Large Language Models for Task-Oriented Dialogues
by: Luo, Xiang, et al.
Published: (2024)
by: Luo, Xiang, et al.
Published: (2024)
ImpRIF: Stronger Implicit Reasoning Leads to Better Complex Instruction Following
by: Yang, Yuancheng, et al.
Published: (2026)
by: Yang, Yuancheng, et al.
Published: (2026)
SelfBudgeter: Adaptive Token Allocation for Efficient LLM Reasoning
by: Li, Zheng, et al.
Published: (2025)
by: Li, Zheng, et al.
Published: (2025)
A Semantic Space is Worth 256 Language Descriptions: Make Stronger Segmentation Models with Descriptive Properties
by: Xiao, Junfei, et al.
Published: (2023)
by: Xiao, Junfei, et al.
Published: (2023)
Multi-Attribute Multi-Grained Adaptation of Pre-Trained Language Models for Text Understanding from Bayesian Perspective
by: Zhang, You, et al.
Published: (2025)
by: Zhang, You, et al.
Published: (2025)
Personalized LoRA for Human-Centered Text Understanding
by: Zhang, You, et al.
Published: (2024)
by: Zhang, You, et al.
Published: (2024)
Ontology-Guided Reverse Thinking Makes Large Language Models Stronger on Knowledge Graph Question Answering
by: Liu, Runxuan, et al.
Published: (2025)
by: Liu, Runxuan, et al.
Published: (2025)
Where Did This Sentence Come From? Tracing Provenance in LLM Reasoning Distillation
by: Liu, Kaiyuan, et al.
Published: (2025)
by: Liu, Kaiyuan, et al.
Published: (2025)
Distribution-Aligned Sequence Distillation for Superior Long-CoT Reasoning
by: Yan, Shaotian, et al.
Published: (2026)
by: Yan, Shaotian, et al.
Published: (2026)
Robust Reasoning via Dynamic Token Selection for Distribution-Aligned Self-Distillation
by: Zhang, Ruiqi, et al.
Published: (2026)
by: Zhang, Ruiqi, et al.
Published: (2026)
Phi-4-Mini-Reasoning: Exploring the Limits of Small Reasoning Language Models in Math
by: Xu, Haoran, et al.
Published: (2025)
by: Xu, Haoran, et al.
Published: (2025)
ASPO: Adaptive Sentence-Level Preference Optimization for Fine-Grained Multimodal Reasoning
by: Wang, Yeyuan, et al.
Published: (2025)
by: Wang, Yeyuan, et al.
Published: (2025)
Self-Evolved Preference Optimization for Enhancing Mathematical Reasoning in Small Language Models
by: Singh, Joykirat, et al.
Published: (2025)
by: Singh, Joykirat, et al.
Published: (2025)
Self-Correction Makes LLMs Better Parsers
by: Zhang, Ziyan, et al.
Published: (2025)
by: Zhang, Ziyan, et al.
Published: (2025)
Deep Self-Evolving Reasoning
by: Liu, Zihan, et al.
Published: (2025)
by: Liu, Zihan, et al.
Published: (2025)
ARM: Adaptive Reasoning Model
by: Wu, Siye, et al.
Published: (2025)
by: Wu, Siye, et al.
Published: (2025)
GReaTer: Gradients over Reasoning Makes Smaller Language Models Strong Prompt Optimizers
by: Das, Sarkar Snigdha Sarathi, et al.
Published: (2024)
by: Das, Sarkar Snigdha Sarathi, et al.
Published: (2024)
SuperCorrect: Advancing Small LLM Reasoning with Thought Template Distillation and Self-Correction
by: Yang, Ling, et al.
Published: (2024)
by: Yang, Ling, et al.
Published: (2024)
Similar Items
-
Learning to Reason via Self-Iterative Process Feedback for Small Language Models
by: Chen, Kaiyuan, et al.
Published: (2024) -
Enhancing Semantics in Multimodal Chain of Thought via Soft Negative Sampling
by: Zheng, Guangmin, et al.
Published: (2024) -
Instruction Tuning with Retrieval-based Examples Ranking for Aspect-based Sentiment Analysis
by: Zheng, Guangmin, et al.
Published: (2024) -
Reverse Thinking Makes LLMs Stronger Reasoners
by: Chen, Justin Chih-Yao, et al.
Published: (2024) -
Mutual Reasoning Makes Smaller LLMs Stronger Problem-Solvers
by: Qi, Zhenting, et al.
Published: (2024)