Mitigating Forgetting Between Supervised and Reinforcement Learning Yields Stronger Reasoners
Fuente:
arXiv
Saved in:
| Main Authors: | Yuan, Xiangchi, Chen, Xiang, Yu, Tong, Shi, Dachuan, Jin, Can, Lee, Wenke, Mitra, Saayan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Superficial Self-Improved Reasoners Benefit from Model Merging
by: Yuan, Xiangchi, et al.
Published: (2025)
by: Yuan, Xiangchi, et al.
Published: (2025)
SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs
by: Shi, Dachuan, et al.
Published: (2025)
by: Shi, Dachuan, et al.
Published: (2025)
CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning
by: Shi, Dachuan, et al.
Published: (2026)
by: Shi, Dachuan, et al.
Published: (2026)
MetaState: Persistent Working Memory Enhances Reasoning in Discrete Diffusion Language Models
by: Xia, Kejing, et al.
Published: (2026)
by: Xia, Kejing, et al.
Published: (2026)
ThinkRouter: Efficient Reasoning via Routing Thinking between Latent and Discrete Spaces
by: Xu, Xin, et al.
Published: (2026)
by: Xu, Xin, et al.
Published: (2026)
CodeLutra: Boosting LLM Code Generation via Preference-Guided Refinement
by: Tao, Leitian, et al.
Published: (2024)
by: Tao, Leitian, et al.
Published: (2024)
An Interactive Paradigm for Deep Research
by: Ai, Lin, et al.
Published: (2026)
by: Ai, Lin, et al.
Published: (2026)
Behavior Knowledge Merge in Reinforced Agentic Models
by: Yuan, Xiangchi, et al.
Published: (2026)
by: Yuan, Xiangchi, et al.
Published: (2026)
RULE: Reinforcement UnLEarning Achieves Forget-Retain Pareto Optimality
by: Zhang, Chenlong, et al.
Published: (2025)
by: Zhang, Chenlong, et al.
Published: (2025)
NFT: Bridging Supervised Learning and Reinforcement Learning in Math Reasoning
by: Chen, Huayu, et al.
Published: (2025)
by: Chen, Huayu, et al.
Published: (2025)
SAPO: Self-Adaptive Process Optimization Makes Small Reasoners Stronger
by: Chen, Kaiyuan, et al.
Published: (2026)
by: Chen, Kaiyuan, et al.
Published: (2026)
Reverse Thinking Makes LLMs Stronger Reasoners
by: Chen, Justin Chih-Yao, et al.
Published: (2024)
by: Chen, Justin Chih-Yao, et al.
Published: (2024)
Mitigating Forgetting in LLM Fine-Tuning via Low-Perplexity Token Learning
by: Wu, Chao-Chung, et al.
Published: (2025)
by: Wu, Chao-Chung, et al.
Published: (2025)
Token-Level Adversarial Prompt Detection Based on Perplexity Measures and Contextual Information
by: Hu, Zhengmian, et al.
Published: (2023)
by: Hu, Zhengmian, et al.
Published: (2023)
LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models
by: Shi, Dachuan, et al.
Published: (2025)
by: Shi, Dachuan, et al.
Published: (2025)
A Penalty Goes a Long Way: Measuring Lexical Diversity in Synthetic Texts Under Prompt-Influenced Length Variations
by: Deshpande, Vijeta, et al.
Published: (2025)
by: Deshpande, Vijeta, et al.
Published: (2025)
Improved Supervised Fine-Tuning for Large Language Models to Mitigate Catastrophic Forgetting
by: Ding, Fei, et al.
Published: (2025)
by: Ding, Fei, et al.
Published: (2025)
Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning
by: Deng, Yihe, et al.
Published: (2025)
by: Deng, Yihe, et al.
Published: (2025)
Mitigating Catastrophic Forgetting in Mathematical Reasoning Finetuning through Mixed Training
by: Reynolds, John Graham
Published: (2025)
by: Reynolds, John Graham
Published: (2025)
Mitigating Catastrophic Forgetting in Continual Learning through Model Growth
by: Süalp, Ege, et al.
Published: (2025)
by: Süalp, Ege, et al.
Published: (2025)
ImpRIF: Stronger Implicit Reasoning Leads to Better Complex Instruction Following
by: Yang, Yuancheng, et al.
Published: (2026)
by: Yang, Yuancheng, et al.
Published: (2026)
AuroraEdge-V-2B: A Faster And Stronger Edge Visual Large Language Model
by: Chen, Xiang
Published: (2026)
by: Chen, Xiang
Published: (2026)
Stronger Re-identification Attacks through Reasoning and Aggregation
by: Charpentier, Lucas Georges Gabriel, et al.
Published: (2025)
by: Charpentier, Lucas Georges Gabriel, et al.
Published: (2025)
Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting
by: Chen, Howard, et al.
Published: (2025)
by: Chen, Howard, et al.
Published: (2025)
Free(): Learning to Forget in Malloc-Only Reasoning Models
by: Zheng, Yilun, et al.
Published: (2026)
by: Zheng, Yilun, et al.
Published: (2026)
Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training
by: Lai, Song, et al.
Published: (2025)
by: Lai, Song, et al.
Published: (2025)
Demystifying Language Model Forgetting with Low-rank Example Associations
by: Jin, Xisen, et al.
Published: (2024)
by: Jin, Xisen, et al.
Published: (2024)
Mutual Reasoning Makes Smaller LLMs Stronger Problem-Solvers
by: Qi, Zhenting, et al.
Published: (2024)
by: Qi, Zhenting, et al.
Published: (2024)
Locate-then-Merge: Neuron-Level Parameter Fusion for Mitigating Catastrophic Forgetting in Multimodal LLMs
by: Yu, Zeping, et al.
Published: (2025)
by: Yu, Zeping, et al.
Published: (2025)
Growing Through Experience: Scaling Episodic Grounding in Language Models
by: Zhang, Chunhui, et al.
Published: (2025)
by: Zhang, Chunhui, et al.
Published: (2025)
What Will My Model Forget? Forecasting Forgotten Examples in Language Model Refinement
by: Jin, Xisen, et al.
Published: (2024)
by: Jin, Xisen, et al.
Published: (2024)
Detecting Ambiguities to Guide Query Rewrite for Robust Conversations in Enterprise AI Assistants
by: Tanjim, Md Mehrab, et al.
Published: (2025)
by: Tanjim, Md Mehrab, et al.
Published: (2025)
Sharpness-Aware Pretraining Mitigates Catastrophic Forgetting
by: Watts, Ishaan, et al.
Published: (2026)
by: Watts, Ishaan, et al.
Published: (2026)
Stronger Models are NOT Stronger Teachers for Instruction Tuning
by: Xu, Zhangchen, et al.
Published: (2024)
by: Xu, Zhangchen, et al.
Published: (2024)
Stronger Random Baselines for In-Context Learning
by: Yauney, Gregory, et al.
Published: (2024)
by: Yauney, Gregory, et al.
Published: (2024)
Parameter Alignment Mitigates Catastrophic Forgetting in Multilingual Expert Language Models
by: Ahuja, Sanchit, et al.
Published: (2026)
by: Ahuja, Sanchit, et al.
Published: (2026)
Reinforcing Multimodal Reasoning Against Visual Degradation
by: Liu, Rui, et al.
Published: (2026)
by: Liu, Rui, et al.
Published: (2026)
Modality-Aware Neuron Pruning for Unlearning in Multimodal Large Language Models
by: Liu, Zheyuan, et al.
Published: (2025)
by: Liu, Zheyuan, et al.
Published: (2025)
Demystifying Reinforcement Learning in Agentic Reasoning
by: Yu, Zhaochen, et al.
Published: (2025)
by: Yu, Zhaochen, et al.
Published: (2025)
Semantic Soft Bootstrapping: Long Context Reasoning in LLMs without Reinforcement Learning
by: Mitra, Purbesh, et al.
Published: (2025)
by: Mitra, Purbesh, et al.
Published: (2025)
Similar Items
-
Superficial Self-Improved Reasoners Benefit from Model Merging
by: Yuan, Xiangchi, et al.
Published: (2025) -
SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs
by: Shi, Dachuan, et al.
Published: (2025) -
CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning
by: Shi, Dachuan, et al.
Published: (2026) -
MetaState: Persistent Working Memory Enhances Reasoning in Discrete Diffusion Language Models
by: Xia, Kejing, et al.
Published: (2026) -
ThinkRouter: Efficient Reasoning via Routing Thinking between Latent and Discrete Spaces
by: Xu, Xin, et al.
Published: (2026)