Debunk the Myth of SFT Generalization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lin, Xiaofeng, Sang, Hejian, Wang, Zhipeng, Zhang, Xuezhou |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL
par: Lin, Xiaofeng, et autres
Publié: (2026)
par: Lin, Xiaofeng, et autres
Publié: (2026)
Efficient Reinforcement Learning in Probabilistic Reward Machines
par: Lin, Xiaofeng, et autres
Publié: (2024)
par: Lin, Xiaofeng, et autres
Publié: (2024)
Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning
par: Xu, Yuanda, et autres
Publié: (2026)
par: Xu, Yuanda, et autres
Publié: (2026)
PACED: Distillation and On-Policy Self-Distillation at the Frontier of Student Competence
par: Xu, Yuanda, et autres
Publié: (2026)
par: Xu, Yuanda, et autres
Publié: (2026)
Not all tokens are needed(NAT): token efficient reinforcement learning
par: Sang, Hejian, et autres
Publié: (2026)
par: Sang, Hejian, et autres
Publié: (2026)
Aligning Diffusion Language Models via Unpaired Preference Optimization
par: Jindal, Vaibhav, et autres
Publié: (2025)
par: Jindal, Vaibhav, et autres
Publié: (2025)
Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training
par: Xu, Yuanda, et autres
Publié: (2026)
par: Xu, Yuanda, et autres
Publié: (2026)
TIP: Token Importance in On-Policy Distillation
par: Xu, Yuanda, et autres
Publié: (2026)
par: Xu, Yuanda, et autres
Publié: (2026)
Scale-free Adversarial Reinforcement Learning
par: Chen, Mingyu, et autres
Publié: (2024)
par: Chen, Mingyu, et autres
Publié: (2024)
State-free Reinforcement Learning
par: Chen, Mingyu, et autres
Publié: (2024)
par: Chen, Mingyu, et autres
Publié: (2024)
mSFT: Addressing Dataset Mixtures Overfitting Heterogeneously in Multi-task SFT
par: Koh, Woosung, et autres
Publié: (2026)
par: Koh, Woosung, et autres
Publié: (2026)
Avoiding $\mathbf{exp(R_{max})}$ scaling in RLHF through Preference-based Exploration
par: Chen, Mingyu, et autres
Publié: (2025)
par: Chen, Mingyu, et autres
Publié: (2025)
Gradients Must Earn Their Influence: Unifying SFT with Generalized Entropic Objectives
par: Wang, Zecheng, et autres
Publié: (2026)
par: Wang, Zecheng, et autres
Publié: (2026)
Memorize Theorems, Not Instances: Probing SFT Generalization through Mathematical Reasoning
par: Peng, Ruiying, et autres
Publié: (2026)
par: Peng, Ruiying, et autres
Publié: (2026)
Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer
par: Liu, Zhihan, et autres
Publié: (2024)
par: Liu, Zhihan, et autres
Publié: (2024)
RL Fine-Tuning Heals OOD Forgetting in SFT
par: Jin, Hangzhan, et autres
Publié: (2025)
par: Jin, Hangzhan, et autres
Publié: (2025)
PepThink-R1: LLM for Interpretable Cyclic Peptide Optimization with CoT SFT and Reinforcement Learning
par: Wang, Ruheng, et autres
Publié: (2025)
par: Wang, Ruheng, et autres
Publié: (2025)
Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead
par: Kang, Feiyang, et autres
Publié: (2025)
par: Kang, Feiyang, et autres
Publié: (2025)
Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration
par: Zhao, Yang, et autres
Publié: (2026)
par: Zhao, Yang, et autres
Publié: (2026)
SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models
par: Kim, Gyuhak, et autres
Publié: (2025)
par: Kim, Gyuhak, et autres
Publié: (2025)
Complementing reinforcement learning with SFT through logit averaging in the post training of LLMs
par: Gan, Xingwei, et autres
Publié: (2026)
par: Gan, Xingwei, et autres
Publié: (2026)
GAC: Noise-Aware Adaptive Mixing for Hybrid SFT-RL Post-Training
par: Hu, Yuelin, et autres
Publié: (2026)
par: Hu, Yuelin, et autres
Publié: (2026)
Accelerating RL for LLM Reasoning with Optimal Advantage Regression
par: Brantley, Kianté, et autres
Publié: (2025)
par: Brantley, Kianté, et autres
Publié: (2025)
Reference-Sampled Boltzmann Projection for KL-Regularized RLVR: Target-Matched Weighted SFT, Finite One-Shot Gaps, and Policy Mirror Descent
par: Shu, Yao, et autres
Publié: (2026)
par: Shu, Yao, et autres
Publié: (2026)
Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections
par: Wang, Bo, et autres
Publié: (2025)
par: Wang, Bo, et autres
Publié: (2025)
A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning
par: Yoshihara, Hiroshi, et autres
Publié: (2025)
par: Yoshihara, Hiroshi, et autres
Publié: (2025)
Post-Training is About States, Not Tokens: A State Distribution View of SFT, RL, and On-Policy Distillation
par: Nie, Dong
Publié: (2026)
par: Nie, Dong
Publié: (2026)
DynamixSFT: Dynamic Mixture Optimization of Instruction Tuning Collections
par: Shin, Haebin, et autres
Publié: (2025)
par: Shin, Haebin, et autres
Publié: (2025)
SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning
par: Limozin, Alexis, et autres
Publié: (2026)
par: Limozin, Alexis, et autres
Publié: (2026)
SFT-GRPO Data Overlap as a Post-Training Hyperparameter for Autoformalization
par: Su, Xiaole, et autres
Publié: (2026)
par: Su, Xiaole, et autres
Publié: (2026)
Harnessing Network Effect for Fake News Mitigation: Selecting Debunkers via Self-Imitation Learning
par: Xu, Xiaofei, et autres
Publié: (2024)
par: Xu, Xiaofei, et autres
Publié: (2024)
Climbing the Ladder of Reasoning: What LLMs Can-and Still Can't-Solve after SFT?
par: Sun, Yiyou, et autres
Publié: (2025)
par: Sun, Yiyou, et autres
Publié: (2025)
RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment
par: Du, Yuhao, et autres
Publié: (2025)
par: Du, Yuhao, et autres
Publié: (2025)
Continual SFT Matches Multimodal RLHF with Negative Supervision
par: Zhu, Ke, et autres
Publié: (2024)
par: Zhu, Ke, et autres
Publié: (2024)
Stable but Wrong: When More Data Degrades Scientific Conclusions
par: Zhang, Zhipeng, et autres
Publié: (2026)
par: Zhang, Zhipeng, et autres
Publié: (2026)
Towards On-Policy SFT: Distribution Discriminant Theory and its Applications in LLM Training
par: Zhang, Miaosen, et autres
Publié: (2026)
par: Zhang, Miaosen, et autres
Publié: (2026)
Scalpel vs. Hammer: GRPO Amplifies Existing Capabilities, SFT Replaces Them
par: Rajani, Neel, et autres
Publié: (2025)
par: Rajani, Neel, et autres
Publié: (2025)
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
par: Hong, Joey, et autres
Publié: (2024)
par: Hong, Joey, et autres
Publié: (2024)
PDC & DM-SFT: A Road for LLM SQL Bug-Fix Enhancing
par: Duan, Yiwen, et autres
Publié: (2024)
par: Duan, Yiwen, et autres
Publié: (2024)
SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training
par: Chu, Tianzhe, et autres
Publié: (2025)
par: Chu, Tianzhe, et autres
Publié: (2025)
Documents similaires
-
Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL
par: Lin, Xiaofeng, et autres
Publié: (2026) -
Efficient Reinforcement Learning in Probabilistic Reward Machines
par: Lin, Xiaofeng, et autres
Publié: (2024) -
Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning
par: Xu, Yuanda, et autres
Publié: (2026) -
PACED: Distillation and On-Policy Self-Distillation at the Frontier of Student Competence
par: Xu, Yuanda, et autres
Publié: (2026) -
Not all tokens are needed(NAT): token efficient reinforcement learning
par: Sang, Hejian, et autres
Publié: (2026)