Procedural-skill SFT across capacity tiers: A W-Shaped pre-SFT Trajectory and Regime-Asymmetric Mechanism on 0.8B-4B Qwen3.5 Models
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Strozzi, Igor |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
mSFT: Addressing Dataset Mixtures Overfitting Heterogeneously in Multi-task SFT
par: Koh, Woosung, et autres
Publié: (2026)
par: Koh, Woosung, et autres
Publié: (2026)
TMS: Trajectory-Mixed Supervision for Reward-Free, On-Policy SFT
par: Khan, Rana Muhammad Shahroz, et autres
Publié: (2026)
par: Khan, Rana Muhammad Shahroz, et autres
Publié: (2026)
Debunk the Myth of SFT Generalization
par: Lin, Xiaofeng, et autres
Publié: (2025)
par: Lin, Xiaofeng, et autres
Publié: (2025)
What Do Agents Learn from Trajectory-SFT: Semantics or Interfaces?
par: Gu, Weizheng, et autres
Publié: (2026)
par: Gu, Weizheng, et autres
Publié: (2026)
Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead
par: Kang, Feiyang, et autres
Publié: (2025)
par: Kang, Feiyang, et autres
Publié: (2025)
Crowd-SFT: Crowdsourcing for LLM Alignment
par: Sotiropoulos, Alex, et autres
Publié: (2025)
par: Sotiropoulos, Alex, et autres
Publié: (2025)
Crafting Reversible SFT Behaviors in Large Language Models
par: Lin, Yuping, et autres
Publié: (2026)
par: Lin, Yuping, et autres
Publié: (2026)
Getting More Juice Out of the SFT Data: Reward Learning from Human Demonstration Improves SFT for LLM Alignment
par: Li, Jiaxiang, et autres
Publié: (2024)
par: Li, Jiaxiang, et autres
Publié: (2024)
A Three-Dimensional SFT with Sparse Columns
par: Salo, Ville, et autres
Publié: (2025)
par: Salo, Ville, et autres
Publié: (2025)
Simplified SFT moduli spaces for Legendrian links
par: Avdek, Russell
Publié: (2021)
par: Avdek, Russell
Publié: (2021)
SFT covers for actions of the first Grigorchuk group
par: Grigorchuk, Rostislav, et autres
Publié: (2024)
par: Grigorchuk, Rostislav, et autres
Publié: (2024)
Automatically Generating Numerous Context-Driven SFT Data for LLMs across Diverse Granularity
par: Quan, Shanghaoran
Publié: (2024)
par: Quan, Shanghaoran
Publié: (2024)
Qwen3.5-Omni Technical Report
par: Qwen Team
Publié: (2026)
par: Qwen Team
Publié: (2026)
Symbolic Momentum Conservation and Curvature Entanglement in a Recursive Universe: A Force-Based Reality Framework (SFT-FBRF-8) Eighth Research Paper of the SFT-FBRF Series
par: JANAKARAJ, SIVARAM
Publié: (2025)
par: JANAKARAJ, SIVARAM
Publié: (2025)
R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model
par: Zhou, Hengguang, et autres
Publié: (2025)
par: Zhou, Hengguang, et autres
Publié: (2025)
A landscape of contact manifolds via rational SFT
par: Moreno, Agustin, et autres
Publié: (2020)
par: Moreno, Agustin, et autres
Publié: (2020)
RL makes MLLMs see better than SFT
par: Song, Junha, et autres
Publié: (2025)
par: Song, Junha, et autres
Publié: (2025)
RL Fine-Tuning Heals OOD Forgetting in SFT
par: Jin, Hangzhan, et autres
Publié: (2025)
par: Jin, Hangzhan, et autres
Publié: (2025)
SFT for ASD: A systemic intervention for neurodiverse families
par: Anthony Pennant
Publié: (2024)
par: Anthony Pennant
Publié: (2024)
Continual SFT Matches Multimodal RLHF with Negative Supervision
par: Zhu, Ke, et autres
Publié: (2024)
par: Zhu, Ke, et autres
Publié: (2024)
Learning to Adapt SFT Data for Better Reasoning Generalization
par: Sun, Lisong, et autres
Publié: (2026)
par: Sun, Lisong, et autres
Publié: (2026)
On Countable SFT Covers of Sparse Multidimensional Shift Spaces
par: Törmä, Ilkka
Publié: (2024)
par: Törmä, Ilkka
Publié: (2024)
An Empirical Study of SFT-DPO Interaction and Parameterization in Small Language Models
par: Feng, Yuming, et autres
Publié: (2026)
par: Feng, Yuming, et autres
Publié: (2026)
Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation
par: Zhao, Anhao, et autres
Publié: (2026)
par: Zhao, Anhao, et autres
Publié: (2026)
SED-SFT: Selectively Encouraging Diversity in Supervised Fine-Tuning
par: Chen, Yijie, et autres
Publié: (2026)
par: Chen, Yijie, et autres
Publié: (2026)
Empowering Lightweight MLLMs with Reasoning via Long CoT SFT
par: Ou, Linyu, et autres
Publié: (2025)
par: Ou, Linyu, et autres
Publié: (2025)
Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning
par: Zhu, Taojie, et autres
Publié: (2026)
par: Zhu, Taojie, et autres
Publié: (2026)
SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning
par: Limozin, Alexis, et autres
Publié: (2026)
par: Limozin, Alexis, et autres
Publié: (2026)
Reconciling Contradictory Views on the Effectiveness of SFT in LLMs: An Interaction Perspective
par: Zhang, Junpeng, et autres
Publié: (2026)
par: Zhang, Junpeng, et autres
Publié: (2026)
DynamixSFT: Dynamic Mixture Optimization of Instruction Tuning Collections
par: Shin, Haebin, et autres
Publié: (2025)
par: Shin, Haebin, et autres
Publié: (2025)
On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification
par: Wu, Yongliang, et autres
Publié: (2025)
par: Wu, Yongliang, et autres
Publié: (2025)
Comments on resolution of nonassociativity in SFT- an example from axioms of BCFT-
par: Matsuo Yutaka
Publié: (2002)
par: Matsuo Yutaka
Publié: (2002)
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
par: Hong, Joey, et autres
Publié: (2024)
par: Hong, Joey, et autres
Publié: (2024)
SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models
par: Kim, Gyuhak, et autres
Publié: (2025)
par: Kim, Gyuhak, et autres
Publié: (2025)
Blockwise SFT for Diffusion Language Models: Reconciling Bidirectional Attention and Autoregressive Decoding
par: Sun, Bowen, et autres
Publié: (2025)
par: Sun, Bowen, et autres
Publié: (2025)
Metis-RISE: RL Incentivizes and SFT Enhances Multimodal Reasoning Model Learning
par: Qiu, Haibo, et autres
Publié: (2025)
par: Qiu, Haibo, et autres
Publié: (2025)
Bridging SFT and DPO for Diffusion Model Alignment with Self-Sampling Preference Optimization
par: Zhang, Daoan, et autres
Publié: (2024)
par: Zhang, Daoan, et autres
Publié: (2024)
Memorize Theorems, Not Instances: Probing SFT Generalization through Mathematical Reasoning
par: Peng, Ruiying, et autres
Publié: (2026)
par: Peng, Ruiying, et autres
Publié: (2026)
Gradients Must Earn Their Influence: Unifying SFT with Generalized Entropic Objectives
par: Wang, Zecheng, et autres
Publié: (2026)
par: Wang, Zecheng, et autres
Publié: (2026)
RLSR: Reinforcement Learning with Supervised Reward Outperforms SFT in Instruction Following
par: Wang, Zhichao, et autres
Publié: (2025)
par: Wang, Zhichao, et autres
Publié: (2025)
Documents similaires
-
mSFT: Addressing Dataset Mixtures Overfitting Heterogeneously in Multi-task SFT
par: Koh, Woosung, et autres
Publié: (2026) -
TMS: Trajectory-Mixed Supervision for Reward-Free, On-Policy SFT
par: Khan, Rana Muhammad Shahroz, et autres
Publié: (2026) -
Debunk the Myth of SFT Generalization
par: Lin, Xiaofeng, et autres
Publié: (2025) -
What Do Agents Learn from Trajectory-SFT: Semantics or Interfaces?
par: Gu, Weizheng, et autres
Publié: (2026) -
Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead
par: Kang, Feiyang, et autres
Publié: (2025)