How to Fine-Tune a Reasoning Model? A Teacher-Student Cooperation Framework to Synthesize Student-Consistent SFT Data
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Zixian, Yang, Kaichen, Huang, Xu, Hao, Feiyang, Ge, Qiming, Li, Bowen, Du, He, Chen, Kai, Guo, Qipeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ExpLang: Improved Exploration and Exploitation in LLM Reasoning with On-Policy Thinking Language Selection
di: Gao, Changjiang, et al.
Pubblicazione: (2026)
di: Gao, Changjiang, et al.
Pubblicazione: (2026)
RL Fine-Tuning Heals OOD Forgetting in SFT
di: Jin, Hangzhan, et al.
Pubblicazione: (2025)
di: Jin, Hangzhan, et al.
Pubblicazione: (2025)
EvoSyn: Generalizable Evolutionary Data Synthesis for Verifiable Learning
di: Du, He, et al.
Pubblicazione: (2025)
di: Du, He, et al.
Pubblicazione: (2025)
SED-SFT: Selectively Encouraging Diversity in Supervised Fine-Tuning
di: Chen, Yijie, et al.
Pubblicazione: (2026)
di: Chen, Yijie, et al.
Pubblicazione: (2026)
Turning Students into Readers: Librarians and Teachers Cooperating.
di: Farber, Evan Ira
Pubblicazione: (1988)
di: Farber, Evan Ira
Pubblicazione: (1988)
FisherSFT: Data-Efficient Supervised Fine-Tuning of Language Models Using Information Gain
di: Deb, Rohan, et al.
Pubblicazione: (2025)
di: Deb, Rohan, et al.
Pubblicazione: (2025)
SFT Doesn't Always Hurt General Capabilities: Revisiting Domain-Specific Fine-Tuning in LLMs
di: Lin, Jiacheng, et al.
Pubblicazione: (2025)
di: Lin, Jiacheng, et al.
Pubblicazione: (2025)
SFT-KD-Recon: Learning a Student-friendly Teacher for Knowledge Distillation in Magnetic Resonance Image Reconstruction
di: Gayathri, Matcha Naga, et al.
Pubblicazione: (2023)
di: Gayathri, Matcha Naga, et al.
Pubblicazione: (2023)
Scaling Data Diversity for Fine-Tuning Language Models in Human Alignment
di: Song, Feifan, et al.
Pubblicazione: (2024)
di: Song, Feifan, et al.
Pubblicazione: (2024)
Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning
di: Chen, Liang, et al.
Pubblicazione: (2025)
di: Chen, Liang, et al.
Pubblicazione: (2025)
Kernel-Smith: A Unified Recipe for Evolutionary Kernel Optimization
di: Du, He, et al.
Pubblicazione: (2026)
di: Du, He, et al.
Pubblicazione: (2026)
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
di: Hong, Joey, et al.
Pubblicazione: (2024)
di: Hong, Joey, et al.
Pubblicazione: (2024)
SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models
di: Kim, Gyuhak, et al.
Pubblicazione: (2025)
di: Kim, Gyuhak, et al.
Pubblicazione: (2025)
FocuSFT: Bilevel Optimization for Dilution-Aware Long-Context Fine-Tuning
di: Pei, Zehua, et al.
Pubblicazione: (2026)
di: Pei, Zehua, et al.
Pubblicazione: (2026)
Towards Efficient Medical Reasoning with Minimal Fine-Tuning Data
di: Zhuang, Xinlin, et al.
Pubblicazione: (2025)
di: Zhuang, Xinlin, et al.
Pubblicazione: (2025)
Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead
di: Kang, Feiyang, et al.
Pubblicazione: (2025)
di: Kang, Feiyang, et al.
Pubblicazione: (2025)
Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning
di: Zhu, Taojie, et al.
Pubblicazione: (2026)
di: Zhu, Taojie, et al.
Pubblicazione: (2026)
Do Fine-Tuned LLMs Understand Vulnerabilities? An Investigation into the Semantic Trap
di: Huang, Feiyang, et al.
Pubblicazione: (2026)
di: Huang, Feiyang, et al.
Pubblicazione: (2026)
Learning to Adapt SFT Data for Better Reasoning Generalization
di: Sun, Lisong, et al.
Pubblicazione: (2026)
di: Sun, Lisong, et al.
Pubblicazione: (2026)
DeReason: A Difficulty-Aware Curriculum Improves Decoupled SFT-then-RL Training for General Reasoning
di: Hu, Hanxu, et al.
Pubblicazione: (2026)
di: Hu, Hanxu, et al.
Pubblicazione: (2026)
ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning
di: Van Vo, Tuan, et al.
Pubblicazione: (2025)
di: Van Vo, Tuan, et al.
Pubblicazione: (2025)
Capability Salience Vector: Fine-grained Alignment of Loss and Capabilities for Downstream Task Scaling Law
di: Ge, Qiming, et al.
Pubblicazione: (2025)
di: Ge, Qiming, et al.
Pubblicazione: (2025)
Rethinking Teacher-Student Curriculum Learning through the Cooperative Mechanics of Experience
di: Diaz, Manfred, et al.
Pubblicazione: (2024)
di: Diaz, Manfred, et al.
Pubblicazione: (2024)
Teacher Judgments of Student Reading Interests: How Accurate Are They?
di: Stoefen-Fisher, Jill M.
Pubblicazione: (1990)
di: Stoefen-Fisher, Jill M.
Pubblicazione: (1990)
Selective Reflection-Tuning: Student-Selected Data Recycling for LLM Instruction-Tuning
di: Li, Ming, et al.
Pubblicazione: (2024)
di: Li, Ming, et al.
Pubblicazione: (2024)
Students as Teachers
di: Fee, Heidi
Pubblicazione: (2022)
di: Fee, Heidi
Pubblicazione: (2022)
Reasoning, Memorization, and Fine-Tuning Language Models for Non-Cooperative Games
di: Yang, Yunhao, et al.
Pubblicazione: (2024)
di: Yang, Yunhao, et al.
Pubblicazione: (2024)
Get more for less: Principled Data Selection for Warming Up Fine-Tuning in LLMs
di: Kang, Feiyang, et al.
Pubblicazione: (2024)
di: Kang, Feiyang, et al.
Pubblicazione: (2024)
Real-Time Hardware-Free HIFU Interference Suppression via Teacher-Student Diffusion Framework
di: Cai, Dejia, et al.
Pubblicazione: (2025)
di: Cai, Dejia, et al.
Pubblicazione: (2025)
TAPO: Translation Augmented Policy Optimization for Multilingual Mathematical Reasoning
di: Huang, Xu, et al.
Pubblicazione: (2026)
di: Huang, Xu, et al.
Pubblicazione: (2026)
Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections
di: Wang, Bo, et al.
Pubblicazione: (2025)
di: Wang, Bo, et al.
Pubblicazione: (2025)
PuzzleClone: A DSL-Powered Framework for Synthesizing Verifiable Data
di: Xiong, Kai, et al.
Pubblicazione: (2025)
di: Xiong, Kai, et al.
Pubblicazione: (2025)
Student-Oriented Teacher Knowledge Refinement for Knowledge Distillation
di: Shen, Chaomin, et al.
Pubblicazione: (2024)
di: Shen, Chaomin, et al.
Pubblicazione: (2024)
Easy Dataset: A Unified and Extensible Framework for Synthesizing LLM Fine-Tuning Data from Unstructured Documents
di: Miao, Ziyang, et al.
Pubblicazione: (2025)
di: Miao, Ziyang, et al.
Pubblicazione: (2025)
OPCap:Object-aware Prompting Captioning
di: Huang, Feiyang
Pubblicazione: (2024)
di: Huang, Feiyang
Pubblicazione: (2024)
ViTOC: Vision Transformer and Object-aware Captioner
di: Huang, Feiyang
Pubblicazione: (2024)
di: Huang, Feiyang
Pubblicazione: (2024)
SFT-TA: Supervised Fine-Tuned Agents in Multi-Agent LLMs for Automated Inductive Thematic Analysis
di: Yi, Seungjun, et al.
Pubblicazione: (2025)
di: Yi, Seungjun, et al.
Pubblicazione: (2025)
GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models
di: Yi, Qiang, et al.
Pubblicazione: (2025)
di: Yi, Qiang, et al.
Pubblicazione: (2025)
Hint Tuning: Less Data Makes Better Reasoners
di: Fan, Siqi, et al.
Pubblicazione: (2026)
di: Fan, Siqi, et al.
Pubblicazione: (2026)
BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning
di: Zhang, Xuechen, et al.
Pubblicazione: (2025)
di: Zhang, Xuechen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ExpLang: Improved Exploration and Exploitation in LLM Reasoning with On-Policy Thinking Language Selection
di: Gao, Changjiang, et al.
Pubblicazione: (2026) -
RL Fine-Tuning Heals OOD Forgetting in SFT
di: Jin, Hangzhan, et al.
Pubblicazione: (2025) -
EvoSyn: Generalizable Evolutionary Data Synthesis for Verifiable Learning
di: Du, He, et al.
Pubblicazione: (2025) -
SED-SFT: Selectively Encouraging Diversity in Supervised Fine-Tuning
di: Chen, Yijie, et al.
Pubblicazione: (2026) -
Turning Students into Readers: Librarians and Teachers Cooperating.
di: Farber, Evan Ira
Pubblicazione: (1988)