From Instance Selection to Fixed-Pool Data Recipe Search for Supervised Fine-Tuning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Haodong, Zhang, Jiahao, Hu, Lijie, Zhang, Yongqi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Anchored Supervised Fine-Tuning
par: Zhu, He, et autres
Publié: (2025)
par: Zhu, He, et autres
Publié: (2025)
Selection of LLM Fine-Tuning Data based on Orthogonal Rules
par: Li, Xiaomin, et autres
Publié: (2024)
par: Li, Xiaomin, et autres
Publié: (2024)
Dissecting Fine-Tuning Unlearning in Large Language Models
par: Hong, Yihuai, et autres
Publié: (2024)
par: Hong, Yihuai, et autres
Publié: (2024)
Mind the Gap: Data Rewriting for Stable Off-Policy Supervised Fine-Tuning
par: Zhao, Shiwan, et autres
Publié: (2025)
par: Zhao, Shiwan, et autres
Publié: (2025)
UFT: Unifying Supervised and Reinforcement Fine-Tuning
par: Liu, Mingyang, et autres
Publié: (2025)
par: Liu, Mingyang, et autres
Publié: (2025)
Step Rejection Fine-Tuning: A Practical Distillation Recipe
par: Slinko, Igor, et autres
Publié: (2026)
par: Slinko, Igor, et autres
Publié: (2026)
Proximal Supervised Fine-Tuning
par: Zhu, Wenhong, et autres
Publié: (2025)
par: Zhu, Wenhong, et autres
Publié: (2025)
Parameter Importance is Not Static: Evolving Parameter Isolation for Supervised Fine-Tuning
par: Lin, Zekai, et autres
Publié: (2026)
par: Lin, Zekai, et autres
Publié: (2026)
FisherSFT: Data-Efficient Supervised Fine-Tuning of Language Models Using Information Gain
par: Deb, Rohan, et autres
Publié: (2025)
par: Deb, Rohan, et autres
Publié: (2025)
SFTMix: Elevating Language Model Instruction Tuning with Mixup Recipe
par: Xiao, Yuxin, et autres
Publié: (2024)
par: Xiao, Yuxin, et autres
Publié: (2024)
Supervised Fine-Tuning Needs to Unlock the Potential of Token Priority
par: Shen, Zhanming, et autres
Publié: (2026)
par: Shen, Zhanming, et autres
Publié: (2026)
Fine-Tuning LLMs for Report Summarization: Analysis on Supervised and Unsupervised Data
par: Rallapalli, Swati, et autres
Publié: (2025)
par: Rallapalli, Swati, et autres
Publié: (2025)
From Parameters to Data: A Task-Parameter-Guided Fine-Tuning Pipeline for Efficient LLM Alignment
par: Chen, Hao, et autres
Publié: (2026)
par: Chen, Hao, et autres
Publié: (2026)
Get more for less: Principled Data Selection for Warming Up Fine-Tuning in LLMs
par: Kang, Feiyang, et autres
Publié: (2024)
par: Kang, Feiyang, et autres
Publié: (2024)
Supervised Fine-Tuning as Inverse Reinforcement Learning
par: Sun, Hao
Publié: (2024)
par: Sun, Hao
Publié: (2024)
Stabilizing LLM Supervised Fine-Tuning via Explicit Distributional Control
par: Wang, Xinyu, et autres
Publié: (2026)
par: Wang, Xinyu, et autres
Publié: (2026)
Why Fine-Tuning Encourages Hallucinations and How to Fix It
par: Kaplan, Guy, et autres
Publié: (2026)
par: Kaplan, Guy, et autres
Publié: (2026)
Filter-then-Weight: Online Data Selection and Reweighting for LLM Fine-Tuning
par: Wang, Fangxin, et autres
Publié: (2026)
par: Wang, Fangxin, et autres
Publié: (2026)
Memory-Efficient Fine-Tuning of Transformers via Token Selection
par: Simoulin, Antoine, et autres
Publié: (2025)
par: Simoulin, Antoine, et autres
Publié: (2025)
Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling
par: Huang, Zeyu, et autres
Publié: (2025)
par: Huang, Zeyu, et autres
Publié: (2025)
Pre-training LLM without Learning Rate Decay Enhances Supervised Fine-Tuning
par: Yano, Kazuki, et autres
Publié: (2026)
par: Yano, Kazuki, et autres
Publié: (2026)
Threshold Filtering Packing for Supervised Fine-Tuning: Training Related Samples within Packs
par: Dong, Jiancheng, et autres
Publié: (2024)
par: Dong, Jiancheng, et autres
Publié: (2024)
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
par: Fu, Yuqian, et autres
Publié: (2025)
par: Fu, Yuqian, et autres
Publié: (2025)
Diagnosing LLM Reranker Behavior Under Fixed Evidence Pools
par: Arat, Baris, et autres
Publié: (2026)
par: Arat, Baris, et autres
Publié: (2026)
Reassessing the Role of Supervised Fine-Tuning: An Empirical Study in VLM Reasoning
par: Yu, Yongcan, et autres
Publié: (2025)
par: Yu, Yongcan, et autres
Publié: (2025)
Neural Parameter Search for Slimmer Fine-Tuned Models and Better Transfer
par: Du, Guodong, et autres
Publié: (2025)
par: Du, Guodong, et autres
Publié: (2025)
PromptFix: Few-shot Backdoor Removal via Adversarial Prompt Tuning
par: Zhang, Tianrong, et autres
Publié: (2024)
par: Zhang, Tianrong, et autres
Publié: (2024)
Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents: A Comprehensive Recipe
par: Wu, Xixi, et autres
Publié: (2026)
par: Wu, Xixi, et autres
Publié: (2026)
PoliTune: Analyzing the Impact of Data Selection and Fine-Tuning on Economic and Political Biases in Large Language Models
par: Agiza, Ahmed, et autres
Publié: (2024)
par: Agiza, Ahmed, et autres
Publié: (2024)
From Domains to Instances: Dual-Granularity Data Synthesis for LLM Unlearning
par: Xu, Xiaoyu, et autres
Publié: (2026)
par: Xu, Xiaoyu, et autres
Publié: (2026)
ClusterUCB: Efficient Gradient-Based Data Selection for Targeted Fine-Tuning of LLMs
par: Wang, Zige, et autres
Publié: (2025)
par: Wang, Zige, et autres
Publié: (2025)
Mitigating Training Imbalance in LLM Fine-Tuning via Selective Parameter Merging
par: Ju, Yiming, et autres
Publié: (2024)
par: Ju, Yiming, et autres
Publié: (2024)
Learning While Staying Curious: Entropy-Preserving Supervised Fine-Tuning via Adaptive Self-Distillation for Large Reasoning Models
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
Supervised Fine-Tuning Achieve Rapid Task Adaption Via Alternating Attention Head Activation Patterns
par: Zhao, Yang, et autres
Publié: (2024)
par: Zhao, Yang, et autres
Publié: (2024)
DropLoRA: Sparse Low-Rank Adaptation for Parameter-Efficient Fine-Tuning
par: Zhang, Haojie
Publié: (2025)
par: Zhang, Haojie
Publié: (2025)
IA2: Alignment with ICL Activations Improves Supervised Fine-Tuning
par: Mishra, Aayush, et autres
Publié: (2025)
par: Mishra, Aayush, et autres
Publié: (2025)
Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control
par: Zhang, Jiazheng, et autres
Publié: (2026)
par: Zhang, Jiazheng, et autres
Publié: (2026)
LCSB: Layer-Cyclic Selective Backpropagation for Memory-Efficient On-Device LLM Fine-Tuning
par: Park, Juneyoung, et autres
Publié: (2026)
par: Park, Juneyoung, et autres
Publié: (2026)
TAGCOS: Task-agnostic Gradient Clustered Coreset Selection for Instruction Tuning Data
par: Zhang, Jipeng, et autres
Publié: (2024)
par: Zhang, Jipeng, et autres
Publié: (2024)
QLESS: A Quantized Approach for Data Valuation and Selection in Large Language Model Fine-Tuning
par: Ananta, Moses, et autres
Publié: (2025)
par: Ananta, Moses, et autres
Publié: (2025)
Documents similaires
-
Anchored Supervised Fine-Tuning
par: Zhu, He, et autres
Publié: (2025) -
Selection of LLM Fine-Tuning Data based on Orthogonal Rules
par: Li, Xiaomin, et autres
Publié: (2024) -
Dissecting Fine-Tuning Unlearning in Large Language Models
par: Hong, Yihuai, et autres
Publié: (2024) -
Mind the Gap: Data Rewriting for Stable Off-Policy Supervised Fine-Tuning
par: Zhao, Shiwan, et autres
Publié: (2025) -
UFT: Unifying Supervised and Reinforcement Fine-Tuning
par: Liu, Mingyang, et autres
Publié: (2025)