Supervised Fine-Tuning Needs to Unlock the Potential of Token Priority
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shen, Zhanming, Qin, Zeyu, Hu, Jiaqi, Ye, Wentao, Chen, Hao, Hu, Xiaomeng, Xu, Haokai, Chen, Gang, Fung, Yi R., Wang, Haobo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CYCLE-INSTRUCT: Fully Seed-Free Instruction Tuning via Dual Self-Training and Cycle Consistency
par: Shen, Zhanming, et autres
Publié: (2025)
par: Shen, Zhanming, et autres
Publié: (2025)
FLaG: Fine-Grained Latent Grouping for Hallucination Detection
par: Ye, Wentao, et autres
Publié: (2026)
par: Ye, Wentao, et autres
Publié: (2026)
Training-Trajectory-Aware Token Selection
par: Shen, Zhanming, et autres
Publié: (2026)
par: Shen, Zhanming, et autres
Publié: (2026)
Merge-of-Thought Distillation
par: Shen, Zhanming, et autres
Publié: (2025)
par: Shen, Zhanming, et autres
Publié: (2025)
Data Contamination Calibration for Black-box LLMs
par: Ye, Wentao, et autres
Publié: (2024)
par: Ye, Wentao, et autres
Publié: (2024)
From Parameters to Data: A Task-Parameter-Guided Fine-Tuning Pipeline for Efficient LLM Alignment
par: Chen, Hao, et autres
Publié: (2026)
par: Chen, Hao, et autres
Publié: (2026)
Token Cleaning: Fine-Grained Data Selection for LLM Supervised Fine-Tuning
par: Pang, Jinlong, et autres
Publié: (2025)
par: Pang, Jinlong, et autres
Publié: (2025)
Preserving Diversity in Supervised Fine-Tuning of Large Language Models
par: Li, Ziniu, et autres
Publié: (2024)
par: Li, Ziniu, et autres
Publié: (2024)
Applying Fine-Tuned LLMs for Reducing Data Needs in Load Profile Analysis
par: Hu, Yi, et autres
Publié: (2024)
par: Hu, Yi, et autres
Publié: (2024)
One-Token Rollout: Guiding Supervised Fine-Tuning of LLMs with Policy Gradient
par: Ming, Rui, et autres
Publié: (2025)
par: Ming, Rui, et autres
Publié: (2025)
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
par: Tan, Zhiyu, et autres
Publié: (2024)
par: Tan, Zhiyu, et autres
Publié: (2024)
Beyond Generation: Unlocking Universal Editing via Self-Supervised Fine-Tuning
par: Chen, Harold Haodong, et autres
Publié: (2024)
par: Chen, Harold Haodong, et autres
Publié: (2024)
Closed-Loop Supervised Fine-Tuning of Tokenized Traffic Models
par: Zhang, Zhejun, et autres
Publié: (2024)
par: Zhang, Zhejun, et autres
Publié: (2024)
Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models
par: Hu, Xiaomeng, et autres
Publié: (2024)
par: Hu, Xiaomeng, et autres
Publié: (2024)
Beyond Token-level Supervision: Unlocking the Potential of Decoding-based Regression via Reinforcement Learning
par: Chen, Ming, et autres
Publié: (2025)
par: Chen, Ming, et autres
Publié: (2025)
On-Policy Supervised Fine-Tuning for Efficient Reasoning
par: Zhao, Anhao, et autres
Publié: (2026)
par: Zhao, Anhao, et autres
Publié: (2026)
Efficiently Tackling Million-Dimensional Multiobjective Problems: A Direction Sampling and Fine-Tuning Approach
par: Hong, Haokai, et autres
Publié: (2023)
par: Hong, Haokai, et autres
Publié: (2023)
Reinforcement Learning with Rubric Anchors
par: Huang, Zenan, et autres
Publié: (2025)
par: Huang, Zenan, et autres
Publié: (2025)
SPA++: Generalized Graph Spectral Alignment for Versatile Domain Adaptation
par: Xiao, Zhiqing, et autres
Publié: (2025)
par: Xiao, Zhiqing, et autres
Publié: (2025)
Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling
par: Huang, Zeyu, et autres
Publié: (2025)
par: Huang, Zeyu, et autres
Publié: (2025)
ReFT: Reasoning with Reinforced Fine-Tuning
par: Luong, Trung Quoc, et autres
Publié: (2024)
par: Luong, Trung Quoc, et autres
Publié: (2024)
Rethinking Data Selection for Supervised Fine-Tuning
par: Shen, Ming
Publié: (2024)
par: Shen, Ming
Publié: (2024)
Unlock the Correlation between Supervised Fine-Tuning and Reinforcement Learning in Training Code Large Language Models
par: Chen, Jie, et autres
Publié: (2024)
par: Chen, Jie, et autres
Publié: (2024)
Reasoning Path Divergence: A New Metric and Curation Strategy to Unlock LLM Diverse Thinking
par: Ju, Feng, et autres
Publié: (2025)
par: Ju, Feng, et autres
Publié: (2025)
Analyzing the Effects of Supervised Fine-Tuning on Model Knowledge from Token and Parameter Levels
par: Ye, Junjie, et autres
Publié: (2025)
par: Ye, Junjie, et autres
Publié: (2025)
Unlocking the Potential of Difficulty Prior in RL-based Multimodal Reasoning
par: Chen, Mingrui, et autres
Publié: (2025)
par: Chen, Mingrui, et autres
Publié: (2025)
Supervised Fine-Tuning as Inverse Reinforcement Learning
par: Sun, Hao
Publié: (2024)
par: Sun, Hao
Publié: (2024)
Natural Language Fine-Tuning
par: Liu, Jia, et autres
Publié: (2024)
par: Liu, Jia, et autres
Publié: (2024)
Anchored Supervised Fine-Tuning
par: Zhu, He, et autres
Publié: (2025)
par: Zhu, He, et autres
Publié: (2025)
MatterTune: An Integrated, User-Friendly Platform for Fine-Tuning Atomistic Foundation Models to Accelerate Materials Simulation and Discovery
par: Kong, Lingyu, et autres
Publié: (2025)
par: Kong, Lingyu, et autres
Publié: (2025)
The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models
par: Ji, Ke, et autres
Publié: (2025)
par: Ji, Ke, et autres
Publié: (2025)
Understanding Overadaptation in Supervised Fine-Tuning: The Role of Ensemble Methods
par: Hao, Yifan, et autres
Publié: (2025)
par: Hao, Yifan, et autres
Publié: (2025)
Unlock the Potential of Fine-grained LLM Serving via Dynamic Module Scaling
par: Wu, Jingfeng, et autres
Publié: (2025)
par: Wu, Jingfeng, et autres
Publié: (2025)
Unlocking the Black Box: A Five-Dimensional Framework for Evaluating Explainable AI in Credit Risk
par: Ye, Rongbin, et autres
Publié: (2025)
par: Ye, Rongbin, et autres
Publié: (2025)
FastBUS: A Fast Bayesian Framework for Unified Weakly-Supervised Learning
par: Wang, Ziquan, et autres
Publié: (2026)
par: Wang, Ziquan, et autres
Publié: (2026)
An Invariant Latent Space Perspective on Language Model Inversion
par: Ye, Wentao, et autres
Publié: (2025)
par: Ye, Wentao, et autres
Publié: (2025)
Fine-Tuning Protein Language Models Unlocks the Potential of Underrepresented Viral Proteomes.
par: Sawhney, Rajan, et autres
Publié: (2025)
par: Sawhney, Rajan, et autres
Publié: (2025)
From Drafts to Answers: Unlocking LLM Potential via Aggregation Fine-Tuning
par: Li, Yafu, et autres
Publié: (2025)
par: Li, Yafu, et autres
Publié: (2025)
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models
par: Shi, Wentao, et autres
Publié: (2025)
par: Shi, Wentao, et autres
Publié: (2025)
Understanding Forgetting in LLM Supervised Fine-Tuning and Preference Learning -- A Convex Optimization Perspective
par: Fernando, Heshan, et autres
Publié: (2024)
par: Fernando, Heshan, et autres
Publié: (2024)
Documents similaires
-
CYCLE-INSTRUCT: Fully Seed-Free Instruction Tuning via Dual Self-Training and Cycle Consistency
par: Shen, Zhanming, et autres
Publié: (2025) -
FLaG: Fine-Grained Latent Grouping for Hallucination Detection
par: Ye, Wentao, et autres
Publié: (2026) -
Training-Trajectory-Aware Token Selection
par: Shen, Zhanming, et autres
Publié: (2026) -
Merge-of-Thought Distillation
par: Shen, Zhanming, et autres
Publié: (2025) -
Data Contamination Calibration for Black-box LLMs
par: Ye, Wentao, et autres
Publié: (2024)