Understanding Overadaptation in Supervised Fine-Tuning: The Role of Ensemble Methods
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hao, Yifan, Pan, Xingyuan, Zhang, Hanning, Ye, Chenlu, Pan, Rui, Zhang, Tong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models
par: Hao, Yifan, et autres
Publié: (2025)
par: Hao, Yifan, et autres
Publié: (2025)
Self-rewarding correction for mathematical reasoning
par: Xiong, Wei, et autres
Publié: (2025)
par: Xiong, Wei, et autres
Publié: (2025)
PhysProver: Advancing Automatic Theorem Proving for Physics
par: Zhang, Hanning, et autres
Publié: (2026)
par: Zhang, Hanning, et autres
Publié: (2026)
Towards Better Generalization via Distributional Input Projection Network
par: Hao, Yifan, et autres
Publié: (2025)
par: Hao, Yifan, et autres
Publié: (2025)
On-Policy Supervised Fine-Tuning for Efficient Reasoning
par: Zhao, Anhao, et autres
Publié: (2026)
par: Zhao, Anhao, et autres
Publié: (2026)
LR-SQL: A Supervised Fine-Tuning Method for Text2SQL Tasks under Low-Resource Scenarios
par: Wuzhenghong, Wen, et autres
Publié: (2024)
par: Wuzhenghong, Wen, et autres
Publié: (2024)
QuantLRM: Quantization of Large Reasoning Models via Fine-Tuning Signals
par: Zhang, Nan, et autres
Publié: (2026)
par: Zhang, Nan, et autres
Publié: (2026)
Supervised Fine-Tuning versus Reinforcement Learning: A Study of Post-Training Methods for Large Language Models
par: Jiang, Haitao, et autres
Publié: (2026)
par: Jiang, Haitao, et autres
Publié: (2026)
LISA: Layerwise Importance Sampling for Memory-Efficient Large Language Model Fine-Tuning
par: Pan, Rui, et autres
Publié: (2024)
par: Pan, Rui, et autres
Publié: (2024)
Adaptive Layerwise Perturbation: Unifying Off-Policy Corrections for LLM RL
par: Ye, Chenlu, et autres
Publié: (2026)
par: Ye, Chenlu, et autres
Publié: (2026)
Proximal Supervised Fine-Tuning
par: Zhu, Wenhong, et autres
Publié: (2025)
par: Zhu, Wenhong, et autres
Publié: (2025)
Adapt-Pruner: Adaptive Structural Pruning for Efficient Small Language Model Training
par: Pan, Rui, et autres
Publié: (2025)
par: Pan, Rui, et autres
Publié: (2025)
Supervised Fine-Tuning as Inverse Reinforcement Learning
par: Sun, Hao
Publié: (2024)
par: Sun, Hao
Publié: (2024)
Adaptive Ensembles of Fine-Tuned Transformers for LLM-Generated Text Detection
par: Lai, Zhixin, et autres
Publié: (2024)
par: Lai, Zhixin, et autres
Publié: (2024)
Understanding the Performance and Estimating the Cost of LLM Fine-Tuning
par: Xia, Yuchen, et autres
Publié: (2024)
par: Xia, Yuchen, et autres
Publié: (2024)
TAGCOS: Task-agnostic Gradient Clustered Coreset Selection for Instruction Tuning Data
par: Zhang, Jipeng, et autres
Publié: (2024)
par: Zhang, Jipeng, et autres
Publié: (2024)
A Mechanistic Investigation of Supervised Fine Tuning
par: Chopra, Ruhaan
Publié: (2026)
par: Chopra, Ruhaan
Publié: (2026)
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
par: Fu, Yuqian, et autres
Publié: (2025)
par: Fu, Yuqian, et autres
Publié: (2025)
Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL
par: Yao, Jiarui, et autres
Publié: (2025)
par: Yao, Jiarui, et autres
Publié: (2025)
Token Cleaning: Fine-Grained Data Selection for LLM Supervised Fine-Tuning
par: Pang, Jinlong, et autres
Publié: (2025)
par: Pang, Jinlong, et autres
Publié: (2025)
Supervised Fine-Tuning Needs to Unlock the Potential of Token Priority
par: Shen, Zhanming, et autres
Publié: (2026)
par: Shen, Zhanming, et autres
Publié: (2026)
Skillful High-Resolution Ensemble Precipitation Forecasting with an Integrated Deep Learning Framework
par: He, Shuangshuang, et autres
Publié: (2025)
par: He, Shuangshuang, et autres
Publié: (2025)
Rotation-Preserving Supervised Fine-Tuning
par: Jin, Hangzhan, et autres
Publié: (2026)
par: Jin, Hangzhan, et autres
Publié: (2026)
GRE Suite: Geo-localization Inference via Fine-Tuned Vision-Language Models and Enhanced Reasoning Chains
par: Wang, Chun, et autres
Publié: (2025)
par: Wang, Chun, et autres
Publié: (2025)
Understanding and Preserving Safety in Fine-Tuned LLMs
par: Zhang, Jiawen, et autres
Publié: (2026)
par: Zhang, Jiawen, et autres
Publié: (2026)
Analyzing the Effects of Supervised Fine-Tuning on Model Knowledge from Token and Parameter Levels
par: Ye, Junjie, et autres
Publié: (2025)
par: Ye, Junjie, et autres
Publié: (2025)
Semi-Supervised Diseased Detection from Speech Dialogues with Multi-Level Data Modeling
par: Li, Xingyuan, et autres
Publié: (2026)
par: Li, Xingyuan, et autres
Publié: (2026)
Beyond Correctness: Harmonizing Process and Outcome Rewards through RL Training
par: Ye, Chenlu, et autres
Publié: (2025)
par: Ye, Chenlu, et autres
Publié: (2025)
Bayesian Natural Gradient Fine-Tuning of CLIP Models via Kalman Filtering
par: Abdi, Hossein, et autres
Publié: (2025)
par: Abdi, Hossein, et autres
Publié: (2025)
Efficient and Scalable Fine-Tune of Language Models for Genome Understanding
par: Zhan, Huixin, et autres
Publié: (2024)
par: Zhan, Huixin, et autres
Publié: (2024)
Addressing Bias Through Ensemble Learning and Regularized Fine-Tuning
par: Radwan, Ahmed, et autres
Publié: (2024)
par: Radwan, Ahmed, et autres
Publié: (2024)
A Graph Prompt Fine-Tuning Method for WSN Spatio-Temporal Correlation Anomaly Detection
par: Ye, Miao, et autres
Publié: (2026)
par: Ye, Miao, et autres
Publié: (2026)
GFT: From Imitation to Reward Fine-Tuning with Unbiased Group Advantages and Dynamic Coefficient Rectification
par: Gan, Wangjie, et autres
Publié: (2026)
par: Gan, Wangjie, et autres
Publié: (2026)
FedPFT: Federated Proxy Fine-Tuning of Foundation Models
par: Peng, Zhaopeng, et autres
Publié: (2024)
par: Peng, Zhaopeng, et autres
Publié: (2024)
CAT: Causal Attention Tuning For Injecting Fine-grained Causal Knowledge into Large Language Models
par: Han, Kairong, et autres
Publié: (2025)
par: Han, Kairong, et autres
Publié: (2025)
Data Mixing Optimization for Supervised Fine-Tuning of Large Language Models
par: Li, Yuan, et autres
Publié: (2025)
par: Li, Yuan, et autres
Publié: (2025)
A Layer-wise Analysis of Supervised Fine-Tuning
par: Zhao, Qinghua, et autres
Publié: (2026)
par: Zhao, Qinghua, et autres
Publié: (2026)
Goal-Conditioned Supervised Learning for LLM Fine-Tuning
par: Li, Shijun, et autres
Publié: (2026)
par: Li, Shijun, et autres
Publié: (2026)
CharTool: Tool-Integrated Visual Reasoning for Chart Understanding
par: Zhang, Situo, et autres
Publié: (2026)
par: Zhang, Situo, et autres
Publié: (2026)
Zeroth-Order Fine-Tuning of LLMs in Random Subspaces
par: Yu, Ziming, et autres
Publié: (2024)
par: Yu, Ziming, et autres
Publié: (2024)
Documents similaires
-
Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models
par: Hao, Yifan, et autres
Publié: (2025) -
Self-rewarding correction for mathematical reasoning
par: Xiong, Wei, et autres
Publié: (2025) -
PhysProver: Advancing Automatic Theorem Proving for Physics
par: Zhang, Hanning, et autres
Publié: (2026) -
Towards Better Generalization via Distributional Input Projection Network
par: Hao, Yifan, et autres
Publié: (2025) -
On-Policy Supervised Fine-Tuning for Efficient Reasoning
par: Zhao, Anhao, et autres
Publié: (2026)