Preserving Diversity in Supervised Fine-Tuning of Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Ziniu, Chen, Congliang, Xu, Tian, Qin, Zeyu, Xiao, Jiancong, Luo, Zhi-Quan, Sun, Ruoyu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Why Transformers Need Adam: A Hessian Perspective
por: Zhang, Yushun, et al.
Publicado: (2024)
por: Zhang, Yushun, et al.
Publicado: (2024)
Knapsack RL: Unlocking Exploration of LLMs via Optimizing Budget Allocation
por: Li, Ziniu, et al.
Publicado: (2025)
por: Li, Ziniu, et al.
Publicado: (2025)
Adam-mini: Use Fewer Learning Rates To Gain More
por: Zhang, Yushun, et al.
Publicado: (2024)
por: Zhang, Yushun, et al.
Publicado: (2024)
ASFT: Aligned Supervised Fine-Tuning through Absolute Likelihood
por: Wang, Ruoyu, et al.
Publicado: (2024)
por: Wang, Ruoyu, et al.
Publicado: (2024)
Restoring Calibration for Aligned Large Language Models: A Calibration-Aware Fine-Tuning Approach
por: Xiao, Jiancong, et al.
Publicado: (2025)
por: Xiao, Jiancong, et al.
Publicado: (2025)
Quality-Diversity Red-Teaming: Automated Generation of High-Quality and Diverse Attackers for Large Language Models
por: Wang, Ren-Jian, et al.
Publicado: (2025)
por: Wang, Ren-Jian, et al.
Publicado: (2025)
Rotation-Preserving Supervised Fine-Tuning
por: Jin, Hangzhan, et al.
Publicado: (2026)
por: Jin, Hangzhan, et al.
Publicado: (2026)
RoSTE: An Efficient Quantization-Aware Supervised Fine-Tuning Approach for Large Language Models
por: Wei, Quan, et al.
Publicado: (2025)
por: Wei, Quan, et al.
Publicado: (2025)
Supervised Fine-Tuning Needs to Unlock the Potential of Token Priority
por: Shen, Zhanming, et al.
Publicado: (2026)
por: Shen, Zhanming, et al.
Publicado: (2026)
SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models
por: Kim, Gyuhak, et al.
Publicado: (2025)
por: Kim, Gyuhak, et al.
Publicado: (2025)
Self-Evolving Critique Abilities in Large Language Models
por: Tang, Zhengyang, et al.
Publicado: (2025)
por: Tang, Zhengyang, et al.
Publicado: (2025)
On the Entropy Dynamics in Reinforcement Fine-Tuning of Large Language Models
por: Wang, Shumin, et al.
Publicado: (2026)
por: Wang, Shumin, et al.
Publicado: (2026)
The Effectiveness of Approximate Regularized Replay for Efficient Supervised Fine-Tuning of Large Language Models
por: Riemer, Matthew, et al.
Publicado: (2025)
por: Riemer, Matthew, et al.
Publicado: (2025)
MoFO: Momentum-Filtered Optimizer for Mitigating Forgetting in LLM Fine-Tuning
por: Chen, Yupeng, et al.
Publicado: (2024)
por: Chen, Yupeng, et al.
Publicado: (2024)
Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling
por: Huang, Zeyu, et al.
Publicado: (2025)
por: Huang, Zeyu, et al.
Publicado: (2025)
Fine-Tuning Improves Information Conveyance in Language Models
por: Cheng, Yuwei, et al.
Publicado: (2026)
por: Cheng, Yuwei, et al.
Publicado: (2026)
Large Language Models for Sequential Decision-Making: Improving In-Context Learning via Supervised Fine-Tuning
por: Zhang, Minmin, et al.
Publicado: (2026)
por: Zhang, Minmin, et al.
Publicado: (2026)
Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)
por: Qin, Chongli, et al.
Publicado: (2025)
por: Qin, Chongli, et al.
Publicado: (2025)
PrivTune: Efficient and Privacy-Preserving Fine-Tuning of Large Language Models via Device-Cloud Collaboration
por: Liu, Yi, et al.
Publicado: (2025)
por: Liu, Yi, et al.
Publicado: (2025)
Unlock the Correlation between Supervised Fine-Tuning and Reinforcement Learning in Training Code Large Language Models
por: Chen, Jie, et al.
Publicado: (2024)
por: Chen, Jie, et al.
Publicado: (2024)
Proximal Supervised Fine-Tuning
por: Zhu, Wenhong, et al.
Publicado: (2025)
por: Zhu, Wenhong, et al.
Publicado: (2025)
Supervised Fine-Tuning as Inverse Reinforcement Learning
por: Sun, Hao
Publicado: (2024)
por: Sun, Hao
Publicado: (2024)
Beyond the Dirac Delta: Mitigating Diversity Collapse in Reinforcement Fine-Tuning for Versatile Image Generation
por: Liu, Jinmei, et al.
Publicado: (2026)
por: Liu, Jinmei, et al.
Publicado: (2026)
Linearization Explains Fine-Tuning in Large Language Models
por: Afzal, Zahra Rahimi, et al.
Publicado: (2026)
por: Afzal, Zahra Rahimi, et al.
Publicado: (2026)
Automated Federated Pipeline for Parameter-Efficient Fine-Tuning of Large Language Models
por: Fang, Zihan, et al.
Publicado: (2024)
por: Fang, Zihan, et al.
Publicado: (2024)
Understanding and Preserving Safety in Fine-Tuned LLMs
por: Zhang, Jiawen, et al.
Publicado: (2026)
por: Zhang, Jiawen, et al.
Publicado: (2026)
Aligning Large Language Model Agents with Rational and Moral Preferences: A Supervised Fine-Tuning Approach
por: Lu, Wei, et al.
Publicado: (2025)
por: Lu, Wei, et al.
Publicado: (2025)
Aligning Large Language Models via Fine-grained Supervision
por: Xu, Dehong, et al.
Publicado: (2024)
por: Xu, Dehong, et al.
Publicado: (2024)
Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets
por: Lu, Ning, et al.
Publicado: (2025)
por: Lu, Ning, et al.
Publicado: (2025)
FedKRSO: Communication and Memory Efficient Federated Fine-Tuning of Large Language Models
por: Yang, Guohao, et al.
Publicado: (2026)
por: Yang, Guohao, et al.
Publicado: (2026)
RealCritic: Towards Effectiveness-Driven Evaluation of Language Model Critiques
por: Tang, Zhengyang, et al.
Publicado: (2025)
por: Tang, Zhengyang, et al.
Publicado: (2025)
IRIS: Interpolative Rényi Iterative Self-play for Large Language Model Fine-Tuning
por: Liao, Wenjie, et al.
Publicado: (2026)
por: Liao, Wenjie, et al.
Publicado: (2026)
Improving Large Language Models with Concept-Aware Fine-Tuning
por: Chen, Michael K., et al.
Publicado: (2025)
por: Chen, Michael K., et al.
Publicado: (2025)
A Layer-wise Analysis of Supervised Fine-Tuning
por: Zhao, Qinghua, et al.
Publicado: (2026)
por: Zhao, Qinghua, et al.
Publicado: (2026)
Understanding and Guiding Layer Placement in Parameter-Efficient Fine-Tuning of Large Language Models
por: Xu, Yichen, et al.
Publicado: (2026)
por: Xu, Yichen, et al.
Publicado: (2026)
ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models
por: Li, Ziniu, et al.
Publicado: (2023)
por: Li, Ziniu, et al.
Publicado: (2023)
Step-wise Adaptive Integration of Supervised Fine-tuning and Reinforcement Learning for Task-Specific LLMs
por: Chen, Jack, et al.
Publicado: (2025)
por: Chen, Jack, et al.
Publicado: (2025)
Boosting Large Language Models with Mask Fine-Tuning
por: Zhang, Mingyuan, et al.
Publicado: (2025)
por: Zhang, Mingyuan, et al.
Publicado: (2025)
Scaling Sparse Fine-Tuning to Large Language Models
por: Ansell, Alan, et al.
Publicado: (2024)
por: Ansell, Alan, et al.
Publicado: (2024)
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
por: Hong, Joey, et al.
Publicado: (2024)
por: Hong, Joey, et al.
Publicado: (2024)
Ejemplares similares
-
Why Transformers Need Adam: A Hessian Perspective
por: Zhang, Yushun, et al.
Publicado: (2024) -
Knapsack RL: Unlocking Exploration of LLMs via Optimizing Budget Allocation
por: Li, Ziniu, et al.
Publicado: (2025) -
Adam-mini: Use Fewer Learning Rates To Gain More
por: Zhang, Yushun, et al.
Publicado: (2024) -
ASFT: Aligned Supervised Fine-Tuning through Absolute Likelihood
por: Wang, Ruoyu, et al.
Publicado: (2024) -
Restoring Calibration for Aligned Large Language Models: A Calibration-Aware Fine-Tuning Approach
por: Xiao, Jiancong, et al.
Publicado: (2025)