Can Muon Fine-tune Adam-Pretrained Models?
Fuente:
arXiv
Salvato in:
| Autori principali: | Qu, Xingyu, Huang, Peigeng, Horvath, Samuel |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Vanishing Feature: Diagnosing Model Merging and Beyond
di: Qu, Xingyu, et al.
Pubblicazione: (2024)
di: Qu, Xingyu, et al.
Pubblicazione: (2024)
Practical Efficiency of Muon for Pretraining
di: AI, Essential, et al.
Pubblicazione: (2025)
di: AI, Essential, et al.
Pubblicazione: (2025)
DP-MicroAdam: Private and Frugal Algorithm for Training and Fine-tuning
di: Hudişteanu, Mihaela, et al.
Pubblicazione: (2025)
di: Hudişteanu, Mihaela, et al.
Pubblicazione: (2025)
The Implicit Bias of Adam and Muon on Smooth Homogeneous Neural Networks
di: Gronich, Eitan, et al.
Pubblicazione: (2026)
di: Gronich, Eitan, et al.
Pubblicazione: (2026)
AdamS: Momentum Itself Can Be A Normalizer for LLM Pretraining and Post-training
di: Zhang, Huishuai, et al.
Pubblicazione: (2025)
di: Zhang, Huishuai, et al.
Pubblicazione: (2025)
LionMuon: Alternating Spectral and Sign Descent for Efficient Training
di: Bolatov, Arman, et al.
Pubblicazione: (2026)
di: Bolatov, Arman, et al.
Pubblicazione: (2026)
PMSS: Pretrained Matrices Skeleton Selection for LLM Fine-tuning
di: Wang, Qibin, et al.
Pubblicazione: (2024)
di: Wang, Qibin, et al.
Pubblicazione: (2024)
Fine-tuning can Help Detect Pretraining Data from Large Language Models
di: Zhang, Hengxiang, et al.
Pubblicazione: (2024)
di: Zhang, Hengxiang, et al.
Pubblicazione: (2024)
Optimizer-Induced Mode Connectivity: From AdamW to Muon
di: Zhang, Fangzhao, et al.
Pubblicazione: (2026)
di: Zhang, Fangzhao, et al.
Pubblicazione: (2026)
Muon Outperforms Adam in Tail-End Associative Memory Learning
di: Wang, Shuche, et al.
Pubblicazione: (2025)
di: Wang, Shuche, et al.
Pubblicazione: (2025)
Federated Learning Can Find Friends That Are Advantageous
di: Tupitsa, Nazarii, et al.
Pubblicazione: (2024)
di: Tupitsa, Nazarii, et al.
Pubblicazione: (2024)
SEE: Continual Fine-tuning with Sequential Ensemble of Experts
di: Wang, Zhilin, et al.
Pubblicazione: (2025)
di: Wang, Zhilin, et al.
Pubblicazione: (2025)
AdaMeZO: Adam-style Zeroth-Order Optimizer for LLM Fine-tuning Without Maintaining the Moments
di: Cai, Zhijie, et al.
Pubblicazione: (2026)
di: Cai, Zhijie, et al.
Pubblicazione: (2026)
Shake to Leak: Fine-tuning Diffusion Models Can Amplify the Generative Privacy Risk
di: Li, Zhangheng, et al.
Pubblicazione: (2024)
di: Li, Zhangheng, et al.
Pubblicazione: (2024)
LiMuon: Light and Fast Muon Optimizer for Large Models
di: Huang, Feihu, et al.
Pubblicazione: (2025)
di: Huang, Feihu, et al.
Pubblicazione: (2025)
Fine-tuning of Large Language Models for Domain-Specific Cybersecurity Knowledge
di: Huang, Yuan
Pubblicazione: (2025)
di: Huang, Yuan
Pubblicazione: (2025)
Enhancing Multi-modal Models with Heterogeneous MoE Adapters for Fine-tuning
di: Zhou, Sashuai, et al.
Pubblicazione: (2025)
di: Zhou, Sashuai, et al.
Pubblicazione: (2025)
Variance-Adaptive Muon: Accelerating LLM Pretraining with NSR-Modulated and Variance-Scaled Momentum
di: Li, Jingru, et al.
Pubblicazione: (2026)
di: Li, Jingru, et al.
Pubblicazione: (2026)
Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR
di: Fan, Chongyu, et al.
Pubblicazione: (2026)
di: Fan, Chongyu, et al.
Pubblicazione: (2026)
Comparing Reconstruction Attacks on Pretrained Versus Full Fine-tuned Large Language Model Embeddings on Homo Sapiens Splice Sites Genomic Data
di: Al-Saidi, Reem, et al.
Pubblicazione: (2025)
di: Al-Saidi, Reem, et al.
Pubblicazione: (2025)
Connect Later: Improving Fine-tuning for Robustness with Targeted Augmentations
di: Qu, Helen, et al.
Pubblicazione: (2024)
di: Qu, Helen, et al.
Pubblicazione: (2024)
Clipping Improves Adam-Norm and AdaGrad-Norm when the Noise Is Heavy-Tailed
di: Chezhegov, Savelii, et al.
Pubblicazione: (2024)
di: Chezhegov, Savelii, et al.
Pubblicazione: (2024)
Joint Fine-tuning and Conversion of Pretrained Speech and Language Models towards Linear Complexity
di: He, Mutian, et al.
Pubblicazione: (2024)
di: He, Mutian, et al.
Pubblicazione: (2024)
HM3: Hierarchical Multi-Objective Model Merging for Pretrained Models
di: Zhou, Yu, et al.
Pubblicazione: (2024)
di: Zhou, Yu, et al.
Pubblicazione: (2024)
A Theory of How Pretraining Shapes Inductive Bias in Fine-Tuning
di: Anguita, Nicolas, et al.
Pubblicazione: (2026)
di: Anguita, Nicolas, et al.
Pubblicazione: (2026)
Can Perplexity Predict Fine-tuning Performance? An Investigation of Tokenization Effects on Sequential Language Models for Nepali
di: Luitel, Nishant, et al.
Pubblicazione: (2024)
di: Luitel, Nishant, et al.
Pubblicazione: (2024)
Efficient Adjoint Matching for Fine-tuning Diffusion Models
di: Shin, Jeongwoo, et al.
Pubblicazione: (2026)
di: Shin, Jeongwoo, et al.
Pubblicazione: (2026)
Tune My Adam, Please!
di: Athanasiadis, Theodoros, et al.
Pubblicazione: (2025)
di: Athanasiadis, Theodoros, et al.
Pubblicazione: (2025)
Memento: Fine-tuning LLM Agents without Fine-tuning LLMs
di: Zhou, Huichi, et al.
Pubblicazione: (2025)
di: Zhou, Huichi, et al.
Pubblicazione: (2025)
Breaking the Limits of Open-Weight CLIP: An Optimization Framework for Self-supervised Fine-tuning of CLIP
di: Mehta, Anant, et al.
Pubblicazione: (2026)
di: Mehta, Anant, et al.
Pubblicazione: (2026)
MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models
di: Huang, Feihu, et al.
Pubblicazione: (2026)
di: Huang, Feihu, et al.
Pubblicazione: (2026)
LoFT: Low-Rank Adaptation That Behaves Like Full Fine-Tuning
di: Tastan, Nurbek, et al.
Pubblicazione: (2025)
di: Tastan, Nurbek, et al.
Pubblicazione: (2025)
Towards Green AI in Fine-tuning Large Language Models via Adaptive Backpropagation
di: Huang, Kai, et al.
Pubblicazione: (2023)
di: Huang, Kai, et al.
Pubblicazione: (2023)
A Study of Optimizations for Fine-tuning Large Language Models
di: Singh, Arjun, et al.
Pubblicazione: (2024)
di: Singh, Arjun, et al.
Pubblicazione: (2024)
Efficiently Estimating Data Efficiency for Language Model Fine-tuning
di: Je, Gyung Hyun, et al.
Pubblicazione: (2025)
di: Je, Gyung Hyun, et al.
Pubblicazione: (2025)
Model Balancing Helps Low-data Training and Fine-tuning
di: Liu, Zihang, et al.
Pubblicazione: (2024)
di: Liu, Zihang, et al.
Pubblicazione: (2024)
ReMem: Mutual Information-Aware Fine-tuning of Pretrained Vision Transformers for Effective Knowledge Distillation
di: Dong, Chengyu, et al.
Pubblicazione: (2025)
di: Dong, Chengyu, et al.
Pubblicazione: (2025)
AdaMuon: Adaptive Muon Optimizer
di: Si, Chongjie, et al.
Pubblicazione: (2025)
di: Si, Chongjie, et al.
Pubblicazione: (2025)
Bayesian Fine-tuning in Projected Subspaces
di: Dubovik, Viktar, et al.
Pubblicazione: (2026)
di: Dubovik, Viktar, et al.
Pubblicazione: (2026)
HOFT: Householder Orthogonal Fine-tuning
di: Arcas, Alejandro Moreno, et al.
Pubblicazione: (2025)
di: Arcas, Alejandro Moreno, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Vanishing Feature: Diagnosing Model Merging and Beyond
di: Qu, Xingyu, et al.
Pubblicazione: (2024) -
Practical Efficiency of Muon for Pretraining
di: AI, Essential, et al.
Pubblicazione: (2025) -
DP-MicroAdam: Private and Frugal Algorithm for Training and Fine-tuning
di: Hudişteanu, Mihaela, et al.
Pubblicazione: (2025) -
The Implicit Bias of Adam and Muon on Smooth Homogeneous Neural Networks
di: Gronich, Eitan, et al.
Pubblicazione: (2026) -
AdamS: Momentum Itself Can Be A Normalizer for LLM Pretraining and Post-training
di: Zhang, Huishuai, et al.
Pubblicazione: (2025)