Muon in Associative Memory Learning: Training Dynamics and Scaling Laws
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Binghui, Wang, Kaifei, Zhong, Han, Lu, Pinyan, Wang, Liwei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Muon Outperforms Adam in Tail-End Associative Memory Learning
di: Wang, Shuche, et al.
Pubblicazione: (2025)
di: Wang, Shuche, et al.
Pubblicazione: (2025)
Fast Catch-Up, Late Switching: Optimal Batch Size Scheduling via Functional Scaling Laws
di: Wang, Jinbo, et al.
Pubblicazione: (2026)
di: Wang, Jinbo, et al.
Pubblicazione: (2026)
Phases of Muon: When Muon Eclipses SignSGD
di: Paquette, Elliot, et al.
Pubblicazione: (2026)
di: Paquette, Elliot, et al.
Pubblicazione: (2026)
Leveraging Coordinate Momentum in SignSGD and Muon: Memory-Optimized Zero-Order
di: Petrov, Egor, et al.
Pubblicazione: (2025)
di: Petrov, Egor, et al.
Pubblicazione: (2025)
Lions and Muons: Optimization via Stochastic Frank-Wolfe
di: Sfyraki, Maria-Eleni, et al.
Pubblicazione: (2025)
di: Sfyraki, Maria-Eleni, et al.
Pubblicazione: (2025)
MuonBP: Faster Muon via Block-Periodic Orthogonalization
di: Khaled, Ahmed, et al.
Pubblicazione: (2025)
di: Khaled, Ahmed, et al.
Pubblicazione: (2025)
LiMuon: Light and Fast Muon Optimizer for Large Models
di: Huang, Feihu, et al.
Pubblicazione: (2025)
di: Huang, Feihu, et al.
Pubblicazione: (2025)
Muon Optimizes Under Spectral Norm Constraints
di: Chen, Lizhang, et al.
Pubblicazione: (2025)
di: Chen, Lizhang, et al.
Pubblicazione: (2025)
Convergence of Muon with Newton-Schulz
di: Kim, Gyu Yeol, et al.
Pubblicazione: (2026)
di: Kim, Gyu Yeol, et al.
Pubblicazione: (2026)
Error Feedback for Muon and Friends
di: Gruntkowska, Kaja, et al.
Pubblicazione: (2025)
di: Gruntkowska, Kaja, et al.
Pubblicazione: (2025)
Towards a Principled Muon under $μ\mathsf{P}$: Ensuring Spectral Conditions throughout Training
di: Zhao, John
Pubblicazione: (2026)
di: Zhao, John
Pubblicazione: (2026)
FedMuon: Federated Learning with Bias-corrected LMO-based Optimization
di: Takezawa, Yuki, et al.
Pubblicazione: (2025)
di: Takezawa, Yuki, et al.
Pubblicazione: (2025)
Insights on Muon from Simple Quadratics
di: Gonon, Antoine, et al.
Pubblicazione: (2026)
di: Gonon, Antoine, et al.
Pubblicazione: (2026)
Muon Dynamics as a Spectral Wasserstein Flow
di: Peyré, Gabriel
Pubblicazione: (2026)
di: Peyré, Gabriel
Pubblicazione: (2026)
Muon Does Not Converge on Convex Lipschitz Functions
di: Parshakova, Tetiana, et al.
Pubblicazione: (2026)
di: Parshakova, Tetiana, et al.
Pubblicazione: (2026)
Muon is Provably Faster with Momentum Variance Reduction
di: Qian, Xun, et al.
Pubblicazione: (2025)
di: Qian, Xun, et al.
Pubblicazione: (2025)
Drop-Muon: Update Less, Converge Faster
di: Gruntkowska, Kaja, et al.
Pubblicazione: (2025)
di: Gruntkowska, Kaja, et al.
Pubblicazione: (2025)
Beyond the Ideal: Analyzing the Inexact Muon Update
di: Shulgin, Egor, et al.
Pubblicazione: (2025)
di: Shulgin, Egor, et al.
Pubblicazione: (2025)
Beyond Muon: MUD (MomentUm Decorrelation) for Faster Transformer Training
di: Southworth, Ben S., et al.
Pubblicazione: (2026)
di: Southworth, Ben S., et al.
Pubblicazione: (2026)
Scaling Laws for Gradient Descent and Sign Descent for Linear Bigram Models under Zipf's Law
di: Kunstner, Frederik, et al.
Pubblicazione: (2025)
di: Kunstner, Frederik, et al.
Pubblicazione: (2025)
Improved Convergence Rates of Muon Optimizer for Nonconvex Optimization
di: Nagashima, Shuntaro, et al.
Pubblicazione: (2026)
di: Nagashima, Shuntaro, et al.
Pubblicazione: (2026)
AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates
di: Zhang, Minxin, et al.
Pubblicazione: (2025)
di: Zhang, Minxin, et al.
Pubblicazione: (2025)
Implicit Bias of Spectral Descent and Muon on Multiclass Separable Data
di: Fan, Chen, et al.
Pubblicazione: (2025)
di: Fan, Chen, et al.
Pubblicazione: (2025)
Learning Generative Dynamics with Soft Law Constraints: A McKean-Vlasov FBSDE Approach
di: Boustany, Samer El, et al.
Pubblicazione: (2026)
di: Boustany, Samer El, et al.
Pubblicazione: (2026)
Instance-optimal stochastic convex optimization: Can we improve upon sample-average and robust stochastic approximation?
di: Jiang, Liwei, et al.
Pubblicazione: (2026)
di: Jiang, Liwei, et al.
Pubblicazione: (2026)
MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models
di: Huang, Feihu, et al.
Pubblicazione: (2026)
di: Huang, Feihu, et al.
Pubblicazione: (2026)
The Newton-Muon Optimizer
di: Du, Zhehang, et al.
Pubblicazione: (2026)
di: Du, Zhehang, et al.
Pubblicazione: (2026)
On the Convergence Analysis of Muon
di: Shen, Wei, et al.
Pubblicazione: (2025)
di: Shen, Wei, et al.
Pubblicazione: (2025)
Muon with Nesterov Momentum: Heavy-Tailed Noise and (Randomized) Inexact Polar Decomposition
di: Choudhury, Sayantan, et al.
Pubblicazione: (2026)
di: Choudhury, Sayantan, et al.
Pubblicazione: (2026)
PDHG-Unrolled Learning-to-Optimize Method for Large-Scale Linear Programming
di: Li, Bingheng, et al.
Pubblicazione: (2024)
di: Li, Bingheng, et al.
Pubblicazione: (2024)
Muon Converges under Heavy-Tailed Noise: Nonconvex Hölder-Smooth Empirical Risk Minimization
di: Iiduka, Hideaki
Pubblicazione: (2026)
di: Iiduka, Hideaki
Pubblicazione: (2026)
Online Convex Optimization with Memory and Limited Predictions
di: Wang, Zhengmiao, et al.
Pubblicazione: (2024)
di: Wang, Zhengmiao, et al.
Pubblicazione: (2024)
Convex Dominance in Deep Learning I: A Scaling Law of Loss and Learning Rate
di: Bu, Zhiqi, et al.
Pubblicazione: (2026)
di: Bu, Zhiqi, et al.
Pubblicazione: (2026)
Learning an Optimal Assortment Policy under Observational Data
di: Han, Yuxuan, et al.
Pubblicazione: (2025)
di: Han, Yuxuan, et al.
Pubblicazione: (2025)
Gluon: Making Muon & Scion Great Again! (Bridging Theory and Practice of LMO-based Optimizers for LLMs)
di: Riabinin, Artem, et al.
Pubblicazione: (2025)
di: Riabinin, Artem, et al.
Pubblicazione: (2025)
Preconditioning Benefits of Spectral Orthogonalization in Muon
di: Ma, Jianhao, et al.
Pubblicazione: (2026)
di: Ma, Jianhao, et al.
Pubblicazione: (2026)
Finite-Time Decoupled Convergence in Nonlinear Two-Time-Scale Stochastic Approximation
di: Han, Yuze, et al.
Pubblicazione: (2024)
di: Han, Yuze, et al.
Pubblicazione: (2024)
$ϕ$-Balancing for Mixture-of-Experts Training
di: Chen, Lizhang, et al.
Pubblicazione: (2026)
di: Chen, Lizhang, et al.
Pubblicazione: (2026)
Memory-Reduced Meta-Learning with Guaranteed Convergence
di: Yang, Honglin, et al.
Pubblicazione: (2024)
di: Yang, Honglin, et al.
Pubblicazione: (2024)
Towards Guided Descent: Optimization Algorithms for Training Neural Networks At Scale
di: Nagwekar, Ansh
Pubblicazione: (2025)
di: Nagwekar, Ansh
Pubblicazione: (2025)
Documenti analoghi
-
Muon Outperforms Adam in Tail-End Associative Memory Learning
di: Wang, Shuche, et al.
Pubblicazione: (2025) -
Fast Catch-Up, Late Switching: Optimal Batch Size Scheduling via Functional Scaling Laws
di: Wang, Jinbo, et al.
Pubblicazione: (2026) -
Phases of Muon: When Muon Eclipses SignSGD
di: Paquette, Elliot, et al.
Pubblicazione: (2026) -
Leveraging Coordinate Momentum in SignSGD and Muon: Memory-Optimized Zero-Order
di: Petrov, Egor, et al.
Pubblicazione: (2025) -
Lions and Muons: Optimization via Stochastic Frank-Wolfe
di: Sfyraki, Maria-Eleni, et al.
Pubblicazione: (2025)