MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Feihu, Luo, Yuning, Chen, Songcan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LiMuon: Light and Fast Muon Optimizer for Large Models
por: Huang, Feihu, et al.
Publicado: (2025)
por: Huang, Feihu, et al.
Publicado: (2025)
The Newton-Muon Optimizer
por: Du, Zhehang, et al.
Publicado: (2026)
por: Du, Zhehang, et al.
Publicado: (2026)
Preconditioning Benefits of Spectral Orthogonalization in Muon
por: Ma, Jianhao, et al.
Publicado: (2026)
por: Ma, Jianhao, et al.
Publicado: (2026)
DeMuon: A Decentralized Muon for Matrix Optimization over Graphs
por: He, Chuan, et al.
Publicado: (2025)
por: He, Chuan, et al.
Publicado: (2025)
CLion: Efficient Cautious Lion Optimizer with Enhanced Generalization
por: Huang, Feihu, et al.
Publicado: (2026)
por: Huang, Feihu, et al.
Publicado: (2026)
Optimizer-Induced Mode Connectivity: From AdamW to Muon
por: Zhang, Fangzhao, et al.
Publicado: (2026)
por: Zhang, Fangzhao, et al.
Publicado: (2026)
Muon Dynamics as a Spectral Wasserstein Flow
por: Peyré, Gabriel
Publicado: (2026)
por: Peyré, Gabriel
Publicado: (2026)
HomeAdam: Adam and AdamW Algorithms Sometimes Go Home to Obtain Better Provable Generalization
por: Huang, Feihu, et al.
Publicado: (2026)
por: Huang, Feihu, et al.
Publicado: (2026)
Muon Outperforms Adam in Tail-End Associative Memory Learning
por: Wang, Shuche, et al.
Publicado: (2025)
por: Wang, Shuche, et al.
Publicado: (2025)
Adaptive Federated Minimax Optimization with Lower Complexities
por: Huang, Feihu, et al.
Publicado: (2022)
por: Huang, Feihu, et al.
Publicado: (2022)
Improved Convergence Rates of Muon Optimizer for Nonconvex Optimization
por: Nagashima, Shuntaro, et al.
Publicado: (2026)
por: Nagashima, Shuntaro, et al.
Publicado: (2026)
Muon is Not That Special: Random or Inverted Spectra Work Just as Well
por: Shumaylov, Zakhar, et al.
Publicado: (2026)
por: Shumaylov, Zakhar, et al.
Publicado: (2026)
Muon Optimizes Under Spectral Norm Constraints
por: Chen, Lizhang, et al.
Publicado: (2025)
por: Chen, Lizhang, et al.
Publicado: (2025)
Phases of Muon: When Muon Eclipses SignSGD
por: Paquette, Elliot, et al.
Publicado: (2026)
por: Paquette, Elliot, et al.
Publicado: (2026)
MuonBP: Faster Muon via Block-Periodic Orthogonalization
por: Khaled, Ahmed, et al.
Publicado: (2025)
por: Khaled, Ahmed, et al.
Publicado: (2025)
Enhanced Adaptive Gradient Algorithms for Nonconvex-PL Minimax Optimization
por: Huang, Feihu, et al.
Publicado: (2023)
por: Huang, Feihu, et al.
Publicado: (2023)
On the Convergence Analysis of Muon
por: Shen, Wei, et al.
Publicado: (2025)
por: Shen, Wei, et al.
Publicado: (2025)
Lions and Muons: Optimization via Stochastic Frank-Wolfe
por: Sfyraki, Maria-Eleni, et al.
Publicado: (2025)
por: Sfyraki, Maria-Eleni, et al.
Publicado: (2025)
Convergence of Muon with Newton-Schulz
por: Kim, Gyu Yeol, et al.
Publicado: (2026)
por: Kim, Gyu Yeol, et al.
Publicado: (2026)
Error Feedback for Muon and Friends
por: Gruntkowska, Kaja, et al.
Publicado: (2025)
por: Gruntkowska, Kaja, et al.
Publicado: (2025)
ARO: A New Lens On Matrix Optimization For Large Models
por: Gong, Wenbo, et al.
Publicado: (2026)
por: Gong, Wenbo, et al.
Publicado: (2026)
Optimal Hessian/Jacobian-Free Nonconvex-PL Bilevel Optimization
por: Huang, Feihu
Publicado: (2024)
por: Huang, Feihu
Publicado: (2024)
Insights on Muon from Simple Quadratics
por: Gonon, Antoine, et al.
Publicado: (2026)
por: Gonon, Antoine, et al.
Publicado: (2026)
FedMuon: Federated Learning with Bias-corrected LMO-based Optimization
por: Takezawa, Yuki, et al.
Publicado: (2025)
por: Takezawa, Yuki, et al.
Publicado: (2025)
Intersectional Fairness via Mixed-Integer Optimization
por: Němeček, Jiří, et al.
Publicado: (2026)
por: Němeček, Jiří, et al.
Publicado: (2026)
Muon Does Not Converge on Convex Lipschitz Functions
por: Parshakova, Tetiana, et al.
Publicado: (2026)
por: Parshakova, Tetiana, et al.
Publicado: (2026)
Muon is Provably Faster with Momentum Variance Reduction
por: Qian, Xun, et al.
Publicado: (2025)
por: Qian, Xun, et al.
Publicado: (2025)
Drop-Muon: Update Less, Converge Faster
por: Gruntkowska, Kaja, et al.
Publicado: (2025)
por: Gruntkowska, Kaja, et al.
Publicado: (2025)
Beyond the Ideal: Analyzing the Inexact Muon Update
por: Shulgin, Egor, et al.
Publicado: (2025)
por: Shulgin, Egor, et al.
Publicado: (2025)
Implicit Bias of Spectral Descent and Muon on Multiclass Separable Data
por: Fan, Chen, et al.
Publicado: (2025)
por: Fan, Chen, et al.
Publicado: (2025)
Leveraging Coordinate Momentum in SignSGD and Muon: Memory-Optimized Zero-Order
por: Petrov, Egor, et al.
Publicado: (2025)
por: Petrov, Egor, et al.
Publicado: (2025)
On Finding Small Hyper-Gradients in Bilevel Optimization: Hardness Results and Improved Analysis
por: Chen, Lesi, et al.
Publicado: (2023)
por: Chen, Lesi, et al.
Publicado: (2023)
From Large Language Models and Optimization to Decision Optimization CoPilot: A Research Manifesto
por: Wasserkrug, Segev, et al.
Publicado: (2024)
por: Wasserkrug, Segev, et al.
Publicado: (2024)
Optimization and Generalization Guarantees for Weight Normalization
por: Cisneros-Velarde, Pedro, et al.
Publicado: (2024)
por: Cisneros-Velarde, Pedro, et al.
Publicado: (2024)
Policy Optimization in Hybrid Discrete-Continuous Action Spaces via Mixed Gradients
por: Alvo, Matias, et al.
Publicado: (2026)
por: Alvo, Matias, et al.
Publicado: (2026)
Uncovering Symmetry Transfer in Large Language Models via Layer-Peeled Optimization
por: Du, Zhehang, et al.
Publicado: (2026)
por: Du, Zhehang, et al.
Publicado: (2026)
Learning Backdoors for Mixed Integer Linear Programs with Contrastive Learning
por: Cai, Junyang, et al.
Publicado: (2024)
por: Cai, Junyang, et al.
Publicado: (2024)
Multi-task Representation Learning for Mixed Integer Linear Programming
por: Cai, Junyang, et al.
Publicado: (2024)
por: Cai, Junyang, et al.
Publicado: (2024)
Unsupervised Training of Diffusion Models for Feasible Solution Generation in Neural Combinatorial Optimization
por: Hong, Seong-Hyun, et al.
Publicado: (2024)
por: Hong, Seong-Hyun, et al.
Publicado: (2024)
Muon in Associative Memory Learning: Training Dynamics and Scaling Laws
por: Li, Binghui, et al.
Publicado: (2026)
por: Li, Binghui, et al.
Publicado: (2026)
Ejemplares similares
-
LiMuon: Light and Fast Muon Optimizer for Large Models
por: Huang, Feihu, et al.
Publicado: (2025) -
The Newton-Muon Optimizer
por: Du, Zhehang, et al.
Publicado: (2026) -
Preconditioning Benefits of Spectral Orthogonalization in Muon
por: Ma, Jianhao, et al.
Publicado: (2026) -
DeMuon: A Decentralized Muon for Matrix Optimization over Graphs
por: He, Chuan, et al.
Publicado: (2025) -
CLion: Efficient Cautious Lion Optimizer with Enhanced Generalization
por: Huang, Feihu, et al.
Publicado: (2026)