Salvato in:
| Autori principali: | Zhang, Hongtao, Zhou, Wenjie, Chen, Wei, Cheng, Xueqi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2605.08933 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Stability of Singular Distribution: A Spectral Perspective on the Two-Phase Dynamics of Language Model Pre-training
di: Zhang, Hongtao, et al.
Pubblicazione: (2026)
di: Zhang, Hongtao, et al.
Pubblicazione: (2026)
BSFA: Leveraging the Subspace Dichotomy to Accelerate Neural Network Training
di: Zhou, Wenjie, et al.
Pubblicazione: (2025)
di: Zhou, Wenjie, et al.
Pubblicazione: (2025)
Extra-Merge: Tracing the Rank-1 Subspace of Model Merging in Language Model Pre-Training
di: Zhou, Wenjie, et al.
Pubblicazione: (2026)
di: Zhou, Wenjie, et al.
Pubblicazione: (2026)
MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training
di: Li, Jiacheng, et al.
Pubblicazione: (2026)
di: Li, Jiacheng, et al.
Pubblicazione: (2026)
AdaMuon: Adaptive Muon Optimizer
di: Si, Chongjie, et al.
Pubblicazione: (2025)
di: Si, Chongjie, et al.
Pubblicazione: (2025)
Muon Optimizer Accelerates Grokking
di: Tveit, Amund, et al.
Pubblicazione: (2025)
di: Tveit, Amund, et al.
Pubblicazione: (2025)
When Muon Optimizer Meets Adversarial Training: A Theoretical and Empirical Study
di: Yan, Jun, et al.
Pubblicazione: (2026)
di: Yan, Jun, et al.
Pubblicazione: (2026)
Phases of Muon: When Muon Eclipses SignSGD
di: Paquette, Elliot, et al.
Pubblicazione: (2026)
di: Paquette, Elliot, et al.
Pubblicazione: (2026)
Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts
di: Li, Cheng, et al.
Pubblicazione: (2025)
di: Li, Cheng, et al.
Pubblicazione: (2025)
LiMuon: Light and Fast Muon Optimizer for Large Models
di: Huang, Feihu, et al.
Pubblicazione: (2025)
di: Huang, Feihu, et al.
Pubblicazione: (2025)
MuonQ: Enhancing Low-Bit Muon Quantization via Directional Fidelity Optimization
di: Su, Yupeng, et al.
Pubblicazione: (2026)
di: Su, Yupeng, et al.
Pubblicazione: (2026)
FedMuon: Accelerating Federated Learning with Matrix Orthogonalization
di: Liu, Junkang, et al.
Pubblicazione: (2025)
di: Liu, Junkang, et al.
Pubblicazione: (2025)
MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models
di: Huang, Feihu, et al.
Pubblicazione: (2026)
di: Huang, Feihu, et al.
Pubblicazione: (2026)
Multi-Head Low-Rank Attention
di: Liu, Songtao, et al.
Pubblicazione: (2026)
di: Liu, Songtao, et al.
Pubblicazione: (2026)
SageAttention: Accurate 8-Bit Attention for Plug-and-play Inference Acceleration
di: Zhang, Jintao, et al.
Pubblicazione: (2024)
di: Zhang, Jintao, et al.
Pubblicazione: (2024)
TrasMuon: Trust-Region Adaptive Scaling for Orthogonalized Momentum Optimizers
di: Cheng, Peng, et al.
Pubblicazione: (2026)
di: Cheng, Peng, et al.
Pubblicazione: (2026)
Why Softmax Attention Outperforms Linear Attention
di: Deng, Yichuan, et al.
Pubblicazione: (2023)
di: Deng, Yichuan, et al.
Pubblicazione: (2023)
Foundation Models in Radiology: What, How, When, Why and Why Not
di: Paschali, Magdalini, et al.
Pubblicazione: (2024)
di: Paschali, Magdalini, et al.
Pubblicazione: (2024)
SignMuon: Communication-Efficient Distributed Muon Optimization
di: Mishra, Neel, et al.
Pubblicazione: (2026)
di: Mishra, Neel, et al.
Pubblicazione: (2026)
Muon Optimizes Under Spectral Norm Constraints
di: Chen, Lizhang, et al.
Pubblicazione: (2025)
di: Chen, Lizhang, et al.
Pubblicazione: (2025)
Effective Quantization of Muon Optimizer States
di: Gupta, Aman, et al.
Pubblicazione: (2025)
di: Gupta, Aman, et al.
Pubblicazione: (2025)
SwitchHead: Accelerating Transformers with Mixture-of-Experts Attention
di: Csordás, Róbert, et al.
Pubblicazione: (2023)
di: Csordás, Róbert, et al.
Pubblicazione: (2023)
Optimised Grouped-Query Attention Mechanism for Transformers
di: Chen, Yuang, et al.
Pubblicazione: (2024)
di: Chen, Yuang, et al.
Pubblicazione: (2024)
Benign Overfitting in Single-Head Attention
di: Magen, Roey, et al.
Pubblicazione: (2024)
di: Magen, Roey, et al.
Pubblicazione: (2024)
The Newton-Muon Optimizer
di: Du, Zhehang, et al.
Pubblicazione: (2026)
di: Du, Zhehang, et al.
Pubblicazione: (2026)
Muon: Training and Trade-offs with Latent Attention and MoE
di: Mehta, Sushant, et al.
Pubblicazione: (2025)
di: Mehta, Sushant, et al.
Pubblicazione: (2025)
POME: Post Optimization Model Edit via Muon-style Projection
di: Liu, Yong, et al.
Pubblicazione: (2025)
di: Liu, Yong, et al.
Pubblicazione: (2025)
Muon with Spectral Guidance: Efficient Optimization for Scientific Machine Learning
di: Lu, Binghang, et al.
Pubblicazione: (2026)
di: Lu, Binghang, et al.
Pubblicazione: (2026)
Interleaved Head Attention
di: Duvvuri, Sai Surya, et al.
Pubblicazione: (2026)
di: Duvvuri, Sai Surya, et al.
Pubblicazione: (2026)
NorMuon: Making Muon more efficient and scalable
di: Li, Zichong, et al.
Pubblicazione: (2025)
di: Li, Zichong, et al.
Pubblicazione: (2025)
Muown: Row-Norm Control for Muon Optimization
di: Lion, Kai, et al.
Pubblicazione: (2026)
di: Lion, Kai, et al.
Pubblicazione: (2026)
Multi-Head Attention as a Source of Catastrophic Forgetting in MoE Transformers
di: Chen, Anrui, et al.
Pubblicazione: (2026)
di: Chen, Anrui, et al.
Pubblicazione: (2026)
Adaptive Head Budgeting for Efficient Multi-Head Attention
di: Faye, Bilal, et al.
Pubblicazione: (2026)
di: Faye, Bilal, et al.
Pubblicazione: (2026)
When and Why Does Unsupervised RL Succeed in Mathematical Reasoning? A Manifold Envelopment Perspective
di: Zhang, Zelin, et al.
Pubblicazione: (2026)
di: Zhang, Zelin, et al.
Pubblicazione: (2026)
Amortized Variational Inference: When and Why?
di: Margossian, Charles C., et al.
Pubblicazione: (2023)
di: Margossian, Charles C., et al.
Pubblicazione: (2023)
When, Where and Why to Average Weights?
di: Ajroldi, Niccolò, et al.
Pubblicazione: (2025)
di: Ajroldi, Niccolò, et al.
Pubblicazione: (2025)
Improved Convergence Rates of Muon Optimizer for Nonconvex Optimization
di: Nagashima, Shuntaro, et al.
Pubblicazione: (2026)
di: Nagashima, Shuntaro, et al.
Pubblicazione: (2026)
On the Convergence Analysis of Muon
di: Shen, Wei, et al.
Pubblicazione: (2025)
di: Shen, Wei, et al.
Pubblicazione: (2025)
Efficient Conditioning Why Pseudo Observation Batch Bayesian Optimization Works When It Does not
di: Nagaswetha, Kumbha, et al.
Pubblicazione: (2026)
di: Nagaswetha, Kumbha, et al.
Pubblicazione: (2026)
Convergence Bound and Critical Batch Size of Muon Optimizer
di: Sato, Naoki, et al.
Pubblicazione: (2025)
di: Sato, Naoki, et al.
Pubblicazione: (2025)
Documenti analoghi
-
The Stability of Singular Distribution: A Spectral Perspective on the Two-Phase Dynamics of Language Model Pre-training
di: Zhang, Hongtao, et al.
Pubblicazione: (2026) -
BSFA: Leveraging the Subspace Dichotomy to Accelerate Neural Network Training
di: Zhou, Wenjie, et al.
Pubblicazione: (2025) -
Extra-Merge: Tracing the Rank-1 Subspace of Model Merging in Language Model Pre-Training
di: Zhou, Wenjie, et al.
Pubblicazione: (2026) -
MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training
di: Li, Jiacheng, et al.
Pubblicazione: (2026) -
AdaMuon: Adaptive Muon Optimizer
di: Si, Chongjie, et al.
Pubblicazione: (2025)