NuMuon: Nuclear-Norm-Constrained Muon for Compressible LLM Training
Fuente:
arXiv
Guardado en:
| Autores principales: | Dolatabadi, Hadi Mohaghegh, Ajanthan, Thalaiyasingam, Ramasinghe, Sameera, Koneputugodage, Chamin P Hewa, Siriwardhana, Shamane, Shevchenko, Violetta, Pajak, Karol, Snewin, James, Avraham, Gil, Long, Alexander |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SENTINEL: Stagewise Integrity Verification for Pipeline Parallel Decentralized Training
por: Dolatabadi, Hadi Mohaghegh, et al.
Publicado: (2026)
por: Dolatabadi, Hadi Mohaghegh, et al.
Publicado: (2026)
AsyncMesh: Fully Asynchronous Optimization for Data and Pipeline Parallelism
por: Ajanthan, Thalaiyasingam, et al.
Publicado: (2026)
por: Ajanthan, Thalaiyasingam, et al.
Publicado: (2026)
Neural Experts: Mixture of Experts for Implicit Neural Representations
por: Ben-Shabat, Yizhak, et al.
Publicado: (2024)
por: Ben-Shabat, Yizhak, et al.
Publicado: (2024)
VI3NR: Variance Informed Initialization for Implicit Neural Representations
por: Koneputugodage, Chamin Hewa, et al.
Publicado: (2025)
por: Koneputugodage, Chamin Hewa, et al.
Publicado: (2025)
Protocol Models: Scaling Decentralized Training with Communication-Efficient Model Parallelism
por: Ramasinghe, Sameera, et al.
Publicado: (2025)
por: Ramasinghe, Sameera, et al.
Publicado: (2025)
Nesterov Method for Asynchronous Pipeline Parallel Optimization
por: Ajanthan, Thalaiyasingam, et al.
Publicado: (2025)
por: Ajanthan, Thalaiyasingam, et al.
Publicado: (2025)
Scaling Prompt Instructed Zero Shot Composed Image Retrieval with Image-Only Data
por: Duan, Yiqun, et al.
Publicado: (2025)
por: Duan, Yiqun, et al.
Publicado: (2025)
Learning Visual Hierarchies in Hyperbolic Space for Image Retrieval
por: Wang, Ziwei, et al.
Publicado: (2024)
por: Wang, Ziwei, et al.
Publicado: (2024)
A Sampling Theory Perspective on Activations for Implicit Neural Representations
por: Saratchandran, Hemanth, et al.
Publicado: (2024)
por: Saratchandran, Hemanth, et al.
Publicado: (2024)
Sharper Convergence Rates for Nonconvex Optimisation via Reduction Mappings
por: Markou, Evan, et al.
Publicado: (2025)
por: Markou, Evan, et al.
Publicado: (2025)
Guiding Neural Collapse: Optimising Towards the Nearest Simplex Equiangular Tight Frame
por: Markou, Evan, et al.
Publicado: (2024)
por: Markou, Evan, et al.
Publicado: (2024)
Muon Nuclear Data
por: Niikura, Megumi, et al.
Publicado: (2024)
por: Niikura, Megumi, et al.
Publicado: (2024)
Jointly Fine-Tuning "BERT-like" Self Supervised Models to Improve Multimodal Speech Emotion Recognition
por: Siriwardhana, Shamane, et al.
Publicado: (2020)
por: Siriwardhana, Shamane, et al.
Publicado: (2020)
Fine-tune the Entire RAG Architecture (including DPR retriever) for Question-Answering
por: Siriwardhana, Shamane, et al.
Publicado: (2021)
por: Siriwardhana, Shamane, et al.
Publicado: (2021)
Self-Supervision Improves Diffusion Models for Tabular Data Imputation
por: Liu, Yixin, et al.
Publicado: (2024)
por: Liu, Yixin, et al.
Publicado: (2024)
Round Trip Translation Defence against Large Language Model Jailbreaking Attacks
por: Yung, Canaan, et al.
Publicado: (2024)
por: Yung, Canaan, et al.
Publicado: (2024)
Muown: Row-Norm Control for Muon Optimization
por: Lion, Kai, et al.
Publicado: (2026)
por: Lion, Kai, et al.
Publicado: (2026)
Muon Optimizes Under Spectral Norm Constraints
por: Chen, Lizhang, et al.
Publicado: (2025)
por: Chen, Lizhang, et al.
Publicado: (2025)
Muon Nuclear Data Development Project
por: Watanabe, Yukinobu, et al.
Publicado: (2026)
por: Watanabe, Yukinobu, et al.
Publicado: (2026)
From Activation to Initialization: Scaling Insights for Optimizing Neural Fields
por: Saratchandran, Hemanth, et al.
Publicado: (2024)
por: Saratchandran, Hemanth, et al.
Publicado: (2024)
AdaMuon: Adaptive Muon Optimizer
por: Si, Chongjie, et al.
Publicado: (2025)
por: Si, Chongjie, et al.
Publicado: (2025)
Testing the Neutrino Content of the Muon at Muon Colliders
por: Capdevilla, Rodolfo, et al.
Publicado: (2024)
por: Capdevilla, Rodolfo, et al.
Publicado: (2024)
Improving the Domain Adaptation of Retrieval Augmented Generation (RAG) Models for Open Domain Question Answering
por: Siriwardhana, Shamane, et al.
Publicado: (2022)
por: Siriwardhana, Shamane, et al.
Publicado: (2022)
ViewFusion: Towards Multi-View Consistency via Interpolated Denoising
por: Yang, Xianghui, et al.
Publicado: (2024)
por: Yang, Xianghui, et al.
Publicado: (2024)
From SGD to Muon: Adaptive Optimization via Schatten-p Norms
por: Massena, Thomas, et al.
Publicado: (2026)
por: Massena, Thomas, et al.
Publicado: (2026)
NorMuon: Making Muon more efficient and scalable
por: Li, Zichong, et al.
Publicado: (2025)
por: Li, Zichong, et al.
Publicado: (2025)
SignMuon: Communication-Efficient Distributed Muon Optimization
por: Mishra, Neel, et al.
Publicado: (2026)
por: Mishra, Neel, et al.
Publicado: (2026)
Phases of Muon: When Muon Eclipses SignSGD
por: Paquette, Elliot, et al.
Publicado: (2026)
por: Paquette, Elliot, et al.
Publicado: (2026)
Distinguishing Ion Dynamics from Muon Diffusion in Muon Spin Relaxation II -- Extension to Paramagnetic Muons
por: Kadono, Ryosuke, et al.
Publicado: (2024)
por: Kadono, Ryosuke, et al.
Publicado: (2024)
The Muon Collider
por: Accettura, Carlotta, et al.
Publicado: (2025)
por: Accettura, Carlotta, et al.
Publicado: (2025)
MuonBP: Faster Muon via Block-Periodic Orthogonalization
por: Khaled, Ahmed, et al.
Publicado: (2025)
por: Khaled, Ahmed, et al.
Publicado: (2025)
LiMuon: Light and Fast Muon Optimizer for Large Models
por: Huang, Feihu, et al.
Publicado: (2025)
por: Huang, Feihu, et al.
Publicado: (2025)
Probing Muon $g-2$ at a Future Muon Collider
por: Arakawa, Jason, et al.
Publicado: (2022)
por: Arakawa, Jason, et al.
Publicado: (2022)
Muon Signal Charge in the Underground Muon Detector of AugerPrime
por: Scornavacche, Marina
Publicado: (2025)
por: Scornavacche, Marina
Publicado: (2025)
Lepton Flavor Violation: From Muon Decays to Muon Colliders
por: Asadi, Pouya, et al.
Publicado: (2025)
por: Asadi, Pouya, et al.
Publicado: (2025)
DynMuon: A Dynamic Spectral Shaping View of Muon
por: Wu, Fangzhou, et al.
Publicado: (2026)
por: Wu, Fangzhou, et al.
Publicado: (2026)
Trading Positional Complexity vs. Deepness in Coordinate Networks
por: Zheng, Jianqiao, et al.
Publicado: (2022)
por: Zheng, Jianqiao, et al.
Publicado: (2022)
Cuerdas, amor y guitarra [Recurso electrónico] / Chamin Correa
por: Correa, Chamin
por: Correa, Chamin
Muon$^2$: Boosting Muon via Adaptive Second-Moment Preconditioning
por: Liu, Ziyue, et al.
Publicado: (2026)
por: Liu, Ziyue, et al.
Publicado: (2026)
MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models
por: Huang, Feihu, et al.
Publicado: (2026)
por: Huang, Feihu, et al.
Publicado: (2026)
Ejemplares similares
-
SENTINEL: Stagewise Integrity Verification for Pipeline Parallel Decentralized Training
por: Dolatabadi, Hadi Mohaghegh, et al.
Publicado: (2026) -
AsyncMesh: Fully Asynchronous Optimization for Data and Pipeline Parallelism
por: Ajanthan, Thalaiyasingam, et al.
Publicado: (2026) -
Neural Experts: Mixture of Experts for Implicit Neural Representations
por: Ben-Shabat, Yizhak, et al.
Publicado: (2024) -
VI3NR: Variance Informed Initialization for Implicit Neural Representations
por: Koneputugodage, Chamin Hewa, et al.
Publicado: (2025) -
Protocol Models: Scaling Decentralized Training with Communication-Efficient Model Parallelism
por: Ramasinghe, Sameera, et al.
Publicado: (2025)