When Muon Optimizer Meets Adversarial Training: A Theoretical and Empirical Study
Fuente:
arXiv
Guardado en:
| Autores principales: | Yan, Jun, Huang, Weiquan, Zuo, Jiankai, Mo, Yujian, Fang, Xi, Wu, Chengliang, Wei, Zeming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
When and Why Grouping Attention Heads Accelerates Muon Optimization
por: Zhang, Hongtao, et al.
Publicado: (2026)
por: Zhang, Hongtao, et al.
Publicado: (2026)
AdaMuon: Adaptive Muon Optimizer
por: Si, Chongjie, et al.
Publicado: (2025)
por: Si, Chongjie, et al.
Publicado: (2025)
Fight Back Against Jailbreaking via Prompt Adversarial Tuning
por: Mo, Yichuan, et al.
Publicado: (2024)
por: Mo, Yichuan, et al.
Publicado: (2024)
Identifying and Understanding Cross-Class Features in Adversarial Training
por: Wei, Zeming, et al.
Publicado: (2025)
por: Wei, Zeming, et al.
Publicado: (2025)
DiM-TS: Bridge the Gap between Selective State Space Models and Time Series for Generative Modeling
por: Yao, Zihao, et al.
Publicado: (2025)
por: Yao, Zihao, et al.
Publicado: (2025)
Phases of Muon: When Muon Eclipses SignSGD
por: Paquette, Elliot, et al.
Publicado: (2026)
por: Paquette, Elliot, et al.
Publicado: (2026)
LiMuon: Light and Fast Muon Optimizer for Large Models
por: Huang, Feihu, et al.
Publicado: (2025)
por: Huang, Feihu, et al.
Publicado: (2025)
When LLM Agents Meet Graph Optimization: An Automated Data Quality Improvement Approach
por: Zhang, Zhihan, et al.
Publicado: (2025)
por: Zhang, Zhihan, et al.
Publicado: (2025)
When RL Meets Adaptive Speculative Training: A Unified Training-Serving System
por: Wang, Junxiong, et al.
Publicado: (2026)
por: Wang, Junxiong, et al.
Publicado: (2026)
A Theoretical Understanding of Self-Correction through In-context Alignment
por: Wang, Yifei, et al.
Publicado: (2024)
por: Wang, Yifei, et al.
Publicado: (2024)
Breaking Symmetry When Training Transformers
por: Zuo, Chunsheng, et al.
Publicado: (2024)
por: Zuo, Chunsheng, et al.
Publicado: (2024)
When Invariant Representation Learning Meets Label Shift: Insufficiency and Theoretical Insights
por: Luo, You-Wei, et al.
Publicado: (2024)
por: Luo, You-Wei, et al.
Publicado: (2024)
On the Duality Between Sharpness-Aware Minimization and Adversarial Training
por: Zhang, Yihao, et al.
Publicado: (2024)
por: Zhang, Yihao, et al.
Publicado: (2024)
NuMuon: Nuclear-Norm-Constrained Muon for Compressible LLM Training
por: Dolatabadi, Hadi Mohaghegh, et al.
Publicado: (2026)
por: Dolatabadi, Hadi Mohaghegh, et al.
Publicado: (2026)
Democratic Training Against Universal Adversarial Perturbations
por: Sun, Bing, et al.
Publicado: (2025)
por: Sun, Bing, et al.
Publicado: (2025)
Short-length Adversarial Training Helps LLMs Defend Long-length Jailbreak Attacks: Theoretical and Empirical Evidence
por: Fu, Shaopeng, et al.
Publicado: (2025)
por: Fu, Shaopeng, et al.
Publicado: (2025)
Enhancing Adversarial Training via Reweighting Optimization Trajectory
por: Huang, Tianjin, et al.
Publicado: (2023)
por: Huang, Tianjin, et al.
Publicado: (2023)
Better Representations via Adversarial Training in Pre-Training: A Theoretical Perspective
por: Xing, Yue, et al.
Publicado: (2024)
por: Xing, Yue, et al.
Publicado: (2024)
MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models
por: Huang, Feihu, et al.
Publicado: (2026)
por: Huang, Feihu, et al.
Publicado: (2026)
Muon is Scalable for LLM Training
por: Liu, Jingyuan, et al.
Publicado: (2025)
por: Liu, Jingyuan, et al.
Publicado: (2025)
Lions and Muons: Optimization via Stochastic Frank-Wolfe
por: Sfyraki, Maria-Eleni, et al.
Publicado: (2025)
por: Sfyraki, Maria-Eleni, et al.
Publicado: (2025)
When Pattern-by-Pattern Works: Theoretical and Empirical Insights for Logistic Models with Missing Values
por: Muller, Christophe, et al.
Publicado: (2025)
por: Muller, Christophe, et al.
Publicado: (2025)
ReAct Meets ActRe: When Language Agents Enjoy Training Data Autonomy
por: Yang, Zonghan, et al.
Publicado: (2024)
por: Yang, Zonghan, et al.
Publicado: (2024)
Adversarial Representation Engineering: A General Model Editing Framework for Large Language Models
por: Zhang, Yihao, et al.
Publicado: (2024)
por: Zhang, Yihao, et al.
Publicado: (2024)
MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training
por: Li, Jiacheng, et al.
Publicado: (2026)
por: Li, Jiacheng, et al.
Publicado: (2026)
Decoding Large Language Diffusion Models with Foreseeing Movement
por: Mo, Yichuan, et al.
Publicado: (2025)
por: Mo, Yichuan, et al.
Publicado: (2025)
When and Why Adversarial Training Improves PINNs: A Neural Tangent Kernel Perspective
por: Cao, Yuan-dong, et al.
Publicado: (2026)
por: Cao, Yuan-dong, et al.
Publicado: (2026)
AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates
por: Zhang, Minxin, et al.
Publicado: (2025)
por: Zhang, Minxin, et al.
Publicado: (2025)
Effective Quantization of Muon Optimizer States
por: Gupta, Aman, et al.
Publicado: (2025)
por: Gupta, Aman, et al.
Publicado: (2025)
LaMsS: When Large Language Models Meet Self-Skepticism
por: Wu, Yetao, et al.
Publicado: (2024)
por: Wu, Yetao, et al.
Publicado: (2024)
MuonQ: Enhancing Low-Bit Muon Quantization via Directional Fidelity Optimization
por: Su, Yupeng, et al.
Publicado: (2026)
por: Su, Yupeng, et al.
Publicado: (2026)
Adversarial Instance Generation and Robust Training for Neural Combinatorial Optimization with Multiple Objectives
por: Liu, Wei, et al.
Publicado: (2026)
por: Liu, Wei, et al.
Publicado: (2026)
On the Convergence Analysis of Muon
por: Shen, Wei, et al.
Publicado: (2025)
por: Shen, Wei, et al.
Publicado: (2025)
MuCon: Clipped Muon Updates for LLM Training
por: Yi, Albert
Publicado: (2026)
por: Yi, Albert
Publicado: (2026)
SignMuon: Communication-Efficient Distributed Muon Optimization
por: Mishra, Neel, et al.
Publicado: (2026)
por: Mishra, Neel, et al.
Publicado: (2026)
Neural Network Training Techniques Regularize Optimization Trajectory: An Empirical Study
por: Chen, Cheng, et al.
Publicado: (2020)
por: Chen, Cheng, et al.
Publicado: (2020)
Muown: Row-Norm Control for Muon Optimization
por: Lion, Kai, et al.
Publicado: (2026)
por: Lion, Kai, et al.
Publicado: (2026)
The Newton-Muon Optimizer
por: Du, Zhehang, et al.
Publicado: (2026)
por: Du, Zhehang, et al.
Publicado: (2026)
Adversarial Training for Graph Neural Networks via Graph Subspace Energy Optimization
por: Liu, Ganlin, et al.
Publicado: (2024)
por: Liu, Ganlin, et al.
Publicado: (2024)
S2O: Enhancing Adversarial Training with Second-Order Statistics of Weights
por: Jin, Gaojie, et al.
Publicado: (2026)
por: Jin, Gaojie, et al.
Publicado: (2026)
Ejemplares similares
-
When and Why Grouping Attention Heads Accelerates Muon Optimization
por: Zhang, Hongtao, et al.
Publicado: (2026) -
AdaMuon: Adaptive Muon Optimizer
por: Si, Chongjie, et al.
Publicado: (2025) -
Fight Back Against Jailbreaking via Prompt Adversarial Tuning
por: Mo, Yichuan, et al.
Publicado: (2024) -
Identifying and Understanding Cross-Class Features in Adversarial Training
por: Wei, Zeming, et al.
Publicado: (2025) -
DiM-TS: Bridge the Gap between Selective State Space Models and Time Series for Generative Modeling
por: Yao, Zihao, et al.
Publicado: (2025)