When Muon Optimizer Meets Adversarial Training: A Theoretical and Empirical Study
Fuente:
arXiv
Salvato in:
| Autori principali: | Yan, Jun, Huang, Weiquan, Zuo, Jiankai, Mo, Yujian, Fang, Xi, Wu, Chengliang, Wei, Zeming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
When and Why Grouping Attention Heads Accelerates Muon Optimization
di: Zhang, Hongtao, et al.
Pubblicazione: (2026)
di: Zhang, Hongtao, et al.
Pubblicazione: (2026)
AdaMuon: Adaptive Muon Optimizer
di: Si, Chongjie, et al.
Pubblicazione: (2025)
di: Si, Chongjie, et al.
Pubblicazione: (2025)
Fight Back Against Jailbreaking via Prompt Adversarial Tuning
di: Mo, Yichuan, et al.
Pubblicazione: (2024)
di: Mo, Yichuan, et al.
Pubblicazione: (2024)
Identifying and Understanding Cross-Class Features in Adversarial Training
di: Wei, Zeming, et al.
Pubblicazione: (2025)
di: Wei, Zeming, et al.
Pubblicazione: (2025)
DiM-TS: Bridge the Gap between Selective State Space Models and Time Series for Generative Modeling
di: Yao, Zihao, et al.
Pubblicazione: (2025)
di: Yao, Zihao, et al.
Pubblicazione: (2025)
Phases of Muon: When Muon Eclipses SignSGD
di: Paquette, Elliot, et al.
Pubblicazione: (2026)
di: Paquette, Elliot, et al.
Pubblicazione: (2026)
LiMuon: Light and Fast Muon Optimizer for Large Models
di: Huang, Feihu, et al.
Pubblicazione: (2025)
di: Huang, Feihu, et al.
Pubblicazione: (2025)
When LLM Agents Meet Graph Optimization: An Automated Data Quality Improvement Approach
di: Zhang, Zhihan, et al.
Pubblicazione: (2025)
di: Zhang, Zhihan, et al.
Pubblicazione: (2025)
When RL Meets Adaptive Speculative Training: A Unified Training-Serving System
di: Wang, Junxiong, et al.
Pubblicazione: (2026)
di: Wang, Junxiong, et al.
Pubblicazione: (2026)
A Theoretical Understanding of Self-Correction through In-context Alignment
di: Wang, Yifei, et al.
Pubblicazione: (2024)
di: Wang, Yifei, et al.
Pubblicazione: (2024)
Breaking Symmetry When Training Transformers
di: Zuo, Chunsheng, et al.
Pubblicazione: (2024)
di: Zuo, Chunsheng, et al.
Pubblicazione: (2024)
When Invariant Representation Learning Meets Label Shift: Insufficiency and Theoretical Insights
di: Luo, You-Wei, et al.
Pubblicazione: (2024)
di: Luo, You-Wei, et al.
Pubblicazione: (2024)
On the Duality Between Sharpness-Aware Minimization and Adversarial Training
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
NuMuon: Nuclear-Norm-Constrained Muon for Compressible LLM Training
di: Dolatabadi, Hadi Mohaghegh, et al.
Pubblicazione: (2026)
di: Dolatabadi, Hadi Mohaghegh, et al.
Pubblicazione: (2026)
Democratic Training Against Universal Adversarial Perturbations
di: Sun, Bing, et al.
Pubblicazione: (2025)
di: Sun, Bing, et al.
Pubblicazione: (2025)
Short-length Adversarial Training Helps LLMs Defend Long-length Jailbreak Attacks: Theoretical and Empirical Evidence
di: Fu, Shaopeng, et al.
Pubblicazione: (2025)
di: Fu, Shaopeng, et al.
Pubblicazione: (2025)
Enhancing Adversarial Training via Reweighting Optimization Trajectory
di: Huang, Tianjin, et al.
Pubblicazione: (2023)
di: Huang, Tianjin, et al.
Pubblicazione: (2023)
Better Representations via Adversarial Training in Pre-Training: A Theoretical Perspective
di: Xing, Yue, et al.
Pubblicazione: (2024)
di: Xing, Yue, et al.
Pubblicazione: (2024)
MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models
di: Huang, Feihu, et al.
Pubblicazione: (2026)
di: Huang, Feihu, et al.
Pubblicazione: (2026)
Muon is Scalable for LLM Training
di: Liu, Jingyuan, et al.
Pubblicazione: (2025)
di: Liu, Jingyuan, et al.
Pubblicazione: (2025)
Lions and Muons: Optimization via Stochastic Frank-Wolfe
di: Sfyraki, Maria-Eleni, et al.
Pubblicazione: (2025)
di: Sfyraki, Maria-Eleni, et al.
Pubblicazione: (2025)
When Pattern-by-Pattern Works: Theoretical and Empirical Insights for Logistic Models with Missing Values
di: Muller, Christophe, et al.
Pubblicazione: (2025)
di: Muller, Christophe, et al.
Pubblicazione: (2025)
ReAct Meets ActRe: When Language Agents Enjoy Training Data Autonomy
di: Yang, Zonghan, et al.
Pubblicazione: (2024)
di: Yang, Zonghan, et al.
Pubblicazione: (2024)
Adversarial Representation Engineering: A General Model Editing Framework for Large Language Models
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training
di: Li, Jiacheng, et al.
Pubblicazione: (2026)
di: Li, Jiacheng, et al.
Pubblicazione: (2026)
Decoding Large Language Diffusion Models with Foreseeing Movement
di: Mo, Yichuan, et al.
Pubblicazione: (2025)
di: Mo, Yichuan, et al.
Pubblicazione: (2025)
When and Why Adversarial Training Improves PINNs: A Neural Tangent Kernel Perspective
di: Cao, Yuan-dong, et al.
Pubblicazione: (2026)
di: Cao, Yuan-dong, et al.
Pubblicazione: (2026)
AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates
di: Zhang, Minxin, et al.
Pubblicazione: (2025)
di: Zhang, Minxin, et al.
Pubblicazione: (2025)
Effective Quantization of Muon Optimizer States
di: Gupta, Aman, et al.
Pubblicazione: (2025)
di: Gupta, Aman, et al.
Pubblicazione: (2025)
LaMsS: When Large Language Models Meet Self-Skepticism
di: Wu, Yetao, et al.
Pubblicazione: (2024)
di: Wu, Yetao, et al.
Pubblicazione: (2024)
MuonQ: Enhancing Low-Bit Muon Quantization via Directional Fidelity Optimization
di: Su, Yupeng, et al.
Pubblicazione: (2026)
di: Su, Yupeng, et al.
Pubblicazione: (2026)
Adversarial Instance Generation and Robust Training for Neural Combinatorial Optimization with Multiple Objectives
di: Liu, Wei, et al.
Pubblicazione: (2026)
di: Liu, Wei, et al.
Pubblicazione: (2026)
On the Convergence Analysis of Muon
di: Shen, Wei, et al.
Pubblicazione: (2025)
di: Shen, Wei, et al.
Pubblicazione: (2025)
MuCon: Clipped Muon Updates for LLM Training
di: Yi, Albert
Pubblicazione: (2026)
di: Yi, Albert
Pubblicazione: (2026)
SignMuon: Communication-Efficient Distributed Muon Optimization
di: Mishra, Neel, et al.
Pubblicazione: (2026)
di: Mishra, Neel, et al.
Pubblicazione: (2026)
Neural Network Training Techniques Regularize Optimization Trajectory: An Empirical Study
di: Chen, Cheng, et al.
Pubblicazione: (2020)
di: Chen, Cheng, et al.
Pubblicazione: (2020)
Muown: Row-Norm Control for Muon Optimization
di: Lion, Kai, et al.
Pubblicazione: (2026)
di: Lion, Kai, et al.
Pubblicazione: (2026)
The Newton-Muon Optimizer
di: Du, Zhehang, et al.
Pubblicazione: (2026)
di: Du, Zhehang, et al.
Pubblicazione: (2026)
Adversarial Training for Graph Neural Networks via Graph Subspace Energy Optimization
di: Liu, Ganlin, et al.
Pubblicazione: (2024)
di: Liu, Ganlin, et al.
Pubblicazione: (2024)
S2O: Enhancing Adversarial Training with Second-Order Statistics of Weights
di: Jin, Gaojie, et al.
Pubblicazione: (2026)
di: Jin, Gaojie, et al.
Pubblicazione: (2026)
Documenti analoghi
-
When and Why Grouping Attention Heads Accelerates Muon Optimization
di: Zhang, Hongtao, et al.
Pubblicazione: (2026) -
AdaMuon: Adaptive Muon Optimizer
di: Si, Chongjie, et al.
Pubblicazione: (2025) -
Fight Back Against Jailbreaking via Prompt Adversarial Tuning
di: Mo, Yichuan, et al.
Pubblicazione: (2024) -
Identifying and Understanding Cross-Class Features in Adversarial Training
di: Wei, Zeming, et al.
Pubblicazione: (2025) -
DiM-TS: Bridge the Gap between Selective State Space Models and Time Series for Generative Modeling
di: Yao, Zihao, et al.
Pubblicazione: (2025)