The Implicit Bias of Adam and Muon on Smooth Homogeneous Neural Networks
Fuente:
arXiv
Salvato in:
| Autori principali: | Gronich, Eitan, Vardi, Gal |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Flavors of Margin: Implicit Bias of Steepest Descent in Homogeneous Neural Networks
di: Tsilivis, Nikolaos, et al.
Pubblicazione: (2024)
di: Tsilivis, Nikolaos, et al.
Pubblicazione: (2024)
Implicit Regularization Towards Rank Minimization in ReLU Networks
di: Timor, Nadav, et al.
Pubblicazione: (2022)
di: Timor, Nadav, et al.
Pubblicazione: (2022)
ImpMIA: Leveraging Implicit Bias for Membership Inference Attack
di: Golbari, Yuval, et al.
Pubblicazione: (2025)
di: Golbari, Yuval, et al.
Pubblicazione: (2025)
Provable Privacy Attacks on Trained Shallow Neural Networks
di: Smorodinsky, Guy, et al.
Pubblicazione: (2024)
di: Smorodinsky, Guy, et al.
Pubblicazione: (2024)
The Implicit Bias of Adam on Separable Data
di: Zhang, Chenyang, et al.
Pubblicazione: (2024)
di: Zhang, Chenyang, et al.
Pubblicazione: (2024)
On the Implicit Bias of Adam
di: Cattaneo, Matias D., et al.
Pubblicazione: (2023)
di: Cattaneo, Matias D., et al.
Pubblicazione: (2023)
Implicit Bias of Mirror Flow in Homogeneous Neural Networks: Sparse and Dense Feature Learning
di: Jacobs, Tom, et al.
Pubblicazione: (2026)
di: Jacobs, Tom, et al.
Pubblicazione: (2026)
Provable Unlearning with Gradient Ascent on Two-Layer ReLU Neural Networks
di: Melamed, Odelia, et al.
Pubblicazione: (2025)
di: Melamed, Odelia, et al.
Pubblicazione: (2025)
Noisy Interpolation Learning with Shallow Univariate ReLU Networks
di: Joshi, Nirmit, et al.
Pubblicazione: (2023)
di: Joshi, Nirmit, et al.
Pubblicazione: (2023)
Trained Transformer Classifiers Generalize and Exhibit Benign Overfitting In-Context
di: Frei, Spencer, et al.
Pubblicazione: (2024)
di: Frei, Spencer, et al.
Pubblicazione: (2024)
Transformers are almost optimal metalearners for linear classification
di: Magen, Roey, et al.
Pubblicazione: (2025)
di: Magen, Roey, et al.
Pubblicazione: (2025)
The Rich and the Simple: On the Implicit Bias of Adam and SGD
di: Vasudeva, Bhavya, et al.
Pubblicazione: (2025)
di: Vasudeva, Bhavya, et al.
Pubblicazione: (2025)
Implicit Bias of Gradient Descent for Non-Homogeneous Deep Networks
di: Cai, Yuhang, et al.
Pubblicazione: (2025)
di: Cai, Yuhang, et al.
Pubblicazione: (2025)
Querying Kernel Methods Suffices for Reconstructing their Training Data
di: Barzilai, Daniel, et al.
Pubblicazione: (2025)
di: Barzilai, Daniel, et al.
Pubblicazione: (2025)
Implicit Bias of Spectral Descent and Muon on Multiclass Separable Data
di: Fan, Chen, et al.
Pubblicazione: (2025)
di: Fan, Chen, et al.
Pubblicazione: (2025)
To Grok Grokking: Provable Grokking in Ridge Regression
di: Xu, Mingyue, et al.
Pubblicazione: (2026)
di: Xu, Mingyue, et al.
Pubblicazione: (2026)
Overfitting Behaviour of Gaussian Kernel Ridgeless Regression: Varying Bandwidth or Dimensionality
di: Medvedev, Marko, et al.
Pubblicazione: (2024)
di: Medvedev, Marko, et al.
Pubblicazione: (2024)
The Effect of Mini-Batch Noise on the Implicit Bias of Adam
di: Cattaneo, Matias D., et al.
Pubblicazione: (2026)
di: Cattaneo, Matias D., et al.
Pubblicazione: (2026)
Implicit Bias of AdamW: $\ell_\infty$ Norm Constrained Optimization
di: Xie, Shuo, et al.
Pubblicazione: (2024)
di: Xie, Shuo, et al.
Pubblicazione: (2024)
Can Muon Fine-tune Adam-Pretrained Models?
di: Qu, Xingyu, et al.
Pubblicazione: (2026)
di: Qu, Xingyu, et al.
Pubblicazione: (2026)
Implicit Graph Neural Diffusion Networks: Convergence, Generalization, and Over-Smoothing
di: Fu, Guoji, et al.
Pubblicazione: (2023)
di: Fu, Guoji, et al.
Pubblicazione: (2023)
Beyond Implicit Bias: The Insignificance of SGD Noise in Online Learning
di: Vyas, Nikhil, et al.
Pubblicazione: (2023)
di: Vyas, Nikhil, et al.
Pubblicazione: (2023)
Implicit Bias of Mirror Flow for Shallow Neural Networks in Univariate Regression
di: Liang, Shuang, et al.
Pubblicazione: (2024)
di: Liang, Shuang, et al.
Pubblicazione: (2024)
Factorized Neural Implicit DMD for Parametric Dynamics
di: Chen, Siyuan, et al.
Pubblicazione: (2026)
di: Chen, Siyuan, et al.
Pubblicazione: (2026)
An Agnostic View on the Cost of Overfitting in (Kernel) Ridge Regression
di: Zhou, Lijia, et al.
Pubblicazione: (2023)
di: Zhou, Lijia, et al.
Pubblicazione: (2023)
On the Hardness of Learning Regular Expressions
di: Attias, Idan, et al.
Pubblicazione: (2025)
di: Attias, Idan, et al.
Pubblicazione: (2025)
Adam Simplified: Bias Correction Debunked
di: Laing, Sam, et al.
Pubblicazione: (2025)
di: Laing, Sam, et al.
Pubblicazione: (2025)
Feature Averaging: An Implicit Bias of Gradient Descent Leading to Non-Robustness in Neural Networks
di: Li, Binghui, et al.
Pubblicazione: (2024)
di: Li, Binghui, et al.
Pubblicazione: (2024)
Temperature is All You Need for Generalization in Langevin Dynamics and other Markov Processes
di: Harel, Itamar, et al.
Pubblicazione: (2025)
di: Harel, Itamar, et al.
Pubblicazione: (2025)
Quotient Geometry, Effective Curvature, and Implicit Bias in Simple Shallow Neural Networks
di: Dong, Hang-Cheng, et al.
Pubblicazione: (2026)
di: Dong, Hang-Cheng, et al.
Pubblicazione: (2026)
Implicit Bias of Per-sample Adam on Separable Data: Departure from the Full-batch Regime
di: Baek, Beomhan, et al.
Pubblicazione: (2025)
di: Baek, Beomhan, et al.
Pubblicazione: (2025)
Optimizer-Induced Mode Connectivity: From AdamW to Muon
di: Zhang, Fangzhao, et al.
Pubblicazione: (2026)
di: Zhang, Fangzhao, et al.
Pubblicazione: (2026)
Muon Outperforms Adam in Tail-End Associative Memory Learning
di: Wang, Shuche, et al.
Pubblicazione: (2025)
di: Wang, Shuche, et al.
Pubblicazione: (2025)
Adam-SHANG: A Convergent Adam-Type Method for Stochastic Smooth Convex Optimization
di: Yu, Yaxin, et al.
Pubblicazione: (2026)
di: Yu, Yaxin, et al.
Pubblicazione: (2026)
To Use or not to Use Muon: How Simplicity Bias in Optimizers Matters
di: Dragutinović, Sara, et al.
Pubblicazione: (2026)
di: Dragutinović, Sara, et al.
Pubblicazione: (2026)
Provable Adaptivity of Adam under Non-uniform Smoothness
di: Wang, Bohan, et al.
Pubblicazione: (2022)
di: Wang, Bohan, et al.
Pubblicazione: (2022)
The Implicit Bias of Logit Regularization
di: Beck, Alon, et al.
Pubblicazione: (2026)
di: Beck, Alon, et al.
Pubblicazione: (2026)
Positive Distribution Shift as a Framework for Understanding Tractable Learning
di: Medvedev, Marko, et al.
Pubblicazione: (2026)
di: Medvedev, Marko, et al.
Pubblicazione: (2026)
Benign Overfitting in Single-Head Attention
di: Magen, Roey, et al.
Pubblicazione: (2024)
di: Magen, Roey, et al.
Pubblicazione: (2024)
How Does Overparameterization Affect Machine Unlearning of Deep Neural Networks?
di: Alon, Gal, et al.
Pubblicazione: (2025)
di: Alon, Gal, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Flavors of Margin: Implicit Bias of Steepest Descent in Homogeneous Neural Networks
di: Tsilivis, Nikolaos, et al.
Pubblicazione: (2024) -
Implicit Regularization Towards Rank Minimization in ReLU Networks
di: Timor, Nadav, et al.
Pubblicazione: (2022) -
ImpMIA: Leveraging Implicit Bias for Membership Inference Attack
di: Golbari, Yuval, et al.
Pubblicazione: (2025) -
Provable Privacy Attacks on Trained Shallow Neural Networks
di: Smorodinsky, Guy, et al.
Pubblicazione: (2024) -
The Implicit Bias of Adam on Separable Data
di: Zhang, Chenyang, et al.
Pubblicazione: (2024)