How do simple rotations affect the implicit bias of Adam?
Fuente:
arXiv
Salvato in:
| Autori principali: | DePavia, Adela, Charisopoulos, Vasileios, Willett, Rebecca |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Faster Adaptive Optimization via Expected Gradient Outer Product Reparameterization
di: DePavia, Adela, et al.
Pubblicazione: (2025)
di: DePavia, Adela, et al.
Pubblicazione: (2025)
Learning-Based Algorithms for Graph Searching Problems
di: DePavia, Adela Frances, et al.
Pubblicazione: (2024)
di: DePavia, Adela Frances, et al.
Pubblicazione: (2024)
Solving Inverse Problems with Deep Linear Neural Networks: Global Convergence Guarantees for Gradient Descent with Weight Decay
di: Laus, Hannah, et al.
Pubblicazione: (2025)
di: Laus, Hannah, et al.
Pubblicazione: (2025)
Nonlinear tomographic reconstruction via nonsmooth optimization
di: Charisopoulos, Vasileios, et al.
Pubblicazione: (2024)
di: Charisopoulos, Vasileios, et al.
Pubblicazione: (2024)
A Model-Guided Neural Network Method for the Inverse Scattering Problem
di: Tsang, Olivia, et al.
Pubblicazione: (2025)
di: Tsang, Olivia, et al.
Pubblicazione: (2025)
Causal Discovery over High-Dimensional Structured Hypothesis Spaces with Causal Graph Partitioning
di: Shah, Ashka, et al.
Pubblicazione: (2024)
di: Shah, Ashka, et al.
Pubblicazione: (2024)
Local linear convergence of gradient methods for overparameterized Gaussian mixtures
di: Wang, Jingxing, et al.
Pubblicazione: (2026)
di: Wang, Jingxing, et al.
Pubblicazione: (2026)
How does the optimizer implicitly bias the model merging loss landscape?
di: Zhang, Chenxiang, et al.
Pubblicazione: (2025)
di: Zhang, Chenxiang, et al.
Pubblicazione: (2025)
Quantifying the Importance of Data Alignment in Downstream Model Performance
di: Chawla, Krrish, et al.
Pubblicazione: (2025)
di: Chawla, Krrish, et al.
Pubblicazione: (2025)
ReLU Neural Networks with Linear Layers are Biased Towards Single- and Multi-Index Models
di: Parkinson, Suzanna, et al.
Pubblicazione: (2023)
di: Parkinson, Suzanna, et al.
Pubblicazione: (2023)
Detecting clinician implicit biases in diagnoses using proximal causal inference
di: Liu, Kara, et al.
Pubblicazione: (2025)
di: Liu, Kara, et al.
Pubblicazione: (2025)
Understanding and inverse design of implicit bias in stochastic learning: a geometric perspective
di: Aladrah, Nicola, et al.
Pubblicazione: (2026)
di: Aladrah, Nicola, et al.
Pubblicazione: (2026)
Embed and Emulate: Contrastive representations for simulation-based inference
di: Jiang, Ruoxi, et al.
Pubblicazione: (2024)
di: Jiang, Ruoxi, et al.
Pubblicazione: (2024)
Multi-Frequency Progressive Refinement for Learned Inverse Scattering
di: Melia, Owen, et al.
Pubblicazione: (2024)
di: Melia, Owen, et al.
Pubblicazione: (2024)
Integrating Uncertainty Awareness into Conformalized Quantile Regression
di: Rossellini, Raphael, et al.
Pubblicazione: (2023)
di: Rossellini, Raphael, et al.
Pubblicazione: (2023)
Stabilizing black-box model selection with the inflated argmax
di: Adrian, Melissa, et al.
Pubblicazione: (2024)
di: Adrian, Melissa, et al.
Pubblicazione: (2024)
Building a stable classifier with the inflated argmax
di: Soloff, Jake A., et al.
Pubblicazione: (2024)
di: Soloff, Jake A., et al.
Pubblicazione: (2024)
Bagging Provides Assumption-free Stability
di: Soloff, Jake A., et al.
Pubblicazione: (2023)
di: Soloff, Jake A., et al.
Pubblicazione: (2023)
Auto-differentiable data assimilation: Co-learning of states, dynamics, and filtering algorithms
di: Adrian, Melissa, et al.
Pubblicazione: (2026)
di: Adrian, Melissa, et al.
Pubblicazione: (2026)
Sketch-Augmented Features Improve Learning Long-Range Dependencies in Graph Neural Networks
di: Hosseini, Ryien, et al.
Pubblicazione: (2025)
di: Hosseini, Ryien, et al.
Pubblicazione: (2025)
Quality Measures for Dynamic Graph Generative Models
di: Hosseini, Ryien, et al.
Pubblicazione: (2025)
di: Hosseini, Ryien, et al.
Pubblicazione: (2025)
Depth Separation in Norm-Bounded Infinite-Width Neural Networks
di: Parkinson, Suzanna, et al.
Pubblicazione: (2024)
di: Parkinson, Suzanna, et al.
Pubblicazione: (2024)
Quantification of Uncertainties in Probabilistic Deep Neural Network by Implementing Boosting of Variational Inference
di: Bera, Pavia, et al.
Pubblicazione: (2025)
di: Bera, Pavia, et al.
Pubblicazione: (2025)
Training neural operators to preserve invariant measures of chaotic attractors
di: Jiang, Ruoxi, et al.
Pubblicazione: (2023)
di: Jiang, Ruoxi, et al.
Pubblicazione: (2023)
Escape dynamics and implicit bias of one-pass SGD in overparameterized quadratic networks
di: Bocchi, Dario, et al.
Pubblicazione: (2026)
di: Bocchi, Dario, et al.
Pubblicazione: (2026)
Accelerating PDE Surrogates via RL-Guided Mesh Optimization
di: Meng, Yang, et al.
Pubblicazione: (2026)
di: Meng, Yang, et al.
Pubblicazione: (2026)
Data Assimilation with Machine Learning Surrogate Models: A Case Study with FourCastNet
di: Adrian, Melissa, et al.
Pubblicazione: (2024)
di: Adrian, Melissa, et al.
Pubblicazione: (2024)
Assumption-free stability for ranking problems
di: Liang, Ruiting, et al.
Pubblicazione: (2025)
di: Liang, Ruiting, et al.
Pubblicazione: (2025)
Can a calibration metric be both testable and actionable?
di: Rossellini, Raphael, et al.
Pubblicazione: (2025)
di: Rossellini, Raphael, et al.
Pubblicazione: (2025)
Deep Stochastic Mechanics
di: Orlova, Elena, et al.
Pubblicazione: (2023)
di: Orlova, Elena, et al.
Pubblicazione: (2023)
Sample-efficient neural likelihood-free Bayesian inference of implicit HMMs
di: Ghosh, Sanmitra, et al.
Pubblicazione: (2024)
di: Ghosh, Sanmitra, et al.
Pubblicazione: (2024)
CaAdam: Improving Adam optimizer using connection aware methods
di: Genet, Remi, et al.
Pubblicazione: (2024)
di: Genet, Remi, et al.
Pubblicazione: (2024)
Progressive distillation induces an implicit curriculum
di: Panigrahi, Abhishek, et al.
Pubblicazione: (2024)
di: Panigrahi, Abhishek, et al.
Pubblicazione: (2024)
Beyond Ensemble Averages: Leveraging Climate Model Ensembles for Subseasonal Forecasting
di: Orlova, Elena, et al.
Pubblicazione: (2022)
di: Orlova, Elena, et al.
Pubblicazione: (2022)
How does over-squashing affect the power of GNNs?
di: Di Giovanni, Francesco, et al.
Pubblicazione: (2023)
di: Di Giovanni, Francesco, et al.
Pubblicazione: (2023)
How to Set $β_1, β_2$ in Adam: An Online Learning Perspective
di: Nguyen, Quan
Pubblicazione: (2025)
di: Nguyen, Quan
Pubblicazione: (2025)
Hierarchical Implicit Neural Emulators
di: Jiang, Ruoxi, et al.
Pubblicazione: (2025)
di: Jiang, Ruoxi, et al.
Pubblicazione: (2025)
HomeAdam: Adam and AdamW Algorithms Sometimes Go Home to Obtain Better Provable Generalization
di: Huang, Feihu, et al.
Pubblicazione: (2026)
di: Huang, Feihu, et al.
Pubblicazione: (2026)
Tune My Adam, Please!
di: Athanasiadis, Theodoros, et al.
Pubblicazione: (2025)
di: Athanasiadis, Theodoros, et al.
Pubblicazione: (2025)
In Search of Adam's Secret Sauce
di: Orvieto, Antonio, et al.
Pubblicazione: (2025)
di: Orvieto, Antonio, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Faster Adaptive Optimization via Expected Gradient Outer Product Reparameterization
di: DePavia, Adela, et al.
Pubblicazione: (2025) -
Learning-Based Algorithms for Graph Searching Problems
di: DePavia, Adela Frances, et al.
Pubblicazione: (2024) -
Solving Inverse Problems with Deep Linear Neural Networks: Global Convergence Guarantees for Gradient Descent with Weight Decay
di: Laus, Hannah, et al.
Pubblicazione: (2025) -
Nonlinear tomographic reconstruction via nonsmooth optimization
di: Charisopoulos, Vasileios, et al.
Pubblicazione: (2024) -
A Model-Guided Neural Network Method for the Inverse Scattering Problem
di: Tsang, Olivia, et al.
Pubblicazione: (2025)