Never Saddle for Reparameterized Steepest Descent as Mirror Flow
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jacobs, Tom, Zhou, Chao, Burkholz, Rebekka |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Mirror, Mirror of the Flow: How Does Regularization Shape Implicit Bias?
par: Jacobs, Tom, et autres
Publié: (2025)
par: Jacobs, Tom, et autres
Publié: (2025)
Mask in the Mirror: Implicit Sparsification
par: Jacobs, Tom, et autres
Publié: (2024)
par: Jacobs, Tom, et autres
Publié: (2024)
Sign-In to the Lottery: Reparameterizing Sparse Training From Scratch
par: Gadhikar, Advait, et autres
Publié: (2025)
par: Gadhikar, Advait, et autres
Publié: (2025)
Pay Attention to Small Weights
par: Zhou, Chao, et autres
Publié: (2025)
par: Zhou, Chao, et autres
Publié: (2025)
HORST: Composing Optimizer Geometries for Sparse Transformer Training
par: Jacobs, Tom, et autres
Publié: (2026)
par: Jacobs, Tom, et autres
Publié: (2026)
Hyperbolic Aware Minimization: Implicit Bias for Sparsity
par: Jacobs, Tom, et autres
Publié: (2025)
par: Jacobs, Tom, et autres
Publié: (2025)
GATE: How to Keep Out Intrusive Neighbors
par: Mustafa, Nimrah, et autres
Publié: (2024)
par: Mustafa, Nimrah, et autres
Publié: (2024)
Masks, Signs, And Learning Rate Rewinding
par: Gadhikar, Advait, et autres
Publié: (2024)
par: Gadhikar, Advait, et autres
Publié: (2024)
The Graphon Limit Hypothesis: Understanding Neural Network Pruning via Infinite Width Analysis
par: Pham, Hoang, et autres
Publié: (2025)
par: Pham, Hoang, et autres
Publié: (2025)
Fixed Aggregation Features Can Rival GNNs
par: Rubio-Madrigal, Celia, et autres
Publié: (2026)
par: Rubio-Madrigal, Celia, et autres
Publié: (2026)
Faster Acceleration for Steepest Descent
par: Bai, Cedar Site, et autres
Publié: (2024)
par: Bai, Cedar Site, et autres
Publié: (2024)
Robustness of Mixtures of Experts to Feature Noise
par: Sun, Dong, et autres
Publié: (2026)
par: Sun, Dong, et autres
Publié: (2026)
Implicit Bias of Mirror Flow in Homogeneous Neural Networks: Sparse and Dense Feature Learning
par: Jacobs, Tom, et autres
Publié: (2026)
par: Jacobs, Tom, et autres
Publié: (2026)
SparseOpt: Addressing Normalization-induced Gradient Skew in Sparse Training
par: Adnan, Mohammed, et autres
Publié: (2026)
par: Adnan, Mohammed, et autres
Publié: (2026)
The Implicit Bias of Steepest Descent with Mini-batch Stochastic Gradient
par: Li, Jichu, et autres
Publié: (2026)
par: Li, Jichu, et autres
Publié: (2026)
Spectral Graph Pruning Against Over-Squashing and Over-Smoothing
par: Jamadandi, Adarsh, et autres
Publié: (2024)
par: Jamadandi, Adarsh, et autres
Publié: (2024)
Bridging Domains through Subspace-Aware Model Merging
par: Chaves, Levy, et autres
Publié: (2026)
par: Chaves, Levy, et autres
Publié: (2026)
One-Step Flow Policy Mirror Descent
par: Chen, Tianyi, et autres
Publié: (2025)
par: Chen, Tianyi, et autres
Publié: (2025)
Stochastic Gradient Descent in the Saddle-to-Saddle Regime of Deep Linear Networks
par: Corlouer, Guillaume, et autres
Publié: (2026)
par: Corlouer, Guillaume, et autres
Publié: (2026)
GNNs Getting ComFy: Community and Feature Similarity Guided Rewiring
par: Rubio-Madrigal, Celia, et autres
Publié: (2025)
par: Rubio-Madrigal, Celia, et autres
Publié: (2025)
Flavors of Margin: Implicit Bias of Steepest Descent in Homogeneous Neural Networks
par: Tsilivis, Nikolaos, et autres
Publié: (2024)
par: Tsilivis, Nikolaos, et autres
Publié: (2024)
Convergence of Steepest Descent and Adam under Non-Uniform Smoothness
par: Vaswani, Sharan, et autres
Publié: (2026)
par: Vaswani, Sharan, et autres
Publié: (2026)
Cyclic Sparse Training: Is it Enough?
par: Gadhikar, Advait, et autres
Publié: (2024)
par: Gadhikar, Advait, et autres
Publié: (2024)
Multi-Agent Systems are Mixtures of Experts: Who Becomes an Influencer?
par: Bause, Franka, et autres
Publié: (2026)
par: Bause, Franka, et autres
Publié: (2026)
Pruning neural network models for gene regulatory dynamics using data and domain knowledge
par: Hossain, Intekhab, et autres
Publié: (2024)
par: Hossain, Intekhab, et autres
Publié: (2024)
Mirror Descent Algorithms with Nearly Dimension-Independent Rates for Differentially-Private Stochastic Saddle-Point Problems
par: González, Tomás, et autres
Publié: (2024)
par: González, Tomás, et autres
Publié: (2024)
Flow Matching Policy Optimization with Mirror Descent and Entropy Constraints
par: Gao, Ting, et autres
Publié: (2026)
par: Gao, Ting, et autres
Publié: (2026)
Frequency-Based Hyperparameter Selection in Games
par: Sanyal, Aniket, et autres
Publié: (2026)
par: Sanyal, Aniket, et autres
Publié: (2026)
When Shift Happens - Confounding Is to Blame
par: Reddy, Abbavaram Gowtham, et autres
Publié: (2025)
par: Reddy, Abbavaram Gowtham, et autres
Publié: (2025)
SPGD: Steepest Perturbed Gradient Descent Optimization
par: Vahedi, Amir M., et autres
Publié: (2024)
par: Vahedi, Amir M., et autres
Publié: (2024)
Stacey: Promoting Stochastic Steepest Descent via Accelerated $\ell_p$-Smooth Nonconvex Optimization
par: Luo, Xinyu, et autres
Publié: (2025)
par: Luo, Xinyu, et autres
Publié: (2025)
Reparameterization Flow Policy Optimization
par: Zhong, Hai, et autres
Publié: (2026)
par: Zhong, Hai, et autres
Publié: (2026)
Preconditioned Norms: A Unified Framework for Steepest Descent, Quasi-Newton and Adaptive Methods
par: Veprikov, Andrey, et autres
Publié: (2025)
par: Veprikov, Andrey, et autres
Publié: (2025)
On the Effect of Regularization in Policy Mirror Descent
par: Kleuker, Jan Felix, et autres
Publié: (2025)
par: Kleuker, Jan Felix, et autres
Publié: (2025)
Mirror Descent on Riemannian Manifolds
par: Jiang, Jiaxin, et autres
Publié: (2026)
par: Jiang, Jiaxin, et autres
Publié: (2026)
Parameter-free Mirror Descent
par: Jacobsen, Andrew, et autres
Publié: (2022)
par: Jacobsen, Andrew, et autres
Publié: (2022)
Policy Mirror Descent with Lookahead
par: Protopapas, Kimon, et autres
Publié: (2024)
par: Protopapas, Kimon, et autres
Publié: (2024)
A Mirror Descent Perspective of Smoothed Sign Descent
par: Wang, Shuyang, et autres
Publié: (2024)
par: Wang, Shuyang, et autres
Publié: (2024)
The Hidden Cost of Approximation in Online Mirror Descent
par: Schlisselberg, Ofir, et autres
Publié: (2025)
par: Schlisselberg, Ofir, et autres
Publié: (2025)
Functional Acceleration for Policy Mirror Descent
par: Chelu, Veronica, et autres
Publié: (2024)
par: Chelu, Veronica, et autres
Publié: (2024)
Documents similaires
-
Mirror, Mirror of the Flow: How Does Regularization Shape Implicit Bias?
par: Jacobs, Tom, et autres
Publié: (2025) -
Mask in the Mirror: Implicit Sparsification
par: Jacobs, Tom, et autres
Publié: (2024) -
Sign-In to the Lottery: Reparameterizing Sparse Training From Scratch
par: Gadhikar, Advait, et autres
Publié: (2025) -
Pay Attention to Small Weights
par: Zhou, Chao, et autres
Publié: (2025) -
HORST: Composing Optimizer Geometries for Sparse Transformer Training
par: Jacobs, Tom, et autres
Publié: (2026)