Leveraging Continuous Time to Understand Momentum When Training Diagonal Linear Networks
Fuente:
arXiv
Salvato in:
| Autori principali: | Papazov, Hristo, Pesme, Scott, Flammarion, Nicolas |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Implicit Bias of Mirror Flow on Separable Data
di: Pesme, Scott, et al.
Pubblicazione: (2024)
di: Pesme, Scott, et al.
Pubblicazione: (2024)
Learning Algorithms in the Limit
di: Papazov, Hristo, et al.
Pubblicazione: (2025)
di: Papazov, Hristo, et al.
Pubblicazione: (2025)
A Theoretical Framework for Grokking: Interpolation followed by Riemannian Norm Minimisation
di: Boursier, Etienne, et al.
Pubblicazione: (2025)
di: Boursier, Etienne, et al.
Pubblicazione: (2025)
MAP Estimation with Denoisers: Convergence Rates and Guarantees
di: Pesme, Scott, et al.
Pubblicazione: (2025)
di: Pesme, Scott, et al.
Pubblicazione: (2025)
Optimization Insights into Deep Diagonal Linear Networks
di: Labarrière, Hippolyte, et al.
Pubblicazione: (2024)
di: Labarrière, Hippolyte, et al.
Pubblicazione: (2024)
Gradient Flow Polarizes Softmax Outputs towards Low-Entropy Solutions
di: Varre, Aditya, et al.
Pubblicazione: (2026)
di: Varre, Aditya, et al.
Pubblicazione: (2026)
Exact Learning of Arithmetic with Differentiable Agents
di: Papazov, Hristo, et al.
Pubblicazione: (2025)
di: Papazov, Hristo, et al.
Pubblicazione: (2025)
Incremental Learning of Sparse Attention Patterns in Transformers
di: Yüksel, Oğuz Kaan, et al.
Pubblicazione: (2026)
di: Yüksel, Oğuz Kaan, et al.
Pubblicazione: (2026)
Adaptive Momentum and Nonlinear Damping for Neural Network Training
di: Karoni, Aikaterini, et al.
Pubblicazione: (2026)
di: Karoni, Aikaterini, et al.
Pubblicazione: (2026)
High-dimensional Limit of SGD for Diagonal Linear Networks
di: Malaxechebarría, Begoña García, et al.
Pubblicazione: (2026)
di: Malaxechebarría, Begoña García, et al.
Pubblicazione: (2026)
Neighbor-Sampling Based Momentum Stochastic Methods for Training Graph Neural Networks
di: Noel, Molly, et al.
Pubblicazione: (2025)
di: Noel, Molly, et al.
Pubblicazione: (2025)
When is Momentum Extragradient Optimal? A Polynomial-Based Analysis
di: Kim, Junhyung Lyle, et al.
Pubblicazione: (2022)
di: Kim, Junhyung Lyle, et al.
Pubblicazione: (2022)
Leveraging Coordinate Momentum in SignSGD and Muon: Memory-Optimized Zero-Order
di: Petrov, Egor, et al.
Pubblicazione: (2025)
di: Petrov, Egor, et al.
Pubblicazione: (2025)
Regularized Adaptive Momentum Dual Averaging with an Efficient Inexact Subproblem Solver for Training Structured Neural Network
di: Huang, Zih-Syuan, et al.
Pubblicazione: (2024)
di: Huang, Zih-Syuan, et al.
Pubblicazione: (2024)
Stochastic Polyak Step-sizes and Momentum: Convergence Guarantees and Practical Performance
di: Oikonomou, Dimitris, et al.
Pubblicazione: (2024)
di: Oikonomou, Dimitris, et al.
Pubblicazione: (2024)
Understanding Outer Optimizers in Local SGD: Learning Rates, Momentum, and Acceleration
di: Khaled, Ahmed, et al.
Pubblicazione: (2025)
di: Khaled, Ahmed, et al.
Pubblicazione: (2025)
Efficient Sparse PCA via Block-Diagonalization
di: Del Pia, Alberto, et al.
Pubblicazione: (2024)
di: Del Pia, Alberto, et al.
Pubblicazione: (2024)
Multi-Objective Linear Ensembles for Robust and Sparse Training of Few-Bit Neural Networks
di: Bernardelli, Ambrogio Maria, et al.
Pubblicazione: (2022)
di: Bernardelli, Ambrogio Maria, et al.
Pubblicazione: (2022)
Operator Models for Continuous-Time Offline Reinforcement Learning
di: Hoischen, Nicolas, et al.
Pubblicazione: (2025)
di: Hoischen, Nicolas, et al.
Pubblicazione: (2025)
Fixed Horizon Linear Quadratic Covariance Steering in Continuous Time with Hilbert-Schmidt Terminal Cost
di: Sial, Tushar, et al.
Pubblicazione: (2025)
di: Sial, Tushar, et al.
Pubblicazione: (2025)
Provable Accelerated Convergence of Nesterov's Momentum for Deep ReLU Neural Networks
di: Liao, Fangshuo, et al.
Pubblicazione: (2023)
di: Liao, Fangshuo, et al.
Pubblicazione: (2023)
Weight-Parameterization in Continuous Time Deep Neural Networks for Surrogate Modeling
di: Rosso, Haley, et al.
Pubblicazione: (2025)
di: Rosso, Haley, et al.
Pubblicazione: (2025)
Diagonalizing the Softmax: Hadamard Initialization for Tractable Cross-Entropy Dynamics
di: Garrod, Connall, et al.
Pubblicazione: (2025)
di: Garrod, Connall, et al.
Pubblicazione: (2025)
Diagonal Linear Networks and the Lasso Regularization Path
di: Berthier, Raphaël
Pubblicazione: (2025)
di: Berthier, Raphaël
Pubblicazione: (2025)
Stable Nonconvex-Nonconcave Training via Linear Interpolation
di: Pethick, Thomas, et al.
Pubblicazione: (2023)
di: Pethick, Thomas, et al.
Pubblicazione: (2023)
Improving Stochastic Cubic Newton with Momentum
di: Chayti, El Mahdi, et al.
Pubblicazione: (2024)
di: Chayti, El Mahdi, et al.
Pubblicazione: (2024)
Stochastic Difference-of-Convex Optimization with Momentum
di: Chayti, El Mahdi, et al.
Pubblicazione: (2025)
di: Chayti, El Mahdi, et al.
Pubblicazione: (2025)
Dimension-adapted Momentum Outscales SGD
di: Ferbach, Damien, et al.
Pubblicazione: (2025)
di: Ferbach, Damien, et al.
Pubblicazione: (2025)
Convergence and Implicit Bias of Gradient Descent on Continual Linear Classification
di: Jung, Hyunji, et al.
Pubblicazione: (2025)
di: Jung, Hyunji, et al.
Pubblicazione: (2025)
Shuffling Momentum Gradient Algorithm for Convex Optimization
di: Tran, Trang H., et al.
Pubblicazione: (2024)
di: Tran, Trang H., et al.
Pubblicazione: (2024)
Muon is Provably Faster with Momentum Variance Reduction
di: Qian, Xun, et al.
Pubblicazione: (2025)
di: Qian, Xun, et al.
Pubblicazione: (2025)
Understanding SGD with Exponential Moving Average: A Case Study in Linear Regression
di: Li, Xuheng, et al.
Pubblicazione: (2025)
di: Li, Xuheng, et al.
Pubblicazione: (2025)
Non-convex Stochastic Composite Optimization with Polyak Momentum
di: Gao, Yuan, et al.
Pubblicazione: (2024)
di: Gao, Yuan, et al.
Pubblicazione: (2024)
(Accelerated) Noise-adaptive Stochastic Heavy-Ball Momentum
di: Dang, Anh, et al.
Pubblicazione: (2024)
di: Dang, Anh, et al.
Pubblicazione: (2024)
The Marginal Value of Momentum for Small Learning Rate SGD
di: Wang, Runzhe, et al.
Pubblicazione: (2023)
di: Wang, Runzhe, et al.
Pubblicazione: (2023)
SGD with Adaptive Preconditioning: Unified Analysis and Momentum Acceleration
di: Kovalev, Dmitry
Pubblicazione: (2025)
di: Kovalev, Dmitry
Pubblicazione: (2025)
Adaptive Optimization via Momentum on Variance-Normalized Gradients
di: Patitucci, Francisco, et al.
Pubblicazione: (2026)
di: Patitucci, Francisco, et al.
Pubblicazione: (2026)
Improved Analysis for Sign-based Methods with Momentum Updates
di: Jiang, Wei, et al.
Pubblicazione: (2025)
di: Jiang, Wei, et al.
Pubblicazione: (2025)
Dynamics of Stochastic Momentum with Sparse Updates in High Dimensions
di: Everett, Katie, et al.
Pubblicazione: (2026)
di: Everett, Katie, et al.
Pubblicazione: (2026)
Logarithmic-time Schedules for Scaling Language Models with Momentum
di: Ferbach, Damien, et al.
Pubblicazione: (2026)
di: Ferbach, Damien, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Implicit Bias of Mirror Flow on Separable Data
di: Pesme, Scott, et al.
Pubblicazione: (2024) -
Learning Algorithms in the Limit
di: Papazov, Hristo, et al.
Pubblicazione: (2025) -
A Theoretical Framework for Grokking: Interpolation followed by Riemannian Norm Minimisation
di: Boursier, Etienne, et al.
Pubblicazione: (2025) -
MAP Estimation with Denoisers: Convergence Rates and Guarantees
di: Pesme, Scott, et al.
Pubblicazione: (2025) -
Optimization Insights into Deep Diagonal Linear Networks
di: Labarrière, Hippolyte, et al.
Pubblicazione: (2024)