SLowcal-SGD: Slow Query Points Improve Local-SGD for Stochastic Convex Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dahan, Tehila, Levy, Kfir Y. |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
$μ^2$-SGD: Stable Stochastic Optimization via a Double Momentum Mechanism
par: Dahan, Tehila, et autres
Publié: (2023)
par: Dahan, Tehila, et autres
Publié: (2023)
Bringing Order to Asynchronous SGD: Towards Optimality under Data-Dependent Delays with Momentum
par: Dahan, Tehila, et autres
Publié: (2026)
par: Dahan, Tehila, et autres
Publié: (2026)
On the Provable Suboptimality of Momentum SGD in Nonstationary Stochastic Optimization
par: Sahu, Sharan, et autres
Publié: (2026)
par: Sahu, Sharan, et autres
Publié: (2026)
Convergence of Clipped SGD on Convex $(L_0,L_1)$-Smooth Functions
par: Gaash, Ofir, et autres
Publié: (2025)
par: Gaash, Ofir, et autres
Publié: (2025)
Demystifying SGD with Doubly Stochastic Gradients
par: Kim, Kyurae, et autres
Publié: (2024)
par: Kim, Kyurae, et autres
Publié: (2024)
Provable Complexity Improvement of AdaGrad over SGD: Upper and Lower Bounds in Stochastic Non-Convex Optimization
par: Jiang, Ruichen, et autres
Publié: (2024)
par: Jiang, Ruichen, et autres
Publié: (2024)
Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization
par: Armacki, Aleksandar, et autres
Publié: (2026)
par: Armacki, Aleksandar, et autres
Publié: (2026)
SketchySGD: Reliable Stochastic Optimization via Randomized Curvature Estimates
par: Frangella, Zachary, et autres
Publié: (2022)
par: Frangella, Zachary, et autres
Publié: (2022)
Edge of Stochastic Stability: Revisiting the Edge of Stability for SGD
par: Andreyev, Arseniy, et autres
Publié: (2024)
par: Andreyev, Arseniy, et autres
Publié: (2024)
Enhancing Stochastic Optimization for Statistical Efficiency Using ROOT-SGD with Diminishing Stepsize
par: Li, Chris Junchi
Publié: (2024)
par: Li, Chris Junchi
Publié: (2024)
Understanding Outer Optimizers in Local SGD: Learning Rates, Momentum, and Acceleration
par: Khaled, Ahmed, et autres
Publié: (2025)
par: Khaled, Ahmed, et autres
Publié: (2025)
Non-Euclidean SGD for Structured Optimization: Unified Analysis and Improved Rates
par: Kovalev, Dmitry, et autres
Publié: (2025)
par: Kovalev, Dmitry, et autres
Publié: (2025)
From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees
par: Xie, Shengping, et autres
Publié: (2025)
par: Xie, Shengping, et autres
Publié: (2025)
Weight for Robustness: A Comprehensive Approach towards Optimal Fault-Tolerant Asynchronous ML
par: Dahan, Tehila, et autres
Publié: (2025)
par: Dahan, Tehila, et autres
Publié: (2025)
Fault Tolerant ML: Efficient Meta-Aggregation and Synchronous Training
par: Dahan, Tehila, et autres
Publié: (2024)
par: Dahan, Tehila, et autres
Publié: (2024)
Sign-SGD via Parameter-Free Optimization
par: Medyakov, Daniil, et autres
Publié: (2025)
par: Medyakov, Daniil, et autres
Publié: (2025)
A Hessian-Aware Stochastic Differential Equation for Modelling SGD
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
Faster Convergence of Local SGD for Over-Parameterized Models
par: Qin, Tiancheng, et autres
Publié: (2022)
par: Qin, Tiancheng, et autres
Publié: (2022)
Convergence of Clipped-SGD for Convex $(L_0,L_1)$-Smooth Optimization with Heavy-Tailed Noise
par: Chezhegov, Savelii, et autres
Publié: (2025)
par: Chezhegov, Savelii, et autres
Publié: (2025)
StoSignSGD: Unbiased Structural Stochasticity Fixes SignSGD for Training Large Language Models
par: Yu, Dingzhi, et autres
Publié: (2026)
par: Yu, Dingzhi, et autres
Publié: (2026)
SGD at the Edge of Stability: The Stochastic Sharpness Gap
par: Liao, Fangshuo, et autres
Publié: (2026)
par: Liao, Fangshuo, et autres
Publié: (2026)
The Optimality of (Accelerated) SGD for High-Dimensional Quadratic Optimization
par: Zhang, Haihan, et autres
Publié: (2024)
par: Zhang, Haihan, et autres
Publié: (2024)
SGD with Partial Hessian for Deep Neural Networks Optimization
par: Sun, Ying, et autres
Publié: (2024)
par: Sun, Ying, et autres
Publié: (2024)
Optimal Projection-Free Adaptive SGD for Matrix Optimization
par: Kovalev, Dmitry
Publié: (2026)
par: Kovalev, Dmitry
Publié: (2026)
On the Trajectories of SGD Without Replacement
par: Beneventano, Pierfrancesco
Publié: (2023)
par: Beneventano, Pierfrancesco
Publié: (2023)
Making SGD Parameter-Free
par: Carmon, Yair, et autres
Publié: (2022)
par: Carmon, Yair, et autres
Publié: (2022)
Asynchronous Decentralized SGD under Non-Convexity: A Block-Coordinate Descent Framework
par: Zhou, Yijie, et autres
Publié: (2025)
par: Zhou, Yijie, et autres
Publié: (2025)
Lower Bounds and Proximally Anchored SGD for Non-Convex Minimization Under Unbounded Variance
par: Fazla, Arda, et autres
Publié: (2026)
par: Fazla, Arda, et autres
Publié: (2026)
Shadowheart SGD: Distributed Asynchronous SGD with Optimal Time Complexity Under Arbitrary Computation and Communication Heterogeneity
par: Tyurin, Alexander, et autres
Publié: (2024)
par: Tyurin, Alexander, et autres
Publié: (2024)
Birch SGD: A Tree Graph Framework for Local and Asynchronous SGD Methods
par: Tyurin, Alexander, et autres
Publié: (2025)
par: Tyurin, Alexander, et autres
Publié: (2025)
Dimension-adapted Momentum Outscales SGD
par: Ferbach, Damien, et autres
Publié: (2025)
par: Ferbach, Damien, et autres
Publié: (2025)
Heavy-Tail Phenomenon in Decentralized SGD
par: Gurbuzbalaban, Mert, et autres
Publié: (2022)
par: Gurbuzbalaban, Mert, et autres
Publié: (2022)
AutoSGD: Automatic Learning Rate Selection for Stochastic Gradient Descent
par: Surjanovic, Nikola, et autres
Publié: (2025)
par: Surjanovic, Nikola, et autres
Publié: (2025)
Proactive DP: A Multple Target Optimization Framework for DP-SGD
par: van Dijk, Marten, et autres
Publié: (2021)
par: van Dijk, Marten, et autres
Publié: (2021)
Revisiting LocalSGD and SCAFFOLD: Improved Rates and Missing Analysis
par: Luo, Ruichen, et autres
Publié: (2025)
par: Luo, Ruichen, et autres
Publié: (2025)
Scaling Laws of SignSGD in Linear Regression: When Does It Outperform SGD?
par: Kim, Jihwan, et autres
Publié: (2026)
par: Kim, Jihwan, et autres
Publié: (2026)
The Rich and the Simple: On the Implicit Bias of Adam and SGD
par: Vasudeva, Bhavya, et autres
Publié: (2025)
par: Vasudeva, Bhavya, et autres
Publié: (2025)
Can SGD Handle Heavy-Tailed Noise?
par: Fatkhullin, Ilyas, et autres
Publié: (2025)
par: Fatkhullin, Ilyas, et autres
Publié: (2025)
SGD with memory: fundamental properties and stochastic acceleration
par: Yarotsky, Dmitry, et autres
Publié: (2024)
par: Yarotsky, Dmitry, et autres
Publié: (2024)
Does SGD really happen in tiny subspaces?
par: Song, Minhak, et autres
Publié: (2024)
par: Song, Minhak, et autres
Publié: (2024)
Documents similaires
-
$μ^2$-SGD: Stable Stochastic Optimization via a Double Momentum Mechanism
par: Dahan, Tehila, et autres
Publié: (2023) -
Bringing Order to Asynchronous SGD: Towards Optimality under Data-Dependent Delays with Momentum
par: Dahan, Tehila, et autres
Publié: (2026) -
On the Provable Suboptimality of Momentum SGD in Nonstationary Stochastic Optimization
par: Sahu, Sharan, et autres
Publié: (2026) -
Convergence of Clipped SGD on Convex $(L_0,L_1)$-Smooth Functions
par: Gaash, Ofir, et autres
Publié: (2025) -
Demystifying SGD with Doubly Stochastic Gradients
par: Kim, Kyurae, et autres
Publié: (2024)