Enregistré dans:
| Auteurs principaux: | Kawamoto, Yuta, Iiduka, Hideaki |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2510.20608 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Muon Converges under Heavy-Tailed Noise: Nonconvex Hölder-Smooth Empirical Risk Minimization
par: Iiduka, Hideaki
Publié: (2026)
par: Iiduka, Hideaki
Publié: (2026)
Optimal Growth Schedules for Batch Size and Learning Rate in SGD that Reduce SFO Complexity
par: Umeda, Hikaru, et autres
Publié: (2025)
par: Umeda, Hikaru, et autres
Publié: (2025)
Using Stochastic Gradient Descent to Smooth Nonconvex Functions: Analysis of Implicit Graduated Optimization
par: Sato, Naoki, et autres
Publié: (2023)
par: Sato, Naoki, et autres
Publié: (2023)
Increasing Batch Size Improves Convergence of Stochastic Gradient Descent with Momentum
par: Kamo, Keisuke, et autres
Publié: (2025)
par: Kamo, Keisuke, et autres
Publié: (2025)
Improved Convergence Rates of Muon Optimizer for Nonconvex Optimization
par: Nagashima, Shuntaro, et autres
Publié: (2026)
par: Nagashima, Shuntaro, et autres
Publié: (2026)
Faster Convergence of Riemannian Stochastic Gradient Descent with Increasing Batch Size
par: Oowada, Kanata, et autres
Publié: (2025)
par: Oowada, Kanata, et autres
Publié: (2025)
Both Asymptotic and Non-Asymptotic Convergence of Quasi-Hyperbolic Momentum using Increasing Batch Size
par: Imaizumi, Kento, et autres
Publié: (2025)
par: Imaizumi, Kento, et autres
Publié: (2025)
Convergence of Sharpness-Aware Minimization Algorithms using Increasing Batch Size and Decaying Learning Rate
par: Harada, Hinata, et autres
Publié: (2024)
par: Harada, Hinata, et autres
Publié: (2024)
Convergence Bound and Critical Batch Size of Muon Optimizer
par: Sato, Naoki, et autres
Publié: (2025)
par: Sato, Naoki, et autres
Publié: (2025)
Accelerating SGDM via Learning Rate and Batch Size Schedules: A Lyapunov-Based Analysis
par: Kondo, Yuichi, et autres
Publié: (2025)
par: Kondo, Yuichi, et autres
Publié: (2025)
Iteration and Stochastic First-order Oracle Complexities of Stochastic Gradient Descent using Constant and Decaying Learning Rates
par: Imaizumi, Kento, et autres
Publié: (2024)
par: Imaizumi, Kento, et autres
Publié: (2024)
Explicit and Implicit Graduated Optimization in Deep Neural Networks
par: Sato, Naoki, et autres
Publié: (2024)
par: Sato, Naoki, et autres
Publié: (2024)
Lipschitz Multiscale Deep Equilibrium Models: A Theoretically Guaranteed and Accelerated Approach
par: Sato, Naoki, et autres
Publié: (2026)
par: Sato, Naoki, et autres
Publié: (2026)
Adaptive Batch Size and Learning Rate Scheduler for Stochastic Gradient Descent Based on Minimization of Stochastic First-order Oracle Complexity
par: Umeda, Hikaru, et autres
Publié: (2025)
par: Umeda, Hikaru, et autres
Publié: (2025)
Relationship between Batch Size and Number of Steps Needed for Nonconvex Optimization of Stochastic Gradient Descent using Armijo Line Search
par: Tsukada, Yuki, et autres
Publié: (2023)
par: Tsukada, Yuki, et autres
Publié: (2023)
Increasing Both Batch Size and Learning Rate Accelerates Stochastic Gradient Descent
par: Umeda, Hikaru, et autres
Publié: (2024)
par: Umeda, Hikaru, et autres
Publié: (2024)
Momentum Does Not Reduce Stochastic Noise in Stochastic Gradient Descent
par: Sato, Naoki, et autres
Publié: (2024)
par: Sato, Naoki, et autres
Publié: (2024)
Scaled Conjugate Gradient Method for Nonconvex Optimization in Deep Neural Networks
par: Sato, Naoki, et autres
Publié: (2024)
par: Sato, Naoki, et autres
Publié: (2024)
Diagonalisation SGD: Fast & Convergent SGD for Non-Differentiable Models via Reparameterisation and Smoothing
par: Wagner, Dominik, et autres
Publié: (2024)
par: Wagner, Dominik, et autres
Publié: (2024)
Fast Last-Iterate Convergence of SGD in the Smooth Interpolation Regime
par: Attia, Amit, et autres
Publié: (2025)
par: Attia, Amit, et autres
Publié: (2025)
Convergent Privacy Loss of Noisy-SGD without Convexity and Smoothness
par: Chien, Eli, et autres
Publié: (2024)
par: Chien, Eli, et autres
Publié: (2024)
Convergence of Clipped-SGD for Convex $(L_0,L_1)$-Smooth Optimization with Heavy-Tailed Noise
par: Chezhegov, Savelii, et autres
Publié: (2025)
par: Chezhegov, Savelii, et autres
Publié: (2025)
Convergence Rates of Constrained Expected Improvement
par: Wang, Haowei, et autres
Publié: (2025)
par: Wang, Haowei, et autres
Publié: (2025)
Discovering Learning-Friendly Generation Orders for Sequential Computation
par: Sato, Yuta, et autres
Publié: (2025)
par: Sato, Yuta, et autres
Publié: (2025)
PCDP-SGD: Improving the Convergence of Differentially Private SGD via Projection in Advance
par: Sha, Haichao, et autres
Publié: (2023)
par: Sha, Haichao, et autres
Publié: (2023)
Smoothed SGD for quantiles: Bahadur representation and Gaussian approximation
par: Chen, Likai, et autres
Publié: (2025)
par: Chen, Likai, et autres
Publié: (2025)
MGDA Converges under Generalized Smoothness, Provably
par: Zhang, Qi, et autres
Publié: (2024)
par: Zhang, Qi, et autres
Publié: (2024)
On the Convergence of DP-SGD with Adaptive Clipping
par: Shulgin, Egor, et autres
Publié: (2024)
par: Shulgin, Egor, et autres
Publié: (2024)
Enhancing SignSGD: Small-Batch Convergence Analysis and a Hybrid Switching Strategy
par: Chen, Haoran, et autres
Publié: (2026)
par: Chen, Haoran, et autres
Publié: (2026)
An Improved Privacy and Utility Analysis of Differentially Private SGD with Bounded Domain and Smooth Losses
par: Liang, Hao, et autres
Publié: (2025)
par: Liang, Hao, et autres
Publié: (2025)
Bilevel Optimization under Unbounded Smoothness: A New Algorithm and Convergence Analysis
par: Hao, Jie, et autres
Publié: (2024)
par: Hao, Jie, et autres
Publié: (2024)
Mini-Batch Stochastic Halpern Algorithm for Nonexpansive Fixed point Problems
par: Iiduka, Hideaki
Publié: (2026)
par: Iiduka, Hideaki
Publié: (2026)
Mini-Batch Stochastic Krasnosel'ski\uı-Mann Algorithm for Nonexpansive Fixed Point Problems
par: Iiduka, Hideaki
Publié: (2026)
par: Iiduka, Hideaki
Publié: (2026)
Convergence Analysis of Randomized Subspace Normalized SGD under Heavy-Tailed Noise
par: Omiya, Gaku, et autres
Publié: (2026)
par: Omiya, Gaku, et autres
Publié: (2026)
Faster Convergence of Local SGD for Over-Parameterized Models
par: Qin, Tiancheng, et autres
Publié: (2022)
par: Qin, Tiancheng, et autres
Publié: (2022)
Global Convergence of SGD On Two Layer Neural Nets
par: Gopalani, Pulkit, et autres
Publié: (2022)
par: Gopalani, Pulkit, et autres
Publié: (2022)
High-Probability Convergence Guarantees of Decentralized SGD
par: Armacki, Aleksandar, et autres
Publié: (2025)
par: Armacki, Aleksandar, et autres
Publié: (2025)
From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees
par: Xie, Shengping, et autres
Publié: (2025)
par: Xie, Shengping, et autres
Publié: (2025)
Convergence of Steepest Descent and Adam under Non-Uniform Smoothness
par: Vaswani, Sharan, et autres
Publié: (2026)
par: Vaswani, Sharan, et autres
Publié: (2026)
Convergence, Sticking and Escape: Stochastic Dynamics Near Critical Points in SGD
par: Dudukalov, Dmitry, et autres
Publié: (2025)
par: Dudukalov, Dmitry, et autres
Publié: (2025)
Documents similaires
-
Muon Converges under Heavy-Tailed Noise: Nonconvex Hölder-Smooth Empirical Risk Minimization
par: Iiduka, Hideaki
Publié: (2026) -
Optimal Growth Schedules for Batch Size and Learning Rate in SGD that Reduce SFO Complexity
par: Umeda, Hikaru, et autres
Publié: (2025) -
Using Stochastic Gradient Descent to Smooth Nonconvex Functions: Analysis of Implicit Graduated Optimization
par: Sato, Naoki, et autres
Publié: (2023) -
Increasing Batch Size Improves Convergence of Stochastic Gradient Descent with Momentum
par: Kamo, Keisuke, et autres
Publié: (2025) -
Improved Convergence Rates of Muon Optimizer for Nonconvex Optimization
par: Nagashima, Shuntaro, et autres
Publié: (2026)