Salvato in:
| Autori principali: | Gruntkowska, Kaja, Gaponov, Alexander, Tovmasyan, Zhirayr, Richtárik, Peter |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2510.00643 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Drop-Muon: Update Less, Converge Faster
di: Gruntkowska, Kaja, et al.
Pubblicazione: (2025)
di: Gruntkowska, Kaja, et al.
Pubblicazione: (2025)
Non-Euclidean Broximal Point Method: A Blueprint for Geometry-Aware Optimization
di: Gruntkowska, Kaja, et al.
Pubblicazione: (2025)
di: Gruntkowska, Kaja, et al.
Pubblicazione: (2025)
Gluon: Making Muon & Scion Great Again! (Bridging Theory and Practice of LMO-based Optimizers for LLMs)
di: Riabinin, Artem, et al.
Pubblicazione: (2025)
di: Riabinin, Artem, et al.
Pubblicazione: (2025)
Improving the Worst-Case Bidirectional Communication Complexity for Nonconvex Distributed Optimization under Function Similarity
di: Gruntkowska, Kaja, et al.
Pubblicazione: (2024)
di: Gruntkowska, Kaja, et al.
Pubblicazione: (2024)
Freya PAGE: First Optimal Time Complexity for Large-Scale Nonconvex Finite-Sum Optimization with Heterogeneous Asynchronous Computations
di: Tyurin, Alexander, et al.
Pubblicazione: (2024)
di: Tyurin, Alexander, et al.
Pubblicazione: (2024)
Rennala MVR: Improved Time Complexity for Parallel Stochastic Optimization via Momentum-Based Variance Reduction
di: Tovmasyan, Zhirayr, et al.
Pubblicazione: (2026)
di: Tovmasyan, Zhirayr, et al.
Pubblicazione: (2026)
Local LMO: Constrained Gradient Optimization via a Local Linear Minimization Oracle
di: Richtárik, Peter, et al.
Pubblicazione: (2026)
di: Richtárik, Peter, et al.
Pubblicazione: (2026)
Tighter Performance Theory of FedExProx
di: Anyszka, Wojciech, et al.
Pubblicazione: (2024)
di: Anyszka, Wojciech, et al.
Pubblicazione: (2024)
The Ball-Proximal (="Broximal") Point Method: a New Algorithm, Convergence Theory, and Applications
di: Gruntkowska, Kaja, et al.
Pubblicazione: (2025)
di: Gruntkowska, Kaja, et al.
Pubblicazione: (2025)
Revisiting Stochastic Proximal Point Methods: Generalized Smoothness and Similarity
di: Tovmasyan, Zhirayr, et al.
Pubblicazione: (2025)
di: Tovmasyan, Zhirayr, et al.
Pubblicazione: (2025)
Communication Compression for Byzantine Robust Learning: New Efficient Algorithms and Improved Rates
di: Rammal, Ahmad, et al.
Pubblicazione: (2023)
di: Rammal, Ahmad, et al.
Pubblicazione: (2023)
Stabilized Proximal Point Method via Trust Region Control
di: Li, Hanmin, et al.
Pubblicazione: (2026)
di: Li, Hanmin, et al.
Pubblicazione: (2026)
Broximal Alignment for Global Non-Convex Optimization
di: Gruntkowska, Kaja, et al.
Pubblicazione: (2026)
di: Gruntkowska, Kaja, et al.
Pubblicazione: (2026)
Byzantine-Robust and Differentially Private Federated Optimization under Weaker Assumptions
di: Islamov, Rustem, et al.
Pubblicazione: (2026)
di: Islamov, Rustem, et al.
Pubblicazione: (2026)
Muon is Provably Faster with Momentum Variance Reduction
di: Qian, Xun, et al.
Pubblicazione: (2025)
di: Qian, Xun, et al.
Pubblicazione: (2025)
Beyond the Ideal: Analyzing the Inexact Muon Update
di: Shulgin, Egor, et al.
Pubblicazione: (2025)
di: Shulgin, Egor, et al.
Pubblicazione: (2025)
Double Momentum and Error Feedback for Clipping with Fast Rates and Differential Privacy
di: Islamov, Rustem, et al.
Pubblicazione: (2025)
di: Islamov, Rustem, et al.
Pubblicazione: (2025)
EF21 with Bells & Whistles: Six Algorithmic Extensions of Modern Error Feedback
di: Fatkhullin, Ilyas, et al.
Pubblicazione: (2021)
di: Fatkhullin, Ilyas, et al.
Pubblicazione: (2021)
Improved Convergence in Parameter-Agnostic Error Feedback through Momentum
di: Sadiev, Abdurakhmon, et al.
Pubblicazione: (2025)
di: Sadiev, Abdurakhmon, et al.
Pubblicazione: (2025)
A Computation and Communication Efficient Method for Distributed Nonconvex Problems in the Partial Participation Setting
di: Tyurin, Alexander, et al.
Pubblicazione: (2022)
di: Tyurin, Alexander, et al.
Pubblicazione: (2022)
Convergence Analysis of the PAGE Stochastic Algorithm for Weakly Convex Finite-Sum Optimization
di: Condat, Laurent, et al.
Pubblicazione: (2025)
di: Condat, Laurent, et al.
Pubblicazione: (2025)
MARINA-P: Superior Performance in Non-smooth Federated Optimization with Adaptive Stepsizes
di: Sokolov, Igor, et al.
Pubblicazione: (2024)
di: Sokolov, Igor, et al.
Pubblicazione: (2024)
Shadowheart SGD: Distributed Asynchronous SGD with Optimal Time Complexity Under Arbitrary Computation and Communication Heterogeneity
di: Tyurin, Alexander, et al.
Pubblicazione: (2024)
di: Tyurin, Alexander, et al.
Pubblicazione: (2024)
Second-order Optimization under Heavy-Tailed Noise: Hessian Clipping and Sample Complexity Limits
di: Sadiev, Abdurakhmon, et al.
Pubblicazione: (2025)
di: Sadiev, Abdurakhmon, et al.
Pubblicazione: (2025)
A Unified Theory of Stochastic Proximal Point Methods without Smoothness
di: Richtárik, Peter, et al.
Pubblicazione: (2024)
di: Richtárik, Peter, et al.
Pubblicazione: (2024)
BiCoLoR: Communication-Efficient Optimization with Bidirectional Compression and Local Training
di: Condat, Laurent, et al.
Pubblicazione: (2026)
di: Condat, Laurent, et al.
Pubblicazione: (2026)
On the Convergence of DP-SGD with Adaptive Clipping
di: Shulgin, Egor, et al.
Pubblicazione: (2024)
di: Shulgin, Egor, et al.
Pubblicazione: (2024)
First Provable Guarantees for Practical Private FL: Beyond Restrictive Assumptions
di: Shulgin, Egor, et al.
Pubblicazione: (2025)
di: Shulgin, Egor, et al.
Pubblicazione: (2025)
Better LMO-based Momentum Methods with Second-Order Information
di: Khirirat, Sarit, et al.
Pubblicazione: (2025)
di: Khirirat, Sarit, et al.
Pubblicazione: (2025)
Sparse-ProxSkip: Accelerated Sparse-to-Sparse Training in Federated Learning
di: Meinhardt, Georg, et al.
Pubblicazione: (2024)
di: Meinhardt, Georg, et al.
Pubblicazione: (2024)
TAMUNA: Doubly Accelerated Distributed Optimization with Local Training, Compression, and Partial Participation
di: Condat, Laurent, et al.
Pubblicazione: (2023)
di: Condat, Laurent, et al.
Pubblicazione: (2023)
Ringmaster ASGD: The First Asynchronous SGD with Optimal Time Complexity
di: Maranjyan, Artavazd, et al.
Pubblicazione: (2025)
di: Maranjyan, Artavazd, et al.
Pubblicazione: (2025)
A Novel Unified Parametric Assumption for Nonconvex Optimization
di: Riabinin, Artem, et al.
Pubblicazione: (2025)
di: Riabinin, Artem, et al.
Pubblicazione: (2025)
Differentially Private Random Block Coordinate Descent
di: Maranjyan, Artavazd, et al.
Pubblicazione: (2024)
di: Maranjyan, Artavazd, et al.
Pubblicazione: (2024)
Phases of Muon: When Muon Eclipses SignSGD
di: Paquette, Elliot, et al.
Pubblicazione: (2026)
di: Paquette, Elliot, et al.
Pubblicazione: (2026)
Ringleader ASGD: The First Asynchronous SGD with Optimal Time Complexity under Data Heterogeneity
di: Maranjyan, Artavazd, et al.
Pubblicazione: (2025)
di: Maranjyan, Artavazd, et al.
Pubblicazione: (2025)
Towards a Better Theoretical Understanding of Independent Subnetwork Training
di: Shulgin, Egor, et al.
Pubblicazione: (2023)
di: Shulgin, Egor, et al.
Pubblicazione: (2023)
Modular Distributed Nonconvex Learning with Error Feedback
di: Carnevale, Guido, et al.
Pubblicazione: (2025)
di: Carnevale, Guido, et al.
Pubblicazione: (2025)
MuonBP: Faster Muon via Block-Periodic Orthogonalization
di: Khaled, Ahmed, et al.
Pubblicazione: (2025)
di: Khaled, Ahmed, et al.
Pubblicazione: (2025)
LiMuon: Light and Fast Muon Optimizer for Large Models
di: Huang, Feihu, et al.
Pubblicazione: (2025)
di: Huang, Feihu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Drop-Muon: Update Less, Converge Faster
di: Gruntkowska, Kaja, et al.
Pubblicazione: (2025) -
Non-Euclidean Broximal Point Method: A Blueprint for Geometry-Aware Optimization
di: Gruntkowska, Kaja, et al.
Pubblicazione: (2025) -
Gluon: Making Muon & Scion Great Again! (Bridging Theory and Practice of LMO-based Optimizers for LLMs)
di: Riabinin, Artem, et al.
Pubblicazione: (2025) -
Improving the Worst-Case Bidirectional Communication Complexity for Nonconvex Distributed Optimization under Function Similarity
di: Gruntkowska, Kaja, et al.
Pubblicazione: (2024) -
Freya PAGE: First Optimal Time Complexity for Large-Scale Nonconvex Finite-Sum Optimization with Heterogeneous Asynchronous Computations
di: Tyurin, Alexander, et al.
Pubblicazione: (2024)