FRUGAL: Memory-Efficient Optimization by Reducing State Overhead for Scalable Training
Fuente:
arXiv
Guardado en:
| Autores principales: | Zmushko, Philip, Beznosikov, Aleksandr, Takáč, Martin, Horváth, Samuel |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LionMuon: Alternating Spectral and Sign Descent for Efficient Training
por: Bolatov, Arman, et al.
Publicado: (2026)
por: Bolatov, Arman, et al.
Publicado: (2026)
Random-reshuffled SARAH does not need a full gradient computations
por: Beznosikov, Aleksandr, et al.
Publicado: (2021)
por: Beznosikov, Aleksandr, et al.
Publicado: (2021)
Label Privacy in Split Learning for Large Models with Parameter-Efficient Training
por: Zmushko, Philip, et al.
Publicado: (2024)
por: Zmushko, Philip, et al.
Publicado: (2024)
Just a Simple Transformation is Enough for Data Protection in Vertical Federated Learning
por: Semenov, Andrei, et al.
Publicado: (2024)
por: Semenov, Andrei, et al.
Publicado: (2024)
Preconditioned Norms: A Unified Framework for Steepest Descent, Quasi-Newton and Adaptive Methods
por: Veprikov, Andrey, et al.
Publicado: (2025)
por: Veprikov, Andrey, et al.
Publicado: (2025)
Faster Than SVD, Smarter Than SGD: The OPLoRA Alternating Update
por: Almansoori, Abdulla Jasem, et al.
Publicado: (2025)
por: Almansoori, Abdulla Jasem, et al.
Publicado: (2025)
Beyond SGD, Without SVD: Proximal Subspace Iteration LoRA with Diagonal Fractional K-FAC
por: Almansoori, Abdulla Jasem, et al.
Publicado: (2026)
por: Almansoori, Abdulla Jasem, et al.
Publicado: (2026)
Similarity, Compression and Local Steps: Three Pillars of Efficient Communications for Distributed Variational Inequalities
por: Beznosikov, Aleksandr, et al.
Publicado: (2023)
por: Beznosikov, Aleksandr, et al.
Publicado: (2023)
Convergence of Clipped-SGD for Convex $(L_0,L_1)$-Smooth Optimization with Heavy-Tailed Noise
por: Chezhegov, Savelii, et al.
Publicado: (2025)
por: Chezhegov, Savelii, et al.
Publicado: (2025)
Sign-SGD via Parameter-Free Optimization
por: Medyakov, Daniil, et al.
Publicado: (2025)
por: Medyakov, Daniil, et al.
Publicado: (2025)
Where Does Warm-Up Come From? Adaptive Scheduling for Norm-Constrained Optimizers
por: Riabinin, Artem, et al.
Publicado: (2026)
por: Riabinin, Artem, et al.
Publicado: (2026)
Collaborative and Efficient Personalization with Mixtures of Adaptors
por: Almansoori, Abdulla Jasem, et al.
Publicado: (2024)
por: Almansoori, Abdulla Jasem, et al.
Publicado: (2024)
Clipping Improves Adam-Norm and AdaGrad-Norm when the Noise Is Heavy-Tailed
por: Chezhegov, Savelii, et al.
Publicado: (2024)
por: Chezhegov, Savelii, et al.
Publicado: (2024)
AdaFRUGAL: Adaptive Memory-Efficient Training with Dynamic Control
por: Bui, Quang-Hung, et al.
Publicado: (2025)
por: Bui, Quang-Hung, et al.
Publicado: (2025)
Byzantine-Robust Optimization under $(L_0, L_1)$-Smoothness
por: Bolatov, Arman, et al.
Publicado: (2026)
por: Bolatov, Arman, et al.
Publicado: (2026)
Sign Operator for Coping with Heavy-Tailed Noise in Non-Convex Optimization: High Probability Bounds Under $(L_0, L_1)$-Smoothness
por: Kornilov, Nikita, et al.
Publicado: (2025)
por: Kornilov, Nikita, et al.
Publicado: (2025)
On Biased Compression for Distributed Learning
por: Beznosikov, Aleksandr, et al.
Publicado: (2020)
por: Beznosikov, Aleksandr, et al.
Publicado: (2020)
Generalising Battery Control in Net-Zero Buildings via Personalised Federated RL
por: Avila, Nicolas M Cuadrado, et al.
Publicado: (2024)
por: Avila, Nicolas M Cuadrado, et al.
Publicado: (2024)
Ito Diffusion Approximation of Universal Ito Chains for Sampling, Optimization and Boosting
por: Ustimenko, Aleksei, et al.
Publicado: (2023)
por: Ustimenko, Aleksei, et al.
Publicado: (2023)
Thinking like a CHEMIST: Combined Heterogeneous Embedding Model Integrating Structure and Tokens
por: Rekut, Nikolai, et al.
Publicado: (2025)
por: Rekut, Nikolai, et al.
Publicado: (2025)
PaDPaF: Partial Disentanglement with Partially-Federated GANs
por: Almansoori, Abdulla Jasem, et al.
Publicado: (2022)
por: Almansoori, Abdulla Jasem, et al.
Publicado: (2022)
Accelerated Stochastic ExtraGradient: Mixing Hessian and Gradient Similarity to Reduce Communication in Distributed and Federated Learning
por: Bylinkin, Dmitry, et al.
Publicado: (2024)
por: Bylinkin, Dmitry, et al.
Publicado: (2024)
Stochastic Gradient Methods with Preconditioned Updates
por: Sadiev, Abdurakhmon, et al.
Publicado: (2022)
por: Sadiev, Abdurakhmon, et al.
Publicado: (2022)
Federated Learning Can Find Friends That Are Advantageous
por: Tupitsa, Nazarii, et al.
Publicado: (2024)
por: Tupitsa, Nazarii, et al.
Publicado: (2024)
Generalized Policy Learning for Smart Grids: FL TRPO Approach
por: Li, Yunxiang, et al.
Publicado: (2024)
por: Li, Yunxiang, et al.
Publicado: (2024)
Accelerated Methods with Compressed Communications for Distributed Optimization Problems under Data Similarity
por: Bylinkin, Dmitry, et al.
Publicado: (2024)
por: Bylinkin, Dmitry, et al.
Publicado: (2024)
Efficient Conformal Prediction under Data Heterogeneity
por: Plassier, Vincent, et al.
Publicado: (2023)
por: Plassier, Vincent, et al.
Publicado: (2023)
FedPeWS: Personalized Warmup via Subnetworks for Enhanced Heterogeneous Federated Learning
por: Tastan, Nurbek, et al.
Publicado: (2024)
por: Tastan, Nurbek, et al.
Publicado: (2024)
Sarah Frank-Wolfe: Methods for Constrained Optimization with Best Rates and Practical Features
por: Beznosikov, Aleksandr, et al.
Publicado: (2023)
por: Beznosikov, Aleksandr, et al.
Publicado: (2023)
What Scalable Second-Order Information Knows for Pruning at Initialization
por: Navarrete, Ivo Gollini, et al.
Publicado: (2025)
por: Navarrete, Ivo Gollini, et al.
Publicado: (2025)
Hierarchical Mixture-of-Experts with Two-Stage Optimization
por: Molodtsov, Gleb, et al.
Publicado: (2026)
por: Molodtsov, Gleb, et al.
Publicado: (2026)
LoFT: Low-Rank Adaptation That Behaves Like Full Fine-Tuning
por: Tastan, Nurbek, et al.
Publicado: (2025)
por: Tastan, Nurbek, et al.
Publicado: (2025)
Remove that Square Root: A New Efficient Scale-Invariant Version of AdaGrad
por: Choudhury, Sayantan, et al.
Publicado: (2024)
por: Choudhury, Sayantan, et al.
Publicado: (2024)
Enhancing Stability of Physics-Informed Neural Network Training Through Saddle-Point Reformulation
por: Bylinkin, Dmitry, et al.
Publicado: (2025)
por: Bylinkin, Dmitry, et al.
Publicado: (2025)
Reducing Fine-Tuning Memory Overhead by Approximate and Memory-Sharing Backpropagation
por: Yang, Yuchen, et al.
Publicado: (2024)
por: Yang, Yuchen, et al.
Publicado: (2024)
Decentralized Personalized Federated Learning for Min-Max Problems
por: Borodich, Ekaterina, et al.
Publicado: (2021)
por: Borodich, Ekaterina, et al.
Publicado: (2021)
Optimal Data Splitting in Distributed Optimization for Machine Learning
por: Medyakov, Daniil, et al.
Publicado: (2024)
por: Medyakov, Daniil, et al.
Publicado: (2024)
Methods for Convex $(L_0,L_1)$-Smooth Optimization: Clipping, Acceleration, and Adaptivity
por: Gorbunov, Eduard, et al.
Publicado: (2024)
por: Gorbunov, Eduard, et al.
Publicado: (2024)
Methods with Local Steps and Random Reshuffling for Generally Smooth Non-Convex Federated Optimization
por: Demidovich, Yury, et al.
Publicado: (2024)
por: Demidovich, Yury, et al.
Publicado: (2024)
Revisiting LocalSGD and SCAFFOLD: Improved Rates and Missing Analysis
por: Luo, Ruichen, et al.
Publicado: (2025)
por: Luo, Ruichen, et al.
Publicado: (2025)
Ejemplares similares
-
LionMuon: Alternating Spectral and Sign Descent for Efficient Training
por: Bolatov, Arman, et al.
Publicado: (2026) -
Random-reshuffled SARAH does not need a full gradient computations
por: Beznosikov, Aleksandr, et al.
Publicado: (2021) -
Label Privacy in Split Learning for Large Models with Parameter-Efficient Training
por: Zmushko, Philip, et al.
Publicado: (2024) -
Just a Simple Transformation is Enough for Data Protection in Vertical Federated Learning
por: Semenov, Andrei, et al.
Publicado: (2024) -
Preconditioned Norms: A Unified Framework for Steepest Descent, Quasi-Newton and Adaptive Methods
por: Veprikov, Andrey, et al.
Publicado: (2025)