Analysis of an Idealized Stochastic Polyak Method and its Application to Black-Box Model Distillation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gower, Robert M., Garrigos, Guillaume, Loizou, Nicolas, Oikonomou, Dimitris, Mishchenko, Konstantin, Schaipp, Fabian |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cutting Some Slack for SGD with Adaptive Polyak Stepsizes
par: Gower, Robert M., et autres
Publié: (2022)
par: Gower, Robert M., et autres
Publié: (2022)
MoMo: Momentum Models for Adaptive Learning Rates
par: Schaipp, Fabian, et autres
Publié: (2023)
par: Schaipp, Fabian, et autres
Publié: (2023)
Stochastic versus Deterministic in Stochastic Gradient Descent
par: Li, Runze, et autres
Publié: (2025)
par: Li, Runze, et autres
Publié: (2025)
Stable gradient-adjusted root mean square propagation on least squares problem
par: Li, Runze, et autres
Publié: (2024)
par: Li, Runze, et autres
Publié: (2024)
Stochastic trace estimation for parameter-dependent matrices applied to spectral density approximation
par: Matti, Fabio, et autres
Publié: (2025)
par: Matti, Fabio, et autres
Publié: (2025)
Federated Learning with Convex Global and Local Constraints
par: He, Chuan, et autres
Publié: (2023)
par: He, Chuan, et autres
Publié: (2023)
Classification by Separating Hypersurfaces: An Entropic Approach
par: Arratia, Argimiro, et autres
Publié: (2025)
par: Arratia, Argimiro, et autres
Publié: (2025)
Dimension-free estimators of gradients of functions with(out) non-independent variables
par: Lamboni, Matieyendou
Publié: (2025)
par: Lamboni, Matieyendou
Publié: (2025)
On the boundedness of the sequence generated by minibatch stochastic gradient descent
par: Bauschke, Heinz H., et autres
Publié: (2025)
par: Bauschke, Heinz H., et autres
Publié: (2025)
CompressedScaffnew: The First Theoretical Double Acceleration of Communication from Local Training and Compression in Distributed Optimization
par: Condat, Laurent, et autres
Publié: (2022)
par: Condat, Laurent, et autres
Publié: (2022)
Optimal Online Bipartite Matching in Degree-2 Graphs
par: Bhangale, Amey, et autres
Publié: (2025)
par: Bhangale, Amey, et autres
Publié: (2025)
Structured Sketching for Linear Systems
par: Brust, Johannes J, et autres
Publié: (2024)
par: Brust, Johannes J, et autres
Publié: (2024)
Exact recovery for seeded graph matching
par: Fraiman, Nicolas, et autres
Publié: (2026)
par: Fraiman, Nicolas, et autres
Publié: (2026)
Acceleration and restart for the randomized Bregman-Kaczmarz method
par: Tondji, Lionel, et autres
Publié: (2023)
par: Tondji, Lionel, et autres
Publié: (2023)
A New Algorithm for Computing Integer Hulls of 2D Polyhedral Sets
par: Mukherjee, Chirantan
Publié: (2025)
par: Mukherjee, Chirantan
Publié: (2025)
Primal-Dual Coordinate Descent for Nonconvex-Nonconcave Saddle Point Problems Under the Weak MVI Assumption
par: Walwil, Iyad, et autres
Publié: (2025)
par: Walwil, Iyad, et autres
Publié: (2025)
Distributed Computing for Huge-Scale Aggregative Convex Programming
par: Tao, Luoyi
Publié: (2026)
par: Tao, Luoyi
Publié: (2026)
A Heuristic Alternating Direction Method of Multipliers Framework for Distributed and Centralized Tree-Constrained Optimization: Applications to Hop-Constrained Spanning Tree Multicommodity Flow Design
par: Mokhtari, Yacine
Publié: (2025)
par: Mokhtari, Yacine
Publié: (2025)
Efficient Multi-Processor Scheduling in Increasingly Realistic Models
par: Papp, Pál András, et autres
Publié: (2024)
par: Papp, Pál András, et autres
Publié: (2024)
Nature-Inspired Algorithms in Optimization: Introduction, Hybridization and Insights
par: Yang, Xin-She
Publié: (2023)
par: Yang, Xin-She
Publié: (2023)
RA-DCA: A Randomized Active-Set DCA for Directional Stationarity in Max-Structured DC Programs
par: Niu, Yi-Shuai
Publié: (2026)
par: Niu, Yi-Shuai
Publié: (2026)
Correcting the Foundational Analysis of Karp--Vazirani--Vazirani (STOC 1990): A Rigorous Revision of the $1-1/e$ Upper Bound
par: Xu, Pan
Publié: (2025)
par: Xu, Pan
Publié: (2025)
Weighted domination models and randomized heuristics
par: Dijkstra, Lukas, et autres
Publié: (2022)
par: Dijkstra, Lukas, et autres
Publié: (2022)
Some Remarks on the Optimal Level of Randomization in Global Optimization
par: Theodosopoulos, Ted
Publié: (2004)
par: Theodosopoulos, Ted
Publié: (2004)
Multi-Party Multi-Objective Optimization as Consensus Search: Runtime Analysis of Cross-Party Recombination
par: Fang, Xiaolei, et autres
Publié: (2026)
par: Fang, Xiaolei, et autres
Publié: (2026)
Advancing Stochastic 3-SAT Solvers by Dissipating Oversatisfied Constraints
par: Schwardt, J., et autres
Publié: (2025)
par: Schwardt, J., et autres
Publié: (2025)
Have ASkotch: A Neat Solution for Large-scale Kernel Ridge Regression
par: Rathore, Pratik, et autres
Publié: (2024)
par: Rathore, Pratik, et autres
Publié: (2024)
An accelerated randomized Bregman-Kaczmarz method for strongly convex linearly constraint optimization
par: Tondji, Lionel, et autres
Publié: (2025)
par: Tondji, Lionel, et autres
Publié: (2025)
Enhancing Diversity in Multi-objective Feature Selection
par: Miyandoab, Sevil Zanjani, et autres
Publié: (2024)
par: Miyandoab, Sevil Zanjani, et autres
Publié: (2024)
General Constrained Matrix Optimization
par: Garner, Casey, et autres
Publié: (2024)
par: Garner, Casey, et autres
Publié: (2024)
Spectrally Constrained Optimization
par: Garner, Casey, et autres
Publié: (2023)
par: Garner, Casey, et autres
Publié: (2023)
A Fast Monte Carlo algorithm for evaluating matrix functions with application in complex networks
par: Guidotti, Nicolas L., et autres
Publié: (2023)
par: Guidotti, Nicolas L., et autres
Publié: (2023)
Algebraic Algorithms for Fractional Linear Matroid Parity via Non-commutative Rank
par: Oki, Taihei, et autres
Publié: (2022)
par: Oki, Taihei, et autres
Publié: (2022)
Replication in Graph Partitioning and Scheduling Problems
par: Papp, Pál András, et autres
Publié: (2026)
par: Papp, Pál András, et autres
Publié: (2026)
Parallelization Strategies for the Randomized Kaczmarz Algorithm on Large-Scale Dense Systems
par: Ferreira, Inês, et autres
Publié: (2024)
par: Ferreira, Inês, et autres
Publié: (2024)
Submodular Maximization over a Matroid $k$-Intersection: Multiplicative Improvement over Greedy
par: Feldman, Moran, et autres
Publié: (2026)
par: Feldman, Moran, et autres
Publié: (2026)
Subspace-constrained randomized coordinate descent for linear systems with good low-rank matrix approximations
par: Lok, Jackie, et autres
Publié: (2025)
par: Lok, Jackie, et autres
Publié: (2025)
Functional Similarity Metric for Neural Networks: Overcoming Parametric Ambiguity via Activation Region Analysis
par: Hennadii, Kutomanov
Publié: (2026)
par: Hennadii, Kutomanov
Publié: (2026)
A Speed-up for Helsgaun's TSP Heuristic by Relaxing the Positive Gain Criterion
par: Ammann, Sabrina C. L., et autres
Publié: (2024)
par: Ammann, Sabrina C. L., et autres
Publié: (2024)
On the connected (sub)partition polytope
par: Moura, Phablo F. S., et autres
Publié: (2024)
par: Moura, Phablo F. S., et autres
Publié: (2024)
Documents similaires
-
Cutting Some Slack for SGD with Adaptive Polyak Stepsizes
par: Gower, Robert M., et autres
Publié: (2022) -
MoMo: Momentum Models for Adaptive Learning Rates
par: Schaipp, Fabian, et autres
Publié: (2023) -
Stochastic versus Deterministic in Stochastic Gradient Descent
par: Li, Runze, et autres
Publié: (2025) -
Stable gradient-adjusted root mean square propagation on least squares problem
par: Li, Runze, et autres
Publié: (2024) -
Stochastic trace estimation for parameter-dependent matrices applied to spectral density approximation
par: Matti, Fabio, et autres
Publié: (2025)