Connections between Schedule-Free Optimizers, AdEMAMix, and Accelerated SGD Variants
Fuente:
arXiv
Salvato in:
| Autori principali: | Morwani, Depen, Vyas, Nikhil, Zhang, Hanlin, Kakade, Sham |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Potential of Second-Order Optimization for LLMs: A Study with Full Gauss-Newton
di: Abreu, Natalie, et al.
Pubblicazione: (2025)
di: Abreu, Natalie, et al.
Pubblicazione: (2025)
Deconstructing What Makes a Good Optimizer for Language Models
di: Zhao, Rosie, et al.
Pubblicazione: (2024)
di: Zhao, Rosie, et al.
Pubblicazione: (2024)
Anytime Pretraining: Horizon-Free Learning-Rate Schedules with Weight Averaging
di: Meterez, Alexandru, et al.
Pubblicazione: (2026)
di: Meterez, Alexandru, et al.
Pubblicazione: (2026)
How Does Critical Batch Size Scale in Pre-training?
di: Zhang, Hanlin, et al.
Pubblicazione: (2024)
di: Zhang, Hanlin, et al.
Pubblicazione: (2024)
Beyond Implicit Bias: The Insignificance of SGD Noise in Online Learning
di: Vyas, Nikhil, et al.
Pubblicazione: (2023)
di: Vyas, Nikhil, et al.
Pubblicazione: (2023)
Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling
di: Meterez, Alexandru, et al.
Pubblicazione: (2025)
di: Meterez, Alexandru, et al.
Pubblicazione: (2025)
The AdEMAMix Optimizer: Better, Faster, Older
di: Pagliardini, Matteo, et al.
Pubblicazione: (2024)
di: Pagliardini, Matteo, et al.
Pubblicazione: (2024)
SOAP: Improving and Stabilizing Shampoo using Adam
di: Vyas, Nikhil, et al.
Pubblicazione: (2024)
di: Vyas, Nikhil, et al.
Pubblicazione: (2024)
Adam or Gauss-Newton? A Comparative Study In Terms of Basis Alignment and SGD Noise
di: Liu, Bingbin, et al.
Pubblicazione: (2025)
di: Liu, Bingbin, et al.
Pubblicazione: (2025)
A New Perspective on Shampoo's Preconditioner
di: Morwani, Depen, et al.
Pubblicazione: (2024)
di: Morwani, Depen, et al.
Pubblicazione: (2024)
A Simplified Analysis of SGD for Linear Regression with Weight Averaging
di: Meterez, Alexandru, et al.
Pubblicazione: (2025)
di: Meterez, Alexandru, et al.
Pubblicazione: (2025)
Loss-to-Loss Prediction: Scaling Laws for All Datasets
di: Brandfonbrener, David, et al.
Pubblicazione: (2024)
di: Brandfonbrener, David, et al.
Pubblicazione: (2024)
LOTION: Smoothing the Optimization Landscape for Quantized Training
di: Kwun, Mujin, et al.
Pubblicazione: (2025)
di: Kwun, Mujin, et al.
Pubblicazione: (2025)
Discovering Hierarchical Latent Capabilities of Language Models via Causal Representation Learning
di: Jin, Jikai, et al.
Pubblicazione: (2025)
di: Jin, Jikai, et al.
Pubblicazione: (2025)
Prescriptive Scaling Reveals the Evolution of Language Model Capabilities
di: Zhang, Hanlin, et al.
Pubblicazione: (2026)
di: Zhang, Hanlin, et al.
Pubblicazione: (2026)
The Recurrent Transformer: Greater Effective Depth and Efficient Decoding
di: Oncescu, Costin-Andrei, et al.
Pubblicazione: (2026)
di: Oncescu, Costin-Andrei, et al.
Pubblicazione: (2026)
CoLoR-Filter: Conditional Loss Reduction Filtering for Targeted Language Model Pre-training
di: Brandfonbrener, David, et al.
Pubblicazione: (2024)
di: Brandfonbrener, David, et al.
Pubblicazione: (2024)
Feature emergence via margin maximization: case studies in algebraic tasks
di: Morwani, Depen, et al.
Pubblicazione: (2023)
di: Morwani, Depen, et al.
Pubblicazione: (2023)
Follow My Instruction and Spill the Beans: Scalable Data Extraction from Retrieval-Augmented Generation Systems
di: Qi, Zhenting, et al.
Pubblicazione: (2024)
di: Qi, Zhenting, et al.
Pubblicazione: (2024)
Learning Hidden Markov Models Using Conditional Samples
di: Kakade, Sham M., et al.
Pubblicazione: (2023)
di: Kakade, Sham M., et al.
Pubblicazione: (2023)
Flash Inference: Near Linear Time Inference for Long Convolution Sequence Models and Beyond
di: Oncescu, Costin-Andrei, et al.
Pubblicazione: (2024)
di: Oncescu, Costin-Andrei, et al.
Pubblicazione: (2024)
A Study on the Calibration of In-context Learning
di: Zhang, Hanlin, et al.
Pubblicazione: (2023)
di: Zhang, Hanlin, et al.
Pubblicazione: (2023)
Soup to go: mitigating forgetting during continual learning with model averaging
di: Kleiman, Anat, et al.
Pubblicazione: (2025)
di: Kleiman, Anat, et al.
Pubblicazione: (2025)
Repeat After Me: Transformers are Better than State Space Models at Copying
di: Jelassi, Samy, et al.
Pubblicazione: (2024)
di: Jelassi, Samy, et al.
Pubblicazione: (2024)
EvoLM: In Search of Lost Language Model Training Dynamics
di: Qi, Zhenting, et al.
Pubblicazione: (2025)
di: Qi, Zhenting, et al.
Pubblicazione: (2025)
Scaling Laws for Imitation Learning in Single-Agent Games
di: Tuyls, Jens, et al.
Pubblicazione: (2023)
di: Tuyls, Jens, et al.
Pubblicazione: (2023)
Analysis of Schedule-Free Nonconvex Optimization
di: Brown, Connor
Pubblicazione: (2025)
di: Brown, Connor
Pubblicazione: (2025)
The Role of Sparsity for Length Generalization in Transformers
di: Golowich, Noah, et al.
Pubblicazione: (2025)
di: Golowich, Noah, et al.
Pubblicazione: (2025)
Transcendence: Generative Models Can Outperform The Experts That Train Them
di: Zhang, Edwin, et al.
Pubblicazione: (2024)
di: Zhang, Edwin, et al.
Pubblicazione: (2024)
Scaling Laws in Linear Regression: Compute, Parameters, and Data
di: Lin, Licong, et al.
Pubblicazione: (2024)
di: Lin, Licong, et al.
Pubblicazione: (2024)
ScheduleFree+: Scaling Learning-Rate-Free & Schedule-Free Learning to Large Language Models
di: Defazio, Aaron
Pubblicazione: (2026)
di: Defazio, Aaron
Pubblicazione: (2026)
Anytime Training with Schedule-Free Spectral Optimization
di: Apte, Anuj, et al.
Pubblicazione: (2026)
di: Apte, Anuj, et al.
Pubblicazione: (2026)
Accumulative SGD Influence Estimation for Data Attribution
di: Shi, Yunxiao, et al.
Pubblicazione: (2025)
di: Shi, Yunxiao, et al.
Pubblicazione: (2025)
Anon: Extrapolating Adaptivity Beyond SGD and Adam
di: Zhang, Yiheng, et al.
Pubblicazione: (2026)
di: Zhang, Yiheng, et al.
Pubblicazione: (2026)
Deep Learning with Tabular Data: A Self-supervised Approach
di: Vyas, Tirth Kiranbhai
Pubblicazione: (2024)
di: Vyas, Tirth Kiranbhai
Pubblicazione: (2024)
Bootstrap SGD: Algorithmic Stability and Robustness
di: Christmann, Andreas, et al.
Pubblicazione: (2024)
di: Christmann, Andreas, et al.
Pubblicazione: (2024)
Observation-Free Attacks on Online Learning to Rank
di: Chattopadhyay, Sameep, et al.
Pubblicazione: (2025)
di: Chattopadhyay, Sameep, et al.
Pubblicazione: (2025)
GreedySnake: Accelerating SSD-Offloaded LLM Training with Efficient Scheduling and Optimizer Step Overlapping
di: Yin, Yishu, et al.
Pubblicazione: (2025)
di: Yin, Yishu, et al.
Pubblicazione: (2025)
Preference-Based Multi-Agent Reinforcement Learning: Data Coverage and Algorithmic Techniques
di: Zhang, Natalia, et al.
Pubblicazione: (2024)
di: Zhang, Natalia, et al.
Pubblicazione: (2024)
SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling
di: Zhang, Yiqi, et al.
Pubblicazione: (2026)
di: Zhang, Yiqi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
The Potential of Second-Order Optimization for LLMs: A Study with Full Gauss-Newton
di: Abreu, Natalie, et al.
Pubblicazione: (2025) -
Deconstructing What Makes a Good Optimizer for Language Models
di: Zhao, Rosie, et al.
Pubblicazione: (2024) -
Anytime Pretraining: Horizon-Free Learning-Rate Schedules with Weight Averaging
di: Meterez, Alexandru, et al.
Pubblicazione: (2026) -
How Does Critical Batch Size Scale in Pre-training?
di: Zhang, Hanlin, et al.
Pubblicazione: (2024) -
Beyond Implicit Bias: The Insignificance of SGD Noise in Online Learning
di: Vyas, Nikhil, et al.
Pubblicazione: (2023)