Deconstructing What Makes a Good Optimizer for Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Rosie, Morwani, Depen, Brandfonbrener, David, Vyas, Nikhil, Kakade, Sham |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Connections between Schedule-Free Optimizers, AdEMAMix, and Accelerated SGD Variants
di: Morwani, Depen, et al.
Pubblicazione: (2025)
di: Morwani, Depen, et al.
Pubblicazione: (2025)
The Potential of Second-Order Optimization for LLMs: A Study with Full Gauss-Newton
di: Abreu, Natalie, et al.
Pubblicazione: (2025)
di: Abreu, Natalie, et al.
Pubblicazione: (2025)
SOAP: Improving and Stabilizing Shampoo using Adam
di: Vyas, Nikhil, et al.
Pubblicazione: (2024)
di: Vyas, Nikhil, et al.
Pubblicazione: (2024)
Beyond Implicit Bias: The Insignificance of SGD Noise in Online Learning
di: Vyas, Nikhil, et al.
Pubblicazione: (2023)
di: Vyas, Nikhil, et al.
Pubblicazione: (2023)
Loss-to-Loss Prediction: Scaling Laws for All Datasets
di: Brandfonbrener, David, et al.
Pubblicazione: (2024)
di: Brandfonbrener, David, et al.
Pubblicazione: (2024)
How Does Critical Batch Size Scale in Pre-training?
di: Zhang, Hanlin, et al.
Pubblicazione: (2024)
di: Zhang, Hanlin, et al.
Pubblicazione: (2024)
Anytime Pretraining: Horizon-Free Learning-Rate Schedules with Weight Averaging
di: Meterez, Alexandru, et al.
Pubblicazione: (2026)
di: Meterez, Alexandru, et al.
Pubblicazione: (2026)
Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling
di: Meterez, Alexandru, et al.
Pubblicazione: (2025)
di: Meterez, Alexandru, et al.
Pubblicazione: (2025)
A New Perspective on Shampoo's Preconditioner
di: Morwani, Depen, et al.
Pubblicazione: (2024)
di: Morwani, Depen, et al.
Pubblicazione: (2024)
Adam or Gauss-Newton? A Comparative Study In Terms of Basis Alignment and SGD Noise
di: Liu, Bingbin, et al.
Pubblicazione: (2025)
di: Liu, Bingbin, et al.
Pubblicazione: (2025)
Repeat After Me: Transformers are Better than State Space Models at Copying
di: Jelassi, Samy, et al.
Pubblicazione: (2024)
di: Jelassi, Samy, et al.
Pubblicazione: (2024)
CoLoR-Filter: Conditional Loss Reduction Filtering for Targeted Language Model Pre-training
di: Brandfonbrener, David, et al.
Pubblicazione: (2024)
di: Brandfonbrener, David, et al.
Pubblicazione: (2024)
Feature emergence via margin maximization: case studies in algebraic tasks
di: Morwani, Depen, et al.
Pubblicazione: (2023)
di: Morwani, Depen, et al.
Pubblicazione: (2023)
LOTION: Smoothing the Optimization Landscape for Quantized Training
di: Kwun, Mujin, et al.
Pubblicazione: (2025)
di: Kwun, Mujin, et al.
Pubblicazione: (2025)
The Role of Sparsity for Length Generalization in Transformers
di: Golowich, Noah, et al.
Pubblicazione: (2025)
di: Golowich, Noah, et al.
Pubblicazione: (2025)
The Recurrent Transformer: Greater Effective Depth and Efficient Decoding
di: Oncescu, Costin-Andrei, et al.
Pubblicazione: (2026)
di: Oncescu, Costin-Andrei, et al.
Pubblicazione: (2026)
Prescriptive Scaling Reveals the Evolution of Language Model Capabilities
di: Zhang, Hanlin, et al.
Pubblicazione: (2026)
di: Zhang, Hanlin, et al.
Pubblicazione: (2026)
A Simplified Analysis of SGD for Linear Regression with Weight Averaging
di: Meterez, Alexandru, et al.
Pubblicazione: (2025)
di: Meterez, Alexandru, et al.
Pubblicazione: (2025)
Discovering Hierarchical Latent Capabilities of Language Models via Causal Representation Learning
di: Jin, Jikai, et al.
Pubblicazione: (2025)
di: Jin, Jikai, et al.
Pubblicazione: (2025)
GQ-VAE: A gated quantized VAE for learning variable length tokens
di: Datta, Theo, et al.
Pubblicazione: (2025)
di: Datta, Theo, et al.
Pubblicazione: (2025)
Learning Hidden Markov Models Using Conditional Samples
di: Kakade, Sham M., et al.
Pubblicazione: (2023)
di: Kakade, Sham M., et al.
Pubblicazione: (2023)
Flash Inference: Near Linear Time Inference for Long Convolution Sequence Models and Beyond
di: Oncescu, Costin-Andrei, et al.
Pubblicazione: (2024)
di: Oncescu, Costin-Andrei, et al.
Pubblicazione: (2024)
Q-Probe: A Lightweight Approach to Reward Maximization for Language Models
di: Li, Kenneth, et al.
Pubblicazione: (2024)
di: Li, Kenneth, et al.
Pubblicazione: (2024)
What Makes a Good Diffusion Planner for Decision Making?
di: Lu, Haofei, et al.
Pubblicazione: (2025)
di: Lu, Haofei, et al.
Pubblicazione: (2025)
What Makes a Reward Model a Good Teacher? An Optimization Perspective
di: Razin, Noam, et al.
Pubblicazione: (2025)
di: Razin, Noam, et al.
Pubblicazione: (2025)
Universal Length Generalization with Turing Programs
di: Hou, Kaiying, et al.
Pubblicazione: (2024)
di: Hou, Kaiying, et al.
Pubblicazione: (2024)
Soup to go: mitigating forgetting during continual learning with model averaging
di: Kleiman, Anat, et al.
Pubblicazione: (2025)
di: Kleiman, Anat, et al.
Pubblicazione: (2025)
Mixture of Parrots: Experts improve memorization more than reasoning
di: Jelassi, Samy, et al.
Pubblicazione: (2024)
di: Jelassi, Samy, et al.
Pubblicazione: (2024)
Scaling Laws for Imitation Learning in Single-Agent Games
di: Tuyls, Jens, et al.
Pubblicazione: (2023)
di: Tuyls, Jens, et al.
Pubblicazione: (2023)
EvoLM: In Search of Lost Language Model Training Dynamics
di: Qi, Zhenting, et al.
Pubblicazione: (2025)
di: Qi, Zhenting, et al.
Pubblicazione: (2025)
Distinguishing the Knowable from the Unknowable with Language Models
di: Ahdritz, Gustaf, et al.
Pubblicazione: (2024)
di: Ahdritz, Gustaf, et al.
Pubblicazione: (2024)
What Makes a Good Curriculum? Disentangling the Effects of Data Ordering on LLM Mathematical Reasoning
di: Jia, Yaning, et al.
Pubblicazione: (2025)
di: Jia, Yaning, et al.
Pubblicazione: (2025)
Transcendence: Generative Models Can Outperform The Experts That Train Them
di: Zhang, Edwin, et al.
Pubblicazione: (2024)
di: Zhang, Edwin, et al.
Pubblicazione: (2024)
Follow My Instruction and Spill the Beans: Scalable Data Extraction from Retrieval-Augmented Generation Systems
di: Qi, Zhenting, et al.
Pubblicazione: (2024)
di: Qi, Zhenting, et al.
Pubblicazione: (2024)
Deconstructing Generative Diversity: An Information Bottleneck Analysis of Discrete Latent Generative Models
di: Wu, Yudi, et al.
Pubblicazione: (2025)
di: Wu, Yudi, et al.
Pubblicazione: (2025)
What Makes Quantization for Large Language Models Hard? An Empirical Study from the Lens of Perturbation
di: Gong, Zhuocheng, et al.
Pubblicazione: (2024)
di: Gong, Zhuocheng, et al.
Pubblicazione: (2024)
Scaling Laws in Linear Regression: Compute, Parameters, and Data
di: Lin, Licong, et al.
Pubblicazione: (2024)
di: Lin, Licong, et al.
Pubblicazione: (2024)
It Takes a Good Model to Train a Good Model: Generalized Gaussian Priors for Optimized LLMs
di: Wu, Jun, et al.
Pubblicazione: (2025)
di: Wu, Jun, et al.
Pubblicazione: (2025)
What Makes Reasoning Invalid: Echo Reflection Mitigation for Large Language Models
di: He, Chen, et al.
Pubblicazione: (2025)
di: He, Chen, et al.
Pubblicazione: (2025)
Occam's Razor for Self Supervised Learning: What is Sufficient to Learn Good Representations?
di: Ibrahim, Mark, et al.
Pubblicazione: (2024)
di: Ibrahim, Mark, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Connections between Schedule-Free Optimizers, AdEMAMix, and Accelerated SGD Variants
di: Morwani, Depen, et al.
Pubblicazione: (2025) -
The Potential of Second-Order Optimization for LLMs: A Study with Full Gauss-Newton
di: Abreu, Natalie, et al.
Pubblicazione: (2025) -
SOAP: Improving and Stabilizing Shampoo using Adam
di: Vyas, Nikhil, et al.
Pubblicazione: (2024) -
Beyond Implicit Bias: The Insignificance of SGD Noise in Online Learning
di: Vyas, Nikhil, et al.
Pubblicazione: (2023) -
Loss-to-Loss Prediction: Scaling Laws for All Datasets
di: Brandfonbrener, David, et al.
Pubblicazione: (2024)