Beyond Cosine Decay: On the effectiveness of Infinite Learning Rate Schedule for Continual Pre-training
Fuente:
arXiv
Salvato in:
| Autori principali: | Singh, Vaibhav, Janson, Paul, Mehrbod, Paria, Ibrahim, Adam, Rish, Irina, Belilovsky, Eugene, Thérien, Benjamin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Simple and Scalable Strategies to Continually Pre-train Large Language Models
di: Ibrahim, Adam, et al.
Pubblicazione: (2024)
di: Ibrahim, Adam, et al.
Pubblicazione: (2024)
MuLoCo: Muon is a practical inner optimizer for DiLoCo
di: Thérien, Benjamin, et al.
Pubblicazione: (2025)
di: Thérien, Benjamin, et al.
Pubblicazione: (2025)
Communication Efficient LLM Pre-training with SparseLoCo
di: Sarfi, Amir, et al.
Pubblicazione: (2025)
di: Sarfi, Amir, et al.
Pubblicazione: (2025)
Warming Up for Zeroth-Order Federated Pre-Training with Low Resource Clients
di: Legate, Gwen, et al.
Pubblicazione: (2025)
di: Legate, Gwen, et al.
Pubblicazione: (2025)
Continual Pre-training of MoEs: How robust is your router?
di: Thérien, Benjamin, et al.
Pubblicazione: (2025)
di: Thérien, Benjamin, et al.
Pubblicazione: (2025)
$μ$LO: Compute-Efficient Meta-Generalization of Learned Optimizers
di: Thérien, Benjamin, et al.
Pubblicazione: (2024)
di: Thérien, Benjamin, et al.
Pubblicazione: (2024)
Test Time Adaptation Using Adaptive Quantile Recalibration
di: Mehrbod, Paria, et al.
Pubblicazione: (2025)
di: Mehrbod, Paria, et al.
Pubblicazione: (2025)
PyLO: Towards Accessible Learned Optimizers in PyTorch
di: Janson, Paul, et al.
Pubblicazione: (2025)
di: Janson, Paul, et al.
Pubblicazione: (2025)
Dual-Phase Continual Learning: Supervised Adaptation Meets Unsupervised Retention
di: Singh, Vaibhav, et al.
Pubblicazione: (2024)
di: Singh, Vaibhav, et al.
Pubblicazione: (2024)
Stabilizing Native Low-Rank LLM Pretraining
di: Janson, Paul, et al.
Pubblicazione: (2026)
di: Janson, Paul, et al.
Pubblicazione: (2026)
Towards motion from video diffusion models
di: Janson, Paul, et al.
Pubblicazione: (2024)
di: Janson, Paul, et al.
Pubblicazione: (2024)
Heterogeneous Low-Bandwidth Pre-Training of LLMs
di: Obeidi, Yazan, et al.
Pubblicazione: (2026)
di: Obeidi, Yazan, et al.
Pubblicazione: (2026)
Channel-Selective Normalization for Label-Shift Robust Test-Time Adaptation
di: Vianna, Pedro, et al.
Pubblicazione: (2024)
di: Vianna, Pedro, et al.
Pubblicazione: (2024)
Meta-learning Optimizers for Communication-Efficient Learning
di: Joseph, Charles-Étienne, et al.
Pubblicazione: (2023)
di: Joseph, Charles-Étienne, et al.
Pubblicazione: (2023)
When Data Falls Short: Grokking Below the Critical Threshold
di: Singh, Vaibhav, et al.
Pubblicazione: (2025)
di: Singh, Vaibhav, et al.
Pubblicazione: (2025)
Revisiting Replay and Gradient Alignment for Continual Pre-Training of Large Language Models
di: Abbes, Istabrak, et al.
Pubblicazione: (2025)
di: Abbes, Istabrak, et al.
Pubblicazione: (2025)
WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training
di: Tian, Changxin, et al.
Pubblicazione: (2025)
di: Tian, Changxin, et al.
Pubblicazione: (2025)
Covenant-72B: Pre-Training a 72B LLM with Trustless Peers Over-the-Internet
di: Lidin, Joel, et al.
Pubblicazione: (2026)
di: Lidin, Joel, et al.
Pubblicazione: (2026)
Model Parallelism With Subnetwork Data Parallelism
di: Singh, Vaibhav, et al.
Pubblicazione: (2025)
di: Singh, Vaibhav, et al.
Pubblicazione: (2025)
DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone
di: Singh, Vaibhav, et al.
Pubblicazione: (2025)
di: Singh, Vaibhav, et al.
Pubblicazione: (2025)
Understanding and Exploiting Weight Update Sparsity for Communication-Efficient Distributed RL
di: Miahi, Erfan, et al.
Pubblicazione: (2026)
di: Miahi, Erfan, et al.
Pubblicazione: (2026)
FairDropout: Using Example-Tied Dropout to Enhance Generalization of Minority Groups
di: Nanfack, Geraldin, et al.
Pubblicazione: (2025)
di: Nanfack, Geraldin, et al.
Pubblicazione: (2025)
Pre-training LLM without Learning Rate Decay Enhances Supervised Fine-Tuning
di: Yano, Kazuki, et al.
Pubblicazione: (2026)
di: Yano, Kazuki, et al.
Pubblicazione: (2026)
Celo2: Towards Learned Optimization Free Lunch
di: Moudgil, Abhinav, et al.
Pubblicazione: (2026)
di: Moudgil, Abhinav, et al.
Pubblicazione: (2026)
Model Breadcrumbs: Scaling Multi-Task Model Merging with Sparse Masks
di: Davari, MohammadReza, et al.
Pubblicazione: (2023)
di: Davari, MohammadReza, et al.
Pubblicazione: (2023)
Beyond Cosine Similarity
di: Ai, Xinbo
Pubblicazione: (2026)
di: Ai, Xinbo
Pubblicazione: (2026)
Optimal Linear Decay Learning Rate Schedules and Further Refinements
di: Defazio, Aaron, et al.
Pubblicazione: (2023)
di: Defazio, Aaron, et al.
Pubblicazione: (2023)
A Guide to Robust Generalization: The Impact of Architecture, Pre-training, and Optimization Strategy
di: Heuillet, Maxime, et al.
Pubblicazione: (2025)
di: Heuillet, Maxime, et al.
Pubblicazione: (2025)
From Feature Visualization to Visual Circuits: Effect of Adversarial Model Manipulation
di: Nanfack, Geraldin, et al.
Pubblicazione: (2024)
di: Nanfack, Geraldin, et al.
Pubblicazione: (2024)
Efficient Refusal Ablation in LLM through Optimal Transport
di: Nanfack, Geraldin, et al.
Pubblicazione: (2026)
di: Nanfack, Geraldin, et al.
Pubblicazione: (2026)
Celo: Training Versatile Learned Optimizers on a Compute Diet
di: Moudgil, Abhinav, et al.
Pubblicazione: (2025)
di: Moudgil, Abhinav, et al.
Pubblicazione: (2025)
Optimal Learning-Rate Schedules under Functional Scaling Laws: Power Decay and Warmup-Stable-Decay
di: Li, Binghui, et al.
Pubblicazione: (2026)
di: Li, Binghui, et al.
Pubblicazione: (2026)
Knowledge Distillation for Federated Learning: a Practical Guide
di: Mora, Alessio, et al.
Pubblicazione: (2022)
di: Mora, Alessio, et al.
Pubblicazione: (2022)
Neural Optimizer Equation, Decay Function, and Learning Rate Schedule Joint Evolution
di: Morgan, Brandon, et al.
Pubblicazione: (2024)
di: Morgan, Brandon, et al.
Pubblicazione: (2024)
Training Dynamics of the Cooldown Stage in Warmup-Stable-Decay Learning Rate Scheduler
di: Dremov, Aleksandr, et al.
Pubblicazione: (2025)
di: Dremov, Aleksandr, et al.
Pubblicazione: (2025)
Areas Between Cosines
di: Dombrowski, Muhammad Adam, et al.
Pubblicazione: (2024)
di: Dombrowski, Muhammad Adam, et al.
Pubblicazione: (2024)
Enabling Realtime Reinforcement Learning at Scale with Staggered Asynchronous Inference
di: Riemer, Matthew, et al.
Pubblicazione: (2024)
di: Riemer, Matthew, et al.
Pubblicazione: (2024)
Towards ethical multimodal systems
di: Roger, Alexis, et al.
Pubblicazione: (2023)
di: Roger, Alexis, et al.
Pubblicazione: (2023)
Not Only the Last-Layer Features for Spurious Correlations: All Layer Deep Feature Reweighting
di: Hameed, Humza Wajid, et al.
Pubblicazione: (2024)
di: Hameed, Humza Wajid, et al.
Pubblicazione: (2024)
Canadá y el sistema interamericano
di: Jean Philippe Thérien
Pubblicazione: (2004)
di: Jean Philippe Thérien
Pubblicazione: (2004)
Documenti analoghi
-
Simple and Scalable Strategies to Continually Pre-train Large Language Models
di: Ibrahim, Adam, et al.
Pubblicazione: (2024) -
MuLoCo: Muon is a practical inner optimizer for DiLoCo
di: Thérien, Benjamin, et al.
Pubblicazione: (2025) -
Communication Efficient LLM Pre-training with SparseLoCo
di: Sarfi, Amir, et al.
Pubblicazione: (2025) -
Warming Up for Zeroth-Order Federated Pre-Training with Low Resource Clients
di: Legate, Gwen, et al.
Pubblicazione: (2025) -
Continual Pre-training of MoEs: How robust is your router?
di: Thérien, Benjamin, et al.
Pubblicazione: (2025)