AdaPM: a Partial Momentum Algorithm for LLM Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Yimu, Liu, Yuanshi, Fang, Cong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PRAC: Principal-Random Subspace for LLM Activation Compression and Memory-Efficient Training
di: Li, Yanyi, et al.
Pubblicazione: (2026)
di: Li, Yanyi, et al.
Pubblicazione: (2026)
Optimal Algorithms in Linear Regression under Covariate Shift: On the Importance of Precondition
di: Liu, Yuanshi, et al.
Pubblicazione: (2025)
di: Liu, Yuanshi, et al.
Pubblicazione: (2025)
Learning Curves of Stochastic Gradient Descent in Kernel Regression
di: Zhang, Haihan, et al.
Pubblicazione: (2025)
di: Zhang, Haihan, et al.
Pubblicazione: (2025)
The Optimality of (Accelerated) SGD for High-Dimensional Quadratic Optimization
di: Zhang, Haihan, et al.
Pubblicazione: (2024)
di: Zhang, Haihan, et al.
Pubblicazione: (2024)
Pretext Training Algorithms for Event Sequence Data
di: Wang, Yimu, et al.
Pubblicazione: (2024)
di: Wang, Yimu, et al.
Pubblicazione: (2024)
Distributed Sign Momentum with Local Steps for Training Transformers
di: Yu, Shuhua, et al.
Pubblicazione: (2024)
di: Yu, Shuhua, et al.
Pubblicazione: (2024)
Partial Feedback Online Learning
di: Shao, Shihao, et al.
Pubblicazione: (2026)
di: Shao, Shihao, et al.
Pubblicazione: (2026)
SPAM: Spike-Aware Adam with Momentum Reset for Stable LLM Training
di: Huang, Tianjin, et al.
Pubblicazione: (2025)
di: Huang, Tianjin, et al.
Pubblicazione: (2025)
GAdaBoost: An Efficient and Robust AdaBoost Algorithm Based on Granular-Ball Structure
di: Xie, Qin, et al.
Pubblicazione: (2025)
di: Xie, Qin, et al.
Pubblicazione: (2025)
FedMomentum: Preserving LoRA Training Momentum in Federated Fine-Tuning
di: Yan, Peishen, et al.
Pubblicazione: (2026)
di: Yan, Peishen, et al.
Pubblicazione: (2026)
AdaGC: Improving Training Stability for Large Language Model Pretraining
di: Wang, Guoxia, et al.
Pubblicazione: (2025)
di: Wang, Guoxia, et al.
Pubblicazione: (2025)
AdaGrad under Anisotropic Smoothness
di: Liu, Yuxing, et al.
Pubblicazione: (2024)
di: Liu, Yuxing, et al.
Pubblicazione: (2024)
Rapid Learning in Constrained Minimax Games with Negative Momentum
di: Fang, Zijian, et al.
Pubblicazione: (2024)
di: Fang, Zijian, et al.
Pubblicazione: (2024)
AdaQAT: Adaptive Bit-Width Quantization-Aware Training
di: Gernigon, Cédric, et al.
Pubblicazione: (2024)
di: Gernigon, Cédric, et al.
Pubblicazione: (2024)
AdaMuon: Adaptive Muon Optimizer
di: Si, Chongjie, et al.
Pubblicazione: (2025)
di: Si, Chongjie, et al.
Pubblicazione: (2025)
Bridging Training and Merging Through Momentum-Aware Optimization
di: Moayedikia, Alireza, et al.
Pubblicazione: (2025)
di: Moayedikia, Alireza, et al.
Pubblicazione: (2025)
Low-rank Momentum Factorization for Memory Efficient Training
di: Mahdavinia, Pouria, et al.
Pubblicazione: (2025)
di: Mahdavinia, Pouria, et al.
Pubblicazione: (2025)
SoftAdaClip: A Smooth Clipping Strategy for Fair and Private Model Training
di: Soleymani, Dorsa, et al.
Pubblicazione: (2025)
di: Soleymani, Dorsa, et al.
Pubblicazione: (2025)
AdaBet: Gradient-free Layer Selection for Efficient Training of Deep Neural Networks
di: Tenison, Irene, et al.
Pubblicazione: (2025)
di: Tenison, Irene, et al.
Pubblicazione: (2025)
AdaGrad-Diff: A New Version of the Adaptive Gradient Algorithm
di: Bojovic, Matia, et al.
Pubblicazione: (2026)
di: Bojovic, Matia, et al.
Pubblicazione: (2026)
AdaDPIGU: Differentially Private SGD with Adaptive Clipping and Importance-Based Gradient Updates for Deep Neural Networks
di: Zhang, Huiqi, et al.
Pubblicazione: (2025)
di: Zhang, Huiqi, et al.
Pubblicazione: (2025)
Shuffling Momentum Gradient Algorithm for Convex Optimization
di: Tran, Trang H., et al.
Pubblicazione: (2024)
di: Tran, Trang H., et al.
Pubblicazione: (2024)
Stochastic Gradient Descent with Momentum is Algorithmically Stable
di: Lei, Yunwen, et al.
Pubblicazione: (2026)
di: Lei, Yunwen, et al.
Pubblicazione: (2026)
Stochastic Normalized Gradient Descent with Momentum for Large-Batch Training
di: Zhao, Shen-Yi, et al.
Pubblicazione: (2020)
di: Zhao, Shen-Yi, et al.
Pubblicazione: (2020)
AdaHOP: Fast and Accurate Low-Precision Training via Outlier-Pattern-Aware Rotation
di: Kim, Seonggon, et al.
Pubblicazione: (2026)
di: Kim, Seonggon, et al.
Pubblicazione: (2026)
GeoAdaLer: Geometric Insights into Adaptive Stochastic Gradient Descent Algorithms
di: Eleh, Chinedu, et al.
Pubblicazione: (2024)
di: Eleh, Chinedu, et al.
Pubblicazione: (2024)
TiAda: A Time-scale Adaptive Algorithm for Nonconvex Minimax Optimization
di: Li, Xiang, et al.
Pubblicazione: (2022)
di: Li, Xiang, et al.
Pubblicazione: (2022)
AdamFLIP: Adaptive Momentum Feedback Linearization Optimization for Hard Constrained PINN Training
di: Lu, Binghang, et al.
Pubblicazione: (2026)
di: Lu, Binghang, et al.
Pubblicazione: (2026)
AdaGMLP: AdaBoosting GNN-to-MLP Knowledge Distillation
di: Lu, Weigang, et al.
Pubblicazione: (2024)
di: Lu, Weigang, et al.
Pubblicazione: (2024)
AdaFRUGAL: Adaptive Memory-Efficient Training with Dynamic Control
di: Bui, Quang-Hung, et al.
Pubblicazione: (2025)
di: Bui, Quang-Hung, et al.
Pubblicazione: (2025)
AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates
di: Zhang, Minxin, et al.
Pubblicazione: (2025)
di: Zhang, Minxin, et al.
Pubblicazione: (2025)
Relational Learning in Pre-Trained Models: A Theory from Hypergraph Recovery Perspective
di: Chen, Yang, et al.
Pubblicazione: (2024)
di: Chen, Yang, et al.
Pubblicazione: (2024)
Understanding the Effect of Noise in LLM Training Data with Algorithmic Chains of Thought
di: Havrilla, Alex, et al.
Pubblicazione: (2024)
di: Havrilla, Alex, et al.
Pubblicazione: (2024)
Realistic Evaluation of Deep Partial-Label Learning Algorithms
di: Wang, Wei, et al.
Pubblicazione: (2025)
di: Wang, Wei, et al.
Pubblicazione: (2025)
AdaRankGrad: Adaptive Gradient-Rank and Moments for Memory-Efficient LLMs Training and Fine-Tuning
di: Refael, Yehonathan, et al.
Pubblicazione: (2024)
di: Refael, Yehonathan, et al.
Pubblicazione: (2024)
R-Diverse: Mitigating Diversity Illusion in Self-Play LLM Training
di: Li, Gengsheng, et al.
Pubblicazione: (2026)
di: Li, Gengsheng, et al.
Pubblicazione: (2026)
AdaBlock-dLLM: Semantic-Aware Diffusion LLM Inference via Adaptive Block Size
di: Lu, Guanxi, et al.
Pubblicazione: (2025)
di: Lu, Guanxi, et al.
Pubblicazione: (2025)
AdaSwitch: An Adaptive Switching Meta-Algorithm for Learning-Augmented Bounded-Influence Problems
di: Chen, Xi, et al.
Pubblicazione: (2025)
di: Chen, Xi, et al.
Pubblicazione: (2025)
Adaptive Momentum and Nonlinear Damping for Neural Network Training
di: Karoni, Aikaterini, et al.
Pubblicazione: (2026)
di: Karoni, Aikaterini, et al.
Pubblicazione: (2026)
Delayed Momentum Aggregation: Communication-efficient Byzantine-robust Federated Learning with Partial Participation
di: Otsuka, Kaoru, et al.
Pubblicazione: (2025)
di: Otsuka, Kaoru, et al.
Pubblicazione: (2025)
Documenti analoghi
-
PRAC: Principal-Random Subspace for LLM Activation Compression and Memory-Efficient Training
di: Li, Yanyi, et al.
Pubblicazione: (2026) -
Optimal Algorithms in Linear Regression under Covariate Shift: On the Importance of Precondition
di: Liu, Yuanshi, et al.
Pubblicazione: (2025) -
Learning Curves of Stochastic Gradient Descent in Kernel Regression
di: Zhang, Haihan, et al.
Pubblicazione: (2025) -
The Optimality of (Accelerated) SGD for High-Dimensional Quadratic Optimization
di: Zhang, Haihan, et al.
Pubblicazione: (2024) -
Pretext Training Algorithms for Event Sequence Data
di: Wang, Yimu, et al.
Pubblicazione: (2024)