GNMR: Runtime Stability Control for Low-Precision Large Language Model Training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kong, Boao, Jia, Weichen, Zhang, Engao, Li, Guohong, Dong, Yonghan, Wang, Yao, Wang, Yaoyuan, Peng, Yunke, Yuan, Kun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BROS: Bias-Corrected Randomized Subspaces for Memory-Efficient Single-Loop Bilevel Optimization
par: Zhang, Hengrui, et autres
Publié: (2026)
par: Zhang, Hengrui, et autres
Publié: (2026)
On the Convergence of Stochastic Gradient Descent with Perturbed Forward-Backward Passes
par: Kong, Boao, et autres
Publié: (2026)
par: Kong, Boao, et autres
Publié: (2026)
SPARKLE: A Unified Single-Loop Primal-Dual Framework for Decentralized Bilevel Optimization
par: Zhu, Shuchen, et autres
Publié: (2024)
par: Zhu, Shuchen, et autres
Publié: (2024)
Decentralized Bilevel Optimization: A Perspective from Transient Iteration Complexity
par: Kong, Boao, et autres
Publié: (2024)
par: Kong, Boao, et autres
Publié: (2024)
Clapping: Removing Per-sample Storage for Pipeline Parallel Distributed Optimization with Communication Compression
par: Kong, Boao, et autres
Publié: (2025)
par: Kong, Boao, et autres
Publié: (2025)
Greedy Low-Rank Gradient Compression for Distributed Learning with Convergence Guarantees
par: Chen, Chuyan, et autres
Publié: (2025)
par: Chen, Chuyan, et autres
Publié: (2025)
Stabilizing Rate of Stochastic Control Systems
par: Jia, Hui, et autres
Publié: (2025)
par: Jia, Hui, et autres
Publié: (2025)
Compressing Large Language Models using Low Rank and Low Precision Decomposition
par: Saha, Rajarshi, et autres
Publié: (2024)
par: Saha, Rajarshi, et autres
Publié: (2024)
An Overview of Low-Rank Structures in the Training and Adaptation of Large Models
par: Balzano, Laura, et autres
Publié: (2025)
par: Balzano, Laura, et autres
Publié: (2025)
SUDA-Muon: Structural Design Principles and Boundaries for Fully Decentralized Muon
par: Zhang, Hengrui, et autres
Publié: (2026)
par: Zhang, Hengrui, et autres
Publié: (2026)
Learning to Control Stabilization in Column Generation
par: Wang, Olivia, et autres
Publié: (2026)
par: Wang, Olivia, et autres
Publié: (2026)
CR-Net: Scaling Parameter-Efficient Training with Cross-Layer Low-Rank Structure
par: Kong, Boao, et autres
Publié: (2025)
par: Kong, Boao, et autres
Publié: (2025)
Subspace Optimization for Large Language Models with Convergence Guarantees
par: He, Yutong, et autres
Publié: (2024)
par: He, Yutong, et autres
Publié: (2024)
Nonlinear Optimal Guidance for Impact Time Control with Field-of-View Constraint
par: Lu, Fangmin, et autres
Publié: (2025)
par: Lu, Fangmin, et autres
Publié: (2025)
GradPower: Powering Gradients for Faster Language Model Pre-Training
par: Wang, Jinbo, et autres
Publié: (2025)
par: Wang, Jinbo, et autres
Publié: (2025)
A Multi-scale Perimeter Control and Route Guidance System for Large-scale Road Networks
par: Peng, Xianyue, et autres
Publié: (2025)
par: Peng, Xianyue, et autres
Publié: (2025)
Safety on the Fly: Constructing Robust Safety Filters via Policy Control Barrier Functions at Runtime
par: Knoedler, Luzia, et autres
Publié: (2024)
par: Knoedler, Luzia, et autres
Publié: (2024)
Empirical Asymptotic Runtime Analysis of Linear Programming Algorithms
par: Rothberg, Edward
Publié: (2026)
par: Rothberg, Edward
Publié: (2026)
A Multi-objective Sequential Quadratic Programming Algorithm Based on Low-order Smooth Penalty Function
par: Kong, Zanyang
Publié: (2025)
par: Kong, Zanyang
Publié: (2025)
From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees
par: Xie, Shengping, et autres
Publié: (2025)
par: Xie, Shengping, et autres
Publié: (2025)
A Proximal DC Algorithm for Sample Average Approximation of Chance Constrained Programming
par: Wang, Peng, et autres
Publié: (2023)
par: Wang, Peng, et autres
Publié: (2023)
Boundary Stabilization for the Rayleigh Beam System under Event-triggered Controls
par: Wang, Siwen, et autres
Publié: (2026)
par: Wang, Siwen, et autres
Publié: (2026)
Optimal Complexity in Byzantine-Robust Distributed Stochastic Optimization with Data Heterogeneity
par: Shi, Qiankun, et autres
Publié: (2025)
par: Shi, Qiankun, et autres
Publié: (2025)
Initial Error Tolerant Distributed Mean Field Control under Partial and Discrete Information
par: Jin, Yuxin, et autres
Publié: (2025)
par: Jin, Yuxin, et autres
Publié: (2025)
Reinforcement Learning for Distributed Transient Frequency Control with Stability and Safety Guarantees
par: Yuan, Zhenyi, et autres
Publié: (2022)
par: Yuan, Zhenyi, et autres
Publié: (2022)
Frictionless Hamiltonian Descent and Coordinate Hamiltonian Descent for Strongly Convex Quadratic Problems
par: Wang, Jun-Kun
Publié: (2024)
par: Wang, Jun-Kun
Publié: (2024)
LoCo: Low-Bit Communication Adaptor for Large-scale Model Training
par: Xie, Xingyu, et autres
Publié: (2024)
par: Xie, Xingyu, et autres
Publié: (2024)
Stability, Contraction, and Controllers for Affine Systems
par: Wieringa, L. P., et autres
Publié: (2026)
par: Wieringa, L. P., et autres
Publié: (2026)
Exact Controllability and Stabilization of the Wave Equation
par: Zuazua, Enrique
Publié: (2024)
par: Zuazua, Enrique
Publié: (2024)
Stochastic Model Predictive Control for Sub-Gaussian Noise
par: Ao, Yunke, et autres
Publié: (2025)
par: Ao, Yunke, et autres
Publié: (2025)
Latent Representations for Control Design with Provable Stability and Safety Guarantees
par: Lutkus, Paul, et autres
Publié: (2025)
par: Lutkus, Paul, et autres
Publié: (2025)
A Precise Characterization of SGD Stability Using Loss Surface Geometry
par: Dexter, Gregory, et autres
Publié: (2024)
par: Dexter, Gregory, et autres
Publié: (2024)
Perturbation-Tolerant Structural Controllability for Linear Systems
par: Zhang, Yuan, et autres
Publié: (2021)
par: Zhang, Yuan, et autres
Publié: (2021)
Analysis of Stability and Performance of Economic Model Predictive Control with State-Independent Costs
par: Arastou, Alireza, et autres
Publié: (2026)
par: Arastou, Alireza, et autres
Publié: (2026)
On the Exponential Stability of Koopman Model Predictive Control
par: Shang, Xu, et autres
Publié: (2025)
par: Shang, Xu, et autres
Publié: (2025)
MARS: Unleashing the Power of Variance Reduction for Training Large Models
par: Yuan, Huizhuo, et autres
Publié: (2024)
par: Yuan, Huizhuo, et autres
Publié: (2024)
Set-based Optimal, Robust, and Resilient Control with Applications to Autonomous Precision Landing
par: Kamath, Abhinav G., et autres
Publié: (2025)
par: Kamath, Abhinav G., et autres
Publié: (2025)
Low-Order Explicit Hessian Imitation Method for Large-Scale Supervised Machine Learning
par: Zhu, Yunlang, et autres
Publié: (2026)
par: Zhu, Yunlang, et autres
Publié: (2026)
Mixed-Precision GPU Acceleration for Large-Scale Minimum Enclosing Ball Problems
par: Liang, Ling, et autres
Publié: (2026)
par: Liang, Ling, et autres
Publié: (2026)
Does Weight Decay Enhance Training Stability?
par: Saether, Marius, et autres
Publié: (2026)
par: Saether, Marius, et autres
Publié: (2026)
Documents similaires
-
BROS: Bias-Corrected Randomized Subspaces for Memory-Efficient Single-Loop Bilevel Optimization
par: Zhang, Hengrui, et autres
Publié: (2026) -
On the Convergence of Stochastic Gradient Descent with Perturbed Forward-Backward Passes
par: Kong, Boao, et autres
Publié: (2026) -
SPARKLE: A Unified Single-Loop Primal-Dual Framework for Decentralized Bilevel Optimization
par: Zhu, Shuchen, et autres
Publié: (2024) -
Decentralized Bilevel Optimization: A Perspective from Transient Iteration Complexity
par: Kong, Boao, et autres
Publié: (2024) -
Clapping: Removing Per-sample Storage for Pipeline Parallel Distributed Optimization with Communication Compression
par: Kong, Boao, et autres
Publié: (2025)