Guardado en:
| Autores principales: | Nguyen, Son, Liu, Bo, Chen, Lizhang, Liu, Qiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2502.07488 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Memory-Efficient Optimization with Factorized Hamiltonian Descent
por: Nguyen, Son, et al.
Publicado: (2024)
por: Nguyen, Son, et al.
Publicado: (2024)
Cautious Optimizers: Improving Training with One Line of Code
por: Liang, Kaizhao, et al.
Publicado: (2024)
por: Liang, Kaizhao, et al.
Publicado: (2024)
Lion Secretly Solves Constrained Optimization: As Lyapunov Predicts
por: Chen, Lizhang, et al.
Publicado: (2023)
por: Chen, Lizhang, et al.
Publicado: (2023)
Muon Optimizes Under Spectral Norm Constraints
por: Chen, Lizhang, et al.
Publicado: (2025)
por: Chen, Lizhang, et al.
Publicado: (2025)
Memory-Efficient LLM Training with Online Subspace Descent
por: Liang, Kaizhao, et al.
Publicado: (2024)
por: Liang, Kaizhao, et al.
Publicado: (2024)
DeMo: Decoupled Momentum Optimization
por: Peng, Bowen, et al.
Publicado: (2024)
por: Peng, Bowen, et al.
Publicado: (2024)
Training-Free Looped Transformers
por: Chen, Lizhang, et al.
Publicado: (2026)
por: Chen, Lizhang, et al.
Publicado: (2026)
Structured Preconditioners in Adaptive Optimization: A Unified Analysis
por: Xie, Shuo, et al.
Publicado: (2025)
por: Xie, Shuo, et al.
Publicado: (2025)
Adaptive Preconditioners Trigger Loss Spikes in Adam
por: Bai, Zhiwei, et al.
Publicado: (2025)
por: Bai, Zhiwei, et al.
Publicado: (2025)
Momentum Guidance: Plug-and-Play Guidance for Flow Models
por: Liao, Runlong, et al.
Publicado: (2026)
por: Liao, Runlong, et al.
Publicado: (2026)
Communication Efficient Distributed Training with Distributed Lion
por: Liu, Bo, et al.
Publicado: (2024)
por: Liu, Bo, et al.
Publicado: (2024)
Taming Preconditioner Drift: Unlocking the Potential of Second-Order Optimizers for Federated Learning on Non-IID Data
por: Liu, Junkang, et al.
Publicado: (2026)
por: Liu, Junkang, et al.
Publicado: (2026)
$ϕ$-Balancing for Mixture-of-Experts Training
por: Chen, Lizhang, et al.
Publicado: (2026)
por: Chen, Lizhang, et al.
Publicado: (2026)
AdaFlow: Imitation Learning with Variance-Adaptive Flow-Based Policies
por: Hu, Xixi, et al.
Publicado: (2024)
por: Hu, Xixi, et al.
Publicado: (2024)
Cautious Weight Decay
por: Chen, Lizhang, et al.
Publicado: (2025)
por: Chen, Lizhang, et al.
Publicado: (2025)
Muon$^2$: Boosting Muon via Adaptive Second-Moment Preconditioning
por: Liu, Ziyue, et al.
Publicado: (2026)
por: Liu, Ziyue, et al.
Publicado: (2026)
SAMix: Calibrated and Accurate Continual Learning via Sphere-Adaptive Mixup and Neural Collapse
por: Dang, Trung-Anh, et al.
Publicado: (2025)
por: Dang, Trung-Anh, et al.
Publicado: (2025)
Curvature-Informed SGD via General Purpose Lie-Group Preconditioners
por: Pooladzandi, Omead, et al.
Publicado: (2024)
por: Pooladzandi, Omead, et al.
Publicado: (2024)
CUPID in the Model Zoo: Online Matchmaking for Selecting Your Dream LLM
por: Nguyen, Son, et al.
Publicado: (2026)
por: Nguyen, Son, et al.
Publicado: (2026)
Diagonally-Weighted Generalized Method of Moments Estimation for Gaussian Mixture Modeling
por: Zhang, Liu, et al.
Publicado: (2025)
por: Zhang, Liu, et al.
Publicado: (2025)
Graph Neural Preconditioners for Iterative Solutions of Sparse Linear Systems
por: Chen, Jie
Publicado: (2024)
por: Chen, Jie
Publicado: (2024)
Learning Sparse Approximate Inverse Preconditioners for Conjugate Gradient Solvers on GPUs
por: Yang, Zherui, et al.
Publicado: (2025)
por: Yang, Zherui, et al.
Publicado: (2025)
A New Perspective on Shampoo's Preconditioner
por: Morwani, Depen, et al.
Publicado: (2024)
por: Morwani, Depen, et al.
Publicado: (2024)
Gaussian Processes Sampling with Sparse Grids under Additive Schwarz Preconditioner
por: Chen, Haoyuan, et al.
Publicado: (2024)
por: Chen, Haoyuan, et al.
Publicado: (2024)
Improving Probabilistic Diffusion Models With Optimal Diagonal Covariance Matching
por: Ou, Zijing, et al.
Publicado: (2024)
por: Ou, Zijing, et al.
Publicado: (2024)
Adam Improves Muon: Adaptive Moment Estimation with Orthogonalized Momentum
por: Zhang, Minxin, et al.
Publicado: (2026)
por: Zhang, Minxin, et al.
Publicado: (2026)
Regime-Adaptive Bayesian Optimization via Dirichlet Process Mixtures of Gaussian Processes
por: Zhang, Yan, et al.
Publicado: (2026)
por: Zhang, Yan, et al.
Publicado: (2026)
A Self-Attentive Meta-Optimizer with Group-Adaptive Learning Rates and Weight Decay
por: Zhao, JiangBo, et al.
Publicado: (2026)
por: Zhao, JiangBo, et al.
Publicado: (2026)
An Experimental Study of Semantic Continuity for Deep Learning Models
por: Wu, Shangxi, et al.
Publicado: (2020)
por: Wu, Shangxi, et al.
Publicado: (2020)
Adaptive Estimation and Inference in Conditional Moment Models via the Discrepancy Principle
por: Tan, Jiyuan, et al.
Publicado: (2026)
por: Tan, Jiyuan, et al.
Publicado: (2026)
Spectral Embeddings Leak Graph Topology: Theory, Benchmark, and Adaptive Reconstruction
por: Nguyen-Cong, Thinh, et al.
Publicado: (2026)
por: Nguyen-Cong, Thinh, et al.
Publicado: (2026)
Diagonal Adaptive Non-local Observables on Quantum Neural Networks
por: Tseng, Huan-Hsin, et al.
Publicado: (2026)
por: Tseng, Huan-Hsin, et al.
Publicado: (2026)
Optimization Insights into Deep Diagonal Linear Networks
por: Labarrière, Hippolyte, et al.
Publicado: (2024)
por: Labarrière, Hippolyte, et al.
Publicado: (2024)
Generative modeling of Sparse Approximate Inverse Preconditioners
por: Li, Mou, et al.
Publicado: (2024)
por: Li, Mou, et al.
Publicado: (2024)
Diagonal Over-parameterization in Reproducing Kernel Hilbert Spaces as an Adaptive Feature Model: Generalization and Adaptivity
por: Li, Yicheng, et al.
Publicado: (2025)
por: Li, Yicheng, et al.
Publicado: (2025)
Preconditioners for the Stochastic Training of Neural Fields
por: Chng, Shin-Fang, et al.
Publicado: (2024)
por: Chng, Shin-Fang, et al.
Publicado: (2024)
Improving Rectified Flow with Boundary Conditions
por: Hu, Xixi, et al.
Publicado: (2025)
por: Hu, Xixi, et al.
Publicado: (2025)
Improving Deep Knowledge Tracing via Gated Architectures and Adaptive Optimization
por: Shukurlu, Altun
Publicado: (2025)
por: Shukurlu, Altun
Publicado: (2025)
Adaptive Moment Estimation Optimization Algorithm Using Projection Gradient for Deep Learning
por: Li, Yongqi, et al.
Publicado: (2025)
por: Li, Yongqi, et al.
Publicado: (2025)
GADPN: Graph Adaptive Denoising and Perturbation Networks via Singular Value Decomposition
por: Deng, Hao, et al.
Publicado: (2026)
por: Deng, Hao, et al.
Publicado: (2026)
Ejemplares similares
-
Memory-Efficient Optimization with Factorized Hamiltonian Descent
por: Nguyen, Son, et al.
Publicado: (2024) -
Cautious Optimizers: Improving Training with One Line of Code
por: Liang, Kaizhao, et al.
Publicado: (2024) -
Lion Secretly Solves Constrained Optimization: As Lyapunov Predicts
por: Chen, Lizhang, et al.
Publicado: (2023) -
Muon Optimizes Under Spectral Norm Constraints
por: Chen, Lizhang, et al.
Publicado: (2025) -
Memory-Efficient LLM Training with Online Subspace Descent
por: Liang, Kaizhao, et al.
Publicado: (2024)