Optimization and Generalization Guarantees for Weight Normalization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cisneros-Velarde, Pedro, Chen, Zhijie, Koyejo, Sanmi, Banerjee, Arindam |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Optimization for Neural Operators can Benefit from Width
par: Cisneros-Velarde, Pedro, et autres
Publié: (2025)
par: Cisneros-Velarde, Pedro, et autres
Publié: (2025)
Quantization through Piecewise-Affine Regularization: Optimization and Statistical Guarantees
par: Ma, Jianhao, et autres
Publié: (2025)
par: Ma, Jianhao, et autres
Publié: (2025)
Stochastic Subgradient Methods with Guaranteed Global Stability in Nonsmooth Nonconvex Optimization
par: Xiao, Nachuan, et autres
Publié: (2023)
par: Xiao, Nachuan, et autres
Publié: (2023)
Global Convergence Guarantees for Federated Policy Gradient Methods with Adversaries
par: Ganesh, Swetha, et autres
Publié: (2024)
par: Ganesh, Swetha, et autres
Publié: (2024)
Federated Dynamical Low-Rank Training with Global Loss Convergence Guarantees
par: Schotthöfer, Steffen, et autres
Publié: (2024)
par: Schotthöfer, Steffen, et autres
Publié: (2024)
Optimal Control Operator Perspective and a Neural Adaptive Spectral Method
par: Feng, Mingquan, et autres
Publié: (2024)
par: Feng, Mingquan, et autres
Publié: (2024)
MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models
par: Huang, Feihu, et autres
Publié: (2026)
par: Huang, Feihu, et autres
Publié: (2026)
Stability of Transformers under Layer Normalization
par: Kan, Kelvin, et autres
Publié: (2025)
par: Kan, Kelvin, et autres
Publié: (2025)
A Retention-Centric Framework for Continual Learning with Guaranteed Model Developmental Safety
par: Li, Gang, et autres
Publié: (2024)
par: Li, Gang, et autres
Publié: (2024)
R2L: Reliable Reinforcement Learning: Guaranteed Return & Reliable Policies in Reinforcement Learning
par: Farhi, Nadir
Publié: (2025)
par: Farhi, Nadir
Publié: (2025)
On the Condition Number Dependency in Bilevel Optimization
par: Chen, Lesi, et autres
Publié: (2025)
par: Chen, Lesi, et autres
Publié: (2025)
Parameter-Efficient Distributional RL via Normalizing Flows and a Geometry-Aware Cramér Surrogate
par: C., Simo Alami, et autres
Publié: (2025)
par: C., Simo Alami, et autres
Publié: (2025)
Unsupervised Training of Diffusion Models for Feasible Solution Generation in Neural Combinatorial Optimization
par: Hong, Seong-Hyun, et autres
Publié: (2024)
par: Hong, Seong-Hyun, et autres
Publié: (2024)
Multi-CALF: A Policy Combination Approach with Statistical Guarantees
par: Malaniya, Georgiy, et autres
Publié: (2025)
par: Malaniya, Georgiy, et autres
Publié: (2025)
Personalized Multi-tier Federated Learning
par: Banerjee, Sourasekhar, et autres
Publié: (2024)
par: Banerjee, Sourasekhar, et autres
Publié: (2024)
Anytime Pretraining: Horizon-Free Learning-Rate Schedules with Weight Averaging
par: Meterez, Alexandru, et autres
Publié: (2026)
par: Meterez, Alexandru, et autres
Publié: (2026)
Weighted Low-rank Approximation via Stochastic Gradient Descent on Manifolds
par: Xu, Conglong, et autres
Publié: (2025)
par: Xu, Conglong, et autres
Publié: (2025)
Time-Varying Optimization for Streaming Data Via Temporal Weighting
par: Abrar, Muhammad Faraz Ul, et autres
Publié: (2025)
par: Abrar, Muhammad Faraz Ul, et autres
Publié: (2025)
The Utility and Complexity of in- and out-of-Distribution Machine Unlearning
par: Allouah, Youssef, et autres
Publié: (2024)
par: Allouah, Youssef, et autres
Publié: (2024)
Recursive Entropic Risk Optimization in Discounted MDPs: Sample Complexity Bounds with a Generative Model
par: Mortensen, Oliver, et autres
Publié: (2025)
par: Mortensen, Oliver, et autres
Publié: (2025)
Adaptively Robust LLM Inference Optimization under Prediction Uncertainty
par: Chen, Zixi, et autres
Publié: (2025)
par: Chen, Zixi, et autres
Publié: (2025)
On Finding Small Hyper-Gradients in Bilevel Optimization: Hardness Results and Improved Analysis
par: Chen, Lesi, et autres
Publié: (2023)
par: Chen, Lesi, et autres
Publié: (2023)
Constructing Industrial-Scale Optimization Modeling Benchmark
par: Li, Zhong, et autres
Publié: (2026)
par: Li, Zhong, et autres
Publié: (2026)
Optimizing the Optimizer for Physics-Informed Neural Networks and Kolmogorov-Arnold Networks
par: Kiyani, Elham, et autres
Publié: (2025)
par: Kiyani, Elham, et autres
Publié: (2025)
Scalable Data-Driven Reachability Analysis and Control via Koopman Operators with Conformal Coverage Guarantees
par: Nath, Devesh, et autres
Publié: (2026)
par: Nath, Devesh, et autres
Publié: (2026)
Riemannian Bilevel Optimization
par: Dutta, Sanchayan, et autres
Publié: (2024)
par: Dutta, Sanchayan, et autres
Publié: (2024)
The Newton-Muon Optimizer
par: Du, Zhehang, et autres
Publié: (2026)
par: Du, Zhehang, et autres
Publié: (2026)
Benchmarking PtO and PnO Methods in the Predictive Combinatorial Optimization Regime
par: Geng, Haoyu, et autres
Publié: (2023)
par: Geng, Haoyu, et autres
Publié: (2023)
A Safe Screening Rule with Bi-level Optimization of $ν$ Support Vector Machine
par: Yang, Zhiji, et autres
Publié: (2024)
par: Yang, Zhiji, et autres
Publié: (2024)
MetaOptimize: A Framework for Optimizing Step Sizes and Other Meta-parameters
par: Sharifnassab, Arsalan, et autres
Publié: (2024)
par: Sharifnassab, Arsalan, et autres
Publié: (2024)
Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less
par: Liu, Yuxing, et autres
Publié: (2026)
par: Liu, Yuxing, et autres
Publié: (2026)
From Large Language Models and Optimization to Decision Optimization CoPilot: A Research Manifesto
par: Wasserkrug, Segev, et autres
Publié: (2024)
par: Wasserkrug, Segev, et autres
Publié: (2024)
Transformers Provably Learn Chain-of-Thought Reasoning with Length Generalization
par: Huang, Yu, et autres
Publié: (2025)
par: Huang, Yu, et autres
Publié: (2025)
Jacobian Descent for Multi-Objective Optimization
par: Quinton, Pierre, et autres
Publié: (2024)
par: Quinton, Pierre, et autres
Publié: (2024)
Neural Solver Selection for Combinatorial Optimization
par: Gao, Chengrui, et autres
Publié: (2024)
par: Gao, Chengrui, et autres
Publié: (2024)
Dynamic Memory Based Adaptive Optimization
par: Szegedy, Balázs, et autres
Publié: (2024)
par: Szegedy, Balázs, et autres
Publié: (2024)
Budget-aware Auto Optimizer Configurator
par: Liu, Kang, et autres
Publié: (2026)
par: Liu, Kang, et autres
Publié: (2026)
Client-Centric Federated Adaptive Optimization
par: Sun, Jianhui, et autres
Publié: (2025)
par: Sun, Jianhui, et autres
Publié: (2025)
Understanding Optimization in Deep Learning with Central Flows
par: Cohen, Jeremy M., et autres
Publié: (2024)
par: Cohen, Jeremy M., et autres
Publié: (2024)
Bayesian Optimization for Hyperparameters Tuning in Neural Networks
par: Onorato, Gabriele
Publié: (2024)
par: Onorato, Gabriele
Publié: (2024)
Documents similaires
-
Optimization for Neural Operators can Benefit from Width
par: Cisneros-Velarde, Pedro, et autres
Publié: (2025) -
Quantization through Piecewise-Affine Regularization: Optimization and Statistical Guarantees
par: Ma, Jianhao, et autres
Publié: (2025) -
Stochastic Subgradient Methods with Guaranteed Global Stability in Nonsmooth Nonconvex Optimization
par: Xiao, Nachuan, et autres
Publié: (2023) -
Global Convergence Guarantees for Federated Policy Gradient Methods with Adversaries
par: Ganesh, Swetha, et autres
Publié: (2024) -
Federated Dynamical Low-Rank Training with Global Loss Convergence Guarantees
par: Schotthöfer, Steffen, et autres
Publié: (2024)