Enregistré dans:
| Auteurs principaux: | Kravatskiy, Alexey, Kozyrev, Ivan, Kozlov, Nikolai, Vinogradov, Alexander, Merkulov, Daniil, Oseledets, Ivan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2512.09678 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ImprovEvolve: Ask AlphaEvolve to Improve the Input Solution and Then Improvise
par: Kravatskiy, Alexey, et autres
Publié: (2026)
par: Kravatskiy, Alexey, et autres
Publié: (2026)
Another approach to build Lyapunov functions for the first order methods in the quadratic case
par: Merkulov, Daniil, et autres
Publié: (2023)
par: Merkulov, Daniil, et autres
Publié: (2023)
Gradient Clipping Beyond Vector Norms: A Spectral Approach for Matrix-Valued Parameters
par: Yukhimchuk, Alexander, et autres
Publié: (2026)
par: Yukhimchuk, Alexander, et autres
Publié: (2026)
Decoupled Weight Decay for Any $p$ Norm
par: Outmezguine, Nadav Joseph, et autres
Publié: (2024)
par: Outmezguine, Nadav Joseph, et autres
Publié: (2024)
PowerStep: Memory-Efficient Adaptive Optimization via $\ell_p$-Norm Steepest Descent
par: Lu, Yao, et autres
Publié: (2026)
par: Lu, Yao, et autres
Publié: (2026)
Black-Box Approximation and Optimization with Hierarchical Tucker Decomposition
par: Ryzhakov, Gleb, et autres
Publié: (2024)
par: Ryzhakov, Gleb, et autres
Publié: (2024)
Old Optimizer, New Norm: An Anthology
par: Bernstein, Jeremy, et autres
Publié: (2024)
par: Bernstein, Jeremy, et autres
Publié: (2024)
Clipping Improves Adam-Norm and AdaGrad-Norm when the Noise Is Heavy-Tailed
par: Chezhegov, Savelii, et autres
Publié: (2024)
par: Chezhegov, Savelii, et autres
Publié: (2024)
ARO: A New Lens On Matrix Optimization For Large Models
par: Gong, Wenbo, et autres
Publié: (2026)
par: Gong, Wenbo, et autres
Publié: (2026)
Muon Optimizes Under Spectral Norm Constraints
par: Chen, Lizhang, et autres
Publié: (2025)
par: Chen, Lizhang, et autres
Publié: (2025)
DualSchool: How Reliable are LLMs for Optimization Education?
par: Klamkin, Michael, et autres
Publié: (2025)
par: Klamkin, Michael, et autres
Publié: (2025)
Small Gradient Norm Regret for Online Convex Optimization
par: Gao, Wenzhi, et autres
Publié: (2026)
par: Gao, Wenzhi, et autres
Publié: (2026)
Self-Certifying Primal-Dual Optimization Proxies for Large-Scale Batch Economic Dispatch
par: Klamkin, Michael, et autres
Publié: (2025)
par: Klamkin, Michael, et autres
Publié: (2025)
Beyond Minimax Rates in Group Distributionally Robust Optimization via a Novel Notion of Sparsity
par: Nguyen, Quan, et autres
Publié: (2024)
par: Nguyen, Quan, et autres
Publié: (2024)
Stability of Primal-Dual Gradient Flow Dynamics for Multi-Block Convex Optimization Problems
par: Ozaslan, Ibrahim K., et autres
Publié: (2024)
par: Ozaslan, Ibrahim K., et autres
Publié: (2024)
Hierarchical Mixture-of-Experts with Two-Stage Optimization
par: Molodtsov, Gleb, et autres
Publié: (2026)
par: Molodtsov, Gleb, et autres
Publié: (2026)
Implicit Bias of AdamW: $\ell_\infty$ Norm Constrained Optimization
par: Xie, Shuo, et autres
Publié: (2024)
par: Xie, Shuo, et autres
Publié: (2024)
$γ$-weakly $θ$-up-concavity: A Unified Framework for Non-Convex Optimization Beyond DR-Submodular and OSS Functions
par: Pedramfar, Mohammad, et autres
Publié: (2026)
par: Pedramfar, Mohammad, et autres
Publié: (2026)
DeMuon: A Decentralized Muon for Matrix Optimization over Graphs
par: He, Chuan, et autres
Publié: (2025)
par: He, Chuan, et autres
Publié: (2025)
On the Width Scaling of Neural Optimizers Under Matrix Operator Norms I: Row/Column Normalization and Hyperparameter Transfer
par: Xu, Ruihan, et autres
Publié: (2026)
par: Xu, Ruihan, et autres
Publié: (2026)
From Optimization to Prediction: Transformer-Based Path-Flow Estimation to the Traffic Assignment Problem
par: Ameli, Mostafa, et autres
Publié: (2025)
par: Ameli, Mostafa, et autres
Publié: (2025)
Combining Reinforcement Learning and Optimal Transport for the Traveling Salesman Problem
par: Goh, Yong Liang, et autres
Publié: (2022)
par: Goh, Yong Liang, et autres
Publié: (2022)
Scale-Invariant Neural Network Optimization: Norm Geometry and Heavy-Tailed Noise
par: Zhang, Jiayu, et autres
Publié: (2026)
par: Zhang, Jiayu, et autres
Publié: (2026)
Global Convergence of Multiplicative Updates for the Matrix Mechanism: A Collaborative Proof with Gemini 3
par: Rush, Keith
Publié: (2026)
par: Rush, Keith
Publié: (2026)
Nonnegative Matrix Factorization in the Component-Wise L1 Norm for Sparse Data
par: Seraghiti, Giovanni, et autres
Publié: (2026)
par: Seraghiti, Giovanni, et autres
Publié: (2026)
Federated Majorize-Minimization: Beyond Parameter Aggregation
par: Dieuleveut, Aymeric, et autres
Publié: (2025)
par: Dieuleveut, Aymeric, et autres
Publié: (2025)
Beyond Expectations: Learning with Stochastic Dominance Made Practical
par: Cen, Shicong, et autres
Publié: (2024)
par: Cen, Shicong, et autres
Publié: (2024)
Adaptive Primal-Dual Method for Safe Reinforcement Learning
par: Chen, Weiqin, et autres
Publié: (2024)
par: Chen, Weiqin, et autres
Publié: (2024)
Exact Dual Geometry of SOC-ICNN Value Functions
par: Liu, Kang, et autres
Publié: (2026)
par: Liu, Kang, et autres
Publié: (2026)
Primal-Dual Spectral Representation for Off-policy Evaluation
par: Hu, Yang, et autres
Publié: (2024)
par: Hu, Yang, et autres
Publié: (2024)
Where Does Warm-Up Come From? Adaptive Scheduling for Norm-Constrained Optimizers
par: Riabinin, Artem, et autres
Publié: (2026)
par: Riabinin, Artem, et autres
Publié: (2026)
Universal Architectures for the Learning of Polyhedral Norms and Convex Regularizers
par: Unser, Michael, et autres
Publié: (2025)
par: Unser, Michael, et autres
Publié: (2025)
Training Deep Learning Models with Norm-Constrained LMOs
par: Pethick, Thomas, et autres
Publié: (2025)
par: Pethick, Thomas, et autres
Publié: (2025)
Optimizing the Optimizer for Physics-Informed Neural Networks and Kolmogorov-Arnold Networks
par: Kiyani, Elham, et autres
Publié: (2025)
par: Kiyani, Elham, et autres
Publié: (2025)
The Newton-Muon Optimizer
par: Du, Zhehang, et autres
Publié: (2026)
par: Du, Zhehang, et autres
Publié: (2026)
Riemannian Bilevel Optimization
par: Dutta, Sanchayan, et autres
Publié: (2024)
par: Dutta, Sanchayan, et autres
Publié: (2024)
Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less
par: Liu, Yuxing, et autres
Publié: (2026)
par: Liu, Yuxing, et autres
Publié: (2026)
MetaOptimize: A Framework for Optimizing Step Sizes and Other Meta-parameters
par: Sharifnassab, Arsalan, et autres
Publié: (2024)
par: Sharifnassab, Arsalan, et autres
Publié: (2024)
Data Uniformity Improves Training Efficiency and More, with a Convergence Framework Beyond the NTK Regime
par: Wang, Yuqing, et autres
Publié: (2025)
par: Wang, Yuqing, et autres
Publié: (2025)
WARP: A Benchmark for Primal-Dual Warm-Starting of Interior-Point Solvers
par: Suri, Dhruv, et autres
Publié: (2026)
par: Suri, Dhruv, et autres
Publié: (2026)
Documents similaires
-
ImprovEvolve: Ask AlphaEvolve to Improve the Input Solution and Then Improvise
par: Kravatskiy, Alexey, et autres
Publié: (2026) -
Another approach to build Lyapunov functions for the first order methods in the quadratic case
par: Merkulov, Daniil, et autres
Publié: (2023) -
Gradient Clipping Beyond Vector Norms: A Spectral Approach for Matrix-Valued Parameters
par: Yukhimchuk, Alexander, et autres
Publié: (2026) -
Decoupled Weight Decay for Any $p$ Norm
par: Outmezguine, Nadav Joseph, et autres
Publié: (2024) -
PowerStep: Memory-Efficient Adaptive Optimization via $\ell_p$-Norm Steepest Descent
par: Lu, Yao, et autres
Publié: (2026)