Step by Step: Adaptive Gradient Descent for Training L-Lipschitz Neural Networks
Fuente:
arXiv
Salvato in:
| Autori principali: | Sung, Kyle, Khalil, Kholood, Forman, Noah, Samu, Steven, Kratsios, Anastasis |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Structure-Preserving Reconstruction of Convex Lipschitz Functionals on Hilbert Spaces from Finite Samples
di: Kratsios, Anastasis
Pubblicazione: (2026)
di: Kratsios, Anastasis
Pubblicazione: (2026)
Polynomial Scaling is Possible For Neural Operator Approximations of Structured Families of BSDEs
di: Furuya, Takashi, et al.
Pubblicazione: (2024)
di: Furuya, Takashi, et al.
Pubblicazione: (2024)
Revisiting the Initial Steps in Adaptive Gradient Descent Optimization
di: Abuduweili, Abulikemu, et al.
Pubblicazione: (2024)
di: Abuduweili, Abulikemu, et al.
Pubblicazione: (2024)
Adaptive Step Sizes for Preconditioned Stochastic Gradient Descent
di: Köhne, Frederik, et al.
Pubblicazione: (2023)
di: Köhne, Frederik, et al.
Pubblicazione: (2023)
Is In-Context Universality Enough? MLPs are Also Universal In-Context
di: Kratsios, Anastasis, et al.
Pubblicazione: (2025)
di: Kratsios, Anastasis, et al.
Pubblicazione: (2025)
Incremental Generation is Necessary and Sufficient for Universality in Flow-Based Modelling
di: Rouhvarzi, Hossein, et al.
Pubblicazione: (2025)
di: Rouhvarzi, Hossein, et al.
Pubblicazione: (2025)
Generative Neural Operators of Log-Complexity Can Simultaneously Solve Infinitely Many Convex Programs
di: Kratsios, Anastasis, et al.
Pubblicazione: (2025)
di: Kratsios, Anastasis, et al.
Pubblicazione: (2025)
Beyond Universal Approximation Theorems: Algorithmic Uniform Approximation by Neural Networks Trained with Noisy Data
di: Kratsios, Anastasis, et al.
Pubblicazione: (2025)
di: Kratsios, Anastasis, et al.
Pubblicazione: (2025)
Neural Snowflakes: Universal Latent Graph Inference via Trainable Latent Geometries
di: Borde, Haitz Sáez de Ocáriz, et al.
Pubblicazione: (2023)
di: Borde, Haitz Sáez de Ocáriz, et al.
Pubblicazione: (2023)
Quantifying The Limits of AI Reasoning: Systematic Neural Network Representations of Algorithms
di: Kratsios, Anastasis, et al.
Pubblicazione: (2025)
di: Kratsios, Anastasis, et al.
Pubblicazione: (2025)
Designing Universal Causal Deep Learning Models: The Case of Infinite-Dimensional Dynamical Systems from Stochastic Analysis
di: Galimberti, Luca, et al.
Pubblicazione: (2022)
di: Galimberti, Luca, et al.
Pubblicazione: (2022)
Bridging the Gap Between Approximation and Learning via Optimal Approximation by ReLU MLPs of Maximal Regularity
di: Hong, Ruiyang, et al.
Pubblicazione: (2024)
di: Hong, Ruiyang, et al.
Pubblicazione: (2024)
Scalable Message Passing Neural Networks: No Need for Attention in Large Graph Representation Learning
di: Borde, Haitz Sáez de Ocáriz, et al.
Pubblicazione: (2024)
di: Borde, Haitz Sáez de Ocáriz, et al.
Pubblicazione: (2024)
Approximation Rates in Besov Norms and Sample-Complexity of Kolmogorov-Arnold Networks with Residual Connections
di: Kratsios, Anastasis, et al.
Pubblicazione: (2025)
di: Kratsios, Anastasis, et al.
Pubblicazione: (2025)
Simultaneously Solving Infinitely Many LQ Mean Field Games In Hilbert Spaces: The Power of Neural Operators
di: Firoozi, Dena, et al.
Pubblicazione: (2025)
di: Firoozi, Dena, et al.
Pubblicazione: (2025)
Neural Operators Can Play Dynamic Stackelberg Games
di: Alvarez, Guillermo, et al.
Pubblicazione: (2024)
di: Alvarez, Guillermo, et al.
Pubblicazione: (2024)
Gradient Descent with Large Step Sizes: Chaos and Fractal Convergence Region
di: Liang, Shuang, et al.
Pubblicazione: (2025)
di: Liang, Shuang, et al.
Pubblicazione: (2025)
Provably Faster Gradient Descent via Long Steps
di: Grimmer, Benjamin
Pubblicazione: (2023)
di: Grimmer, Benjamin
Pubblicazione: (2023)
Feature Learning in Linear-Width Two-Layer Networks: Two vs. One Step of Gradient Descent
di: Moniri, Behrad, et al.
Pubblicazione: (2026)
di: Moniri, Behrad, et al.
Pubblicazione: (2026)
Adaptivity Under Realizability Constraints: Comparing In-Context and Agentic Learning
di: Kratsios, Anastasis, et al.
Pubblicazione: (2026)
di: Kratsios, Anastasis, et al.
Pubblicazione: (2026)
Certifiable Boolean Reasoning Is Universal
di: Li, Wenhao, et al.
Pubblicazione: (2026)
di: Li, Wenhao, et al.
Pubblicazione: (2026)
Characterizing Overfitting in Kernel Ridgeless Regression Through the Eigenspectrum
di: Cheng, Tin Sum, et al.
Pubblicazione: (2024)
di: Cheng, Tin Sum, et al.
Pubblicazione: (2024)
A Comprehensive Analysis on the Learning Curve in Kernel Ridge Regression
di: Cheng, Tin Sum, et al.
Pubblicazione: (2024)
di: Cheng, Tin Sum, et al.
Pubblicazione: (2024)
Effectiveness of Distributed Gradient Descent with Local Steps for Overparameterized Models
di: Zhu, Heng, et al.
Pubblicazione: (2024)
di: Zhu, Heng, et al.
Pubblicazione: (2024)
From Logistic Regression to the Perceptron Algorithm: Exploring Gradient Descent with Large Step Sizes
di: Tyurin, Alexander
Pubblicazione: (2024)
di: Tyurin, Alexander
Pubblicazione: (2024)
Statistical Guarantees for Reasoning Probes on Looped Boolean Circuits
di: Kratsios, Anastasis, et al.
Pubblicazione: (2026)
di: Kratsios, Anastasis, et al.
Pubblicazione: (2026)
Gradient Descent on Logistic Regression with Non-Separable Data and Large Step Sizes
di: Meng, Si Yi, et al.
Pubblicazione: (2024)
di: Meng, Si Yi, et al.
Pubblicazione: (2024)
One-Step Flow Policy Mirror Descent
di: Chen, Tianyi, et al.
Pubblicazione: (2025)
di: Chen, Tianyi, et al.
Pubblicazione: (2025)
Approximation and Gradient Descent Training with Neural Networks
di: Welper, G.
Pubblicazione: (2024)
di: Welper, G.
Pubblicazione: (2024)
A Survey on Hypergraph Neural Networks: An In-Depth and Step-By-Step Guide
di: Kim, Sunwoo, et al.
Pubblicazione: (2024)
di: Kim, Sunwoo, et al.
Pubblicazione: (2024)
Gradient Descent on Logistic Regression: Do Large Step-Sizes Work with Data on the Sphere?
di: Meng, Si Yi, et al.
Pubblicazione: (2025)
di: Meng, Si Yi, et al.
Pubblicazione: (2025)
Gradient Descent Robustly Learns the Intrinsic Dimension of Data in Training Convolutional Neural Networks
di: Zhang, Chenyang, et al.
Pubblicazione: (2025)
di: Zhang, Chenyang, et al.
Pubblicazione: (2025)
LoRA Fine-Tuning Without GPUs: A CPU-Efficient Meta-Generation Framework for LLMs
di: Arabpour, Reza, et al.
Pubblicazione: (2025)
di: Arabpour, Reza, et al.
Pubblicazione: (2025)
Neural Network Training via Stochastic Alternating Minimization with Trainable Step Sizes
di: Yan, Chengcheng, et al.
Pubblicazione: (2025)
di: Yan, Chengcheng, et al.
Pubblicazione: (2025)
One model to solve them all: 2BSDE families via neural operators
di: Furuya, Takashi, et al.
Pubblicazione: (2025)
di: Furuya, Takashi, et al.
Pubblicazione: (2025)
On the Lipschitz Constant of Deep Networks and Double Descent
di: Gamba, Matteo, et al.
Pubblicazione: (2023)
di: Gamba, Matteo, et al.
Pubblicazione: (2023)
Dual Natural Gradient Descent for Scalable Training of Physics-Informed Neural Networks
di: Jnini, Anas, et al.
Pubblicazione: (2025)
di: Jnini, Anas, et al.
Pubblicazione: (2025)
Stochastic Gradient Descent for Two-layer Neural Networks
di: Cao, Dinghao, et al.
Pubblicazione: (2024)
di: Cao, Dinghao, et al.
Pubblicazione: (2024)
Variational Stochastic Gradient Descent for Deep Neural Networks
di: Chen, Haotian, et al.
Pubblicazione: (2024)
di: Chen, Haotian, et al.
Pubblicazione: (2024)
Perturbed Iterate SGD for Lipschitz Continuous Loss Functions with Numerical Error and Adaptive Step Sizes
di: Metel, Michael R.
Pubblicazione: (2022)
di: Metel, Michael R.
Pubblicazione: (2022)
Documenti analoghi
-
Structure-Preserving Reconstruction of Convex Lipschitz Functionals on Hilbert Spaces from Finite Samples
di: Kratsios, Anastasis
Pubblicazione: (2026) -
Polynomial Scaling is Possible For Neural Operator Approximations of Structured Families of BSDEs
di: Furuya, Takashi, et al.
Pubblicazione: (2024) -
Revisiting the Initial Steps in Adaptive Gradient Descent Optimization
di: Abuduweili, Abulikemu, et al.
Pubblicazione: (2024) -
Adaptive Step Sizes for Preconditioned Stochastic Gradient Descent
di: Köhne, Frederik, et al.
Pubblicazione: (2023) -
Is In-Context Universality Enough? MLPs are Also Universal In-Context
di: Kratsios, Anastasis, et al.
Pubblicazione: (2025)