Salvato in:
| Autori principali: | Nitanda, Atsushi, Kikuchi, Ryuhei, Maeda, Shugo, Wu, Denny |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2302.09376 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Uniform convergence of the smooth calibration error and its relationship with functional gradient
di: Futami, Futoshi, et al.
Pubblicazione: (2025)
di: Futami, Futoshi, et al.
Pubblicazione: (2025)
Improved Particle Approximation Error for Mean Field Neural Networks
di: Nitanda, Atsushi
Pubblicazione: (2024)
di: Nitanda, Atsushi
Pubblicazione: (2024)
Statistical Analysis of the Sinkhorn Iterations for Two-Sample Schrödinger Bridge Estimation
di: Maeda, Ibuki, et al.
Pubblicazione: (2025)
di: Maeda, Ibuki, et al.
Pubblicazione: (2025)
Alternating Diffusion for Proximal Sampling with Zeroth Order Queries
di: Takagi, Hirohane, et al.
Pubblicazione: (2026)
di: Takagi, Hirohane, et al.
Pubblicazione: (2026)
How Does Preconditioning Guide Feature Learning in Deep Neural Networks?
di: Yoshida, Kotaro, et al.
Pubblicazione: (2025)
di: Yoshida, Kotaro, et al.
Pubblicazione: (2025)
Mirror Descent Policy Optimisation for Robust Constrained Markov Decision Processes
di: Bossens, David M., et al.
Pubblicazione: (2025)
di: Bossens, David M., et al.
Pubblicazione: (2025)
Emergence and scaling laws in SGD learning of shallow neural networks
di: Ren, Yunwei, et al.
Pubblicazione: (2025)
di: Ren, Yunwei, et al.
Pubblicazione: (2025)
Towards a Unified Analysis of Neural Networks in Nonparametric Instrumental Variable Regression: Optimization and Generalization
di: Chen, Zonghao, et al.
Pubblicazione: (2025)
di: Chen, Zonghao, et al.
Pubblicazione: (2025)
Direct Distributional Optimization for Provable Alignment of Diffusion Models
di: Kawata, Ryotaro, et al.
Pubblicazione: (2025)
di: Kawata, Ryotaro, et al.
Pubblicazione: (2025)
Slowly Annealed Langevin Dynamics: Theory and Applications to Training-Free Guided Generation
di: Nitanda, Atsushi, et al.
Pubblicazione: (2026)
di: Nitanda, Atsushi, et al.
Pubblicazione: (2026)
Neural network learns low-dimensional polynomials with SGD near the information-theoretic limit
di: Lee, Jason D., et al.
Pubblicazione: (2024)
di: Lee, Jason D., et al.
Pubblicazione: (2024)
Intrinsic Wasserstein Rates for Score-Based Generative Models on Smooth Manifolds
di: Fu, Guoji, et al.
Pubblicazione: (2026)
di: Fu, Guoji, et al.
Pubblicazione: (2026)
Learning quadratic neural networks in high dimensions: SGD dynamics and scaling laws
di: Arous, Gérard Ben, et al.
Pubblicazione: (2025)
di: Arous, Gérard Ben, et al.
Pubblicazione: (2025)
Why pre-training is beneficial for downstream classification tasks?
di: Jiang, Xin, et al.
Pubblicazione: (2024)
di: Jiang, Xin, et al.
Pubblicazione: (2024)
Koopman-based generalization bound: New aspect for full-rank weights
di: Hashimoto, Yuka, et al.
Pubblicazione: (2023)
di: Hashimoto, Yuka, et al.
Pubblicazione: (2023)
Full-Batch Gradient Descent Outperforms One-Pass SGD: Sample Complexity Separation in Single-Index Learning
di: Kovačević, Filip, et al.
Pubblicazione: (2026)
di: Kovačević, Filip, et al.
Pubblicazione: (2026)
Propagation of Chaos for Mean-Field Langevin Dynamics and its Application to Model Ensemble
di: Nitanda, Atsushi, et al.
Pubblicazione: (2025)
di: Nitanda, Atsushi, et al.
Pubblicazione: (2025)
SGD method for entropy error function with smoothing l0 regularization for neural networks
di: Nguyen, Trong-Tuan, et al.
Pubblicazione: (2024)
di: Nguyen, Trong-Tuan, et al.
Pubblicazione: (2024)
Provably Transformers Harness Multi-Concept Word Semantics for Efficient In-Context Learning
di: Bu, Dake, et al.
Pubblicazione: (2024)
di: Bu, Dake, et al.
Pubblicazione: (2024)
Provable Benefit of Curriculum in Transformer Tree-Reasoning Post-Training
di: Bu, Dake, et al.
Pubblicazione: (2025)
di: Bu, Dake, et al.
Pubblicazione: (2025)
DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Diffusion Language Models
di: Bu, Dake, et al.
Pubblicazione: (2026)
di: Bu, Dake, et al.
Pubblicazione: (2026)
Provable In-Context Vector Arithmetic via Retrieving Task Concepts
di: Bu, Dake, et al.
Pubblicazione: (2025)
di: Bu, Dake, et al.
Pubblicazione: (2025)
From Coupled Oscillators to Graph Neural Networks: Reducing Over-smoothing via a Kuramoto Model-based Approach
di: Nguyen, Tuan, et al.
Pubblicazione: (2023)
di: Nguyen, Tuan, et al.
Pubblicazione: (2023)
Stochastic Collapse: How Gradient Noise Attracts SGD Dynamics Towards Simpler Subnetworks
di: Chen, Feng, et al.
Pubblicazione: (2023)
di: Chen, Feng, et al.
Pubblicazione: (2023)
When and Why SignSGD Outperforms SGD: A Theoretical Study Based on $\ell_1$-norm Lower Bounds
di: Tao, Hongyi, et al.
Pubblicazione: (2026)
di: Tao, Hongyi, et al.
Pubblicazione: (2026)
Why Adam Can Beat SGD: Second-Moment Normalization Yields Sharper Tails
di: Jin, Ruinan, et al.
Pubblicazione: (2026)
di: Jin, Ruinan, et al.
Pubblicazione: (2026)
Post-Training as Reweighting: A Stochastic View of Reasoning Trajectories in Language Models
di: Bu, Dake, et al.
Pubblicazione: (2025)
di: Bu, Dake, et al.
Pubblicazione: (2025)
High-dimensional scaling limits and fluctuations of online least-squares SGD with smooth covariance
di: Balasubramanian, Krishnakumar, et al.
Pubblicazione: (2023)
di: Balasubramanian, Krishnakumar, et al.
Pubblicazione: (2023)
Small Batch Size Training for Language Models: When Vanilla SGD Works, and Why Gradient Accumulation Is Wasteful
di: Marek, Martin, et al.
Pubblicazione: (2025)
di: Marek, Martin, et al.
Pubblicazione: (2025)
Accelerated zero-order SGD under high-order smoothness and overparameterized regime
di: Bychkov, Georgii, et al.
Pubblicazione: (2024)
di: Bychkov, Georgii, et al.
Pubblicazione: (2024)
Demystifying Why Local Aggregation Helps: Convergence Analysis of Hierarchical SGD
di: Wang, Jiayi, et al.
Pubblicazione: (2020)
di: Wang, Jiayi, et al.
Pubblicazione: (2020)
Propagation of Chaos in One-hidden-layer Neural Networks beyond Logarithmic Time
di: Glasgow, Margalit, et al.
Pubblicazione: (2025)
di: Glasgow, Margalit, et al.
Pubblicazione: (2025)
Stochastic-Sign SGD for Federated Learning with Theoretical Guarantees
di: Jin, Richeng, et al.
Pubblicazione: (2020)
di: Jin, Richeng, et al.
Pubblicazione: (2020)
Ordered Momentum for Asynchronous SGD
di: Shi, Chang-Wei, et al.
Pubblicazione: (2024)
di: Shi, Chang-Wei, et al.
Pubblicazione: (2024)
Improving Implicit Regularization of SGD with Preconditioning for Least Square Problems
di: Su, Junwei, et al.
Pubblicazione: (2024)
di: Su, Junwei, et al.
Pubblicazione: (2024)
Anon: Extrapolating Adaptivity Beyond SGD and Adam
di: Zhang, Yiheng, et al.
Pubblicazione: (2026)
di: Zhang, Yiheng, et al.
Pubblicazione: (2026)
Generalization and Optimization of SGD with Lookahead
di: Li, Kangcheng, et al.
Pubblicazione: (2025)
di: Li, Kangcheng, et al.
Pubblicazione: (2025)
PCDP-SGD: Improving the Convergence of Differentially Private SGD via Projection in Advance
di: Sha, Haichao, et al.
Pubblicazione: (2023)
di: Sha, Haichao, et al.
Pubblicazione: (2023)
Smoothed SGD for quantiles: Bahadur representation and Gaussian approximation
di: Chen, Likai, et al.
Pubblicazione: (2025)
di: Chen, Likai, et al.
Pubblicazione: (2025)
Topology-aware Generalization of Decentralized SGD
di: Zhu, Tongtian, et al.
Pubblicazione: (2022)
di: Zhu, Tongtian, et al.
Pubblicazione: (2022)
Documenti analoghi
-
Uniform convergence of the smooth calibration error and its relationship with functional gradient
di: Futami, Futoshi, et al.
Pubblicazione: (2025) -
Improved Particle Approximation Error for Mean Field Neural Networks
di: Nitanda, Atsushi
Pubblicazione: (2024) -
Statistical Analysis of the Sinkhorn Iterations for Two-Sample Schrödinger Bridge Estimation
di: Maeda, Ibuki, et al.
Pubblicazione: (2025) -
Alternating Diffusion for Proximal Sampling with Zeroth Order Queries
di: Takagi, Hirohane, et al.
Pubblicazione: (2026) -
How Does Preconditioning Guide Feature Learning in Deep Neural Networks?
di: Yoshida, Kotaro, et al.
Pubblicazione: (2025)