Convergence Properties of Natural Gradient Descent for Minimizing KL Divergence
Fuente:
arXiv
Salvato in:
| Autori principali: | Datar, Adwait, Ay, Nihat |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Well-Posed KL-Regularized Control via Wasserstein and Kalman-Wasserstein KL Divergences
di: Stein, Viktor, et al.
Pubblicazione: (2026)
di: Stein, Viktor, et al.
Pubblicazione: (2026)
Wasserstein KL-divergence for Gaussian distributions
di: Datar, Adwait, et al.
Pubblicazione: (2025)
di: Datar, Adwait, et al.
Pubblicazione: (2025)
On the Natural Gradient of the Evidence Lower Bound
di: Ay, Nihat, et al.
Pubblicazione: (2023)
di: Ay, Nihat, et al.
Pubblicazione: (2023)
Enhancing Convergence of Decentralized Gradient Tracking under the KL Property
di: Chen, Xiaokai, et al.
Pubblicazione: (2024)
di: Chen, Xiaokai, et al.
Pubblicazione: (2024)
Projective Proximal Gradient Descent for A Class of Nonconvex Nonsmooth Optimization Problems: Fast Convergence Without Kurdyka-Lojasiewicz (KL) Property
di: Yang, Yingzhen, et al.
Pubblicazione: (2023)
di: Yang, Yingzhen, et al.
Pubblicazione: (2023)
Dimension-Independent Convergence of Underdamped Langevin Monte Carlo in KL Divergence
di: Zhang, Shiyuan, et al.
Pubblicazione: (2026)
di: Zhang, Shiyuan, et al.
Pubblicazione: (2026)
Learning Provably Improves the Convergence of Gradient Descent
di: Song, Qingyu, et al.
Pubblicazione: (2025)
di: Song, Qingyu, et al.
Pubblicazione: (2025)
Convergence of Alternating Gradient Descent for Matrix Factorization
di: Ward, Rachel, et al.
Pubblicazione: (2023)
di: Ward, Rachel, et al.
Pubblicazione: (2023)
On the Convergence of Gradient Descent on Learning Transformers with Residual Connections
di: Qin, Zhen, et al.
Pubblicazione: (2025)
di: Qin, Zhen, et al.
Pubblicazione: (2025)
Convergence Analysis of Stochastic Gradient Descent with MCMC Estimators
di: Li, Tianyou, et al.
Pubblicazione: (2023)
di: Li, Tianyou, et al.
Pubblicazione: (2023)
Open Problem: Anytime Convergence Rate of Gradient Descent
di: Kornowski, Guy, et al.
Pubblicazione: (2024)
di: Kornowski, Guy, et al.
Pubblicazione: (2024)
Convergence and Implicit Bias of Gradient Descent on Continual Linear Classification
di: Jung, Hyunji, et al.
Pubblicazione: (2025)
di: Jung, Hyunji, et al.
Pubblicazione: (2025)
Exponential Convergence of (Stochastic) Gradient Descent for Separable Logistic Regression
di: Kale, Sacchit, et al.
Pubblicazione: (2026)
di: Kale, Sacchit, et al.
Pubblicazione: (2026)
Faster Convergence of Stochastic Accelerated Gradient Descent under Interpolation
di: Mishkin, Aaron, et al.
Pubblicazione: (2024)
di: Mishkin, Aaron, et al.
Pubblicazione: (2024)
Convergence of Gradient Descent with Small Initialization for Unregularized Matrix Completion
di: Ma, Jianhao, et al.
Pubblicazione: (2024)
di: Ma, Jianhao, et al.
Pubblicazione: (2024)
On the Convergence of Stochastic Gradient Descent with Perturbed Forward-Backward Passes
di: Kong, Boao, et al.
Pubblicazione: (2026)
di: Kong, Boao, et al.
Pubblicazione: (2026)
Gauss-Newton Natural Gradient Descent for Shape Learning
di: King, James, et al.
Pubblicazione: (2026)
di: King, James, et al.
Pubblicazione: (2026)
Faster Convergence of Riemannian Stochastic Gradient Descent with Increasing Batch Size
di: Oowada, Kanata, et al.
Pubblicazione: (2025)
di: Oowada, Kanata, et al.
Pubblicazione: (2025)
Convergence Rates for Gradient Descent on the Edge of Stability in Overparametrised Least Squares
di: MacDonald, Lachlan Ewen, et al.
Pubblicazione: (2025)
di: MacDonald, Lachlan Ewen, et al.
Pubblicazione: (2025)
Convergence of Gradient Descent for Recurrent Neural Networks: A Nonasymptotic Analysis
di: Cayci, Semih, et al.
Pubblicazione: (2024)
di: Cayci, Semih, et al.
Pubblicazione: (2024)
Coupling-based Convergence Diagnostic and Stepsize Scheme for Stochastic Gradient Descent
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
Gradient Descent Converges Linearly to Flatter Minima than Gradient Flow in Shallow Linear Networks
di: Beneventano, Pierfrancesco, et al.
Pubblicazione: (2025)
di: Beneventano, Pierfrancesco, et al.
Pubblicazione: (2025)
Inclusive KL Minimization: A Wasserstein-Fisher-Rao Gradient Flow Perspective
di: Zhu, Jia-Jie
Pubblicazione: (2024)
di: Zhu, Jia-Jie
Pubblicazione: (2024)
Natural Hypergradient Descent: Algorithm Design, Convergence Analysis, and Parallel Implementation
di: Kong, Deyi, et al.
Pubblicazione: (2026)
di: Kong, Deyi, et al.
Pubblicazione: (2026)
Convergence of Implicit Gradient Descent for Training Two-Layer Physics-Informed Neural Networks
di: Xu, Xianliang, et al.
Pubblicazione: (2024)
di: Xu, Xianliang, et al.
Pubblicazione: (2024)
On the Convergence of (Stochastic) Gradient Descent for Kolmogorov--Arnold Networks
di: Gao, Yihang, et al.
Pubblicazione: (2024)
di: Gao, Yihang, et al.
Pubblicazione: (2024)
Controlling the Flow: Stability and Convergence for Stochastic Gradient Descent with Decaying Regularization
di: Kassing, Sebastian, et al.
Pubblicazione: (2025)
di: Kassing, Sebastian, et al.
Pubblicazione: (2025)
Stochastic Adaptive Gradient Descent Without Descent
di: Aujol, Jean-François, et al.
Pubblicazione: (2025)
di: Aujol, Jean-François, et al.
Pubblicazione: (2025)
Corner Gradient Descent
di: Yarotsky, Dmitry
Pubblicazione: (2025)
di: Yarotsky, Dmitry
Pubblicazione: (2025)
A New Convergence Analysis of Plug-and-Play Proximal Gradient Descent Under Prior Mismatch
di: Xu, Guixian, et al.
Pubblicazione: (2026)
di: Xu, Guixian, et al.
Pubblicazione: (2026)
Dual Natural Gradient Descent for Scalable Training of Physics-Informed Neural Networks
di: Jnini, Anas, et al.
Pubblicazione: (2025)
di: Jnini, Anas, et al.
Pubblicazione: (2025)
Quantitative Convergence Analysis of Projected Stochastic Gradient Descent for Non-Convex Losses via the Goldstein Subdifferential
di: Zheng, Yuping, et al.
Pubblicazione: (2025)
di: Zheng, Yuping, et al.
Pubblicazione: (2025)
Adaptive Conditional Gradient Descent
di: Khademi, Abbas, et al.
Pubblicazione: (2025)
di: Khademi, Abbas, et al.
Pubblicazione: (2025)
$k$-SVD with Gradient Descent
di: Jedra, Yassir, et al.
Pubblicazione: (2025)
di: Jedra, Yassir, et al.
Pubblicazione: (2025)
Reusing Historical Trajectories in Natural Policy Gradient via Importance Sampling: Convergence and Convergence Rate
di: Lin, Yifan, et al.
Pubblicazione: (2024)
di: Lin, Yifan, et al.
Pubblicazione: (2024)
Negative Stepsizes Make Gradient-Descent-Ascent Converge
di: Shugart, Henry, et al.
Pubblicazione: (2025)
di: Shugart, Henry, et al.
Pubblicazione: (2025)
Anytime Acceleration of Gradient Descent
di: Zhang, Zihan, et al.
Pubblicazione: (2024)
di: Zhang, Zihan, et al.
Pubblicazione: (2024)
Solving Inverse Problems with Deep Linear Neural Networks: Global Convergence Guarantees for Gradient Descent with Weight Decay
di: Laus, Hannah, et al.
Pubblicazione: (2025)
di: Laus, Hannah, et al.
Pubblicazione: (2025)
On the Convergence of Policy in Unregularized Policy Mirror Descent
di: Lin, Dachao, et al.
Pubblicazione: (2022)
di: Lin, Dachao, et al.
Pubblicazione: (2022)
Convergence of Spectral Descent for Non-smooth Optimization
di: Yang, Yixuan, et al.
Pubblicazione: (2026)
di: Yang, Yixuan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Well-Posed KL-Regularized Control via Wasserstein and Kalman-Wasserstein KL Divergences
di: Stein, Viktor, et al.
Pubblicazione: (2026) -
Wasserstein KL-divergence for Gaussian distributions
di: Datar, Adwait, et al.
Pubblicazione: (2025) -
On the Natural Gradient of the Evidence Lower Bound
di: Ay, Nihat, et al.
Pubblicazione: (2023) -
Enhancing Convergence of Decentralized Gradient Tracking under the KL Property
di: Chen, Xiaokai, et al.
Pubblicazione: (2024) -
Projective Proximal Gradient Descent for A Class of Nonconvex Nonsmooth Optimization Problems: Fast Convergence Without Kurdyka-Lojasiewicz (KL) Property
di: Yang, Yingzhen, et al.
Pubblicazione: (2023)