Block Coordinate Descent for Neural Networks Provably Finds Global Minima
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Akiyama, Shunta |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Why Agentic Theorem Prover Works: A Statistical Provability Theory of Mathematical Reasoning Models
par: Sonoda, Sho, et autres
Publié: (2026)
par: Sonoda, Sho, et autres
Publié: (2026)
Gradient Descent with Polyak's Momentum Finds Flatter Minima via Large Catapults
par: Phunyaphibarn, Prin, et autres
Publié: (2023)
par: Phunyaphibarn, Prin, et autres
Publié: (2023)
Exponential Sample Complexity Separation between Flat and Hierarchical Agentic Theorem Provers
par: Sonoda, Sho, et autres
Publié: (2026)
par: Sonoda, Sho, et autres
Publié: (2026)
Hybrid Coordinate Descent for Efficient Neural Network Learning Using Line Search and Gradient Descent
par: Hsiao, Yen-Che, et autres
Publié: (2024)
par: Hsiao, Yen-Che, et autres
Publié: (2024)
Geometry and Local Recovery of Global Minima of Two-layer Neural Networks at Overparameterization
par: Zhang, Leyang, et autres
Publié: (2023)
par: Zhang, Leyang, et autres
Publié: (2023)
Differentially Private Random Block Coordinate Descent
par: Maranjyan, Artavazd, et autres
Publié: (2024)
par: Maranjyan, Artavazd, et autres
Publié: (2024)
Gradient Descent Converges Linearly to Flatter Minima than Gradient Flow in Shallow Linear Networks
par: Beneventano, Pierfrancesco, et autres
Publié: (2025)
par: Beneventano, Pierfrancesco, et autres
Publié: (2025)
Exploiting Block Coordinate Descent for Cost-Effective LLM Model Training
par: Liu, Zeyu, et autres
Publié: (2025)
par: Liu, Zeyu, et autres
Publié: (2025)
SAFE: Finding Sparse and Flat Minima to Improve Pruning
par: Lee, Dongyeop, et autres
Publié: (2025)
par: Lee, Dongyeop, et autres
Publié: (2025)
Neural Networks with Complex-Valued Weights Have No Spurious Local Minima
par: Liu, Xingtu
Publié: (2021)
par: Liu, Xingtu
Publié: (2021)
Zeroth-Order Optimization Finds Flat Minima
par: Zhang, Liang, et autres
Publié: (2025)
par: Zhang, Liang, et autres
Publié: (2025)
Coordinate Descent for Network Linearization
par: Rakhlin, Vlad, et autres
Publié: (2025)
par: Rakhlin, Vlad, et autres
Publié: (2025)
Hidden State Differential Private Mini-Batch Block Coordinate Descent for Multi-convexity Optimization
par: Chen, Ding, et autres
Publié: (2024)
par: Chen, Ding, et autres
Publié: (2024)
Gradient Descent with Provably Tuned Learning-rate Schedules
par: Sharma, Dravyansh
Publié: (2025)
par: Sharma, Dravyansh
Publié: (2025)
Gradient Descent Finds Over-Parameterized Neural Networks with Sharp Generalization for Nonparametric Regression
par: Yang, Yingzhen, et autres
Publié: (2024)
par: Yang, Yingzhen, et autres
Publié: (2024)
Asynchronous Decentralized SGD under Non-Convexity: A Block-Coordinate Descent Framework
par: Zhou, Yijie, et autres
Publié: (2025)
par: Zhou, Yijie, et autres
Publié: (2025)
FedBCD:Communication-Efficient Accelerated Block Coordinate Gradient Descent for Federated Learning
par: Liu, Junkang, et autres
Publié: (2026)
par: Liu, Junkang, et autres
Publié: (2026)
Learning Provably Improves the Convergence of Gradient Descent
par: Song, Qingyu, et autres
Publié: (2025)
par: Song, Qingyu, et autres
Publié: (2025)
Stable Minima of ReLU Neural Networks Suffer from the Curse of Dimensionality: The Neural Shattering Phenomenon
par: Liang, Tongtong, et autres
Publié: (2025)
par: Liang, Tongtong, et autres
Publié: (2025)
Randomized Block-Coordinate Optimistic Gradient Algorithms for Root-Finding Problems
par: Tran-Dinh, Quoc, et autres
Publié: (2023)
par: Tran-Dinh, Quoc, et autres
Publié: (2023)
Product-Stability: Provable Convergence for Gradient Descent on the Edge of Stability
par: Gan, Eric
Publié: (2026)
par: Gan, Eric
Publié: (2026)
DP-FedPGN: Finding Global Flat Minima for Differentially Private Federated Learning via Penalizing Gradient Norm
par: Liu, Junkang, et autres
Publié: (2025)
par: Liu, Junkang, et autres
Publié: (2025)
SMiLE: Provably Enforcing Global Relational Properties in Neural Networks
par: Francobaldi, Matteo, et autres
Publié: (2025)
par: Francobaldi, Matteo, et autres
Publié: (2025)
A Block Coordinate Descent Method for Nonsmooth Composite Optimization under Orthogonality Constraints
par: Yuan, Ganzhao
Publié: (2023)
par: Yuan, Ganzhao
Publié: (2023)
Provable and Practical Online Learning Rate Adaptation with Hypergradient Descent
par: Chu, Ya-Chi, et autres
Publié: (2025)
par: Chu, Ya-Chi, et autres
Publié: (2025)
Provably Faster Gradient Descent via Long Steps
par: Grimmer, Benjamin
Publié: (2023)
par: Grimmer, Benjamin
Publié: (2023)
Stochastic Gradient Descent for Two-layer Neural Networks
par: Cao, Dinghao, et autres
Publié: (2024)
par: Cao, Dinghao, et autres
Publié: (2024)
Variational Stochastic Gradient Descent for Deep Neural Networks
par: Chen, Haotian, et autres
Publié: (2024)
par: Chen, Haotian, et autres
Publié: (2024)
Provably Bounding Neural Network Preimages
par: Kotha, Suhas, et autres
Publié: (2023)
par: Kotha, Suhas, et autres
Publié: (2023)
Generative Autoencoding of Dropout Patterns
par: Maeda, Shunta
Publié: (2023)
par: Maeda, Shunta
Publié: (2023)
Hidden Minima in Two-Layer ReLU Networks
par: Arjevani, Yossi
Publié: (2023)
par: Arjevani, Yossi
Publié: (2023)
Provable Privacy Attacks on Trained Shallow Neural Networks
par: Smorodinsky, Guy, et autres
Publié: (2024)
par: Smorodinsky, Guy, et autres
Publié: (2024)
Provably Powerful Graph Neural Networks for Directed Multigraphs
par: Egressy, Béni, et autres
Publié: (2023)
par: Egressy, Béni, et autres
Publié: (2023)
Provable Guarantees for Nonlinear Feature Learning in Three-Layer Neural Networks
par: Nichani, Eshaan, et autres
Publié: (2023)
par: Nichani, Eshaan, et autres
Publié: (2023)
Provably Communication-Efficient and Privacy-Preserving Federated Graph Neural Networks
par: Guo, Zhishuai, et autres
Publié: (2026)
par: Guo, Zhishuai, et autres
Publié: (2026)
Global Minima by Penalized Full-dimensional Scaling
par: de Leeuw, Jan
Publié: (2024)
par: de Leeuw, Jan
Publié: (2024)
Generalization Bounds of Stochastic Gradient Descent in Homogeneous Neural Networks
par: Ma, Wenquan, et autres
Publié: (2026)
par: Ma, Wenquan, et autres
Publié: (2026)
Generalization Guarantees of Gradient Descent for Multi-Layer Neural Networks
par: Wang, Puyu, et autres
Publié: (2023)
par: Wang, Puyu, et autres
Publié: (2023)
Asynchronous Distributed Reinforcement Learning for LQR Control via Zeroth-Order Block Coordinate Descent
par: Jing, Gangshan, et autres
Publié: (2021)
par: Jing, Gangshan, et autres
Publié: (2021)
Transformers Trained via Gradient Descent Can Provably Learn a Class of Teacher Models
par: Zhang, Chenyang, et autres
Publié: (2026)
par: Zhang, Chenyang, et autres
Publié: (2026)
Documents similaires
-
Why Agentic Theorem Prover Works: A Statistical Provability Theory of Mathematical Reasoning Models
par: Sonoda, Sho, et autres
Publié: (2026) -
Gradient Descent with Polyak's Momentum Finds Flatter Minima via Large Catapults
par: Phunyaphibarn, Prin, et autres
Publié: (2023) -
Exponential Sample Complexity Separation between Flat and Hierarchical Agentic Theorem Provers
par: Sonoda, Sho, et autres
Publié: (2026) -
Hybrid Coordinate Descent for Efficient Neural Network Learning Using Line Search and Gradient Descent
par: Hsiao, Yen-Che, et autres
Publié: (2024) -
Geometry and Local Recovery of Global Minima of Two-layer Neural Networks at Overparameterization
par: Zhang, Leyang, et autres
Publié: (2023)