Enregistré dans:
| Auteurs principaux: | Zhang, Chenyang, Gao, Peifeng, Zou, Difan, Cao, Yuan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2504.08628 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Implicit Bias of Adam on Separable Data
par: Zhang, Chenyang, et autres
Publié: (2024)
par: Zhang, Chenyang, et autres
Publié: (2024)
Understanding the Generalization of Stochastic Gradient Adam in Learning Neural Networks
par: Tang, Xuan, et autres
Publié: (2025)
par: Tang, Xuan, et autres
Publié: (2025)
Transformers Trained via Gradient Descent Can Provably Learn a Class of Teacher Models
par: Zhang, Chenyang, et autres
Publié: (2026)
par: Zhang, Chenyang, et autres
Publié: (2026)
The Implicit Bias of Steepest Descent with Mini-batch Stochastic Gradient
par: Li, Jichu, et autres
Publié: (2026)
par: Li, Jichu, et autres
Publié: (2026)
Transformers Efficiently Perform In-Context Logistic Regression via Normalized Gradient Descent
par: Zhang, Chenyang, et autres
Publié: (2026)
par: Zhang, Chenyang, et autres
Publié: (2026)
On the Robustness of Transformers against Context Hijacking for Linear Classification
par: Li, Tianle, et autres
Publié: (2025)
par: Li, Tianle, et autres
Publié: (2025)
A Mechanism Study of Delayed Loss Spikes in Batch-Normalized Linear Models
par: Gao, Peifeng, et autres
Publié: (2026)
par: Gao, Peifeng, et autres
Publié: (2026)
Understanding the Benefits of SimCLR Pre-Training in Two-Layer Convolutional Neural Networks
par: Zhang, Han, et autres
Publié: (2024)
par: Zhang, Han, et autres
Publié: (2024)
On the Feature Learning in Diffusion Models
par: Han, Andi, et autres
Publié: (2024)
par: Han, Andi, et autres
Publié: (2024)
Stochastic Gradient Descent for Two-layer Neural Networks
par: Cao, Dinghao, et autres
Publié: (2024)
par: Cao, Dinghao, et autres
Publié: (2024)
How Does Label Noise Gradient Descent Improve Generalization in the Low SNR Regime?
par: Huang, Wei, et autres
Publié: (2025)
par: Huang, Wei, et autres
Publié: (2025)
Enhancing Deep Learning with Optimized Gradient Descent: Bridging Numerical Methods and Neural Network Training
par: Ma, Yuhan, et autres
Publié: (2024)
par: Ma, Yuhan, et autres
Publié: (2024)
PRES: Toward Scalable Memory-Based Dynamic Graph Neural Networks
par: Su, Junwei, et autres
Publié: (2024)
par: Su, Junwei, et autres
Publié: (2024)
Improving Group Robustness on Spurious Correlation Requires Preciser Group Inference
par: Han, Yujin, et autres
Publié: (2024)
par: Han, Yujin, et autres
Publié: (2024)
Towards Robust Graph Incremental Learning on Evolving Graphs
par: Su, Junwei, et autres
Publié: (2024)
par: Su, Junwei, et autres
Publié: (2024)
Approximation and Gradient Descent Training with Neural Networks
par: Welper, G.
Publié: (2024)
par: Welper, G.
Publié: (2024)
On Convolutions, Intrinsic Dimension, and Diffusion Models
par: Leung, Kin Kwan, et autres
Publié: (2025)
par: Leung, Kin Kwan, et autres
Publié: (2025)
Step by Step: Adaptive Gradient Descent for Training L-Lipschitz Neural Networks
par: Sung, Kyle, et autres
Publié: (2025)
par: Sung, Kyle, et autres
Publié: (2025)
What Can Transformer Learn with Varying Depth? Case Studies on Sequence Learning Tasks
par: Chen, Xingwu, et autres
Publié: (2024)
par: Chen, Xingwu, et autres
Publié: (2024)
On the Theory of Continual Learning with Gradient Descent for Neural Networks
par: Taheri, Hossein, et autres
Publié: (2025)
par: Taheri, Hossein, et autres
Publié: (2025)
Initialization Matters: On the Benign Overfitting of Two-Layer ReLU CNN with Fully Trainable Layers
par: Shang, Shuning, et autres
Publié: (2024)
par: Shang, Shuning, et autres
Publié: (2024)
On the Intrinsic Dimensions of Data in Kernel Learning
par: Takhanov, Rustem
Publié: (2026)
par: Takhanov, Rustem
Publié: (2026)
Hybrid Coordinate Descent for Efficient Neural Network Learning Using Line Search and Gradient Descent
par: Hsiao, Yen-Che, et autres
Publié: (2024)
par: Hsiao, Yen-Che, et autres
Publié: (2024)
Benign Overfitting without Linearity: Neural Network Classifiers Trained by Gradient Descent for Noisy Linear Data
par: Frei, Spencer, et autres
Publié: (2022)
par: Frei, Spencer, et autres
Publié: (2022)
Dual Natural Gradient Descent for Scalable Training of Physics-Informed Neural Networks
par: Jnini, Anas, et autres
Publié: (2025)
par: Jnini, Anas, et autres
Publié: (2025)
Feature Averaging: An Implicit Bias of Gradient Descent Leading to Non-Robustness in Neural Networks
par: Li, Binghui, et autres
Publié: (2024)
par: Li, Binghui, et autres
Publié: (2024)
Faster Sampling via Stochastic Gradient Proximal Sampler
par: Huang, Xunpeng, et autres
Publié: (2024)
par: Huang, Xunpeng, et autres
Publié: (2024)
Variational Stochastic Gradient Descent for Deep Neural Networks
par: Chen, Haotian, et autres
Publié: (2024)
par: Chen, Haotian, et autres
Publié: (2024)
Physics-Informed Neural PDE Solvers via Spatio-Temporal MeanFlow
par: Bai, Hanru, et autres
Publié: (2026)
par: Bai, Hanru, et autres
Publié: (2026)
Dual Cone Gradient Descent for Training Physics-Informed Neural Networks
par: Hwang, Youngsik, et autres
Publié: (2024)
par: Hwang, Youngsik, et autres
Publié: (2024)
Gradient Flow Matching for Learning Update Dynamics in Neural Network Training
par: Shou, Xiao, et autres
Publié: (2025)
par: Shou, Xiao, et autres
Publié: (2025)
Optimizing Quantum Convolutional Neural Network Architectures for Arbitrary Data Dimension
par: Lee, Changwon, et autres
Publié: (2024)
par: Lee, Changwon, et autres
Publié: (2024)
Convergence of Implicit Gradient Descent for Training Two-Layer Physics-Informed Neural Networks
par: Xu, Xianliang, et autres
Publié: (2024)
par: Xu, Xianliang, et autres
Publié: (2024)
Learning under Quantization for High-Dimensional Linear Regression
par: Zhang, Dechen, et autres
Publié: (2025)
par: Zhang, Dechen, et autres
Publié: (2025)
Reshaping Reasoning in LLMs: A Theoretical Analysis of RL Training Dynamics through Pattern Selection
par: Chen, Xingwu, et autres
Publié: (2025)
par: Chen, Xingwu, et autres
Publié: (2025)
Robust Gradient Descent for Phase Retrieval
par: Buna, Alex, et autres
Publié: (2024)
par: Buna, Alex, et autres
Publié: (2024)
Generalization Bounds of Stochastic Gradient Descent in Homogeneous Neural Networks
par: Ma, Wenquan, et autres
Publié: (2026)
par: Ma, Wenquan, et autres
Publié: (2026)
Generalization Guarantees of Gradient Descent for Multi-Layer Neural Networks
par: Wang, Puyu, et autres
Publié: (2023)
par: Wang, Puyu, et autres
Publié: (2023)
Extracting Training Data from Unconditional Diffusion Models
par: Chen, Yunhao, et autres
Publié: (2024)
par: Chen, Yunhao, et autres
Publié: (2024)
On the Limitation and Experience Replay for GNNs in Continual Learning
par: Su, Junwei, et autres
Publié: (2023)
par: Su, Junwei, et autres
Publié: (2023)
Documents similaires
-
The Implicit Bias of Adam on Separable Data
par: Zhang, Chenyang, et autres
Publié: (2024) -
Understanding the Generalization of Stochastic Gradient Adam in Learning Neural Networks
par: Tang, Xuan, et autres
Publié: (2025) -
Transformers Trained via Gradient Descent Can Provably Learn a Class of Teacher Models
par: Zhang, Chenyang, et autres
Publié: (2026) -
The Implicit Bias of Steepest Descent with Mini-batch Stochastic Gradient
par: Li, Jichu, et autres
Publié: (2026) -
Transformers Efficiently Perform In-Context Logistic Regression via Normalized Gradient Descent
par: Zhang, Chenyang, et autres
Publié: (2026)