Spectral Gradient Descent Mitigates Anisotropy-Driven Misalignment: A Case Study in Phase Retrieval
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Braun, Guillaume, Bao, Han, Huang, Wei, Imaizumi, Masaaki |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning a Single Index Model from Anisotropic Data with vanilla Stochastic Gradient Descent
par: Braun, Guillaume, et autres
Publié: (2025)
par: Braun, Guillaume, et autres
Publié: (2025)
Neuron Block Dynamics for XOR Classification with Zero-Margin
par: Braun, Guillaume, et autres
Publié: (2026)
par: Braun, Guillaume, et autres
Publié: (2026)
Fast Escape, Slow Convergence: Learning Dynamics of Phase Retrieval under Power-Law Data
par: Braun, Guillaume, et autres
Publié: (2025)
par: Braun, Guillaume, et autres
Publié: (2025)
Dichotomy of Feature Learning and Unlearning: Fast-Slow Analysis on Neural Networks with Stochastic Gradient Descent
par: Imai, Shota, et autres
Publié: (2026)
par: Imai, Shota, et autres
Publié: (2026)
High-Dimensional Limit of Stochastic Gradient Flow via Dynamical Mean-Field Theory
par: Nishiyama, Sota, et autres
Publié: (2026)
par: Nishiyama, Sota, et autres
Publié: (2026)
Robust Gradient Descent for Phase Retrieval
par: Buna, Alex, et autres
Publié: (2024)
par: Buna, Alex, et autres
Publié: (2024)
Effect of Weight Quantization on Learning Models by Typical Case Analysis
par: Kashiwamura, Shuhei, et autres
Publié: (2024)
par: Kashiwamura, Shuhei, et autres
Publié: (2024)
Iteration and Stochastic First-order Oracle Complexities of Stochastic Gradient Descent using Constant and Decaying Learning Rates
par: Imaizumi, Kento, et autres
Publié: (2024)
par: Imaizumi, Kento, et autres
Publié: (2024)
Precise gradient descent training dynamics for finite-width multi-layer neural networks
par: Han, Qiyang, et autres
Publié: (2025)
par: Han, Qiyang, et autres
Publié: (2025)
Spectrum-Adaptive Generalization Bounds for Trained Deep Transformers
par: Sakai, Mana, et autres
Publié: (2026)
par: Sakai, Mana, et autres
Publié: (2026)
High-dimensional Contextual Bandit Problem without Sparsity
par: Komiyama, Junpei, et autres
Publié: (2023)
par: Komiyama, Junpei, et autres
Publié: (2023)
Extended Wasserstein-GAN Approach to Causal Distribution Learning: Density-Free Estimation and Minimax Optimality
par: Tamano, Shu, et autres
Publié: (2026)
par: Tamano, Shu, et autres
Publié: (2026)
Approximation of Permutation Invariant Polynomials by Transformers: Efficient Construction in Column-Size
par: Takeshita, Naoki, et autres
Publié: (2025)
par: Takeshita, Naoki, et autres
Publié: (2025)
Benign Overfitting in Time Series Linear Models with Over-Parameterization
par: Nakakita, Shogo, et autres
Publié: (2022)
par: Nakakita, Shogo, et autres
Publié: (2022)
Precise Dynamics of Diagonal Linear Networks: A Unifying Analysis by Dynamical Mean-Field Theory
par: Nishiyama, Sota, et autres
Publié: (2025)
par: Nishiyama, Sota, et autres
Publié: (2025)
Finite-Sample Inference for Sparsely Permuted Linear Regression
par: Ota, Hirofumi, et autres
Publié: (2026)
par: Ota, Hirofumi, et autres
Publié: (2026)
Bayesian Analysis for Over-parameterized Linear Model via Effective Spectra
par: Wakayama, Tomoya, et autres
Publié: (2023)
par: Wakayama, Tomoya, et autres
Publié: (2023)
Minimax Rates of Estimation for Optimal Transport Map between Infinite-Dimensional Spaces
par: Ponnoprat, Donlapark, et autres
Publié: (2025)
par: Ponnoprat, Donlapark, et autres
Publié: (2025)
Automatic Domain Adaptation by Transformers in In-Context Learning
par: Hataya, Ryuichiro, et autres
Publié: (2024)
par: Hataya, Ryuichiro, et autres
Publié: (2024)
Zero Generalization Error Theorem for Random Interpolators via Algebraic Geometry
par: Yoshida, Naoki, et autres
Publié: (2025)
par: Yoshida, Naoki, et autres
Publié: (2025)
Infinite-Width Limit of a Single Attention Layer: Analysis via Tensor Programs
par: Sakai, Mana, et autres
Publié: (2025)
par: Sakai, Mana, et autres
Publié: (2025)
Effect of Random Learning Rate: Theoretical Analysis of SGD Dynamics in Non-Convex Optimization via Stationary Distribution
par: Yoshida, Naoki, et autres
Publié: (2024)
par: Yoshida, Naoki, et autres
Publié: (2024)
Optimal Dynamic Regret by Transformers for Non-Stationary Reinforcement Learning
par: Chen, Baiyuan, et autres
Publié: (2025)
par: Chen, Baiyuan, et autres
Publié: (2025)
High-dimensional Nonparametric Contextual Bandit Problem
par: Iwazaki, Shogo, et autres
Publié: (2025)
par: Iwazaki, Shogo, et autres
Publié: (2025)
Any-stepsize Gradient Descent for Separable Data under Fenchel-Young Losses
par: Bao, Han, et autres
Publié: (2025)
par: Bao, Han, et autres
Publié: (2025)
Parameter-free Clipped Gradient Descent Meets Polyak
par: Takezawa, Yuki, et autres
Publié: (2024)
par: Takezawa, Yuki, et autres
Publié: (2024)
Anti Mode-Collapse in Mean-Field Transformer via Auxiliary Variables
par: Imaizumi, Masaaki, et autres
Publié: (2026)
par: Imaizumi, Masaaki, et autres
Publié: (2026)
Minimax Optimal Estimation of Transport-Growth Pairs in Unbalanced Optimal Transport
par: Ponnoprat, Donlapark, et autres
Publié: (2026)
par: Ponnoprat, Donlapark, et autres
Publié: (2026)
On the Optimization and Generalization of Two-layer Transformers with Sign Gradient Descent
par: Li, Bingrui, et autres
Publié: (2024)
par: Li, Bingrui, et autres
Publié: (2024)
Stochastic Gradient Descent in the Saddle-to-Saddle Regime of Deep Linear Networks
par: Corlouer, Guillaume, et autres
Publié: (2026)
par: Corlouer, Guillaume, et autres
Publié: (2026)
Gradient Descent as a Shrinkage Operator for Spectral Bias
par: Lucey, Simon
Publié: (2025)
par: Lucey, Simon
Publié: (2025)
Harmonized Gradient Descent for Class Imbalanced Data Stream Online Learning
par: Zhou, Han, et autres
Publié: (2025)
par: Zhou, Han, et autres
Publié: (2025)
How Does Label Noise Gradient Descent Improve Generalization in the Low SNR Regime?
par: Huang, Wei, et autres
Publié: (2025)
par: Huang, Wei, et autres
Publié: (2025)
Generalization Guarantees on Data-Driven Tuning of Gradient Descent with Langevin Updates
par: Goyal, Saumya, et autres
Publié: (2026)
par: Goyal, Saumya, et autres
Publié: (2026)
Occam Gradient Descent
par: Kausik, B. N.
Publié: (2024)
par: Kausik, B. N.
Publié: (2024)
Learning High-Dimensional Parity Functions with Product Networks using Gradient Descent
par: Larue, Guillaume, et autres
Publié: (2026)
par: Larue, Guillaume, et autres
Publié: (2026)
Trained Mamba Emulates Online Gradient Descent in In-Context Linear Regression
par: Jiang, Jiarui, et autres
Publié: (2025)
par: Jiang, Jiarui, et autres
Publié: (2025)
Federated Unlearning with Gradient Descent and Conflict Mitigation
par: Pan, Zibin, et autres
Publié: (2024)
par: Pan, Zibin, et autres
Publié: (2024)
Federated Learning with Relative Fairness
par: Nakakita, Shogo, et autres
Publié: (2024)
par: Nakakita, Shogo, et autres
Publié: (2024)
Weighted Averaged Stochastic Gradient Descent: Asymptotic Normality and Optimality
par: Wei, Ziyang, et autres
Publié: (2023)
par: Wei, Ziyang, et autres
Publié: (2023)
Documents similaires
-
Learning a Single Index Model from Anisotropic Data with vanilla Stochastic Gradient Descent
par: Braun, Guillaume, et autres
Publié: (2025) -
Neuron Block Dynamics for XOR Classification with Zero-Margin
par: Braun, Guillaume, et autres
Publié: (2026) -
Fast Escape, Slow Convergence: Learning Dynamics of Phase Retrieval under Power-Law Data
par: Braun, Guillaume, et autres
Publié: (2025) -
Dichotomy of Feature Learning and Unlearning: Fast-Slow Analysis on Neural Networks with Stochastic Gradient Descent
par: Imai, Shota, et autres
Publié: (2026) -
High-Dimensional Limit of Stochastic Gradient Flow via Dynamical Mean-Field Theory
par: Nishiyama, Sota, et autres
Publié: (2026)