The Benefits of Reusing Batches for Gradient Descent in Two-Layer Networks: Breaking the Curse of Information and Leap Exponents
Fuente:
arXiv
Salvato in:
| Autori principali: | Dandi, Yatin, Troiani, Emanuele, Arnaboldi, Luca, Pesce, Luca, Zdeborová, Lenka, Krzakala, Florent |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Computational Advantage of Depth: Learning High-Dimensional Hierarchical Functions with Gradient Descent
di: Dandi, Yatin, et al.
Pubblicazione: (2025)
di: Dandi, Yatin, et al.
Pubblicazione: (2025)
Online Learning and Information Exponents: On The Importance of Batch size, and Time/Complexity Tradeoffs
di: Arnaboldi, Luca, et al.
Pubblicazione: (2024)
di: Arnaboldi, Luca, et al.
Pubblicazione: (2024)
Fundamental limits of learning in sequence multi-index models and deep attention networks: High-dimensional asymptotics and sharp thresholds
di: Troiani, Emanuele, et al.
Pubblicazione: (2025)
di: Troiani, Emanuele, et al.
Pubblicazione: (2025)
Repetita Iuvant: Data Repetition Allows SGD to Learn High-Dimensional Multi-Index Functions
di: Arnaboldi, Luca, et al.
Pubblicazione: (2024)
di: Arnaboldi, Luca, et al.
Pubblicazione: (2024)
Fundamental computational limits of weak learnability in high-dimensional multi-index models
di: Troiani, Emanuele, et al.
Pubblicazione: (2024)
di: Troiani, Emanuele, et al.
Pubblicazione: (2024)
How Two-Layer Neural Networks Learn, One (Giant) Step at a Time
di: Dandi, Yatin, et al.
Pubblicazione: (2023)
di: Dandi, Yatin, et al.
Pubblicazione: (2023)
Sampling with flows, diffusion and autoregressive neural networks: A spin-glass perspective
di: Ghio, Davide, et al.
Pubblicazione: (2023)
di: Ghio, Davide, et al.
Pubblicazione: (2023)
Deep Learning of Compositional Targets with Hierarchical Spectral Methods
di: Tabanelli, Hugo, et al.
Pubblicazione: (2026)
di: Tabanelli, Hugo, et al.
Pubblicazione: (2026)
Asymptotics of SGD in Sequence-Single Index Models and Single-Layer Attention Networks
di: Arnaboldi, Luca, et al.
Pubblicazione: (2025)
di: Arnaboldi, Luca, et al.
Pubblicazione: (2025)
Asymptotics of feature learning in two-layer networks after one gradient-step
di: Cui, Hugo, et al.
Pubblicazione: (2024)
di: Cui, Hugo, et al.
Pubblicazione: (2024)
The Nuclear Route: Sharp Asymptotics of ERM in Overparameterized Quadratic Networks
di: Erba, Vittorio, et al.
Pubblicazione: (2025)
di: Erba, Vittorio, et al.
Pubblicazione: (2025)
Universality laws for Gaussian mixtures in generalized linear models
di: Dandi, Yatin, et al.
Pubblicazione: (2023)
di: Dandi, Yatin, et al.
Pubblicazione: (2023)
Deep Learning as Neural Low-Degree Filtering: A Spectral Theory of Hierarchical Feature Learning
di: Dandi, Yatin, et al.
Pubblicazione: (2026)
di: Dandi, Yatin, et al.
Pubblicazione: (2026)
Rigorous dynamical mean field theory for stochastic gradient descent methods
di: Gerbelot, Cedric, et al.
Pubblicazione: (2022)
di: Gerbelot, Cedric, et al.
Pubblicazione: (2022)
Bayes-optimal learning of an extensive-width neural network from quadratically many samples
di: Maillard, Antoine, et al.
Pubblicazione: (2024)
di: Maillard, Antoine, et al.
Pubblicazione: (2024)
A Random Matrix Theory Perspective on the Spectrum of Learned Features and Asymptotic Generalization Capabilities
di: Dandi, Yatin, et al.
Pubblicazione: (2024)
di: Dandi, Yatin, et al.
Pubblicazione: (2024)
Gibbs Sampling the Posterior of Neural Networks
di: Piccioli, Giovanni, et al.
Pubblicazione: (2023)
di: Piccioli, Giovanni, et al.
Pubblicazione: (2023)
Single-Head Attention in High Dimensions: A Theory of Generalization, Weights Spectra, and Scaling Laws
di: Boncoraglio, Fabrizio, et al.
Pubblicazione: (2025)
di: Boncoraglio, Fabrizio, et al.
Pubblicazione: (2025)
Rigorous Asymptotics for First-Order Algorithms Through the Dynamical Cavity Method
di: Dandi, Yatin, et al.
Pubblicazione: (2026)
di: Dandi, Yatin, et al.
Pubblicazione: (2026)
Learning with Restricted Boltzmann Machines: Asymptotics of AMP and GD in High Dimensions
di: Xu, Yizhou, et al.
Pubblicazione: (2025)
di: Xu, Yizhou, et al.
Pubblicazione: (2025)
Maximally-stable Local Optima in Random Graphs and Spin Glasses: Phase Transitions and Universality
di: Dandi, Yatin, et al.
Pubblicazione: (2023)
di: Dandi, Yatin, et al.
Pubblicazione: (2023)
Provable Learning of Random Hierarchy Models and Hierarchical Shallow-to-Deep Chaining
di: Ren, Yunwei, et al.
Pubblicazione: (2026)
di: Ren, Yunwei, et al.
Pubblicazione: (2026)
Scaling Laws and Spectra of Shallow Neural Networks in the Feature Learning Regime
di: Defilippis, Leonardo, et al.
Pubblicazione: (2025)
di: Defilippis, Leonardo, et al.
Pubblicazione: (2025)
Bilinear Sequence Regression: A Model for Learning from Long Sequences of High-dimensional Tokens
di: Erba, Vittorio, et al.
Pubblicazione: (2024)
di: Erba, Vittorio, et al.
Pubblicazione: (2024)
Fundamental limits of Non-Linear Low-Rank Matrix Estimation
di: Mergny, Pierre, et al.
Pubblicazione: (2024)
di: Mergny, Pierre, et al.
Pubblicazione: (2024)
A phase transition between positional and semantic learning in a solvable model of dot-product attention
di: Cui, Hugo, et al.
Pubblicazione: (2024)
di: Cui, Hugo, et al.
Pubblicazione: (2024)
Optimal Spectral Transitions in High-Dimensional Multi-Index Models
di: Defilippis, Leonardo, et al.
Pubblicazione: (2025)
di: Defilippis, Leonardo, et al.
Pubblicazione: (2025)
Asymptotics of Non-Convex Generalized Linear Models in High-Dimensions: A proof of the replica formula
di: Vilucchio, Matteo, et al.
Pubblicazione: (2025)
di: Vilucchio, Matteo, et al.
Pubblicazione: (2025)
Escaping mediocrity: how two-layer networks learn hard generalized linear models with SGD
di: Arnaboldi, Luca, et al.
Pubblicazione: (2023)
di: Arnaboldi, Luca, et al.
Pubblicazione: (2023)
Computational Thresholds in Multi-Modal Learning via the Spiked Matrix-Tensor Model
di: Tabanelli, Hugo, et al.
Pubblicazione: (2025)
di: Tabanelli, Hugo, et al.
Pubblicazione: (2025)
Scaling Laws from Sequential Feature Recovery: A Solvable Hierarchical Model
di: Wortsman-Zurich, Arie, et al.
Pubblicazione: (2026)
di: Wortsman-Zurich, Arie, et al.
Pubblicazione: (2026)
Fundamental Limits of Matrix Sensing: Exact Asymptotics, Universality, and Applications
di: Xu, Yizhou, et al.
Pubblicazione: (2025)
di: Xu, Yizhou, et al.
Pubblicazione: (2025)
Sequential Dynamics in Ising Spin Glasses
di: Dandi, Yatin, et al.
Pubblicazione: (2025)
di: Dandi, Yatin, et al.
Pubblicazione: (2025)
Analysis of learning a flow-based generative model from limited sample complexity
di: Cui, Hugo, et al.
Pubblicazione: (2023)
di: Cui, Hugo, et al.
Pubblicazione: (2023)
Asymptotic Characterisation of Robust Empirical Risk Minimisation Performance in the Presence of Outliers
di: Vilucchio, Matteo, et al.
Pubblicazione: (2023)
di: Vilucchio, Matteo, et al.
Pubblicazione: (2023)
Bayes optimal learning of attention-indexed models
di: Boncoraglio, Fabrizio, et al.
Pubblicazione: (2025)
di: Boncoraglio, Fabrizio, et al.
Pubblicazione: (2025)
Counting in Small Transformers: The Delicate Interplay between Attention and Feed-Forward Layers
di: Behrens, Freya, et al.
Pubblicazione: (2024)
di: Behrens, Freya, et al.
Pubblicazione: (2024)
The phase diagram of compressed sensing with $\ell_0$-norm regularization
di: Barbier, Damien, et al.
Pubblicazione: (2024)
di: Barbier, Damien, et al.
Pubblicazione: (2024)
Gaussian Universality of Perceptrons with Random Labels
di: Gerace, Federica, et al.
Pubblicazione: (2022)
di: Gerace, Federica, et al.
Pubblicazione: (2022)
A Gentle Introduction to Gradient-Based Optimization and Variational Inequalities for Machine Learning
di: Wadia, Neha S., et al.
Pubblicazione: (2023)
di: Wadia, Neha S., et al.
Pubblicazione: (2023)
Documenti analoghi
-
The Computational Advantage of Depth: Learning High-Dimensional Hierarchical Functions with Gradient Descent
di: Dandi, Yatin, et al.
Pubblicazione: (2025) -
Online Learning and Information Exponents: On The Importance of Batch size, and Time/Complexity Tradeoffs
di: Arnaboldi, Luca, et al.
Pubblicazione: (2024) -
Fundamental limits of learning in sequence multi-index models and deep attention networks: High-dimensional asymptotics and sharp thresholds
di: Troiani, Emanuele, et al.
Pubblicazione: (2025) -
Repetita Iuvant: Data Repetition Allows SGD to Learn High-Dimensional Multi-Index Functions
di: Arnaboldi, Luca, et al.
Pubblicazione: (2024) -
Fundamental computational limits of weak learnability in high-dimensional multi-index models
di: Troiani, Emanuele, et al.
Pubblicazione: (2024)