Bilinear Sequence Regression: A Model for Learning from Long Sequences of High-dimensional Tokens
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Erba, Vittorio, Troiani, Emanuele, Biggio, Luca, Maillard, Antoine, Zdeborová, Lenka |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Bayes optimal learning of attention-indexed models
par: Boncoraglio, Fabrizio, et autres
Publié: (2025)
par: Boncoraglio, Fabrizio, et autres
Publié: (2025)
The Nuclear Route: Sharp Asymptotics of ERM in Overparameterized Quadratic Networks
par: Erba, Vittorio, et autres
Publié: (2025)
par: Erba, Vittorio, et autres
Publié: (2025)
Single-Head Attention in High Dimensions: A Theory of Generalization, Weights Spectra, and Scaling Laws
par: Boncoraglio, Fabrizio, et autres
Publié: (2025)
par: Boncoraglio, Fabrizio, et autres
Publié: (2025)
A solvable high-dimensional model where nonlinear autoencoders learn structure invisible to PCA while test loss misaligns with generalization
par: Mendes, Vicente Conde, et autres
Publié: (2026)
par: Mendes, Vicente Conde, et autres
Publié: (2026)
Bayes-optimal learning of an extensive-width neural network from quadratically many samples
par: Maillard, Antoine, et autres
Publié: (2024)
par: Maillard, Antoine, et autres
Publié: (2024)
Fundamental limits of learning in sequence multi-index models and deep attention networks: High-dimensional asymptotics and sharp thresholds
par: Troiani, Emanuele, et autres
Publié: (2025)
par: Troiani, Emanuele, et autres
Publié: (2025)
Scaling Laws and Spectra of Shallow Neural Networks in the Feature Learning Regime
par: Defilippis, Leonardo, et autres
Publié: (2025)
par: Defilippis, Leonardo, et autres
Publié: (2025)
High-dimensional Asymptotics of Denoising Autoencoders
par: Cui, Hugo, et autres
Publié: (2023)
par: Cui, Hugo, et autres
Publié: (2023)
Asymptotics of SGD in Sequence-Single Index Models and Single-Layer Attention Networks
par: Arnaboldi, Luca, et autres
Publié: (2025)
par: Arnaboldi, Luca, et autres
Publié: (2025)
Fundamental computational limits of weak learnability in high-dimensional multi-index models
par: Troiani, Emanuele, et autres
Publié: (2024)
par: Troiani, Emanuele, et autres
Publié: (2024)
Analysis of Bootstrap and Subsampling in High-dimensional Regularized Regression
par: Clarté, Lucas, et autres
Publié: (2024)
par: Clarté, Lucas, et autres
Publié: (2024)
Fundamental Limits of Matrix Sensing: Exact Asymptotics, Universality, and Applications
par: Xu, Yizhou, et autres
Publié: (2025)
par: Xu, Yizhou, et autres
Publié: (2025)
Quenches in the Sherrington-Kirkpatrick model
par: Erba, Vittorio, et autres
Publié: (2024)
par: Erba, Vittorio, et autres
Publié: (2024)
Learning with Restricted Boltzmann Machines: Asymptotics of AMP and GD in High Dimensions
par: Xu, Yizhou, et autres
Publié: (2025)
par: Xu, Yizhou, et autres
Publié: (2025)
Building Conformal Prediction Intervals with Approximate Message Passing
par: Clarté, Lucas, et autres
Publié: (2024)
par: Clarté, Lucas, et autres
Publié: (2024)
Optimal thresholds and algorithms for a model of multi-modal learning in high dimensions
par: Keup, Christian, et autres
Publié: (2024)
par: Keup, Christian, et autres
Publié: (2024)
The Rules-and-Facts Model for Simultaneous Generalization and Memorization in Neural Networks
par: Farné, Gabriele, et autres
Publié: (2026)
par: Farné, Gabriele, et autres
Publié: (2026)
Computational Thresholds in Multi-Modal Learning via the Spiked Matrix-Tensor Model
par: Tabanelli, Hugo, et autres
Publié: (2025)
par: Tabanelli, Hugo, et autres
Publié: (2025)
Statistical mechanics of the maximum-average submatrix problem
par: Erba, Vittorio, et autres
Publié: (2023)
par: Erba, Vittorio, et autres
Publié: (2023)
Spectral Thresholds in Correlated Spiked Models and Fundamental Limits of Partial Least Squares
par: Mergny, Pierre, et autres
Publié: (2025)
par: Mergny, Pierre, et autres
Publié: (2025)
On the existence of consistent adversarial attacks in high-dimensional linear classification
par: Vilucchio, Matteo, et autres
Publié: (2025)
par: Vilucchio, Matteo, et autres
Publié: (2025)
The committee machine: Computational to statistical gaps in learning a two-layers neural network
par: Aubin, Benjamin, et autres
Publié: (2018)
par: Aubin, Benjamin, et autres
Publié: (2018)
Topological Exploration of High-Dimensional Empirical Risk Landscapes: general approach, and applications to phase retrieval
par: Maillard, Antoine, et autres
Publié: (2026)
par: Maillard, Antoine, et autres
Publié: (2026)
The maximum-average subtensor problem: equilibrium and out-of-equilibrium properties
par: Erba, Vittorio, et autres
Publié: (2025)
par: Erba, Vittorio, et autres
Publié: (2025)
Rigorous Asymptotics for First-Order Algorithms Through the Dynamical Cavity Method
par: Dandi, Yatin, et autres
Publié: (2026)
par: Dandi, Yatin, et autres
Publié: (2026)
Asymptotics of feature learning in two-layer networks after one gradient-step
par: Cui, Hugo, et autres
Publié: (2024)
par: Cui, Hugo, et autres
Publié: (2024)
Specialization of softmax attention heads: insights from the high-dimensional single-location model
par: Sagitova, M., et autres
Publié: (2026)
par: Sagitova, M., et autres
Publié: (2026)
Statistical Advantage of Softmax Attention: Insights from Single-Location Regression
par: Duranthon, O., et autres
Publié: (2025)
par: Duranthon, O., et autres
Publié: (2025)
Sampling with flows, diffusion and autoregressive neural networks: A spin-glass perspective
par: Ghio, Davide, et autres
Publié: (2023)
par: Ghio, Davide, et autres
Publié: (2023)
Statistical physics analysis of graph neural networks: Approaching optimality in the contextual stochastic block model
par: Duranthon, O., et autres
Publié: (2025)
par: Duranthon, O., et autres
Publié: (2025)
Asymptotic generalization error of a single-layer graph convolutional network
par: Duranthon, O., et autres
Publié: (2024)
par: Duranthon, O., et autres
Publié: (2024)
Memorisation, convergence and generalisation in generative models
par: Maillard, Antoine, et autres
Publié: (2026)
par: Maillard, Antoine, et autres
Publié: (2026)
Inference in Spreading Processes with Neural-Network Priors
par: Ghio, Davide, et autres
Publié: (2025)
par: Ghio, Davide, et autres
Publié: (2025)
Asymptotic Dynamics of Alternating Minimization for Bilinear Regression
par: Okajima, Koki, et autres
Publié: (2024)
par: Okajima, Koki, et autres
Publié: (2024)
Dynamical Cavity Method for Hypergraphs and its Application to Quenches in the k-XOR-SAT Problem
par: Maier, Aude, et autres
Publié: (2024)
par: Maier, Aude, et autres
Publié: (2024)
Dynamical Phase Transitions in Graph Cellular Automata
par: Behrens, Freya, et autres
Publié: (2023)
par: Behrens, Freya, et autres
Publié: (2023)
Biased Generalization in Diffusion Models
par: Garnier-Brun, Jerome, et autres
Publié: (2026)
par: Garnier-Brun, Jerome, et autres
Publié: (2026)
Factual recall in linear associative memories: sharp asymptotics and mechanistic insights
par: Giorlandino, Alessio, et autres
Publié: (2026)
par: Giorlandino, Alessio, et autres
Publié: (2026)
Gaussian Universality of Perceptrons with Random Labels
par: Gerace, Federica, et autres
Publié: (2022)
par: Gerace, Federica, et autres
Publié: (2022)
Injectivity of ReLU networks: perspectives from statistical physics
par: Maillard, Antoine, et autres
Publié: (2023)
par: Maillard, Antoine, et autres
Publié: (2023)
Documents similaires
-
Bayes optimal learning of attention-indexed models
par: Boncoraglio, Fabrizio, et autres
Publié: (2025) -
The Nuclear Route: Sharp Asymptotics of ERM in Overparameterized Quadratic Networks
par: Erba, Vittorio, et autres
Publié: (2025) -
Single-Head Attention in High Dimensions: A Theory of Generalization, Weights Spectra, and Scaling Laws
par: Boncoraglio, Fabrizio, et autres
Publié: (2025) -
A solvable high-dimensional model where nonlinear autoencoders learn structure invisible to PCA while test loss misaligns with generalization
par: Mendes, Vicente Conde, et autres
Publié: (2026) -
Bayes-optimal learning of an extensive-width neural network from quadratically many samples
par: Maillard, Antoine, et autres
Publié: (2024)