On the Interpolation Error of Nonlinear Attention versus Linear Regression
Fuente:
arXiv
Saved in:
| Main Authors: | Liao, Zhenyu, Liu, Jiaqing, Hou, TianQi, Zou, Difan, Ling, Zenan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Diving into Kronecker Adapters: Component Design Matters
by: Bai, Jiayu, et al.
Published: (2026)
by: Bai, Jiayu, et al.
Published: (2026)
Minimax Linear Regression under the Quantile Risk
by: Hanchi, Ayoub El, et al.
Published: (2024)
by: Hanchi, Ayoub El, et al.
Published: (2024)
Online and Offline Robust Multivariate Linear Regression
by: Godichon-Baggioni, Antoine, et al.
Published: (2024)
by: Godichon-Baggioni, Antoine, et al.
Published: (2024)
Functional Linear Regression of Cumulative Distribution Functions
by: Zhang, Qian, et al.
Published: (2022)
by: Zhang, Qian, et al.
Published: (2022)
An Improved Analysis of Langevin Algorithms with Prior Diffusion for Non-Log-Concave Sampling
by: Huang, Xunpeng, et al.
Published: (2024)
by: Huang, Xunpeng, et al.
Published: (2024)
Max-Linear Regression by Convex Programming
by: Kim, Seonho, et al.
Published: (2021)
by: Kim, Seonho, et al.
Published: (2021)
Characterizing the Generalization Error of Random Feature Regression with Arbitrary Data-Augmentation
by: Morisset, Lucas, et al.
Published: (2026)
by: Morisset, Lucas, et al.
Published: (2026)
Preventing Model Collapse Under Overparametrization: Optimal Mixing Ratios for Interpolation Learning and Ridge Regression
by: Garg, Anvit, et al.
Published: (2025)
by: Garg, Anvit, et al.
Published: (2025)
Improved Scaling Laws in Linear Regression via Data Reuse
by: Lin, Licong, et al.
Published: (2025)
by: Lin, Licong, et al.
Published: (2025)
Transfer Learning for Benign Overfitting in High-Dimensional Linear Regression
by: Kim, Yeichan, et al.
Published: (2025)
by: Kim, Yeichan, et al.
Published: (2025)
Sharp Risk Bounds for Early-Stopping in Gaussian Linear Regression
by: Wegel, Tobias, et al.
Published: (2025)
by: Wegel, Tobias, et al.
Published: (2025)
Asymptotics of Random Feature Regression Beyond the Linear Scaling Regime
by: Hu, Hong, et al.
Published: (2024)
by: Hu, Hong, et al.
Published: (2024)
Self-Normalized Martingales and Uniform Regret Bounds for Linear Regression
by: Chen, Fan, et al.
Published: (2026)
by: Chen, Fan, et al.
Published: (2026)
Unveiling the Cycloid Trajectory of EM Iterations in Mixed Linear Regression
by: Luo, Zhankun, et al.
Published: (2024)
by: Luo, Zhankun, et al.
Published: (2024)
Sharp Generalization for Nonparametric Regression in Interpolation Space by Over-Parameterized Neural Networks Trained with Preconditioned Gradient Descent and Early Stopping
by: Yang, Yingzhen, et al.
Published: (2024)
by: Yang, Yingzhen, et al.
Published: (2024)
Understanding Overparametrization in Survival Models through Interpolation
by: Liu, Yin, et al.
Published: (2025)
by: Liu, Yin, et al.
Published: (2025)
Finite-Sample Wasserstein Error Bounds and Concentration Inequalities for Nonlinear Stochastic Approximation
by: Kong, Seo Taek, et al.
Published: (2026)
by: Kong, Seo Taek, et al.
Published: (2026)
Finite Sample Confidence Regions for Linear Regression Parameters Using Arbitrary Predictors
by: Guille-Escuret, Charles, et al.
Published: (2024)
by: Guille-Escuret, Charles, et al.
Published: (2024)
On the Contractivity of Stochastic Interpolation Flow
by: Daniels, Mara
Published: (2025)
by: Daniels, Mara
Published: (2025)
A Random Matrix Perspective of Echo State Networks: From Precise Bias--Variance Characterization to Optimal Regularization
by: Moakher, Yessin, et al.
Published: (2025)
by: Moakher, Yessin, et al.
Published: (2025)
Generalization in Representation Models via Random Matrix Theory: Application to Recurrent Networks
by: Moakher, Yessin, et al.
Published: (2025)
by: Moakher, Yessin, et al.
Published: (2025)
Finite-Sample Inference for Sparsely Permuted Linear Regression
by: Ota, Hirofumi, et al.
Published: (2026)
by: Ota, Hirofumi, et al.
Published: (2026)
Belted and Ensembled Neural Network for Linear and Nonlinear Sufficient Dimension Reduction
by: Tang, Yin, et al.
Published: (2024)
by: Tang, Yin, et al.
Published: (2024)
Shuffled Linear Regression via Spectral Matching
by: Liu, Hang, et al.
Published: (2024)
by: Liu, Hang, et al.
Published: (2024)
Optimal Excess Risk Bounds for Empirical Risk Minimization on $p$-Norm Linear Regression
by: Hanchi, Ayoub El, et al.
Published: (2023)
by: Hanchi, Ayoub El, et al.
Published: (2023)
The Thermodynamic Costs of Simple Linear Regression
by: D'Ambrosia, Samuel H., et al.
Published: (2026)
by: D'Ambrosia, Samuel H., et al.
Published: (2026)
Beyond Sin-Squared Error: Linear-Time Entrywise Uncertainty Quantification for Streaming PCA
by: Kumar, Syamantak, et al.
Published: (2025)
by: Kumar, Syamantak, et al.
Published: (2025)
Nonlinear Bayesian Update via Ensemble Kernel Regression with Clustering and Subsampling
by: Lee, Yoonsang
Published: (2025)
by: Lee, Yoonsang
Published: (2025)
Batches Stabilize the Minimum Norm Risk in High Dimensional Overparameterized Linear Regression
by: Ioushua, Shahar Stein, et al.
Published: (2023)
by: Ioushua, Shahar Stein, et al.
Published: (2023)
Iterative Reweighted Framework Based Algorithms for Sparse Linear Regression with Generalized Elastic Net Penalty
by: Ding, Yanyun, et al.
Published: (2024)
by: Ding, Yanyun, et al.
Published: (2024)
Beyond Benign Overfitting in Nadaraya-Watson Interpolators
by: Barzilai, Daniel, et al.
Published: (2025)
by: Barzilai, Daniel, et al.
Published: (2025)
Locally Near Optimal Piecewise Linear Regression in High Dimensions via Difference of Max-Affine Functions
by: Kanj, Haitham, et al.
Published: (2026)
by: Kanj, Haitham, et al.
Published: (2026)
Bivariate Matrix-valued Linear Regression (BMLR): Finite-sample performance under Identifiability and Sparsity Assumptions
by: Bettache, Nayel
Published: (2024)
by: Bettache, Nayel
Published: (2024)
PAC-Chernoff Bounds: Understanding Generalization in the Interpolation Regime
by: Masegosa, Andrés R., et al.
Published: (2023)
by: Masegosa, Andrés R., et al.
Published: (2023)
Scaling Laws in Linear Regression: Compute, Parameters, and Data
by: Lin, Licong, et al.
Published: (2024)
by: Lin, Licong, et al.
Published: (2024)
Decentralized Sparse Linear Regression via Gradient-Tracking: Linear Convergence and Statistical Guarantees
by: Maros, Marie, et al.
Published: (2022)
by: Maros, Marie, et al.
Published: (2022)
A Computational Transition for Detecting Multivariate Shuffled Linear Regression by Low-Degree Polynomials
by: Li, Zhangsong
Published: (2025)
by: Li, Zhangsong
Published: (2025)
Batch List-Decodable Linear Regression via Higher Moments
by: Diakonikolas, Ilias, et al.
Published: (2025)
by: Diakonikolas, Ilias, et al.
Published: (2025)
Computational-Statistical Gaps for Improper Learning in Sparse Linear Regression
by: Buhai, Rares-Darius, et al.
Published: (2024)
by: Buhai, Rares-Darius, et al.
Published: (2024)
Sparse Linear Regression is Easy on Random Supports
by: Chandrasekaran, Gautam, et al.
Published: (2025)
by: Chandrasekaran, Gautam, et al.
Published: (2025)
Similar Items
-
Diving into Kronecker Adapters: Component Design Matters
by: Bai, Jiayu, et al.
Published: (2026) -
Minimax Linear Regression under the Quantile Risk
by: Hanchi, Ayoub El, et al.
Published: (2024) -
Online and Offline Robust Multivariate Linear Regression
by: Godichon-Baggioni, Antoine, et al.
Published: (2024) -
Functional Linear Regression of Cumulative Distribution Functions
by: Zhang, Qian, et al.
Published: (2022) -
An Improved Analysis of Langevin Algorithms with Prior Diffusion for Non-Log-Concave Sampling
by: Huang, Xunpeng, et al.
Published: (2024)