Transformers Provably Learn Sparse XOR with Polylogarithmic Parameters
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Yaomengxi, Ghoshdastidar, Debarghya |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
On the Convergence of Gradient Descent for Large Learning Rates
par: Crăciun, Alexandru, et autres
Publié: (2024)
par: Crăciun, Alexandru, et autres
Publié: (2024)
Tight PAC-Bayesian Risk Certificates for Contrastive Learning
par: Van Elst, Anna, et autres
Publié: (2024)
par: Van Elst, Anna, et autres
Publié: (2024)
Gaussian Process Limit Reveals Structural Benefits of Graph Transformers
par: Ayday, Nil, et autres
Publié: (2026)
par: Ayday, Nil, et autres
Publié: (2026)
Provable Robustness of (Graph) Neural Networks Against Data Poisoning and Backdoor Attacks
par: Gosch, Lukas, et autres
Publié: (2024)
par: Gosch, Lukas, et autres
Publié: (2024)
Non-Singularity of the Gradient Descent map for Neural Networks with Piecewise Analytic Activations
par: Crăciun, Alexandru, et autres
Publié: (2025)
par: Crăciun, Alexandru, et autres
Publié: (2025)
A Probabilistic Model for Non-Contrastive Learning
par: Fleissner, Maximilian, et autres
Publié: (2025)
par: Fleissner, Maximilian, et autres
Publié: (2025)
Theoretical Foundations of Representation Learning using Unlabeled Data: Statistics and Optimization
par: Esser, Pascal, et autres
Publié: (2025)
par: Esser, Pascal, et autres
Publié: (2025)
A Theoretical Characterization of Optimal Data Augmentations in Self-Supervised Learning
par: Feigin, Shlomo Libo, et autres
Publié: (2024)
par: Feigin, Shlomo Libo, et autres
Publié: (2024)
Impact of Bottleneck Layers and Skip Connections on the Generalization of Linear Denoising Autoencoders
par: Ham, Jonghyun, et autres
Publié: (2025)
par: Ham, Jonghyun, et autres
Publié: (2025)
Exact Generalisation Error Exposes Benchmarks Skew Graph Neural Networks Success (or Failure)
par: Ayday, Nil, et autres
Publié: (2025)
par: Ayday, Nil, et autres
Publié: (2025)
Recovering Imbalanced Clusters via Gradient-Based Projection Pursuit
par: Eppert, Martin, et autres
Publié: (2025)
par: Eppert, Martin, et autres
Publié: (2025)
Explainable Clustering Beyond Worst-Case Guarantees
par: Fleissner, Maximilian, et autres
Publié: (2024)
par: Fleissner, Maximilian, et autres
Publié: (2024)
Interpretable Self-Supervised Learning via Representer Landmarks and Nyström Approximation
par: Zarvandi, Maedeh, et autres
Publié: (2025)
par: Zarvandi, Maedeh, et autres
Publié: (2025)
When can we Approximate Wide Contrastive Models with Neural Tangent Kernels and Principal Component Analysis?
par: Anil, Gautham Govind, et autres
Publié: (2024)
par: Anil, Gautham Govind, et autres
Publié: (2024)
Explaining Kernel Clustering via Decision Trees
par: Fleissner, Maximilian, et autres
Publié: (2024)
par: Fleissner, Maximilian, et autres
Publié: (2024)
Infinite Width Limits of Self Supervised Neural Networks
par: Fleissner, Maximilian, et autres
Publié: (2024)
par: Fleissner, Maximilian, et autres
Publié: (2024)
Nonparametric Kernel Clustering with Bandit Feedback
par: Thuot, Victor, et autres
Publié: (2026)
par: Thuot, Victor, et autres
Publié: (2026)
Robustness Certificates for Neural Networks against Adversarial Attacks
par: Taheri, Sara, et autres
Publié: (2025)
par: Taheri, Sara, et autres
Publié: (2025)
Exact Certification of (Graph) Neural Networks Against Label Poisoning
par: Sabanayagam, Mahalakshmi, et autres
Publié: (2024)
par: Sabanayagam, Mahalakshmi, et autres
Publié: (2024)
Robust Feature Inference: A Test-time Defense Strategy using Spectral Projections
par: Singh, Anurag, et autres
Publié: (2023)
par: Singh, Anurag, et autres
Publié: (2023)
Generalization Certificates for Adversarially Robust Bayesian Linear Regression
par: Sabanayagam, Mahalakshmi, et autres
Publié: (2025)
par: Sabanayagam, Mahalakshmi, et autres
Publié: (2025)
Different Statistical Perspectives for Understanding Generalisation in Graph Neural Networks
par: Ayday, Nil, et autres
Publié: (2026)
par: Ayday, Nil, et autres
Publié: (2026)
Exact Certification of Neural Networks and Partition Aggregation Ensembles against Label Poisoning
par: Mohgaonkar, Ajinkya, et autres
Publié: (2026)
par: Mohgaonkar, Ajinkya, et autres
Publié: (2026)
Learning on Transformers is Provable Low-Rank and Sparse: A One-layer Analysis
par: Li, Hongkang, et autres
Publié: (2024)
par: Li, Hongkang, et autres
Publié: (2024)
Transformers Provably Learn Sparse Token Selection While Fully-Connected Nets Cannot
par: Wang, Zixuan, et autres
Publié: (2024)
par: Wang, Zixuan, et autres
Publié: (2024)
Provable In-Context Learning of Nonlinear Regression with Transformers
par: Li, Hongbo, et autres
Publié: (2025)
par: Li, Hongbo, et autres
Publié: (2025)
Transformers Provably Learn to Internalize Chain-of-Thought
par: Huang, Yixiao, et autres
Publié: (2026)
par: Huang, Yixiao, et autres
Publié: (2026)
Provably Transformers Harness Multi-Concept Word Semantics for Efficient In-Context Learning
par: Bu, Dake, et autres
Publié: (2024)
par: Bu, Dake, et autres
Publié: (2024)
Adaptive Estimation and Inference in Semi-parametric Heterogeneous Clustered Multitask Learning via Neyman Orthogonality
par: Chen, Hanxiao, et autres
Publié: (2026)
par: Chen, Hanxiao, et autres
Publié: (2026)
Unlabeled Data Can Provably Enhance In-Context Learning of Transformers
par: Liu, Renpu, et autres
Publié: (2026)
par: Liu, Renpu, et autres
Publié: (2026)
Looped Transformers with Layer Normalization Provably Learn the Power Method
par: Wu, Lyumin, et autres
Publié: (2026)
par: Wu, Lyumin, et autres
Publié: (2026)
Provable Benefit of Curriculum in Transformer Tree-Reasoning Post-Training
par: Bu, Dake, et autres
Publié: (2025)
par: Bu, Dake, et autres
Publié: (2025)
Compute Optimal Inference and Provable Amortisation Gap in Sparse Autoencoders
par: O'Neill, Charles, et autres
Publié: (2024)
par: O'Neill, Charles, et autres
Publié: (2024)
Sparse Orthogonal Parameters Tuning for Continual Learning
par: Ning, Kun-Peng, et autres
Publié: (2024)
par: Ning, Kun-Peng, et autres
Publié: (2024)
Neuron Block Dynamics for XOR Classification with Zero-Margin
par: Braun, Guillaume, et autres
Publié: (2026)
par: Braun, Guillaume, et autres
Publié: (2026)
Semi-Supervised Sparse Gaussian Classification: Provable Benefits of Unlabeled Data
par: Azar, Eyar, et autres
Publié: (2024)
par: Azar, Eyar, et autres
Publié: (2024)
Taming the Sigmoid Bottleneck: Provably Argmaxable Sparse Multi-Label Classification
par: Grivas, Andreas, et autres
Publié: (2023)
par: Grivas, Andreas, et autres
Publié: (2023)
One-Layer Transformer Provably Learns One-Nearest Neighbor In Context
par: Li, Zihao, et autres
Publié: (2024)
par: Li, Zihao, et autres
Publié: (2024)
Transformers Provably Learn Algorithmic Solutions for Graph Connectivity, But Only with the Right Data
par: Ye, Qilin, et autres
Publié: (2025)
par: Ye, Qilin, et autres
Publié: (2025)
Transformers Provably Implement In-Context Reinforcement Learning with Policy Improvement
par: Liang, Haodong, et autres
Publié: (2026)
par: Liang, Haodong, et autres
Publié: (2026)
Documents similaires
-
On the Convergence of Gradient Descent for Large Learning Rates
par: Crăciun, Alexandru, et autres
Publié: (2024) -
Tight PAC-Bayesian Risk Certificates for Contrastive Learning
par: Van Elst, Anna, et autres
Publié: (2024) -
Gaussian Process Limit Reveals Structural Benefits of Graph Transformers
par: Ayday, Nil, et autres
Publié: (2026) -
Provable Robustness of (Graph) Neural Networks Against Data Poisoning and Backdoor Attacks
par: Gosch, Lukas, et autres
Publié: (2024) -
Non-Singularity of the Gradient Descent map for Neural Networks with Piecewise Analytic Activations
par: Crăciun, Alexandru, et autres
Publié: (2025)