A Theoretical Analysis of Self-Supervised Learning for Vision Transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Yu, Wen, Zixin, Chi, Yuejie, Liang, Yingbin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Agentic Transformers Provably Learn to Search via Reinforcement Learning
par: Yang, Tong, et autres
Publié: (2026)
par: Yang, Tong, et autres
Publié: (2026)
In-Context Learning with Representations: Contextual Generalization of Trained Transformers
par: Yang, Tong, et autres
Publié: (2024)
par: Yang, Tong, et autres
Publié: (2024)
The Implicit Curriculum: Learning Dynamics in RL with Verifiable Rewards
par: Huang, Yu, et autres
Publié: (2026)
par: Huang, Yu, et autres
Publié: (2026)
Multi-head Transformers Provably Learn Symbolic Multi-step Reasoning via Gradient Descent
par: Yang, Tong, et autres
Publié: (2025)
par: Yang, Tong, et autres
Publié: (2025)
Transformers Provably Learn Chain-of-Thought Reasoning with Length Generalization
par: Huang, Yu, et autres
Publié: (2025)
par: Huang, Yu, et autres
Publié: (2025)
The Sample-Communication Complexity Trade-off in Federated Q-Learning
par: Salgia, Sudeep, et autres
Publié: (2024)
par: Salgia, Sudeep, et autres
Publié: (2024)
Preconditioning Benefits of Spectral Orthogonalization in Muon
par: Ma, Jianhao, et autres
Publié: (2026)
par: Ma, Jianhao, et autres
Publié: (2026)
Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL
par: Yang, Tong, et autres
Publié: (2025)
par: Yang, Tong, et autres
Publié: (2025)
Statistical and Algorithmic Foundations of Reinforcement Learning
par: Chi, Yuejie, et autres
Publié: (2025)
par: Chi, Yuejie, et autres
Publié: (2025)
Communication-Efficient Federated Optimization over Semi-Decentralized Networks
par: Wang, He, et autres
Publié: (2023)
par: Wang, He, et autres
Publié: (2023)
Is Q-Learning Minimax Optimal? A Tight Sample Complexity Analysis
par: Li, Gen, et autres
Publié: (2021)
par: Li, Gen, et autres
Publié: (2021)
The Power of Preconditioning in Overparameterized Low-Rank Matrix Sensing
par: Xu, Xingyu, et autres
Publié: (2023)
par: Xu, Xingyu, et autres
Publié: (2023)
Self-Supervised Learning of Iterative Solvers for Constrained Optimization
par: Lüken, Lukas, et autres
Publié: (2024)
par: Lüken, Lukas, et autres
Publié: (2024)
Beyond Expectations: Learning with Stochastic Dominance Made Practical
par: Cen, Shicong, et autres
Publié: (2024)
par: Cen, Shicong, et autres
Publié: (2024)
A Retention-Centric Framework for Continual Learning with Guaranteed Model Developmental Safety
par: Li, Gang, et autres
Publié: (2024)
par: Li, Gang, et autres
Publié: (2024)
Self-Supervised Penalty-Based Learning for Robust Constrained Optimization
par: Benslimane, Wyame, et autres
Publié: (2025)
par: Benslimane, Wyame, et autres
Publié: (2025)
Reevaluating Theoretical Analysis Methods for Optimization in Deep Learning
par: Tran, Hoang, et autres
Publié: (2024)
par: Tran, Hoang, et autres
Publié: (2024)
Breaking the Sample Size Barrier in Model-Based Reinforcement Learning with a Generative Model
par: Li, Gen, et autres
Publié: (2020)
par: Li, Gen, et autres
Publié: (2020)
Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence
par: Liu, Yuxing, et autres
Publié: (2025)
par: Liu, Yuxing, et autres
Publié: (2025)
Accelerating Convergence of Score-Based Diffusion Models, Provably
par: Li, Gen, et autres
Publié: (2024)
par: Li, Gen, et autres
Publié: (2024)
Gradient Methods with Online Scaling Part I. Theoretical Foundations
par: Gao, Wenzhi, et autres
Publié: (2025)
par: Gao, Wenzhi, et autres
Publié: (2025)
Vertical Federated Learning with Missing Features During Training and Inference
par: Valdeira, Pedro, et autres
Publié: (2024)
par: Valdeira, Pedro, et autres
Publié: (2024)
Self-Supervised Learning for Large-Scale Preventive Security Constrained DC Optimal Power Flow
par: Park, Seonho, et autres
Publié: (2023)
par: Park, Seonho, et autres
Publié: (2023)
Theoretical Analysis of Heteroscedastic Gaussian Processes with Posterior Distributions
par: Ito, Yuji
Publié: (2024)
par: Ito, Yuji
Publié: (2024)
Supervised Feature Compression based on Counterfactual Analysis
par: Piccialli, Veronica, et autres
Publié: (2022)
par: Piccialli, Veronica, et autres
Publié: (2022)
How Transformers Get Rich: Approximation and Dynamics Analysis
par: Wang, Mingze, et autres
Publié: (2024)
par: Wang, Mingze, et autres
Publié: (2024)
Towards Robust Learning to Optimize with Theoretical Guarantees
par: Song, Qingyu, et autres
Publié: (2025)
par: Song, Qingyu, et autres
Publié: (2025)
A Theoretical and Experimental Study of a Novel Adaptive Learning Algorithm
par: Kumari, Sakshi, et autres
Publié: (2026)
par: Kumari, Sakshi, et autres
Publié: (2026)
A Multi-Token Coordinate Descent Method for Semi-Decentralized Vertical Federated Learning
par: Valdeira, Pedro, et autres
Publié: (2023)
par: Valdeira, Pedro, et autres
Publié: (2023)
Control Theoretic Approach to Fine-Tuning and Transfer Learning
par: Bayram, Erkan, et autres
Publié: (2024)
par: Bayram, Erkan, et autres
Publié: (2024)
A Control Theoretic Framework for Adaptive Gradient Optimizers in Machine Learning
par: Chakrabarti, Kushal, et autres
Publié: (2022)
par: Chakrabarti, Kushal, et autres
Publié: (2022)
Fast Computation of Optimal Transport via Entropy-Regularized Extragradient Methods
par: Li, Gen, et autres
Publié: (2023)
par: Li, Gen, et autres
Publié: (2023)
Convergence rates of stochastic gradient method with independent sequences of step-size and momentum weight
par: Hwang, Wen-Liang
Publié: (2024)
par: Hwang, Wen-Liang
Publié: (2024)
Provably Robust Score-Based Diffusion Posterior Sampling for Plug-and-Play Image Reconstruction
par: Xu, Xingyu, et autres
Publié: (2024)
par: Xu, Xingyu, et autres
Publié: (2024)
Communication-efficient Vertical Federated Learning via Compressed Error Feedback
par: Valdeira, Pedro, et autres
Publié: (2024)
par: Valdeira, Pedro, et autres
Publié: (2024)
Achieving Logarithmic Regret in KL-Regularized Zero-Sum Markov Games
par: Nayak, Anupam, et autres
Publié: (2025)
par: Nayak, Anupam, et autres
Publié: (2025)
Learning-to-Optimize with PAC-Bayesian Guarantees: Theoretical Considerations and Practical Implementation
par: Sucker, Michael, et autres
Publié: (2024)
par: Sucker, Michael, et autres
Publié: (2024)
On Building Myopic MPC Policies using Supervised Learning
par: Orrico, Christopher A., et autres
Publié: (2024)
par: Orrico, Christopher A., et autres
Publié: (2024)
Sporadic Gradient Tracking over Directed Graphs: A Theoretical Perspective on Decentralized Federated Learning
par: Zehtabi, Shahryar, et autres
Publié: (2026)
par: Zehtabi, Shahryar, et autres
Publié: (2026)
Control and optimization for Neural Partial Differential Equations in Supervised Learning
par: Bensoussan, Alain, et autres
Publié: (2025)
par: Bensoussan, Alain, et autres
Publié: (2025)
Documents similaires
-
Agentic Transformers Provably Learn to Search via Reinforcement Learning
par: Yang, Tong, et autres
Publié: (2026) -
In-Context Learning with Representations: Contextual Generalization of Trained Transformers
par: Yang, Tong, et autres
Publié: (2024) -
The Implicit Curriculum: Learning Dynamics in RL with Verifiable Rewards
par: Huang, Yu, et autres
Publié: (2026) -
Multi-head Transformers Provably Learn Symbolic Multi-step Reasoning via Gradient Descent
par: Yang, Tong, et autres
Publié: (2025) -
Transformers Provably Learn Chain-of-Thought Reasoning with Length Generalization
par: Huang, Yu, et autres
Publié: (2025)