Enregistré dans:
| Auteurs principaux: | He, Jianliang, Wang, Leda, Chen, Siyu, Yang, Zhuoran |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.16849 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unveiling Induction Heads: Provable Training Dynamics and Feature Learning in Transformers
par: Chen, Siyu, et autres
Publié: (2024)
par: Chen, Siyu, et autres
Publié: (2024)
Wasserstein Flow Meets Replicator Dynamics: A Mean-Field Analysis of Representation Learning in Actor-Critic
par: Zhang, Yufeng, et autres
Publié: (2021)
par: Zhang, Yufeng, et autres
Publié: (2021)
Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality
par: Chen, Siyu, et autres
Publié: (2024)
par: Chen, Siyu, et autres
Publié: (2024)
TwIST: Rigging the Lottery in Transformers with Independent Subnetwork Training
par: Menezes, Michael, et autres
Publié: (2025)
par: Menezes, Michael, et autres
Publié: (2025)
Principled Penalty-based Methods for Bilevel Reinforcement Learning and RLHF
par: Shen, Han, et autres
Publié: (2024)
par: Shen, Han, et autres
Publié: (2024)
A Theoretical Framework for Grokking: Interpolation followed by Riemannian Norm Minimisation
par: Boursier, Etienne, et autres
Publié: (2025)
par: Boursier, Etienne, et autres
Publié: (2025)
Reinforcement Learning from Partial Observation: Linear Function Approximation with Provable Sample Efficiency
par: Cai, Qi, et autres
Publié: (2022)
par: Cai, Qi, et autres
Publié: (2022)
Symmetric Mean-field Langevin Dynamics for Distributional Minimax Problems
par: Kim, Juno, et autres
Publié: (2023)
par: Kim, Juno, et autres
Publié: (2023)
Can Temporal-Difference and Q-Learning Learn Representation? A Mean-Field Theory
par: Zhang, Yufeng, et autres
Publié: (2020)
par: Zhang, Yufeng, et autres
Publié: (2020)
A Mean-Field Analysis of Neural Stochastic Gradient Descent-Ascent for Functional Minimax Optimization
par: Zhu, Yuchen, et autres
Publié: (2024)
par: Zhu, Yuchen, et autres
Publié: (2024)
Provably Efficient Exploration in Policy Optimization
par: Cai, Qi, et autres
Publié: (2019)
par: Cai, Qi, et autres
Publié: (2019)
Bridging Lottery Ticket and Grokking: Understanding Grokking from Inner Structure of Networks
par: Minegishi, Gouki, et autres
Publié: (2023)
par: Minegishi, Gouki, et autres
Publié: (2023)
Learning Dynamic Mechanisms in Unknown Environments: A Reinforcement Learning Approach
par: Qiu, Shuang, et autres
Publié: (2022)
par: Qiu, Shuang, et autres
Publié: (2022)
Double Duality: Variational Primal-Dual Policy Optimization for Constrained Reinforcement Learning
par: Li, Zihao, et autres
Publié: (2024)
par: Li, Zihao, et autres
Publié: (2024)
Variational Transport: A Convergent Particle-BasedAlgorithm for Distributional Optimization
par: Yang, Zhuoran, et autres
Publié: (2020)
par: Yang, Zhuoran, et autres
Publié: (2020)
Grokking or Glitching? How Low-Precision Drives Slingshot Loss Spikes
par: Hanqing, Liu, et autres
Publié: (2026)
par: Hanqing, Liu, et autres
Publié: (2026)
Grokking as Structural Inference: Transformers Need Bayesian Lottery Tickets
par: Hidajat, Kai, et autres
Publié: (2026)
par: Hidajat, Kai, et autres
Publié: (2026)
Fourier Learning Machines: Nonharmonic Fourier-Based Neural Networks for Scientific Machine Learning
par: Rubel, Mominul, et autres
Publié: (2025)
par: Rubel, Mominul, et autres
Publié: (2025)
Modular Distributed Nonconvex Learning with Error Feedback
par: Carnevale, Guido, et autres
Publié: (2025)
par: Carnevale, Guido, et autres
Publié: (2025)
Feature Augmentation of GNNs for ILPs: Local Uniqueness Suffices
par: Han, Qingyu, et autres
Publié: (2025)
par: Han, Qingyu, et autres
Publié: (2025)
Guided by the Experts: Provable Feature Learning Dynamic of Soft-Routed Mixture-of-Experts
par: Liao, Fangshuo, et autres
Publié: (2025)
par: Liao, Fangshuo, et autres
Publié: (2025)
Reinforcement Learning under Latent Dynamics: Toward Statistical and Algorithmic Modularity
par: Amortila, Philip, et autres
Publié: (2024)
par: Amortila, Philip, et autres
Publié: (2024)
Dynamic Controlled Variables Based Dynamic Self-Optimizing Control
par: Zhou, Chenchen, et autres
Publié: (2026)
par: Zhou, Chenchen, et autres
Publié: (2026)
Which Features are Best for Successor Features?
par: Ollivier, Yann
Publié: (2025)
par: Ollivier, Yann
Publié: (2025)
A Modular Algorithm for Non-Stationary Online Convex-Concave Optimization
par: Meng, Qing-xin, et autres
Publié: (2025)
par: Meng, Qing-xin, et autres
Publié: (2025)
Implicit Regularization of Gradient Flow on One-Layer Softmax Attention
par: Sheen, Heejune, et autres
Publié: (2024)
par: Sheen, Heejune, et autres
Publié: (2024)
Shallow Neural Networks Learn Low-Degree Spherical Polynomials with Feature Learning by Learnable Channel Attention
par: Yang, Yingzhen
Publié: (2025)
par: Yang, Yingzhen
Publié: (2025)
Decision-Dependent Stochastic Optimization: The Role of Distribution Dynamics
par: He, Zhiyu, et autres
Publié: (2025)
par: He, Zhiyu, et autres
Publié: (2025)
Enhancing Unsupervised Feature Selection via Double Sparsity Constrained Optimization
par: Xiu, Xianchao, et autres
Publié: (2025)
par: Xiu, Xianchao, et autres
Publié: (2025)
A Re-solving Heuristic for Dynamic Assortment Optimization with Knapsack Constraints
par: Chen, Xi, et autres
Publié: (2024)
par: Chen, Xi, et autres
Publié: (2024)
A Theory of Feature Learning in Kernel Models
par: Chen, Yunlu, et autres
Publié: (2023)
par: Chen, Yunlu, et autres
Publié: (2023)
A Mechanism Study of Delayed Loss Spikes in Batch-Normalized Linear Models
par: Gao, Peifeng, et autres
Publié: (2026)
par: Gao, Peifeng, et autres
Publié: (2026)
Multi-level Monte-Carlo Gradient Methods for Stochastic Optimization with Biased Oracles
par: Hu, Yifan, et autres
Publié: (2024)
par: Hu, Yifan, et autres
Publié: (2024)
Bi-Sparse Unsupervised Feature Selection
par: Xiu, Xianchao, et autres
Publié: (2024)
par: Xiu, Xianchao, et autres
Publié: (2024)
Feature-Based Interpretable Surrogates for Optimization
par: Goerigk, Marc, et autres
Publié: (2024)
par: Goerigk, Marc, et autres
Publié: (2024)
Over-parameterised Shallow Neural Networks with Asymmetrical Node Scaling: Global Convergence Guarantees and Feature Learning
par: Caron, Francois, et autres
Publié: (2023)
par: Caron, Francois, et autres
Publié: (2023)
Negative Imaginary Neural ODEs: Learning to Control Mechanical Systems with Stability Guarantees
par: Shi, Kanghong, et autres
Publié: (2025)
par: Shi, Kanghong, et autres
Publié: (2025)
Random Features Approximation for Control-Affine Systems
par: Kazemian, Kimia, et autres
Publié: (2024)
par: Kazemian, Kimia, et autres
Publié: (2024)
A Compositional Kernel Model for Feature Learning
par: Ruan, Feng, et autres
Publié: (2025)
par: Ruan, Feng, et autres
Publié: (2025)
Supervised Feature Compression based on Counterfactual Analysis
par: Piccialli, Veronica, et autres
Publié: (2022)
par: Piccialli, Veronica, et autres
Publié: (2022)
Documents similaires
-
Unveiling Induction Heads: Provable Training Dynamics and Feature Learning in Transformers
par: Chen, Siyu, et autres
Publié: (2024) -
Wasserstein Flow Meets Replicator Dynamics: A Mean-Field Analysis of Representation Learning in Actor-Critic
par: Zhang, Yufeng, et autres
Publié: (2021) -
Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality
par: Chen, Siyu, et autres
Publié: (2024) -
TwIST: Rigging the Lottery in Transformers with Independent Subnetwork Training
par: Menezes, Michael, et autres
Publié: (2025) -
Principled Penalty-based Methods for Bilevel Reinforcement Learning and RLHF
par: Shen, Han, et autres
Publié: (2024)