Mamba Can Learn Low-Dimensional Targets In-Context via Test-Time Feature Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Oh, Junsoo, Huang, Wei, Suzuki, Taiji |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Transformers Learn Nonlinear Features In Context: Nonconvex Mean-field Dynamics on the Attention Landscape
par: Kim, Juno, et autres
Publié: (2024)
par: Kim, Juno, et autres
Publié: (2024)
Provable Benefit of Cutout and CutMix for Feature Learning
par: Oh, Junsoo, et autres
Publié: (2024)
par: Oh, Junsoo, et autres
Publié: (2024)
Trained Mamba Emulates Online Gradient Descent in In-Context Linear Regression
par: Jiang, Jiarui, et autres
Publié: (2025)
par: Jiang, Jiarui, et autres
Publié: (2025)
In-Context Learning Is Provably Bayesian Inference: A Generalization Theory for Meta-Learning
par: Wakayama, Tomoya, et autres
Publié: (2025)
par: Wakayama, Tomoya, et autres
Publié: (2025)
From Linear to Nonlinear: Provable Weak-to-Strong Generalization through Feature Learning
par: Oh, Junsoo, et autres
Publié: (2025)
par: Oh, Junsoo, et autres
Publié: (2025)
Approximation and Estimation Ability of Transformers for Sequence-to-Sequence Functions with Infinite Dimensional Input
par: Takakura, Shokichi, et autres
Publié: (2023)
par: Takakura, Shokichi, et autres
Publié: (2023)
The Mechanism of Weak-to-Strong Generalization: Feature Elicitation from Latent Knowledge
par: Awano, Ryoya, et autres
Publié: (2026)
par: Awano, Ryoya, et autres
Publié: (2026)
Test time training enhances in-context learning of nonlinear functions
par: Kuwataka, Kento, et autres
Publié: (2025)
par: Kuwataka, Kento, et autres
Publié: (2025)
On the Role of Label Noise in the Feature Learning Process
par: Han, Andi, et autres
Publié: (2025)
par: Han, Andi, et autres
Publié: (2025)
How do Transformers perform In-Context Autoregressive Learning?
par: Sander, Michael E., et autres
Publié: (2024)
par: Sander, Michael E., et autres
Publié: (2024)
Provably Transformers Harness Multi-Concept Word Semantics for Efficient In-Context Learning
par: Bu, Dake, et autres
Publié: (2024)
par: Bu, Dake, et autres
Publié: (2024)
Transformers are Minimax Optimal Nonparametric In-Context Learners
par: Kim, Juno, et autres
Publié: (2024)
par: Kim, Juno, et autres
Publié: (2024)
Degrees of Freedom for Linear Attention: Distilling Softmax Attention with Optimal Feature Efficiency
par: Nishikawa, Naoki, et autres
Publié: (2025)
par: Nishikawa, Naoki, et autres
Publié: (2025)
Can Mamba Learn How to Learn? A Comparative Study on In-Context Learning Tasks
par: Park, Jongho, et autres
Publié: (2024)
par: Park, Jongho, et autres
Publié: (2024)
Can Mamba Learn In Context with Outliers? A Theoretical Generalization Analysis
par: Li, Hongkang, et autres
Publié: (2025)
par: Li, Hongkang, et autres
Publié: (2025)
Provably Neural Active Learning Succeeds via Prioritizing Perplexing Samples
par: Bu, Dake, et autres
Publié: (2024)
par: Bu, Dake, et autres
Publié: (2024)
On the Comparison between Multi-modal and Single-modal Contrastive Learning
par: Huang, Wei, et autres
Publié: (2024)
par: Huang, Wei, et autres
Publié: (2024)
How Neural Reward Models Learn Features for Policy Optimization: A Single-Index Analysis
par: Higuchi, Rei, et autres
Publié: (2026)
par: Higuchi, Rei, et autres
Publié: (2026)
Provable In-Context Vector Arithmetic via Retrieving Task Concepts
par: Bu, Dake, et autres
Publié: (2025)
par: Bu, Dake, et autres
Publié: (2025)
High-Dimensional Kernel Methods under Covariate Shift: Data-Dependent Implicit Regularization
par: Chen, Yihang, et autres
Publié: (2024)
par: Chen, Yihang, et autres
Publié: (2024)
Is Mamba Capable of In-Context Learning?
par: Grazzi, Riccardo, et autres
Publié: (2024)
par: Grazzi, Riccardo, et autres
Publié: (2024)
Deep Two-Way Matrix Reordering for Relational Data Analysis
par: Watanabe, Chihiro, et autres
Publié: (2021)
par: Watanabe, Chihiro, et autres
Publié: (2021)
State Space Models are Provably Comparable to Transformers in Dynamic Token Selection
par: Nishikawa, Naoki, et autres
Publié: (2024)
par: Nishikawa, Naoki, et autres
Publié: (2024)
Transformers Provably Solve Parity Efficiently with Chain of Thought
par: Kim, Juno, et autres
Publié: (2024)
par: Kim, Juno, et autres
Publié: (2024)
Mean-field Analysis on Two-layer Neural Networks from a Kernel Perspective
par: Takakura, Shokichi, et autres
Publié: (2024)
par: Takakura, Shokichi, et autres
Publié: (2024)
AutoLL: Automatic Linear Layout of Graphs based on Deep Neural Network
par: Watanabe, Chihiro, et autres
Publié: (2021)
par: Watanabe, Chihiro, et autres
Publié: (2021)
Transformers as Measure-Theoretic Associative Memory: A Statistical Perspective and Minimax Optimality
par: Kawata, Ryotaro, et autres
Publié: (2026)
par: Kawata, Ryotaro, et autres
Publié: (2026)
Mixture of Experts Provably Detect and Learn the Latent Cluster Structure in Gradient-Based Learning
par: Kawata, Ryotaro, et autres
Publié: (2025)
par: Kawata, Ryotaro, et autres
Publié: (2025)
Learning sum of diverse features: computational hardness and efficient gradient-based training for ridge combinations
par: Oko, Kazusato, et autres
Publié: (2024)
par: Oko, Kazusato, et autres
Publié: (2024)
Direct Density Ratio Optimization: A Statistically Consistent Approach to Aligning Large Language Models
par: Higuchi, Rei, et autres
Publié: (2025)
par: Higuchi, Rei, et autres
Publié: (2025)
Optimality and Adaptivity of Deep Neural Features for Instrumental Variable Regression
par: Kim, Juno, et autres
Publié: (2025)
par: Kim, Juno, et autres
Publié: (2025)
How Does Label Noise Gradient Descent Improve Generalization in the Low SNR Regime?
par: Huang, Wei, et autres
Publié: (2025)
par: Huang, Wei, et autres
Publié: (2025)
Dimensionality-induced information loss of outliers in deep neural networks
par: Uematsu, Kazuki, et autres
Publié: (2024)
par: Uematsu, Kazuki, et autres
Publié: (2024)
Rule2DRC: Benchmarking LLM Agents for DRC Script Synthesis with Execution-Guided Test Generation
par: Kim, Jinuk, et autres
Publié: (2026)
par: Kim, Jinuk, et autres
Publié: (2026)
Provably Learning Diffusion Models under the Manifold Hypothesis: Collapse and Refine
par: Huang, Wei, et autres
Publié: (2026)
par: Huang, Wei, et autres
Publié: (2026)
On the Learning Dynamics of Two-layer Linear Networks with Label Noise SGD
par: Zhang, Tongcheng, et autres
Publié: (2026)
par: Zhang, Tongcheng, et autres
Publié: (2026)
Quantifying the Optimization and Generalization Advantages of Graph Neural Networks Over Multilayer Perceptrons
par: Huang, Wei, et autres
Publié: (2023)
par: Huang, Wei, et autres
Publié: (2023)
From Saddle Points Toward Global Minima: A Newton-Type Method on Wasserstein Space
par: Lascu, Razvan-Andrei, et autres
Publié: (2026)
par: Lascu, Razvan-Andrei, et autres
Publié: (2026)
Learning on the Job: Test-Time Curricula for Targeted Reinforcement Learning
par: Hübotter, Jonas, et autres
Publié: (2025)
par: Hübotter, Jonas, et autres
Publié: (2025)
Can Transformers Break Encryption Schemes via In-Context Learning?
par: Korrapati, Jathin, et autres
Publié: (2025)
par: Korrapati, Jathin, et autres
Publié: (2025)
Documents similaires
-
Transformers Learn Nonlinear Features In Context: Nonconvex Mean-field Dynamics on the Attention Landscape
par: Kim, Juno, et autres
Publié: (2024) -
Provable Benefit of Cutout and CutMix for Feature Learning
par: Oh, Junsoo, et autres
Publié: (2024) -
Trained Mamba Emulates Online Gradient Descent in In-Context Linear Regression
par: Jiang, Jiarui, et autres
Publié: (2025) -
In-Context Learning Is Provably Bayesian Inference: A Generalization Theory for Meta-Learning
par: Wakayama, Tomoya, et autres
Publié: (2025) -
From Linear to Nonlinear: Provable Weak-to-Strong Generalization through Feature Learning
par: Oh, Junsoo, et autres
Publié: (2025)