Linear Transformers are Versatile In-Context Learners
Fuente:
arXiv
Salvato in:
| Autori principali: | Vladymyrov, Max, von Oswald, Johannes, Sandler, Mark, Ge, Rong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Continual HyperTransformer: A Meta-Learner for Continual Few-Shot Learning
di: Vladymyrov, Max, et al.
Pubblicazione: (2023)
di: Vladymyrov, Max, et al.
Pubblicazione: (2023)
Contextually Guided Transformers via Low-Rank Adaptation
di: Zhmoginov, Andrey, et al.
Pubblicazione: (2025)
di: Zhmoginov, Andrey, et al.
Pubblicazione: (2025)
Long Context In-Context Compression by Getting to the Gist of Gisting
di: Petrov, Aleksandar, et al.
Pubblicazione: (2025)
di: Petrov, Aleksandar, et al.
Pubblicazione: (2025)
Uncovering mesa-optimization algorithms in Transformers
di: von Oswald, Johannes, et al.
Pubblicazione: (2023)
di: von Oswald, Johannes, et al.
Pubblicazione: (2023)
Narrowing the Focus: Learned Optimizers for Pretrained Models
di: Kristiansen, Gus, et al.
Pubblicazione: (2024)
di: Kristiansen, Gus, et al.
Pubblicazione: (2024)
Understanding In-Context Learning of Linear Models in Transformers Through an Adversarial Lens
di: Anwar, Usman, et al.
Pubblicazione: (2024)
di: Anwar, Usman, et al.
Pubblicazione: (2024)
Learning Randomized Algorithms with Transformers
di: von Oswald, Johannes, et al.
Pubblicazione: (2024)
di: von Oswald, Johannes, et al.
Pubblicazione: (2024)
State Soup: In-Context Skill Learning, Retrieval and Mixing
di: Pióro, Maciej, et al.
Pubblicazione: (2024)
di: Pióro, Maciej, et al.
Pubblicazione: (2024)
Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones
di: Zhmoginov, Andrey, et al.
Pubblicazione: (2025)
di: Zhmoginov, Andrey, et al.
Pubblicazione: (2025)
Transformers are Minimax Optimal Nonparametric In-Context Learners
di: Kim, Juno, et al.
Pubblicazione: (2024)
di: Kim, Juno, et al.
Pubblicazione: (2024)
Rotary Masked Autoencoders are Versatile Learners
di: Zivanovic, Uros, et al.
Pubblicazione: (2025)
di: Zivanovic, Uros, et al.
Pubblicazione: (2025)
Fine-Tuning Dynamics of In-Context Factual Recall in Transformers
di: Huang, Ruomin, et al.
Pubblicazione: (2026)
di: Huang, Ruomin, et al.
Pubblicazione: (2026)
Diffusion Language Models Are Versatile Protein Learners
di: Wang, Xinyou, et al.
Pubblicazione: (2024)
di: Wang, Xinyou, et al.
Pubblicazione: (2024)
Automating Versatile Time-Series Analysis with Tiny Transformers on Embedded FPGAs
di: Ling, Tianheng, et al.
Pubblicazione: (2025)
di: Ling, Tianheng, et al.
Pubblicazione: (2025)
Fast Differentiable Modal Simulation of Non-linear Strings, Membranes, and Plates
di: Diaz, Rodrigo, et al.
Pubblicazione: (2025)
di: Diaz, Rodrigo, et al.
Pubblicazione: (2025)
InAttention: Linear Context Scaling for Transformers
di: Eisner, Joseph
Pubblicazione: (2024)
di: Eisner, Joseph
Pubblicazione: (2024)
Vintix II: Decision Pre-Trained Transformer is a Scalable In-Context Reinforcement Learner
di: Polubarov, Andrei, et al.
Pubblicazione: (2026)
di: Polubarov, Andrei, et al.
Pubblicazione: (2026)
Plain Transformers Can be Powerful Graph Learners
di: Ma, Liheng, et al.
Pubblicazione: (2025)
di: Ma, Liheng, et al.
Pubblicazione: (2025)
Dynamics of Transient Structure in In-Context Linear Regression Transformers
di: Carroll, Liam, et al.
Pubblicazione: (2025)
di: Carroll, Liam, et al.
Pubblicazione: (2025)
Adversarially Pretrained Transformers May Be Universally Robust In-Context Learners
di: Kumano, Soichiro, et al.
Pubblicazione: (2025)
di: Kumano, Soichiro, et al.
Pubblicazione: (2025)
Featurising Pixels from Dynamic 3D Scenes with Linear In-Context Learners
di: Araslanov, Nikita, et al.
Pubblicazione: (2026)
di: Araslanov, Nikita, et al.
Pubblicazione: (2026)
Weight decay induces low-rank attention layers
di: Kobayashi, Seijin, et al.
Pubblicazione: (2024)
di: Kobayashi, Seijin, et al.
Pubblicazione: (2024)
PDE-Transformer: Efficient and Versatile Transformers for Physics Simulations
di: Holzschuh, Benjamin, et al.
Pubblicazione: (2025)
di: Holzschuh, Benjamin, et al.
Pubblicazione: (2025)
Mixtures of In-Context Learners
di: Hong, Giwon, et al.
Pubblicazione: (2024)
di: Hong, Giwon, et al.
Pubblicazione: (2024)
Lifelong Learner: Discovering Versatile Neural Solvers for Vehicle Routing Problems
di: Feng, Shaodi, et al.
Pubblicazione: (2025)
di: Feng, Shaodi, et al.
Pubblicazione: (2025)
Exact Conversion of In-Context Learning to Model Weights in Linearized-Attention Transformers
di: Chen, Brian K, et al.
Pubblicazione: (2024)
di: Chen, Brian K, et al.
Pubblicazione: (2024)
Beyond Linear Attention: Softmax Transformers Implement In-Context Reinforcement Learning
di: Xie, Zixuan, et al.
Pubblicazione: (2026)
di: Xie, Zixuan, et al.
Pubblicazione: (2026)
Variational Linear Attention: Stable Associative Memory for Long-Context Transformers
di: Pandey, Vishal, et al.
Pubblicazione: (2026)
di: Pandey, Vishal, et al.
Pubblicazione: (2026)
Incentivizing Exploration with Linear Contexts and Combinatorial Actions
di: Sellke, Mark
Pubblicazione: (2023)
di: Sellke, Mark
Pubblicazione: (2023)
Large (Vision) Language Models are Unsupervised In-Context Learners
di: Gadetsky, Artyom, et al.
Pubblicazione: (2025)
di: Gadetsky, Artyom, et al.
Pubblicazione: (2025)
LLMs as In-Context Meta-Learners for Model and Hyperparameter Selection
di: Hili, Youssef Attia El, et al.
Pubblicazione: (2025)
di: Hili, Youssef Attia El, et al.
Pubblicazione: (2025)
Transformers are Universal In-context Learners
di: Furuya, Takashi, et al.
Pubblicazione: (2024)
di: Furuya, Takashi, et al.
Pubblicazione: (2024)
Transformers Implement Functional Gradient Descent to Learn Non-Linear Functions In Context
di: Cheng, Xiang, et al.
Pubblicazione: (2023)
di: Cheng, Xiang, et al.
Pubblicazione: (2023)
In-Context Learning of Linear Dynamical Systems with Transformers: Approximation Bounds and Depth-Separation
di: Cole, Frank, et al.
Pubblicazione: (2025)
di: Cole, Frank, et al.
Pubblicazione: (2025)
Learning and Unlearning of Fabricated Knowledge in Language Models
di: Sun, Chen, et al.
Pubblicazione: (2024)
di: Sun, Chen, et al.
Pubblicazione: (2024)
Non-Convex Optimization with Spectral Radius Regularization
di: Sandler, Adam, et al.
Pubblicazione: (2021)
di: Sandler, Adam, et al.
Pubblicazione: (2021)
Linear Transformers with Learnable Kernel Functions are Better In-Context Models
di: Aksenov, Yaroslav, et al.
Pubblicazione: (2024)
di: Aksenov, Yaroslav, et al.
Pubblicazione: (2024)
Fine-Tuned In-Context Learners for Efficient Adaptation
di: Bornschein, Jorg, et al.
Pubblicazione: (2025)
di: Bornschein, Jorg, et al.
Pubblicazione: (2025)
Are Large Language Models In-Context Graph Learners?
di: Li, Jintang, et al.
Pubblicazione: (2025)
di: Li, Jintang, et al.
Pubblicazione: (2025)
From Growing to Looping: A Unified View of Iterative Computation in LLMs
di: Kapl, Ferdinand, et al.
Pubblicazione: (2026)
di: Kapl, Ferdinand, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Continual HyperTransformer: A Meta-Learner for Continual Few-Shot Learning
di: Vladymyrov, Max, et al.
Pubblicazione: (2023) -
Contextually Guided Transformers via Low-Rank Adaptation
di: Zhmoginov, Andrey, et al.
Pubblicazione: (2025) -
Long Context In-Context Compression by Getting to the Gist of Gisting
di: Petrov, Aleksandar, et al.
Pubblicazione: (2025) -
Uncovering mesa-optimization algorithms in Transformers
di: von Oswald, Johannes, et al.
Pubblicazione: (2023) -
Narrowing the Focus: Learned Optimizers for Pretrained Models
di: Kristiansen, Gus, et al.
Pubblicazione: (2024)