Uncovering mesa-optimization algorithms in Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | von Oswald, Johannes, Schlegel, Maximilian, Meulemans, Alexander, Kobayashi, Seijin, Niklasson, Eyvind, Zucchet, Nicolas, Scherrer, Nino, Miller, Nolan, Sandler, Mark, Arcas, Blaise Agüera y, Vladymyrov, Max, Pascanu, Razvan, Sacramento, João |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Multi-agent cooperation through learning-aware policy gradients
di: Meulemans, Alexander, et al.
Pubblicazione: (2024)
di: Meulemans, Alexander, et al.
Pubblicazione: (2024)
MesaNet: Sequence Modeling by Locally Optimal Test-Time Training
di: von Oswald, Johannes, et al.
Pubblicazione: (2025)
di: von Oswald, Johannes, et al.
Pubblicazione: (2025)
Emergent temporal abstractions in autoregressive models enable hierarchical reinforcement learning
di: Kobayashi, Seijin, et al.
Pubblicazione: (2025)
di: Kobayashi, Seijin, et al.
Pubblicazione: (2025)
Attention as a Hypernetwork
di: Schug, Simon, et al.
Pubblicazione: (2024)
di: Schug, Simon, et al.
Pubblicazione: (2024)
Reasoning Models Generate Societies of Thought
di: Kim, Junsol, et al.
Pubblicazione: (2026)
di: Kim, Junsol, et al.
Pubblicazione: (2026)
Computational Life: How Well-formed, Self-replicating Programs Emerge from Simple Interaction
di: Arcas, Blaise Agüera y, et al.
Pubblicazione: (2024)
di: Arcas, Blaise Agüera y, et al.
Pubblicazione: (2024)
The unreasonable effectiveness of pattern matching
di: Lupyan, Gary, et al.
Pubblicazione: (2026)
di: Lupyan, Gary, et al.
Pubblicazione: (2026)
Gated recurrent neural networks discover attention
di: Zucchet, Nicolas, et al.
Pubblicazione: (2023)
di: Zucchet, Nicolas, et al.
Pubblicazione: (2023)
When can transformers compositionally generalize in-context?
di: Kobayashi, Seijin, et al.
Pubblicazione: (2024)
di: Kobayashi, Seijin, et al.
Pubblicazione: (2024)
Multi-agent cooperation through in-context co-player inference
di: Weis, Marissa A., et al.
Pubblicazione: (2026)
di: Weis, Marissa A., et al.
Pubblicazione: (2026)
Discovering modular solutions that generalize compositionally
di: Schug, Simon, et al.
Pubblicazione: (2023)
di: Schug, Simon, et al.
Pubblicazione: (2023)
Embedded Universal Predictive Intelligence: a coherent framework for multi-agent learning
di: Meulemans, Alexander, et al.
Pubblicazione: (2025)
di: Meulemans, Alexander, et al.
Pubblicazione: (2025)
Linear Transformers are Versatile In-Context Learners
di: Vladymyrov, Max, et al.
Pubblicazione: (2024)
di: Vladymyrov, Max, et al.
Pubblicazione: (2024)
Agentic AI and the next intelligence explosion
di: Evans, James, et al.
Pubblicazione: (2026)
di: Evans, James, et al.
Pubblicazione: (2026)
Long Context In-Context Compression by Getting to the Gist of Gisting
di: Petrov, Aleksandar, et al.
Pubblicazione: (2025)
di: Petrov, Aleksandar, et al.
Pubblicazione: (2025)
Continual HyperTransformer: A Meta-Learner for Continual Few-Shot Learning
di: Vladymyrov, Max, et al.
Pubblicazione: (2023)
di: Vladymyrov, Max, et al.
Pubblicazione: (2023)
State Soup: In-Context Skill Learning, Retrieval and Mixing
di: Pióro, Maciej, et al.
Pubblicazione: (2024)
di: Pióro, Maciej, et al.
Pubblicazione: (2024)
What Lives? A meta-analysis of diverse opinions on the definition of life
di: Bender, Reed, et al.
Pubblicazione: (2025)
di: Bender, Reed, et al.
Pubblicazione: (2025)
Learning and Unlearning of Fabricated Knowledge in Language Models
di: Sun, Chen, et al.
Pubblicazione: (2024)
di: Sun, Chen, et al.
Pubblicazione: (2024)
Weight decay induces low-rank attention layers
di: Kobayashi, Seijin, et al.
Pubblicazione: (2024)
di: Kobayashi, Seijin, et al.
Pubblicazione: (2024)
How do language models learn facts? Dynamics, curricula and hallucinations
di: Zucchet, Nicolas, et al.
Pubblicazione: (2025)
di: Zucchet, Nicolas, et al.
Pubblicazione: (2025)
Contextually Guided Transformers via Low-Rank Adaptation
di: Zhmoginov, Andrey, et al.
Pubblicazione: (2025)
di: Zhmoginov, Andrey, et al.
Pubblicazione: (2025)
Can LLMs get help from other LLMs without revealing private information?
di: Hartmann, Florian, et al.
Pubblicazione: (2024)
di: Hartmann, Florian, et al.
Pubblicazione: (2024)
Narrowing the Focus: Learned Optimizers for Pretrained Models
di: Kristiansen, Gus, et al.
Pubblicazione: (2024)
di: Kristiansen, Gus, et al.
Pubblicazione: (2024)
Differentiable Logic Cellular Automata: From Game of Life to Pattern Generation
di: Miotti, Pietro, et al.
Pubblicazione: (2025)
di: Miotti, Pietro, et al.
Pubblicazione: (2025)
Learning Randomized Algorithms with Transformers
di: von Oswald, Johannes, et al.
Pubblicazione: (2024)
di: von Oswald, Johannes, et al.
Pubblicazione: (2024)
Social Learning: Towards Collaborative Learning with Large Language Models
di: Mohtashami, Amirkeivan, et al.
Pubblicazione: (2023)
di: Mohtashami, Amirkeivan, et al.
Pubblicazione: (2023)
How new data permeates LLM knowledge and how to dilute it
di: Sun, Chen, et al.
Pubblicazione: (2025)
di: Sun, Chen, et al.
Pubblicazione: (2025)
Mesh Neural Cellular Automata
di: Pajouheshgar, Ehsan, et al.
Pubblicazione: (2023)
di: Pajouheshgar, Ehsan, et al.
Pubblicazione: (2023)
Lattice: Learning to Efficiently Compress the Memory
di: Karami, Mahdi, et al.
Pubblicazione: (2025)
di: Karami, Mahdi, et al.
Pubblicazione: (2025)
Deep Grokking: Would Deep Neural Networks Generalize Better?
di: Fan, Simin, et al.
Pubblicazione: (2024)
di: Fan, Simin, et al.
Pubblicazione: (2024)
AI in Education: Rationale, Principles, and Instructional Implications
di: Elstad, Eyvind
Pubblicazione: (2024)
di: Elstad, Eyvind
Pubblicazione: (2024)
The Influence of Parents and Teachers on the Deep Learning Approach of Pupils in Norwegian Upper-Secondary Schools
di: Eyvind Elstad
Pubblicazione: (2012)
di: Eyvind Elstad
Pubblicazione: (2012)
NoProp: Training Neural Networks without Full Back-propagation or Full Forward-propagation
di: Li, Qinyu, et al.
Pubblicazione: (2025)
di: Li, Qinyu, et al.
Pubblicazione: (2025)
Meta-learning how to Share Credit among Macro-Actions
di: Hosu, Ionel-Alexandru, et al.
Pubblicazione: (2025)
di: Hosu, Ionel-Alexandru, et al.
Pubblicazione: (2025)
Latent Space Representations of Neural Algorithmic Reasoners
di: Mirjanić, Vladimir V., et al.
Pubblicazione: (2023)
di: Mirjanić, Vladimir V., et al.
Pubblicazione: (2023)
Revisiting Adam for Streaming Reinforcement Learning
di: Gogianu, Florin, et al.
Pubblicazione: (2026)
di: Gogianu, Florin, et al.
Pubblicazione: (2026)
The Global Directory of Marine and Freshwater Professionals: OceanExpert
di: Vladymyrov, Vladimir
Pubblicazione: (2005)
di: Vladymyrov, Vladimir
Pubblicazione: (2005)
EC Project: System of Industry Metocean data for the Offshore and Research Communities (SIMORC).
di: Vladymyrov, Vladimir
Pubblicazione: (2007)
di: Vladymyrov, Vladimir
Pubblicazione: (2007)
Ocean Information Technology Pilot Project
di: Vladymyrov, Vladimir
Pubblicazione: (2005)
di: Vladymyrov, Vladimir
Pubblicazione: (2005)
Documenti analoghi
-
Multi-agent cooperation through learning-aware policy gradients
di: Meulemans, Alexander, et al.
Pubblicazione: (2024) -
MesaNet: Sequence Modeling by Locally Optimal Test-Time Training
di: von Oswald, Johannes, et al.
Pubblicazione: (2025) -
Emergent temporal abstractions in autoregressive models enable hierarchical reinforcement learning
di: Kobayashi, Seijin, et al.
Pubblicazione: (2025) -
Attention as a Hypernetwork
di: Schug, Simon, et al.
Pubblicazione: (2024) -
Reasoning Models Generate Societies of Thought
di: Kim, Junsol, et al.
Pubblicazione: (2026)