Mining Generalizable Activation Functions
Fuente:
arXiv
Salvato in:
| Autori principali: | Vitvitskyi, Alex, Boratko, Michael, Grcic, Matej, Pascanu, Razvan, Shah, Deep, Veličković, Petar |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Softmax is not Enough (for Sharp Size Generalisation)
di: Veličković, Petar, et al.
Pubblicazione: (2024)
di: Veličković, Petar, et al.
Pubblicazione: (2024)
Round and Round We Go! What makes Rotary Positional Encodings useful?
di: Barbero, Federico, et al.
Pubblicazione: (2024)
di: Barbero, Federico, et al.
Pubblicazione: (2024)
Perplexity Cannot Always Tell Right from Wrong
di: Veličković, Petar, et al.
Pubblicazione: (2026)
di: Veličković, Petar, et al.
Pubblicazione: (2026)
Asynchronous Algorithmic Alignment with Cocycles
di: Dudzik, Andrew, et al.
Pubblicazione: (2023)
di: Dudzik, Andrew, et al.
Pubblicazione: (2023)
What makes a good feedforward computational graph?
di: Vitvitskyi, Alex, et al.
Pubblicazione: (2025)
di: Vitvitskyi, Alex, et al.
Pubblicazione: (2025)
Amplifying human performance in combinatorial competitive programming
di: Veličković, Petar, et al.
Pubblicazione: (2024)
di: Veličković, Petar, et al.
Pubblicazione: (2024)
Latent Space Representations of Neural Algorithmic Reasoners
di: Mirjanić, Vladimir V., et al.
Pubblicazione: (2023)
di: Mirjanić, Vladimir V., et al.
Pubblicazione: (2023)
Recurrent Aggregators in Neural Algorithmic Reasoning
di: Xu, Kaijia, et al.
Pubblicazione: (2024)
di: Xu, Kaijia, et al.
Pubblicazione: (2024)
Transformers meet Neural Algorithmic Reasoners
di: Bounsi, Wilfried, et al.
Pubblicazione: (2024)
di: Bounsi, Wilfried, et al.
Pubblicazione: (2024)
Lattice: Learning to Efficiently Compress the Memory
di: Karami, Mahdi, et al.
Pubblicazione: (2025)
di: Karami, Mahdi, et al.
Pubblicazione: (2025)
Transformers need glasses! Information over-squashing in language tasks
di: Barbero, Federico, et al.
Pubblicazione: (2024)
di: Barbero, Federico, et al.
Pubblicazione: (2024)
Revisiting Adam for Streaming Reinforcement Learning
di: Gogianu, Florin, et al.
Pubblicazione: (2026)
di: Gogianu, Florin, et al.
Pubblicazione: (2026)
Meta-learning how to Share Credit among Macro-Actions
di: Hosu, Ionel-Alexandru, et al.
Pubblicazione: (2025)
di: Hosu, Ionel-Alexandru, et al.
Pubblicazione: (2025)
How Overconfidence in Initial Choices and Underconfidence Under Criticism Modulate Change of Mind in Large Language Models
di: Kumaran, Dharshan, et al.
Pubblicazione: (2025)
di: Kumaran, Dharshan, et al.
Pubblicazione: (2025)
Cayley Graph Propagation
di: Wilson, JJ, et al.
Pubblicazione: (2024)
di: Wilson, JJ, et al.
Pubblicazione: (2024)
Filter Equivariant Functions: A symmetric account of length-general extrapolation on lists
di: Lewis, Owen, et al.
Pubblicazione: (2025)
di: Lewis, Owen, et al.
Pubblicazione: (2025)
KNARsack: Teaching Neural Algorithmic Reasoners to Solve Pseudo-Polynomial Problems
di: Požgaj, Stjepan, et al.
Pubblicazione: (2025)
di: Požgaj, Stjepan, et al.
Pubblicazione: (2025)
The CLRS-Text Algorithmic Reasoning Language Benchmark
di: Markeeva, Larisa, et al.
Pubblicazione: (2024)
di: Markeeva, Larisa, et al.
Pubblicazione: (2024)
LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities
di: Schmied, Thomas, et al.
Pubblicazione: (2025)
di: Schmied, Thomas, et al.
Pubblicazione: (2025)
State Soup: In-Context Skill Learning, Retrieval and Mixing
di: Pióro, Maciej, et al.
Pubblicazione: (2024)
di: Pióro, Maciej, et al.
Pubblicazione: (2024)
Retrieval-Augmented Decision Transformer: External Memory for In-context RL
di: Schmied, Thomas, et al.
Pubblicazione: (2024)
di: Schmied, Thomas, et al.
Pubblicazione: (2024)
The Illusion of Stochasticity in LLMs
di: Gu, Xiangming, et al.
Pubblicazione: (2026)
di: Gu, Xiangming, et al.
Pubblicazione: (2026)
Temporal Graph Rewiring with Expander Graphs
di: Petrović, Katarina, et al.
Pubblicazione: (2024)
di: Petrović, Katarina, et al.
Pubblicazione: (2024)
A Geometric Approach to Personalized Recommendation with Set-Theoretic Constraints Using Box Embeddings
di: Dasgupta, Shib, et al.
Pubblicazione: (2025)
di: Dasgupta, Shib, et al.
Pubblicazione: (2025)
Layerwise LQR for Geometry-Aware Optimization of Deep Networks
di: Dufort-Labbé, Simon, et al.
Pubblicazione: (2026)
di: Dufort-Labbé, Simon, et al.
Pubblicazione: (2026)
Navigating Potholes with Geometry-Aware Sharpness Minimization
di: Dufort-Labbé, Simon, et al.
Pubblicazione: (2026)
di: Dufort-Labbé, Simon, et al.
Pubblicazione: (2026)
NAR-*ICP: Neural Execution of Classical ICP-based Pointcloud Registration Algorithms
di: Panagiotaki, Efimia, et al.
Pubblicazione: (2024)
di: Panagiotaki, Efimia, et al.
Pubblicazione: (2024)
Fine-Tuned In-Context Learners for Efficient Adaptation
di: Bornschein, Jorg, et al.
Pubblicazione: (2025)
di: Bornschein, Jorg, et al.
Pubblicazione: (2025)
Normalization and effective learning rates in reinforcement learning
di: Lyle, Clare, et al.
Pubblicazione: (2024)
di: Lyle, Clare, et al.
Pubblicazione: (2024)
Maxwell's Demon at Work: Efficient Pruning by Leveraging Saturation of Neurons
di: Dufort-Labbé, Simon, et al.
Pubblicazione: (2024)
di: Dufort-Labbé, Simon, et al.
Pubblicazione: (2024)
Kalman Filter for Online Classification of Non-Stationary Data
di: Titsias, Michalis K., et al.
Pubblicazione: (2023)
di: Titsias, Michalis K., et al.
Pubblicazione: (2023)
Torque-Aware Momentum
di: Malviya, Pranshu, et al.
Pubblicazione: (2024)
di: Malviya, Pranshu, et al.
Pubblicazione: (2024)
Non-Stationary Learning of Neural Networks with Automatic Soft Parameter Reset
di: Galashov, Alexandre, et al.
Pubblicazione: (2024)
di: Galashov, Alexandre, et al.
Pubblicazione: (2024)
How do LLMs Compute Verbal Confidence
di: Kumaran, Dharshan, et al.
Pubblicazione: (2026)
di: Kumaran, Dharshan, et al.
Pubblicazione: (2026)
A Large Recurrent Action Model: xLSTM enables Fast Inference for Robotics Tasks
di: Schmied, Thomas, et al.
Pubblicazione: (2024)
di: Schmied, Thomas, et al.
Pubblicazione: (2024)
Promoting Exploration in Memory-Augmented Adam using Critical Momenta
di: Malviya, Pranshu, et al.
Pubblicazione: (2023)
di: Malviya, Pranshu, et al.
Pubblicazione: (2023)
From Markov to Laplace: How Mamba In-Context Learns Markov Chains
di: Bondaschi, Marco, et al.
Pubblicazione: (2025)
di: Bondaschi, Marco, et al.
Pubblicazione: (2025)
Positional Attention: Expressivity and Learnability of Algorithmic Computation
di: de Luca, Artur Back, et al.
Pubblicazione: (2024)
di: de Luca, Artur Back, et al.
Pubblicazione: (2024)
Rotary Position Encodings for Graphs
di: Reid, Isaac, et al.
Pubblicazione: (2025)
di: Reid, Isaac, et al.
Pubblicazione: (2025)
Limited Generalizability in Argument Mining: State-Of-The-Art Models Learn Datasets, Not Arguments
di: Feger, Marc, et al.
Pubblicazione: (2025)
di: Feger, Marc, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Softmax is not Enough (for Sharp Size Generalisation)
di: Veličković, Petar, et al.
Pubblicazione: (2024) -
Round and Round We Go! What makes Rotary Positional Encodings useful?
di: Barbero, Federico, et al.
Pubblicazione: (2024) -
Perplexity Cannot Always Tell Right from Wrong
di: Veličković, Petar, et al.
Pubblicazione: (2026) -
Asynchronous Algorithmic Alignment with Cocycles
di: Dudzik, Andrew, et al.
Pubblicazione: (2023) -
What makes a good feedforward computational graph?
di: Vitvitskyi, Alex, et al.
Pubblicazione: (2025)