Approximation of relation functions and attention mechanisms
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Altabaa, Awni, Lafferty, John |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Abstractors and relational cross-attention: An inductive bias for explicit relational reasoning in Transformers
par: Altabaa, Awni, et autres
Publié: (2023)
par: Altabaa, Awni, et autres
Publié: (2023)
Disentangling and Integrating Relational and Sensory Information in Transformer Architectures
par: Altabaa, Awni, et autres
Publié: (2024)
par: Altabaa, Awni, et autres
Publié: (2024)
Learning Hierarchical Relational Representations through Relational Convolutions
par: Altabaa, Awni, et autres
Publié: (2023)
par: Altabaa, Awni, et autres
Publié: (2023)
CoT Information: Improved Sample Complexity under Chain-of-Thought Supervision
par: Altabaa, Awni, et autres
Publié: (2025)
par: Altabaa, Awni, et autres
Publié: (2025)
Unlocking Out-of-Distribution Generalization in Transformers via Recursive Latent Space Reasoning
par: Altabaa, Awni, et autres
Publié: (2025)
par: Altabaa, Awni, et autres
Publié: (2025)
On the Role of Information Structure in Reinforcement Learning for Partially-Observable Sequential Teams and Games
par: Altabaa, Awni, et autres
Publié: (2024)
par: Altabaa, Awni, et autres
Publié: (2024)
Decentralized Multi-Agent Reinforcement Learning for Continuous-Space Stochastic Games
par: Altabaa, Awni, et autres
Publié: (2023)
par: Altabaa, Awni, et autres
Publié: (2023)
Easy attention: A simple attention mechanism for temporal predictions with transformers
par: Sanchis-Agudo, Marcial, et autres
Publié: (2023)
par: Sanchis-Agudo, Marcial, et autres
Publié: (2023)
Fast attention mechanisms: a tale of parallelism
par: Liu, Jingwen, et autres
Publié: (2025)
par: Liu, Jingwen, et autres
Publié: (2025)
Relational inductive biases on attention mechanisms
par: Mijangos, Víctor, et autres
Publié: (2025)
par: Mijangos, Víctor, et autres
Publié: (2025)
Need a Small Specialized Language Model? Plan Early!
par: Grangier, David, et autres
Publié: (2024)
par: Grangier, David, et autres
Publié: (2024)
Compute-Optimal Quantization-Aware Training
par: Dremov, Aleksandr, et autres
Publié: (2025)
par: Dremov, Aleksandr, et autres
Publié: (2025)
Reservoir observer enhanced with residual calibration and attention mechanism
par: Liu, Yichen, et autres
Publié: (2026)
par: Liu, Yichen, et autres
Publié: (2026)
Tucker Attention: A generalization of approximate attention mechanisms
par: Klein, Timon, et autres
Publié: (2026)
par: Klein, Timon, et autres
Publié: (2026)
Inexact calculus of variations on the hyperspherical tangent bundle and its connections to the attention mechanism
par: Gracyk, Andrew
Publié: (2025)
par: Gracyk, Andrew
Publié: (2025)
Redundant feature screening method for human activity recognition based on attention purification mechanism
par: Li, Xiaoyang, et autres
Publié: (2025)
par: Li, Xiaoyang, et autres
Publié: (2025)
On the Approximation of Kernel functions
par: Dommel, Paul, et autres
Publié: (2024)
par: Dommel, Paul, et autres
Publié: (2024)
Sink vs. diagonal patterns as mechanisms for attention switch and oversmoothing prevention
par: Súkeník, Peter, et autres
Publié: (2026)
par: Súkeník, Peter, et autres
Publié: (2026)
A multi-source data power load forecasting method using attention mechanism-based parallel cnn-gru
par: Min, Chao, et autres
Publié: (2024)
par: Min, Chao, et autres
Publié: (2024)
Hybrid Deep Learning Model for epileptic seizure classification by using 1D-CNN with multi-head attention mechanism
par: Guhdar, Mohammed, et autres
Publié: (2025)
par: Guhdar, Mohammed, et autres
Publié: (2025)
Reorganizing attention-space geometry with expressive attention
par: Gros, Claudius
Publié: (2024)
par: Gros, Claudius
Publié: (2024)
Controlling changes to attention logits
par: Anson, Ben, et autres
Publié: (2025)
par: Anson, Ben, et autres
Publié: (2025)
Mapping of attention mechanisms to a generalized Potts model
par: Rende, Riccardo, et autres
Publié: (2023)
par: Rende, Riccardo, et autres
Publié: (2023)
MD-Syn: Synergistic drug combination prediction based on the multidimensional feature fusion method and attention mechanisms
par: Ge, XinXin, et autres
Publié: (2025)
par: Ge, XinXin, et autres
Publié: (2025)
Enhancing short-term traffic prediction by integrating trends and fluctuations with attention mechanism
par: Das, Adway, et autres
Publié: (2025)
par: Das, Adway, et autres
Publié: (2025)
Poly-attention: a general scheme for higher-order self-attention
par: Chakrabarti, Sayak, et autres
Publié: (2026)
par: Chakrabarti, Sayak, et autres
Publié: (2026)
Unified CNNs and transformers underlying learning mechanism reveals multi-head attention modus vivendi
par: Koresh, Ella, et autres
Publié: (2025)
par: Koresh, Ella, et autres
Publié: (2025)
EEG motor imagery decoding: A framework for comparative analysis with channel attention mechanisms
par: Wimpff, Martin, et autres
Publié: (2023)
par: Wimpff, Martin, et autres
Publié: (2023)
Information-Computation Tradeoffs for Noiseless Linear Regression with Oblivious Contamination
par: Diakonikolas, Ilias, et autres
Publié: (2025)
par: Diakonikolas, Ilias, et autres
Publié: (2025)
Latent attention on masked patches for flow reconstruction
par: Eze, Ben, et autres
Publié: (2026)
par: Eze, Ben, et autres
Publié: (2026)
Myosotis: structured computation for attention like layer
par: Egorov, Evgenii, et autres
Publié: (2025)
par: Egorov, Evgenii, et autres
Publié: (2025)
An extension of linear self-attention for in-context learning
par: Hagiwara, Katsuyuki
Publié: (2025)
par: Hagiwara, Katsuyuki
Publié: (2025)
Online high-precision prediction method for injection molding product weight by integrating time series/non-time series mixed features and feature attention mechanism
par: Li, Maoyuan, et autres
Publié: (2025)
par: Li, Maoyuan, et autres
Publié: (2025)
Supervised learning pays attention
par: Craig, Erin, et autres
Publié: (2025)
par: Craig, Erin, et autres
Publié: (2025)
Weight decay induces low-rank attention layers
par: Kobayashi, Seijin, et autres
Publié: (2024)
par: Kobayashi, Seijin, et autres
Publié: (2024)
Integrating attention into explanation frameworks for language and vision transformers
par: Eggen, Marte, et autres
Publié: (2025)
par: Eggen, Marte, et autres
Publié: (2025)
Approximation-Aware Bayesian Optimization
par: Maus, Natalie, et autres
Publié: (2024)
par: Maus, Natalie, et autres
Publié: (2024)
Artifact detection and localization in single-channel mobile EEG for sleep research using deep learning and attention mechanisms
par: Semkiv, Khrystyna, et autres
Publié: (2025)
par: Semkiv, Khrystyna, et autres
Publié: (2025)
Integrated electro-optic attention nonlinearities for transformers
par: Mickeler, Luis, et autres
Publié: (2026)
par: Mickeler, Luis, et autres
Publié: (2026)
Self-attention Networks Localize When QK-eigenspectrum Concentrates
par: Bao, Han, et autres
Publié: (2024)
par: Bao, Han, et autres
Publié: (2024)
Documents similaires
-
Abstractors and relational cross-attention: An inductive bias for explicit relational reasoning in Transformers
par: Altabaa, Awni, et autres
Publié: (2023) -
Disentangling and Integrating Relational and Sensory Information in Transformer Architectures
par: Altabaa, Awni, et autres
Publié: (2024) -
Learning Hierarchical Relational Representations through Relational Convolutions
par: Altabaa, Awni, et autres
Publié: (2023) -
CoT Information: Improved Sample Complexity under Chain-of-Thought Supervision
par: Altabaa, Awni, et autres
Publié: (2025) -
Unlocking Out-of-Distribution Generalization in Transformers via Recursive Latent Space Reasoning
par: Altabaa, Awni, et autres
Publié: (2025)